AI 인프라 소프트웨어Tri Dao (프린스턴)
FlashAttention-2 발표
FlashAttention-2 발표 — FlashAttention 대비 2배, A100 이론 FLOPs/s의 50~73%, 학습에서 A100당 최대 225 TFLOPs/s
왜 중요한가
긴 컨텍스트 학습의 실질적 비용을 반감. 32K~128K 컨텍스트 모델이 경제적으로 가능해진 전제
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2307.086912026년 8월 24일에 더한 조각 · 그 주 보기