온디바이스·로컬 추론Tim Dettmers 외
LLM.int8() 발표
LLM.int8() 발표 — 175B 체크포인트를 성능 저하 없이 8비트로 변환, 추론 메모리 절반
왜 중요한가
소비자용 GPU 서버에서 대형 모델 실행을 가능하게 함
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2208.073392026년 8월 24일에 더한 조각 · 그 주 보기
LLM.int8() 발표 — 175B 체크포인트를 성능 저하 없이 8비트로 변환, 추론 메모리 절반
소비자용 GPU 서버에서 대형 모델 실행을 가능하게 함