한국어EN
모델 아키텍처·학습 기법Sergii Kozyrev, Davyd Maiboroda

Minima 공개

Minima 공개 — 하이브리드 LLM Qwen3.8-27B(GDN 48층·어텐션 16층)의 초기 커뮤니티 4비트 양자화가 순환 오차 누적을 우려해 GDN 블록, 특히 decay·write-strength 게이트를 8/16비트로 남겨 두던 관행을 시험하고자 496개 선형 층 전부에 NVFP4 W4A4를 적용. 4K/32K 퍼플렉시티, MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench, 64K RULER 검색에서 BF16과 시드 잡음 범위 내(5개 과제 평균 -0.52)로 일치하면서 17.5 GiB로 비교 대상 중 가장 작고 프리필이 14~19% 빠르다고 보고. 모듈별로 보정된 NVFP4 체크포인트를 모듈을 하나의 GEMM으로 융합하는 커널이 서빙할 때 생기는 전역 스케일 불일치를 함께 수정

왜 중요한가

'순환 상태의 오차는 긴 문맥에서 누적된다'는 통념을 뒤집어 하이브리드 LLM의 순환 절반이 오히려 양자화하기 쉬운 쪽이라고 주장하고, NVFP4의 16원소 블록 스케일링이 잔차 스트림의 극단 이상치를 국소화하는 점과 델타 규칙 순환이 주입된 잡음을 32K 토큰에 걸쳐 평탄하게 유지하는 점 등 네 갈래 기계적 설명을 제시. 수치는 저자 자체 보고.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.040982026년 8월 31일에 더한 조각 · 그 주 보기