한국어EN
평가·벤치마크Clémentine Fourrier 외 (Hugging Face)

Open LLM Leaderboard의 MMLU 점수 불일치 해명

Open LLM Leaderboard의 MMLU 점수 불일치 해명 — 동일 LLaMA 65B가 구현별로 0.636/0.637/0.488

왜 중요한가

벤치마크 수치의 비교불가능성을 공개적으로 확인한 사건

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 공식 발표huggingface.cohttps://huggingface.co/blog/evaluating-mmlu-leaderboard2026년 8월 24일에 더한 조각 · 그 주 보기