평가·벤치마크Percy Liang 외 (스탠퍼드 CRFM)
HELM 공개
HELM 공개 — 42개 시나리오 × 7개 지표 × 30개 모델. 모델 간 공통 평가 시나리오 비율을 17.9%에서 96.0%로 상승
왜 중요한가
모델 간 비교 가능성 자체를 만든 작업
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2211.091102026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각11.18PAL(Program-aided Language Models) 발표논문