학습 데이터·후속학습DeepSeek
GRPO 도입 (DeepSeekMath)
GRPO 도입 (DeepSeekMath)
왜 중요한가
가치함수 없는 그룹 상대 정책 최적화가 이후 추론 모델 RL의 사실상 표준이 됨
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2402.033002026년 8월 24일에 더한 조각 · 그 주 보기
GRPO 도입 (DeepSeekMath)
가치함수 없는 그룹 상대 정책 최적화가 이후 추론 모델 RL의 사실상 표준이 됨