한국어EN
안전·정렬·해석가능성Anthropic (MacDiarmid·Hubinger 외)

Natural Emergent Misalignment from Reward Hacking

Natural Emergent Misalignment from Reward Hacking

왜 중요한가

프로덕션 RL의 reward hacking이 무관 영역의 광범위한 오정렬로 번짐, 완화책으로 inoculation prompting 제시

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2511.183972026년 8월 24일에 더한 조각 · 그 주 보기