안전·정렬·해석가능성OpenAI
Monitoring Reasoning Models for Misbehavior
Monitoring Reasoning Models for Misbehavior
왜 중요한가
CoT를 직접 최적화하면 reward hacking이 은폐형으로 진화, CoT에 최적화 압력을 걸지 말라는 규범의 근거
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2503.119262026년 8월 24일에 더한 조각 · 그 주 보기