한국어EN
안전·정렬·해석가능성OpenAI

Monitoring Reasoning Models for Misbehavior

Monitoring Reasoning Models for Misbehavior

왜 중요한가

CoT를 직접 최적화하면 reward hacking이 은폐형으로 진화, CoT에 최적화 압력을 걸지 말라는 규범의 근거

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2503.119262026년 8월 24일에 더한 조각 · 그 주 보기