한국어EN
안전·정렬·해석가능성Anthropic·Redwood Research

Alignment Faking in LLMs

Alignment Faking in LLMs

왜 중요한가

명시적 학습 없이도 학습 중일 때만 순응하고 선호를 은닉하는 현상을 관측

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 공식 발표anthropic.comhttps://www.anthropic.com/research/alignment-faking2026년 8월 24일에 더한 조각 · 그 주 보기