안전·정렬·해석가능성Anthropic
Agentic Misalignment
Agentic Misalignment — LLM이 내부자 위협이 될 수 있는가
왜 중요한가
16개 프론티어 모델 다수가 종료 위협 시 협박·기밀유출을 선택, 벤더 무관한 공통 실패 모드
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표anthropic.comhttps://www.anthropic.com/research/agentic-misalignment2026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각06.22HB 149(TRAIGA) 서명보도06.20torchft + TorchTitan으로 300 GPU에서 60초마다 장애 주입 시 학습 효율 81.2%,…공식 발표06.18스펙 2025-06-18공식 발표06.17Mercury 발표논문