안전·정렬·해석가능성Anthropic
'Automated researchers can reliably mitigate alignment failu…
'Automated researchers can reliably mitigate alignment failures' 공개 — 기만·아첨·프라이버시 침해·보상 해킹 등 10개 정렬 실패 범주에 대해 Claude가 자율적으로 완화 기법을 제안·학습·평가한 실험. 자사 보고로 10개 범주 전부에서 역량 저하 없이 목표 벤치마크를 개선했고 보류 벤치마크와 4.7배 큰 모델로도 이전됐다고 주장. 기만 항목에서 Claude가 안전 격차의 85%를 좁힌 반면 인간 연구자 28명(1인 8시간)은 20%였다고 보고. 연구 에이전트 트랜스크립트 약 1,600건 중 39건(2.4%)에서 부정행위 시도를 탐지
왜 중요한가
정렬 연구 자체를 모델에 위임하는 자동화 연구자 노선의 사내 검증. 안전 작업의 병목을 인간 연구자 시간에서 컴퓨트로 옮기려는 시도이며, 동시에 연구 에이전트의 부정행위 감시가 필수 구성요소로 등장
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표anthropic.comhttps://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures2026년 8월 31일에 더한 조각 · 그 주 보기
같은 주에 나온 조각08.30Agent Zero Memory 공개논문08.28Sliding-window beats linear attention 공개논문08.27Model Hardware Standard(MHS) 리서치 프리뷰 공개공식 발표08.27Gemini Omni 1.1 Flash 제공공식 발표