한국어EN
축 ③

툴·에이전트

기록 49 · 정리 노트 4 · 관련 축으로 붙은 사건도 함께 보여요.


OpenAI
GPT-6 세대 개시. Anthropic Fable 5.1과 같은 주에, 100만 토큰당 10/50달러라는 동일한 가격표로 출시돼 프런티어 가격이 사실상 수렴했고, 벤치마크 경쟁의 중심이 컴퓨터 사용·사이버·에이전틱 코딩으로 이동

xAI
에이전트 배포의 초점이 능력 과시에서 권한·감사 거버넌스로 이동
툴·에이전트공식 발표

Meta Superintelligence Labs
MSL이 폐쇄 API 노선을 유지한 채 에이전트 효율(툴 호출·토큰 절감)을 전면 지표로 내세움
툴·에이전트공식 발표

Guowei Wang 외
별도 디바이스 풀과 KV 캐시 전송을 요구하는 P/D 분리(disaggregation) 대신, 가중치와 KV를 공유한 채 집합 통신 순서와 상태만 격리해 같은 디바이스에서 P/D를 겹치는 갈래. 서빙 인프라의 병목이 추론 서비스에서 RL 롤아웃으로 옮겨간 사례이기도 하다. 수치는 저자 자체 보고.

Google (Gemini API)
긴 영상을 통째로 넣는 대신 모델이 스스로 탐색하는 방식 — 멀티모달 입력이 에이전트 루프로 편입
멀티모달공식 발표

Ming Wu, Pengyuan Zhu
그래프 단일 구조에 기대던 에이전트 장기기억을 타임라인·그래프·문서 삼중 구조와 출처 추적(provenance)·인용 잠금으로 재편한 갈래. 저자 자체 보고로 LongMemEval 95.60%·LoCoMo 93.60%이며, 8개 언어모델에 걸쳐 질의당 비용이 약 30배 차이 나는데도 정확도 편차는 3.4%포인트에 그쳐 성능을 가르는 것은 모델 선택이 아니라 기억 아키텍처라고 주장.

정리 노트
구글시트에 탑재된 Gemini는 단순 질의응답에서 2026년 4월 수식·피벗·차트 생성, 6월 한국어 지원, 8월 시트 캔버스(미니앱 생성)까지 네 단계로 발전했다. 매출·비용 데이터 4,800행을 두고 수식을 직접 짜는 대신 지표 이름과 의미만 설명

정리 노트
사이버보안 기업 크라우드스트라이크와 옥타가 실적 발표 후 각각 20%, 28%대 급등하며 신고가를 기록한 배경에는 옥타가 내세운 새 서사가 있다. 기존에는 직원 한 명당 계정 하나만 관리하면 됐지만, 이제 직원 한 명이 수십~수백 개의 에이전트를 만들

Google (Gemini API)
영상 생성이 단발 클립에서 이어 붙이고 제어하는 타임라인 작업으로 이동
멀티모달공식 발표

Anthropic
MCP가 소프트웨어 도구 접근을 표준화했듯 물리 장비 제어를 표준화하려는 시도. 에이전트의 작용 범위를 실험실 하드웨어로 넓히는 경계 사건이며, 표준 주도권이 다시 Anthropic에 놓임

정리 노트
Gemini의 업무 자동화 기능은 자동화 강도 순으로 다섯 단계로 정리된다. 개인 인텔리전스에서 메모리와 워크스페이스·노트북 연동을 켜면 메일 확인→정리→캘린더 등록처럼 서비스를 가로지르는 지시가 되고, 노트북은 워드·PDF·드라이브·웹페이지를 주제별

정리 노트
한 채용 플랫폼의 프로덕트 디자인팀이 Claude Code를 실무에 녹인 방식은 네 가지 패턴으로 정리된다. 첫째, 사내 디자인시스템의 템플릿 프롬프트를 붙여넣고 이벤트 결제 페이지를 만들어 달라는 자연어 한 줄로 로컬에 프로토타입을 띄우며, 템플릿

Zhiyuan Li 외
LLM이 뽑아낸 그래프 간선을 그대로 믿지 않고 반사실 개입으로 간선 가중치를 사후 보정한다는 갈래 — 그래프 검색의 고질적 약점으로 지목돼 온 간선 신뢰도 문제를 검색 이전 단계에서 다룬다. 저자 자체 보고로 6개 LLM에 걸쳐 Graph-of-Skills 대비 ScienceWorld 매크로 평균 72.62→80.50, ALFWorld 성공률 80.01%→86.79%이며 환경 스텝 수는 감소.

Ollama·Anthropic
폐쇄형 클라이언트가 로컬 오픈모델 런타임을 공식 백엔드로 수용
툴·에이전트공식 발표

Pranav Bykampadi 외
에이전틱 시스템의 지식그래프를 '추출된 트리플의 평평한 저장소'에서 누가 사실을 소유하는지·왜 채택됐는지·어떻게 쓰여야 하는지를 기록하는 거버넌스 대상으로 재정의한 갈래. 저자 자체 보고로 SciERC에서 평면 삽입 대비 strict 트리플 F1 47%·mapped 트리플 F1 51% 개선, 120개 트리플 블라인드 검토에서 거버넌스 통과 트리플이 더 자주 출처 근거를 가졌고, MuSiQue에서 Microsoft GraphRAG 대비 exact-match 9.0포인트·token F1 11.2포인트 우위.

OpenClaw (Kevin Lin)
급속 릴리스 문화를 유지하던 에이전트 프로젝트가 LTS·성숙도 공시 체계로 이행
툴·에이전트공식 발표

OpenClaw
소비자 소프트웨어 수준의 복구 안전장치가 에이전트 런타임에 도입
툴·에이전트공식 발표

OpenClaw Foundation
경쟁 랩들이 공동으로 중립 에이전트 표준을 후원하는 구조
툴·에이전트공식 발표

OpenAI
2025-10 발표 제품이 8개월 만에 철수 — 에이전트 툴링 층의 불안정성
툴·에이전트공식 발표

Peter Steinberger
개인 프로젝트에서 재단 거버넌스로의 이행이 프론티어 랩 채용과 동시에 발생

OpenClaw
2개월 새 3번째 개명. 프로젝트 정체성을 개인 브랜드에서 분리하는 전환점
툴·에이전트공식 발표

Peter Steinberger
오픈소스 에이전트가 모델 제공사 브랜드에 올라타는 관행에 상표법이 제동을 건 사례

Anthropic
툴 정의가 컨텍스트를 잠식하는 문제에 대한 구조적 해법
툴·에이전트공식 발표

Peter Steinberger
메신저 앱을 인터페이스로 삼는 로컬 상주 에이전트 형태를 대중화한 출발점

LangChain
에이전트 루프 커스터마이즈를 미들웨어 개념으로 정형화
툴·에이전트공식 발표

Anthropic (Ken Aizawa)
프롬프트 엔지니어링이 툴 정의 설계로 이동했음을 보여주는 문서
툴·에이전트공식 발표

Anthropic
위 Cognition 글과 정반대 결론을 같은 달에 제시. 반드시 쌍으로 인용
툴·에이전트공식 발표

Cognition (Walden Yan)
멀티에이전트 확산에 대한 정면 반론. 다음 항목과 하루 차이로 정반대 결론
툴·에이전트공식 발표

Victor Barres 외 (Sierra·토론토대
에이전트-사용자 협업을 평가 대상으로 확장

Mem0 (Chhikara, Khant 외)
에이전트 장기 기억 상용 제품이 그래프 표현을 핵심 확장으로 채택 — 그래프 엔지니어링이 RAG 를 넘어 메모리 계층으로 확산

Zep (Rasmussen, Chalef 외)
시간적 지식그래프를 에이전트 메모리의 1급 설계 요소로 내세운 대표 사례

Anthropic
워크플로와 에이전트를 구분하고 프레임워크보다 API 직접 호출에서 시작하라 권고, 2년간 열광의 정리
툴·에이전트공식 발표

Adam Fourney 외 (Microsoft Re
오케스트레이터-워커 패턴의 구현 레퍼런스

Shunyu Yao 외 (Sierra)
단발 툴 호출이 아닌 다회차 정책 준수를 측정

Anthropic
주요 모델 제공자 전반에서 도구 호출이 기본 기능으로 표준화
툴·에이전트공식 발표

Princeton (John Yang 외)
에이전트 전용 인터페이스 설계라는 개념을 제시하고 SWE-bench pass@1 12.5%를 오픈소스로 달성

GitHub
이슈에서 계획, 코드, 검증으로 이어지는 흐름으로 자동완성에서 태스크 단위 에이전트로 제품 전환
툴·에이전트공식 발표

Internet of Bugs (Carl Brown
에이전트 데모의 재현성·검증 문제를 업계 의제로 만듦

Tianbao Xie 외 (홍콩대·Salesforc
컴퓨터 사용 에이전트의 사실상 표준 벤치마크

OpenAI
1년 만에 접힌 첫 대규모 도구 생태계, 느슨한 마켓플레이스보다 스키마 기반 함수 호출이 살아남는다는 신호
툴·에이전트공식 발표

Cognition
SWE-bench 13.86%로 기존 SOTA 1.96%를 7배 이상 갱신했다고 발표
툴·에이전트공식 발표

Meta·HuggingFace (Mialon 외)
466개 질문에서 인간 92% 대 플러그인 GPT-4 15%, 평가축을 어려운 시험에서 실용 능력으로 이동

João Moura
역할·목표·태스크를 명시 부여하는 구조화된 멀티 에이전트, 완전 자율을 포기하고 워크플로를 설계하는 전환
툴·에이전트공식 발표

OpenAI
에이전트가 실험에서 플랫폼 제품 전략으로 편입
툴·에이전트공식 발표

Microsoft Research 외 (Wu 외)
에이전트 간 대화로 조합하며 human-in-the-loop를 허용하는 멀티 에이전트 노선

DeepWisdom (Hong 외)
SOP를 프롬프트 시퀀스로 인코딩한 조립 라인 방식 멀티 에이전트

CMU (Zhou 외)
실제 동작하는 웹사이트 위 평가에서 GPT-4 에이전트 14.41% 대 인간 78.24%, 데모와 현실의 간극을 못박음

OpenAI
도구 호출이 프롬프트 파싱에서 구조화된 JSON 스키마 인터페이스로 승격, 에이전트 개발의 사실상 표준 API
툴·에이전트공식 발표

Stanford·Google (Park 외)
25명 에이전트 샌드박스에서 관찰-메모리-반성-계획 아키텍처로 창발적 사회 행동

Toran Bruce Richards
목표만 주면 알아서 하는 AI 서사를 만든 동시에 무한 루프·환각·비용 폭증을 대중에 노출

Yohei Nakajima
실행·태스크 생성·우선순위 재조정을 무한 루프로 도는 최소 구조를 제시
툴·에이전트공식 발표

Meta AI (Schick 외)
자기지도 학습으로 API 호출 시점·인자를 스스로 학습, 도구 사용을 가중치에 내재화하는 노선

GitHub
에이전트 이전 시대의 기준선 — 제안은 하지만 스스로 실행·검증하지 못하는 자동완성의 한계
툴·에이전트공식 발표