축 ②
RAG·파인튜닝·컨텍스트
기록 74 · 정리 노트 1 · 관련 축으로 붙은 사건도 함께 보여요.
OpenAI
범용 챗봇이 규제 의료 기록 시스템에 직접 연결되는 단계. 컨텍스트 연결(RAG·커넥터)의 전선이 공개 웹에서 규제 데이터 영역으로 넘어갔고, 안전성 근거는 아직 벤더 자체 평가에 의존
물리 세계·현실 영향공식 발표
Aurélien Lac, Tony Wu
생성 모델을 검색기로 재활용하던 ColPali 계보 대신 처음부터 인코더로 설계한 단일 타워로 되돌아간 갈래 — 멀티모달 검색에서 '인코더 전용'이 다시 유효하다는 주장. 저자 자체 보고로 동일 해상도에서 ColModernVBERT 대비 약 2배 인코딩 처리량, 계층적 토큰 풀링과 비대칭 양자화로 255배 압축에서도 기준 성능 95% 이상 유지.
Ming Wu, Pengyuan Zhu
그래프 단일 구조에 기대던 에이전트 장기기억을 타임라인·그래프·문서 삼중 구조와 출처 추적(provenance)·인용 잠금으로 재편한 갈래. 저자 자체 보고로 LongMemEval 95.60%·LoCoMo 93.60%이며, 8개 언어모델에 걸쳐 질의당 비용이 약 30배 차이 나는데도 정확도 편차는 3.4%포인트에 그쳐 성능을 가르는 것은 모델 선택이 아니라 기억 아키텍처라고 주장.
정리 노트
Claude Code 요금은 토큰으로 표시되지만 실제 비용은 GPU 추론 시간이고, 토큰 단가는 모델 크기·입력/출력 방향·캐시 여부로 정해진다. 입력(프리필)은 병렬 처리되지만 출력(디코드)은 순차 생성이라 출력 단가가 약 5배 비싸고, 보이지 않는
Martino M. L. Pulici, Cuong
검색 시점에 그래프를 조회하는 GraphRAG 계보와 달리 그래프를 모델 가중치로 미리 컴파일해 두는 파라메트릭 지식그래프 갈래를 열면서, 동시에 그 갈래의 병목이 저장이 아니라 어댑터 선택(라우팅)임을 못박았다 — 의미 유사도를 넘어서는 어댑터 선택 기제를 찾는 것이 남은 과제라고 저자들이 결론. 수치는 저자 자체 보고.
Pranav Bykampadi 외
에이전틱 시스템의 지식그래프를 '추출된 트리플의 평평한 저장소'에서 누가 사실을 소유하는지·왜 채택됐는지·어떻게 쓰여야 하는지를 기록하는 거버넌스 대상으로 재정의한 갈래. 저자 자체 보고로 SciERC에서 평면 삽입 대비 strict 트리플 F1 47%·mapped 트리플 F1 51% 개선, 120개 트리플 블라인드 검토에서 거버넌스 통과 트리플이 더 자주 출처 근거를 가졌고, MuSiQue에서 Microsoft GraphRAG 대비 exact-match 9.0포인트·token F1 11.2포인트 우위.
Ashwin Gerard Colaco·Nada La
흩어져 있던 컨텍스트 압축 연구를 하나의 이론틀로 정리
Shijie Xia 외
Context Rot을 검색 에이전트 맥락에서 정량화하고 근본 해결이 어렵다는 것도 함께 보임
Chen, Razkenari 외 (AWS 계열)
검색 지표 중심 평가가 그래프 기법의 이점을 과대평가해 왔다는 반성의 주류화
Dongzhe Fan 외
에이전틱 검색이 두 방식의 격차를 좁힘을 보여 2024년 GraphRAG 논쟁을 갱신
Saroj Mishra 외
에이전틱 RAG의 첫 체계적 분류. 후속 연구의 기준점
Pietro Ferrazzi 외
에이전틱 RAG가 항상 낫지는 않다는 실증. 설계 선택의 근거가 되는 반증형 결과
Xiang, Wu 외 (홍콩이공대 등)
그래프가 언제 도움이 되는가를 벤치마크로 검증하는 국면 전환점 — 2026년 회의론의 방법론적 선행
Mem0 (Chhikara, Khant 외)
에이전트 장기 기억 상용 제품이 그래프 표현을 핵심 확장으로 채택 — 그래프 엔지니어링이 RAG 를 넘어 메모리 계층으로 확산
Zep (Rasmussen, Chalef 외)
시간적 지식그래프를 에이전트 메모리의 1급 설계 요소로 내세운 대표 사례
Ant Group (Liang, Sun 외)
중국 빅테크가 GraphRAG 계보를 전문 도메인(금융·의료)용으로 산업화한 사례
Peng, Zhu 외 (베이징대·앤트그룹 등)
난립하던 변종들을 하나의 분류 체계로 묶어 그래프 기반 RAG를 독립 연구 분야로 공식화
Zhuowan Li 외 (Google DeepMin
롱컨텍스트 vs RAG 논쟁을 비용·성능 트레이드오프로 정리
Greg Kamradt
커뮤니티 테스트가 사실상 표준 평가로 정착, 선언된 길이와 실제 회상 성능이 다르다는 인식 확립
Microsoft (Edward J. Hu 외)
가중치를 동결하고 저랭크 행렬만 학습해 GPT-3 175B 기준 학습 파라미터를 1만분의 1로, 추론 지연 증가 없음