축 ⑰
임베딩·벡터 검색
기록 61 · 정리 노트 0 · 관련 축으로 붙은 사건도 함께 보여요.
Tingyu Song 외
임베딩 학습의 기본값이던 대조학습보다 다단계 순위 감독이 감독 신호를 더 잘 쓴다고 주장하며, 리랭커를 검색 파이프라인의 후단이 아니라 임베딩 모델의 교사로 재배치한 갈래. 저자 자체 보고로 COLA·SUGARCREPE++·NEGBENCH 3개 구성적 추론 벤치마크에서 CORE-RERANKER-8B가 총평균 82.7%로 Jina-Reranker 대비 10.7포인트 우위, CORE-EMBED-8B가 평가 대상 임베딩 모델 중 최고 총평균 0.666이며 COCO·Flickr30K 검색 성능은 유지.
Aurélien Lac, Tony Wu
생성 모델을 검색기로 재활용하던 ColPali 계보 대신 처음부터 인코더로 설계한 단일 타워로 되돌아간 갈래 — 멀티모달 검색에서 '인코더 전용'이 다시 유효하다는 주장. 저자 자체 보고로 동일 해상도에서 ColModernVBERT 대비 약 2배 인코딩 처리량, 계층적 토큰 풀링과 비대칭 양자화로 255배 압축에서도 기준 성능 95% 이상 유지.
Orion Weller, Michael Boratk
단일 벡터 검색의 한계가 데이터·모델 크기로 해결되지 않는 차원상 원리적 한계임을 보인 반박. 다중벡터·희소·하이브리드 회귀의 이론적 근거
Rishi Jha, Collin Zhang 외 (C
임베딩 마이그레이션 비용에 대한 급진적 접근이자 벡터DB 유출 시 보안 함의를 제기
Jinhyuk Lee 외 (Google DeepMi
임베딩 모델이 전용 소형 인코더에서 프런티어 LLM 파생물로 이동하는 흐름을 대표
Zach Nussbaum 외 (Nomic AI)
학습 데이터까지 공개한 첫 경쟁력 있는 임베딩 모델. 재현 가능성을 임베딩 경쟁의 축으로 추가
Xiaohua Zhai 외 (Google DeepM
CLIP 이후 멀티모달 임베딩의 사실상 후계. 대규모 배치 요구를 없애 학습 접근성을 크게 낮춤
Aditya Kusupati 외 (워싱턴대·Goog
임베딩 차원을 사후에 조절 가능하게 만든 기법
Nandan Thakur, Nils Reimers
밀집검색이 어휘검색을 이겼다는 서사에 대한 결정적 반박. 하이브리드 검색이 기본값이 된 실무적 근거
Yantao Shen 외 (Amazon AWS·UC
임베딩 마이그레이션 비용을 정면으로 다룬 첫 연구. 모델 교체 때마다 전 코퍼스를 재임베딩해야 하는 구조적 부채를 문제화
Rodrigo Nogueira, Kyunghyun
리랭커 계보의 원형. 밀집 임베딩이 못 잡는 정밀도를 후단에서 회수하는 2단 구조의 표준화