한국어EN
축 ⑦

멀티모달

기록 47 · 정리 노트 1 · 관련 축으로 붙은 사건도 함께 보여요.


Tingyu Song 외
임베딩 학습의 기본값이던 대조학습보다 다단계 순위 감독이 감독 신호를 더 잘 쓴다고 주장하며, 리랭커를 검색 파이프라인의 후단이 아니라 임베딩 모델의 교사로 재배치한 갈래. 저자 자체 보고로 COLA·SUGARCREPE++·NEGBENCH 3개 구성적 추론 벤치마크에서 CORE-RERANKER-8B가 총평균 82.7%로 Jina-Reranker 대비 10.7포인트 우위, CORE-EMBED-8B가 평가 대상 임베딩 모델 중 최고 총평균 0.666이며 COCO·Flickr30K 검색 성능은 유지.

Google DeepMind·Google Resea
AI 기상 모델이 연구 시연을 넘어 소비자 제품과 상용 API의 기본 예보로 들어감

Google (Gemini API)
긴 영상을 통째로 넣는 대신 모델이 스스로 탐색하는 방식 — 멀티모달 입력이 에이전트 루프로 편입
멀티모달공식 발표

정리 노트
이순신 명량대첩을 소재로 1분짜리 시네마틱 비디오를 만드는 과정에서 배울 점은 프롬프트를 바로 넣지 않는 순서다. 먼저 명량대첩이라는 주제와 생성 툴의 사용법을 각각 리서치시켜 컨텍스트를 채운 뒤, 두 결과를 합쳐 초 단위 화면 기획이 담긴 툴 전용

Aurélien Lac, Tony Wu
생성 모델을 검색기로 재활용하던 ColPali 계보 대신 처음부터 인코더로 설계한 단일 타워로 되돌아간 갈래 — 멀티모달 검색에서 '인코더 전용'이 다시 유효하다는 주장. 저자 자체 보고로 동일 해상도에서 ColModernVBERT 대비 약 2배 인코딩 처리량, 계층적 토큰 풀링과 비대칭 양자화로 255배 압축에서도 기준 성능 95% 이상 유지.

Google (Gemini API)
영상 생성이 단발 클립에서 이어 붙이고 제어하는 타임라인 작업으로 이동
멀티모달공식 발표

Spotify
주요 플랫폼이 AI 페르소나 범주를 만들어 라벨링을 넘어 추천 알고리즘에서 구조적으로 차등하는 첫 사례

xAI
NCII 규제 압박 이후 출시된 이미지 모델임에도 발표문에 워터마킹·모더레이션 언급이 없음
멀티모달공식 발표

EU (AI Act 제50조)
C2PA·SynthID 같은 출처 표기가 선의에서 규제 준수 요건으로 이동. 단 2026-08-02를 적용 개시일로 인용하면 틀린다
멀티모달정부 기록

OpenAI
음성 모델에 reasoning effort와 병렬 도구 호출 도입, 컨텍스트 32K에서 128K로. 음성이 에이전트 실행 환경이 됨
멀티모달공식 발표

OpenAI
시각 이해와 컴퓨터 조작이 같은 능력임을 수치로 보여줌
멀티모달공식 발표

Google
임베딩 상용 계보가 텍스트 전용 세대를 지나 네이티브 멀티모달 세대로 공식 전환

Alibaba Qwen
오픈 웨이트 옴니모달이 10시간 오디오·400초 비디오를 처리하며 프런티어를 따라잡음

Anthropic
조밀한 스크린샷·다이어그램 판독력이 computer use 성능의 병목이었음을 확인
멀티모달공식 발표

Moonshot AI
K2 계열이 텍스트에서 네이티브 멀티모달로 전환한 지점이자 오픈웨이트 에이전트 스웜의 등장
멀티모달공식 발표

xAI
NCII 규제 압박 한복판에서 영상 생성 API를 상용화. 발표문에 콘텐츠 안전·모더레이션 언급이 없음
멀티모달공식 발표

Yann LeCun
LLM 이 아닌 월드 모델 노선의 독자 연구소가 생기며 담론 지형이 갈라짐

vLLM 프로젝트
텍스트 전용이던 오픈소스 서빙 인프라가 비자기회귀·멀티모달 생성까지 포괄하는 확장 신호

Black Forest Labs
Mistral-3 24B VLM과 rectified flow transformer 결합, 오픈 웨이트가 품질 격차를 좁힌 릴리스
멀티모달공식 발표

Google
정확한 인포그래픽과 다국어 텍스트 렌더링으로 이미지 생성을 추론 과제로 재정의, SynthID 탑재
멀티모달공식 발표

Google
네이티브 멀티모달 설계가 비디오·문서 이해 우위로 귀결
멀티모달공식 발표

World Labs
텍스트·이미지·비디오에서 편집 가능한 3D 월드를 생성하고 Gaussian splat·메시로 익스포트
멀티모달공식 발표

DeepSeek
10배 미만 압축에서 OCR 정밀도 97%, 20배에서 약 60%. 이미지를 컨텍스트 압축 매체로 쓰는 발상 전환

OpenAI·SAG-AFTRA
저작권 트랙과 별개로 초상권 트랙이 형성

OpenAI (Sam Altman)
생성 비디오의 권리 처리 방식이 산업 현안으로
멀티모달공식 발표

OpenAI
동기 대사·효과음, 물리 정확도 향상, 본인 삽입(cameo) 기능
멀티모달공식 발표

Google
캐릭터 일관성 편집이 대중 제품 수준에 도달, SynthID 비가시 워터마크 탑재
멀티모달공식 발표

Google DeepMind
720p·24fps로 수 분간 일관성을 유지하며 조작 가능한 환경을 프롬프트로 생성
멀티모달공식 발표

Google
대사·효과음·배경음을 영상과 함께 생성해 무성영화 시대를 끝냄
멀티모달공식 발표

Cohere
상용 임베딩 경쟁이 텍스트 검색을 넘어 장문 문서·혼합 모달리티 검색으로 이동

OpenAI
공식 설명은 tokens에서 transformer, diffusion, pixels 순 — 순수 AR 회귀가 아니라 AR 토큰 생성과 확산 디코더의 하이브리드
멀티모달공식 발표

Google DeepMind
웹 스케일 시맨틱 지식을 로봇 제어라는 출력 모달리티로 연결
멀티모달공식 발표

OpenAI
음성이 개발자 프리미티브(speech-to-speech WebSocket)로
멀티모달공식 발표

Alexandre Défossez 외 (Kyutai
파이프라인형 음성 대화를 단일 모델로 대체한 계보

OpenAI
음성 응답 최소 232ms·평균 320ms로 캐스케이드 구조의 지연과 정보손실을 구조적으로 제거
멀티모달공식 발표

xAI
자체 벤치마크를 만들어 함께 공개한 사례. 발표문은 곧 얼리 테스터에 제공한다고만 밝혀 실제 일반 출시 여부는 미확인
멀티모달공식 발표

Jake Bruce 외 (Google DeepMin
월드 모델 계보의 기점. 저자들은 이 규모에서 foundation world model로 볼 수 있다고 주장

OpenAI
비디오 생성 모델은 곧 월드 시뮬레이터라는 담론을 촉발
멀티모달공식 발표

Google
인코더 후접합이 아니라 처음부터 모든 모달리티를 함께 사전학습하는 노선 선언
멀티모달공식 발표

OpenAI
이미지 이해가 연구 프리뷰에서 광범위 배포 기능으로 이동
멀티모달공식 발표

UW-Madison·Microsoft (Liu 외)
오픈 VLM 계보의 출발점

OpenAI
다국어 ASR을 상품화해 음성이 LLM 파이프라인의 표준 입력이 됨
멀티모달공식 발표

Stability AI·CompVis
소비자 GPU급 고품질 생성 모델의 오픈 웨이트화, LoRA·ControlNet 생태계와 저작권 논쟁을 동시에 촉발
멀티모달공식 발표

Midjourney
Discord 기반 UX로 비개발자 크리에이터 대규모 유입

DeepMind
냉동 비전·언어 모델을 cross-attention으로 잇는 few-shot VLM의 원형

LMU Munich·하이델베르크대 IWR·Runwa
픽셀이 아닌 잠재 공간에서 확산해 연산량 급감, Stable Diffusion의 직접 기반

OpenAI
텍스트에서 이미지 생성의 출발점
멀티모달공식 발표

OpenAI
이후 이미지 생성·검색 모델의 텍스트 조건화 백본. 4억 쌍 대조학습은 논문 arXiv:2103.00020 근거
멀티모달공식 발표