추론 인프라·서빙Heng Wang 외
Random Attention 공개
Random Attention 공개 — 추론 시 KV 캐시 축출에서 캐시된 토큰에 점수를 매겨 남길 토큰을 정하는 통상적 접근에 대해 그 선택 신호가 거의 아무것도 기여하지 않는다고 보고하고, 프롬프트는 보존한 채 각 어텐션 헤드 안에서 토큰을 무작위로 제거해 점수 계산을 아예 없애는 방식을 제시. 4개 모델·6개 추론 벤치마크에서 더 강한 대안들과 성능이 일치하면서 실제 vLLM 환경에서 처리량이 상당히 높다고 보고
왜 중요한가
중요도 점수 기반 KV 축출 계보 전체에 대해 '점수 자체가 필요 없다'는 반증을 제기. 취약한 부분은 프롬프트뿐이며 추론 시퀀스는 텍스트 재진술과 여러 어텐션 헤드에 걸친 복제라는 이중 중복성으로 스스로를 지탱하므로 프롬프트만 지키면 무작위 선택으로 충분하다는 것이 저자들의 설명. 수치는 저자 자체 보고.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.034302026년 8월 31일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.04'Formalizing Fermat's Last Theorem' 공개공식 발표09.03Grok Bot 기업용 제공 시작공식 발표09.03GPT-6 Astra 공개공식 발표09.03Minima 공개논문