Cache-to-Cache, LLM 협업이 텍스트를 건너뛴다
ICLR 2026 논문 Cache-to-Cache는 LLM들이 텍스트 대신 KV 캐시를 직접 주고받는 방식을 제안한다. 멀티 모델 에이전트의 지연시간과 정보 손실을 다시 보게 만든다.
ICLR 2026 논문 Cache-to-Cache는 LLM들이 텍스트 대신 KV 캐시를 직접 주고받는 방식을 제안한다. 멀티 모델 에이전트의 지연시간과 정보 손실을 다시 보게 만든다.
Claude Code 2.1.277은 CLAUDE.md가 없을 때 AGENTS.md를 읽는다. 코딩 에이전트 지침 파일이 도구별 메모에서 공통 계약으로 이동하는 신호다.
Strange Loop의 Jack Rusher 강연은 기하와 대수 사이를 오간 수학 표현의 역사를 다룬다. AI 수학 도구도 답보다 표현 매체를 설계해야 한다.
James Mickens의 논문은 LLM의 언어 출력이 내부 계산을 충실히 보여주지 않을 수 있다고 주장한다. 보안은 CoT 감시보다 sandbox와 taint tracking을 필요로 한다.
New Scientist가 소개한 발달생물학 연구는 뇌의 앞뒤 영역이 서로 다른 progenitor cell에서 나온다고 전한다. AI가 뇌 은유를 쓸 때 더 조심해야 할 이유다.
Ian Duncan의 장문 에세이는 AI 안전 담론이 특정 인터넷 하위문화와 제도권 권력으로 이어지는 방식을 추적하며 공적 신뢰의 조건을 묻는다.
Bend는 C급 속도, GPU 병렬성, Lean식 증명을 묶어 AI가 만든 코드의 실수를 커밋 전에 막겠다는 새 프로그래밍 언어 실험이다.
PrismML의 Bonsai 2 27B는 1.76비트 삼진 가중치로 27B 모델을 5.9GB에 담으며 로컬 멀티모달 AI 배포 기준을 낮춘다.
Infinite-Parameter LLM 논문은 실시간 데이터를 프롬프트에 반복해 넣는 대신 하이퍼네트워크가 가중치 변조로 컴파일하는 구조를 제안한다.
Thomas Ptacek은 LLM을 유령작가가 아니라 까다로운 편집자로 쓰라고 제안한다. AI 글쓰기의 핵심은 목소리를 보존하는 워크플로우다.
BITCOS 논문은 ternary LLM 가중치의 0 비중을 이용해 저장 비트를 줄이고 CPU와 GPU 추론 처리량까지 높일 수 있음을 보였다.
Linum의 JiT-DDT는 pixel-space encoder-decoder로 text-to-image 모델을 3.6배 적은 GPU-hours에 훈련하며 생성형 이미지 모델 비용 구조를 다시 묻는다.
Mistral과 Mozilla가 Firefox Smart Window에 협력하면서 브라우저 AI 경쟁은 검색 보조를 넘어 프라이버시와 지역 주권의 문제로 이동했다.
4B Qwen 모델이 Postgres 기본 플랜보다 빠른 쿼리 플랜을 찾는 실험은 AI 에이전트가 반복 업무의 실행 전략까지 학습할 수 있음을 보여준다.
샤오미 Mimo 2.6의 공개 RL 대시보드는 모델 경쟁이 결과 발표를 넘어 학습 과정의 관측성과 신뢰 경쟁으로 옮겨가고 있음을 보여준다.
Google의 Gemini 3.8 Live 공개는 음성·영상 대화가 모델 경쟁의 전면으로 왔다는 신호다. 에이전트 UX와 비용 구조가 함께 바뀐다.
Navier-Stokes 성과 뒤에도 LLM 완전 자율성에는 명세·검증 비용이라는 구조적 한계가 남는다. 기업 도입 전략은 더 차분해져야 한다.
네덜란드 철도에서 의심되는 사보타주로 35건 이상 장애가 발생했다. AI 운영 시대에는 물리 인프라와 디지털 통제가 함께 취약점이 된다.
LLM RL 사후학습의 Matthew Effect는 쉬운 문제만 더 쉬워지는 현상을 드러낸다. NGU는 어려운 문제에 계산을 되돌리는 설계다.
노르웨이 소비자위원회의 순환경제 보고서는 품질과 내구성을 소비자 권리로 본다. 온디바이스 AI 제품에도 같은 질문이 온다.