로컬 프런티어 AI, 작은 연구실의 반격
Tim Dettmers의 dlab은 소수 GPU와 로컬 장비로 125B·550B급 모델, 장기 에이전트, 자율 연구를 시연하겠다고 예고했다. 과감한 성능 주장과 작은 연구실의 전략을 검증 관점에서 분석한다.
작은 연구실의 경쟁력은 대규모 사전학습이 아니라 압축·추론·에이전트 하네스를 결합해 값싼 문제를 빠르게 푸는 데 있다. 다만 공개 전 성능 주장은 코드·모델·평가셋으로 재현돼야 한다.
자율 AI 에이전트, 멀티 에이전트 시스템, 에이전트 프레임워크 및 실제 업무 활용 사례를 다룹니다.
Tim Dettmers의 dlab은 소수 GPU와 로컬 장비로 125B·550B급 모델, 장기 에이전트, 자율 연구를 시연하겠다고 예고했다. 과감한 성능 주장과 작은 연구실의 전략을 검증 관점에서 분석한다.
작은 연구실의 경쟁력은 대규모 사전학습이 아니라 압축·추론·에이전트 하네스를 결합해 값싼 문제를 빠르게 푸는 데 있다. 다만 공개 전 성능 주장은 코드·모델·평가셋으로 재현돼야 한다.
mathjs 모방 npm 패키지 3종은 특정 파스칼 행렬을 풀 때만 AES-GCM 페이로드를 복호화해 원격 명령 에이전트를 실행했다. 저장소와 배포물이 다른 공급망 공격의 방어법을 분석한다.
검사 환경에서 실행되지 않는 조건부 페이로드는 평판·다운로드 수·기본 버전 검사만으로 잡기 어렵다. 소스 저장소가 아니라 실제 레지스트리 아카이브를 해시·행위 기준으로 검증해야 한다.
Google의 오픈소스 AX는 작업·워크스페이스·네트워크·모델을 선언형 자원으로 묶는다. 에이전트 운영이 챗봇 배포와 다른 이유와 한국 기업의 도입 조건을 짚는다.
에이전트 운영의 핵심 단위는 컨테이너가 아니라 상태·권한·비용을 함께 가진 작업이다. AX는 이 차이를 선언형 인프라 자원으로 드러낸 초기 시도다.
Laya-CoreML은 Apple Silicon에서 텍스트 생성 대신 분류형 결정을 확률로 반환한다. 짧은 입력의 속도·전력 이점과 96토큰 한계, 재현 조건을 함께 본다.
모든 AI 작업이 문장을 생성할 필요는 없다. Laya-CoreML은 결정 공간을 먼저 정의하면 작은 로컬 모델이 더 빠르고 검증 가능한 부품이 될 수 있음을 보여준다.
Pirate Face는 Hugging Face 공개 모델을 체크섬 검증 토렌트와 web-seed로 보존한다. 가용성은 높이지만 라이선스·삭제권·시드 지속성이라는 새 숙제를 만든다.
모델 파일을 P2P로 복제하면 단일 호스트 장애는 줄지만 삭제와 책임의 경계도 흐려진다. AI 모델 보존은 저장 기술과 거버넌스를 함께 설계해야 한다.
TinyBrains는 8KiB부터 크기 등급을 나눠 ONNX 신경망이 전략 게임을 플레이하게 한다. 모델 규모가 아닌 byte당 실력과 재현성을 경쟁 지표로 삼는다.
TinyBrains의 흥미로운 점은 최고 점수보다 제한된 bytes 안에서의 실력을 묻는 데 있다. 효율 경쟁은 모델 크기와 평가 환경을 함께 고정할 때 의미가 생긴다.
ICLR 2026 논문 Cache-to-Cache는 LLM들이 텍스트 대신 KV 캐시를 직접 주고받는 방식을 제안한다. 멀티 모델 에이전트의 지연시간과 정보 손실을 다시 보게 만든다.
멀티 LLM 협업의 병목은 추론 능력만이 아니라 모델 사이의 통신 형식이다. C2C는 텍스트를 공용어로 쓰는 설계가 항상 최선은 아닐 수 있음을 보여준다.
Claude Code 2.1.277은 CLAUDE.md가 없을 때 AGENTS.md를 읽는다. 코딩 에이전트 지침 파일이 도구별 메모에서 공통 계약으로 이동하는 신호다.
AGENTS.md 지원은 작은 호환성 변경처럼 보이지만, 에이전트 도구가 프로젝트 지침을 읽는 공통 경로를 만들고 있다는 점에서 중요하다.
James Mickens의 논문은 LLM의 언어 출력이 내부 계산을 충실히 보여주지 않을 수 있다고 주장한다. 보안은 CoT 감시보다 sandbox와 taint tracking을 필요로 한다.
모델이 말하는 이유를 믿는 보안은 충분하지 않다. 에이전트 보안은 언어적 자기보고와 무관하게 상태 오염을 차단하는 시스템 경계가 필요하다.
Ian Duncan의 장문 에세이는 AI 안전 담론이 특정 인터넷 하위문화와 제도권 권력으로 이어지는 방식을 추적하며 공적 신뢰의 조건을 묻는다.
AI 위험 논의가 설득력을 얻으려면 경고의 강도뿐 아니라 경고를 생산하는 제도와 커뮤니티의 이해관계도 공개적으로 검증되어야 한다.
Bend는 C급 속도, GPU 병렬성, Lean식 증명을 묶어 AI가 만든 코드의 실수를 커밋 전에 막겠다는 새 프로그래밍 언어 실험이다.
AI가 코드를 더 많이 쓰는 시대에는 리뷰보다 빠른 기계적 계약이 필요하다. Bend의 핵심은 언어 기능보다 에이전트 루프 안에 증명 검사를 넣는 운영 모델이다.
PrismML의 Bonsai 2 27B는 1.76비트 삼진 가중치로 27B 모델을 5.9GB에 담으며 로컬 멀티모달 AI 배포 기준을 낮춘다.
로컬 AI 경쟁은 작은 모델만의 싸움이 아니다. 27B급 능력을 6GB 안팎으로 압축하면 개인정보, 지연시간, 비용 구조가 동시에 바뀐다.
Infinite-Parameter LLM 논문은 실시간 데이터를 프롬프트에 반복해 넣는 대신 하이퍼네트워크가 가중치 변조로 컴파일하는 구조를 제안한다.
긴 문맥과 RAG의 다음 질문은 정보를 어디에 저장하느냐다. 실시간 데이터를 가중치 변조로 바꾸는 접근은 에이전트 메모리의 계산 비용을 다시 설계한다.
Thomas Ptacek은 LLM을 유령작가가 아니라 까다로운 편집자로 쓰라고 제안한다. AI 글쓰기의 핵심은 목소리를 보존하는 워크플로우다.
AI 글쓰기의 성패는 생성 능력이 아니라 권한 배분에 있다. 모델에게 문장을 맡기면 목소리를 잃고, 결함 탐지를 맡기면 편집 비용을 줄일 수 있다.
BITCOS 논문은 ternary LLM 가중치의 0 비중을 이용해 저장 비트를 줄이고 CPU와 GPU 추론 처리량까지 높일 수 있음을 보였다.
모델 압축 경쟁은 더 낮은 비트 수 선언보다 실제 분포와 언팩 비용을 함께 최적화하는 방향으로 이동하고 있다.
Linum의 JiT-DDT는 pixel-space encoder-decoder로 text-to-image 모델을 3.6배 적은 GPU-hours에 훈련하며 생성형 이미지 모델 비용 구조를 다시 묻는다.
이미지 생성 경쟁의 다음 병목은 더 큰 모델보다 토큰 창과 구조 학습을 줄이는 아키텍처 설계에 있다.
4B Qwen 모델이 Postgres 기본 플랜보다 빠른 쿼리 플랜을 찾는 실험은 AI 에이전트가 반복 업무의 실행 전략까지 학습할 수 있음을 보여준다.
에이전트의 다음 시장은 코드를 쓰는 것만이 아니라 오래 반복되는 운영 결정을 더 싸고 빠르게 고르는 일이다.
샤오미 Mimo 2.6의 공개 RL 대시보드는 모델 경쟁이 결과 발표를 넘어 학습 과정의 관측성과 신뢰 경쟁으로 옮겨가고 있음을 보여준다.
모델 기업의 신뢰 경쟁은 최종 점수보다 훈련 중 어떤 신호가 올라가고 비용이 얼마나 드는지를 보여주는 방향으로 넓어지고 있다.
Google의 Gemini 3.8 Live 공개는 음성·영상 대화가 모델 경쟁의 전면으로 왔다는 신호다. 에이전트 UX와 비용 구조가 함께 바뀐다.
실시간 대화 모델의 경쟁력은 벤치마크 점수보다 턴 지연, 끼어들기 처리, 도구 호출 통제, 비용 예측성에서 갈린다.
Navier-Stokes 성과 뒤에도 LLM 완전 자율성에는 명세·검증 비용이라는 구조적 한계가 남는다. 기업 도입 전략은 더 차분해져야 한다.
LLM 자율성의 병목은 모델이 똑똑한가만이 아니라, 실패를 막기 위한 명세와 검증을 누가 얼마의 비용으로 쓰느냐에 있다.