AI 코딩 시대, Linear는 CI를 다시 설계했다
Linear는 테스트가 연초보다 약 4배 늘었는데도 PR 대기를 6분대에서 5분대로 줄이고 테스트당 러너 시간을 절반가량 낮췄다. AI가 코드를 빠르게 만들수록 검증 경제성이 중요해지는 이유를 짚는다.
AI 코딩의 생산성은 생성한 코드 줄 수가 아니라 검증된 변경이 합쳐지는 속도로 측정해야 한다. CI의 임계경로와 고정비를 줄이지 않으면 에이전트 확산이 비용과 대기열만 키운다.
infrastructure 관련 AI 뉴스와 분석 기사를 모아놓은 토픽 페이지입니다.
Linear는 테스트가 연초보다 약 4배 늘었는데도 PR 대기를 6분대에서 5분대로 줄이고 테스트당 러너 시간을 절반가량 낮췄다. AI가 코드를 빠르게 만들수록 검증 경제성이 중요해지는 이유를 짚는다.
AI 코딩의 생산성은 생성한 코드 줄 수가 아니라 검증된 변경이 합쳐지는 속도로 측정해야 한다. CI의 임계경로와 고정비를 줄이지 않으면 에이전트 확산이 비용과 대기열만 키운다.
Tim Dettmers의 dlab은 소수 GPU와 로컬 장비로 125B·550B급 모델, 장기 에이전트, 자율 연구를 시연하겠다고 예고했다. 과감한 성능 주장과 작은 연구실의 전략을 검증 관점에서 분석한다.
작은 연구실의 경쟁력은 대규모 사전학습이 아니라 압축·추론·에이전트 하네스를 결합해 값싼 문제를 빠르게 푸는 데 있다. 다만 공개 전 성능 주장은 코드·모델·평가셋으로 재현돼야 한다.
Google의 오픈소스 AX는 작업·워크스페이스·네트워크·모델을 선언형 자원으로 묶는다. 에이전트 운영이 챗봇 배포와 다른 이유와 한국 기업의 도입 조건을 짚는다.
에이전트 운영의 핵심 단위는 컨테이너가 아니라 상태·권한·비용을 함께 가진 작업이다. AX는 이 차이를 선언형 인프라 자원으로 드러낸 초기 시도다.
Laya-CoreML은 Apple Silicon에서 텍스트 생성 대신 분류형 결정을 확률로 반환한다. 짧은 입력의 속도·전력 이점과 96토큰 한계, 재현 조건을 함께 본다.
모든 AI 작업이 문장을 생성할 필요는 없다. Laya-CoreML은 결정 공간을 먼저 정의하면 작은 로컬 모델이 더 빠르고 검증 가능한 부품이 될 수 있음을 보여준다.
Pirate Face는 Hugging Face 공개 모델을 체크섬 검증 토렌트와 web-seed로 보존한다. 가용성은 높이지만 라이선스·삭제권·시드 지속성이라는 새 숙제를 만든다.
모델 파일을 P2P로 복제하면 단일 호스트 장애는 줄지만 삭제와 책임의 경계도 흐려진다. AI 모델 보존은 저장 기술과 거버넌스를 함께 설계해야 한다.
TinyBrains는 8KiB부터 크기 등급을 나눠 ONNX 신경망이 전략 게임을 플레이하게 한다. 모델 규모가 아닌 byte당 실력과 재현성을 경쟁 지표로 삼는다.
TinyBrains의 흥미로운 점은 최고 점수보다 제한된 bytes 안에서의 실력을 묻는 데 있다. 효율 경쟁은 모델 크기와 평가 환경을 함께 고정할 때 의미가 생긴다.
ICLR 2026 논문 Cache-to-Cache는 LLM들이 텍스트 대신 KV 캐시를 직접 주고받는 방식을 제안한다. 멀티 모델 에이전트의 지연시간과 정보 손실을 다시 보게 만든다.
멀티 LLM 협업의 병목은 추론 능력만이 아니라 모델 사이의 통신 형식이다. C2C는 텍스트를 공용어로 쓰는 설계가 항상 최선은 아닐 수 있음을 보여준다.
James Mickens의 논문은 LLM의 언어 출력이 내부 계산을 충실히 보여주지 않을 수 있다고 주장한다. 보안은 CoT 감시보다 sandbox와 taint tracking을 필요로 한다.
모델이 말하는 이유를 믿는 보안은 충분하지 않다. 에이전트 보안은 언어적 자기보고와 무관하게 상태 오염을 차단하는 시스템 경계가 필요하다.
PrismML의 Bonsai 2 27B는 1.76비트 삼진 가중치로 27B 모델을 5.9GB에 담으며 로컬 멀티모달 AI 배포 기준을 낮춘다.
로컬 AI 경쟁은 작은 모델만의 싸움이 아니다. 27B급 능력을 6GB 안팎으로 압축하면 개인정보, 지연시간, 비용 구조가 동시에 바뀐다.
Infinite-Parameter LLM 논문은 실시간 데이터를 프롬프트에 반복해 넣는 대신 하이퍼네트워크가 가중치 변조로 컴파일하는 구조를 제안한다.
긴 문맥과 RAG의 다음 질문은 정보를 어디에 저장하느냐다. 실시간 데이터를 가중치 변조로 바꾸는 접근은 에이전트 메모리의 계산 비용을 다시 설계한다.
BITCOS 논문은 ternary LLM 가중치의 0 비중을 이용해 저장 비트를 줄이고 CPU와 GPU 추론 처리량까지 높일 수 있음을 보였다.
모델 압축 경쟁은 더 낮은 비트 수 선언보다 실제 분포와 언팩 비용을 함께 최적화하는 방향으로 이동하고 있다.
Linum의 JiT-DDT는 pixel-space encoder-decoder로 text-to-image 모델을 3.6배 적은 GPU-hours에 훈련하며 생성형 이미지 모델 비용 구조를 다시 묻는다.
이미지 생성 경쟁의 다음 병목은 더 큰 모델보다 토큰 창과 구조 학습을 줄이는 아키텍처 설계에 있다.
4B Qwen 모델이 Postgres 기본 플랜보다 빠른 쿼리 플랜을 찾는 실험은 AI 에이전트가 반복 업무의 실행 전략까지 학습할 수 있음을 보여준다.
에이전트의 다음 시장은 코드를 쓰는 것만이 아니라 오래 반복되는 운영 결정을 더 싸고 빠르게 고르는 일이다.
샤오미 Mimo 2.6의 공개 RL 대시보드는 모델 경쟁이 결과 발표를 넘어 학습 과정의 관측성과 신뢰 경쟁으로 옮겨가고 있음을 보여준다.
모델 기업의 신뢰 경쟁은 최종 점수보다 훈련 중 어떤 신호가 올라가고 비용이 얼마나 드는지를 보여주는 방향으로 넓어지고 있다.
네덜란드 철도에서 의심되는 사보타주로 35건 이상 장애가 발생했다. AI 운영 시대에는 물리 인프라와 디지털 통제가 함께 취약점이 된다.
AI 운영 시스템의 위험은 모델 오류만이 아니다. 센서가 보는 현실 자체가 조작될 때, 자동화는 잘못된 세계를 매우 빠르게 믿을 수 있다.
노르웨이 소비자위원회의 순환경제 보고서는 품질과 내구성을 소비자 권리로 본다. 온디바이스 AI 제품에도 같은 질문이 온다.
온디바이스 AI가 확산될수록 제품의 수명은 배터리와 부품뿐 아니라 모델 업데이트, 보안 패치, 데이터 이전 가능성으로 결정된다.
Claude Code Web 환경을 역공학한 글은 Firecracker MicroVM, 스냅샷, 내부 배포 프로토콜을 드러낸다. 에이전트 런타임 경쟁의 힌트다.
코딩 에이전트의 경쟁력은 모델만이 아니라 격리된 실행환경, 스냅샷, 배포 프로토콜에서 나온다. AI IDE의 다음 전장은 런타임 인프라다.
M3 Apple Neural Engine의 DMA 병목 분석은 온디바이스 AI 성능이 모델 크기보다 메모리 경로와 커널 구현에 더 민감할 수 있음을 보여준다.
온디바이스 AI의 성능 병목은 모델 논문보다 메모리 이동에서 먼저 터질 수 있다. 로컬 AI 시장은 하드웨어 스펙표가 아니라 커널과 런타임의 싸움이 된다.
이코노미스트의 엔비디아 분석은 GPU 공급자가 단순 칩 회사를 넘어 AI 산업의 자본 배분자처럼 작동한다는 점을 드러낸다.
AI 경쟁의 병목은 모델 아이디어보다 계산 자본 배분이다. 엔비디아는 칩을 파는 회사이면서 동시에 누가 얼마나 빨리 확장할 수 있는지 정하는 배관이 됐다.
litelm은 LiteLLM의 핵심 라우팅과 메시지 변환을 2900줄, 2개 기본 의존성으로 줄인 실험이다. 에이전트 스택의 경량화 요구를 보여준다.
LLM 인프라 시장은 기능을 더하는 경쟁만큼 덜어내는 경쟁도 시작됐다. litelm은 작은 팀이 에이전트 호출 경로를 이해하고 통제하려는 수요가 커졌다는 신호다.