AirLLM, 작은 GPU 추론의 경제학을 흔들다
AirLLM은 70B 모델을 4GB GPU에서 실행한다는 주장으로 로컬 추론의 병목이 총 파라미터가 아니라 메모리 이동과 지연임을 드러낸다. 작은 장비 실험과 운영 서비스의 경제성, 지연 시간은 분리해서 봐야 한다.
AirLLM은 70B 모델을 4GB GPU에서 실행한다는 주장으로 로컬 추론의 병목이 총 파라미터가 아니라 메모리 이동과 지연임을 드러낸다. 작은 장비 실험과 운영 서비스의 경제성, 지연 시간은 분리해서 봐야 한다.
Jane Street의 Bonsai는 OCaml 기반 반응형 UI 라이브러리지만, 에이전트 대시보드가 왜 명시적 상태와 테스트를 필요로 하는지 보여준다. 채팅창보다 감사 가능한 상태 기계와 전이 검증, 운영 로그가 중요해진다.
YC S26 Hoplite는 로컬 개발환경, MCP 서버, 미리보기를 클라우드 샌드박스로 옮겨 코딩 에이전트 운영 병목을 겨냥한다. 경쟁의 초점은 모델 성능보다 작업장, 권한, QA 루프, 비용 통제 설계로 이동한다.
LLM이 모두를 제너럴리스트로 만들수록 진짜 차이는 프롬프트 문장이 아니라 도메인 지식, 검증 감각, 문제 재구성 능력에서 벌어진다. 기업 AI 교육도 템플릿보다 업무별 실패 조건, 리뷰 기준, 검증 루프를 키워야 한다.
노르웨이 Digdir DDoS 장애는 디지털 신원과 공공 서비스 관문이 흔들릴 때 AI 행정 자동화도 함께 멈출 수 있음을 보여준다. 공공 AI의 안정성은 모델 성능보다 의존성 관리, 대체 절차, 장애 안내에서 시작된다.
중세 Ars Notoria 이야기는 AI 학습 도구가 파는 즉석 지식의 약속이 새롭지 않으며, 비용·접근성·검증 문제가 반복된다는 점을 보여준다.
eBay의 5,570만 달러 합의는 AI 플랫폼이 내부 보안·신뢰안전 조직에 더 큰 권한을 줄수록 감사와 인센티브 설계가 중요하다는 신호다.
Habsburg jaw 개구리 SVG 실험은 작은 프롬프트가 모델의 시각적 추론, 지시 준수, 과잉해석을 드러내는 평가 도구가 될 수 있음을 보여준다.
C++23로 만든 초경량 코딩 에이전트 MicroCodex는 기능 경쟁이 커지는 코딩 도구 시장에서 작은 바이너리와 로컬 제어의 가치를 다시 묻는다.
OpenAI Astra의 10개 수학·이론컴퓨터과학 성과를 둘러싼 논쟁은 검증 가능한 영역의 진전과 범용지능 서사를 구분해야 함을 보여준다.
MIT Sloan 연구는 AI 금융 조언이 저축과 분산투자에는 강하지만 충격 대응과 편향에는 약하다고 짚었다. 금융 AI의 핵심은 답변보다 질문 설계다.
n=4 braid group의 Burau representation faithful 증명은 순수수학 뉴스지만 AI 시대에는 형식검증과 정리 증명 모델의 좋은 장기 벤치마크가 된다.
Explorative Modeling은 best-of-K 학습으로 생성 모델의 평균화 문제를 줄이고 추론 단계를 낮추려는 시도다. 데이터와 파라미터 다음의 확장 축으로 주목할 만하다.
Microsoft의 Flint는 AI 에이전트가 짧은 의미 중심 스펙으로 Vega-Lite, ECharts, Chart.js, Plotly, Excel 차트를 만들게 하는 시각화 중간언어다.
Kaisel은 문자열 경로와 코드 생성 없이 Dart 3 sealed route를 쓰는 Flutter 라우터다. AI 코딩 시대에는 이런 타입 구조가 에이전트가 읽는 앱 지도다.
Quanta가 2026년 AI 추론 논쟁을 정리했다. reasoning trace가 성능을 높여도 실제 원인인지 불확실하다는 점이 연구와 제품 평가의 핵심 쟁점이다.
JW Labs의 BTB는 같은 프롬프트가 몰리는 LLM 버스트에서 KV 캐시를 미리 복제해 TTFT를 줄인다. 에이전트 원가 경쟁이 라우팅에서 메모리 운영으로 이동한다.
Google Chrome 보안팀은 AI로 취약점 발견, triage, 수정, release를 자동화하고 있다. 최근 두 milestone에서 보안 버그 1,072개를 수정했다.
Manifest가 LLM 라우터를 출시 4개월 만에 폐기한다고 밝혔다. 비용 절감 자동화보다 캐시, 일관성, 평가 유지비가 더 중요해지는 흐름이다.
ORCA-bench는 50GB 규모 관측 데이터와 1,079개 RCA 과제로 온콜 에이전트를 평가했다. 최고 모델도 현실적인 난이도에서 25.3% 정확도에 그쳤다.