Anthropic 자기개선 경고, AI 개발 속도의 새 변수
Anthropic은 Claude가 AI 개발 자체를 가속하고 있다며 recursive self-improvement 가능성을 제기했다. 병목은 코드 작성에서 검토와 거버넌스로 옮겨간다.
Anthropic은 Claude가 AI 개발 자체를 가속하고 있다며 recursive self-improvement 가능성을 제기했다. 병목은 코드 작성에서 검토와 거버넌스로 옮겨간다.
Anthropic의 오픈소스 보안 하네스는 AI가 취약점을 대량 발견하는 시대에 검증, 샌드박스, 패치 검토가 새 병목이 됐음을 보여준다.
Ashby Engineering은 2025년 8월 이후 신규 production code의 절반 이상이 AI 생성이라고 밝히며 코드 작성보다 검증과 판단이 중요해졌다고 분석했다.
Huawei CSL의 KVarN은 vLLM용 KV 캐시 양자화 백엔드로 3~5배 더 긴 컨텍스트와 FP16 수준 정확도를 주장하며 에이전트 추론 비용 경쟁을 자극한다.
Works in Progress의 Samurai city는 안정성을 위해 생산 엘리트를 도시에 묶은 Edo의 역사를 통해 AI 시대 조직 설계와 인센티브의 비용을 되묻는다.
Mnemo는 SQLite와 지식 그래프로 LLM 대화 기억을 로컬에 쌓는 실험이다. 에이전트 장기 기억의 비용, 프라이버시, 이식성 문제를 함께 드러낸다.
Rootshell의 아이슬란드 호스팅 E2EE 이메일 실험은 AI 에이전트가 메일을 읽고 쓰는 시대에 암호화, 복구, 외부 수신자 경고가 왜 중요한지 보여준다.
Uber의 월 1500달러 AI 코딩 도구 한도는 기업용 에이전트가 실험 예산을 넘어 인건비 대비 ROI와 사용량 통제의 대상이 됐다는 신호다.
NVIDIA Cosmos 3 공개는 로봇, 자율주행, 스마트 공간을 위한 세계 모델 경쟁이 폐쇄형 데모를 넘어 오픈 모델과 합성 데이터 생태계로 이동하고 있음을 보여준다.
스탠퍼드 CS336의 AI 에이전트 지침은 코딩 조교와 과제 대행의 경계를 분명히 하며, 교육 현장의 AI 사용 규칙이 운영 문서로 이동하고 있음을 보여준다.
에이전트가 코드를 빨리 만들수록 희소해지는 것은 구현력이 아니라 정답을 판별하는 도메인 지식이다. 개발자와 기업의 역량 재배치를 분석한다.
Open Envelope의 스키마는 에이전트 팀을 코드가 아닌 선언형 계약으로 정의하려는 시도다. 멀티에이전트 운영 표준의 가능성을 본다.
OpenRouter의 1억1300만 달러 Series B는 단일 모델 경쟁보다 라우팅, 비용, 신뢰성 계층이 AI 인프라의 핵심이 됐다는 신호다.
Liquid AI의 LFM2.5-8B-A1B는 38T 토큰, 128K 컨텍스트, 도구 호출을 내세운 온디바이스 MoE 모델이다. 로컬 에이전트 경쟁을 분석한다.
Mistral AI Now Summit은 모델 발표보다 산업, 데이터센터, 에이전트 운영을 앞세웠다. 유럽형 풀스택 AI 전략이 한국 기업에 주는 의미를 짚는다.
Shift는 뉴욕 무료 청소를 대가로 1인칭 청소 영상을 수집한다. 로봇 학습 데이터가 서비스와 맞교환되는 시대의 기회와 위험을 분석한다.
Zot은 Go로 만든 코딩 에이전트 하네스다. 세션, 서브에이전트, 도구 게이트, 모델 폴백이 왜 모델만큼 중요한지 분석한다.
Anthropic의 Claude Opus 4.8은 성능 개선보다 동적 워크플로, 노력 제어, 토큰 비용 관리가 엔터프라이즈 AI 도입의 핵심으로 옮겨갔음을 보여준다.
Continue Y/N은 Claude Code식 권한 승인 피로를 1분 게임으로 보여준다. 에이전트 보안은 승인 버튼이 아니라 샌드박스와 권한 경계 설계 문제다.
Kaelio의 ktx는 데이터 에이전트가 매번 SQL과 지표 정의를 다시 추측하지 않도록 시맨틱 계층과 위키 지식을 로컬 파일로 구축하는 오픈소스 도구다.