현실의 디테일, AI 에이전트 평가의 맹점
2017년 에세이가 다시 읽히는 이유는 분명하다. 에이전트가 현실 업무를 맡을수록 문제는 추론 점수가 아니라 보이지 않는 세부조건이다.
2017년 에세이가 다시 읽히는 이유는 분명하다. 에이전트가 현실 업무를 맡을수록 문제는 추론 점수가 아니라 보이지 않는 세부조건이다.
강한 코딩 모델일수록 자율성보다 짧은 피드백 루프가 중요해진다. Fable 시대의 생산성은 모델 방임이 아니라 감독 설계에서 갈린다.
스페인이 Palantir 신규 계약 회피를 지시했다는 보도는 AI 조달의 핵심이 기능에서 데이터 주권과 전략 정보 통제로 이동했음을 보여준다.
미국 정부가 Anthropic Mythos·Fable 모델 수출 제한을 풀었다. 프런티어 모델 출시는 기술 발표가 아니라 외교와 보안 협상의 산물이 됐다.
Cloudflare가 검색·학습·에이전트 혼합 크롤러를 기본 차단하겠다고 밝혔다. AI 검색과 콘텐츠 경제의 거래 조건이 다시 쓰인다.
Google Gemini Spark가 macOS 베타로 확장됐다. 에이전트 경쟁은 채팅창이 아니라 파일, 일정, 앱 권한을 둘러싼 데스크톱 전쟁으로 옮겨간다.
Meta의 Brain2Qwerty v2는 MEG 기반 비침습 뇌파 문장 복원에서 61% 단어 정확도를 보고했다. 의료 AI와 데이터 공개 경쟁을 분석한다.
한 개발자는 Claude Code의 체감 작업량이 과거의 16~20%로 줄었다고 분석했다. 구독형 AI 코딩 도구의 비용 투명성을 짚는다.
Claude Code 요청에 숨은 마커가 있다는 분석은 보안 기능인지 추적 장치인지 논란을 낳았다. 개발자 도구의 투명성 기준을 짚는다.
Claude Science beta는 과학 연구용 워크벤치를 표방한다. 단순 챗봇을 넘어 데이터, 코드, 도구, 재현성을 묶는 경쟁을 분석한다.
Anthropic의 Claude Sonnet 5는 낮은 단가와 에이전트 성능을 앞세운다. 모델 경쟁이 성능표에서 운영비와 안전 정책 경쟁으로 이동한다.
Carson Gross의 htmx 에세이는 AI가 원인 분석과 테스트에는 강하지만 설계 판단은 인간에게 남는다는 점을 구체적 버그 수정으로 보여준다.
Ornith-1.0은 9B부터 397B까지 공개한 에이전틱 코딩 모델이다. 자기개선 RL, 벤치마크, 한국 개발조직의 도입 기준을 짚는다.
.self 최상위 도메인 구상은 자가 호스팅과 인간 중심 웹을 DNS 레벨에서 묶으려는 실험이다. AI 에이전트 시대의 신뢰 인프라를 분석한다.
vLLM Semantic Router의 Micro-Agent 구상은 한 번의 모델 호출 안에 라우팅, 평가, 합성을 넣는다. 추론 인프라 경쟁의 다음 축을 분석한다.
Adrafinil은 AI 코딩 에이전트가 일할 때만 맥 절전을 막는다. 개발 장비 운영, 권한 분리, 에이전트 훅 설계의 의미를 분석한다.
DeepSeek DeepSpec의 DSpark는 speculative decoding 학습과 평가를 공개했다. LLM 추론 비용, 지연시간, 한국 서비스 운영 전략을 분석한다.
OpenAI가 GPT-5.6 Sol, Terra, Luna 제한 프리뷰를 공개했다. 가격, 캐시, 울트라 모드가 에이전트 제품 설계에 주는 의미를 분석한다.
Doubleword의 오픈웨이트 LLM 격차 분석은 폐쇄형 모델 우위가 줄고 있음을 보여준다. 한국 기업의 모델 조달과 자체 운영 전략을 짚는다.
Workweave Router는 Claude Code, Codex, Cursor 앞단에서 요청별 모델 라우팅을 제공한다. 멀티모델 시대 개발도구 인프라의 의미를 분석한다.