agent.md, 코딩 에이전트 품질의 새 계약서
Fabien Sanglard의 agent.md 제안은 코딩 에이전트 성능을 프롬프트 재주가 아니라 저장소 안의 명시적 계약, 검증 루프, 팀 규칙으로 관리해야 한다는 흐름을 선명하게 보여준다.
Fabien Sanglard의 agent.md 제안은 코딩 에이전트 성능을 프롬프트 재주가 아니라 저장소 안의 명시적 계약, 검증 루프, 팀 규칙으로 관리해야 한다는 흐름을 선명하게 보여준다.
FT가 전한 Anthropic 최상위 모델 채택 부진은 기업 AI 구매가 성능 최고점보다 비용, 지연시간, 워크플로 적합성으로 이동하고 있음을 보여준다.
1998년 복잡계 실패론은 AI 에이전트 운영에도 그대로 적용된다. 사고는 단일 모델 결함이 아니라 경계, 로그, 인간 개입, 조직 압력이 겹칠 때 발생한다.
Tim Harford의 설명 방식 논의는 생성형 AI 시대에 쉬운 설명이 전문성을 대체하는 것이 아니라 검증, 교육, 조직 커뮤니케이션의 핵심 역량이 된다는 점을 보여준다.
Google Workspace가 개인 도메인을 이메일 제공자로 오판한 사례는 AI 에이전트가 메일, 캘린더, SSO에 붙는 시대에 신원 인프라 오류가 곧 자동화 리스크가 된다는 점을 보여준다.
한 개발자의 일주일 사용기는 Codex와 Claude Code의 차이를 모델 성능보다 작업 태도, 세션 운영, 검증 루프, 통합 UX와 팀 규율의 차이로 보여주며, 코딩 에이전트 선택 기준이 습관 적합성으로 이동하고 있음을 말한다.
SynthID 워터마크 응답을 맞히는 간단한 퀴즈 결과는 사용자가 AI 워터마크를 체감 품질로 식별하기 어렵고, 출처 증명은 사람 눈보다 플랫폼 검증과 감사 가능한 메타데이터 설계에 달려 있음을 보여준다. 교육과 기업 문서 모두에 해당한다.
로컬 LLM이 기대보다 둔하게 느껴지는 이유는 모델 가중치만의 문제가 아니다. 추론 엔진, 양자화, KV 캐시, 긴 문맥 평가와 업무형 벤치마크가 실제 품질을 좌우한다는 신호이며, 온프레미스 AI 도입팀에는 재현성 체계가 필요하다.
Munder Difflin은 Claude Code, Codex, Gemini CLI 등 기존 터미널 에이전트를 묶어 개인과 팀의 클론 사무실처럼 운영하려는 오픈소스 하네스로, 경쟁축이 단일 채팅창에서 운영 계층으로 넓어지고 있음을 보여준다.
로이터가 보도한 AI 해킹 시도 제보 사건은 에이전트 시대 보안의 초점이 모델 성능에서 권한, 로그, 제보 체계, 인간 개입 경로로 이동했음을 보여주며, 기업에는 감사 가능한 운영 장치가 필요하다는 경고다. 지금 바로 점검할 사안이다.