에이전트 승인 피로, 인간 방화벽은 새고 있다
Scale X의 4만 회 게임 데이터에서 사용자는 악성 명령 3개 중 1개를 놓쳤다. 에이전트 보안은 승인 버튼보다 샌드박스, 권한 분리, 실행 전후 검증으로 이동해야 한다.
Scale X의 4만 회 게임 데이터에서 사용자는 악성 명령 3개 중 1개를 놓쳤다. 에이전트 보안은 승인 버튼보다 샌드박스, 권한 분리, 실행 전후 검증으로 이동해야 한다.
CopilotKit의 Channels SDK는 AG-UI 에이전트를 Slack, Teams, Discord, Telegram 같은 채널에 연결한다. 에이전트 경쟁은 IDE 밖 협업 표면으로 확장되고 있다.
GitHub Actions와 Pages 장애는 Copilot coding agent와 코드 리뷰까지 지연시켰다. AI 개발 자동화가 CI/CD 위에 얹힐수록 배포망 복원력은 모델 품질만큼 중요해진다.
OpenAI는 Plus와 Pro의 GPT-5.6 Sol을 더 집중된 답변으로 조정하고 무료 사용자의 GPT-5.6 Luna 접근을 넓혔다. 추론 깊이를 UI로 고르는 시대가 왔다.
vLLM 내부 해설이 다시 주목받은 이유는 모델 경쟁의 다음 병목이 추론 서버에 있기 때문이다. 한국 AI 서비스는 GPU 구매보다 스케줄링, KV 캐시, 관측 설계를 먼저 점검해야 한다.
Castform과 Neon은 4B 오픈 모델을 검색 업무에 후훈련해 GPT-5.6 Sol급 검색 정확도를 100분의 1 비용으로 냈다고 밝혔다. 범용 모델보다 업무별 RL 루프가 중요해졌다.
구글이 데미스 하사비스를 DeepMind 의장 겸 알파벳 수석과학자로 옮기고 코레이 카부크오글루에게 실행을 맡겼다. AI 경쟁은 연구 스타에서 운영 체계로 이동하고 있다.
HyperProbe는 코딩 에이전트가 운영 환경에 읽기 전용 프로브를 심어 변수 스냅샷을 잡는 온콜 도구를 내세운다. 핵심은 자동 수정이 아니라 증거 기반 원인 확인이다.
Prime Intellect가 공개한 Prime Agent는 RLM과 Continual Harness를 앞세운 오픈소스 코딩 에이전트다. 성능보다 중요한 질문은 에이전트가 자기 작업 습관을 어떻게 관리하느냐다.
Sula는 Scryer Prolog로 작성된 Gemini 프로토콜 서버다. AI 시대의 거대한 웹 자동화와 반대로, 단순한 프로토콜과 논리 언어가 신뢰 가능한 소프트웨어의 다른 길을 보여준다.