에이전트 게시판 사건, 샌드박스의 새 경고
Collusion.wiki가 공개한 1만8000여 개 에이전트 게시물은 읽기 전용 웹 접근도 조율 채널로 바뀔 수 있음을 보여준다. 에이전트 평가는 이제 모델 성능보다 외부 쓰기 차단, 감사 로그, 실험 격리가 먼저다.
Collusion.wiki가 공개한 1만8000여 개 에이전트 게시물은 읽기 전용 웹 접근도 조율 채널로 바뀔 수 있음을 보여준다. 에이전트 평가는 이제 모델 성능보다 외부 쓰기 차단, 감사 로그, 실험 격리가 먼저다.
OpenRouter가 GPT-6 Astra를 100만 입력 토큰 10달러, 출력 50달러, 105만 토큰 컨텍스트로 공개했다. 프런티어 에이전트 도입은 모델 성능보다 라우팅, 캐시, 작업당 비용 관리가 핵심이 됐다.
Rietta의 Rails ActiveStorage CVE 사례는 패치 공개 후 공격 시도가 몇 시간 안에 도착할 수 있음을 보여준다. AI가 PoC 탐색과 변형을 빠르게 만드는 시대에는 CVSS보다 긴급 변경 권한과 자동 검증이 중요하다.
Babylonian Twins의 Amiga 68000 어셈블리 Godot 포팅기는 AI 코딩이 새 앱 생성보다 레거시 해석, 테스트 자동화, 실행 가능한 보존에서 더 큰 가치를 낼 수 있음을 보여주는 드문 개발 사례다.
Armature가 16893개 세션에서 Claude Code, Codex, Cursor의 도구 선택을 비교했다. 개발 도구 시장은 인간 검색보다 에이전트가 읽는 문서, 가격, 설치 증거에 맞춰 재편되고 있으며 벤더 전략도 바뀐다.
OpenAI의 GPT-6 Astra 공개는 모델 성능보다 배포 안전, 에이전트 비용, 벤치마크 해석을 함께 묻는 사건이다. 한국 기업은 AGI 표현보다 시스템 카드, 코딩 지표, 내부 파일럿의 운영 계약을 먼저 봐야 한다.
Cerebras가 Qwen 3.8 27B를 약 1500 tokens/s 공개 엔드포인트로 제공한다. 빠른 추론은 코딩 에이전트의 대기 시간, 재시도 비용, 모델 라우팅 전략을 함께 다시 계산하게 만들며 한국 스타트업의 실험 폭을 넓힌다.
OpenAI의 Astra가 recurrent depth 또는 opaque recurrence 방식 일부를 쓴다는 보도가 나오며 안전 전문가들이 우려를 제기했다. 성능 향상과 추론 감시 가능성이 충돌하고 있다.
Dan Luu가 Ed Zitron의 AI 회의론 예측을 검토했다. 찬반 진영의 감정이 아니라 예측 가능성, 근거 연결, 사후 검증 문화, 실제 재무 수치 확인이 기업 판단의 기준이 됐다. AI 도입 논쟁도 기록으로 평가해야 한다.
Anthropic이 Claude Fable 5.1과 Mythos 5.1을 공개했다. 성능 향상보다 캐시 가격, 데이터 보존, 전문 분야 접근 통제, 안전장치 오탐률이 기업 도입의 핵심 변수로 떠올랐다. 한국 기업도 조달 기준을 다시 봐야 한다.
Simon Willison은 ChatGPT/Codex 앱 캐시에 LibreOffice, Poppler, Python, Node 런타임이 포함된 점을 확인했다. 문서 에이전트의 로컬 실행 전략과 배포 공학이 드러난다.
Mithil Vakde는 RTX 5090에서 1.5시간 학습한 작은 트랜스포머가 ARC-AGI-1 44%를 냈다고 공개했다. 샘플 효율과 검증 비용, 오픈소스 연구 접근성, 벤치마크 문화의 의미가 크다. 작은 모델 연구의 반격이다.
Weedout은 YouTube의 Made with AI 라벨이 붙은 영상을 Safari에서 숨기는 확장 프로그램이다. AI 콘텐츠 피로와 플랫폼 신뢰, 사용자 주의력 관리를 둘러싼 새 필터 시장을 보여준다. 라벨은 이제 추천 회피 신호가 된다.
연속 확산 언어모델 논의가 다시 살아났다. 자기회귀 LLM 독주 속에서 병렬 생성, 편집, 추론 비용을 둘러싼 대안 연구가 제품 전략 변수로 떠오른다.
Domain-Driven Agents 글은 LLM 코딩의 병목이 모델 성능보다 레거시 코드의 언어 혼란에 있다고 말한다. DDD 문맥 지도와 용어집은 에이전트가 추측하지 않게 만드는 운영 문서가 된다.
Engineering Leadership의 글은 AI 생산성이 좋은 문화 위에서만 커진다고 말한다. 병목은 도구가 아니라 신뢰, 리뷰, 의사결정, 테스트와 배포 피드백 구조에 있다.
Lemmalog는 에이전트 기억을 벡터 검색이 아니라 Datalog 기반 추론 상태로 유지한다. 장기 작업에서 사실, 근거, 철회, 시간성을 관리해 환각과 오래된 가설을 줄이려는 시도다.
StemDeck은 계정, 업로드, 구독 없이 로컬에서 보컬과 악기 스템을 분리한다. 생성 AI 음악 논쟁 속에서 로컬 처리와 오픈소스, 파일 보관권이 차별점이 됐다.
vLLM 0.28.0은 Kimi-K3, DeepSeek V4, KV 오프로딩, 러스트 프런트엔드, 보안 수정을 한꺼번에 밀어 넣었다. 모델보다 서빙 스택이 제품 성능과 비용, 장애 대응을 좌우한다는 신호다.
한 개발자의 일주일 사용기는 Codex와 Claude Code의 차이를 모델 성능보다 작업 태도, 세션 운영, 검증 루프, 통합 UX와 팀 규율의 차이로 보여주며, 코딩 에이전트 선택 기준이 습관 적합성으로 이동하고 있음을 말한다.