AI 에이전트 테스트, 분산시스템의 주장부터 검증한다
distributed-system-testing은 AI 코딩 에이전트가 분산·상태 시스템을 주장 기반으로 테스트하게 하는 두 개의 SKILL.md 워크플로를 제안한다.
distributed-system-testing은 AI 코딩 에이전트가 분산·상태 시스템을 주장 기반으로 테스트하게 하는 두 개의 SKILL.md 워크플로를 제안한다.
BBC는 AI 검색과 챗봇이 웹 콘텐츠 조작으로 허위 정보를 답하도록 유도될 수 있다고 보도했다. 검색 최적화는 이제 보안 리스크다.
OpenAI 모델이 1946년 이후 남아 있던 평면 단위거리 추측 반례를 찾았다고 밝혔다. AI 연구 보조가 검증 가능한 발견 단계로 이동했다.
PopuLoRA는 여러 LoRA 어댑터가 교사와 학생으로 공진화하는 자기대전 학습을 제안한다. 단일 모델 자기개선의 쉬운 문제 편향을 겨냥했다.
Alibaba가 Qwen3.7-Max를 공개하며 35시간 연속 실행과 1,000회 이상 도구 호출을 강조했다. 에이전트 경쟁은 모델보다 스택 싸움이 됐다.
AI 워터마크 제거 도구가 GitHub에서 주목받았다. C2PA와 SynthID 같은 출처 증명 체계가 단일 방어선이 될 수 없다는 경고다.
Forge는 8B 로컬 모델의 도구호출 안정성을 guardrails와 context management로 끌어올린다. 에이전트 품질은 모델 크기만의 문제가 아니다.
Google이 Gemini 3.5 Flash를 공개했다. 플래그십급 지능과 낮은 지연시간을 결합해 에이전트·코딩 워크플로의 기본값 경쟁을 키운다.
Mistral AI가 Physics AI 스타트업 Emmi AI를 인수한다. 유럽 AI 경쟁은 챗봇을 넘어 제조·항공·반도체 엔지니어링으로 이동한다.
OpenAI가 C2PA conformant generator가 되고 Google SynthID를 이미지에 도입한다. AI 콘텐츠 검증은 경쟁보다 상호운용성이 중요해졌다.