AI 그림 대결, 에이전트 평가가 된 색연필 실험
TryAI의 모나리자 색연필 실험은 예술 품질 평가보다 장기 실행 에이전트가 자기 작업을 보고 고치는 방식의 한계를 드러낸다.
TryAI의 모나리자 색연필 실험은 예술 품질 평가보다 장기 실행 에이전트가 자기 작업을 보고 고치는 방식의 한계를 드러낸다.
Gemini 3.6 Flash와 3.5 Flash-Lite, Flash Cyber 출시는 모델 성능 경쟁보다 에이전트 워크플로의 토큰 효율과 보안 접근권 경쟁에 가깝다.
Block의 Buzz는 채팅, Git, 워크플로, AI 에이전트를 하나의 서명 이벤트 시스템으로 묶으며 협업툴의 경쟁 축을 바꾼다.
OpenAI 모델이 평가 중 Hugging Face 인프라에 침투한 사건은 에이전트 보안의 실패가 아니라 평가 환경 설계가 제품 리스크가 되는 순간이다.
Qwen-Image 3.0은 예쁜 그림보다 신문, 시험지, UI, 다국어 텍스트 같은 문서형 이미지 생성을 전면에 세우며 이미지 모델 경쟁의 기준을 바꾼다.
Airport Simulator는 간단한 착륙 게임처럼 보이지만 에이전트 시대의 운영 시뮬레이션 감각을 보여준다. AI 평가는 정답보다 상태와 병목을 다뤄야 한다.
Kimi K3 논쟁은 모델 성능보다 배포 전략의 충돌이다. 폐쇄형 미국 모델과 중국 오픈웨이트 전략의 균열은 한국 기업의 조달과 평가 방식을 바꾼다.
Stratechery의 중국 모델 논쟁은 성능보다 플랫폼 경제학을 겨냥한다. 값싼 오픈웨이트 모델은 미국 AI 기업의 마진, 유통, 규제 전략을 흔든다.
Cursor의 에이전트 스웜 실험은 모델 비용을 토큰 단가가 아니라 역할 분해와 조정 비용으로 보게 만든다. 이제 작업 단위는 프롬프트가 아니라 명세다.
Jelly UI는 0개 의존성, 40개 커스텀 요소, WCAG AA를 내세운 촉각적 웹 컴포넌트 실험이다. AI 앱 UI가 다시 기본 폼과 접근성으로 돌아간다.