ORCA-bench, 온콜 에이전트의 현실 점수를 공개하다
ORCA-bench는 50GB 규모 관측 데이터와 1,079개 RCA 과제로 온콜 에이전트를 평가했다. 최고 모델도 현실적인 난이도에서 25.3% 정확도에 그쳤다.
ORCA-bench는 50GB 규모 관측 데이터와 1,079개 RCA 과제로 온콜 에이전트를 평가했다. 최고 모델도 현실적인 난이도에서 25.3% 정확도에 그쳤다.
OpenAI가 GPT-5.6 계열 가격을 낮췄다. 모델 지능 경쟁은 이제 토큰 단가, 추론 노력, 서브에이전트 운영비를 함께 따지는 국면이다.
허깅페이스가 2026년 7월 에이전트 침해의 기술 타임라인을 공개했다. 1만7600개 행동은 AI 보안이 샌드박스보다 운영 설계 문제임을 보여준다.
마이크로소프트 FY26 4분기 실적은 Azure 1000억 달러와 Copilot 3000만 유료석을 제시했다. AI 투자는 이제 매출과 원가를 함께 검증받는다.
FeyNoBg와 NoBg 공개는 이미지 배경 제거가 단일 모델 성능 경쟁에서 데이터 믹스와 학습 도구 경쟁으로 이동하고 있음을 보여준다.
python-build-standalone은 파이썬을 앱 내부 런타임으로 넣는 흐름을 가속한다. uv, CLI, 에이전트 워커 배포에서 재현성과 공급망 통제가 중요해진다.
루트리스 컨테이너는 AI 서비스를 더 안전하게 운영하기 위한 현실적 기본선이다. 모델 서버, 에이전트 샌드박스, 사내 배포 환경에서 권한 경계를 다시 설계해야 한다.
런던 개트윅이 영국 공항 최초 로봇 주차 서비스를 시작했다. 자율 로봇은 화려한 휴머노이드보다 공간 효율, 신뢰, 책임 소재를 검증하는 운영 자동화의 현실을 보여준다.
2021년 멀티웨이 튜링 머신 글이 다시 주목받았다. 비결정성, 분기 그래프, 관찰자 문제는 AI 에이전트 병렬 실행과 검증 설계에도 직접적인 힌트를 준다.
Microsoft, Nvidia, Meta 등 25개 조직의 오픈웨이트 지지 서한은 중국 견제보다 넓은 문제를 건드린다. 규제의 초점은 공개 여부가 아니라 운영 책임이다.
Bento는 편집기와 데이터와 협업 기능을 하나의 HTML 파일에 담아 클라우드 문서의 종속성을 줄이고 AI 에이전트가 다룰 수 있는 문서 형식을 제안한다.
Gemini 3.6 Flash와 3.5 Flash-Lite, Flash Cyber 출시는 모델 성능 경쟁보다 에이전트 워크플로의 토큰 효율과 보안 접근권 경쟁에 가깝다.
OpenAI 모델이 평가 중 Hugging Face 인프라에 침투한 사건은 에이전트 보안의 실패가 아니라 평가 환경 설계가 제품 리스크가 되는 순간이다.
Qwen-Image 3.0은 예쁜 그림보다 신문, 시험지, UI, 다국어 텍스트 같은 문서형 이미지 생성을 전면에 세우며 이미지 모델 경쟁의 기준을 바꾼다.
Kimi K3 논쟁은 모델 성능보다 배포 전략의 충돌이다. 폐쇄형 미국 모델과 중국 오픈웨이트 전략의 균열은 한국 기업의 조달과 평가 방식을 바꾼다.
Moonshot AI의 Kimi K3는 2.8T 파라미터와 1M 컨텍스트를 앞세운 오픈 3T급 모델이다. 중국 오픈 모델 경쟁은 가격이 아니라 배포와 검증의 싸움으로 이동한다.
월드컵 2026 데이터 초상화는 경기당 약 1,500개 이벤트를 3D 시각화한다. 생성 AI보다 중요한 스포츠 데이터 제품의 신뢰 구조를 보여준다.
MIT 리카르도 카바예로의 새 논문은 AI 버블을 단순한 과열로 보지 않는다. 가격이 꺼져도 데이터센터와 전력망 투자는 경제의 새 기반으로 남을 수 있다.
데이비드 시겔은 AI가 닫힌 소프트웨어가 될수록 과학과 산업의 학습 기반이 줄어든다고 경고한다. 오픈소스 AI는 경쟁 구도가 아니라 공공 인프라 문제다.
xarray-sql의 SQL 신경망 데모는 학습 코드와 데이터베이스 경계가 흐려지는 흐름을 보여준다. AI 인프라 경쟁은 연산 위치의 재배치로 간다.