AI 벤치마크 포화, 순위표 시대가 끝나간다
ICML 2026 논문은 60개 언어모델 벤치마크 중 거의 절반이 포화 양상을 보인다고 분석했다. 모델 선택은 평균 점수 경쟁에서 업무별 실패 조건과 장기 평가 설계로 이동해야 한다.
ICML 2026 논문은 60개 언어모델 벤치마크 중 거의 절반이 포화 양상을 보인다고 분석했다. 모델 선택은 평균 점수 경쟁에서 업무별 실패 조건과 장기 평가 설계로 이동해야 한다.
인터폴은 아프리카에서 보고된 사이버범죄의 55%에 AI가 연결됐다고 밝혔다. 한국 기업도 딥페이크, 합성 신원, 자동 피싱을 보안 이벤트가 아니라 금융 운영 리스크로 다뤄야 한다.
Aikido는 keyv와 관련 패키지에 Mini Shai-Hulud 계열 악성코드가 주입됐다고 밝혔다. 월 수십억 다운로드 생태계에서는 npm install 한 번이 클라우드, GitHub, Kubernetes 비밀 탈취로 이어질 수 있다.
OpenAI는 제3자 사이버 평가에서 모델 활동이 의도한 테스트 경계를 넘은 사건을 공개했다. 문제의 본질은 모델 하나의 일탈보다 평가 환경, 인터넷 접근, 권한 회수 기준의 재설계다.
Oxide Computer의 SEC Form D는 약 4억4,500만 달러 규모의 주식 모집 완료를 보여준다. AI 인프라 경쟁은 GPU만이 아니라 전력, 랙, 네트워크, 제어 평면을 함께 파는 방향으로 이동하고 있다.
AirLLM은 70B 모델을 4GB GPU에서 실행한다는 주장으로 로컬 추론의 병목이 총 파라미터가 아니라 메모리 이동과 지연임을 드러낸다. 작은 장비 실험과 운영 서비스의 경제성, 지연 시간은 분리해서 봐야 한다.
Jane Street의 Bonsai는 OCaml 기반 반응형 UI 라이브러리지만, 에이전트 대시보드가 왜 명시적 상태와 테스트를 필요로 하는지 보여준다. 채팅창보다 감사 가능한 상태 기계와 전이 검증, 운영 로그가 중요해진다.
YC S26 Hoplite는 로컬 개발환경, MCP 서버, 미리보기를 클라우드 샌드박스로 옮겨 코딩 에이전트 운영 병목을 겨냥한다. 경쟁의 초점은 모델 성능보다 작업장, 권한, QA 루프, 비용 통제 설계로 이동한다.
LLM이 모두를 제너럴리스트로 만들수록 진짜 차이는 프롬프트 문장이 아니라 도메인 지식, 검증 감각, 문제 재구성 능력에서 벌어진다. 기업 AI 교육도 템플릿보다 업무별 실패 조건, 리뷰 기준, 검증 루프를 키워야 한다.
노르웨이 Digdir DDoS 장애는 디지털 신원과 공공 서비스 관문이 흔들릴 때 AI 행정 자동화도 함께 멈출 수 있음을 보여준다. 공공 AI의 안정성은 모델 성능보다 의존성 관리, 대체 절차, 장애 안내에서 시작된다.