본문으로 건너뛰기

뉴스 아카이브 - 4페이지

SWE-2가 말하는 코딩 모델의 비용 전선

Cognition의 SWE-2 발표는 코딩 모델 경쟁이 단순 정답률에서 비용, 노력 단계, 에이전트 실행 안정성의 경쟁으로 옮겨갔음을 보여준다. 개발팀은 벤치마크 점수보다 운영 비용과 검토 체계를 함께 봐야 한다, 정량적으로.

2026-09-11원본

OpenAI Agents API, 에이전트 운영을 API로 묶다

OpenAI Agents API는 durable cloud agents와 managed Codex harness를 전면에 내세운다. 이는 모델 호출 API에서 장기 실행 작업, 도구 권한, 상태 관리, 관찰 가능성까지 포함한 운영 API로 무게중심이 이동했다는 신호다.

2026-09-11원본

Lean 4 증명, AI 수학의 신뢰 장치가 되다

OpenAI의 Navier-Stokes 관련 발표에 Lean 4 형식 증명이 포함됐다는 보도는 AI 수학 경쟁의 기준이 바뀌고 있음을 보여준다. 생성된 답보다 중요한 것은 기계가 검증 가능한 증명 산출물과 인간 수학자의 검토 흐름이다.

2026-09-11원본

미공개 수학과 AI 신뢰의 균열

수학자 Andreas Thom의 문제 제기는 AI 연구 플랫폼의 핵심 리스크를 드러낸다. 미공개 대화가 훈련과 추론 개선에 어떻게 쓰이는지 설명하지 못하면, AI는 연구 협업 도구가 아니라 지식 유출 경로로 인식될 수 있다.

트러스팅 트러스트, 컴파일러 밖으로 번졌다

arXiv 논문은 GNU strip 하나로 NixOS 부트스트랩 전체에 백도어가 전파될 수 있음을 보였다. AI가 빌드와 배포를 자동화하는 시대에는 소스 코드 리뷰를 넘어 바이너리 도구 체인과 부트스트랩 seed까지 검증해야 한다.

2026-09-08원본