본문으로 건너뛰기

Evaluation

2개 기사최근 업데이트: 2026-09-10

evaluation 관련 AI 뉴스와 분석 기사를 모아놓은 토픽 페이지입니다.

GPT-6 Astra 논쟁, 숨은 추론은 성능인가 리스크인가

Sebastian Raschka가 GPT-6 Astra, looped transformers, hidden reasoning을 분석했다. 반복 깊이는 성능을 올리지만 비용, 벤치마크, 감사 가능성의 기준을 흔든다.

반복 깊이와 숨은 추론은 모델이 더 적은 외부 토큰으로 더 많은 계산을 하는 방향이다. 이는 사용자 경험을 좋게 만들 수 있지만, 운영자는 내부 계산량과 실패 경로를 더 보기 어렵게 된다.

Qwen 3.8, 추론 프리필이 드러낸 증류의 그림자

GPT-5.5 Pro 추론 1%를 넣자 Qwen3.8 A95B의 답변 겹침이 16.79%에서 34.97%로 뛰었다. 오픈 모델 경쟁은 성능보다 출처와 검증의 싸움이 되고 있다.

추론 프리필 실험은 성능 점수보다 모델 계보와 데이터 출처를 묻는 실험이다. 오픈 모델이 빨라질수록 기업은 성능표와 함께 재현 가능한 provenance 검증을 요구하게 된다.