AI 조언은 정답보다 확신을 먼저 키운다
새 arXiv 연구는 틀린 AI 조언이 사람의 정답률을 낮추면서도 확신은 키운다고 보고했다. 기업 AI UX의 핵심 위험은 답변 품질보다 판단 보류 능력의 약화다.
새 arXiv 연구는 틀린 AI 조언이 사람의 정답률을 낮추면서도 확신은 키운다고 보고했다. 기업 AI UX의 핵심 위험은 답변 품질보다 판단 보류 능력의 약화다.
Claude Code가 Rust로 옮긴 Bun 런타임을 이미 쓰고 있다는 확인은 코딩 에이전트 경쟁이 모델뿐 아니라 배포 런타임과 안정성으로 확장됐음을 보여준다.
OpenAI Codex의 모델 메타데이터 PR은 GPT-5.6 Sol 컨텍스트 상한을 372K에서 272K로 낮췄다. 긴 컨텍스트는 성능 기능이 아니라 제품 원가 정책이다.
Moonshot AI의 Kimi K3는 2.8T 파라미터와 1M 컨텍스트를 앞세운 오픈 3T급 모델이다. 중국 오픈 모델 경쟁은 가격이 아니라 배포와 검증의 싸움으로 이동한다.
OpenAI의 AI scorecard는 토큰 가격이나 좌석 수 대신 유용한 작업, 성공 작업당 비용, 신뢰성, 규모의 가치를 보라고 제안한다. AI 예산 심사의 기준이 바뀌고 있다.
AI 만능론에 대한 현장 비판은 기술 회의론보다 조직이 실패를 측정하지 않는 문제를 겨냥한다. ROI 검증이 경쟁력이다.
예비 맥을 Claude Code 전용 머신으로 쓰는 가이드는 에이전트 자동화의 핵심이 성능보다 격리와 권한 설계임을 보여준다.
NP-hard 최적화 벤치마크에서 Fable 5와 GPT-5.6 Sol을 비교한 실험은 목표 모드가 만능 스위치가 아님을 보여준다.
GPT-5.6이 볼록최적화의 30년 난제를 좁혔다는 주장은 AI 수학의 본질이 답 생성보다 검증 체계에 있음을 보여준다.
Stack Overflow 질문 감소 그래프는 AI가 개발자 지식 시장을 대체한 것이 아니라 공개 Q&A의 역할을 재편하고 있음을 보여준다.