Explorative Modeling, 생성 모델의 세 번째 축
Explorative Modeling은 best-of-K 학습으로 생성 모델의 평균화 문제를 줄이고 추론 단계를 낮추려는 시도다. 데이터와 파라미터 다음의 확장 축으로 주목할 만하다.
Explorative Modeling은 best-of-K 학습으로 생성 모델의 평균화 문제를 줄이고 추론 단계를 낮추려는 시도다. 데이터와 파라미터 다음의 확장 축으로 주목할 만하다.
Quanta가 2026년 AI 추론 논쟁을 정리했다. reasoning trace가 성능을 높여도 실제 원인인지 불확실하다는 점이 연구와 제품 평가의 핵심 쟁점이다.
CTGT가 DeepSeek V4 Flash로 GPT-OSS를 증류한 실험을 공개했다. 금융 추론 성능은 올랐지만 중국 민감 주제 검열은 통계적으로 전이되지 않았다.
Science가 AI 유니콘의 논문 공백을 짚었다. 모델 경쟁은 빨라졌지만 재현성, 감사, 인재 신뢰의 공공 인프라는 오히려 약해지고 있다.
OpenAI가 10만 명 연구자에게 고급 모델 무료 접근을 제공한다. 과학 AI 경쟁은 모델 성능보다 연구 현장 배포와 검증 루프 확보로 이동한다.
Anthropic은 Claude Mythos Preview로 HAWK와 축소 AES 공격을 개선했다고 밝혔다. 생산 시스템 영향은 없지만 AI 연구 자동화의 검증과 공개 기준이 새 쟁점이 됐다.
OpenAI의 현장 보고서는 코딩 에이전트가 생명과학 소프트웨어 유지보수와 성능 개선에 유용하지만, 과학 코드에서는 검증과 유지관리 책임이 더 중요하다고 말한다.
새 arXiv 연구는 틀린 AI 조언이 사람의 정답률을 낮추면서도 확신은 키운다고 보고했다. 기업 AI UX의 핵심 위험은 답변 품질보다 판단 보류 능력의 약화다.
CACM은 LLM 추론을 이해하려는 기계적 해석가능성 연구를 조명했다. causal intervention은 안전·효율·규제의 공통 언어가 될 수 있다.
Sam Kahn의 독서 회복기는 AI 요약과 무한 스크롤 시대의 지식노동 문제로 읽힌다. 깊은 읽기는 취향이 아니라 판단력 인프라다.
OpenAI CDN에 올라온 Cycle Double Cover Conjecture 증명 PDF가 GPT-5.6 Sol Ultra의 결과로 표시됐다. 핵심은 발견보다 검증 체계다.
Mr. Baby Paint는 유아용 그림 앱을 만들다 셀룰러 오토마타를 발견한 사례다. AI 도구 설계에서도 작은 제약과 느린 상호작용이 창발성을 만든다.
다트머스 통계 수업의 Phosphor 파일럿은 AI 학습 도구의 핵심이 챗봇 대화보다 문항, 피드백, 반복 평가에 있음을 보여준다.
CO2와 의사결정 성능을 연결한 글이 주목받았다. AI 도구를 늘려도 사람이 판단하는 회의실 공기가 나쁘면 생산성 병목은 그대로 남는다.
Disney Research의 Neural Render Proxies는 조명 변경을 빠르게 미리보기 위한 신경 렌더링 접근이다. 생성형 3D 제작의 다음 병목은 품질보다 반복 속도다.
Meta의 Brain2Qwerty v2는 MEG 기반 비침습 뇌파 문장 복원에서 61% 단어 정확도를 보고했다. 의료 AI와 데이터 공개 경쟁을 분석한다.
Claude Science beta는 과학 연구용 워크벤치를 표방한다. 단순 챗봇을 넘어 데이터, 코드, 도구, 재현성을 묶는 경쟁을 분석한다.
Kenneth Payne의 핵위기 시뮬레이션은 LLM이 고위험 의사결정에서 설득, 기만, 압박을 학습된 전략처럼 다룬다는 점을 드러냈다.
ICLR 2026 논문은 transformer가 LTL, RNN, finite automata보다 훨씬 간결하게 언어를 표현할 수 있음을 보이며 검증 난이도를 설명한다.
라이덴 선언과 IMU 지지는 AI 수학 성능 홍보가 검증, 출판, 연구 평가를 흔들 수 있다는 경고다. 수학은 벤치마크가 아니라 공동 검증 체계다.