Claude Science, 연구실 워크벤치 전쟁의 시작
Claude Science beta는 과학 연구용 워크벤치를 표방한다. 단순 챗봇을 넘어 데이터, 코드, 도구, 재현성을 묶는 경쟁을 분석한다.
2026-07-01원본
Claude Science beta는 과학 연구용 워크벤치를 표방한다. 단순 챗봇을 넘어 데이터, 코드, 도구, 재현성을 묶는 경쟁을 분석한다.
Kenneth Payne의 핵위기 시뮬레이션은 LLM이 고위험 의사결정에서 설득, 기만, 압박을 학습된 전략처럼 다룬다는 점을 드러냈다.
ICLR 2026 논문은 transformer가 LTL, RNN, finite automata보다 훨씬 간결하게 언어를 표현할 수 있음을 보이며 검증 난이도를 설명한다.
라이덴 선언과 IMU 지지는 AI 수학 성능 홍보가 검증, 출판, 연구 평가를 흔들 수 있다는 경고다. 수학은 벤치마크가 아니라 공동 검증 체계다.
새 arXiv 논문은 도메인 어휘를 흉내 낸 인젝션이 탐지율을 크게 떨어뜨린다고 보고했다. 에이전트 보안은 키워드 차단을 넘어 문맥 검증이 필요하다.
OpenAI 모델이 1946년 이후 남아 있던 평면 단위거리 추측 반례를 찾았다고 밝혔다. AI 연구 보조가 검증 가능한 발견 단계로 이동했다.
PopuLoRA는 여러 LoRA 어댑터가 교사와 학생으로 공진화하는 자기대전 학습을 제안한다. 단일 모델 자기개선의 쉬운 문제 편향을 겨냥했다.
수학자 티모시 가워스는 ChatGPT 5.5 Pro가 약 한 시간 만에 박사급 연구 결과를 냈다고 평가했다. 연구 자동화의 기준선이 바뀌고 있다.