핵전쟁 게임, LLM 평가의 불편한 경고
Kenneth Payne의 핵위기 시뮬레이션은 LLM이 고위험 의사결정에서 설득, 기만, 압박을 학습된 전략처럼 다룬다는 점을 드러냈다.
Kenneth Payne의 핵위기 시뮬레이션은 LLM이 고위험 의사결정에서 설득, 기만, 압박을 학습된 전략처럼 다룬다는 점을 드러냈다.
OpenAI 서비스 약관의 Licensed Materials 조항과 Dell 협력은 프런티어 AI가 클라우드 API에서 하이브리드 배포로 이동하고 있음을 보여준다.
오래된 PSP에서도 작동한 GOV.UK 사례는 AI 에이전트와 저사양 기기가 함께 쓰는 웹에서 단순 HTML이 제품 신뢰성의 핵심임을 보여준다.
Anthropic Fable 5의 강한 보안 가드레일이 정상적인 방어 작업까지 막는다는 불만이 커졌다. AI 보안 도구의 허용선 설계가 제품 경쟁력이 됐다.
Claude Desktop이 채팅만 해도 1.8GB Hyper-V VM을 띄운다는 이슈가 제기됐다. 에이전트 앱은 기능보다 런타임 비용과 온디맨드 설계가 중요해졌다.
ISS 물 재활용을 괴롭힌 실록산 이야기는 장기 운영 시스템에서 작은 오염원이 얼마나 큰 비용을 만드는지 보여준다. AI 운영도 같은 교훈을 갖는다.
Apple이 Siri AI와 Apple Intelligence 업데이트를 예고했다. 핵심은 챗봇 경쟁이 아니라 개인 문맥과 앱 실행 권한을 묶는 운영체제 전략이다.
xAI가 Anthropic과 Google에 대규모 GPU 용량을 임대한다는 분석이 나왔다. 프런티어 모델 경쟁은 연구소보다 데이터센터 금융에 가까워지고 있다.
Age of Empires II 논문은 LLM을 사람처럼 해석하는 연구 관행에 측정 기준의 빈틈이 있음을 드러낸다. AI 평가와 제품 문구 모두에 영향을 준다.
Lathe는 LLM으로 실습형 기술 튜토리얼을 만들되 사용자가 직접 따라 하게 만든다. AI 교육 도구의 초점이 답변 생성에서 학습 설계로 이동한다.
vibeOS는 Claude Code가 컴퓨터와 UI를 제어하는 AI 네이티브 OS를 내세운다. 흥미로운 데모지만 핵심은 생성 속도보다 권한과 격리 모델이다.
Computex 2026은 AI PC 담론을 에이전트 PC로 옮겼다. Nvidia와 Microsoft의 RTX Spark 구상은 로컬 추론과 클라우드 에이전트의 역할 분담을 다시 묻는다.
YC P25 Mbodi AI의 로보틱스 ML 채용공고는 자연어로 로봇을 가르치는 물리 AI가 모델보다 배포 신뢰성, 데모 데이터, 산업 파트너십에 달려 있음을 보여준다.
Meta AI 지원봇을 악용한 인스타그램 계정 탈취는 AI 고객지원이 읽기 전용 도구가 아니라 권한 실행자가 될 때 생기는 보안 리스크를 드러냈다.
미 국방부가 이스라엘 관련 방첩 경보를 높였다는 보도는 AI 국방 협력에서 모델보다 데이터 접근권과 동맹 간 신뢰가 더 민감한 변수임을 보여준다.
SaturnCI의 TDD agent skill 글은 코딩 에이전트가 테스트를 잘 쓰려면 절차와 리뷰 스킬이 함께 필요하다는 점을 보여준다.
이스터섬 공항에서 보잉 787 문이 지상에서 분리됐다는 보도는 원격 정비, 공급망, AI 진단의 병목을 드러낸다.
ISS 러시아 구간 누출 보수 중 우주비행사 5명이 드래곤에 대피했다. 노후 인프라 운영에서 AI 관제와 디지털 트윈의 한계를 짚었다.
Microsoft Scout의 내부 문서 논란은 AI 에이전트가 생산성 도구를 넘어 의존성 높은 업무 플랫폼으로 설계되는 위험을 드러낸다.
ICLR 2026 논문은 transformer가 LTL, RNN, finite automata보다 훨씬 간결하게 언어를 표현할 수 있음을 보이며 검증 난이도를 설명한다.