OpenRouter 배틀로얄, 에이전트 평가의 빈틈
OpenRouter의 2D 배틀로얄 실험은 Grok 4.1 Fast가 30게임 중 13승을 거뒀고 Claude Sonnet 4.6은 협력 성향을 드러냈다. 벤치마크가 놓치는 업무 적합성 신호다.
에이전트 모델은 지식 점수보다 목표 함수와 비용 함수에 더 민감하다. 같은 모델도 협력, 생존, 공격, 비용 중 무엇을 보상하느냐에 따라 완전히 다른 제품 선택이 된다.
grok 관련 AI 뉴스와 분석 기사를 모아놓은 토픽 페이지입니다.
OpenRouter의 2D 배틀로얄 실험은 Grok 4.1 Fast가 30게임 중 13승을 거뒀고 Claude Sonnet 4.6은 협력 성향을 드러냈다. 벤치마크가 놓치는 업무 적합성 신호다.
에이전트 모델은 지식 점수보다 목표 함수와 비용 함수에 더 민감하다. 같은 모델도 협력, 생존, 공격, 비용 중 무엇을 보상하느냐에 따라 완전히 다른 제품 선택이 된다.
프랑스 당국이 일론 머스크의 소셜미디어 플랫폼 X(구 트위터) 파리 사무실을 압수수색했으며, 영국 데이터보호청도 X의 AI 챗봇 Grok에 대한 새로운 조사에 착수했다. 이는 EU 디지털서비스법 위반 의혹과 개인정보 무단 수집 문제가 동시에 불거지면서 X가 유럽에서 강화된...