Gemini Robotics 2, 로봇의 몸 전체를 겨냥하다
Gemini Robotics 2의 핵심은 휴머노이드 데모가 아니라 로봇 제어를 VLA, embodied reasoning, 온디바이스 모델로 쪼갠 구조다. 한국 제조 기업은 하드웨어보다 작업 정의, 안전 게이트, 현장 데이터 수집 체계를 먼저 준비해야 한다.
AI 뉴스를 놓치지 마세요
매주 핵심 AI 소식을 이메일로 받아보세요.
손끝에서 발끝까지 간 모델
Google DeepMind는 2026년 7월 30일 Gemini Robotics 2를 공개했다. 발표의 키워드는 전신 제어, 정교한 손 조작, 다중 로봇 협업이다. 이전 세대가 주로 상체와 탁상 작업을 보여줬다면, 이번에는 Apptronik Apollo 2 같은 휴머노이드가 걷고, 몸을 굽히고, 물건을 들어 선반에 놓는 장면을 전면에 세웠다.
DeepMind가 함께 설명한 Gemini Robotics 모델 페이지를 보면 구조가 더 명확하다. Gemini Robotics 2는 시각-언어-행동 모델로 운동 제어를 맡고, Gemini Robotics ER 2는 물리 공간을 이해하고 여러 단계 작업을 계획하는 embodied reasoning 모델이다. Gemini Robotics On-Device 2는 로봇 하드웨어에서 로컬 실행을 목표로 한다. 즉 하나의 거대한 로봇 두뇌가 아니라 계획, 행동, 현장 적응을 나눈 스택이다. 하드웨어 파트너로 언급된 Apptronik Apollo 같은 플랫폼은 이 소프트웨어 스택이 실제 몸체와 만나는 접점이다.
데모보다 중요한 숫자
발표 자료는 전신 조작과 손 조작의 성공률을 함께 보여준다. 예를 들어 Apollo 2와 Inspire hands 조합의 일반 전신 조작은 작업에 따라 45.7%에서 76.3% 수준으로 제시됐다. SharpaWave 5손가락 손의 다중 손가락 작업은 전구 풀기 92%처럼 높은 항목도 있지만, 쓰레기봉투 묶기 44%, 지퍼백 닫기 40%, 쓰레받기 32%처럼 아직 낮은 항목도 있다. DeepMind 스스로도 다중 손가락 조작은 여전히 어렵다고 설명한다.
이 숫자가 중요한 이유는 로봇 AI가 챗봇과 다르기 때문이다. 텍스트 모델은 실패하면 다시 생성하면 되지만, 로봇은 물건을 떨어뜨리고 사람과 충돌하며 장비를 망가뜨릴 수 있다. DARPA AI F-16, 자율전투의 실험장이 커졌다가 자율 시스템의 평가장을 다뤘다면, Gemini Robotics 2는 일상 공간에서 비슷한 평가 문제가 생긴다는 신호다.
| 구성요소 | 역할 | 공개된 강점 | 남은 병목 |
|---|---|---|---|
| Gemini Robotics 2 | VLA 기반 운동 제어 | 전신 휴머노이드와 양팔 로봇 제어 | 속도와 정밀도 |
| Gemini Robotics ER 2 | 공간 이해와 계획 | 수분 단위 다단계 작업, 협업 | 실패 판단과 재계획 |
| On-Device 2 | 로컬 실행 | 새 로봇 몸체에 몇 시간 데이터로 적응 | 현장 데이터 품질 |
| ASIMOV-Agentic | 안전 평가 | 불확실성, 위험 명령 거부 | 실제 산업 환경 검증 |
안전은 벤치마크에서 시작된다
DeepMind는 이번 발표에서 ASIMOV-Agentic도 소개했다. 이는 로봇을 제어하는 에이전트가 위험한 도구 호출을 거부하는지, 불확실할 때 사람 개입을 요청하는지, 가능한 작업과 불가능한 작업을 구분하는지 측정하는 벤치마크다. Gemini Robotics ER 2 모델 카드도 안전 지시 준수와 인간 안전 모니터링 평가를 강조한다.
이 지점은 AI 그림 대결, 에이전트 평가가 된 색연필 실험과 닮았다. AI 평가가 단순 정답률에서 도구 사용, 계획, 물리적 실행으로 이동하고 있다. 로봇에서는 특히 "할 수 없음"을 말하는 능력이 성능만큼 중요하다. 불확실한 집기, 젖은 바닥, 사람 접근, 도구 파손 가능성을 감지하지 못하면 높은 평균 성공률은 현장 신뢰로 이어지지 않는다.
한국 제조 현장의 의미
한국 기업이 바로 휴머노이드를 대량 도입할 가능성은 낮다. 그러나 제조, 물류, 조선, 반도체 클린룸 자동화에는 이번 흐름이 중요하다. 지금까지 로봇 도입은 작업별 전용 장비와 고정된 절차 중심이었다. Gemini Robotics 2가 약속하는 방향은 비정형 환경에서 언어 지시와 시각 이해로 작업을 재구성하는 것이다. 이는 하드웨어 구매보다 작업 정의와 안전 인증의 문제가 된다.
따라서 준비는 세 가지다. 첫째, 반복 작업을 언어로 명확히 기술해야 한다. 둘째, 현장 영상과 센서 데이터를 학습 가능한 형태로 정리해야 한다. 셋째, 사람과 설비가 있는 공간에서 로봇이 언제 멈춰야 하는지 규칙을 문서화해야 한다. 중국 오픈웨이트 전략, 미국 AI를 흔들다가 모델 비용 경쟁을 말한다면, 로봇 AI에서는 현장 데이터와 안전 승인 비용이 더 큰 진입 장벽이 된다.
자주 묻는 질문
Q1: Gemini Robotics 2는 바로 살 수 있는 제품인가요?
A: 공개 발표는 연구와 파트너십 중심이다. 일반 기업이 즉시 구매하는 범용 로봇 제품으로 보기는 이르다.
Q2: 전신 제어가 왜 중요한가요?
A: 실제 공간은 팔만 움직여 해결되지 않는다. 걷기, 굽히기, 균형 잡기, 물체 조작이 함께 필요하다.
Q3: 손 조작 성능은 인간 수준인가요?
A: 아니다. 일부 작업은 높은 성공률을 보였지만, 여러 손가락이 필요한 작업은 여전히 낮은 항목이 있다.
Q4: 온디바이스 모델의 장점은 무엇인가요?
A: 네트워크 의존도를 줄이고 지연시간과 개인정보 리스크를 낮출 수 있다. 다만 로봇 하드웨어별 검증이 필요하다.
Q5: 한국 기업의 첫 적용처는 어디인가요?
A: 완전 자율 휴머노이드보다 창고 정리, 검사 보조, 위험 구역 단순 조작처럼 사람 감독이 쉬운 작업이 현실적이다.
📰 원본 출처
deepmind.google이 기사는 AI 기술을 활용하여 작성되었으며, 원본 뉴스 소스를 기반으로 분석 및 해설을 추가한 콘텐츠입니다. 정확한 정보 전달을 위해 노력하고 있으나, 원본 기사를 함께 확인하시기를 권장합니다.