본문으로 건너뛰기
뉴스 목록으로

Gemini 4 Argon, 긴 추론보다 중요한 접근권과 검증

Gemini 4 Argon, 긴 추론보다 중요한 접근권과 검증

출력 한도가 커질수록 추론 능력뿐 아니라 작업 예산과 중단 조건이 중요해진다. 공개된 성능 수치와 실제 서비스 접근 가능성은 별도로 판단해야 한다.

AI 뉴스를 놓치지 마세요

매주 핵심 AI 소식을 이메일로 받아보세요.

구글이 9월 30일 발표한 Gemini 4 Argon의 핵심은 긴 작업을 끝까지 수행하는 능력이다. 다만 발표를 곧바로 일반 이용자 대상 출시로 읽어서는 안 된다. 공식 발표에 따르면 현재 제공 대상은 Fairwind 프로그램의 신뢰된 사이버 방어자이며, 개발자·기업·소비자 대상 접근은 단계적으로 확대할 계획이다.

한국 기업에 중요한 질문도 “당장 기존 모델을 바꿀까”보다 “긴 실행을 허용할 준비가 됐는가”에 가깝다. 아래 성능과 내부 적용 사례는 구글이 발표한 결과이며, Agenthub가 독립적으로 재현한 수치는 아니다.

무엇이 달라졌나: 100만은 출력 한도다

구글은 출력 토큰 한도를 기존 6만 4천에서 100만으로 확대했다고 설명한다. 이는 입력 문맥 길이에 대한 발표와 구분해야 한다. 긴 답을 작성하는 기능만이 아니라, 복잡한 문제에서 한 경로를 오래 탐색할 여유를 준다는 것이 회사의 설명이다. 실제로 유용한 결과가 나오는지는 과제와 실행 환경에 따라 달라진다.

발표에는 DeepSWE v1.1 77.9%, 업무 자동화 평가 AutomationBench 51.3%, 긴 영상 이해 평가 LVBench 91.7%가 포함됐다. 서로 다른 시험의 점수를 평균 내거나, 이를 모든 기업 업무의 성공률로 해석하는 것은 적절하지 않다. 특히 AutomationBench 점수는 높은 순위와 별개로 검토와 실패 처리가 여전히 중요함을 보여준다.

내부 사례로는 데이터센터 메모리 최적화 적용 후 300TiB 이상 확보, 추가 절감 잠재치 500TiB~1PiB, Fuchsia Zircon 커널의 80만 줄 이상 규모 Rust 전환 작업을 제시했다. 여기서 적용 완료 수치와 추정 잠재치, 진행 중인 마이그레이션을 구별해야 한다. 구글 역시 중요한 코드의 전환에는 자동·수동 감사와 에뮬레이션 테스트가 필요하다고 밝혔다.

가격표보다 먼저 정할 작업 예산

발표된 도입 가격은 100만 토큰당 입력 2달러, 출력 10달러다. 캐시 입력은 입력 가격 대비 95% 할인이다. 각주에는 도입 기간 이후 입력 4달러, 출력 20달러가 적용된다고 적혀 있다. 도입 기간의 종료일은 이 발표만으로 확정할 수 없다.

비교 항목공식 발표 내용도입팀이 확인할 사항
현재 접근신뢰된 보안 방어자부터 제공자사 계정의 실제 접근권
출력 한도최대 100만 토큰작업별 상한과 중단 조건
도입 가격입력 2달러·출력 10달러/100만 토큰할인 종료와 별도 비용
도입 기간 이후입력 4달러·출력 20달러/100만 토큰장기 예산의 기준 단가
캐시 입력입력 단가 대비 95% 할인적중률과 적용 조건

단순 계산으로 청구 대상 출력이 100만 토큰이면 도입 가격에서 출력 비용만 10달러다. 이는 최대 한도를 모두 사용하는 경우의 산술 예시이지 평균 작업 비용이 아니다. 입력, 재시도, 외부 도구 실행, 저장 및 사람의 검토는 별개다. 장기 작업에서는 저렴한 호출을 여러 번 반복하는 방식과 비싼 한 경로를 오래 실행하는 방식을 실제 성공한 업무 단위로 비교해야 한다.

Sonnet 5.5의 작업당 비용 분석과 GPT-6 Sol·Luna의 라우팅 분석이 다룬 문제도 같은 맥락이다. 서로 다른 발표의 점수를 직접 대조하기보다 동일한 사내 과제로 품질과 총비용을 측정하는 편이 낫다. 실제 적용 전에는 Gemini 가격 문서를 다시 확인해야 한다.

방어용 역량과 운영 권한은 별개다

구글은 Argon이 취약점을 찾아 검증하고 패치하는 작업을 수행한다고 설명한다. 신뢰된 방어자와 내부 팀에는 사이버 가드레일을 제한하지 않은 형태를 제공한다는 내용도 있다. 이것은 일반 이용자에게 동일한 접근을 허용한다는 뜻이 아니며, 기업의 승인·감사 체계가 필요 없어진다는 뜻도 아니다.

회사 측은 오용 방지, 간접 프롬프트 주입 방어, 의도에서 벗어난 행동 감시, 샌드박스 강화라는 네 영역을 제시했다. Frontier Safety Framework 소개는 이런 단계적 제공의 정책적 배경을 이해하는 참고 자료다. 모델 내부의 감시 성능과 실제 인프라가 실행을 중단하는 능력은 분리해 평가해야 한다.

예컨대 취약점 패치를 생성하는 권한과 운영 서버에 적용하는 권한을 같은 자격증명으로 묶을 필요는 없다. 모델이 어떤 결론에 도달했는지 남기는 것뿐 아니라 누가 어떤 시스템을 변경했는지 추적할 수 있어야 한다. 이 문제는 OpenAI DNS 사고의 탐지·중단 간극에서 살펴본 운영 통제와 연결된다.

한국 기업의 도입 순서

우선 코드 마이그레이션, 계약 검토, 보안 패치처럼 검증 가능한 산출물이 있는 업무를 분리하는 것이 좋다. 하나의 거대한 업무를 통째로 위임하기보다 중간 결과를 저장하고 다음 단계로 넘어갈 조건을 정해야 한다. 한국어 계약서나 국내 규정 검토는 미국 중심의 평가 성과만으로 대체할 수 없다.

다음으로 모델의 실행 시간을 늘렸을 때 실제 성공률이 얼마나 개선되는지 측정해야 한다. 일정한 토큰 예산을 넘은 뒤 개선이 거의 없다면 사람에게 넘기는 것이 합리적이다. 마지막으로 접근권이 열리기 전에 평가 데이터와 기존 모델의 기준 성능을 준비해 두면, 출시 후 홍보 수치에 의존하지 않고 비교할 수 있다.

Gemini 공식 모델 안내와 제품별 문서는 공개 범위 확인의 출발점이다. 이번 발표의 경쟁적 의미는 단순한 출력 길이 경쟁보다는, 긴 작업을 수행하는 모델과 그 작업을 통제하는 운영 체계가 함께 제품화된다는 데 있다.

자주 묻는 질문

지금 모든 개발자가 사용할 수 있나?

아니다. 발표 시점에는 Fairwind의 신뢰된 보안 방어자부터 제공한다. 일반 개발자에게 실제로 열린 시점과 계정별 접근권은 별도 확인이 필요하다.

100만 토큰은 입력 문맥 크기인가?

이번 발표에서 확대 대상으로 명시한 것은 출력 토큰 한도다. 입력 한도와 혼동하지 않아야 한다.

가격이 계속 입력 2달러·출력 10달러인가?

도입 가격이다. 공식 각주는 이후 입력 4달러·출력 20달러를 명시하며, 모두 100만 토큰 기준이다.

벤치마크 1위면 사람 검토를 없애도 되나?

그렇지 않다. 평가 범위와 실제 업무는 다르며, 구글의 내부 코드 전환 사례에도 감사와 테스트가 포함된다.

국내 팀이 지금 준비할 일은 무엇인가?

한국어·사내 환경의 평가 과제, 작업별 예산, 중단 조건, 변경 권한을 준비하는 것이다. 전면 공개 일정을 추정해 운영 의존성을 먼저 만들 필요는 없다.

관련 토픽 더 보기

#llm#regulation추론 비용단계적 출시에이전트 검증

📰 원본 출처

blog.google

이 기사는 AI 기술을 활용하여 작성되었으며, 원본 뉴스 소스를 기반으로 분석 및 해설을 추가한 콘텐츠입니다. 정확한 정보 전달을 위해 노력하고 있으나, 원본 기사를 함께 확인하시기를 권장합니다.

공유

관련 기사