본문으로 건너뛰기
뉴스 목록으로

Claude Opus 5, 에이전트 원가 경쟁의 본격화

Claude Opus 5, 에이전트 원가 경쟁의 본격화

Opus 5의 핵심은 새 최고점보다 일상적 장기 작업의 단가다. 기업은 모델 이름보다 작업당 성공률, 토큰, 지연시간을 함께 평가해야 한다.

AI 뉴스를 놓치지 마세요

매주 핵심 AI 소식을 이메일로 받아보세요.

Opus 5가 말하는 새 경쟁축

Anthropic은 2026년 7월 24일 Claude Opus 5를 공개하며 Fable 5에 가까운 지능을 절반 가격에 제공한다고 설명했다. API 가격은 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 제시됐다. 같은 날 Claude 모델 문서는 Opus 5를 복잡한 에이전트 코딩과 기업 업무의 기본 선택지로 권한다.

중요한 것은 "가장 똑똑한 모델" 경쟁이 아니다. Anthropic은 Frontier-Bench, CursorBench, AutomationBench, OSWorld 같은 작업 중심 평가를 전면에 뒀다. 이는 모델 발표가 점점 채팅 품질이 아니라 장기 작업을 끝내는 비용표로 바뀌고 있다는 뜻이다. Claude Code 토큰세에서 봤듯, 에이전트의 진짜 비용은 구독료가 아니라 반복 호출, 도구 실행, 재시도, 검증 루프에서 나온다.

벤치마크보다 작업당 비용

Anthropic은 Opus 5가 Opus 4.8보다 같은 가격에서 성능이 좋아졌고, CursorBench 3.2 최대 effort에서는 Fable 5 최고점에 0.5% 안쪽으로 접근한다고 주장한다. 또한 ARC-AGI 3에서는 차순위 모델의 세 배 점수, Zapier AutomationBench에서는 같은 작업 비용 기준 약 1.5배 통과율을 제시했다. 다만 이런 수치는 하네스와 effort 설정의 영향을 크게 받는다.

Anthropic의 Claude 4 발표도 이미 SWE-bench와 Terminal-bench, 장기 에이전트 성능을 강조했다. 이번 Opus 5는 그 흐름의 가격 재배치에 가깝다. GPT-5.6 전환 평가 하네스가 지적했듯, 운영팀은 모델 교체를 발표문이 아니라 내부 평가셋과 실패 로그로 결정해야 한다.

평가 축발표가 강조한 점실무에서 볼 지표리스크
코딩장기 디버깅과 루트 원인 분석PR 성공률, 테스트 통과율, 리뷰 수정 횟수과도한 자율 변경
지식 업무워크북, 문서, 리서치 흐름재작업률, 근거 추적성, 시간 절감그럴듯한 결론
컴퓨터 사용OSWorld 등 도구 사용클릭 오류, 세션 복구, 권한 경계화면 자동화 사고
비용Fable 대비 낮은 작업 단가작업당 토큰, 지연시간, 실패 비용숨은 재시도 비용

안전 장치도 제품 기능이 됐다

Opus 5 발표에서 눈에 띄는 대목은 안전 정책의 세분화다. Anthropic은 Opus 5가 Mythos 5보다 생물학 연구와 공격적 사이버 역량에서 뒤처진다고 설명했고, 일부 사이버 요청은 Opus 4.8로 자동 fallback될 수 있다고 밝혔다. Anthropic 사용 정책Responsible Scaling Policy는 모델 능력이 커질수록 배포 판단이 제품 로드맵의 일부가 된다는 점을 보여준다.

이 흐름은 OpenAI와 Hugging Face 보안 평가 사고 이후 더 중요해졌다. 강한 모델을 내놓는 것만으로는 부족하다. 어떤 요청을 막고, 어떤 요청은 더 낮은 모델로 우회하며, 어떤 고객에게 제한 완화 버전을 제공하는지까지가 기업 계약의 핵심 조건이 된다.

한국 기업의 도입 순서

한국 기업은 Opus 5를 "최신이라 써보자"가 아니라 세 가지 업무 묶음으로 시험해야 한다. 첫째, 코드 리뷰와 리팩터링처럼 결과 검증이 가능한 작업이다. 둘째, 회계, 법무, 리서치처럼 근거 문서가 남는 작업이다. 셋째, 사내 툴을 조작하는 에이전트 업무다. 특히 세 번째는 권한, 로그, 취소 기능 없이는 바로 생산 적용하기 어렵다.

LM Studio Bionic처럼 로컬 에이전트 선택지도 커지고 있다. 따라서 클라우드 프런티어 모델은 가장 어려운 작업에 쓰고, 반복 업무는 더 싼 모델이나 오픈 모델로 돌리는 혼합 전략이 현실적이다. Opus 5의 메시지도 결국 "모든 일을 가장 비싼 모델에 맡기라"가 아니라 "장기 작업의 비용 대비 성공률을 다시 계산하라"에 가깝다.

자주 묻는 질문

Q1: Opus 5는 Fable 5를 대체하나요?

A: 완전한 대체라기보다 일상적 장기 작업용 선택지에 가깝다. 최고 성능이 필요한 일부 작업은 Fable 5나 Mythos 계열이 여전히 별도 위치를 갖는다.

Q2: 가격이 낮아졌다고 바로 비용이 줄까요?

A: 아니다. 실패 후 재시도, 도구 호출, 검증 루프까지 포함한 작업당 비용으로 봐야 한다.

Q3: 코딩 에이전트에는 어떤 평가가 필요하나요?

A: 내부 저장소 기준 테스트 통과율, 리뷰 수정 횟수, 보안 경고, 롤백 빈도를 함께 측정해야 한다.

Q4: 자동 fallback은 왜 중요한가요?

A: 거절이나 안전 분류가 곧 업무 중단으로 이어지지 않게 만들지만, 모델이 바뀐 사실을 로그로 남겨야 결과 해석이 가능하다.

Q5: 한국 스타트업에는 어떤 기회가 있나요?

A: 모델 자체보다 평가 하네스, 토큰 비용 관측, 사내 권한 제어, 감사 로그를 묶은 운영 도구가 더 현실적인 기회다.

관련 토픽 더 보기

#anthropic#claude#ai-agent#ai-coding#enterpriseClaude Opus 5에이전트 비용코딩 모델기업 AI

📰 원본 출처

anthropic.com

이 기사는 AI 기술을 활용하여 작성되었으며, 원본 뉴스 소스를 기반으로 분석 및 해설을 추가한 콘텐츠입니다. 정확한 정보 전달을 위해 노력하고 있으나, 원본 기사를 함께 확인하시기를 권장합니다.

공유

관련 기사