GPT-6 Sol·Luna, 모델 경쟁은 업무당 비용으로
가격표가 절반이 되어도 업무 원가는 자동으로 절반이 되지 않는다. 모델 선택과 재시도·검수 비용을 함께 설계하는 팀이 효율 개선을 실제 이익으로 바꾼다.
AI 뉴스를 놓치지 마세요
매주 핵심 AI 소식을 이메일로 받아보세요.
무엇이 발표됐나: 최고 성능을 더 넓은 업무로
OpenAI가 9월 22일 GPT-6 Sol과 Luna를 공개했다. TechCrunch 보도에 따르면, 이달 앞서 등장한 Astra의 세대를 더 작고 효율적인 제품군으로 확장하는 발표다. Sol은 코딩 같은 복잡한 업무, Luna는 문서 요약·정보 추출처럼 목표가 분명하고 처리량이 많은 업무를 겨냥한다.
보도는 OpenAI가 두 모델의 API 가격을 이전 GPT-5.6 계열 대비 절반으로 낮췄으며, 캐싱과 추론 효율 개선을 이유로 들었다고 전한다. 이는 회사가 제시한 세대 간 비교이지 모든 고객의 월 청구액이 절반이 된다는 의미는 아니다. 구체적인 사용 조건은 공식 발표와 최신 가격표를 계약 시점에 확인해야 한다.
사실 정확성에 대해서도 구분이 필요하다. 보도에 인용된 OpenAI 설명은 이용자가 오류를 신고한 대화를 비식별화해 만든 내부 평가에서 Sol의 실수가 전작의 약 절반이었다는 것이다. 한국어 계약서, 사내 약어, 최신 법령까지 같은 개선 폭을 보인다는 독립 검증은 아니다. 이번 기사는 확인 가능한 보도에 근거하며 해당 성능을 직접 측정한 결과로 제시하지 않는다.
왜 중요한가: 하나의 모델보다 업무 분류가 중요해진다
모델을 선택할 때 가장 높은 점수만 보는 방식은 대량 자동화에서 비싸다. 입력이 잘 정리된 분류 작업과 의존성을 추적해야 하는 코드 수정은 난도가 다르다. 저렴한 모델이 충분한 작업에 고가 모델을 쓰면 낭비이고, 어려운 작업을 작은 모델에 고집하면 재시도와 사람 검수가 비용을 되돌려 놓는다.
제품군의 세분화는 모델 라우팅을 기업 시스템의 중요한 기능으로 만든다. 예를 들어 문서에서 날짜와 금액을 추출하는 단계는 작은 모델로 시작하고, 원문과 결과가 충돌하거나 필수 값이 누락되면 상위 모델 또는 사람에게 넘길 수 있다. 여기서 승격 조건은 모델의 자신감 표현보다 스키마 검사, 근거 문장 유무, 업무 규칙 충족 여부로 정의하는 편이 낫다.
| 업무 유형 | 이번 제품 구분에서의 출발점 | 별도로 검증할 항목 |
|---|---|---|
| 반복 문서 요약·필드 추출 | Luna 계열 검토 | 누락률, 원문 근거, 형식 준수 |
| 여러 파일을 고치는 코딩 | Sol 계열 검토 | 회귀 테스트, 재시도, 검토 시간 |
| 고난도 탐색·예외 처리 | 상위 모델 또는 사람으로 승격 | 성공률과 총 실행 예산 |
| 개인정보 포함 업무 | 모델 선택 전에 데이터 경계 설정 | 전송 범위, 보관 조건, 접근 권한 |
이 표는 발표 내용을 토대로 한 도입 설계안이지 제품의 모든 기능을 인증한 비교표가 아니다. 가벼운 LLM 라우팅 코어 분석에서 다룬 것처럼, 특정 공급자 이름보다 교체 가능한 호출 경계와 실패 처리 방식이 장기 운영에 중요하다.
경쟁 구도: 가격 인하와 토큰 절약은 다른 축이다
같은 날 Anthropic도 Opus 5.5를 발표하며 단가와 작업당 사용량을 함께 강조했다. 두 회사가 모두 효율을 내세운다는 점은 시장의 평가 단위가 벤치마크 최고점에서 완료된 업무의 경제성으로 확장되고 있음을 보여준다. 다만 공급자마다 평가 과제, 추론 강도, 도구 환경이 달라 발표 숫자를 같은 조건의 승부처럼 나열해서는 안 된다.
가상의 예를 들어 호출 단가가 50% 낮아져도 승인 가능한 결과를 얻는 데 필요한 호출이 두 배가 되면 모델 호출비 절감은 사라진다. 반대로 더 비싼 모델이 한 번에 통과하면 전체 비용이 낮아질 수도 있다. 따라서 입력·출력 토큰뿐 아니라 캐시 적중, 도구 실행, 검수 시간, 실패 후 복구를 합쳐야 한다. 이 예시는 비용 구조를 설명하기 위한 계산이며 실측 성능은 아니다.
코딩 업무에서는 모델 바깥의 대기시간도 크다. Linear의 CI 재설계 사례가 보여주는 병목을 함께 봐야 한다. 코드를 만드는 속도만 빨라지고 테스트 대기열이 그대로라면 개발자의 실제 완료 시간은 기대만큼 줄지 않는다.
한국 기업의 도입 기준: 한국어 성공 건당 비용을 재자
첫 단계는 최근 실제 요청을 비식별화한 평가 묶음을 만드는 것이다. 한국어 존댓말, 제품명, 표가 섞인 문서, 오래된 사내 규정과 최신 규정이 충돌하는 사례를 포함한다. 쉬운 문제만 넣으면 모델 간 차이를 작게 보게 되고, 어려운 문제만 넣으면 일상 업무의 경제성을 놓친다.
두 번째는 동일한 도구와 종료 조건에서 비교하는 것이다. 모델마다 다른 검색 결과나 다른 테스트를 제공하면 성능 차이와 환경 차이를 분리할 수 없다. 성공 건당 비용, 전체 처리시간의 상위 구간, 사람이 수정한 비율을 함께 기록하면 단가 절약이 실질적인지 판단할 수 있다. 표본 수와 측정 기간도 기록해야 한다.
세 번째는 성능과 행동 경계를 별도로 관리하는 것이다. 문서 요약이 좋아졌다고 외부 발송 권한까지 확대할 이유는 없다. 관리형 에이전트 API의 운영 경계를 참고해 읽기, 수정, 발송 권한을 분리하고 실패 시 이전 모델로 되돌릴 수 있어야 한다. 모델 교체는 의사결정 권한의 자동 확대가 아니다.
FAQ
GPT-6 Sol과 Luna는 같은 용도인가?
보도에 따르면 Sol은 복잡한 코딩 등, Luna는 목표가 명확한 대량 업무에 초점을 둔다. 실제 선택은 자체 평가 결과에 따라 달라진다.
가격이 절반이면 운영비도 절반인가?
그렇지 않다. 호출 횟수, 출력량, 캐시, 도구 사용, 검수와 복구 비용을 합산해야 한다.
오류가 절반이라는 수치는 독립 평가인가?
확인된 보도는 OpenAI의 내부 사실성 평가를 인용한다. 모든 언어와 업종에 그대로 적용할 수 없다.
바로 모든 고객에게 같은 방식으로 제공되나?
TechCrunch는 제품과 계정 유형에 따른 제공 범위 및 순차 적용을 전했다. 개별 계정에서의 사용 가능 여부는 별도 확인 대상이다.
한국 팀이 가장 먼저 할 일은 무엇인가?
한국어 실제 업무를 비식별화해 같은 조건으로 비교하고, 승인 가능한 결과 한 건의 비용을 측정하는 것이다.
📰 원본 출처
openai.com이 기사는 AI 기술을 활용하여 작성되었으며, 원본 뉴스 소스를 기반으로 분석 및 해설을 추가한 콘텐츠입니다. 정확한 정보 전달을 위해 노력하고 있으나, 원본 기사를 함께 확인하시기를 권장합니다.