본문으로 건너뛰기
뉴스 목록으로

Codex 272K 축소, 긴 컨텍스트의 가격표

Codex 272K 축소, 긴 컨텍스트의 가격표

긴 컨텍스트는 무료로 누릴 수 있는 스펙이 아니다. 제품이 실제 사용량을 감당하려면 모델의 이론적 창 크기와 에이전트 제품의 운영 상한이 분리될 수밖에 없다.

AI 뉴스를 놓치지 마세요

매주 핵심 AI 소식을 이메일로 받아보세요.

372K에서 272K로 내려간 숫자

2026년 7월 18일 병합된 OpenAI Codex PR #33972는 표면상 "bundled model metadata" 백포트다. 그러나 diff에서 눈에 띄는 변화는 GPT-5.6 Sol 항목의 context_window와 max_context_window가 372000에서 272000으로 바뀐 부분이다. Hacker News와 커뮤니티에서는 이것을 Codex 제품의 장문맥 축소로 읽었다. OpenAI 커뮤니티 글도 Codex 안에서 사용자가 공개된 장문맥 tier를 그대로 쓰지 못한다는 불만을 담았다.

이 사건은 단순한 너프 논쟁보다 크다. 모델 발표 페이지의 최대 컨텍스트, API 가격표, Codex 같은 완제품의 실제 상한은 서로 다른 운영 계층이다. 제품은 매일 수많은 저장소를 스캔하고, 파일을 읽고, 로그와 diff를 붙이고, 대화 기록을 유지한다. 긴 컨텍스트가 가능하다는 사실과 그것을 모든 사용자의 기본값으로 제공할 수 있다는 사실은 다르다. Claude Code 토큰세에서 본 것처럼 에이전트 비용은 사용자가 직접 입력한 프롬프트보다 하네스가 자동으로 보내는 맥락에서 커진다.

긴 컨텍스트는 기능이 아니라 원가 구조

372K와 272K의 차이는 단순히 100K 토큰을 덜 읽는 문제가 아니다. 코딩 에이전트에서는 컨텍스트 창이 커질수록 저장소 탐색 전략이 느슨해지고, 자동 첨부가 많아지고, 압축 지점이 뒤로 밀린다. 좋은 경우에는 대형 리팩터링 성공률이 올라가지만, 나쁜 경우에는 사용자가 보지 못한 토큰 청구와 지연 시간이 커진다. 따라서 제품팀은 어느 시점에서 "최대 지능"과 "지속 가능한 기본값"을 나눠야 한다.

OpenAI의 GPT-5.6 발표는 더 적은 토큰으로 더 많은 성공 작업을 강조했다. AI 시대의 scorecard도 토큰당 가격보다 성공한 작업당 총비용을 봐야 한다고 설명한다. Codex의 컨텍스트 상한 조정은 그 메시지의 운영 버전이다. 긴 창을 열어두는 것이 항상 더 싼 결과를 만들지는 않는다.

선택지장점비용팀이 봐야 할 지표
큰 컨텍스트 기본값탐색 누락 감소토큰과 지연 증가성공 PR당 총비용
낮은 상한예측 가능한 비용복잡 작업 실패 가능성재시도율과 압축 품질
수동 확장고난도 작업에 집중 사용UX 복잡도사용자가 확장한 이유
검색 우선필요한 파일만 선택검색 품질 의존근거 파일 누락률

컨텍스트 엔지니어링의 귀환

한동안 장문맥 모델은 "전부 넣으면 된다"는 기대를 만들었다. 그러나 에이전트 업무가 늘수록 다시 정보 선택이 중요해지고 있다. 어떤 파일을 먼저 읽을지, 테스트 로그를 얼마나 오래 보존할지, 이전 대화 요약을 언제 압축할지, 외부 문서를 어느 시점에 붙일지 결정해야 한다. 에이전트 API 설계가 말한 명시적 계약도 같은 이유에서 중요하다. 모델이 알아서 문맥을 찾는다는 믿음은 비용과 보안 양쪽에서 위험하다.

한국 개발팀에는 두 가지 실무 과제가 생긴다. 첫째, 코딩 에이전트 비용을 사용자별 월 사용량이 아니라 작업 유형별로 봐야 한다. 둘째, 장문맥 의존도를 낮추는 저장소 지도, 테스트 실패 요약, 설계 결정 기록을 별도로 관리해야 한다. GPT-5.6 전환 평가 하네스처럼 모델을 바꾸기 전에 태스크별 성공 기준과 컨텍스트 예산을 정의해야 한다.

사용자는 무엇을 요구해야 하나

제품 공급자에게는 컨텍스트 상한을 숨기지 말라고 요구해야 한다. 모델 선택 화면에 최대 창, 자동 압축 기준, 파일 첨부 전략, 비용 경고, 수동 확장 옵션이 보여야 한다. 특히 엔터프라이즈에서는 관리자가 프로젝트별 상한과 예산을 설정할 수 있어야 한다. 컨텍스트는 이제 UX 옵션이 아니라 재무 통제 항목이다.

개발자 개인도 습관을 바꿔야 한다. 거대한 저장소 전체를 맡기기보다 실패 테스트, 관련 파일, 재현 절차, 기대 동작을 좁혀 주는 편이 비용과 품질 모두에서 유리하다. 긴 컨텍스트가 줄어든 사건은 불편하지만, 동시에 좋은 에이전트 사용법을 다시 생각하게 만든다.

자주 묻는 질문

Q1: GPT-5.6 자체의 최대 컨텍스트가 줄었다는 뜻인가요?

A: 공개 PR에서 확인되는 것은 Codex에 포함된 모델 메타데이터 상한 변경이다. API나 다른 제품의 정책과 동일하다고 단정해서는 안 된다.

Q2: 왜 100K 토큰 차이가 중요한가요?

A: 코딩 에이전트는 파일, 로그, diff, 대화 요약을 자동으로 붙인다. 100K 토큰은 대형 저장소 작업에서 성공률과 비용에 모두 영향을 준다.

Q3: 사용자가 할 수 있는 대응은 무엇인가요?

A: 관련 파일을 명확히 지정하고, 재현 절차와 실패 로그를 짧게 정리하며, 모델이 읽어야 할 범위를 작업마다 좁히는 것이 좋다.

Q4: 기업은 어떤 정책을 세워야 하나요?

A: 팀별 컨텍스트 예산, 태스크별 모델 라우팅, 자동 압축 로그, 성공 작업당 비용 지표를 운영해야 한다.

Q5: 긴 컨텍스트 모델의 가치는 줄어드나요?

A: 아니다. 다만 모든 작업의 기본값이 될 필요는 없다. 가치가 큰 복잡 작업에 선택적으로 써야 경제성이 맞는다.

관련 토픽 더 보기

#openai#gpt#ai-coding#developer-toolsOpenAI Codex긴 컨텍스트토큰 비용에이전트 운영

📰 원본 출처

github.com

이 기사는 AI 기술을 활용하여 작성되었으며, 원본 뉴스 소스를 기반으로 분석 및 해설을 추가한 콘텐츠입니다. 정확한 정보 전달을 위해 노력하고 있으나, 원본 기사를 함께 확인하시기를 권장합니다.

공유

관련 기사