원문: Advancing the price-performance frontier with GPT-5.6 — OpenAI 번역일: 2026-07-30
어제 우리는 GPT-5.6이 스스로를 더 효율적으로 돌아가게 만든 과정을 공유했다. 오늘은 그 이득을 고객에게 넘긴다. API에서 GPT-5.6 루나(Luna)와 테라(Terra)는 더 저렴한 가격으로, GPT-5.6 솔(Sol)은 더 빠른 성능으로 제공한다. 이 업데이트들은 함께, 고객이 AI에 투자하는 매 1달러에서 더 많은 것을 얻고, 시간이 중요할 때 더 빠르게 움직일 수 있게 해준다.
오늘부터 우리의 가장 빠르고 저렴한 모델인 GPT-5.6 루나는 가격이 80% 낮아지고, 일상 업무를 위한 균형 잡힌 모델인 GPT-5.6 테라는 20% 낮아진다. 루나와 테라의 이 낮아진 가격은 Codex와 ChatGPT Work를 유료 구독으로 이용할 때 사용량이 차감되는 방식에도 반영된다. 루나는 기업이 매우 높은 품질 수준으로 대용량 업무를 처리할 수 있는 훨씬 더 비용 효율적인 방법을 제공한다. 도구를 사용하고 여러 단계로 이뤄진 워크플로를 완수할 수 있어, 더 폭넓은 범위의 AI 애플리케이션을 대규모로 운영하는 것이 실용적이게 된다.
첨단 지능을 더 풍부하고 저렴하게 만드는 것은 AGI가 인류 전체에 혜택을 주도록 하겠다는 OpenAI의 미션에서 핵심이다. 이번 변화는 그 약속을 실천에 옮긴 것이다. 이는 우리 모델이 만들어지고, 서빙되고, 활용되는 방식에서 수년간 이어진 개선을 반영한다.
우리는 또한 API에 패스트 모드(Fast mode)를 도입한다. 기존의 우선 처리(Priority Processing) 옵션을 대체하는 것이다. GPT-5.6 솔의 경우, 패스트 모드는 이제 표준(Standard) 처리 대비 최대 2.5배 빠른 속도를 지능 저하 없이 2배 가격에 제공한다. 패스트 모드는 하위 호환된다. 우선순위(priority)로 태그된 요청은 자동으로 패스트 모드를 쓴다.
결과물에 맞는 지능 선택하기
AI를 효율적으로 쓰는 것은 결과물에서 시작한다. 위험 부담, 오류 비용, 긴급성, 규모가 지능·속도·신뢰성·비용의 적절한 균형을 결정한다. 그 균형은 워크플로의 한 단계에서 다음 단계로 넘어갈 때 달라질 수 있다.
GPT-5.6은 기업들이 그 방정식을 최적화할 수 있는 훨씬 넓은 여지를 준다. 루나는 1년 전에는 프론티어급이었던 모델들과 견줄 만한 성능을, 작업당 대략 6센트라는 가격에, 거의 9배에 달하는 속도로 제공한다. Agents' Last Exam으로 측정한 전문 업무에서, 루나는 작업당 예상 비용이 거의 99% 더 낮으면서도 Fable 5를 능가한다.
실무에서 기업들은 필요한 결과물과 품질 기준을 정의한 다음, 평가(evaluation)를 활용해 어디에 추가적인 지능이 실질적으로 결과를 개선하는지, 어디에 더 빠르고 저렴한 처리로도 같은 품질을 낼 수 있는지 판단할 수 있다. 예를 들어 코딩 워크플로라면 불확실성을 해소하고 계획을 세우는 데는 솔을 쓰고, 명확하게 명시된 변경사항을 구현하고 테스트를 작성·실행하고 결과를 평가하는 데는 루나를 쓸 수 있다. 다른 워크플로는 다른 균형을 필요로 할 수도 있다.
GPT-5.6 패밀리는 그런 선택지의 범위를 넓혀준다. 기업들은 각 단계마다 최대한 유용한 지능을 적용하면서, 그것이 만들어내는 가치에 맞는 적절한 가격을 지불할 수 있다.
이런 유연성을 제공하려면 모델 뒤의 모든 레이어를 더 효율적으로 만드는 데서 시작해야 한다.
우리가 효율성 프론티어를 밀어붙이는 방법
우리의 효율성 우위는 모델 자체, 그것을 실행하는 추론 시스템, 그리고 도구와 맥락에 모델을 연결하는 에이전틱 하네스(agentic harness)를 개선하는 데서 나온다. GPT-5.6 모델들은 작업을 처리하는 더 직접적인 경로를 택한다. 더 나은 라우팅이 하드웨어를 생산적으로 유지하고, 최적화된 프로덕션 소프트웨어가 토큰을 더 효율적으로 생성하며, 더 똑똑한 맥락 관리가 에이전트가 이미 끝낸 작업을 반복하지 않도록 돕는다. 이런 개선들이 합쳐져, 같은 연산 자원으로 더 유용한 작업을 완수할 수 있게 해주며, 각 결과물에 필요한 시간·토큰·비용을 줄여준다.
GPT-5.6 솔은 다음 라운드의 개선을 찾고 실현하는 데도 점점 더 많은 도움을 주고 있다. 사람이 주도하는 프로세스 안에서, 솔은 프로덕션 커널을 자율적으로 재작성·최적화했고, 토큰 생성을 개선하기 위한 수백 건의 실험을 설계·실행했으며, 훈련 과정을 모니터링해 문제가 발생하면 개입했다. 이 커널 작업은 모델을 서빙하는 전체 비용을 20% 줄이는 데 기여했고, 그 실험들은 토큰 생성 효율을 15% 넘게 높였다. 이 작업은 계속되고 있으며, 더 촘촘한 피드백 루프를 만들어낸다. 우리 모델이 개선되고 더 자율적으로 작업할 수 있게 될수록, 효율을 개선하는 우리의 능력도 가속화된다. GPT-5.6 뒤의 엔지니어링에 대해 더 읽어보라.
규모에 맞춰 설계된 컴퓨팅 전략
풍부한 지능에 대한 수요를 충족하려면 더 많은 컴퓨팅과 더 생산적인 컴퓨팅이 모두 필요하다. 우리는 회복력 있는 인프라 포트폴리오를 구축하고, 각 워크로드를 그것을 실행하기에 가장 적합한 시스템과 짝짓고 있다. 이 접근법은 가격-성능 곡선의 양쪽 끝을 모두 뒷받침한다. 저비용 쪽 끝에서는 새로운 루나와 테라 가격이 훨씬 더 큰 규모에서 대용량 작업을 경제적으로 만들어준다. 프론티어 쪽 끝에서는 패스트 모드가 응답 시간이 중요할 때 API 고객에게 솔에 대한 더 빠른 접근을 제공한다.
기업들은 가장 중대한 작업의 속도를 희생하지 않으면서도 더 많은 AI를 일상 업무에 도입할 수 있다. 대규모 문서 분석, 고객 상호작용 분류, 일상적인 구현 작업은 폭넓게 경제적으로 운영될 수 있게 되는 한편, 복잡한 솔 워크로드는 프리미엄이 정당화될 때 더 빠르게 움직일 수 있다.
이 이득들은 복리로 쌓일 수 있다. 사람이 주도하는 프로세스 안에서, 더 유능한 모델은 우리 기술팀이 다음 세대의 개선을 찾도록 도와, 더 나은 성능과 더 낮은 비용으로 가는 경로를 단축시킨다. 우리의 전략은 계속해서 역량과 효율성 둘 다를 발전시키는 데 초점을 맞추고 있으며, 그래야 각 세대의 지능이 더 낮은 비용으로 더 많은 작업을 해낼 수 있다.
이용 가능 시기와 가격
GPT-5.6 테라와 루나는 ChatGPT Work, Codex, OpenAI API에서 계속 이용할 수 있다. ChatGPT Work와 Codex에서 무료(Free)와 Go 사용자는 테라를 이용할 수 있고, Plus·Pro·Business·Enterprise 사용자는 테라와 루나를 선택할 수 있다.
7월 30일부터 API 가격은 테라의 경우 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 12달러이며, 루나는 입력 토큰 100만 개당 0.20달러, 출력 토큰 100만 개당 1.20달러다. 솔의 가격은 변동이 없다. ChatGPT와 Codex 구독 가격 및 쿼터 예산은 변동이 없으며, 테라와 루나 사용량은 이제 더 적은 크레딧을 소모한다. 가격 변경은 오늘 늦게 AWS에서부터 순차 적용되기 시작한다.
GPT-5.6 솔을 위한 패스트 모드는 API에서 우선 처리(Priority Processing)를 대체하며, Codex의 /fast와 동일하게 동작한다. 기존에 priority로 태그된 API 요청은 계속 작동한다. 전체 API 가격 상세 보기.
핵심 요약 (12줄)
- OpenAI가 GPT-5.6 루나(Luna)는 가격을 80% 낮추고, 테라(Terra)는 20% 낮추며, 솔(Sol)은 API에서 더 빠른 '패스트 모드'를 제공한다고 발표한다.
- 이번 가격 인하는 어제 공개한 GPT-5.6 자체 효율화 작업(서빙 비용 20% 절감, 토큰 생성 효율 15%+ 개선)의 성과를 고객에게 넘기는 것이라고 설명한다.
- 루나는 1년 전 프론티어급 모델과 견줄 성능을 작업당 약 6센트, 약 9배 빠른 속도로 제공하며, 전문 업무 벤치마크(Agents' Last Exam)에서 Fable 5보다 비용은 99% 낮으면서도 더 우수하다고 밝힌다.
- 기업은 결과물과 품질 기준을 먼저 정의한 뒤 평가(eval)로 어디에 고급 지능이 필요하고 어디에 저비용 처리로 충분한지 판단할 수 있다고 조언한다.
- 예시로 코딩 워크플로에서는 계획 수립엔 솔을, 명확한 변경 구현·테스트엔 루나를 쓰는 식으로 단계별로 다른 모델을 조합할 수 있다고 설명한다.
- 패스트 모드는 기존 '우선 처리'를 대체해 표준 처리 대비 최대 2.5배 빠른 속도를 지능 저하 없이 2배 가격에 제공하며 하위 호환된다.
- 효율성 향상은 모델 자체, 추론 시스템, 에이전틱 하네스 세 레이어 모두를 개선한 결과이며, 더 나은 라우팅과 맥락 관리로 작업 반복을 줄인다고 설명한다.
- GPT-5.6 솔이 사람 주도 프로세스 안에서 프로덕션 커널을 자율적으로 재작성·최적화하고 수백 건의 실험을 설계·실행해 다음 세대 개선을 스스로 찾는 데 기여하고 있다고 밝힌다.
- 저비용 끝(루나·테라)과 프론티어 끝(패스트 모드)을 함께 최적화하는 컴퓨팅 전략으로, 대용량 반복 작업은 경제적으로 대규모 운영이 가능해지고 복잡한 작업은 필요할 때 더 빠르게 처리할 수 있다고 설명한다.
- 7월 30일부터 API 가격은 테라 기준 입력 100만 토큰당 2달러·출력 12달러, 루나는 입력 0.20달러·출력 1.20달러이며 솔 가격은 변동 없다고 공지한다.
- ChatGPT/Codex 구독료와 쿼터는 그대로지만 테라·루나 사용은 더 적은 크레딧을 소모하도록 반영된다고 밝힌다.
- 첨단 지능을 더 저렴하고 풍부하게 만드는 것이 AGI가 인류 전체에 혜택을 주도록 한다는 OpenAI의 미션을 실천하는 것이라고 결론짓는다.