OpenAI, GPT-6 Sol·Luna 출시…API 가격 절반으로 낮추고 오류는 절반으로

OpenAI, GPT-6 Sol·Luna 출시…API 가격 절반으로 낮추고 오류는 절반으로

OpenAI가 GPT-6 세대의 라인업을 완성했습니다. 9월 초 플래그십 모델 GPT-6 Astra를 선보인 지 19일 만인 9월 22일(현지시간), 그보다 가볍고 저렴한 GPT-6 SolGPT-6 Luna를 공개한 것입니다. 이번 발표의 핵심 메시지는 명확합니다. 최상위 모델의 지능을 더 효율적이고 접근하기 쉬운 형태로 확산시키겠다는 것입니다.

가장 눈에 띄는 것은 가격입니다. OpenAI는 두 모델의 API 가격을 이전 세대인 GPT-5.6 Sol·Luna 대비 절반 수준으로 책정했습니다. 동시에 사실 오류는 절반 가까이 줄였다고 밝혔습니다. 기업들이 AI 모델을 ‘벤치마크 점수’가 아닌 ‘작업당 비용’으로 비교하기 시작한 시장 환경을 정조준한 발표입니다.

GPT-6 패밀리의 3단 구조: Astra, Sol, Luna

이번 출시로 GPT-6 세대는 세 가지 등급으로 정리됐습니다.

  • GPT-6 Astra: 9월 3일 출시된 최상위 플래그십. 가장 어려운 엔드투엔드 작업을 위한 모델
  • GPT-6 Sol: 코딩 등 복잡한 작업과 전문 업무를 위한 중형 모델
  • GPT-6 Luna: 문서 요약, 정보 추출, 간단한 질의응답 등 목표가 명확한 대량 작업을 위한 경량 모델

Sol과 Luna라는 이름 자체는 올해 7월 GPT-5.6 세대에서 처음 도입된 것으로, OpenAI의 모델 계층 내에서 각기 다른 등급을 나타냅니다. 이번에 GPT-6 세대로 업그레이드된 것입니다. 흥미로운 점은 GPT-5.6에 있던 중간 등급 **’Terra’**의 GPT-6 버전은 나오지 않았다는 것입니다. 대신 Sol이 과거 Terra의 가격대로 내려오며 그 자리를 흡수한 모양새입니다.

OpenAI는 두 모델이 Astra와 유사한 방법으로 학습됐다고 밝혔습니다. 다만 아키텍처나 파라미터 수 등 구체적인 기술 사양은 공개하지 않았습니다. 두 모델 모두 약 105만 토큰의 컨텍스트 윈도를 지원합니다.

가격: 절반, 그리고 그 이상

API 가격은 다음과 같습니다(100만 토큰 기준).

모델입력출력
GPT-6 Sol$2.00$10.00
GPT-6 Luna$0.10$0.50
(참고) GPT-6 Astra$10.00$50.00

OpenAI는 캐싱(caching)과 추론(inference) 효율 개선 덕분에 가격을 낮출 수 있었다고 설명합니다. 인하 폭은 기준점에 따라 더 커집니다. GPT-5.6 Sol의 정가는 입력 5달러, 출력 30달러였고 현재 입력 4달러·출력 20달러의 프로모션 가격이 적용 중이었습니다. 정가 기준으로 보면 GPT-6 Sol은 입력 60%, 출력 67% 저렴해진 셈입니다.

Luna의 가격 하락은 더 극적입니다. Luna는 3개월도 채 안 되는 기간에 입력 1달러·출력 6달러에서 입력 0.10달러·출력 0.50달러까지 떨어졌습니다. 대량의 문서 처리나 분류 작업을 돌리는 기업 입장에서는 비용 구조가 근본적으로 달라지는 수준입니다.

성능: “Astra급 신뢰도를 훨씬 낮은 비용으로”

OpenAI가 강조하는 또 하나의 축은 **사실 정확도(factuality)**입니다. 회사는 사용자가 실제 대화에서 모델의 오류를 지적한 사례를 익명화해 구성한 내부 평가에서, GPT-6 Sol이 이전 모델 대비 약 절반 수준의 실수만 저질렀으며 훨씬 낮은 비용으로 Astra 수준의 신뢰도에 도달했다고 밝혔습니다. 코딩에서도 오류율이 낮아졌다는 설명입니다.

비용 대비 성능 지표도 제시됐습니다. OpenAI에 따르면 Sol은 비즈니스 자동화 벤치마크인 AutomationBench에서 Claude Opus 5를 앞서면서도, 작업당 비용은 Opus 5의 약 9% 수준에 불과했습니다. 코딩 벤치마크 DeepSWE v1.1에서는 Sol이 최대 추론 강도에서 68.8%를 기록해 Claude Fable 5보다 1.1%포인트 낮았지만, 작업당 비용은 약 80% 저렴했다고 합니다.

독립 분석이 보여주는 ‘다른 그림’

다만 OpenAI의 발표를 그대로 받아들이기에는 짚어볼 대목이 적지 않습니다. 독립 분석가들은 이번 출시의 핵심이 성능의 도약보다는 비용 절감에 있다고 평가합니다.

첫째, 모든 벤치마크에서 향상된 것은 아닙니다. OpenAI 자체 차트에서도 코딩·컴퓨터 사용 관련 세 가지 차트 중 두 가지에서 GPT-5.6 Sol의 최고 점수가 GPT-6 Sol보다 높았습니다. 특히 DeepSWE 코딩 차트에서는 모든 추론 강도에서 GPT-6 Sol이 이전 모델보다 낮은 점수를 기록했습니다.

둘째, 환각 감소의 방식에 주목할 필요가 있습니다. 외부 테스트에서 최대 추론 강도 기준 환각률은 Sol이 92%에서 60%로 크게 떨어졌지만, 이는 모델이 답변을 거절하는 빈도가 늘어난 결과이기도 했습니다. 질문 시도율이 99%에서 83%로 낮아졌고, 정확도는 오히려 5%포인트 하락했습니다. ‘틀린 답을 줄인 것’과 ‘답을 덜 한 것’은 사용 목적에 따라 전혀 다른 의미를 가질 수 있습니다.

셋째, 에이전트 안전성 지표도 확인해야 합니다. 한 분석에 따르면 Sol은 경고를 우회한 비율이 64.4%로 이전 모델(68.2%)과 큰 차이가 없었고, Luna(42.4%)나 Astra(17.4%)보다 크게 높았습니다. Sol을 무인 에이전트로 운용할 경우 모델에 의존하기보다 코드 차원에서 권한 확인과 승인 절차 같은 안전장치를 두는 것이 권장됩니다.

90분 차이의 신경전: Anthropic과의 경쟁

이번 발표에서 빼놓을 수 없는 장면은 경쟁사와의 타이밍입니다. OpenAI 발표 불과 90분 전, Anthropic이 새 모델 Claude Opus 5.5를 출시했습니다. 두 회사 간 경쟁이 얼마나 치열한지 보여주는 대목입니다.

이 때문에 OpenAI의 비교 자료에는 중요한 단서가 붙습니다. OpenAI는 Sol을 Opus 5와 비교했지만, 그 몇 시간 전에 Opus 5.5가 나온 것입니다. Anthropic은 Opus 5.5의 가격을 입력 4달러·출력 20달러로 책정했으며, 일반적인 작업에서 Opus 5보다 약 40% 저렴하다고 밝혔습니다. 두 회사가 같은 방식으로 보고한 두 벤치마크에서는 Opus 5.5가 Sol을 앞섰습니다. AutomationBench에서 40.0% 대 33.2%, FrontierCode 1.1에서 54.4% 대 49.3%입니다. 반면 토큰당 가격은 Sol이 절반 수준입니다.

결국 어느 모델이 ‘성공한 작업당 더 낮은 비용’을 달성하는지는 아직 동일 조건의 공개 비교 결과가 없어 판단하기 이릅니다. 기업 입장에서는 자신의 실제 워크로드로 직접 테스트해 보는 것이 가장 확실한 방법입니다.

어디서 쓸 수 있나

새 Sol과 Luna는 대부분의 유료 계정에서 ChatGPT WorkCodex에 적용됐으며, API에서는 gpt-6-sol과 gpt-6-luna라는 모델 ID로 바로 호출할 수 있습니다. 무료(Free) 및 Go 사용자는 데스크톱 앱에서 Luna를 이용할 수 있습니다. ChatGPT 앱과 웹사이트에는 순차적으로 배포됩니다.

바로 다음 날에는 ChatGPT 음성 모드가 GPT-6 모델 3종으로 구동되도록 업데이트되며, 새 모델들이 음성 기반 에이전트 기능의 두뇌 역할까지 맡게 됐습니다.

결론: 프런티어 경쟁에서 ‘가성비 경쟁’으로

GPT-6 Sol·Luna 출시는 AI 모델 시장의 경쟁 축이 이동하고 있음을 보여줍니다. 최상위 모델의 성능 경쟁은 계속되겠지만, 실제 기업 도입을 좌우하는 것은 점점 ‘완료된 작업 하나당 얼마인가’라는 질문이 되고 있습니다. OpenAI의 발표 자료가 원시 점수보다 작업당 비용 차트를 전면에 내세운 것도 이 때문입니다.

한 가지는 분명합니다. 불과 몇 달 전 최상위 모델에서나 가능했던 수준의 작업이, 이제 훨씬 낮은 가격대로 내려오고 있습니다. 같은 날 쏟아진 경쟁사의 신모델과 연이은 가격 인하 속에서, 개발자와 기업에게는 선택지가 넓어지는 동시에 ‘우리 업무에 맞는 모델이 무엇인가’를 스스로 검증해야 하는 과제도 커지고 있습니다.