AI에게 고객 문의를 분류하고 답변 초안을 만들게 한다고 해보겠습니다. 한 번의 멋진 답변도 좋지만, 매일 수백 건씩 맡기려면 다른 질문이 생깁니다. 이 정도 결과를 계속 얻는 데 얼마가 드는가. 결과가 아쉬울 때 다시 시켜도 부담이 적은가.
GPT-6 Sol과 Luna는 이 질문에 꽤 반가운 답을 내놓았습니다. OpenAI는 GPT-5.6 프로모션 가격과 비교해 두 모델의 API 가격을 50% 낮췄다고 발표했습니다. 업무 평가에서도 비용 대비 성능 개선을 함께 제시했습니다. 가격표의 숫자만 낮춘 출시로 보기 어려운 이유입니다. OpenAI 공식 발표
Claude Opus 5.5도 같은 경쟁에 들어왔습니다. Anthropic이 제시한 방향 역시 더 높은 능력과 더 낮은 작업 비용입니다. 이번 소식은 ‘누가 가장 똑똑한가’에 더해 그 능력을 얼마나 자주 써도 되는가를 묻게 합니다. Claude Opus 5.5 발표
대표 그림의 “속도를 늦추자!”는 실제 인용이 아닌 풍자입니다. 안전과 발전 속도를 논의하는 동안에도 제품 경쟁은 계속되는 모습을 그렸습니다. Grok은 경쟁 구도를 표현하는 캐릭터이며, 이번 글의 출시·성능 비교 대상은 아닙니다.
API 가격 50% 인하, 무엇이 반값이 됐나
API는 다른 프로그램이 AI에 일을 요청하는 통로입니다. 이때 읽어 들인 내용과 생성한 내용을 ‘토큰’이라는 작은 단위로 계산해 요금을 매깁니다. 토큰은 글자 수나 단어 수와 정확히 같지는 않습니다. 입력은 AI가 읽는 양, 출력은 AI가 만드는 양으로 생각하면 가격표를 이해하기 쉽습니다.
GPT-6 Sol의 기본 단가는 100만 토큰당 입력 2달러, 출력 10달러입니다. Luna는 입력 0.10달러, 출력 0.50달러입니다. 아래는 OpenAI 발표에 실린 이전 모델과의 비교입니다. Sol 모델 문서, Luna 모델 문서
Sol은 입력·출력 모두 정확히 절반입니다. Luna는 입력이 절반이고, 표의 출력 단가를 계산하면 약 58.3% 인하입니다. 발표의 ‘50% 인하’라는 큰 메시지와 개별 항목의 계산값을 구분해서 읽으면 됩니다.
고객 문의를 처리하면서 합계 입력 100만 토큰과 출력 20만 토큰을 썼다고 가정해보겠습니다. 위 비교 단가를 그대로 적용하면 Sol은 8달러에서 4달러로, Luna는 0.44달러에서 0.20달러로 내려갑니다. 같은 양을 읽고 같은 양의 답변을 만든다는 산술 예시입니다. 실제 문의 몇 건에 해당하는지는 문의 길이와 답변 길이에 따라 달라집니다.
이 계산은 캐시를 쓰지 않는 Standard의 short context 단가를 전제로 합니다. 긴 입력에 적용되는 요금, 빠른 처리 옵션, 도구 사용료 등은 별도로 확인해야 합니다. ChatGPT 구독료가 반값이 됐다는 뜻도 아닙니다. API에서 같은 토큰량을 소비할 때의 변화입니다. OpenAI API 요금표
AutomationBench: 덜 쓰면서 더 잘 끝냈는가
문의 내용을 요약하는 일과, 문의를 읽고 고객 정보를 찾아 적절한 업무 절차까지 끝내는 일은 다릅니다. 두 번째에는 여러 도구를 골라 순서대로 사용하고, 앞 단계의 결과를 다음 단계로 넘기는 능력이 필요합니다.
Zapier의 AutomationBench는 이런 업무 흐름을 평가합니다. 영업·마케팅·운영·고객 지원·재무·인사에 걸친 과제를 여러 도구로 수행하게 합니다. 말로 정답을 설명하는 능력보다 연결된 일을 실제로 완수하는 능력을 보려는 시험에 가깝습니다. AutomationBench의 평가 설명
눈여겨볼 지점은 GPT-6 Sol의 33.2%, 과제당 0.27달러입니다. Sol은 xhigh, 비교 대상인 Claude Opus 5는 max 설정이며 Opus 5의 점수는 26.9%입니다. OpenAI가 강조하는 것은 이 조건에서 Sol의 비용이 Opus 5의 약 9%였다는 점입니다. 점수·비용·설정 원문
Luna도 좋아졌습니다. high 설정에서 이전 Luna보다 점수는 5.4%포인트 높아지고, 과제당 비용은 58% 낮아졌다고 보고했습니다. 가벼운 모델은 성능을 포기하고 가격만 택하는 선택지라는 생각을 다시 보게 하는 변화입니다. Luna의 업무 평가
여기서 effort는 문제를 풀 때 얼마나 깊게 생각하도록 설정했는지를 나타냅니다. 같은 모델도 설정을 높이면 점수와 비용이 함께 바뀔 수 있습니다. 그래서 이 그림은 브랜드별 점수 하나를 세워놓은 순위표보다 유용합니다. 필요한 품질을 얻는 데 어느 정도 비용을 써야 하는지 보게 해주기 때문입니다.
다만 이 차트의 Claude는 Opus 5이며, 새로 나온 Opus 5.5가 아닙니다. Fable 5.1의 표시 비용에는 일부 과제에서 사용한 Opus 5 대체 처리 비용이 빠져 있다는 주석도 있습니다. 차트의 범례와 주석을 떼어내면 비교의 의미가 달라집니다.
33.2%를 ‘우리 회사 업무의 33.2%를 자동화할 수 있다’고 바꾸어 읽어서도 안 됩니다. 정해진 과제와 도구, 채점 방식에서 나온 점수입니다. 그래도 같은 평가 안에서 더 낮은 비용으로 더 높은 점수를 얻었다는 사실은, 예전에는 비용 때문에 미뤘던 업무를 다시 살펴볼 충분한 이유가 됩니다.
Agents’ Last Exam: 긴 업무에서도 보이는 변화
일은 짧은 단계만으로 끝나지 않습니다. 자료를 여러 번 찾아보고, 파일을 만들고, 앞서 내린 판단을 수정해야 하는 과제도 있습니다. Agents’ Last Exam은 이런 장기 전문 업무를 평가하며, 55개 세부 산업을 포괄하는 과제를 수집합니다. 단순 지식 문답 시험인 것처럼 이름만 보고 판단하기 쉽지만, 실제로는 컴퓨터에서 수행하는 업무 결과를 중심에 둡니다. Agents’ Last Exam 소개
OpenAI가 보고한 GPT-6 Sol의 max 점수는 56.4%입니다. 해당 평가에서 Opus 5의 최고점보다 높으면서 과제당 비용은 60% 낮았다고 설명합니다. 앞 절의 API 단가 50% 인하와는 다른 수치입니다. 여기서는 실제 평가 과정에서 소비한 토큰 등을 반영한 과제당 비용을 비교합니다. 평가 결과
두 차트에서 읽을 공통 메시지는 ‘최고 점수를 가진 모델만 가치가 있다’가 아닙니다. 원하는 수준을 더 작은 예산으로 얻을 선택지가 넓어졌다는 것입니다. Sol과 Luna를 Astra와 같은 모델로 볼 필요도 없습니다. 가벼운 일부터 어려운 일까지 모두 가장 비싼 모델에 맡길 이유가 줄어드는 쪽에 가깝습니다.
평가 환경도 남겨 두어야 합니다. OpenAI는 자사 연구 환경 또는 API에서 평가했으며, 실제 제품과 도구·시스템 지시가 다를 수 있다고 설명합니다. 차트의 우세는 내 파일·내 업무 절차에서도 그대로 재현된다는 보증은 아닙니다.
Claude Opus 5.5 출시, 단가 20%와 작업 비용 40%의 차이
Claude 쪽도 이전 모델 가격표에 머물러 있지 않습니다. Opus 5.5의 입력·출력 단가는 100만 토큰당 4달러·20달러입니다. Opus 5의 5달러·25달러에서 각각 20% 낮아졌습니다. 캐시 읽기는 0.50달러에서 0.20달러로, 60% 낮아졌습니다. Anthropic 가격·기능 문서
앞서 사용한 입력 100만·출력 20만 토큰의 예시를 그대로 대입하면, Opus는 10달러에서 8달러가 됩니다. 캐시를 쓰지 않고 토큰량이 같다는 조건에서는 20% 절감입니다. 같은 예시에서 Sol은 4달러였으므로 Opus 5.5의 기본 단가가 더 높습니다. 이 차이를 감수할 만큼 결과나 재작업 시간이 좋아지는지를 따져볼 수 있습니다.
Anthropic의 ‘일반적인 작업에서 40% 저렴하다’는 설명은 별도로 읽어야 합니다. 단가 인하와 토큰 사용량을 반영한 기본 설정의 자사 테스트 결과입니다. 출력 생성도 Opus 5보다 30% 이상 빨라졌다고 발표했습니다. Opus 5.5 비용·속도 설명
읽는 단가가 내려가는 것과 같은 일을 더 적게 읽고 끝내는 것은 다른 개선입니다. 두 효과가 겹치면 토큰 가격표보다 큰 절감이 나올 수 있습니다. 반대로 일을 더 오래 맡기거나 결과를 더 길게 만들면 월 청구액은 늘 수도 있습니다. ‘40%’를 모든 계정의 요금을 일괄 할인한다는 뜻으로 읽으면 안 되는 이유입니다.
설정도 달라졌습니다. API의 기본 effort는 Opus 5의 high에서 medium으로 바뀌었고, thinking은 항상 켜집니다. 같은 effort 이름을 지정해도 이전 모델보다 한 차례에 더 많이 생각하는 경향이 있어, 기존 max 설정을 그대로 옮기기보다 다시 비교하라는 안내입니다. 공식 변경 문서
구독 사용자는 API 단가표가 곧 월 구독료표가 아니라는 점을 기억하면 됩니다. 발표에는 Pro·Max·Team·좌석형 Enterprise의 5시간 사용 한도 확대도 포함됩니다. 구독 한도 관련 공식 발표
Opus 5.5 성능표: 코딩 점수와 업무 완수율
종합표에서는 내가 맡길 일과 가까운 행부터 보면 됩니다. 코딩에 쓸 사람은 Terminal-Bench를, 여러 앱을 연결하는 담당자는 AutomationBench를 먼저 읽는 식입니다. 모든 행을 평균 내어 ‘종합 지능’으로 바꾸기에는 평가 대상과 점수 단위가 서로 다릅니다.
Terminal-Bench 4.0에서 Opus 5.5는 66.4%, Opus 5는 52.3%입니다. GPT-6 Astra의 57.9%와도 차이가 있지만, 각각 xhigh와 high라는 서로 다른 설정의 최고점입니다. Opus 5.5의 표준오차는 ±2.6%포인트이며 일부 평가에는 안전장치에 따른 대체 모델 처리가 포함됩니다. 성능표의 측정 조건
AutomationBench는 40.0% 대 26.9%로, Opus 5보다 13.1%포인트 높습니다. 이 평가는 Zapier가 실행했고 안전장치 개입을 대체 처리 없이 실패로 셌습니다. AutomationBench 평가 주석
점수가 좋아졌다는 사실과 맡긴 일을 반드시 끝낸다는 보장은 다릅니다. 고객 문의를 읽고 고객 정보를 갱신하는 자동화라면, 틀린 정보를 기록한 한 번의 실패가 여러 번의 성공보다 큰 비용을 만들 수도 있습니다. 이 표는 후보를 고르는 근거로 쓰고, 실제 도입 여부는 자신의 완료 조건으로 판단해야 합니다.
새 GPT-6 Sol과 비교할 때는 평가 기관의 현재 목록을 함께 봐야 합니다. Zapier의 AutomationBench 1.0.6에는 Opus 5.5 max가 40.0%, 1.28달러, Sol xhigh가 33.2%, 0.27달러로 올라 있습니다. 이 두 설정에서는 Opus의 점수가 높고 Sol의 비용이 낮습니다. Zapier 원본 리더보드
Opus 5.5의 비용 곡선: 최고 설정이 늘 정답은 아니다
종합표가 최고 성적을 보여준다면, 다음 차트는 그 성적을 얻는 과정에서 지출이 어떻게 달라지는지 보여줍니다. 같은 주황색 선 위의 점들이 서로 다른 effort입니다. 왼쪽 위에 가까울수록 작은 비용으로 높은 점수를 얻은 것입니다.
Anthropic은 이 평가에서 기본 medium의 Opus 5.5가 Astra와 비슷한 점수를 약 40%의 비용으로 얻었다고 설명합니다. 코딩 비용 비교 여기서 읽을 실용적인 메시지는 ‘항상 max로 설정해야 신모델을 제대로 쓴다’는 생각을 버려도 된다는 것입니다.
특히 주황색 선의 마지막 두 점을 보면 max가 xhigh보다 오른쪽에 있지만 더 높지는 않습니다. 더 많이 생각하게 하는 설정이 모든 시험에서 더 좋은 결과로 이어지지는 않는다는 관찰입니다. 다만 이 작은 점수 차이만으로 xhigh가 언제나 더 낫다고 단정해서도 안 됩니다. 실제 업무에서는 낮은 설정부터 결과를 확인하고, 놓치는 항목이 있을 때 비용을 올려보는 방식이 합리적입니다.
코딩 이외의 업무에도 같은 질문을 적용할 수 있습니다. 고객 지원 보고서라면 실행 가능한 코드 대신, 자료를 제대로 읽었는지와 보고서가 의사결정에 쓸 만한지를 보아야 합니다.
GDPval-AA v2.1은 44개 직업의 전문 업무를 평가하며, Opus 5.5의 최고점은 1846 Elo입니다. 기본 medium도 Astra max보다 높은 점수를 약 5분의 1 비용으로 얻었다는 설명입니다. 사무·전문 업무 평가
Elo는 비교 성적을 표현하는 점수입니다. 1846을 성공 건수나 자동화 비율로 해석하거나, 다른 시험의 56.4%와 직접 비교할 수는 없습니다. 내 업무에서 중요한 것은 ‘차트가 높다’보다 빠뜨린 근거와 수정해야 할 문장이 줄어드는가입니다. 같은 자료 묶음으로 초안을 만들어보면서, 사람이 고친 부분을 기록해두면 모델 가격 이상의 차이를 볼 수 있습니다.
또 하나 놓치기 쉬운 차이가 있습니다. 이 표의 Humanity’s Last Exam과 앞의 Agents’ Last Exam은 다른 평가입니다. 이름이 비슷하다고 두 숫자를 나란히 놓으면 비교 자체가 잘못됩니다. Anthropic 표의 GPT-5.6 Sol과 OpenAI 표의 Opus 5 역시 모두 이전 세대이므로, 어느 한 발표 자료만으로 신모델끼리의 우열이 확정되지는 않습니다.
Anthropic은 발전 속도 조절 논의와 함께 이번 출시의 평가·안전장치를 설명합니다. 공식 발표의 Pacing the frontier 대표 그림은 이 장면을 과장한 풍자입니다. 세 회사의 공동 감속 약속이나 실제 발언을 옮긴 장면은 아닙니다. 안전 논의와 출시 경쟁이 함께 진행된다는 긴장감만으로도 그림 속 바쁜 발걸음은 충분히 설명됩니다.
싸진 것은 요청 비용, 남는 것은 완성 비용
고객 문의 예시로 돌아가보겠습니다. 분류와 답변 초안을 만드는 비용이 절반이 돼도, 잘못된 환불 안내를 사람이 고치는 데 더 오래 걸리면 전체 비용은 절반이 되지 않습니다. 반대로 같은 품질을 유지하면서 재작업까지 줄었다면 절감 효과는 더 커질 수 있습니다.
계산할 항목은 세 가지입니다. AI에 지불한 금액, 실패해서 다시 시킨 금액, 사람이 확인하고 수정한 시간입니다. 앞서 계산한 Sol 4달러는 첫 항목의 가상 예시일 뿐, 최종 업무 원가를 뜻하지 않습니다.
구독료와 API 요금, 검수 시간을 함께 계산하려면 AI 코딩 도구 비용 계산: 구독·API·검수 시간의 계산 예시를 참고할 수 있습니다. 낮아진 토큰 단가가 내 월간 지출과 작업 시간에 얼마나 영향을 주는지 따져보는 데 도움이 됩니다.
반복해서 읽는 자료가 많다면 캐시도 영향을 줍니다. 매번 같은 상담 규칙과 상품 설명을 처음부터 처리하는 대신, 재사용 가능한 입력 부분을 활용하는 방식입니다. OpenAI의 현재 단가에서 Sol의 캐시 입력은 100만 토큰당 0.20달러, Luna는 0.01달러입니다. 각각 일반 입력의 10%입니다. 그렇다고 모든 입력이 자동으로 그 가격에 처리되는 것은 아니며, 캐시 쓰기와 적중 여부를 함께 봐야 합니다. API 요금표, 프롬프트 캐시 조건
할인 덕분에 재시도와 검토를 더 할 여유가 생긴다는 점은 분명 반갑습니다. 다만 그 여유를 결과의 신뢰도를 높이는 데 쓸지, 확인하지 못할 결과물을 더 쌓는 데 쓸지는 작업 설계에 달려 있습니다.
내 업무에서는 무엇부터 바꿔볼까
OpenAI는 Sol을 복잡한 코딩·에이전트 작업용, Luna를 범위가 분명한 대량 처리용으로 설명합니다. Anthropic은 Opus 5.5를 장시간 이어지는 코딩·지식 업무에 맞춘 모델로 소개합니다. 이 구분은 후보를 좁히는 출발점으로 쓸 수 있습니다. Sol, Luna, Opus 5.5
예를 들어 고객 문의 분류처럼 정답 기준을 명확히 만들 수 있는 부분에는 Luna를 먼저 비교해볼 만합니다. 여러 자료를 대조해 답변을 만들고 도구로 후속 작업까지 연결해야 한다면 Sol과 Opus 5.5를 같은 과제로 살펴볼 수 있습니다. 기존에 Astra를 쓰고 있었다면 그 결과도 기준점으로 남겨 두면 됩니다. 업무를 어디까지 맡기고 어느 지점에서 사람이 확인해야 할지는 GPT-6 Astra, 어디까지 일을 맡길 수 있을까에서 컴퓨터 사용과 벤치마크의 한계를 함께 살펴볼 수 있습니다.
| 구분 | 역할 | 설명 | 예시 |
|---|---|---|---|
| 반복 분류 | Luna부터 작은 표본 비교 | 입력과 정답 기준이 분명한 작업에 낮은 단가의 효과가 있는지 봅니다. | 문의 유형 분류에서 누락·오분류와 건당 비용을 기록합니다. |
| 여러 단계의 업무 | Sol과 Opus 5.5를 같은 과제로 | 도구 사용을 포함해 마지막 결과까지 완성하는지 확인합니다. | 정책 확인 → 답변 초안 → 근거 대조를 같은 자료로 비교합니다. |
| 오류 비용이 큰 판단 | 기존 기준 모델과 사람 검수 유지 | 싼 단가만으로 검토 단계를 없애지 않습니다. | 환불 예외·계약 해석은 근거와 예외 조건을 사람이 확인합니다. |
처음에는 개인정보를 지운 과거 문의처럼 정답을 확인할 수 있는 자료를 작은 묶음으로 고르면 됩니다. 각 모델에 같은 자료와 완료 기준을 주고, 답변 품질뿐 아니라 누락된 항목·재시도 횟수·수정 시간을 기록합니다. 가장 어려운 한 건을 잘 푸는 모델과 평소 물량을 경제적으로 처리하는 모델은 다를 수 있습니다.
계획·분석과 반복 실행을 나누는 선택 기준은 Codex Astra·GPT-5.6 비교: 성능·비용과 모델 선택법으로 이어집니다. 이전 세대인 GPT-5.6을 다룬 글이므로 그 글의 가격을 이번 Sol·Luna의 현재 요금으로 읽지 말고, 작업 난도에 따라 모델을 고르는 기준을 참고하면 됩니다.
직접 API를 연결한 서비스라면 모델 이름만 바꾸기 전에 호환성도 확인해야 합니다. 예를 들어 Opus 5.5는 thinking을 끄는 요청이나 특정 도구 호출을 강제하는 기존 설정을 허용하지 않습니다. 단가 인하와 기존 연동의 호환성은 별개의 문제입니다. Opus 5.5 변경 사항
저는 Astra로 계획하고, Luna max로 작업합니다
현재 저는 Pro 5x 플랜으로 Codex를 사용하고 있습니다. 작업 계획을 세우는 Plan 단계와 복잡한 구간, 깊이 있는 분석에는 GPT-6 Astra를 쓰고, 평소 작업에는 GPT-6 Luna를 max 설정으로 활용합니다. Astra로 방향을 잡고 Luna로 작업을 이어가는 식입니다.
이렇게 나누어 쓰면 제 작업량에서는 주간 사용 한도가 꽤 넉넉하게 느껴집니다. 예전에는 Claude, 특히 Opus를 많이 썼는데, 요즘은 Codex의 가성비가 훨씬 좋아졌다는 인상이 강합니다. 여기서 말하는 가성비는 앞의 API 단가 계산과는 별개로, 제가 내는 구독료에 비해 얼마나 만족스럽게 일을 맡기고 있는가에 대한 체감입니다.
최근에는 주간 사용 한도를 리셋해주는 기회도 자주 접하고 있습니다. 경쟁이 치열해진 영향일까 싶기도 하지만, 그 이유까지 확인한 것은 아닙니다. OpenAI는 별도로 저장해 두었다가 사용하는 리셋과 대상 계정에 자동 적용하는 리셋을 구분해 안내합니다. 제 체감을 앞으로도 계속 제공되는 고정 혜택으로 받아들이기보다는, 본인 계정의 사용량 화면에서 적용 여부를 확인하는 편이 좋습니다. Codex 리셋 공식 안내
Claude를 많이 사용해온 입장에서도, 요즘 Codex는 주관적으로 굉장히 만족스럽게 쓰고 있는 도구입니다. 모든 작업에서 어느 모델이 더 낫다는 순위를 매기려는 이야기는 아닙니다. 제 작업 방식에서는 Astra와 Luna의 역할을 나누는 조합이 잘 맞고, 비용과 사용량 부담까지 줄었다는 점이 특히 마음에 듭니다.
GPT-6 Sol·Luna와 Opus 5.5가 함께 보여주는 반가운 변화는 좋은 AI를 시험해볼 경제적 문턱이 낮아졌다는 것입니다. 이제는 ‘최고 모델을 쓸까 말까’에만 머물 필요가 없습니다. 자주 맡기는 일에 필요한 품질을, 더 작은 비용으로 얻을 수 있는가. 이번 가격 인하를 실제 이득으로 바꾸는 질문은 여기에 있습니다.
VIEW—


