AI 모델 발표를 읽다 보면 어느 순간 성적표 구경이 됩니다. 지난달에는 이 모델이 1위였고, 이번 달에는 다른 모델이 몇 점 앞섰다는 이야기입니다. 그런데 Gemini 4 아르곤(Gemini 4 Argon)의 발표에서 더 흥미로운 대목은 시험장 밖에 있습니다. 기존 소프트웨어를 고쳐 실제 시스템에서 쓸 수 있는 자원을 되찾았다는 사례입니다.

그렇다면 이제 AI에게 큰 일을 맡기고 퇴근해도 된다는 뜻일까요? 그 결론까지 가기에는 확인할 조건이 남아 있습니다. 발표된 성과의 크기만큼, 무엇을 비교했고 어디까지 완료했는지가 중요합니다.

아르곤은 무엇이고, 지금 누구에게 열렸나

아르곤은 구글이 2026년 9월 30일 발표한 새 Gemini 모델입니다. 복잡한 코딩·전문 업무를 오래 이어 가는 능력을 앞세웁니다. 구글 발표에는 향후 유료 API 고객과 Google AI Ultra 가입자부터 접근을 확대한다는 계획이 담겨 있습니다.

현재 접근 경로를 이해하려면 Fairwind 프로그램을 봐야 합니다. 승인된 보안 방어 파트너 일부에 아르곤을 먼저 제공하는 구조입니다. 신청자를 심사하고 이용 목적과 접근 권한을 관리합니다. 일반 사용자가 가입만 하면 바로 선택할 수 있는 공개 모델로 받아들이면 곤란합니다.

신제품 자동차의 시험 주행이 시작된 상황을 떠올리면 쉽습니다. 일부 운전자가 실제 도로에서 달리고 있고 성능 자료도 나왔지만, 모든 사람이 가까운 매장에서 차를 받을 수 있는 단계와는 다릅니다. 모델 발표, 제한된 제공, 일반 공개는 각각 다른 사건입니다.

300TiB 메모리 확보: 창고를 더 지은 걸까

구글은 최적화를 적용해 300TiB 이상의 메모리를 확보했으며, 총 절감량을 500TiB~1PiB로 예상한다고 밝혔습니다. 앞은 보고된 성과, 뒤는 전망입니다. 공식 발표의 메모리 사례

메모리는 프로그램이 실행 중에 사용하는 작업 공간입니다. TiB와 PiB는 그 용량을 나타내는 단위입니다. 여기서 확보했다는 말은 새 메모리 반도체를 제조했다는 의미가 아닙니다. 기존 프로그램의 점유량을 줄여 다른 작업에 쓸 여지를 만들었다는 뜻으로 읽어야 합니다.

같은 선반에서 내용물을 버리지 않고 포장을 줄여 다시 사용할 공간을 확보하는 전후 비교
같은 자원에서 점유량을 줄이는 원리를 선반 정리에 빗댔습니다. 구글 내부 최적화 방식의 실제 도해는 아닙니다.

그림에서 달라진 것은 선반 크기가 아니라 물건이 차지하는 공간입니다. 프로그램에서도 필요한 결과를 유지하면서 불필요한 점유를 줄일 수 있다면, 하드웨어를 추가하지 않고 처리할 여유가 생깁니다. 다만 구체적인 개선 방식은 시스템마다 다르므로 그림의 재포장이 실제 구현을 뜻하지는 않습니다.

이 사례가 흥미로운 이유는 AI의 산출물이 설명문을 넘어 운영 자원의 변화로 연결됐다는 데 있습니다. 반대로 이 숫자만으로 전기요금이나 장비 구매비가 얼마 줄었는지 계산할 수는 없습니다. 실제 구매를 피했는지, 어떤 장비에서 여유가 생겼는지, 유지·검증 비용은 얼마였는지까지 알아야 금액으로 바꿀 수 있습니다. 공급사가 보고한 내부 성과와 외부에서 재현한 결과도 구분해야 합니다.

100만 출력 토큰: 큰 책상과 긴 작업은 다르다

공식 발표의 출력 한도는 기존 64K에서 1M 토큰으로 늘었습니다. 표기된 64,000과 1,000,000을 비교하면 약 15.6배입니다. 구글의 출력 한도 설명

토큰은 모델이 글을 처리하는 조각 단위입니다. 한 토큰을 한 글자나 한 단어로 고정해 바꾸기는 어렵습니다. 더 중요한 구분은 읽고 참고할 수 있는 범위와 생성하며 작업을 이어 갈 수 있는 여력입니다. 컨텍스트를 자료를 펼쳐 놓는 작업대에 빗댄다면, 출력 한도는 작업하며 작성할 수 있는 분량의 제한에 가깝습니다. 두 제한의 계산 방식은 API 사양을 함께 봐야 합니다.

참고할 책을 읽는 장면과 긴 작업물을 작성하는 장면을 구분하고 표시해 둔 지점에서 작업을 재개하는 AI 조수
참고 자료의 범위, 생성 작업의 길이, 중단 뒤 재개는 서로 다른 문제입니다.

그림의 책과 두루마리를 구분해서 보세요. 두꺼운 책을 읽을 수 있다고 긴 작업을 끝까지 수행할 수 있는 것은 아닙니다. 반대로 아주 긴 두루마리를 만들 수 있어도 내용이 정확하다는 보장은 없습니다.

Artificial Analysis의 평가는 Long Decode Continuation을 사용했다고 설명합니다. 긴 응답을 멈췄다가 후속 호출로 이어 가는 기능입니다. 따라서 100만 출력 토큰을 “한 번의 HTTP 요청에서 100만 토큰짜리 최종 답을 곧바로 받는다”로 바꾸어 말하면 부정확합니다. 추론을 포함하는 긴 생성 과정과 사용자가 읽는 최종 답변도 같은 분량이 아닐 수 있습니다.

예를 들어 코드 개선을 맡겼는데 마지막 문장만 길게 늘어난다면 이득이 작습니다. 수정 후보를 만들고 검사를 거쳐 다음 후보를 시도하는 작업을 충분히 이어 갈 수 있어야 의미가 있습니다. 긴 한도는 그 가능성을 넓히지만, 올바른 중간 판단과 완료 조건까지 대신 정해 주지는 않습니다.

Rust 80만 줄과 2.7배, 비교 대상을 놓치면 생기는 오해

구글이 설명한 Rust 전환은 진행 중인 작업이며, Zircon 커널의 80만 줄 이상도 대상에 포함됩니다. 중요한 시스템은 운영 적용 전 자동·수동 감사와 테스트를 거칩니다. 전환 완료나 무인 배포를 뜻하지 않습니다. 공식 마이그레이션 설명

프로그래밍 언어 전환은 문장을 다른 언어로 번역하는 일보다, 작동 중인 공장의 부품을 바꾸는 일에 가깝습니다. 부품 하나가 맞더라도 연결부와 예외 상황에서 문제가 없어야 합니다. 특히 커널은 운영체제의 핵심이므로 줄 수가 많다는 사실과 안전하게 교체했다는 사실 사이에는 큰 검증 단계가 있습니다.

영상 디코더 libgav1 사례에서는 32K 줄의 SIMD 코드를 교체했고, 결과가 기존 Rust 포트보다 2.7배 빠르며 영상 출력은 같았다고 구글이 보고했습니다. 최적화된 C++보다 2.7배 빠르다는 발표는 아닙니다. libgav1 사례

디코더는 압축된 영상 데이터를 재생 가능한 화면으로 풀어 주는 프로그램입니다. SIMD는 여러 데이터를 한 명령으로 함께 처리하는 방식입니다. Rust라는 이름만 붙이면 자동으로 빨라지는 것은 아니고, 어떤 구현과 비교했는지가 결과를 좌우합니다.

가상의 요청으로 생각해 보겠습니다. “이 영상 처리 코드를 더 빠르게 해 주세요”라고 맡겼는데 영상 일부가 깨졌다면, 실행 시간이 짧아도 성공이 아닙니다. 같은 영상을 넣고 결과가 같은지 확인한 뒤 속도를 비교해야 합니다. 평소에는 잘 재생되지만 손상된 파일에서 멈춘다면 예외 처리도 다시 봐야 합니다. 코드를 많이 고쳤다는 보고보다, 무엇을 유지하면서 무엇을 개선했는지가 실무의 성과입니다.

양자 40%와 벤치마크는 어느 범위의 성적표인가

양자 사례의 40%는 특정 서브루틴의 큐비트 수×게이트 수 자원 지표에서 발표된 기준선을 몇 분 만에 개선했다는 구글의 설명입니다. 전체 양자컴퓨터가 40% 빨라졌다는 뜻으로 확대할 수 없습니다. 공식 양자 최적화 사례

전체 요리 시간을 줄이려는 식당에서 특정 손질 공정의 낭비를 줄인 경우를 생각하면 됩니다. 그 공정의 개선은 유용하지만 주문 처리, 조리, 서빙까지 모두 같은 비율로 빨라졌다고 할 수는 없습니다. 이 비유에서 확인할 것은 “40%”보다 “어느 공정을 어떤 기준으로 비교했나”입니다.

구글 발표에 나온 **DeepSWE v1.1 77.9%, AutomationBench 51.3%, LVBench 91.7%**는 확인됩니다. 발표의 평가 결과에서 제시한 수치입니다. CWE-bench v1 68%는 공동 1위로, Fairwind 공식 페이지에서도 확인할 수 있습니다. 서로 다른 시험이므로 네 점수를 평균 내어 “전체 업무 성공률”로 쓸 수는 없습니다.

구글 공식 발표에 실린 Gemini 4 Argon과 경쟁 모델의 평가별 점수 비교표. 평가 이름과 조건, 모델별 결과를 함께 제시합니다.
구글 공식 발표의 벤치마크 비교표입니다. 공급사가 제시한 결과이며 평가별 조건을 함께 읽어야 합니다. 원본 발표 · 이미지를 누르면 확대됩니다.

표에서는 가장 높은 숫자만 찾기보다 행의 평가 이름과 열의 모델 조건을 먼저 보세요. DeepSWE는 긴 소프트웨어 작업, LVBench는 긴 영상 이해처럼 서로 다른 능력을 다룹니다. Zapier의 AutomationBench와 AA의 AutomationBench-AA도 이름이 비슷하지만 같은 평가로 섞어 읽으면 안 됩니다. 실제 업무에서는 코드 변경 후 회귀 오류나 영상 질문의 오답 유형처럼 내 작업에 해당하는 실패를 별도로 확인해야 합니다.

외부 평가도 살펴볼 만합니다. Vals Index는 아르곤을 선두로 표시합니다. 다만 이 지표는 금융·코딩·법률·세무를 미국 GDP 비중에 따라 가중합니다. 한국의 특정 회사 업무를 그대로 재현한 시험도, 실제 경제 효과를 측정한 통계도 아닙니다. 방법론이 표현하려는 범위 안에서 강한 결과로 읽는 편이 정확합니다.

구글 공식 발표의 Vals Index 비교 차트. 전문 업무 평가에서 아르곤과 다른 모델의 결과를 막대로 비교합니다.
구글 발표에 실린 Vals Index 차트입니다. 차트 출처 · 평가 기관의 방법론과 결과

또한 Artificial Analysis의 종합 지능 지수에서는 아르곤 high가 53점으로 GPT-6 Astra max와 같고, GPT-6.1 Sol max는 52점입니다. 이것은 경쟁력 있는 성능의 근거가 되지만, 모든 분야를 압도한다는 근거는 아닙니다. 시험을 바꾸면 순위도 달라질 수 있습니다.

아르곤은 저렴할까: 단가와 작업 비용을 나눠 비교하기

아르곤의 도입 가격은 입력·출력 각각 100만 토큰당 2달러·10달러, 도입 기간 뒤에는 4달러·20달러입니다. 구글 발표의 가격 각주까지 읽어야 하는 이유입니다.

가격만으로 아르곤을 고를 만큼 압도적으로 싼 구성은 아닙니다. 도입 할인 중에는 GPT-6.1 Sol·Claude Sonnet 5.5와 입력·출력 단가가 같고, 정상 가격은 Claude Opus 5.5와 같습니다. GPT-6 Astra보다 낮지만, Grok 4.7보다는 출력 단가가 높습니다. 비교 대상에 따라 평가가 달라지는 가격대입니다. OpenAI 가격표, Claude 가격표, Grok 가격표

같은 사용량이라면 얼마가 나올까

아래 단가는 미국 달러·100만 토큰당 기본 API 입력/출력 요금입니다. OpenAI는 Standard의 short-context 요금을 사용했습니다. Batch·Fast 모드, 캐시, 도구 호출비, 세금은 제외했습니다. ChatGPT·Claude·Gemini 앱의 월 구독료 비교는 아닙니다.

계산 예시는 요청당 입력 10만·청구 대상 출력 1만 토큰을 10회 사용한다고 가정했습니다. 총 입력 100만·출력 10만이므로 비용은 입력 단가 + 출력 단가 × 0.1입니다. 한 요청에 100만 토큰을 넣는 장문 요금 시나리오가 아닙니다. 실제로 모델들이 같은 일을 같은 토큰 수로 끝낸다는 가정도 아닙니다.

핵심 비교
구분역할설명예시
Gemini 4 Argon · 도입 할인입력 $2 / 출력 $10동일 사용량 계산: $3.00Sol·Sonnet과 같습니다. Opus의 절반입니다.
Gemini 4 Argon · 정상 가격입력 $4 / 출력 $20동일 사용량 계산: $6.00Sol·Sonnet의 2배, Opus와 같습니다.
GPT-6.1 Sol입력 $2 / 출력 $10동일 사용량 계산: $3.00아르곤 할인 가격과 비교할 기준입니다.
Claude Sonnet 5.5입력 $2 / 출력 $10동일 사용량 계산: $3.00일반 API 단가 기준입니다.
Claude Opus 5.5입력 $4 / 출력 $20동일 사용량 계산: $6.00아르곤 정상 가격과 비교할 기준입니다.
GPT-6 Astra입력 $10 / 출력 $50동일 사용량 계산: $15.00아르곤 할인은 이 금액의 20%, 정상가는 40%입니다.
Grok 4.7입력 $2 / 출력 $6동일 사용량 계산: $2.60아르곤 할인 $3는 이 예시에서 약 15% 높습니다.

Grok과의 차이는 출력이 많아질수록 커집니다. 아르곤의 할인 출력 단가 $10은 Grok의 $6보다 약 67% 높습니다. 정상 가격 $20은 약 3.33배입니다. 반면 위 예시는 입력 비중이 높아 총액 차이가 할인 중 약 15%, 정상 가격에서는 약 131%로 나옵니다. “몇 배 비싸다”는 말에는 입력과 출력 중 무엇을 비교했는지 붙여야 합니다.

반복해서 같은 자료를 넣는 업무는 캐시도 봐야 합니다. 구글이 발표한 캐시 입력 할인은 95%이므로 도입 가격 기준 100만 토큰당 $0.10입니다. 하지만 캐시 적중률과 저장·쓰기 비용, 긴 입력의 별도 요금 조건까지 포함하면 계산이 달라집니다. 위 표는 그 차이를 빼고 기본 단가만 맞춘 비교입니다.

실제 평가에서는 Sol보다 비싸고, Astra보다 저렴했다

하지만 단가표만으로 경제성을 판단하면 장바구니를 보지 않고 영수증을 예측하는 셈입니다. 같은 가격의 재료를 사더라도 한쪽이 더 많이 쓰거나 실패해서 다시 만들면 총액이 달라집니다.

같은 단가의 토큰을 서로 다른 양만큼 담은 장바구니와 길이가 다른 영수증, 결과의 성공 여부까지 확인하는 장면
단가에 사용량이 곱해져 비용이 생깁니다. 실무에서는 재시도와 검수까지 포함해 성공한 결과의 비용을 봐야 합니다.

그림의 긴 영수증이 반드시 나쁜 선택이라는 뜻도 아닙니다. 더 어려운 일을 제대로 끝냈다면 추가 지출이 타당할 수 있습니다. 그래서 비교할 때는 “얼마를 썼나”와 “같은 품질 기준을 통과했나”를 함께 물어야 합니다.

Artificial Analysis의 아르곤 평가에서 할인 가격을 적용한 지능 지수 작업당 비용은 1.99달러, GPT-6.1 Sol max의 약 2.7배로 보고됐습니다. AA의 Sol 평가 글에서는 0.72달러를 제시합니다. 같은 단가여도 작업 비용은 다를 수 있습니다. 다만 표시된 값의 반올림과 발표 시점까지 고려해야 하며, 모든 업무에서 같은 비용 비율이 나온다는 뜻은 아닙니다.

같은 AA 발표에서 GPT-6 Astra max는 $3.26입니다. 아르곤 high의 $1.99는 이보다 약 39% 저렴합니다. 단가표에서 봤던 80% 절감과는 차이가 큽니다. AA는 아르곤이 작업당 평균 약 6.2만 출력 토큰, Astra가 약 2.7만을 사용했다고 설명합니다. 단가가 낮아도 사용량이 늘면 가격 차이가 줄어드는 사례입니다. AA의 비용·토큰 사용량 분석

할인이 끝난 뒤 동일한 사용량에 정상 가격을 적용하면 $3.98라는 것이 AA의 환산입니다. 이는 Astra의 $3.26보다 약 22% 높고, Sol의 $0.72를 기준으로 약 5.5배입니다. 미래의 실제 청구액을 측정한 값은 아닙니다. 토큰 소비와 비교 모델 가격이 그대로라는 가정입니다. 또한 이 지표는 평가 작업당 가중 비용이므로, 성공한 업무 한 건의 비용과도 구분해야 합니다.

따라서 아르곤을 “Astra급 성능을 할인 가격에 시험해 볼 후보”로 보는 해석은 가능하지만, Sol·Sonnet보다 저렴한 대안이라고 소개하기는 어렵습니다. Opus와 Grok도 단가만으로 실제 업무 비용의 승자를 정할 수 없습니다. 아르곤이 더 비싼 작업에서는 결과 품질이나 재작업 감소가 그 차이를 메우는지 확인해야 합니다. 가격 경쟁력을 판단할 때 도입 할인과 정상 가격을 따로 보는 이유입니다.

AA의 작업당 비용 방법론은 입력·캐시·추론·답변 비용을 평가별로 계산하고 가중합니다. 단순한 최종 답변 길이 비교가 아닙니다. 우리 업무에서는 여기에 도구 실행비와 사람의 검수 시간까지 고려할 수 있습니다. 할인 종료 뒤에도 같은 토큰 소비 패턴이 유지된다는 가정과, 새로운 모델이 나와 비용이 달라질 가능성도 구분해야 합니다. “할인이 끝나기 전에 다음 모델이 나올 것”은 예산 근거가 될 수 없습니다.

구글의 복귀가 반가운 이유, 소비자의 선택지가 넓어진다

OpenAI나 Claude를 만족스럽게 쓰고 있더라도, 구글이 경쟁력 있는 모델을 내놓는 일은 반갑습니다. 아르곤의 발표 성과와 외부 평가를 함께 보면 기존 선택지와 진지하게 비교해 볼 후보가 생겼다고 해석할 수 있습니다. 소비자에게는 익숙한 도구를 계속 쓸지, 업무 일부를 다른 모델에 맡길지 판단할 여지가 더 생기는 셈입니다.

선택할 만한 대안이 늘면 공급사도 사용자를 붙잡기 위해 성능과 가격, 사용 편의성을 함께 고민할 이유가 커집니다. 더 좋은 답변, 부담이 덜한 요금, 실제 업무에서 덜 번거로운 도구를 기대할 수 있는 방향입니다. 물론 경쟁이 곧바로 모든 구독료 인하로 이어진다는 뜻은 아닙니다. API 할인과 개인용 구독 요금은 별개이고, 발표된 능력이 일반 사용자에게 언제 어떤 조건으로 제공되는지도 중요합니다.

예를 들어 지금 쓰는 모델이 짧은 문서 정리를 빠르고 저렴하게 처리한다면 그 용도로 계속 쓰면 됩니다. 나중에 아르곤을 이용할 수 있게 됐을 때 긴 자료를 다루거나 여러 단계의 수정이 필요한 업무를 같은 조건으로 비교해 볼 수 있습니다. 영상 코드 개선이라면 출력 일치, 예외 처리, 속도, 실행비와 검수 시간을 함께 확인하는 식입니다. 모든 일을 한 모델에 몰아주지 않아도, 작업마다 더 잘 맞는 선택을 할 수 있습니다.

아르곤은 긴 작업과 실제 시스템 개선에서 주목할 만한 가능성을 보여 줬습니다. 앞으로 일반 이용 환경에서도 그 장점이 이어진다면 모델을 고르는 일이 더 흥미로워질 것입니다. 구글의 복귀가 반가운 이유는, 소비자가 더 좋은 결과와 더 나은 조건을 요구하며 고를 수 있는 경쟁이 넓어진다는 데 있습니다.

VIEW—

© Chacolate. 일부를 인용할 때는 글 제목과 원문 링크를 함께 표시해 주세요. 무단 전재·재배포는 허용하지 않습니다.