
Fugu Max vs Grok 4.6: 동일한 요금표, 공개된 점수는 단 하나
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
Fugu Max와 Grok 4.6은 가격이 정확히 같습니다. Sakana AI는 2026년 9월 11일 Fugu Max를 출시했고, 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00으로 책정했습니다. 그리고 그것은 SpaceXAI가 8월 12일 Grok 4.6을 출시한 이후 계속 청구해 온 요금표와 한 줄도 다르지 않습니다. 이 우연은 이번 맞대결에서 가장 유용한 사실입니다. 가격을 논쟁에서 삭제해 주기 때문입니다. 두 제품이 동일하게 청구한다면, 남는 유일한 질문은 그 돈에 무엇이 오는가이며, 바로 그 지점에서 둘은 완전히 갈라집니다. Grok 4.6은 버전으로 고정할 수 있고, 벤치마크 표를 읽을 수 있으며, 독립 지표와 대조해 확인할 수 있는 단일 모델입니다. Fugu Max는 훈련된 코디네이터로, 각 작업을 자체 풀에서 가장 저렴한 모델로 보내며, Sakana의 발표는 여섯 개 벤치마크에서 종합 최고 점수를 차지한다고 주장하지만 그중 어느 것에서도 수치를 제시하지 않습니다. 이 두 구매 중 하나는 구매 전에 측정할 수 있습니다. 다른 하나는 그렇지 않습니다.
두 제품, 하나의 요금표
• 입력 — Fugu Max 1M 토큰당 $2.00 vs Grok 4.6 1M 토큰당 $2.00
• 출력 — Fugu Max 1M 토큰당 $6.00 vs Grok 4.6 1M 토큰당 $6.00
• 캐시된 입력 — Fugu Max 100만 토큰당 $0.25 vs Grok 4.6 100만 토큰당 $0.50, 두 가격이 유일하게 차이를 보이는 항목
• 컨텍스트 윈도우 — 벤더가 공개하지 않은 Fugu Max vs Grok 4.6 500,000 토큰, Grok 4.5와 동일
• 장문 프롬프트 재가격 책정 — Fugu Max는 릴리스에서 티어가 명시되지 않은 반면, Grok 4.6은 단일 요청이 200,000 토큰을 초과하면 $4.00 / $12.00로 두 배가 되며, 이는 초과분이 아니라 요청 전체에 적용됨
• 추론 제어 — Fugu Max는 노출되지 않음 vs Grok 4.6은 low부터 xhigh까지 4가지 effort 레벨, 기본값은 high이며 off로 전환할 수 없음
• 아키텍처 — Fugu Max는 오픈 웨이트와 특화 모델을 포함하는 비공개 풀을 대상으로 훈련된 코디네이터로, NVIDIA와의 협업을 통해 NVIDIA Nemotron 패밀리와 함께 Max를 위해 확장되었으며, vs Grok 4.6은 하나의 버전에 하나의 모델
• 독립 평가 — Fugu Max는 공개된 것이 없으며, 어떤 Fugu 모델에도 Artificial Analysis 페이지가 존재하지 않습니다. 반면 Grok 4.6은 실시간 Artificial Analysis Intelligence Index 44, 200개 중 #20위입니다.
저렴한 열은 예측할 수 없는 쪽이다
Fugu Max가 실제로 가격에서 우위를 점하는 지점을 보세요. 바로 캐시 읽기이며, Grok 4.6의 절반입니다. 이는 실질적인 이점이지만, 비용 모델을 세우기에 딱 잘못된 지점입니다. 캐시 가격은 캐시 적중률에 비례해서만 이득을 주는데, Sakana는 Fugu Max의 캐시 적중률을 공개하지 않기 때문입니다. 이번 발표에는 컨텍스트 윈도우도, 장문 컨텍스트 등급도, 출력 상한도 명시되어 있지 않습니다. 따라서 Fugu Max가 Grok 4.6을 밑도는 단 하나의 항목은, 알 수 없는 비중의 토큰에 적용되는 알 수 없는 크기의 할인입니다.
Grok 4.6의 약점은 적어도 눈에 보인다. 200,000토큰 임계값은 공격적이다. 전체 요청의 가격을 다시 산정하므로, 250,000토큰 프롬프트는 200,001번째 토큰이 아니라 첫 토큰부터 두 배 요율로 청구된다. 하지만 그 절벽을 볼 수 있고, 거기에 맞춰 프롬프트를 측정하며, 청크로 나눌지 결정할 수 있다. 바로 여기에 질적인 차이가 있다. 한 시스템은 계획을 세울 수 있는 형태의 가격표를 공개하고, 다른 시스템은 어떤 요금표도 붙이지 않은 대표 요율만 공개한다.
6승, 그리고 단 한 점도 없음
Sakana가 언급한 벤치마크는 Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench, SWEFish입니다. 그중 다섯 개는 인정받는 공개 평가입니다. 여섯 번째인 SWEFish는 Sakana 자체 코딩 벤치마크로, 이는 주장된 여섯 번의 승리 중 하나가 벤더가 작성하고 아직 공개하지 않은 테스트에서 채점된다는 뜻입니다. 나머지 다섯 개에 대해, 발표 자료는 Fugu Max가 최고 종합 점수를 달성한다고 말하고 거기서 끝납니다 — 점수도, 격차도, 나란히 놓을 경쟁사 수치도 없습니다.
이를 SpaceXAI가 Grok 4.6을 위해 공개한 표와 견주어 보자. 그 표는 전부 벤더가 보고한 수치이지만 적어도 표이기는 하다. GDPVal-AA v2는 1,753, AA-Briefcase는 1,577, DeepSWE v1.1은 65.9%, CursorBench v3.2는 69.9%, GPQA Diamond는 94.9%다. 또한 출시 자료에 따르면 AA-Briefcase의 장기(long-horizon) 작업을 해결하는 데는 약 53턴과 약 5억 개의 입력 토큰이 드는 반면, 경쟁 프런티어 모델은 약 103턴과 20억 개의 토큰이 필요하다고 한다. 이 역시 벤더가 보고한 주장으로, Grok은 토큰당 요율이 그리 높지 않은데도 완료된 작업당 비용은 저렴하다는 근거가 된다.
Grok 수치 중 두 가지는 인용하기 전에 처리해야 할 부분이 있습니다. 첫 번째는 대표 수치인 GPQA Diamond 94.9%가 Artificial Analysis가 포화 상태로 판단해 이후 폐기한 벤치마크에서 나온 것이라는 점입니다. 따라서 이제는 예전처럼 프런티어 모델을 변별해 주지 못합니다. 두 번째는 예전 보도에서 보게 될 숫자, 즉 Grok 4.6의 Artificial Analysis Intelligence Index 61입니다. 이는 재산정 이전의 척도였습니다. Artificial Analysis는 2026년 9월에 이 지수를 재보정했으며, 현재 수치는 200개 중 20위인 44이고, Intelligence Index 작업당 비용은 $1.86입니다. 61을 기준으로 Grok 4.6을 Claude Fable 5나 GPT-5.6 Sol과 견주어 순위를 매기는 사람은 서로 다른 두 계측기의 측정값을 비교하고 있는 것입니다.

오케스트레이터의 토큰 가격에 포함되지 않는 것
Sakana가 해당 릴리스를 직접 다룬 글에서도 구조적 문제를 인정한다. Fugu Max는 단일 작업 안에서 모델을 전환하기 때문에 "문맥 캐시 재사용을 줄일 수 있고 추가 오케스트레이션 토큰도 생성할 수 있다" — 그리고 회사는 그로 인한 캐시 적중률이나 작업당 총 토큰 비용을 공개하지 않았다. 코디네이터가 생성하는 모든 에이전트는 추론과 출력 텍스트를 작성하며, 그 전부가 100만 토큰당 $6.00로 청구된다. 이 요금은 Grok 4.6과 동일하다. 사용량은 동일하지 않으며, 사용량은 가격 페이지가 보여줄 수 없는 변수다.
두 공급업체 모두 당신을 같은 수정 방향으로 밀어붙입니다 — 요금 비교는 그만두고, 완성된 작업당 비용을 비교하기 시작하세요 — 하지만 그중 한 곳만이 시작점이 될 숫자를 건네줍니다. Grok 4.6은 공개된 턴 및 토큰 프로필과 함께 등장합니다. Fugu Max는 직접 측정하라는 지시와 함께 등장합니다.
Fugu Max의 침묵에는 공정한 해석이 하나 있으며, 그것은 밝힐 가치가 있다. Max는 Fugu 라인의 비용 최적화 티어로, 입력 $5.00, 출력 $30.00에서 성능을 밀어붙인 Fugu Ultra v2와 같은 날 출시되었다. Sakana가 Max를 위해 내세우는 시각적 논거는 파레토 도표 — 성능 대 비용 — 이며, 파레토 도표에서 원시 벤치마크 점수는 요점이 아니다. 달러당 점수가 주장의 전부다. 그것이 논거라면, 비용 없이 승리를 거둔 여섯 개 점수를 인쇄하는 것은 빠진 도표가 아니라 오해를 부르는 도표일 것이다. 이번 릴리스가 구매자에게 여전히 빚지고 있는 것은 분모인데, 그것을 제공하지 않는다.
Grok 4.6이 진정으로 노출되는 곳
터미널 작업은 Grok 4.6의 공개된 평가 영역 중 가장 취약한 부분입니다. Terminal-Bench v3.0 점수는 26%로, 해당 분야 선두에 한참 뒤처져 있습니다. 바로 옆에 있는 수치를 조심하세요. 같은 모델이 Terminal-Bench v2.1에서는 88.4%를 기록하는데, 이 둘은 서로 다른 테스트입니다. 보도에서는 두 수치가 뒤섞여 제시되는 것을 보게 될 것이며, 그 혼합은 Grok에 상당히 유리하게 작용합니다.
두 번째 위험 요인은 추론을 끌 수 없다는 점입니다. 사고 토큰은 모든 요청에 대해 과금되므로, Grok 4.6의 실질적인 출력 비용은 모델이 사용자의 프롬프트에 대해 얼마나 열심히 생각할지 결정하는 정도에 달려 있습니다. 노력 다이얼은 낮은 쪽에서 제어권을 제공하지만, 0으로 설정하는 옵션은 없습니다.
그에 반해, Grok 4.6에는 Fugu Max가 현재 어떤 가격에도 제공할 수 없는 것이 있습니다: 바로 숫자입니다. 위의 모든 행은 제3자가 검증할 수 있으며, Artificial Analysis 항목은 이미 한 행이 그렇게 검증되었음을 의미합니다. Fugu Max의 여섯 번의 승리는 모델과 같은 날, 그것을 개발한 회사에 의해 발표되었고, 이 글을 쓰는 시점에 Sakana 외부의 누구도 그것을 실행해 보지 않았습니다.
하나는 부르고, 다른 하나는 조종하기
Grok 4.6이 OrcaRouter에서 SpaceXAI의 정가로 제공됩니다 — 입력 백만 토큰당 $2.00, 캐시 적중 시 $0.50, 출력 백만 토큰당 $6.00 — 0% 마크업으로 그대로 전달됩니다, 따라서 공급업체 가격 변경은 마이그레이션 일정에 따라 반영되는 대신 같은 날 우리 게이트웨이에 도달합니다. OpenAI와 호환되며 카탈로그의 나머지와 동일한 기본 URL을 사용하므로, 프로덕션 경로에 공급자를 하드코딩하는 대신 장애 조치 체인에 넣거나 조건부 라우팅 규칙 뒤에 둘 수 있고, 두 번째 계약 없이 다른 모델과 A/B 테스트할 수 있습니다. 지난 7일 동안 게이트웨이를 통해 4,660만 토큰이 오갔습니다.
Fugu Max는 우리 카탈로그에 없습니다. Fugu Max는 Sakana 자체의 OpenAI 호환 API와 여러 서드파티 플랫폼을 통해 여러분에게 전달되며, 회사 측은 기존 Fugu 통합이 파라미터 하나만 바꾸면 이것으로 업그레이드된다고 말합니다. 둘 다 동일한 요청 형식을 사용하기 때문에, 이들을 하나의 플래그 뒤에 두는 평가는 재작성이 아니라 base-URL 교체입니다 — 이 특정 논쟁을 정리하는 올바른 방식이죠. 논쟁의 대상이 완료된 작업당 토큰 수이고, 그 숫자는 오직 여러분 자신의 워크로드만이 산출할 수 있기 때문입니다.

어느 것을 사야 할까요
Grok 4.6은 정당화할 수 있는 기본값입니다. Fugu Max와 동일한 요금표로, 계획을 세울 수 있는 500K 컨텍스트 창, 고정할 수 있는 버전, 4단계 추론 제어, 작업당 비용 수치가 옆에 있는 44위의 독립적인 인덱스 배치, 그리고 수개월간의 제3자 측정을 제공합니다. 그 비용은 구체적이고 알려져 있습니다: 200K 재가격 절벽, 항상 청구되는 추론, 그리고 업계에서 뒤처지는 터미널 작업 프로필.
Fugu Max는 더 흥미로운 승부수이자, 입수 가능한 증거로 볼 때 검증하기는 더 어려운 쪽이다. 설계 근거는 타당하다 — 코디네이터가 당신의 작업을 완료할 수 있는 가장 저렴한 모델을 안정적으로 고른다면, 완료된 작업당 중위 비용은 요율표가 내려가지 않아도 낮아진다. 하지만 $2.00 / $6.00의 토큰 요율에 Fugu Max의 우위가 있는 것은 아니다. 그 요율은 정확히 Grok 4.6과 같다. 우위는 더 적은 토큰을 소비하는 데서 나와야 하는데, Sakana는 실제로 그렇다는 점을 보여줄 측정치를 공개하지 않았다.
그러니 두 벤더가 요구하는 방식대로 비교를 실행해 보세요. Grok 4.6을 게이트웨이에 올리고, Fugu Max를 기능 플래그 뒤에서 호출하고, 여러분의 업무와 비슷한 작업에서 완료된 작업당 출력 토큰을 세어 보세요. Fugu Max가 동일한 요금으로 단일 모델보다 더 적은 토큰으로 끝낸다면, 캐시 할인과 조정은 실제 비용 절감이며 전환은 정당합니다. 그렇지 않다면, 버전 번호는 그대로인 채 시스템 구성이 여러분 발밑에서 바뀔 수 있는 시스템에 동일한 요금을 지불하는 셈입니다.
이번 분기에 그 측정 없이 결정할 수 있는 모든 것에 대해서는, 스코어보드가 있는 모델부터 시작하세요.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
