
Fugu Max vs Qwen3.8-Max: 같은 가격, 같은 벤치마크, 공개된 숫자는 단 하나
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
Fugu Max와 Qwen3.8-Max는 동일한 요율을 책정한다: 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00. Sakana AI는 2026년 9월 11일에 Fugu Max를 출시했고, Alibaba는 8월 초부터 Qwen3.8-Max를 제공해 왔으며, 두 업체는 서로 반대 방향에서 동일한 요율표에 도달했다 — 하나는 라우팅 정책에 가격을 매기고, 다른 하나는 2조 4천억 파라미터 모델에 가격을 매긴 것이다. 이 동률은 결정에서 가격을 완전히 배제시키는데, 이는 유난히 깔끔하다. 남는 것은 증거이며, 두 진영은 그 지점에서 다른 어디보다 더 크게 갈린다. 두 업체의 표 모두 Terminal Bench 2.1을 언급한다. Alibaba는 Qwen3.8-Max에 대해 86.6을 기재한다. Sakana는 Fugu Max가 Terminal Bench 2.1에서 최고 종합 점수를 차지한다고 말하면서도, 그 테스트든 자사가 우승한다고 주장하는 다른 다섯 테스트든, 수치를 전혀 기재하지 않는다.
양측이 모두 언급하는 단 하나의 기준
이것은 전체 매치업을 단 한 줄로 압축한 것이므로, 정확하게 짚고 넘어갈 가치가 있습니다.
Sakana의 발표 자료에는 Fugu Max가 종합 최고 점수를 차지한 여섯 가지 벤치마크가 나열되어 있다: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench, SWEFish. 다섯 개는 공인된 공개 평가이고, 여섯 번째인 SWEFish는 Sakana 자체의 코딩 벤치마크다. 이 여섯 가지 중 어느 것에 대해서도 발표 자료는 값이나 격차, 또는 그 옆에 놓을 경쟁사 수치를 제시하지 않는다. 이에 맞물리는 주장, 즉 Fugu Max가 10개 벤치마크 중 7개에서 비용-성능 파레토 프런티어를 확장한다는 주장 역시 축 위의 한 점이라기보다 차트상의 위치에 관한 진술이다.
Alibaba가 Qwen3.8-Max에 대해 공개한 항목에는 Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, GPQA Diamond 92.6, SWE-bench Pro 67.7이 포함됩니다. 모두 벤더가 보고한 수치이며, 전부 숫자입니다. 그래서 두 회사가 이름을 붙이기로 선택한 단일 테스트에서, 한쪽은 수치를 공개했고 다른 쪽은 순위를 공개했습니다. 그것만으로 어느 시스템이 더 나은지 결론 내릴 수는 없습니다 — Sakana의 "best overall"은 91을 의미할 수도, 87을 의미할 수도 있습니다. 결론 내릴 수 있는 것은 발표 시점 기준으로 이 질문에 답하는 공개 증거가 없다는 것, 그리고 더 큰 주장을 하는 벤더가 바로 그것을 수치화하기를 꺼리는 쪽이라는 것입니다.
동일한 가격, 상반된 구성
• 입력 — Fugu Max 1M 토큰당 $2.00 vs Qwen3.8-Max 1M 토큰당 $2.00
• 출력 — Fugu Max 1M 토큰당 $6.00 vs Qwen3.8-Max 1M 토큰당 $6.00
• 캐시된 입력 — Fugu Max 1M 토큰당 $0.25 vs Qwen3.8-Max 1M 토큰당 $0.25, 그리고 Artificial Analysis는 Qwen 측에서 88퍼센트의 캐시 할인을 독립적으로 측정합니다
• 장문 프롬프트 할증 — Fugu Max는 릴리스에 등급이 명시되지 않음 vs Qwen3.8-Max는 창 전체에 걸쳐 정액 적용, 할증 없음
• 컨텍스트 및 출력 — Fugu Max는 두 수치 모두 공개하지 않았고, Qwen3.8-Max는 약 128K의 출력 상한을 지닌 1M 토큰 윈도우
• 입력 모달리티 — Fugu Max 텍스트, 그 뒤에 풀 자체의 기능이 뒷받침하는 방식 vs Qwen3.8-Max 텍스트, 이미지, 동영상 및 PDF
• 아키텍처 — Fugu Max는 비공개 풀을 대상으로 훈련된 코디네이터로, NVIDIA와의 협업을 통해 NVIDIA Nemotron 패밀리를 포함한 오픈 웨이트 및 특화 모델로 Max를 위해 확장됨 vs Qwen3.8-Max는 대략 총 2.4조 개의 파라미터와 토큰당 약 950억 개의 활성 파라미터를 갖춘 하나의 희소 전문가 혼합 모델
• 가중치 — Fugu Max는 클로즈드, 풀 구성원 여부는 설계상 비공개. 반면 Qwen3.8-Max는 맞춤형 라이선스에 따라 Max급 체크포인트의 오픈 가중치를 공개
• 독립적 평가 — Fugu Max는 공개된 결과가 없고, 어떤 Fugu 모델에도 Artificial Analysis 페이지가 존재하지 않는다. 반면 Qwen3.8-Max는 속도, 장황함, 작업당 비용 수치가 공개된 실제 Artificial Analysis 항목이다.
그 행 중 네 개는 Fugu 쪽에서는 "게시되지 않음"으로 표시되고 Qwen 쪽에서는 수치를 담고 있습니다. 요율이 동일할 때, 그것이 비교의 전부입니다: 같은 돈으로 설명할 수 있는 시스템 하나와 설명할 수 없는 시스템 하나를 사게 됩니다.

한 컬럼의 배후에는 제3자가 있습니다
Artificial Analysis는 재산정된 v4.3 Intelligence Index에서 Qwen3.8-Max에 40점을 부여하며, 200개 중 30위이고, Intelligence Index 작업당 비용은 $2.67, 초당 출력 토큰은 37.8개입니다 — 속도 면에서 200개 중 154위에 오를 정도로 느립니다. 같은 항목은 지수 전반에서 생성된 출력 토큰 1억 8,000만 개를 기록하는데, 이는 중간값 모델의 8,900만 개보다 두 배 이상 많으며, 88퍼센트의 캐시 할인을 기록합니다.
그중 어느 것이 인용되기 전에 두 가지 정정이 적용된다. 첫째는 Qwen3.8-Max에 대해 널리 퍼진 58 — 또는 58.1, 또는 58.4 —라는 수치가 Artificial Analysis가 2026년 9월에 지수를 재보정하기 전의 것이며, 현재 페이지에는 재산정된 점수를 표시하는 "Updated" 배지가 붙어 있다는 점이다. 예전 글들은 또한 이전 척도와는 다른 노력 비용을 담고 있었는데, 작업당 64턴으로, 이전 Qwen 세대의 14턴과 대비되며, Intelligence Index 작업당 약 $1.14였고; 현재 페이지에는 $2.67로 나온다. 둘째는 척도 아티팩트가 아니라 실제 경고다. Artificial Analysis는 Qwen3.8-Max의 환각률이 이전 세대 대비 23퍼센트에서 40퍼센트로 상승한 것을 별도로 측정했다. 자율적 다단계 작업용으로 마케팅된 모델에게 이것은 각주가 아니라 검증기에 예산을 배정해야 하는 비용이다.
Fugu Max에는 어떤 종류의 독립 항목도 없다. Fugu Max에 딸린 모든 수치는 Sakana에서 비롯되며, 이 글을 쓰는 시점에 Fugu Max나 그 형제 모델 중 어느 것에도 Artificial Analysis 페이지가 존재하지 않는다. 그것은 비난이 아니다 — 몇 시간 전에 공개된 모델에 제3자 보도가 있을 리 없기 때문이다 — 하지만 그것은 두 칼럼이 똑같이 검증 가능하지 않다는 뜻이며, Sakana 외부의 누군가가 그것을 돌려보기 전까지는 그런 상태로 남을 것이다.
초과 지출하는 두 가지 방법
이 두 시스템은 모두 답변 비용을 토큰 비용과 분리했으며, 서로 반대 방향으로 그렇게 한다. Qwen3.8-Max는 토큰 기준으로는 알뜰하고 답변 기준으로는 풍성하다: Intelligence Index에서 1억 8천만 개의 출력 토큰으로 중앙값의 두 배이며, 작업당 $2.67이다. 이는 큰 모델이라기보다 오래 작동하며, 88퍼센트 캐시 할인이 청구서를 통제하는 지렛대다 — 같은 컨텍스트를 계속 다시 읽는 긴 에이전트 실행은 저렴하게 유지되지만, 계속 새로운 텍스트를 생성하는 실행은 그렇지 않다.
Fugu Max는 토큰당 비싸고 답변은 예측할 수 없다. 그 코디네이터는 하위 에이전트를 생성하며, 각 하위 에이전트는 추론과 출력 텍스트를 작성하고 이는 백만 토큰당 $6.00로 청구된다. 여기에 코디네이터 자체의 종합이 더해진다. Sakana는 멀티 에이전트 실행이 참여하는 최상위 모델에 연동된 하나의 혼합 요율로 청구되며, 에이전트를 추가해도 청구액이 배로 늘지 않는다고 약속한다. 이는 순진한 멀티 에이전트 시스템을 감당할 수 없게 만드는 최악의 팬아웃 폭증을 제거한다. 그것이 볼륨을 제거하지는 않는다. 그리고 볼륨 문제에 관해 이번 릴리스는 중요한 부분에서 침묵한다: Sakana 자체의 보도는 작업 도중 모델을 전환하면 컨텍스트 캐시 재사용이 줄어들고 추가 오케스트레이션 토큰이 생성될 수 있다고 밝히며, 회사가 Max의 캐시 적중률이나 작업당 총 토큰 비용을 공개하지 않았다는 점을 확인한다.
그러니까 같은 $2.00 / $6.00 요율은 한쪽에서는 예측 가능한 숫자이고, 다른 쪽에서는 하한만 있는, 상한이 없는 배수다. Qwen3.8-Max의 장황함은 약정하기 전에 측정할 수 있지만, Fugu Max의 장황함은 그렇지 않다.
탈출구 테스트
여기에서 통상적인 락인 논리가 뒤집히는데, 그것이 이 짝에서 가장 유용한 점이다.
Sakana가 Fugu Max를 내세우는 근거는 회복탄력성이다. 오픈 웨이트 모델과 특화 모델에 걸쳐 있고, NVIDIA Nemotron 제품군으로 Max를 위해 확장된 풀은, 단일 프런티어 공급업체의 지원 중단, 가격 재책정 또는 지역 철수가 당신의 제품을 무너뜨릴 수 없음을 의미한다 — 진정한 헤지이며, 회사가 이를 판매한다고 분명히 밝히는 것이기도 하다. 하지만 그 헤지는 외부에서 검증할 수 없다. 그 풀을 볼 수도, 특정 구성원을 넣거나 뺄 수도, 그중 무엇도 자체 호스팅할 수도, EU/EEA에서 아예 실행할 수도 없다. 들여다볼 수 없는 풀에 대한 약속은 들리는 것보다 약한 보장이다.
Qwen3.8-Max는 그 논리를 반대 방향으로 전개한다. 이는 단일 벤더의 모델이므로 단일 벤더의 결정에 노출된다 — 하지만 Alibaba는 Max급 Qwen3.8-2.4T-A95B 체크포인트의 공개 가중치를 맞춤형 라이선스로 공개했고, 이는 탈출구가 수사적 표현이 아니라 실제라는 뜻이다: 가격이나 조건이 바뀌면 그 모델을 자체 인프라에서 서빙할 수 있다. 실제 두려움이 벤더가 발을 빼는 것인 팀에게는 다운로드 가능한 체크포인트가 풀에 대한 설명보다 낫다.
둘 중 하나를 호출
Qwen3.8-Max는 저희 카탈로그에 백만 토큰당 입력 $2.00, 출력 $6.00으로 등록되어 있습니다. 이는 Alibaba의 정가에 0% 마크업을 그대로 반영한 가격이므로, 공급사 가격 변경이 마이그레이션 일정이 아니라 같은 날 같은 키에 적용됩니다. 카탈로그의 나머지와 동일한 base URL에서 OpenAI와 호환되므로, 즉조건부 라우팅 규칙, 페일오버 체인, 또는 모델 퓨전 패널 뒤에 배치할 수 있습니다. 별도의 계약이나 코드 변경도 필요 없습니다 — 자동 페일오버가 속도 제한이 걸리거나 성능이 저하된 공급자 경로를 커버합니다. 지난 7일 동안 이 게이트웨이를 통해 1억 2,770만 토큰이 이동했습니다.
Fugu Max는 OrcaRouter에 없습니다. Fugu Max는 Sakana 자체의 OpenAI 호환 API와 여러 서드파티 플랫폼을 통해 여러분에게 도달하며, 회사는 기존 Fugu 통합이 한 줄 매개변수 변경만으로 업그레이드된다고 말합니다. 둘 다 동일한 요청 형식을 사용하기 때문에, 벤치마크 격차를 해소하는 가장 저렴한 방법은 Sakana가 그것을 공개하기를 기다리는 것을 멈추고, 여러분의 자체 워크로드에서 하나의 플래그 뒤에서 둘 다 실행한 뒤 완료된 작업당 출력 토큰 수를 세는 것입니다. 그것이 어느 공급업체도 제공하지 않은 측정치입니다.

어느 것이며, 언제인가요?
Qwen3.8-Max는 감사하고, 가격을 매기고, 버릴 수 있는 선택지다. 동일한 요율표에서 1M 토큰 창을 제공하며 장문 프롬프트 할증이 없고, 이미지·비디오·PDF 입력, 다운로드 가능한 Max급 체크포인트, 청구서를 좌우하는 요소들을 측정하는 실시간 독립 항목, 그리고 캐시 입력 88% 할인을 제공한다. 그 비용도 똑같이 구체적이다. 초당 37.8토큰으로 느리고, 속도 면에서는 해당 분야 하위권에 랭크되며, 인덱스에서 1억 8천만 토큰으로 엄청나게 장황하고, 측정된 환각률은 이전 세대 대비 대략 두 배로 늘었다. 이는 바로 이 모델이 판매되는 자율 작업에 심각한 우려다. 캐시 할인을 적극 활용하고 검증자 예산을 잡아라.
Fugu Max는 조정이 역량을 이긴다는 데 거는 베팅이다. 당신의 작업이 장기 지평이고 검증 가능하며, 검증자를 생성하는 조정자가 단일 모델이 두 번 실패하는 작업을 완수한다면, 오케스트레이션 토큰은 재시도보다 저렴하고, 동일한 요금표는 전혀 무승부가 아니다. 당신이 사는 것은 지속성이다. 풀을 고정할 수 없고, 컨텍스트 윈도가 공개되지 않았으며, 여섯 번의 벤치마크 승리에 아무 수치도 붙지 않은 시스템에서 — 테스트 이름은 대고 수치는 감추기로 한 벤더로부터.
두 제품 모두 토큰당 비용은 같습니다. 그중 하나만이 그 대가로 무엇을 얻는지 알려줍니다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
