
Fugu Ultra v2 vs Qwen3.8-Max: 가격표가 잘못된 숫자인 이유
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2는 출력 토큰 100만 개당 $30.00입니다. Qwen3.8-Max는 $6.00입니다. 이는 5대 1 격차이며, 이 두 에이전트 시스템 중에서 그 비율만 보고 고른다면 잘못 고르게 됩니다. 왜냐하면 둘 다 실제로는 가격표가 시사하는 방식으로 청구되지 않기 때문입니다. Artificial Analysis의 자체 측정에 따르면, Qwen3.8-Max는 Intelligence Index를 완료하는 데 1억 8천만 개의 출력 토큰을 생성했으며, 이는 중간값 모델의 8,900만 개보다 두 배 이상 많고 작업당 $2.67의 비용이 들었습니다. 이는 토큰 기준으로는 알뜰한 모델이지만 답변 기준으로는 사치스러운 모델입니다. 2026년 9월 11일 출시된 Sakana AI의 Fugu Ultra v2는 정반대 형태입니다. 요청마다 생성하고 조정하는 다른 연구소 모델들의 비공개 풀을, Sakana에 따르면 에이전트가 추가되어도 배수로 늘어나지 않는다고 하는 하나의 혼합 요율로 청구합니다. 하나는 오랫동안 소리 내어 생각하는 단일 2.4조 매개변수 모델입니다. 다른 하나는 도움을 고용하는 작은 조정자입니다. 두 모델의 토큰 가격을 비교하는 것은 어느 쪽이 실행 비용이 더 저렴한지에 대해 거의 아무것도 알려주지 않습니다.
비싸게 되는 두 가지 상반된 방법
{{1}}메커니즘부터 시작하세요. {{/1}}{{2}}이것이 이 비교에서 다른 모든 차이를 설명해 주기 때문입니다.{{/2}}
Qwen3.8-Max는 희소 전문가 혼합 모델입니다 — 총 2.4조 개의 매개변수, 토큰당 약 950억 개가 활성화 — 더 커지는 대신 더 오래 작업함으로써 최전선에 근접한 결과를 달성합니다. Artificial Analysis는 이를 초당 37.8개의 출력 토큰으로 측정했으며, 속도 부문에서 200개 모델 중 #154위에 올랐고, Intelligence Index 전반에 걸쳐 1억 8천만 개의 출력 토큰을 생성했습니다(장황함 부문에서 200개 중 #70위). Intelligence Index 작업당 비용은 $2.67로 기록되며, 캐시 할인율은 88%로 이례적으로 깊은데, 이것이 실제로 여기서 비용을 좌우하는 지렛대입니다: 동일한 컨텍스트를 계속 다시 읽는 긴 에이전트 실행은 저렴하지만, 계속 새로운 텍스트를 생성하는 실행은 그렇지 않습니다.
Fugu Ultra v2는 같은 문제를 반대쪽 끝에서 접근한다. 이는 오케스트레이터다. 즉, 약 70억 개 파라미터로 보고된 작고 훈련된 코디네이터로, 요청을 읽고 Sakana의 TRINITY 작업에서 나온 Thinker, Worker, Verifier 역할에 따라 에이전트 팀을 구성한 다음 답변을 합성한다. 토큰 청구액은 하위 에이전트가 생성한 것에 코디네이터 자체의 합성 텍스트를 더한 합계다. Sakana는 가격 FAQ에서 관련된 최상위 모델에 연동된 하나의 혼합 요율로 청구되며 에이전트를 추가해도 청구액이 배로 늘지 않는다고 약속하는데, 이는 팬아웃이 비용을 배로 만드는 전형적인 다중 에이전트 폭증 문제를 제거한다. 하지만 그것이 제거하지 못하는 것은 볼륨이다. 백만 출력 토큰당 $30.00에서 중요한 숫자는 얼마나 많은 에이전트가 실행되었고 얼마나 많이 썼는가이며, 그것은 여러분도 Sakana도 가격 페이지에서 예측할 수 없는 숫자다.
그것이 가격 격차에 대한 정직한 규정이다. 그것은 총액이 아니라 요율이다. 산출량을 예측할 수 없는 워크로드에 적용되는 다섯 배 높은 요율은 비용이 다섯 배라는 뜻이 아니다 — 그것은 예측 가능한 하한을 지닌, 한계 없는 배수다.

사양서, 그리고 그것을 결정짓는 단 하나의 행
• 가격 — Fugu Ultra v2는 100만 토큰당 입력 $5.00 / 출력 $30.00, Qwen3.8-Max는 입력 $2.00 / 출력 $6.00
• 캐시된 입력 — Fugu Ultra v2 100만당 $0.50 vs Qwen3.8-Max 100만 읽기당 $0.25, 그리고 Artificial Analysis가 측정한 88% 캐시 할인
• 장문 컨텍스트 할증 — Fugu Ultra v2는 272K 토큰 초과 시 입력이 $10.00, 출력이 $45.00로 두 배가 되지만, Qwen3.8-Max는 장문 프롬프트 할증이 없고 윈도 전체에 걸쳐 동일합니다
• 컨텍스트 창 — Fugu Ultra v2 1M 토큰 vs Qwen3.8-Max 1M 토큰
• 출력 상한 — Fugu Ultra v2는 단일 수치로 공개되지 않음, Qwen3.8-Max는 약 128K 토큰
• 입력 모달리티 — Fugu Ultra v2 텍스트(그 배후에 pool 자체의 역량이 있음) vs Qwen3.8-Max 텍스트, 이미지, 비디오 및 PDF
• 가중치 — Fugu Ultra v2는 비공개, 풀 멤버십은 설계상 미공개 vs Qwen3.8-Max는 맞춤형 라이선스 하에 Max급 체크포인트의 오픈 가중치를 공개
• 지역별 판매 여부 — Fugu Ultra v2는 EU/EEA에서 판매되지 않음 vs Qwen3.8-Max는 지역 제한 없이 이용 가능
• 독립적 평가 — Fugu Ultra v2에는 공개된 평가가 없고, 어떤 Fugu 모델에도 Artificial Analysis 페이지가 존재하지 않음. 반면 Qwen3.8-Max는 공개된 속도, 장황함, 작업당 비용 수치를 갖춘 실제 Artificial Analysis 항목임
마지막 두 행을 함께 읽으면 대결 구도가 더 선명해진다. Qwen3.8-Max는 버전으로 고정할 수 있고, 라이선스를 확인할 수 있으며, 체크포인트를 다운로드할 수 있고, 제3자의 스코어보드와 대조해 검증할 수 있는 모델이다. Fugu Ultra v2는 들여다볼 수도, 자체 호스팅할 수도, 유럽에서 구매할 수도, Sakana 외부의 누구와도 검증할 수도 없는 시스템이다. 272K 할증료가 이를 더 심화한다. 그 임계값을 넘으면 Fugu Ultra v2의 입력 요금은 두 배가 되고 출력 요금은 절반만큼 오르지만, Qwen3.8-Max의 요금은 움직이지 않는다. 두 시스템이 겨냥해 만든 장기 지평의 문서 및 저장소 작업에서는 더 저렴한 대표 요금이 더 평탄한 요금이기도 하다.
모두가 인용하는 Qwen3.8-Max 수치는 이미 구식입니다
지난 2주 동안 어디에서든 이 모델에 대해 읽어보셨다면, 아마도 Artificial Analysis Intelligence Index 58, 58.1 또는 58.4를 보셨을 것입니다. 그 수치들은 실제였지만 이제는 더 이상 현재 값이 아닙니다. Artificial Analysis는 2026년 9월 7일 자사 지수를 v4.3으로 재보정하면서 전반적으로 점수를 압축했고, 현재 라이브 Qwen3.8-Max 페이지에 표시된 값은 이제40으로, 200개 모델 중 30위에 해당하며 — 재산정된 점수를 나타내는 "Updated" 배지가 함께 표시됩니다. 이전 글들에는 이전 척도로 측정된 노력 비용도 담겨 있었습니다. 과제당 64턴으로, 이전 Qwen 세대의 14턴과 대비되며, Intelligence Index 과제당 약 $1.14입니다. 현재 페이지는 과제당 $2.67, 초당 출력 토큰 37.8개, 그리고 해당 지수에서 1억 8천만 개의 출력 토큰을 보여줍니다.
두 가지가 뒤따른다. 첫째, 재보정된 척도에서 Qwen3.8-Max는 프런티어의 2티어 나머지와 같은 대역에 속할 뿐, 프런티어와 동급은 아니다. 그리고 58점을 기준으로 Qwen3.8-Max를 Claude Opus 5나 Kimi K3와 비교해 순위를 매기는, 여러분이 읽는 어떤 비교든 그것은 서로 다른 척도에서 나온 스냅샷을 비교하는 셈이다. 둘째, 이번 맞대결에 더 유용하게도, 그 수정은 단방향이라는 점이다. Qwen3.8-Max에는 틀렸다가 고쳐질 수 있는 숫자가 있다. Fugu Ultra v2에는 숫자가 없다. 이 기사의 모든 Fugu 수치는 Sakana의 자체 평가에서 나온 것이며, 9월 11일 현재 Fugu Ultra v2나 다른 어떤 Fugu 모델을 위한 Artificial Analysis 페이지도 없다 — 그 URL은 404가 뜬다. 벤더가 점수판을 공개했는데 어떤 독립적인 제3자도 그 모델을 실행해 본 적이 없다면, 그 점수판이 기록의 전부다.
실제로 겹치는 부분과 그렇지 않은 부분
사카나는 Fugu Ultra v2가 8개 벤치마크 중 5개 — GDP.pdf, Chartography, SWEFish, DeepSWE, Toolathon — 에서 최고 또는 공동 최고이며, 8개 중 7개에서 상위 2위라고 보고한다. 발표 자료에 나온 두 개의 구체적인 수치는 같은 표에서 Chartography 48.3으로, Claude Opus 5의 27.3과 Claude Fable 5의 29.5에 맞선 결과이며, DeepSWE는 74.3이다. Alibaba가 직접 공개한 Qwen3.8-Max의 행에는 Terminal-Bench 2.1이 86.6, OSWorld-Verified가 86.1, GPQA Diamond가 92.6, SWE-bench Pro가 67.7이 포함된다.
그 두 목록의 공통점이 무엇인지 보라: 아무것도 없다. 두 벤더 표 모두에 등장하는 벤치마크는 단 하나도 없다. Sakana 수치와 Alibaba 수치를 나란히 놓고 승자를 읽어낼 수 있는 행은 없으며, 이는 "코딩 에이전트에서 어느 쪽이 더 나은가"에 대한 정직한 답이 발표된 증거로는 답할 수 없다는 뜻이다. 존재하는 것은 벤더가 고른 여덟 개 행만 있고 외부 검증이 없는 한 시스템, 그리고 벤더 행들에 더해 비용과 속도를 측정하는 독립적 항목이 있지만 능력을 일대일로 비교하지는 않는 한 시스템뿐이다. 이는 모델의 격차가 아니라 증거의 격차이며, 여러분이 구매하는 방식을 바꿔야 한다: 벤치마크로는 이들 중 하나를 고를 수 없으니, 실제로 검증할 수 있는 속성으로 골라야 한다.

공개 가중치 대 비공개 풀
여기서 통상적인 락인 논리가 뒤집히는데, 바로 이것이 이 조합에서 가장 흥미로운 점이다.
Sakana가 Fugu Ultra v2를 내세우는 핵심은 주권이다. 교체 가능한 오픈 모델 및 특화 모델 풀은 단일 벤더의 가격 결정, 지원 중단 일정, 정책 변화가 여러분의 제품을 무너뜨릴 수 없게 해주며, 이번 릴리스는 v2에서 풀의 구성이 바뀌었다는 점을 언급함으로써 그 점을 분명히 한다. 회사는 또한 Fugu Ultra v2의 점수가 에이전트 풀에 Claude Fable 5, Claude Fable 5.1 또는 GPT-6 Astra 없이 달성되었다고 명확히 밝힌다. 이용 가능한 가장 강력한 세 모델을 이겼다고 주장하면서도 그중 어느 것도 호출하지 않는다는 점을 확인하는 것이다. 풀에 무엇이 들어 있든, Sakana 자체의 계산으로는 시장 최상위가 아니다.
하지만 그 헤지에는 가격표에 없는 비용이 따릅니다. 풀을 볼 수 없고, 구성원을 Ultra 티어에 넣거나 빼도록 선택할 수 없고, 그중 어떤 것도 자체 호스팅할 수 없으며, EU/EEA에서는 아예 실행할 수 없습니다. 다른 연구소의 가중치를 싱가포르 기반에서 오케스트레이션하는 것은 가중치를 직접 소유하는 것과는 다른 위험 프로필입니다. Qwen3.8-Max는 이를 정확히 뒤집습니다. 그것은 한 공급업체의 모델이므로 한 공급업체의 결정에 그대로 노출되지만, Alibaba는 Max급 Qwen3.8-2.4T-A95B 체크포인트의 오픈 가중치를 사용자 지정 라이선스로 공개했습니다. 이는 탈출구가 수사적 표현이 아니라 실제라는 뜻입니다. 가격이나 조건이 바뀌면 해당 모델을 자체 인프라에서 서빙할 수 있습니다. 실제 두려움이 공급업체가 발을 빼는 것인 팀에게는, 다운로드 가능한 체크포인트가 검사할 수도 없는 풀에 대한 약속보다 더 강력한 보장입니다.
두 시스템을 넘나들며 에이전트를 운영하는 사람이라면 짚고 넘어가야 할 부차적인 요점이 하나 있습니다. Qwen3.8-Max는 입력 $2.00, 출력 $6.00으로 저희 카탈로그에 올라와 있습니다, 이는 알리바바의 정가에 0% 마크업이 그대로 전달된 가격이며 — 벤더 가격이 바뀌면 같은 날 같은 키에 반영되고, 속도 제한에 걸리거나 성능이 저하된 공급자 경로는 자동 장애 조치가 처리합니다. Fugu Ultra v2는 OrcaRouter에 없습니다. 이 모델은 Sakana 자체의 OpenAI 호환 API와 여러 서드파티 플랫폼을 통해 제공되며, 이전 Fugu에서 옮겨오는 것은 한 줄짜리 파라미터 변경이면 끝납니다. 라우터가 코디네이터를 대신할 수 없고, 코디네이터가 장애 조치 능력을 대신할 수 없습니다. 두 속성을 모두 원한다면 두 벤더의 시스템을 운영하는 것이므로 청구서 두 장을 감당할 예산을 잡아야 합니다.
어느 것을 선택해야 할까요
Qwen3.8-Max를 선택하세요. 예측하고 검증하고 탈출할 수 있는 모델이 필요하다면 말입니다. 이 모델은 리스트 기준으로 Fugu Ultra v2 출력 속도의 3분의 1이고, 롱컨텍스트 절벽이 없으며, Fugu 풀의 모달리티가 기반 에이전트가 우연히 지원하는 것에 좌우되는 것과 달리 이미지, 비디오, PDF를 받아들입니다. 되돌아갈 수 있는 체크포인트를 공개하고, 어디서나 판매되며, 실제로 청구서를 좌우하는 항목을 측정하는 실시간 독립 엔트리를 갖추고 있습니다 — 초당 37.8 토큰과, 약정하기 전에 모델링할 수 있는 작업당 비용 수치입니다. 약점도 똑같이 구체적이며 언급할 가치가 있습니다. 느리고, 속도 부문에서 200개 중 #154위이며, 인덱스에서 1억 8천만 토큰으로 엄청나게 장황하고, Artificial Analysis는 별도로 환각률이 이전 세대 대비 23%에서 40%로 상승했다고 측정했는데, 이는 바로 이 모델이 마케팅되는 자율적 다단계 작업에 심각한 우려 사항입니다. 검증기 예산을 잡고, 딥 캐시 할인을 적극적으로 활용하세요.
작업이 장기적이고 검증 가능하며, 예산이 프로덕션이 아니라 탐색적이고, EU/EEA 밖에 있다면 Fugu Ultra v2를 선택하세요. 코디네이터를 둬야 한다는 구조적 근거는 실재하며, 벤더 자체의 예시들도 일관되게 이를 가리킵니다 — 단일 H100에서 14시간에 걸쳐 수행된 123개 실험 자동 연구 실행, 그리고 두 개의 익명 프런티어 베이스라인이 완전히 크래시한 상황에서 300개의 뒤섞인 큐브를 모두 완료한 순수 Python 루빅스 큐브 솔버가 그렇습니다. 이는 익명화된 베이스라인을 사용한 벤더 선별 예시들이라 겉보기만큼 많은 것을 입증하지는 못하지만, 패턴은 일관됩니다: 정확성을 검증할 수 있고 어려운 부분이 지속성인 작업에서는 검증자를 생성하는 것이 하나의 모델에 더 세게 요구하는 것보다 낫습니다. 여러분이 사는 것은 바로 그 지속성이며, 그 요금은 Qwen3.8-Max의 다섯 배이고, 품질을 감사할 수도 풀을 고정할 수도 없는 시스템에서 그렇습니다. 범위를 정해 파일럿을 돌리고, 토큰당이 아니라 완료된 작업당 출력 토큰을 측정하며, 첫 실행 전에 상한을 정하세요.

가격표의 숫자가 틀린 이유는 이 두 제품 모두 답변의 비용을 토큰 비용에서 떼어놓았기 때문이다. Fugu Ultra v2는 이름을 밝히지 않는 모델들로 팬아웃하여 그렇게 한다. Qwen3.8-Max는 1억 8천만 토큰 동안 생각함으로써 그렇게 한다. 작업당 토큰 볼륨을 이미 알고 있다면 계산은 간단하니 직접 계산해야 한다. 대부분의 팀은 그 숫자를 모르며, 그들에게 결정은 더 단순한 것으로 귀결된다: Qwen3.8-Max는 감사하고, 가격을 매기고, 포기할 수 있는 선택이며, Fugu Ultra v2는 조정이 역량을 이긴다고 베팅하는 선택이다. 둘 다 방어 가능하다. 그중 하나만 증거를 함께 제시한다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
