
Fugu Max vs Claude Opus 5: 4배 더 저렴하고, 아무도 발표하지 않은 숫자
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Max는 100만 토큰의 출력을 생성하는 데 6.00달러가 듭니다. Claude Opus 5는 25.00달러가 듭니다. Sakana AI는 2026년 9월 11일 Fugu Max를 출시했는데, 이는 각 작업을 자체 풀에서 가장 효율적인 모델로 라우팅하는 조정자로서, Anthropic의 플래그십 대비 4배의 출력 격차가 이번 출시의 헤드라인 사실이 될 만큼 공격적으로 가격을 책정했습니다. 이번 출시에 포함되지 않은 것은 Fugu Max가 실제로 얼마나 잘 수행하는지를 설명하는 단 하나의 숫자입니다. Sakana는 6개 벤치마크에서 "최고 종합 점수"를 받고 10개 중 7개에서 비용-성능 프런티어를 확장한다고 말합니다 — 이는 축 위의 값이 아니라 차트에서의 위치에 관한 진술입니다. 반면 Claude Opus 5는 거의 모든 작업에 대해 공개된 점수와 함께 제공됩니다. 따라서 이 비교의 정직한 버전은 저렴함 대 비쌈이 아닙니다. 그것은 측정된 것 대 주장된 것이며, 가격 격차가 바로 그 트레이드오프에 대해 논쟁할 가치가 있게 만드는 것입니다.
격차, 그리고 Sakana가 하지 않기로 선택한 비교
Sakana의 릴리스 페이지는 Fugu Max의 출력 단가를 다른 모델들과 비교하여 정당화한다. 그 페이지가 거론하는 세 모델은 Claude Sonnet 5, GPT-5.6 Terra, Kimi K3이며, Fugu Max의 출력 가격이 이들보다 40~60퍼센트 낮다는 주장이다. 누가 빠졌는지 주목해 보라. Claude Opus 5는 그 목록에 없으며, 그 이유는 산수에 있다. 6.00달러 대 25.00달러라는 구도에서 Fugu Max는 Opus 5보다 40퍼센트 저렴한 것이 아니라 76퍼센트 저렴하다. Opus 5를 이름에 넣었다면 그 주장은 경쟁력 있어 보이기보다는 믿기 어려워 보였을 것이므로, 비교는 플래그십 아래 등급을 상대로 이루어진다.
그것은 가격 책정에 대한 비판이 아니다. 그 가격은 정말로 낮다. 그것은 주변 문장이 무엇을 하고 있는지에 대한 지적이다. Sakana 자신의 프레이밍 — '두 배에서 여섯 배 더 낮은 비용으로 엘리트 모델들의 턱밑까지 추격하는' 성능 — 은 그것이 이름을 대기로 선택한 모델들에 맞춰져 있다. Claude Opus 5와 비교하면 그 배수는 두 배에서 여섯 배가 아니라 출력 기준으로 네 배를 넘는다. Opus 5가 그 문장의 기준에서 여전히 '엘리트 모델'인지는 명시되지 않았는데, 이는 전체적인 세일즈 포인트가 최전선에서의 비용 대비 성능 효율성인 발표에서 의아한 누락이다.
• 입력 가격 — Fugu Max 1M 토큰당 $2.00 vs Claude Opus 5 1M 토큰당 $5.00
• 출력 가격 — Fugu Max 1M 토큰당 $6.00 vs Claude Opus 5 1M 토큰당 $25.00
• 캐시된 입력 — Fugu Max 100만 토큰당 $0.25 vs Claude Opus 5 캐싱은 캐시된 입력에 대해 최대 90% 할인으로 책정됨
• 벤치마크 점수 — Fugu Max는 공개된 수치가 없고, 숫자 없이 6개 벤치마크 승리를 주장한 반면, Claude Opus 5는 Anthropic이 보고한 SWE-bench Verified 96.0%, SWE-bench Pro 79.2%, ARC-AGI 3에서 약 30.2%를 기록했습니다
• 아키텍처 — 비공개 풀을 대상으로 학습된 코디네이터인 Fugu Max 대 버전으로 고정할 수 있는 단일 모델인 Claude Opus 5
• 컨텍스트 — Fugu Max 미공개 vs Claude Opus 5 1M 토큰, 128K 출력 상한
• 독립적 평가 — Fugu Max: 어떤 Fugu 모델에도 존재하지 않음 vs Claude Opus의 5개월치 제3자 리더보드 순위 기록
점수 없이 거둔 6승
여섯 가지 벤치마크는 Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench, SWEFish입니다. 그중 다섯 개는 널리 알려진 공개 평가입니다. 여섯 번째인 SWEFish는 Sakana 자체의 코딩 벤치마크로, 이는 여섯 번의 승리 중 하나가 해당 업체가 직접 작성하고 아직 공개하지 않은 테스트에서 채점되었음을 의미합니다.
나머지 다섯 개에 대해서는, 보도자료가 Fugu Max가 최고의 종합 점수를 달성했다고 밝히면서도 그 점수가 얼마인지, 경쟁사가 얼마를 받았는지는 밝히지 않는다. 이는 모델 발표로는 이례적인 형태다. 업체들은 으레 과장하지만, 보통은 숫자로 과장한다. 숫자가 널리 퍼지는 정보이기 때문이다. 여섯 번의 승리를 주장하면서 그중 단 하나의 수치도 제시하지 않는 보도자료는 오로지 주장 자체의 힘만으로 받아들여지기를 바라는 셈이다.
여기에는 너그러운 해석이 있고, 그것은 분명히 말할 가치가 있습니다. Fugu Max는 비용에 최적화된 코디네이터이지 역량을 밀어붙이는 제품이 아닙니다. Sakana는 Fugu Max를 Fugu Ultra v2와 같은 날 출시했는데, Fugu Ultra v2는 $5.00 입력과 $30.00 출력에서 최대 역량을 겨냥한 버전입니다. Max의 임무는 $6.00 출력에서 허용 가능한 품질에 도달하는 것이며, 오케스트레이터의 대표 점수는 달러당 점수보다 의미가 적습니다. 바로 그것을 파레토 플롯이 보여줍니다. 이번 출시를 위한 Sakana의 시각적 커뮤니케이션은 파레토 플롯입니다. 논지가 "정점이 아니라 곡선을 보라"는 것이라면, 원시 벤치마크 수치는 핵심에서 벗어난 것입니다.
인색하게 해석하면, 숫자를 제시했다가는 벤더가 굳이 피하고 싶은 비교를 불러일으켰을 수 있다는 뜻이다. 두 해석 모두 증거와 부합하며, 현재 공개 기록상으로는 둘을 구분할 수 없다. 말할 수 있는 것은 어떤 독립적인 주체도 어떤 Fugu 모델도 평가한 적이 없으며, Fugu Max나 그 형제 모델들에 대한 Artificial Analysis 항목도 없다는 점이다. 여섯 번의 승리를 포함해 발표 자료의 모든 수치는 Sakana에서 비롯된 것이다.

실제로 하고 있는 구매
단일 모델 벤더가 벤치마크를 발표할 때, 당신은 한 모델에 대한 주장을 사는 것이다. 오케스트레이터가 하나를 발표할 때, 당신은 풀에 대한 주장을 사는 것이다 — 벤더가 학습시키지 않은 모델들이, 라우팅 결정이 의도적으로 공개되지 않는 코디네이터 아래에서 실행되는 풀을. 여기서 이 풀은 Fugu가 사용한 것 중 가장 크다고 설명되며, NVIDIA와의 협업을 통해 NVIDIA Nemotron 패밀리를 포함한 오픈웨이트 및 특화 모델들로 확장되었다. 그 외의 구성원은 공개되지 않았다.
실질적인 결과는 Fugu Max의 버전이 바뀌지 않아도 그 동작이 달라질 수 있다는 점이다. 최전선 연구소의 지원 중단, 가격 변경, 또는 모델이 특정 지역에서 철수되는 일은 코디네이터가 호출할 수 있는 대상을 바꾸며, Sakana는 이러한 복원력이 바로 핵심이라고 분명히 말한다. 즉 벤더 종속과 API 회수에 맞서는 보호를 판매하고 있는 것이다. 그것은 실질적인 이점이며 공짜가 아니다. 또한 Fugu Max 벤치마크가 만약 공개된다면 Claude Opus 5 벤치마크에는 없는 만료일을 달게 될 이유이기도 하다.
Claude Opus 5의 가치 제안은 그 반대이며 가격 책정도 더 쉽습니다. 이는 단일 버전의 단일 모델로, 기본적으로 적응형 사고를 실행하면서 low에서 max까지의 명시적 노력 다이얼을 제공하고, 100만 토큰 컨텍스트 윈도우와 128K 출력 상한을 갖추었으며, 비전, 도구 사용, JSON 모드를 지원합니다. Anthropic은 {{KEEP}}SWE-bench Verified{{/KEEP}}에서 96.0%, {{KEEP}}SWE-bench Pro{{/KEEP}}에서 79.2%를 보고하는데, 이 수치들은 엔드포인트를 호출할 때 받는 바로 그 대상에서 측정된 것이지, 구성이 여러분 발밑에서 바뀔 수 있는 앙상블에서 측정된 것이 아닙니다. 프로덕션에서 실행되고 검토까지 거치는 워크로드에게 그 안정성은 백만 출력 토큰당 19.00달러를 지불하고 얻는 하나의 기능입니다.
완료된 작업당 비용, 토큰당이 아님
Fugu Max의 $6.00 출력 요율은 정말 매력적이며, 이를 검증하는 방법은 토큰 가격 비교를 멈추는 것입니다. 오케스트레이터가 에이전트를 생성하고, 각 에이전트는 추론 및 출력 토큰을 작성하며, 코디네이터는 종합을 작성합니다. Sakana의 Fugu 라인 가격 FAQ는 최상위 참여 모델을 기준으로 한 단일 혼합 요율을 보장하며, 멀티 에이전트 실행이 청구서를 쌓지 않습니다 — 이는 단순한 멀티 에이전트 시스템을 감당 불가능하게 만드는 최악의 팬아웃 곱셈을 제거합니다. 하지만 볼륨 자체를 없애주지는 않습니다. 청구되는 출력 토큰 수는 실행된 에이전트 수에 따라 달라지며, 백만 개당 $6.00에서 그 볼륨은 가격 페이지가 알려줄 수 없는 변수입니다.
Claude Opus 5의 비용 구조는 한 번의 호출, 하나의 모델, 당신이 직접 조정하는 노력 다이얼, 그리고 기다릴 수 있는 작업을 위한 절반 요율의 배치 처리로 이루어집니다. 실행하기 전에 비용을 예측할 수 있습니다. 1만 건이 넘는 실행에 걸쳐, 예측 가능성은 아무도 공개하지 않은 벤치마크 격차보다 훨씬 더 큰 가치를 지닙니다.
여기서 라우팅 질문과 모델 질문이 갈라집니다. Claude Opus 5는 OrcaRouter에서 Anthropic의 정가에 0% 마크업으로 — 공급자의 요율이 그대로 전달되므로, Anthropic의 가격이 바뀌면 같은 날 같은 키에 반영되며, 한 경로가 속도 제한에 걸리거나 사용할 수 없게 되면 공급자 경로 전반에 걸쳐 자동 장애 조치가 이루어집니다. Fugu Max는 저희 카탈로그에 없습니다. 이 모델은 Sakana 자체의 OpenAI 호환 API와 여러 서드파티 플랫폼을 통해 접할 수 있으며, 이전 Fugu에서 이 모델로 옮기는 것은 한 줄짜리 매개변수 변경입니다. Opus 5의 근거 기반과 예측 가능한 청구서를 원한다면 라우터가 더 짧은 길입니다. 어려운 문제에서 스스로 팬아웃을 구성하는 시스템을 원한다면, Fugu Max가 바로 그 일을 하는 것입니다 — 그리고 첫 요청부터 토큰 집계를 켜 둔 상태로 파일럿을 진행해야 합니다.

Fugu Max가 아마도 정답인 경우
설계에 마땅한 평가를 해 주자. 당신의 작업이 대량이고 검증 가능하며, 개별 호출 하나의 최대 역량보다 완료된 작업의 중앙값 비용을 중시한다면, 요청마다 가장 저렴하면서 충분한 모델을 고르는 오케스트레이터는 고정된 플래그십이 할 수 없는 일을 해낸다. Fugu Max는 바로 그런 워크로드를 정조준하며, 입력 요금 $2.00와 캐시 입력 $0.25는 그런 워크로드가 만들어내는 길고 반복적인 컨텍스트에 맞춰 책정된 가격이다. NVIDIA 협업도 겉보기보다 더 중요하다: Nemotron 모델은 오픈 웨이트이므로, 모델 풀에서 가장 저렴한 단계가 다른 연구소의 가격 결정에 노출되지 않는다.
그것이 당신에게 주지 않는 것은 Fugu Max가 Opus 5의 공개 수치가 가장 강력한 과제 — 리포지토리 규모의 소프트웨어 엔지니어링과 어려운 추론 — 에서 Claude Opus 5와 맞먹으리라고 믿을 근거다. 바로 그 항목들이 Sakana의 6개 벤치마크 보드가 수치를 전혀 제공하지 않는 행들이다. 당신의 문제가 저렴한 것보다 최고인 것이 더 중요한 유형이라면, $25.00의 출력 단가는 당신에게 실제로 필요한 것을 사준다.
결론
Claude Opus 5는 근거가 더 탄탄한 구매 선택이자 더 안전한 프로덕션 기본값입니다. 공개된 벤더 벤치마크, 고정할 수 있는 버전, 변하지 않는 컨텍스트 윈도, 128K의 출력 상한, 이득이 있을 때만 추론을 구매할 수 있게 해 주는 노력 다이얼, 그리고 수개월간 축적된 서드파티 결과가 이를 뒷받침합니다. Fugu Max는 더 흥미로운 승부수이자 확실히 더 저렴한 선택입니다. 입력에서는 약 60퍼센트, 출력에서는 약 76퍼센트 저렴하며, 캐시 요율은 Opus 5의 기본 입력 가격보다 10분의 1 수준 낮습니다.
검증 가능하고 반복적이며 대량의 작업을 운영하고 있고 EU/EEA 밖에 있다면, Fugu Max는 시작하기 전에 출력 토큰 상한을 설정하고 호출당 토큰이 아니라 완료된 작업당 토큰을 측정하는 범위 한정 파일럿을 해볼 가치가 있습니다. 이번 분기에 다른 사람에게 방어할 수 있는 프로덕션 결정이 필요하다면 Claude Opus 5가 여전히 답이며, OrcaRouter에서 Anthropic의 정가로 제공업체 요율이 그대로 전달된 채로 이용할 수 있습니다.

