
Sakana Fugu Max: 작동하는 가장 저렴한 모델을 선택하는 $2/$6 오케스트레이터
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
대부분의 모델은 할 수 있는 일이 얼마나 많은지를 두고 경쟁한다. Sakana Fugu Max는 해내고도 넘어갈 수 있는 일이 얼마나 적은지를 두고 경쟁한다. Sakana AI는 Sakana Fugu Max를 2026년 9월 11일, Sakana Fugu Ultra v2와 함께 출시했다 — 비용 대비 성능 곡선의 양 극단을 겨냥한 단일 오케스트레이션 아키텍처의 두 가지 튜닝이다. Fugu Max는 요청에 스스로 답하지 않는다. 작업을 읽고, 처리할 수 있을 법한 자체 풀에서 가장 저렴한 모델을 골라 그리로 라우팅한 뒤, 하나의 답변을 반환한다. Sakana는 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러로 책정했다.
흥미로운 부분은 그 가격이 무엇을 기준으로 측정되는가이다. Sakana는 Fugu Max의 출력 요금이 Claude Sonnet 5, GPT-5.6 Terra, Kimi K3보다 40–60% 저렴하다고 주장한다. 그 주장은 검증 가능하며, 출시일 벤치마크로서는 드물게도 산술이 맞아떨어진다. Sakana가 언급한 세 모델의 현재 정가와 비교하면, 백만 출력당 $6은 제시된 범위의 거의 정중앙에 놓인다. 훨씬 검증하기 어려운 것은 성능 측면인데, Sakana가 Fugu Max의 결과를 수치가 아니라 산점도로 공개했기 때문이다.
Fugu Max는 실제로 무엇인가
Fugu Max는 체크포인트가 아닙니다. 가중치 파일도, 파라미터 수치도, 다운로드할 것도 없습니다. Sakana는 이를 "단일 모델이 아닌 아키텍처"라고 설명합니다 — Fugu Ultra v2와 동일한 핵심 오케스트레이션 엔진으로, 다른 질문에 맞춰 조정되었습니다. Ultra v2는 사용 가능한 최고의 역량이 무엇인지 묻습니다. Fugu Max는 최저 비용으로 최고의 출력이 무엇인지 묻습니다.
그 구분은 운영 측면에서 중요합니다. Fugu Max를 파인튜닝하거나, 셀프 호스팅하거나, 왜 한 모델을 다른 모델보다 선택했는지 검사할 수 없습니다. 또한 라우팅 대상이 되는 전체 모델 목록을 볼 수 없습니다 — Sakana는 이 풀이 "지금까지 우리의 가장 큰 오픈 및 특화 모델 풀"로 확장된다고 말하며, Sakana가 8월에 발표한 NVIDIA 파트너십을 통해 추가된 NVIDIA의 Nemotron 제품군을 명시적으로 언급합니다. 풀의 나머지는 이름이 공개되지 않았고, Sakana는 요청별 라우팅 추적을 공개하지 않습니다.
보이는 것은 그 실체의 형태다. 공급업체 자체의 다이어그램은 Fugu Max를 팬아웃의 최상단에 보여준다. 하나의 오케스트레이터, 그 뒤에 일렬로 놓인 교체 가능한 모델 슬롯, 그리고 대상들 가운데 Sakana Namazu와 Fugu Max 자체가 있다. 이 풀은 설계상 교체 가능한 것으로 설명되며, 제시된 동기는 경제적일 뿐만 아니라 정치적이기도 하다 — Sakana는 오케스트레이션을 공급업체 종속, API 철회, 수출 통제에 대한 방어로 규정한다. 공급업체를 교체할 수 있는 시스템은 어느 한 공급업체에 의해서도 차단될 수 없다는 논거에서다.
Sakana Fugu 자체는 새로운 것이 아니다. 2026년 6월 22일 정식 출시되었고, 벤더의 자체 타임라인은 4월(베타), 6월(GA 및 Fugu Ultra v1), 7월(Fugu-Cyber와 Claude Code 인터페이스), 8월(Sakana Chat 및 NVIDIA 파트너십), 그리고 이제 9월로 이어진다. Fugu Max는 다섯 번째 월간 단계이지 데뷔가 아니며, 이미 Fugu를 운영 중인 사용자는 동일한 OpenAI 호환 엔드포인트에 한 줄 파라미터 변경만으로 마이그레이션 없이 업그레이드할 수 있다.
가격 주장은 정가와 맞닥뜨려도 살아남는다
Sakana의 $2 입력 / $6 출력 수치는 출시 페이지에 명확히 기재되어 있다. 2차 보도에서는 백만 토큰당 $0.25의 캐시 입력 요금을 덧붙이는데, 출시 페이지 자체에는 이 내용이 표시되어 있지 않다. 따라서 이 수치는 확인된 것이 아니라 보도된 것으로 취급해야 한다. 비교하자면, Fugu Ultra v2는 $5 입력, $30 출력이며, 캐시 입력은 $0.50이다.
이제 40–60%라는 주장입니다. 이름이 명시된 세 비교 대상은 현재 다음과 같습니다:
• GPT-5.6 Terra — 입력 $2 / 출력 $12, OpenAI가 7월 30일 단행한 인하로 출력 가격이 $15에서 내려간 후의 가격.
• Claude Sonnet 5 — 출시 프로모션 요율 기준 출력 $10, 표준 요율 기준 $15. 예정된 9월 인상이 철회된 것인지 아니면 단순히 연기된 것인지를 두고 소식통들의 의견이 엇갈리며, 그로 인해 범위가 넓게 형성되어 있다.
• Kimi K3 — 입력 $3 / 출력 $15, 캐시된 입력은 $0.30.
이에 비해, $6 출력은 Terra보다 50% 낮고, Sonnet 5의 프로모션 요금보다 40% 낮으며, Sonnet 5의 표준 요금보다 60% 낮고, Kimi K3보다 60% 낮다. 이 주장은 맞으며, 내부 원가 모델이 아니라 공개된 정가를 기준으로도 맞는다 — 이는 모든 출시일 비율에 대해 할 수 있는 말은 아니다.
같은 섹션에 있는 한 숫자는 같은 검증을 견디지 못한다. Sakana는 또한 Fugu Max가 "2~6배 더 낮은 비용으로 엘리트 모델에 근접한 성능"을 제공한다고 말한다. 40–60% 수치를 위해 이름을 든 세 모델과 비교하면, 원시 출력 가격 격차는 1.7×에서 2.5×에 더 가깝다. 더 큰 배수는 아마도 문장에 나온 세 모델이 아니라, $12보다 훨씬 더 비싼 모델들을 포함한 전체 프런티어 전반을 기준으로 측정된 듯하다. 이는 파레토 곡선에 관한 주장으로는 정당화될 수 있지만, 이름을 든 경쟁자들에 관한 주장으로는 정당화될 수 없으며, 출시 페이지는 이 둘을 구분하지 않는다.
라우팅 계층이 가격 측면에서 제 역할을 톡톡히 하는 지점이 바로 여기입니다. OrcaRouter는 공급자 정가를 마크업 없이 그대로 전달하므로, 공급자가 정가를 바꾸면 보시는 숫자도 그날 바로 바뀝니다. Fugu Max의 전체 전제가 풀 어딘가에 더 저렴한 모델이 있고 사용자가 그것을 의식하지 않고도 거기에 도달해야 한다는 것이므로 여기서 관련이 있습니다. 우리는 Fugu Max를 호스팅하지 않습니다. 그것은 Sakana 자체 API에서 실행됩니다. 하지만 패스스루 원칙은 $6 출력 요금을 $12 기존 모델과 비교해 확인해 볼 가치가 있게 만드는 바로 그 원칙이며, 어느 쪽 숫자든 맹신해서는 안 됩니다.
Sakana가 이긴다고 말하는 것, 그리고 당신에게 보여주지 않으려는 것

벤더의 벤치마크 섹션은 Fugu Max에 대해 세 가지 구체적인 주장을 제시합니다: 여섯 개 벤치마크 — Terminal Bench 2.1, GPQA-D, AA-LCR, GDP.pdf, AutomationBench, SWEFish — 에서 최고 종합 점수, 열 개 벤치마크 중 일곱 개에서 비용 대비 성능 파레토 프런티어의 확장, 그리고 토큰 지출의 일부만으로 "엘리트 모델에 필적할 만큼 근접한" 성능.
그 증거에 관해, 그중 어느 것 하나라도 인용하기 전에 명심해 둘 만한 세 가지가 있습니다.
첫 번째는 Sakana가 어떤 수치도 공개하지 않았다는 점이다. Fugu Max 결과는 10개의 산점도로 제시되는데, 세로축에는 점수, 가로축에는 백만 토큰당 달러로 표시된 출력 가격이 있고, Fugu Max는 회색 영역의 북서쪽에 빨간 점으로 그려져 있다. 그것이 위쪽 왼편에 자리한다는 것은 알 수 있다. 하지만 거기서 점수를 읽어낼 수는 없다. Terminal Bench 2.1, GPQA-D, AA-LCR은 모두 숫자를 직접 비교할 수 있는 공개 리더보드를 가지고 있는데, 어느 것도 제시되지 않았다.
두 번째는 여섯 개의 벤치마크 중 하나가 사카나 자체의 벤치마크라는 점입니다. SWEFish는 출시 페이지에서 "사카나 AI 자체의 코딩 과제와 사용 사례를 반영한 내부 벤치마크"라고 설명됩니다. 이는 자사 제품에 대한 적합성을 측정하는 정당한 방법이지만, 경쟁사와 비교하는 방법은 아닙니다 — 벤더가 설계한 벤치마크에서 벤더가 선택한 과제에 대한 점수는 다른 누구의 모델에 대한 증거가 아닙니다.
세 번째는 페이지에서 가장 강력한 수치들이 다른 모델의 것이라는 점이다. Fugu Max에게는 차트가 주어지는 자리에서 Fugu Ultra v2에게는 수치가 주어진다: Chartography 48.3은 Opus 5의 27.3, Fable 5의 29.5에 맞서고, DeepSWE 74.3, 8개 벤치마크 중 5개에서 최고 또는 공동 최고, 8개 중 7개에서 상위 2위다. Ultra v2는 또한 2026-08-28이라는 명시된 학습 컷오프를 제시하는데, 이는 출시 약 2주 조금 넘기 전이며, 의미심장하게도 Fable 5, Fable 5.1, GPT-6 Astra가 자사 풀에 없다는 점을 분명히 밝히고 있다. Sakana는 그 특정 모델들을 빌리지 않고도 거기에 도달했다고 주장하며, 이는 각주 하나에 담긴 주권 논쟁의 전부다.
이 중 어느 것도 Fugu Max의 주장을 거짓으로 만들지는 않는다. 그것은 그 주장을 검증되지 않은 것으로 만들 뿐이며, 6개 벤치마크라는 헤드라인을 해당 라벨을 붙인 경우에만 반복해도 안전한 것으로 만든다. 완전히 새로운 오케스트레이션 엔드포인트에 대한 독립적 평가는 드물고, 아직 아무것도 공개되지 않았다.
Fugu Max vs Fugu Ultra v2: 당신이 실제로 원하는 것은 어느 쪽인가

이것들은 경쟁 제품이 아니며, 숫자를 나란히 놓고 보면 둘 사이의 선택은 명확합니다. Fugu Max는 저렴한 쪽입니다: 입력 $2, 출력 $6이며, 더 저렴한 모델이 처리할 수 있는 작업이라면 비싼 모델로 가지 않도록 라우팅하도록 만들어졌습니다. Fugu Ultra v2는 강력한 쪽입니다: 입력 $5, 출력 $30, 캐시 $0.50이며, 비용이 더 들더라도 복잡한 다단계 작업에서는 역량이 더 높은 쪽으로 라우팅하도록 만들어졌습니다.
실질적인 구분은 예산이 아니라 작업 형태에 따라 이루어진다. 트래픽이 대부분 조회, 추출, 분류, 짧은 생성, 그리고 단순한 도구 호출이라면, Fugu Max의 설계 전체는 바로 그것을 감지하고 가능한 한 적게 쓰는 데 있다 — 그리고 10개 벤치마크 중 7개에서 프런티어를 확장한다는 Sakana의 주장은 적어도 방향성 면에서는 그것에 관한 것이다. 트래픽에 긴 에이전트 실행, 여러 파일 리팩터링, 또는 한 단계가 잘못되면 큰 비용으로 실패하는 연구 작업이 포함된다면, Ultra v2의 30달러 출력 요금은 실제로 무언가를 사는 것이다: 8개 벤치마크 중 7개에서 상위 2위 안에 든다는 점은 출시 페이지에서 비용 주장이라기보다 역량 주장에 가장 가까운 부분이다.
두 모델 모두 Sakana의 콘솔을 통해 동일한 OpenAI 호환 API에서 사용할 수 있으며, 기존 Fugu에서의 업그레이드 경로는 파라미터 변경이다. 가용성 관련 유의사항이 두 가지 있다. Fugu는 GDPR 작업이 완료될 때까지 EU와 EEA에서 사용할 수 없는 것으로 보고되었는데, 이것이 여전히 유효하다면 어느 모델이든 배포할 수 있는 위치가 제한된다. 그리고 둘 다 폐쇄형 시스템이다. 즉, 엔드포인트를 구매하는 것이고 공급업체가 그 뒤에 어떤 모델을 둘지 선택한다 — Fugu Max의 경우 완전히 공개하지 않는 모델 명단까지 포함해서.
문제는, 여전히 자신의 프런티어를 임대하는 오케스트레이터라는 점이다.
Fugu에 대한 가장 날카로운 비판은 Sakana가 Fugu를 주권 인프라로 규정함으로써 스스로 불러들인 비판이다. 서드파티 API를 가로질러 라우팅하는 오케스트레이션 계층은 그 API들의 철회를 막지 못한다. 이는 단일 장애점을 분산된 장애점으로 바꾸는데, 이는 실질적인 개선이지만, 기반 모델은 여전히 다른 누군가의 것이고, 여전히 동일한 수출 통제의 적용을 받으며, 여전히 동일한 갑작스러운 서비스 중단에 노출되어 있다. 8월의 NVIDIA 파트너십과 Nemotron 추가는 지금까지 이에 대한 가장 구체적인 답이다 — 풀에 있는 오픈 웨이트 모델은 누구도 끌 수 없는 모델이다 — 그러나 Sakana는 Fugu Max의 트래픽 중 실제로 얼마나 많은 부분이 그 모델들로 향하는지 밝히지 않는다.
두 번째의 더 조용한 트레이드오프가 있다. 라우팅 결정은 지연 시간을 늘리고 결정성을 제거한다. 오늘 작은 모델에 할당된 요청이, 풀이나 비용 가중치가 바뀌면 내일은 다른 모델에 할당될 수 있다. 그러면 동작을 회귀 테스트하기가 더 어려워지고, 시스템을 감사하는 누구에게든 설명하기가 더 어려워진다. Sakana의 답은 오케스트레이션이 내부에 있고 API가 단일 모델처럼 동작한다는 것이다. 이는 인터페이스 수준에서는 사실이지만 그 밑에서는 사실이 아니며, 엄격한 재현성 요구 사항을 가진 팀은 이것이 핵심 의존 요소가 되기 전에 이를 신중하게 테스트해야 한다.
비용 이점을 누리되 풀을 단일 의존 대상으로 만들고 싶지 않다면, 같은 패턴을 직접 구성할 수 있습니다. 우리의 라우팅 DSL을 사용하면 하나의 엔드포인트 뒤에 모델 패널을 정의하고 어떤 모델이 어떤 종류의 요청을 처리할지 결정할 수 있으며, 모델 퓨전은 동일한 프롬프트에 여러 모델을 실행하고 일치가 가격보다 더 중요한 경우 답변을 조정합니다. 공급자 간 페일오버는 공급자가 성능이 저하되거나 사라질 때 코드 변경 없이 이미 신뢰하는 모델로 트래픽을 이동한다는 의미합니다. 그것은 Sakana가 여러분에게 통째로 하라고 요구하는 베팅의 더 보수적인 버전입니다.

여기서 우리가 제공하는 것과 제공하지 않는 것을 분명히 하는 것이 좋겠습니다. Sakana Fugu Max는 우리 카탈로그에 없습니다 — 우리 쪽에서 라우팅 가능한 모델이 아니며, Sakana 자체 API와 콘솔에서 실행됩니다. 우리 카탈로그는 하나의 키와 하나의 청구서로 15개 제공업체에 걸친 196개 모델이며, 각 카드에 토큰당 요금이 표시되어 있고 그 위에 별도의 마크업은 없습니다. Fugu Max와 의미 있게 겹치는 부분은 재고가 아니라 발상입니다: 둘 다 "어떤 모델이 이것을 처리해야 하는가"에 대한 올바른 답이 대개 가장 큰 모델은 아니라는 주장입니다.
누가 움직여야 하고, 누가 기다려야 할까요?
Fugu Max는 이번 달 더 흥미로운 출시 중 하나입니다. 바로 모델이 아니기 때문이죠. 이미 Sakana Fugu를 사용 중이라면, 업그레이드는 더 낮은 가격에 한 줄만 바꾸면 되는 것이므로 고민할 이유가 없습니다. 중간급 모델에서 대량의 저복잡도 트래픽을 처리하면서 백만 출력 토큰당 $10–$15를 지불하고 있다면, Sakana가 제시하는 계산법은 직접 벤치마크해 볼 가치가 있습니다 — 일주일 분량의 실제 요청을 가져와 Fugu Max를 통해 실행하고, 산점도가 아니라 현재 모델과 품질을 비교해 보세요.
커밋하기 전에 공개된 벤치마크 수치가 필요하다면, 기다리세요. 아직 Fugu Max에 대한 독립적인 자료는 없고, 벤더 자체의 근거는 표가 아니라 차트이며, 여섯 개의 주요 벤치마크 중 하나는 Sakana의 것입니다. 그렇다고 해서 이 모델을 무시할 이유는 아닙니다 — 오히려 자체 트래픽에서 테스트할 이유입니다. 애초에 당신의 결과를 예측할 수 있었던 유일한 벤치마크는 그것뿐이니까요. 그리고 워크로드가 에이전트형이고, 장기적이며, 잘못될 경우 비용이 큰 경우라면, 이 두 모델 중에서 주목할 모델은 Fugu Max가 아니라 Fugu Ultra v2입니다. 수치가 붙어 있는 쪽은 바로 그 모델입니다.
우리의 라우팅 DSL을 사용하면 단일 엔드포인트 뒤에 모델 패널을 정의하고 어떤 요청 클래스를 어느 모델이 처리할지 결정할 수 있으며, 모델 퓨전은 동일한 프롬프트에서 여러 모델을 실행하고 합의가 가격보다 더 중요한 경우 답변을 조정합니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
