
Sakana Fugu Ultra v2 해설: 풀이 작아졌고 점수는 올라갔다
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
Fugu Ultra v2는 이상한 종류의 업그레이드다. Sakana AI는 2026년 9월 11일, 이제 Claude Fable 5, Claude Fable 5.1, GPT-6 Astra를 포함하지 않는 모델 풀과 함께 이를 출시했으며 — 현재 출시된 가장 강력한 시스템 세 가지다 — 그럼에도 세 가지 모두를 능가한다고 주장한다. Fugu Max라는 더 저렴한 형제 모델과 같은 날 출시된 도쿄 연구소의 새로운 품질 등급 플래그십은 Sakana 자체 평가에서 8개 벤치마크 중 5개에서 최고 또는 공동 최고이며, Chartography에서 Claude Opus 5의 27.3, Claude Fable 5의 29.5에 맞서 48.3을 기록했고 DeepSWE에서 74.3을 기록한 것을 포함한다. 그 수치 중 어느 것도 독립적으로 재현되지 않았고, 어떤 Fugu 모델에도 아직 Artificial Analysis 페이지가 없다. 그 격차가 핵심이다: 당신이 사라고 권유받는 것은 최고의 답을 내는 데 최고의 모델이 필요하지 않다는 점을 전체 판매 논리로 내세우는 조정 계층이다.
사카나 AI는 2023년, Transformer 논문의 공동 저자인 리언 존스와 데이비드 하가 설립했습니다. Fugu 라인은 2026년 6월에 단일 모델로 제공되는 멀티 에이전트 시스템으로 출시되었습니다. 즉, 하나의 OpenAI 호환 엔드포인트를 호출하면, 그 뒤에서 훈련된 코디네이터가 요청을 분해하고 에이전트를 생성한 뒤 결과를 종합합니다. 이 연구는 실체가 있으며 공개되어 있습니다. TRINITY(arXiv 2512.04695)는 Thinker, Worker, Verifier 역할을 할당하는 경량 코디네이터를 진화시켰고, Conductor(arXiv 2512.04388)는 에이전트 간의 자연어 조정을 학습했으며, Fugu 기술 보고서는 arXiv 2606.21228에 있습니다. 사카나가 한 번도 공개하지 않은 것은 모두가 실제로 원하는 바로 그것입니다. 즉, 풀에 포함된 모델들의 정체와 작업별 라우팅 결정입니다.
6월 Fugu Ultra에서 실제로 무엇이 달라졌나
버전 2.0은 원본이 나온 지 약 11주 후의 포인트 리프레시로, 새로운 아키텍처가 아닙니다. 벤더 자신의 표현에 따르면 Fugu Ultra v2와 Fugu Max는 "동일한 핵심 오케스트레이션 아키텍처"를 두 가지 서로 다른 임무에 맞게 튜닝한 것입니다. Max는 가성비의 한계를 낮추고, Ultra는 최고 역량을 끌어올립니다. 모델 ID는 fugu-ultra-v2.0이며, Sakana는 이전 Fugu에서 마이그레이션하는 것이 SDK 마이그레이션 없이 한 줄 매개변수 변경으로 가능하다고 말합니다 — 이는 이번 릴리스에서 가장 소비자 친화적인 점입니다.
실질적인 변화는 양 끝에 있는 두 가지입니다. 첫째, 학습 컷오프가 20260828로 이동하여 코디네이터가 현재 세대의 프런티어 모델에 맞춰 재조정되었습니다. 둘째, 그리고 훨씬 더 흥미로운 점은, 풀 구성이 Sakana가 공개적으로 내세우기로 한 방식으로 바뀌었습니다: Claude Fable 5, Claude Fable 5.1, GPT-6 Astra는 명시적으로 제외됩니다. Sakana의 주장은 이것이 점수가 단일 독점적인 프런티어 모델에 의존하지 않음을 증명한다는 것이며, 이는 벤더 종속, API 회수 또는 수출 통제로 인해 모델이 사라지는 것을 우려하는 경우 중요합니다.
사카나가 깊이 파고들지 않는 이차적 결과가 있다. 만약 그 풀이 이용 가능한 가장 강력한 세 모델을 제외한다면, Fable 5와 Fable 5.1에 대한 벤치마크 비교는 오케스트레이터가 원하더라도 호출할 수 없었던 시스템들을 상대로 이루어지는 셈이다. 그 비교는 정당하다 — 접근 권한이 아니라 아키텍처에 관한 주장이기 때문이다 — 하지만 누가 더 나은 모델을 가졌는지를 두고 같은 조건에서 겨루는 시험은 아니다. 그것은 조정이 순수한 역량을 이기는지를 묻는 시험이다. 그건 정말 흥미로운 질문이다. 다만 언뜻 보기에 점수판이 암시하는 질문은 아니다.

숫자들, 그리고 누가 그것을 산출했는지
이 섹션의 모든 수치는 벤더가 보고한 것입니다. Sakana는 평가 하네스도, 과제별 점수 격자도, 재현 레시피도 공개하지 않았으며, 오케스트레이션 설계는 독립적 재현을 더 쉽게가 아니라 더 어렵게 만듭니다: 점수를 재현하려면 풀에 있는 모든 모델에 동일한 버전과 동일한 토폴로지로 접근할 수 있어야 하는데, 설계상 토폴로지는 요청마다 달라집니다.
• Chartography (차트 및 구조화된 문서에 대한 시각적 추론) — Fugu Ultra v2 48.3, Claude Opus 5 27.3, Claude Fable 5 29.5 — 벤더 보고 기준
• DeepSWE(실제 소프트웨어 엔지니어링) — Fugu Ultra v2 74.3 — 벤더 보고 기준, 토큰당 3~5배 더 비싼 모델보다 뛰어나다고 함
• 최고 또는 공동 최고 순위 — 8개 벤치마크 중 5개: GDP.pdf, Chartography, SWEFish, DeepSWE, Toolathon — 벤더 보고 기준
• 상위 2위권 진입 — 8개 벤치마크 중 7개 — 벤더 보고 기준
• 이전 Fugu Ultra(2026년 6월, 비교 기준) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — 벤더 보고
Chartography 행은 지금 받고 있는 강조를 받을 만하다. 왜냐하면 이름이 알려진 현행 플래그십과의 격차가 미미하지 않은 유일한 범주이기 때문이다. 시각 추론 벤치마크에서 Claude Opus 5보다 21점 앞선다는 것은 보통 며칠 안에 독립 리더보드에 나타나는 종류의 수치다. 이 글을 쓰는 시점까지 그러한 수치는 나타나지 않았다. 이 행을 확정된 결과가 아니라 달러 금액이 붙은 가설로 취급하라.
가격: 6월부터 변동 없음, 출력에서는 그야말로 비쌈
Fugu Ultra v2는 백만 입력 토큰당 $5, 백만 출력 토큰당 $30, 백만 캐시된 입력 토큰당 $0.50입니다. 컨텍스트가 272,000토큰을 초과하면 이는 각각 $10, $45, $1.00가 됩니다. Fugu Max는 완전히 다른 형태입니다: 입력 $2, 출력 $6, 캐시 $0.25로 컨텍스트 길이와 관계없이 동일하며, 웹 검색 또는 fetch 호출당 $0.007가 추가됩니다.
그 가격표에 관해서는 두 가지를 주의 깊게 읽을 가치가 있다. 첫째는 출력이 입력의 6배라는 점이다. 이는 모델의 장황함에 값을 매기는 공격적인 비율이며, 오케스트레이션은 장황한 작업이다. 에이전트를 생성하고 그 답변을 종합하는 코디네이터는 많은 토큰을 내보내고, 당신은 그 모든 토큰에 대해 100만 개당 30달러를 지불한다. Sakana의 효율성 주장은 기반 풀에 관한 것이지, 시스템이 당신을 대신해 얼마나 많은 텍스트를 생성하는지에 관한 것이 아니며, 이 둘은 서로 다른 숫자다. 예산은 헤드라인 요율이 아니라 관측된 토큰 수를 기준으로 세워라.
두 번째는 272K 절벽입니다. 임계값을 넘으면 토큰당 요율을 두 배로 올리는 것은 장문 컨텍스트 작업의 가격을 책정하는 합당한 방식이지만, 그로 인해 장문 컨텍스트 에이전트 실행의 실효 비용은 가격 페이지에 적힌 숫자가 아니게 됩니다. 워크로드가 그 경계 근처에 있다면, 경계 양쪽에서 계산 결과가 크게 달라집니다.
Fugu의 구독 티어 — 월 $20 Standard, $100 Pro, $200 Max, 10배 및 20배 허용량 포함 — 는 모두 Fugu, Fugu Ultra, Fugu Max에 대한 액세스를 포함합니다. Sakana는 또한 특정 요청에 대해 풀에 존재하는 최상위 티어를 기준으로 기본 Fugu 모델의 가격을 책정하며, 에이전트를 더 추가해도 청구서가 배로 늘지 않는다고 분명히 밝힙니다. 이는 여러 프런티어 모델을 직접 호출할 때 얻게 되는 팬아웃 비용 모델과는 실질적인 차이입니다.
Sakana가 당신에게 말하지 않을 것
질문에 어떤 모델이 답했는지 물어보면, FAQ는 단호합니다: "이 라우팅 정보는 설계상 공개되지 않습니다." Ultra와 Max 풀은 고정되어 있으므로 공급업체를 제외하도록 선택할 수 없습니다. 콘솔 설정에서 모델별 옵트아웃을 지원하는 것은 기본 Fugu 모델뿐입니다. 엔터프라이즈 고객은 맞춤형 구성을 협상할 수 있습니다.
그 불투명성은 Fugu 라인이 6월 이후 끌어온 비판의 핵심이며, 그것은 적대적인 비판이라기보다 정당한 비판이다. 오케스트레이터가 다른 연구소들의 모델을 결합해 좋은 점수를 받을 때, 그 점수는 시스템에 속한다 — 이는 실제로 판매할 수 있고 방어 가능한 것이긴 하다 — 그러나 어떤 단일 모델에도 이전되지 않으며, 감사할 수도 없다. 리뷰어들은 이 점을 노골적으로 지적했다: Fugu는 플래그십을 이긴 것이 아니라, 플래그십을 고용한 것이다. 값싼 검증기가 있는 검증 가능한 과제, 가령 테스트 스위트가 있는 코딩 벤치마크에서는 위원회가 실제로 최고의 구성원을 능가할 수 있다. 그런 검증기가 없는 과제에서는 여러 프런티어 모델을 샘플링해 최고 결과를 보고하는 패널이 부분적으로는 운을 보고하는 셈이다. Sakana 자신의 범주 선택 — Chartography, DeepSWE, Toolathon — 은 검증 가능한 쪽으로 기울어져 있는데, 이는 그 주장을 펼치기에 맞는 지점이며, 동시에 그 주장이 공짜로 일반화될 수 없는 이유이기도 하다.
독립적인 테스터들은 또한 지연 시간 변동성을 오케스트레이션의 실질적인 비용으로 지적했습니다: 어려운 작업에서는 코디네이터가 심사숙고하고, 쉬운 작업에서는 그러한 심사숙고가 순전한 오버헤드일 뿐입니다. 한 연구원의 셰이더 작업은 약 30분이 걸렸으며 품질은 겨우 수용 가능한 수준으로 평가되었다고 합니다.

실제로 그것을 구할 수 있는 곳
Fugu Ultra v2는 이제 Sakana 자체의 OpenAI 호환 API를 통해 출시되었습니다 — 기존 클라이언트를 API 키와 함께 엔드포인트로 지정하고 한 줄만 바꾸면 됩니다 — 또한 여러 타사 플랫폼을 통해서도 이용할 수 있습니다. OrcaRouter는 Fugu 모델을 제공하지 않습니다. Fugu Ultra v2를 호출하려면 벤더 자체 API가 직접적인 경로입니다.
What is worth noting is the alternative Sakana is implicitly competing with. The pool that makes Fugu Ultra v2 work is assembled from models that are individually callable today, and the opponents it is measured against are the ones teams already run. Claude Opus 5, DeepSeek V4 Pro and Gemini 3.1 Pro are all on OrcaRouter at their providers' list prices with 0% markup, which means a price cut from any of those vendors is live on our side the same day it is announced. If the reason you are considering an orchestrator is resilience — not wanting a production path to depend on one vendor's uptime or one vendor's policy — then a routing layer with automatic failover across providers solves part of that problem at the model level, and Fugu Ultra v2 solves a different part at the reasoning level. One API for 200+ models with failover is not a substitute for a trained coordinator, and a trained coordinator is not a substitute for not being single-vendor-dependent. Some teams will want both.
컴플라이언스의 함정
Fugu는 유럽연합(EU) 또는 유럽경제지역(EEA)에서는 사용할 수 없습니다. 공급업체의 표현은 명확합니다. GDPR 및 EU 특정 규정 준수를 위해 노력하는 동안 EU/EEA에서는 아직 사용할 수 없으며, 그 외 지역에서는 네트워크 상황이나 현지 규칙에 따라 접근이 제한될 수 있습니다. 귀하의 조직 범위에 EU 법인이 포함되어 있다면, 이는 벤치마크 성능과 관계없이 Fugu 라인을 고려 대상에서 제외합니다. 이는 평가 후가 아니라 평가 전에 알아둘 가치가 있습니다.

볼 것
세 가지가 갖춰지면 Fugu Ultra v2는 흥미로운 주장에서 실제로 의존할 수 있는 선택으로 거듭날 것이다. 독립적인 평가 — Artificial Analysis 등재, LMArena 순위, 그 밖에 검증 체계를 갖춘 무엇이든 — 가 있으면 Chartography 논란은 일주일 안에 정리될 것이다. 검증 가능한 코딩 벤치마크에서 제3자가 재현한 수치가 나오면 아키텍처가 예측하는 시스템 수준의 향상을 확인해 줄 것이다. 그리고 공개된 풀, 심지어 일부만이라도 공개된 풀이 있다면 구매자들은 자신이 검사할 수 없는 코디네이터를 통해 프로덕션 트래픽을 보낼 때 정확히 어떤 단일 장애점을 받아들이는지 따져볼 수 있을 것이다.
그때까지 솔직한 입장은 이렇습니다. Fugu Ultra v2는 오케스트레이션을 연구 데모가 아니라 제품으로 판매하려는 지금까지 가장 진지한 시도이며, 공개된 연구 성과를 갖춘 연구소가 오케스트레이션 프리미엄을 숨기지 않고 명시적으로 드러내는 가격에 내놓은 것입니다. 귀하의 워크로드가 장기 지평형이고 검증 가능하며 Sakana가 서비스를 제공할 수 있는 지역으로 한정되어 있다면, 토큰 사용량 집계를 켠 상태에서 범위를 정한 파일럿을 진행할 가치가 있습니다. 그렇지 않다면, Fugu Ultra v2가 견주어지는 모델들은 API 호출 한 번이면 정가로 이용할 수 있고, 무엇을 할 수 있는지 입증할 증빙도 갖추고 있습니다.
이 글에서 비교한 모델3
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
