Fugu Ultra v2 vs Gemini 3.1 Pro를 위한 히어로 타이틀 카드로, 부제는 '이미 기계 안에 있을지도 모르는 상대', 알약 모양 배지는 '$30.00 vs $12.00 출력', 'CharXiv 86.6 vs 80.2 방향성', '미공개 풀', 하단 문구는 'Sakana AI vs Google DeepMind - 2026년 9월', 그리고 오른쪽 아래 모서리에 OrcaRouter 로고가 들어갑니다.
Guides & Insights

Fugu Ultra v2 vs Gemini 3.1 Pro: 이미 기계 안에 있을지도 모르는 상대

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Fugu Ultra v2 대 Gem​ini 3.1 Pro 비교에는 벤치마크가 어떻게 나오든 Gem​ini가 이기는 버전이 있다. Gem​ini가 일부 작업을 하고 있을 수 있기 때문이다. 2026년 9월 11일 출시된 Sakana AI의 오케스트레이션 시스템은 어떤 모델을 조율하는지 공개하지 않는다. 6월 Fugu Ultra의 보고된 풀에는 다른 여러 모델과 함께 Gem​ini 3.1 Pro가 포함되어 있었고, 2.0 버전은 제거한 것만 알려주면서 Claude Fable 5, Claude Fable 5.1, GPT-6 Astra를 제외 대상으로 명시한다. Goo​gle의 Gem​ini 3.1 Pro는 100만 토큰 컨텍스트를 갖춘 단일 멀티모달 프런티어 모델로, 텍스트, 이미지, PDF, 오디오, 비디오를 처리하며, 2026년 5월부터 입력 100만 토큰당 $2.00, 출력 100만 토큰당 $12.00에 일반 제공된다. 이들 중 하나는 직접 살펴볼 수 있는 모델이다. 다른 하나는 벤치마크 승리가 첫 번째 모델을 경유할 수 있는 시스템이며, 어느 벤더도 그렇게 되는지 여부를 알려주지 않는다.

각 시스템의 실제 정체

Gemini 3.1 Pro는 최전선 릴리스에서는 드물게 명확하게 파악할 수 있는 모델이다. 이는 Google DeepMind의 희소 전문가 혼합(mixture-of-experts) 트랜스포머로, 2026년 2월 19일 프리뷰로 처음 출시되었으며, 한 소식통은 일반 공개 시점을 2026년 5월로 보고 있다 — 우리 자체 목록에는 프리뷰 모델 ID로 등재되어 있다. 입력 창은 1M 토큰, 출력 상한은 65K 토큰이며, 텍스트, 이미지, PDF, 오디오, 비디오, 코드를 입력으로 받고, 3단계 추론 제어(낮음, 중간, 높음)를 제공하는데, API 기본값은 높음이다. Google은 ARC-AGI-2에서 77.1%를 보고했는데, 이는 이전 세대의 31.1%에서 두 배 이상 증가한 수치이다. GPQA Diamond에서는 94.3%, SWE-bench Verified에서는 80.6%, Terminal-Bench 2.0에서는 68.5%, BrowseComp에서는 85.9%, Humanity's Last Exam에서는 도구 없이 44.4%를 기록했으며, 검색과 코드 실행을 사용하면 51.4%로 상승한다. 이 수치들은 벤더 측 발표 값이다. 지식 컷오프는 2025년 1월이므로, 최근 사건에 의존하는 작업이라면 이 점을 유의할 필요가 있다.

Fugu Ultra v2는 코디네이터입니다. 약 7B 파라미터로 보고된 훈련된 모델로, 요청을 읽고 Sakana의 TRINITY 연구에서 가져온 Thinker, Worker, Verifier 역할로 에이전트 팀을 구성하며, OpenAI 호환 엔드포인트 뒤에서 답변을 종합합니다. 자체적으로 공개된 모달리티 목록은 없습니다 — 그것이 볼 수 있는 것은 무엇이든 그것의 풀에 있는 모델이 볼 수 있기 때문에 보는 것입니다. 컨텍스트는 1M 토큰이며 272K에서 급격한 가격 절벽이 있어 요금이 입력 $10, 출력 $45로 두 배가 됩니다. 출력 상한은 공개되지 않았습니다. 풀은 공개되지 않았고, 라우팅 결정은 "설계상 노출되지 않음"이며, Ultra 등급의 경우 풀이 고정되어 있어 제공자를 제외할 수 없습니다.

그 비대칭성이 이 맞대결의 전부다. Gem​ini 3.1 Pro는 직접 구매하고 따져볼 수 있는 구성 요소다. Fugu Ultra v2는 부품을 볼 수 없고, 가장 강력한 벤치마크 주장이 부분적으로는 Gem​ini 자체의 결과와 다른 누군가의 결과를 결합한 것일 수 있는 조립품이다.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All' and the description that Fugu dynamically orchestrates the world's best models to tackle complex, multi-step tasks behind a single API, plus the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

둘이 겹치는 비교

공개된 증거 중 두 시스템을 같은 행에 나란히 올려놓은 것은 거의 없습니다. 아래 Gemini 3.1 Pro의 수치는 Google 자체 수치이고, Fugu Ultra v2의 수치는 Sakana 자체 수치입니다. 제3자 집계 기관이 공유 행을 게시한 경우에는 표시되어 있으며, 결정적이라기보다는 방향성을 제시하는 것이라는 단서가 붙습니다.

• 멀티모달 추론(CharXiv, 공유 행) — Fugu Ultra v2 86.6% 대 Gemini 3.1 Pro 80.2%, BenchLM에 따르면, BenchLM은 해당 범주를 방향성으로 표시하고 승자를 지정하지 않음

• TerminalBench 2.1 — Fugu Ultra v2 v2.0 수치 대비 Gem​ini 3.1 Pro의 비교 가능한 공개 수치는 없음; 6월 Fugu Ultra는 서드파티 집계에서 Gem​ini 3.1 Pro의 70.3% 대비 82.1%를 기록했다

• SWE-Bench Pro — Fugu Ultra v2 v2.0 대 Gem​ini 3.1 Pro 수치는 없음; 비교 가능한 공개 수치도 없음; 6월 Fugu Ultra는 Gem​ini 3.1 Pro의 54.2% 대비 73.7%를 보고했습니다.

• ARC-AGI-2 — Fugu Ultra v2 수치 없음 vs Gemini 3.1 Pro 77.1%, 공급업체 보고

• Humanity's Last Exam — Fugu Ultra v2 v2.0 수치 없음 vs Gem​ini 3.1 Pro: 도구 없이 44.4%, 도구 사용 시 51.4%, 공급업체 보고

• 모달리티 지원 범위 — Fugu Ultra v2는 자체 풀이 지원하는 모든 모달리티를 상속하며, 비공개 vs Gem​ini 3.1 Pro의 텍스트, 이미지, PDF, 오디오, 비디오 및 코드, 문서화됨

• 입력 / 출력 가격 — Fugu Ultra v2 1M당 $5.00 / $30.00, 272K 초과 시 두 배, Gem​ini 3.1 Pro는 200K까지 1M당 $2.00 / $12.00, 그 이상은 $4.00 / $18.00, 캐시 입력 $0.20 / $0.40

• 컨텍스트 및 출력 — Fugu Ultra v2 1M 컨텍스트, 출력 상한 미공개 vs Gem​ini 3.1 Pro 1M 입력, 65K 출력

• 가중치 및 접근성 — Fugu Ultra v2는 비공개, EU/EEA 제외 vs Gemini 3.1 Pro는 독점적이지만 Google의 여러 서비스 전반에서 폭넓게 이용 가능

멀티모달 행은 신중하게 다루어야 할 항목입니다. 가장 많이 인용되면서도 가장 견고하지 않기 때문입니다. BenchLM의 CharXiv 집계에서는 Fugu Ultra v2가 정규화 점수 6.4점 앞서 있습니다. 그리고 같은 페이지에는 방향성 행에는 결코 승자가 주어지지 않는다고 분명히 명시되어 있으며, Gemini는 에이전트, 코딩, 지식 또는 다국어 범주에서 측정된 결과가 없었고, Fugu는 수학이나 다국어에서 아무 결과도 없었다고 되어 있습니다. 대부분의 행에서 한쪽만 측정된 범주는 판정을 내릴 수 없습니다. 이 비교에서 다른 무엇을 얻지 못하더라도 이것만은 기억하세요. 특히 멀티모달 작업에 관해서는 공개된 증거가 어느 쪽으로도 결론을 뒷받침하지 않으며, 존재하는 단 하나의 행도 명시적으로 확정된 결과가 아닙니다.

프레임을 바꾸는 가능성

Sakana는 풀에 무엇이 들어 있는지 밝히지 않는다. 이는 간과가 아니라 문서화된 설계 선택이다 — FAQ에는 라우팅 정보가 설계상 노출되지 않는다고 나와 있으며, 이를 들여다볼 메커니즘도 없다. 6월 세대에서 우리가 아는 것은 보고된 풀 구성원에 다른 최전선 모델들과 함께 Gemini 3.1 Pro가 포함되어 있었다는 점이다. 버전 2.0은 풀을 바꾸었고, Sakana는 그 변화를 오직 빠진 것만으로 설명했다: Claude Fable 5, Claude Fable 5.1, GPT-6 Astra는 제외되었다. 발표 내용 어디에도 Gemini가 여전히 포함되어 있다고 나오지 않는다.

Gemini 3.1 Pro가 풀에 들어 있다면 세 가지 결과가 따른다. 그리고 세 가지 모두 철학적이라기보다 실용적이다. 첫째, Fugu Ultra v2의 멀티모달 성능 중 일부는 다른 모델들의 성능과 결합된 Gemini의 성능이다. 이는 직접 지불할 수도 있는 토큰당 요금 위에 조정 프리미엄을 더 얹어 내고 있다는 뜻이다. 둘째, 출력 100만 개당 30달러인 Fugu Ultra v2와 12달러인 Gemini 3.1 Pro의 차이는 조립에 대한 프리미엄이지 순수한 역량에 대한 프리미엄이 아니다. 작업이 단일 멀티모달 질문이라면 Gemini가 더 저렴하게 답하며, 어느 모델이 답했는지도 정확히 알 수 있다. 셋째, 그리고 가장 유용한 점인데, 오케스트레이터에 대한 정직한 벤치마크는 "구성 요소들을 이기는가"가 아니라 "단독으로 사용할 때 최고의 구성 요소를 이기는가"이다. Sakana의 아키텍처는 검증 가능한 작업에서 그렇다는 주장 위에 세워져 있다. 그 주장은 차트 읽기 벤치마크에서 받아들이기 전에 자신의 워크로드에서 직접 시험해 볼 가치가 있다.

답이 '아니다'이면서도 오케스트레이터가 여전히 제 자리를 지키는 버전이 있다. Gem​ini가 풀에 있고 Fugu Ultra v2의 Chartography 점수 48.3이 Claude Opus 5의 27.3을 상대로도 유지된다면, Sakana가 만든 것은 같은 모델을 한 번 호출할 때보다 더 많은 것을 안정적으로 끌어내는 조정 계층이다. 그것은 실제 제품이며, 남은 문제는 그 마진이 가격을 감당하느냐뿐이다. 아무도 그 실험을 발표하지 않았다.

A two-column scoreboard for Fugu Ultra v2 vs Gemini 3.1 Pro titled 'Fugu Ultra v2 vs Gemini 3.1 Pro - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Modalities inherited, undisclosed, CharXiv 86.6 (directional), Weights closed, pool hidden, EU/EEA availability not served. Right column Gemini 3.1 Pro: Input price $2.00 / 1M, Output price $12.00 / 1M, Modalities text, image, PDF, audio, video, CharXiv 80.2 (directional), Weights proprietary, documented, EU/EEA availability available. Footer 'CharXiv row directional only per BenchLM; Fugu figures vendor-reported by Sakana.', with the OrcaRouter logo bottom-right.

정직한 경계가 어디에 있는지

Gemini 3.1 Pro의 장점은 구체적입니다. 입력과 출력에서 Fugu Ultra v2 가격의 약 5분의 2이며, Fugu와 달리 컨텍스트 임계값을 넘어도 요금이 두 배로 오르지 않습니다. 200K에서의 단계는 272K의 절벽보다 완만합니다. 모달리티를 상속하는 대신 문서화하므로, 오디오 및 비디오 작업이 기대가 아니라 지원되는 기능입니다. 공개된 출력 상한도 있습니다. Google 자체 인터페이스를 통해 제공되며, Fugu Ultra v2가 견주어지는 다른 모델들과 마찬가지로 OrcaRouter에서 호출 가능google/gemini-3.1-pro-preview로서, Google의 정가에 0% 마크업으로, 따라서 Google 가격 변경은 발표되는 당일 같은 키에 적용됩니다.

Fugu Ultra v2의 장점은 더 좁고 실질적이다. 이 모델은 어려운 문제를 한 번 이상 공략하며, Verifier 역할이 작업을 검증한다. 그래서 가장 강력한 주장은 지식 회상이 아니라 정답 여부를 확인할 수 있는 벤치마크 — Chartography, DeepSWE, Toolathon — 에 놓여 있다. Sakana가 공개한 사례 연구들도 같은 방향을 가리킨다: 다른 모델들이 틈과 약한 연결부를 남겨 둔 곳에서도 올바르게 열리고 닫히는 기계 CAD 아이리스; 두 익명의 프런티어 베이스라인이 완전히 크래시한 가운데 섞인 루빅스 큐브 300개를 모두 완성한 순수 Python 루빅스 큐브 솔버. 그 베이스라인들은 익명 처리되었고 벤더가 선택한 것이므로 증명이 아니라 예시로 보아야 한다. 그러나 이 패턴은 릴리스 전반에서 일관되며, 단일 모델 호출에는 없는 진짜 역량을 설명한다: 답이 검사를 통과할 때까지 한 문제에 계속 매달리는 능력.

제약도 따져보세요. Fugu Ultra v2는 EU나 EEA에서 판매되지 않으며, Sakana는 GDPR 준수를 향해 노력하고 있다고 분명히 밝히고 있습니다. Gem​ini 3.1 Pro에는 그런 제한이 없고, 그 뒤에는 훨씬 더 긴 독립적 평가 이력이 있습니다.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the capability tags Vision, Audio, Tools, JSON and Reasoning, the 1M token context and 65K max output fields, the input and output modality line reading 'audio + file + image + text + video' to 'text', the pricing tiles reading INPUT $2.00 and OUTPUT $12.00 per 1M tokens with p50 TTFT 3.82s, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

평결

대부분의 멀티모달 작업에서는 Gem​ini 3.1 Pro가 정답이며, 그 차이는 근소하지 않습니다. 토큰당 더 저렴하고, 문서당 더 저렴하며, 오디오와 비디오에 대해 문서화되어 있고, 실행 중간에 청구서를 두 배로 만들지 않는 컨텍스트 임계값으로 상한이 정해져 있으며 — 여기서 가장 중요한 부분인데 — 무엇이 답변했는지 확인할 수 있습니다. PDF를 읽고, 클립을 보고, 질문에 답하는 하나의 모델이 필요하다면, 출력 가격의 2.5배에 공개되지 않은 풀을 통해 그것을 라우팅할 명분은 없습니다.

Fugu Ultra v2는 특정하고 훨씬 더 좁은 형태의 작업, 즉 검증 가능한 답이 있는 장기적 과제로서, 문제를 세 가지 방식으로 시도하고 결과를 검증하는 것이 한 번 시도하는 것보다 낫고, 품질의 한계적 이점이 그 배수를 감수할 가치가 있는 경우에 적합한 선택입니다. EU 또는 EEA 사용자가 범위에 포함되어 있다면 이는 전적으로 고려 대상 밖입니다.

이 맞대결이 남겨 둔 불편한 질문은 아무도 측정하지 않은 질문이다. 만약 Gemini 3.1 Pro가 그 풀 안에 있다면 — 그리고 오늘날 유일하게 정직한 답은 Sakana가 그렇지 않다고 말하지 않았다는 것뿐이다 — Fugu Ultra v2로 당신이 사는 것의 일부는 그 위에 조정 레이어를 얹은 Gemini 3.1 Pro이며, 그 가격은 그 레이어가 모델보다 대략 2.5배의 가치가 있음을 시사한다. 그것은 사실일 수도 있다. Sakana의 아키텍처는 그것을 사실로 만들기 위해 구축되었다. 그러나 그것은 벤더의 스코어보드가 뒤에 있고 독립적인 테스트는 없는 가설이며, 누군가 그것을 실행하기 전까지는, 당신이 볼 수 있는 모델이 당신이 방어할 수 있는 모델이다.