Fugu Ultra v2 vs Claude Opus 5를 위한 히어로 타이틀 카드, 부제 '동일한 입력 가격, 두 가지 다른 베팅', '양쪽 모두 입력 $5.00', 'Chartography 48.3 vs 27.3', '1M 컨텍스트'라고 적힌 필 배지, 하단 문구 'Sakana AI vs Anthropic - 2026년 9월', 그리고 오른쪽 아래 모서리의 OrcaRouter 로고.
Guides & Insights

Fugu Ultra v2 vs Claude Opus 5: 동일한 입력 가격, 두 가지 다른 승부수

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anth​ropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.

모든 것을 형성하는 우연

두 제품이 일치하는 점부터 시작하세요. 그것이 대표 가격보다 더 많은 것이기 때문입니다.

• 입력 가격 — Fugu Ultra v2 1M 토큰당 $5.00 vs Claude Opus 5 1M 토큰당 $5.00

• 출력 가격 — Fugu Ultra v2 100만 토큰당 $30.00 vs Claude Opus 5 100만 토큰당 $25.00

• 캐시된 입력 — Fugu Ultra v2는 기본 요율 대비 1M당 $0.50를 더 부과하는 반면, Claude Opus 5는 캐싱을 캐시된 입력에 대해 최대 90% 할인으로 책정합니다

• 컨텍스트 — Fugu Ultra v2 1M 토큰, 272K 초과 시 요금 두 배 vs Claude Opus 5 1M 토큰, 고정

• 출력 상한 — Fugu Ultra v2는 Claude Opus 5의 128K 토큰 대비 단일 수치로 공개되지 않음

• 가용성 — Fugu Ultra v2는 EU/EEA에서 판매되지 않음 vs Claude Opus 5는 표준 API 약관에 따라 일반적으로 제공됨

• 근거 — Fugu Ultra v2: 공급업체 보고 벤치마크, 아직 독립 평가 없음 vs Claude Opus 5: 공급업체 벤치마크 및 수개월간의 제3자 리더보드 순위

마지막 행은 바로 이 지점에서 승부가 실제로 갈리는 곳입니다. 같은 입력 가격에서, 당신은 점수를 믿음으로 받아들여야 하는 시스템과 다른 사람들이 재현한 점수를 가진 모델 중에서 선택하게 됩니다. 272K 절벽은 여기에 더해 문제를 심화시킵니다. 그 임계값을 넘으면 Fugu Ultra v2의 입력 요금은 두 배로 올라 $10이 되고 출력은 $45가 되지만, Claude Opus 5의 요금은 움직이지 않습니다. 장문 컨텍스트 에이전트 실행 — 바로 Fugu Ultra v2가 만들어진 워크로드 — 에서는, 더 저렴한 헤드라인 가격의 이점이 시스템이 빛을 발해야 할 바로 그 지점에서 사라집니다.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

각각이 실제로 무엇인지

Claude Opus 5 is Anth​ropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anth​ropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.

Fugu Ultra v2는 그런 것이 아니며, 그 차이는 겉치레가 아니다. 그것은 코디네이터다 — 약 7B 파라미터로 보고된 소형 훈련 모델로서, 요청을 읽고, 에이전트 팀을 구성하며, Sakana의 TRINITY 작업에서 나온 Thinker, Worker, Verifier 역할을 할당하고, 최종 답변을 종합한다. 기반 모델은 공개되지 않으며, 라우팅 결정은 설계상 노출되지 않고, Ultra tier의 경우 풀은 고정되어 있다: 특정 벤더를 제외하도록 선택할 수 없다. Sakana가 버전 2를 설명한 바로는 학습 컷오프가 2026년 8월 28일로 이동했고 풀 구성이 변경되었다 — 구체적으로 Claude Fable 5, Claude Fable 5.1, GPT-6 Astra를 제외하기 위해서다.

그 제외가 이번 발표에서 가장 많은 것을 드러내는 세부 사항이다. Fugu Ultra v2는 이용 가능한 가장 강력한 세 모델을 상대로 벤치마크 우위를 주장하면서도, 그중 어느 것도 호출하지 않는다고 확인하고 있다. 그 풀에 무엇이 들어 있든, Sakana 자신의 셈법으로 보면 그것은 시장 최상위가 아니다. 이들이 내세우는 주장은 조율이 역량을 이긴다는 것이다. 그것은 실체 있는 논지이며, 값싼 검증기가 있는 검증 가능한 과제에서는 증거가 뒷받침하는 논지다. 그것은 "이 시스템이 Claude Opus 5보다 더 똑똑하다"는 주장과 같은 주장이 아니며, 점수판은 이 둘을 혼동하기 쉽게 배치되어 있다.

사카나가 선택한 점수판

아래의 모든 수치는 Sakana가 Fugu Ultra v2를 자체 평가한 결과에서 나온 것입니다. Claude Opus 5의 수치는 별도로 명시된 경우를 제외하면 동일한 비교에서 Sakana가 측정한 값입니다. Fugu 열을 재현한 독립적인 제3자는 없으며, 이 글을 작성하는 현재 어떤 Fugu 모델에 대해서도 Artificial Analysis 항목이 없습니다.

• 차트 분석 — Fugu Ultra v2 48.3 대 Claude Opus 5 27.3 — 벤더 보고 기준, 21점 격차

• DeepSWE — Fugu Ultra v2 74.3 대비, 같은 표에 공개된 Claude Opus 5 수치 없음 — 벤더 보고 기준

• 벤치마크 순위 — Fugu Ultra v2, 8개 중 5개에서 최고 또는 공동 최고, 8개 중 7개에서 상위 2위 — 벤더 보고 기준

• SWE-bench Verified — Fugu Ultra v2 수치 없음 vs Claude Opus 5 96.0% — Anthropic 보고 기준

• SWE-bench Pro — Fugu Ultra v2 수치 없음, Claude Opus 5 79.2% 대비 — Anthropic 보고 기준

• ARC-AGI 3 — Fugu Ultra v2 수치 없음, Claude Opus 5 약 30.2% — Anthropic 보고 기준

그것을 순위라기보다 하나의 형태로 읽어야 합니다. Sakana는 자사가 다섯 개에서 이기는 여덟 개 벤치마크 보드를 공개했고, Claude Opus 5의 가장 강력한 공개 문서화 결과—SWE-bench 행, ARC-AGI 3—는 그 보드에 아예 없습니다. 그건 악의를 의심하는 것이 아닙니다. 모든 벤더의 점수판을 포함해, 벤더 점수판이란 그렇게 생겼습니다. 하지만 그것은 Fugu Ultra v2가 소프트웨어 엔지니어링에서 Claude Opus 5를 이긴다고 그 발표만으로 결론 내릴 수 없다는 뜻입니다. 두 시스템이 그렇게 말할 수 있을 만큼 자주 같은 행에서 측정되지 않았기 때문입니다. 두 시스템이 모두 등장하고 두 숫자가 모두 공개된 유일한 행—Chartography—에서 Fugu Ultra v2는 큰 승리를 주장합니다. 가장 폭넓은 추론 및 코딩 행에서는 한쪽만 공개했습니다.

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

작업당 비용, 토큰당 비용이 아닌

오케스트레이터의 토큰 청구액은 토큰당 요율이 아니다. Fugu Ultra v2는 에이전트를 생성하며, 각 에이전트는 추론 및 출력 토큰을 기여하고, 코디네이터 자체는 합성 텍스트를 생성한다. Sakana의 가격 FAQ는 여기서 진정으로 유용한 약속을 한다 — 관련된 최상위 모델을 기준으로 하나의 혼합 요율이 청구되며, 에이전트를 추가해도 청구액이 배로 늘지 않는다 — 이는 순진한 다중 에이전트 구성이 비싸지게 만드는 최악의 팬아웃 배수를 제거한다. 그러나 볼륨을 제거하지는 않는다. 청구되는 출력 토큰의 양은 여전히 얼마나 많은 에이전트가 실행되었고 얼마나 많이 작성했는지의 함수이며, 백만 토큰당 $30에서 그 볼륨은 가격 페이지에서 예측할 수 없는 변수다.

Claude Opus 5의 비용 구조는 그 반대입니다. 한 번의 호출, 하나의 모델, 당신이 조절하는 노력 다이얼, 그리고 25달러의 출력 요율에 실시간 처리가 필요 없는 작업에는 50% 할인된 배치 처리가 가능합니다. 예측이 가능합니다. 하루에 만 번 실행하는 워크로드라면, 예측 가능성은 차트 읽기 작업에서의 벤치마크 우위보다 훨씬 더 큰 가치가 있습니다.

This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anth​ropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.

Fugu Ultra v2가 진정으로 앞서는 부분

시스템에 마땅한 평가를 해줘야 한다. Chartography 결과가 사실이라면, 이는 단일 모델이 흉내 내기 어려운 종류의 승리다. 구조화된 문서에 대한 시각적 추론은 어떤 해석을 시도하고, 그것을 문서와 대조해 확인하고, 다시 시도하는 데서 보상을 얻는데, 이는 바로 Verifier 역할이 존재하는 이유다. 같은 논리가 Toolathon과 DeepSWE에도 적용된다. 여기서는 답을 두고 논쟁하는 대신 검증할 수 있다. Sakana가 공개한 사례 연구들도 같은 방향을 가리킨다. H100 한 대에서 14시간에 걸쳐 진행된 123개 실험 AutoResearch 실행, 두 개의 익명화된 프런티어 베이스라인이 완전히 다운된 상황에서 300개의 뒤섞인 큐브를 모두 완료한 순수 Python 루빅스 큐브 솔버, 실제로 열리고 닫히는 기계식 CAD 아이리스. 이것들은 익명화된 베이스라인을 사용한 벤더 선별 사례이므로, 겉보기만큼 많은 것을 증명하지는 못한다. 그러나 그 패턴은 일관되며, 실제 범주를 가리킨다. 정확성을 검증할 수 있고 어려운 부분이 끈기인 과제들이다.

벤치마크와는 아무 관련이 없는 구조적 논거도 있습니다. Claude Opus 5는 한 공급업체의 모델이며, 그 공급업체의 가격 결정, 지원 중단 일정, 정책의 적용을 받습니다. Fugu Ultra v2는 그러한 요소 중 어느 하나가 바뀌더라도 살아남도록 설계되었고, Sakana는 바로 이것이 핵심이라고 분명히 말합니다. 공급업체 종속, API 회수, 수출 통제 말입니다. 모델이 거의 예고 없이 특정 지역에서 철수된 시장에서 이는 가상의 일이 아닙니다. 이는 헤지이며, 헤지에는 비용이 듭니다. 백만 출력 토큰당 5달러 더라는 것은 대략 이 헤지의 가격입니다.

평결

Claude Opus 5는 대부분의 팀이 실제로 내리는 결정에서 승리합니다. 수개월에 걸친 독립적 평가가 뒷받침하고, 문서 중간에서 가격이 두 배로 오르지 않는 100만 토큰 컨텍스트 윈도, 128K 출력 상한, 예측 가능한 공개 가격, 작업이 그만한 가치가 있을 때만 추론을 구매할 수 있게 해주는 노력 다이얼, 그리고 에이전트 및 코딩 팀이 가장 중요하게 여기는 바로 그 벤치마크 — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — 에서의 제3자 결과를 갖추고 있습니다. Fugu Ultra v2는 더 좁지만 더 흥미로운 질문에서 승리합니다. 더 작은 풀을 가진 코디네이터가 정답을 검증할 수 있는 작업에서 플래그십을 능가할 수 있는가? Sakana 자체의 스코어보드는 8개 행 중 5개에서 그렇다고 말하며, 풀 배제는 그 승리가 세계 최고의 세 모델 없이 이루어졌음을 보여줍니다.

If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anth​ropic's list price with the provider's rate passed through untouched.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트