การ์ดหัวเรื่องแบบฮีโร่สำหรับ Fugu Ultra v2 กับ Claude Opus 5 พร้อมคำโปรยย่อย 'ราคาอินพุตเท่ากัน เดิมพันสองแบบที่ต่างกัน' ป้ายแคปซูลที่เขียนว่า 'อินพุต $5.00 เท่ากันทั้งคู่' 'Chartography 48.3 กับ 27.3' และ 'คอนเท็กซ์ 1M' บรรทัดท้าย 'Sakana AI กับ Anthropic - กันยายน 2026' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Fugu Ultra v2 vs Claude Opus 5: ราคาอินพุตเท่ากัน แต่เป็นการเดิมพันที่ต่างกันสองแบบ

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anth​ropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.

ความบังเอิญที่หล่อหลอมทุกสิ่ง

เริ่มจากสิ่งที่ผลิตภัณฑ์ทั้งสองเห็นตรงกันก่อน เพราะมันมีมากกว่าราคาที่พาดหัว

• ราคาอินพุต — Fugu Ultra v2 $5.00 ต่อ 1M โทเคน เทียบกับ Claude Opus 5 $5.00 ต่อ 1M โทเคน

• ราคาเอาต์พุต — Fugu Ultra v2 $30.00 ต่อ 1M โทเคน เทียบกับ Claude Opus 5 $25.00 ต่อ 1M โทเคน

• อินพุตที่แคชไว้ — Fugu Ultra v2 $0.50 ต่อ 1 ล้าน ซึ่งสูงกว่าอัตราพื้นฐาน เมื่อเทียบกับ Claude Opus 5 ที่คิดราคาการแคชเป็นส่วนลดสูงสุด 90% สำหรับอินพุตที่แคชไว้

• บริบท — Fugu Ultra v2 1M โทเคน โดยอัตราจะเพิ่มเป็นสองเท่าเมื่อเกิน 272K เมื่อเทียบกับ Claude Opus 5 1M โทเคน แบบคงที่

• เพดานเอาต์พุต — Fugu Ultra v2 ไม่ได้เผยแพร่เป็นตัวเลขเดียว เทียบกับ Claude Opus 5 128K tokens

• ความพร้อมใช้งาน — Fugu Ultra v2 ไม่มีจำหน่ายใน EU/EEA เทียบกับ Claude Opus 5 ที่พร้อมให้ใช้งานทั่วไปภายใต้ข้อกำหนด API มาตรฐาน

• หลักฐาน — ผลทดสอบ (benchmark) ของ Fugu Ultra v2 ที่ผู้ขายรายงานเอง ยังไม่มีการประเมินโดยอิสระ เมื่อเทียบกับผลทดสอบของผู้ขาย Claude Opus 5 บวกกับอันดับบนลีดเดอร์บอร์ดจากบุคคลที่สามที่ต่อเนื่องมาหลายเดือน

แถวสุดท้ายนั่นแหละคือจุดที่การเปรียบเทียบพลิกผันจริง ๆ ที่ราคาอินพุตเท่ากัน คุณกำลังเลือกระหว่างระบบที่คุณต้องเชื่อคะแนนโดยไม่มีการพิสูจน์ กับโมเดลที่คะแนนของมันมีคนอื่นทำซ้ำแล้ว จุดเปลี่ยน 272K ยิ่งซ้ำเติมเรื่องนี้: เมื่อเกินเกณฑ์นั้น อัตราอินพุตของ Fugu Ultra v2 จะเพิ่มเป็นสองเท่าเป็น $10 และเอาต์พุตเป็น $45 ในขณะที่อัตราของ Claude Opus 5 ไม่ขยับ สำหรับการรันเอเจนต์บริบทยาว — ภาระงานแบบที่ Fugu Ultra v2 ถูกสร้างมาสำหรับพอดี — ข้อได้เปรียบด้านราคาของราคาที่โฆษณาไว้ซึ่งถูกกว่าจะหายไปในจุดที่ระบบควรจะโดดเด่นที่สุดพอดี

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

แต่ละอย่างจริงๆ แล้วคืออะไร

Claude Opus 5 is Anth​ropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anth​ropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.

Fugu Ultra v2 ไม่ใช่แบบนั้น และความแตกต่างไม่ได้เป็นเพียงเรื่องผิวเผิน มันเป็นตัวประสานงาน — โมเดลขนาดเล็กที่ผ่านการฝึก ซึ่งมีรายงานว่ามีพารามิเตอร์ประมาณ 7B ที่อ่านคำขอของคุณ ประกอบทีมเอเจนต์ กำหนดบทบาท Thinker, Worker และ Verifier จากงาน TRINITY ของ Sakana และสังเคราะห์คำตอบสุดท้าย โมเดลพื้นฐานไม่ได้ถูกเปิดเผย การตัดสินใจจัดเส้นทางไม่ถูกเปิดเผยโดยการออกแบบ และสำหรับระดับ Ultra พูลนั้นถูกกำหนดตายตัว: คุณไม่สามารถเลือกตัดผู้ขายรายใดออกได้ กรอบของ Sakana เองสำหรับเวอร์ชัน 2 คือจุดตัดการฝึกถูกเลื่อนไปเป็นวันที่ 28 สิงหาคม 2026 และองค์ประกอบของพูลเปลี่ยนไป — โดยเฉพาะเพื่อตัด Claude Fable 5, Claude Fable 5.1 และ GPT-6 Astra ออก

การตัดออกนั้นเป็นรายละเอียดที่เผยความจริงได้มากที่สุดในการเปิดตัวครั้งนี้ Fugu Ultra v2 อ้างว่าคว้าชัยในการทดสอบมาตรฐานเหนือโมเดลที่แข็งแกร่งที่สุดสามตัวที่มีอยู่ พร้อมกับยืนยันว่าไม่ได้เรียกใช้โมเดลใดในสามตัวนั้นเลย ไม่ว่ากลุ่มที่นำมาเปรียบเทียบจะมีอะไรอยู่ก็ตาม มันไม่ใช่สุดยอดของตลาดตามการคำนวณของ Sakana เอง คำโปรยคือการประสานงานชนะความสามารถ นั่นเป็นข้อเสนอเชิงแนวคิดที่มีอยู่จริง และบนงานที่ตรวจสอบได้ด้วยตัวตรวจสอบราคาถูก มันเป็นข้อเสนอที่มีหลักฐานรองรับ ไม่ใช่ข้อกล่าวอ้างแบบเดียวกับ "ระบบนี้ฉลาดกว่า Claude Opus 5" และกระดานคะแนนถูกจัดวางไว้ให้สองเรื่องนี้สับสนกันได้ง่าย

ป้ายคะแนนที่ Sakana เลือก

ตัวเลขทุกตัวด้านล่างมาจากการประเมินของ Sakana เองสำหรับ Fugu Ultra v2 ตัวเลขของ Claude Opus 5 เป็นค่าที่ Sakana วัดได้ในการเปรียบเทียบเดียวกัน เว้นแต่จะระบุไว้เป็นอย่างอื่น ยังไม่มีหน่วยงานอิสระใดทำการทดลองซ้ำให้ได้ผลเหมือนคอลัมน์ Fugu และ ณ เวลาที่เขียนนี้ ยังไม่มีรายการของ Artificial Analysis สำหรับโมเดล Fugu ใด ๆ

Chartography — Fugu Ultra v2 48.3 เทียบกับ Claude Opus 5 27.3 — ตามที่ผู้ขายรายงาน ส่วนต่าง 21 จุด

• DeepSWE — Fugu Ultra v2 74.3 เทียบกับไม่มีตัวเลข Claude Opus 5 ที่เผยแพร่ในตารางเดียวกัน — รายงานโดยผู้ขาย

• อันดับในเบนช์มาร์ก — Fugu Ultra v2 ดีที่สุดหรือดีที่สุดร่วมใน 5 จาก 8 รายการ และอยู่ในสองอันดับแรกใน 7 จาก 8 รายการ — ตามรายงานของผู้ขาย

• SWE-bench Verified — ไม่มีตัวเลขของ Fugu Ultra v2 เทียบกับ Claude Opus 5 ที่ 96.0% — ตามรายงานของ Anthropic

• SWE-bench Pro — ไม่มีตัวเลขผลคะแนนของ Fugu Ultra v2 เมื่อเทียบกับ Claude Opus 5 ที่ 79.2% — ตามรายงานของ Anthropic

• ARC-AGI 3 — ไม่มีตัวเลขของ Fugu Ultra v2 เทียบกับ Claude Opus 5 ~30.2% — รายงานโดย Anthropic

ให้มองสิ่งนั้นเป็นรูปแบบ ไม่ใช่การจัดอันดับ Sakana เผยแพร่บอร์ดแปดเบนช์มาร์กที่ตนชนะห้ารายการ และผลลัพธ์ที่แข็งแกร่งที่สุดซึ่งมีเอกสารเผยแพร่ต่อสาธารณะของ Claude Opus 5 — แถว SWE-bench, ARC-AGI 3 — ก็ไม่ได้อยู่ในบอร์ดนั้นเลย นั่นไม่ใช่การกล่าวหาว่าไม่สุจริต แต่มันคือหน้าตาของสกอร์บอร์ดของผู้ขาย ซึ่งรวมถึงของทุกรายด้วย แต่มันหมายความว่าคุณไม่สามารถสรุปจากการเปิดตัวได้ว่า Fugu Ultra v2 เอาชนะ Claude Opus 5 ในด้านวิศวกรรมซอฟต์แวร์ เพราะระบบทั้งสองไม่ได้รับการวัดบนแถวเดียวกันบ่อยพอที่จะกล่าวได้ บนแถวเดียวที่ทั้งสองปรากฏและตัวเลขทั้งคู่เป็นข้อมูลสาธารณะ — Chartography — Fugu Ultra v2 อ้างว่าชนะอย่างมาก บนแถวการให้เหตุผลและการเขียนโค้ดที่กว้างที่สุด มีเพียงฝ่ายเดียวเท่านั้นที่เผยแพร่

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

ต้นทุนต่องาน ไม่ใช่ต้นทุนต่อโทเคน

ค่าบิลโทเค็นของผู้ประสานงานไม่ใช่อัตราต่อโทเค็นของมัน Fugu Ultra v2 ปล่อยเอเจนต์ออกมา โดยแต่ละตัวส่งโทเค็นการให้เหตุผลและเอาต์พุต ขณะที่ตัวประสานงานเองสร้างข้อความสังเคราะห์ FAQ ด้านราคาของ Sakana ให้คำมั่นที่มีประโยชน์จริง ๆ ตรงนี้ — คุณถูกคิดเงินในอัตราแบบผสมเดียวโดยอิงจากโมเดลระดับสูงสุดที่เกี่ยวข้อง และการเพิ่มเอเจนต์ไม่ได้ทำให้บิลคูณขึ้น — ซึ่งขจัดปัญหาการคูณแบบกระจายออกในกรณีเลวร้ายที่สุดที่ทำให้การตั้งค่าหลายเอเจนต์แบบตรงไปตรงมามีค่าใช้จ่ายสูง แต่ก็ไม่ได้ขจัดปริมาณออกไป ปริมาณโทเค็นเอาต์พุตที่ถูกคิดเงินยังคงเป็นฟังก์ชันของจำนวนเอเจนต์ที่รันและปริมาณที่แต่ละตัวเขียน และที่ 30 ดอลลาร์ต่อล้าน ปริมาณนั้นคือตัวแปรที่คุณคาดเดาจากหน้าราคาไม่ได้

โครงสร้างต้นทุนของ Claude Opus 5 กลับกันตรงข้ามเลย หนึ่งการเรียก หนึ่งโมเดล ปุ่มปรับระดับความพยายามที่คุณควบคุมได้ และอัตราค่าเอาต์พุตที่ $25 พร้อมการประมวลผลแบบแบตช์ที่ลด 50% สำหรับงานที่ไม่ต้องการความเร็วแบบเรียลไทม์ คุณสามารถคาดการณ์ล่วงหน้าได้ สำหรับงานที่คุณรันวันละหนึ่งหมื่นครั้ง ความสามารถในการคาดการณ์ล่วงหน้ามีค่ามากกว่าส่วนต่างของคะแนนเบนช์มาร์กในงานอ่านกราฟมากมายนัก

This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anth​ropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.

จุดที่ Fugu Ultra v2 ชนะอย่างแท้จริง

ให้เครดิตกับระบบตามที่ควรได้รับ ผลลัพธ์ของ Chartography หากยังเป็นจริงได้ ก็เป็นชัยชนะแบบที่โมเดลเดี่ยว ๆ ปลอมได้ยาก: การให้เหตุผลเชิงภาพบนเอกสารที่มีโครงสร้างให้รางวัลกับการลองตีความสักแบบหนึ่ง ตรวจสอบกับเอกสาร แล้วลองอีกครั้ง — ซึ่งเป็นสิ่งที่บทบาท Verifier มีไว้ทำพอดี ตรรกะเดียวกันนี้ใช้กับ Toolathon และ DeepSWE ซึ่งคำตอบสามารถทดสอบได้แทนที่จะต้องมาโต้เถียงกัน กรณีศึกษาที่ Sakana เผยแพร่ก็เอนไปทางเดียวกัน: การรัน AutoResearch จำนวน 123 การทดลองเป็นเวลาสิบสี่ชั่วโมงบน H100 หนึ่งตัว, ตัวแก้ Rubik's cube ที่เป็น pure-Python ซึ่งไขลูกบาศก์ที่ถูกสลับครบทั้ง 300 ลูกได้ ในขณะที่เบสไลน์ระดับแนวหน้าแบบไม่ระบุชื่อสองตัวล่มไปทั้งหมด, ไอริสเชิงกลแบบ CAD ที่เปิดและปิดได้จริง สิ่งเหล่านี้เป็นตัวอย่างที่ผู้ขายคัดเลือกเอง พร้อมเบสไลน์แบบไม่ระบุชื่อ จึงพิสูจน์ได้น้อยกว่าที่ดูเหมือน แต่รูปแบบนี้สม่ำเสมอ และชี้ไปยังหมวดหมู่จริง: งานที่ความถูกต้องตรวจสอบได้ และส่วนที่ยากคือความพากเพียร

ยังมีข้อโต้แย้งเชิงโครงสร้างอีกข้อที่ไม่มีส่วนเกี่ยวข้องกับเบนช์มาร์ก Claude Opus 5 เป็นโมเดลของผู้ให้บริการรายหนึ่ง ซึ่งต้องขึ้นอยู่กับการตัดสินใจด้านราคา กำหนดการเลิกใช้ และนโยบายของผู้ให้บริการรายนั้น Fugu Ultra v2 ถูกออกแบบมาให้อยู่รอดได้แม้สิ่งใดสิ่งหนึ่งในนั้นเปลี่ยนแปลงไป และ Sakana ระบุชัดเจนว่านี่คือประเด็นสำคัญ — การถูกล็อกไว้กับผู้ขายรายเดียว, การเพิกถอน API, การควบคุมการส่งออก ในตลาดที่โมเดลต่าง ๆ ถูกถอนออกจากบางภูมิภาคโดยแทบไม่มีประกาศล่วงหน้า นั่นไม่ใช่เรื่องสมมติ มันคือการป้องกันความเสี่ยง และการป้องกันความเสี่ยงมีค่าใช้จ่าย: แพงขึ้น 5 ดอลลาร์ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็นคือราคาโดยประมาณของการป้องกันความเสี่ยงนี้

คำตัดสิน

Claude Opus 5 ชนะสำหรับการตัดสินใจที่ทีมส่วนใหญ่กำลังทำอยู่จริง ๆ โดยมีเบื้องหลังเป็นเวลาหลายเดือนของการประเมินอิสระ มีหน้าต่าง 1M โทเคนที่ราคาไม่เพิ่มเป็นสองเท่าเมื่อประมวลผลเอกสารของคุณไปได้ครึ่งทาง มีเพดานเอาต์พุต 128K มีราคาที่ประกาศไว้ซึ่งคุณคาดการณ์ได้ มีปุ่มหมุนปรับระดับความพยายามที่ให้คุณซื้อความสามารถในการให้เหตุผลเฉพาะเมื่องานสมควรได้รับมัน และมีผลลัพธ์จากบุคคลที่สามบน benchmark ตรงตัว — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — ที่ทีมด้าน agentic และการเขียนโค้ดให้ความสำคัญมากที่สุด Fugu Ultra v2 ชนะคำถามที่แคบกว่าและน่าสนใจกว่า: ว่า coordinator ที่มีพูลเล็กกว่าจะเอาชนะโมเดลเรือธงได้หรือไม่ในงานที่ตรวจสอบคำตอบได้ กระดานคะแนนของ Sakana เองบอกว่าใช่ในห้าแถวจากแปดแถว และการที่พูลนั้นตัดโมเดลระดับท็อปออกไปก็บอกว่าชัยชนะนี้เกิดขึ้นโดยไม่มีโมเดลที่ดีที่สุดสามตัวในโลก

If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anth​ropic's list price with the provider's rate passed through untouched.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube