
Fugu Ultra v2 กับ Gemini 3.1 Pro: คู่ต่อสู้ที่อาจอยู่ในเครื่องนี้อยู่แล้ว
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
มี Fugu Ultra v2 อยู่เวอร์ชันหนึ่งในการเปรียบเทียบกับ Gemini 3.1 Pro ที่ Gemini ชนะไม่ว่าเบนช์มาร์กจะออกมาในทางไหน — เพราะมันอาจเป็นฝ่ายทำงานบางส่วนให้ ระบบประสานงาน (orchestration) ของ Sakana AI ซึ่งเปิดตัวเมื่อวันที่ 11 กันยายน 2026 ไม่เปิดเผยว่ามันประสานงานโมเดลใดบ้าง กลุ่มโมเดลของ Fugu Ultra เวอร์ชันเดือนมิถุนายนที่มีการรายงานไว้มี Gemini 3.1 Pro รวมอยู่ด้วย ท่ามกลางตัวอื่น ๆ และเวอร์ชัน 2.0 บอกเราเพียงว่ามันเอาอะไรออกไป โดยระบุชื่อ Claude Fable 5, Claude Fable 5.1 และ GPT-6 Astra ว่าเป็นโมเดลที่ถูกตัดออก Gemini 3.1 Pro ของ Google เป็นโมเดล frontier แบบมัลติโมดัลเพียงตัวเดียวที่มีบริบทขนาด 1M token รับมือกับข้อความ รูปภาพ PDF เสียง และวิดีโอ เปิดให้ใช้งานทั่วไปตั้งแต่เดือนพฤษภาคม 2026 ในราคา 2.00 ดอลลาร์ต่ออินพุตหนึ่งล้าน token และ 12.00 ดอลลาร์ต่อเอาต์พุตหนึ่งล้าน token หนึ่งในสองนี้คือโมเดลที่คุณตรวจสอบได้ ส่วนอีกอันคือระบบที่ชัยชนะในเบนช์มาร์กอาจต้องส่งผ่านโมเดลแรก และไม่มีผู้ขายรายใดจะบอกคุณว่ามันเป็นเช่นนั้นหรือไม่
แต่ละระบบแท้จริงแล้วคืออะไร
Gemini 3.1 Pro อ่านเข้าใจได้ในแบบที่หายากแล้วในบรรดาการเปิดตัวโมเดลระดับแนวหน้า มันเป็นทรานส์ฟอร์เมอร์แบบ sparse mixture-of-experts จาก Google DeepMind เริ่มเปิดให้ใช้ในรูปแบบพรีวิวเมื่อวันที่ 19 กุมภาพันธ์ 2026 โดยมีแหล่งข่าวหนึ่งระบุว่าพร้อมให้ใช้งานทั่วไปในเดือนพฤษภาคม 2026 — รายการของเราเองจัดไว้ภายใต้ ID โมเดลพรีวิว รองรับหน้าต่างอินพุต 1M โทเคน และเพดานเอาต์พุต 65K โทเคน รับข้อความ รูปภาพ PDF เสียง วิดีโอ และโค้ด และมีตัวควบคุมการให้เหตุผลสามระดับ — ต่ำ กลาง หรือสูง — โดยค่าเริ่มต้นของ API คือระดับสูง Google รายงานว่า 77.1% บน ARC-AGI-2 ซึ่งมากกว่าสองเท่าของ 31.1% ในรุ่นก่อนหน้า; 94.3% บน GPQA Diamond; 80.6% บน SWE-bench Verified; 68.5% บน Terminal-Bench 2.0; 85.9% บน BrowseComp; และ 44.4% บน Humanity's Last Exam เมื่อไม่ใช้เครื่องมือ เพิ่มขึ้นเป็น 51.4% เมื่อใช้การค้นหาและการรันโค้ด ตัวเลขเหล่านี้เป็นตัวเลขจากผู้ขาย จุดตัดความรู้ของโมเดลคือมกราคม 2025 ซึ่งควรค่าแก่การแจ้งเตือน หากงานของคุณต้องพึ่งพาเหตุการณ์ล่าสุด
Fugu Ultra v2 เป็นผู้ประสานงาน เป็นโมเดลที่ผ่านการฝึก ซึ่งมีรายงานว่ามีพารามิเตอร์ประมาณ 7B ที่อ่านคำขอ ประกอบทีมเอเจนต์โดยมีบทบาท Thinker, Worker และ Verifier ที่ดึงมาจากงานวิจัย TRINITY ของ Sakana และสังเคราะห์คำตอบอยู่เบื้องหลัง endpoint ที่เข้ากันได้กับ OpenAI มันไม่มีรายการโมดัลลิตีที่เผยแพร่ของตัวเอง — สิ่งใดก็ตามที่มันมองเห็นได้ มันมองเห็นได้เพราะโมเดลในพูลของมันสามารถมองเห็นสิ่งนั้นได้ บริบทของมันคือ 1M tokens โดยมีหน้าผาราคาที่รุนแรงที่ 272K ซึ่งอัตราจะเพิ่มเป็นสองเท่าเป็น $10 สำหรับอินพุต และ $45 สำหรับเอาต์พุต เพดานเอาต์พุตของมันไม่ถูกเผยแพร่ พูลของมันไม่ถูกเปิดเผย การตัดสินใจด้าน routing ของมัน "ไม่ถูกเปิดเผยโดยการออกแบบ" และสำหรับระดับ Ultra พูลจะถูกตรึงไว้ ดังนั้นคุณจึงไม่สามารถตัดผู้ให้บริการรายใดออกได้
ความไม่สมมาตรนั้นคือการแข่งขันทั้งหมด Gemini 3.1 Pro เป็นส่วนประกอบที่คุณซื้อได้โดยตรงและให้เหตุผลเกี่ยวกับมันได้ ส่วน Fugu Ultra v2 เป็นการประกอบที่คุณมองไม่เห็นชิ้นส่วน และข้ออ้างด้าน benchmark ที่แข็งแกร่งที่สุดของมันอาจเป็นผลลัพธ์ของ Gemini เองที่ผสมกับของคนอื่น เพียงบางส่วน

การเปรียบเทียบในส่วนที่ทั้งสองทับซ้อนกัน
หลักฐานที่เผยแพร่มีน้อยมากที่จะจัดสองระบบนี้ให้อยู่ในแถวเดียวกัน ตัวเลขของ Gemini 3.1 Pro ด้านล่างเป็นของ Google เอง; ตัวเลขของ Fugu Ultra v2 เป็นของ Sakana เอง; ในกรณีที่ผู้รวบรวมข้อมูลบุคคลที่สามได้เผยแพร่แถวร่วม จะมีการทำเครื่องหมายไว้ พร้อมข้อควรระวังว่าเป็นเพียงข้อมูลเชิงทิศทางมากกว่าที่จะชี้ขาด
• การให้เหตุผลแบบหลายรูปแบบ (CharXiv, แถวที่ใช้ร่วมกัน) — Fugu Ultra v2 86.6% เทียบกับ Gemini 3.1 Pro 80.2% ตามข้อมูลของ BenchLM ซึ่งระบุว่าหมวดหมู่นี้เป็นเชิงทิศทางและปฏิเสธที่จะระบุผู้ชนะ
• TerminalBench 2.1 — ไม่มีตัวเลขของ Fugu Ultra v2 v2.0 เมื่อเทียบกับ Gemini 3.1 Pro และไม่มีตัวเลขที่เผยแพร่ซึ่งเทียบเคียงได้; Fugu Ultra เดือนมิถุนายนรายงาน 82.1% เทียบกับ 70.3% ของ Gemini 3.1 Pro ในการรวบรวมโดยบุคคลที่สาม
• SWE-Bench Pro — ไม่มีตัวเลขของ Fugu Ultra v2 v2.0 เทียบกับ Gemini 3.1 Pro ไม่มีตัวเลขที่เผยแพร่ซึ่งเทียบเคียงได้ ส่วน Fugu Ultra เดือนมิถุนายนรายงานไว้ 73.7% เทียบกับ 54.2% ของ Gemini 3.1 Pro
• ARC-AGI-2 — ไม่มีค่าคะแนนของ Fugu Ultra v2 เมื่อเทียบกับ Gemini 3.1 Pro 77.1% ซึ่งเป็นข้อมูลที่ผู้ขายรายงานเอง
• Humanity's Last Exam — ไม่มีตัวเลขของ Fugu Ultra v2 v2.0 เมื่อเทียบกับ Gemini 3.1 Pro 44.4% เมื่อไม่ใช้เครื่องมือ, 51.4% เมื่อใช้เครื่องมือ, ตามที่ผู้ขายรายงาน
• ความครอบคลุมของโมดัลลิตี — Fugu Ultra v2 สืบทอดทุกอย่างที่พูลของมันรองรับ โดยไม่เปิดเผย เทียบกับ Gemini 3.1 Pro ที่รองรับข้อความ รูปภาพ PDF เสียง วิดีโอ และโค้ด ซึ่งมีเอกสารระบุ
• ราคาอินพุต / เอาต์พุต — Fugu Ultra v2 $5.00 / $30.00 ต่อ 1M โดยเพิ่มเป็นสองเท่าเมื่อเกิน 272K เทียบกับ Gemini 3.1 Pro $2.00 / $12.00 ต่อ 1M สูงสุด 200K, $4.00 / $18.00 เมื่อเกิน, อินพุตที่แคชไว้ $0.20 / $0.40
• บริบทและเอาต์พุต — Fugu Ultra v2 คอนเท็กซ์ 1M, เพดานเอาต์พุตยังไม่เปิดเผย เทียบกับ Gemini 3.1 Pro อินพุต 1M, เอาต์พุต 65K
• น้ำหนักและการเข้าถึง — Fugu Ultra v2 ปิด, ไม่รวม EU/EEA เทียบกับ Gemini 3.1 Pro ที่เป็นกรรมสิทธิ์แต่พร้อมใช้งานอย่างกว้างขวางทั่วทุกช่องทางของ Google
แถวมัลติโมดัลเป็นแถวที่ต้องจัดการอย่างระมัดระวัง เพราะเป็นแถวที่ถูกอ้างอิงมากที่สุดและมีความหนักแน่นน้อยที่สุด การรวมข้อมูล CharXiv ของ BenchLM จัดให้ Fugu Ultra v2 นำอยู่ 6.4 คะแนนนอร์มัลไลซ์ — และหน้าเดียวกันยังระบุอย่างชัดเจนว่าแถวเชิงทิศทางไม่เคยได้รับการตัดสินให้มีผู้ชนะ, Gemini ไม่มีผลลัพธ์ที่วัดได้ในหมวดเอเจนต์ การเขียนโค้ด ความรู้ หรือหลายภาษา และ Fugu ไม่มีผลลัพธ์ใด ๆ ในหมวดคณิตศาสตร์หรือหลายภาษา หมวดที่ในแถวส่วนใหญ่มีเพียงฝ่ายเดียวที่ถูกวัดย่อมไม่อาจให้คำตัดสินได้ หากคุณจะไม่รับสิ่งอื่นใดจากการเปรียบเทียบนี้ ขอให้รับสิ่งนี้ไว้: โดยเฉพาะงานมัลติโมดัล หลักฐานที่เผยแพร่ไม่สนับสนุนข้อสรุปไม่ว่าทางใด และแถวเดียวที่มีอยู่นั้นก็ไม่ใช่ผลลัพธ์ที่ยุติแล้วอย่างชัดเจน
ความเป็นไปได้ที่เปลี่ยนกรอบ
Sakana จะไม่บอกว่ามีอะไรอยู่ในพูล นั่นเป็นทางเลือกด้านการออกแบบที่บันทึกไว้ ไม่ใช่ความหลงลืม — FAQ ระบุว่าข้อมูลการจัดเส้นทางไม่ถูกเปิดเผยโดยการออกแบบ และไม่มีกลไกใดให้ตรวจสอบดูได้ สิ่งที่เราทราบจากการสร้างรุ่นเดือนมิถุนายนก็คือ สมาชิกในพูลที่มีรายงานว่าอยู่ในนั้นมี Gemini 3.1 Pro รวมอยู่ด้วย พร้อมกับโมเดลแนวหน้าอื่น ๆ เวอร์ชัน 2.0 ได้เปลี่ยนสมาชิกในพูล และ Sakana อธิบายการเปลี่ยนแปลงนี้เพียงในเชิงการตัดออกเท่านั้น: Claude Fable 5, Claude Fable 5.1 และ GPT-6 Astra ถูกนำออกไป ไม่มีข้อความใดในประกาศเปิดตัวที่บอกว่า Gemini ยังอยู่ในพูล
ถ้า Gemini 3.1 Pro อยู่ในพูล ผลตามมาสามข้อ และทั้งสามข้อเป็นเรื่องปฏิบัติมากกว่าปรัชญา ข้อแรก ประสิทธิภาพแบบมัลติโมดัลส่วนหนึ่งของ Fugu Ultra v2 คือประสิทธิภาพของ Gemini รวมกับของโมเดลอื่น ๆ — ซึ่งหมายความว่าคุณกำลังจ่ายค่าพรีเมียมด้านการประสานงานเพิ่มจากอัตราต่อโทเคนที่คุณจ่ายโดยตรงได้ ข้อสอง Fugu Ultra v2 ที่ราคาเอาต์พุต 30 ดอลลาร์ต่อล้านโทเคน เทียบกับ Gemini 3.1 Pro ที่ 12 ดอลลาร์ เป็นพรีเมียมสำหรับการประกอบ ไม่ใช่สำหรับขีดความสามารถล้วน ๆ; ถ้างานของคุณคือคำถามแบบมัลติโมดัลเพียงข้อเดียว Gemini ตอบถูกกว่า และคุณเห็นได้ชัดว่าโมเดลใดเป็นคนตอบ ข้อสาม และมีประโยชน์ที่สุด มาตรฐานวัดที่ซื่อตรงของออร์เคสเตรเตอร์ไม่ใช่ "มันเอาชนะส่วนประกอบของมันได้ไหม" แต่คือ "มันเอาชนะส่วนประกอบที่ดีที่สุดของมันได้ไหมเมื่อคุณใช้มันลำพัง" สถาปัตยกรรมของ Sakana สร้างบนคำกล่าวอ้างว่ามันทำได้ ในงานที่ตรวจสอบยืนยันได้ คำกล่าวอ้างนั้นคุ้มค่าที่จะทดสอบกับเวิร์กโหลดของคุณเอง ก่อนที่คุณจะยอมรับมันบนเบนช์มาร์กการอ่านแผนภูมิ
มีเวอร์ชันหนึ่งที่คำตอบคือไม่ และออร์เคสเตรเตอร์ก็ยังคงมีที่ยืนของมัน ถ้า Gemini อยู่ในพูล และคะแนน Chartography 48.3 ของ Fugu Ultra v2 เมื่อเทียบกับ 27.3 ของ Claude Opus 5 ยังยืนได้ สิ่งที่ Sakana สร้างขึ้นก็คือเลเยอร์การประสานงานที่เชื่อถือได้ในการดึงประสิทธิภาพจากโมเดลเดียวกันให้ได้มากกว่าการเรียกใช้เพียงครั้งเดียว นั่นคือผลิตภัณฑ์จริง และคำถามที่ยังเปิดอยู่ก็แค่ว่าส่วนต่างนั้นครอบคลุมราคาหรือไม่ ยังไม่มีใครเผยแพร่การทดลองนี้

ที่ซึ่งขอบอันซื่อตรงอยู่
ข้อได้เปรียบของ Gemini 3.1 Pro นั้นเป็นรูปธรรมชัดเจน ราคาของมันอยู่ที่ประมาณสองในห้าของ Fugu Ultra v2 ทั้งขาเข้าและขาออก และต่างจาก Fugu ตรงที่อัตราของมันไม่เพิ่มเป็นสองเท่าเมื่อพ้นเกณฑ์บริบท โดยขั้นที่ 200K นั้นค่อยเป็นค่อยไปกว่าผาสูงชันที่ 272K มันระบุโมดัลลิตีของตนเองไว้อย่างชัดเจนแทนที่จะสืบทอดมาเฉย ๆ ซึ่งหมายความว่างานด้านเสียงและวิดีโอเป็นฟีเจอร์ที่รองรับจริง ไม่ใช่ความหวังลม ๆ แล้ง ๆ มันมีเพดานผลลัพธ์ที่ประกาศไว้ และสามารถเข้าถึงได้ผ่านช่องทางของ Google เอง และเช่นเดียวกับโมเดลอื่น ๆ ที่ Fugu Ultra v2 ถูกนำมาเปรียบเทียบด้วย มันเรียกใช้งานได้บน OrcaRouter ในชื่อ google/gemini-3.1-pro-preview, ในราคาตามรายการของ Google โดยบวกเพิ่ม 0% ดังนั้นการเปลี่ยนแปลงราคาของ Google จึงมีผลกับคีย์เดียวกันในวันเดียวกับที่ประกาศออกมา
ข้อได้เปรียบของ Fugu Ultra v2 นั้นแคบกว่าและเป็นของจริง มันโจมตีปัญหายากมากกว่าหนึ่งครั้ง โดยมีบทบาท Verifier คอยตรวจงาน ซึ่งเป็นเหตุผลว่าทำไมข้ออ้างที่แข็งแกร่งที่สุดของมันจึงอยู่บน benchmark ที่ตรวจสอบความถูกต้องได้ — Chartography, DeepSWE, Toolathon — มากกว่าอยู่บนการเรียกคืนความรู้ กรณีศึกษาที่ Sakana เผยแพร่ก็เอนไปทางเดียวกัน: ไอริส CAD เชิงกลที่เปิดและปิดได้อย่างถูกต้องในจุดที่โมเดลอื่นทิ้งช่องว่างและข้อต่อที่อ่อนแอ; ตัวแก้รูบิกส์คิวบ์ที่เขียนด้วย Python ล้วนที่ไขลูกบาศก์ที่สลับทั้งหมด 300 ลูกได้สำเร็จ ในขณะที่ baseline ชั้นแนวหน้าสองตัวที่ปกปิดชื่อพังไปเลยทั้งหมด baseline เหล่านั้นถูกปกปิดชื่อและถูกเลือกโดยผู้ขาย ดังนั้นควรถือเป็นตัวอย่างประกอบมากกว่าหลักฐาน แต่รูปแบบนี้สอดคล้องกันทั่วทั้งการเปิดตัว และมันอธิบายความสามารถที่แท้จริงซึ่งการเรียกโมเดลเพียงครั้งเดียวไม่มี: ความมุ่งมั่นต่อปัญหาจนกว่าคำตอบจะผ่านการตรวจสอบ
ชั่งน้ำหนักข้อจำกัดด้วยเช่นกัน Fugu Ultra v2 ไม่ได้วางจำหน่ายใน EU หรือ EEA และ Sakana ระบุชัดเจนว่ากำลังดำเนินการเพื่อให้สอดคล้องกับ GDPR ส่วน Gemini 3.1 Pro ไม่มีข้อจำกัดดังกล่าว และมีประวัติการประเมินโดยอิสระที่ยาวนานกว่ามากรองรับอยู่เบื้องหลัง

คำตัดสิน
สำหรับงานมัลติโมดัลส่วนใหญ่ Gemini 3.1 Pro คือตัวเลือกที่ใช่ และไม่ได้ใกล้เคียงเลย มันถูกกว่าต่อโทเคน ถูกกว่าต่อเอกสาร มีเอกสารรองรับสำหรับเสียงและวิดีโอ ถูกจำกัดที่ขีดจำกัดบริบทซึ่งไม่ทำให้บิลของคุณเพิ่มเป็นสองเท่ากลางการรัน และ — ส่วนที่สำคัญที่สุดตรงนี้ — คุณเห็นได้ว่าอะไรตอบคุณ หากคุณต้องการโมเดลเดียวสำหรับอ่าน PDF ดูคลิป และตอบคำถาม ก็ไม่มีเหตุผลใดๆ ที่จะส่งเรื่องนั้นผ่านพูลที่ไม่ได้เปิดเผยในราคาสองเท่าครึ่งของราคาเอาต์พุต
Fugu Ultra v2 เป็นตัวเลือกที่เหมาะสมสำหรับงานที่มีรูปแบบเฉพาะเจาะจงและแคบกว่ามาก: งานระยะยาวที่มีคำตอบที่ตรวจสอบได้ ซึ่งการลองแก้ปัญหาด้วยสามวิธีและตรวจสอบผลลัพธ์นั้นดีกว่าการลองเพียงครั้งเดียว และคุณภาพที่เพิ่มขึ้นเพียงเล็กน้อยนั้นคุ้มค่ากับค่าใช้จ่ายที่เพิ่มขึ้นหลายเท่า จะไม่นำมาพิจารณาโดยสิ้นเชิงหากคุณมีผู้ใช้ใน EU หรือ EEA อยู่ในขอบเขต
คำถามที่อึดอัดซึ่งการจับคู่นี้เปิดค้างไว้ คือคำถามที่ยังไม่มีใครวัดมัน หาก Gemini 3.1 Pro อยู่ในพูล — และคำตอบที่ซื่อสัตย์เพียงหนึ่งเดียวในวันนี้คือ Sakana ยังไม่ได้บอกว่ามันไม่ได้อยู่ — แล้วส่วนหนึ่งของสิ่งที่คุณกำลังซื้อด้วย Fugu Ultra v2 ก็คือ Gemini 3.1 Pro พร้อมเลเยอร์ประสานงานที่วางทับอยู่ด้านบน ในราคาที่บอกเป็นนัยว่าเลเยอร์นี้มีมูลค่าประมาณสองเท่าครึ่งของโมเดล นั่นอาจเป็นจริงก็ได้ สถาปัตยกรรมของ Sakana ถูกสร้างขึ้นเพื่อทำให้มันเป็นจริง แต่มันเป็นสมมติฐานที่มีสกอร์บอร์ดของผู้ขายอยู่เบื้องหลัง และไม่มีการทดสอบอิสระ และจนกว่าจะมีใครสักคนรันมัน โมเดลที่คุณมองเห็นได้ก็คือโมเดลที่คุณปกป้องได้
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
