
Fugu Ultra v2 กับ Grok 4.6: ราคาเอาต์พุตสูงกว่าห้าเท่า แต่มีเบนช์มาร์กที่ใช้ร่วมกันเพียงหนึ่งเดียว
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
มีเบนช์มาร์กเพียงหนึ่งเดียวเท่านั้นที่ Fugu Ultra v2 และ Grok 4.6 ต่างก็เผยแพร่ตัวเลข และนั่นคือ DeepSWE: Sakana AI รายงานว่า Fugu Ultra v2 ได้ 74.3 ในการประกาศเมื่อวันที่ 11 กันยายน 2026 ขณะที่เอกสารเปิดตัวของ xAI สำหรับ Grok 4.6 ระบุคะแนน DeepSWE v1.1 ของตัวเองไว้ที่ 65.9% นั่นคือช่องว่าง 8.4 คะแนน และเป็นการเปรียบเทียบที่สะอาดเพียงอย่างเดียวที่ทั้งสองบริษัทเสนอให้ ทุกอย่างอื่นที่คุณอาจนำมาเทียบ — Chartography และ SWEFish ของ Sakana เทียบกับ GPQA Diamond และ CursorBench ของ Grok — วัดด้วยเครื่องมือที่แตกต่างกันโดยห้องแล็บที่แตกต่างกัน ดังนั้นคำถามที่ซื่อสัตย์ไม่ใช่ "อันไหนฉลาดกว่า" แต่คือว่าข้อได้เปรียบที่ Fugu Ultra v2 อ้างนั้นคุ้มค่าที่จะจ่าย $30 ต่อล้านโทเค็นเอาต์พุตหรือไม่ เมื่อ Grok 4.6 คิดค่าบริการ $6.
สองคำตอบที่แตกต่างกันสำหรับปัญหาเดียวกัน
Grok 4.6 เป็นโมเดลเดียว และเป็นเรือธงปัจจุบันของสาย Grok — ระบุเป็น "Latest" ในเอกสารสำหรับนักพัฒนาของผู้จำหน่ายเอง สืบทอดต่อจาก Grok 4.5 ด้วยหน้าต่างบริบท 500,000 โทเคนเท่ากัน พื้นผิวอินพุตแบบข้อความ/รูปภาพ/ไฟล์แบบเดียวกัน และราคาฐานเดียวกัน มีจุดตัดความรู้ ณ วันที่ 1 กุมภาพันธ์ 2026 และเปิดให้ปรับระดับความพยายามในการให้เหตุผลได้ตั้งแต่ต่ำ ปานกลาง สูง ไปจนถึงสูงมาก โดยค่าเริ่มต้นคือสูง รายละเอียดหนึ่งที่ทำให้หลายคนประหลาดใจ: ไม่สามารถปิดการให้เหตุผลได้ โทเคนที่ใช้คิดจะถูกคิดค่าบริการในทุกคำขอ ซึ่งทำให้ต้นทุนเอาต์พุตจริงของ Grok 4.6 ขึ้นอยู่กับว่ามันเลือกจะคิดหนักเพียงใด
Fugu Ultra v2ไม่ใช่โมเดลในความหมายปกติเลยสักนิด มันคือระดับความสามารถสูงสุดของสายผลิตภัณฑ์ด้านการประสานงาน (orchestration) ของ Sakana AI — เอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI ซึ่งทำหน้าที่แยกย่อยงานแล้วกระจายงานนั้นไปยังกลุ่มโมเดลอื่น ๆ โดยบางตัวเป็นแบบเปิดน้ำหนัก (open-weights) และบางตัวเป็นแบบเฉพาะทาง กรอบแนวคิดของ Sakana คือมันให้ผลลัพธ์ระดับแนวหน้า "โดยไม่ต้องพึ่งพาโมเดลระดับแนวหน้าที่มันประสานงานอย่างขาดไม่ได้" และระบุตรง ๆ ว่า Claude Fable 5, Claude Fable 5.1 และ GPT-6 Astra ถูกตัดออกจากกลุ่มนั้น คุณกำลังจ่ายเงินให้กับชั้นการจัดตารางงาน และจ่ายให้กับทุกโทเคนที่เอเจนต์ย่อยเผาผลาญไป
ความแตกต่างนั้นไม่ใช่เรื่องฉาบฉวยภายนอก มันเป็นเหตุผลทั้งหมดที่ทำให้ช่องว่างของราคาเกิดขึ้น และเป็นสิ่งเดียวที่ทำให้ช่องว่างนั้นมีเหตุผลรองรับได้
เรตการ์ด รวมถึงส่วนที่ซ้ำ
• อินพุต — Fugu Ultra v2 $5.00 ต่อ 1M เทียบกับ Grok 4.6 $2.00 ต่อ 1M Fugu แพงกว่า 2.5 เท่า ก่อนที่จะมีการเรียกย่อยใด ๆ เกิดขึ้น
• เอาต์พุต — Fugu Ultra v2 $30.00 ต่อ 1 ล้าน เทียบกับ Grok 4.6 $6.00 ต่อ 1 ล้าน ช่องว่างถึง 5 เท่า และเป็นตัวชี้ขาดค่าใช้จ่ายในบิลส่วนใหญ่
• อินพุตที่แคชไว้ — $0.50 ต่อ 1M ทั้งสองเจ้า เหมือนกันเป๊ะ ผู้ให้บริการสองรายที่ไม่มีอย่างอื่นเหมือนกันเลย กลับลงเอยที่ราคาอ่านแคชเดียวกัน ซึ่งทำให้ลูปของเอเจนต์ที่พึ่งพาแคชหนัก ๆ เป็นงานประเภทเดียวที่ทั้งสองเจ้าเทียบกันได้จริงแบบบรรทัดต่อบรรทัด
• การปรับราคาสำหรับบริบทยาว — Grok 4.6 ปรับขึ้นเป็นสองเท่าเป็น $4.00 / $12.00 เมื่อพรอมป์ต์ข้าม 200,000 โทเคน และการปรับราคานี้มีผลกับคำขอทั้งหมดไม่ใช่แค่ส่วนที่เกินเท่านั้น ระดับที่รายงานไว้ของ Fugu Ultra v2 สำหรับอินพุตโทเคนที่สูงกว่าประมาณ 272,000 จะขยับไปเป็นประมาณ $10.00 / $45.00 โดยคิดกับทั้งคำขอเช่นกัน ทั้งคู่ลงโทษพรอมป์ต์แบบยาว; Grok เริ่มลงโทษเร็วกว่า 72K โทเคน
• หน้าต่างบริบท — Grok 4.6 500K โทเคน เทียบกับ Fugu Ultra v2 1M ตามที่ระบุไว้ในรายการของบุคคลที่สาม หน้าเพจประกาศของ Sakana ไม่ได้ระบุตัวเลขบริบทไว้เลย ดังนั้นให้ถือว่า 1M ของมันยังไม่ได้รับการยืนยันจากผู้จำหน่าย
แถวบริบทแบบยาวก็เป็นดาบสองคม และคุ้มค่าที่จะลองคิดเลขดู พรอมต์ขนาด 300K โทเคนมีค่าใช้จ่าย $4.00 ต่ออินพุต 1 ล้านโทเคนบน Grok 4.6 และประมาณ $10.00 บน Fugu Ultra v2 พรอมต์ขนาด 150K โทเคนมีค่าใช้จ่าย $2.00 บน Grok และ $5.00 บน Fugu โมเดลของ Sakana แพงกว่าในทุกความยาวพรอมต์ — คำถามเดียวคือต้องเรียกใช้มันบ่อยแค่ไหน

ข้อโต้แย้งสำหรับการจ่าย 5× สำหรับ output
ข้อโต้แย้งที่สนับสนุนออร์เคสเตรเตอร์ไม่ใช่ว่ามันมีต้นทุนต่อโทเคนต่ำกว่า แต่คือมันต้องใช้จำนวนครั้งที่ลองน้อยกว่า และโทเคนที่มันใช้ไปกับการประสานงานนั้นถูกกว่าโทเคนที่คุณจะต้องเสียไปกับความล้มเหลว
นั่นเป็นข้อโต้แย้งที่มีน้ำหนักจริง และ Sakana กำลังพูดออกมาอย่างชัดเจนว่า: Fugu Ultra v2 มุ่งเป้าไปที่งานหลายขั้นตอนที่ซับซ้อน — การวิจัยอัตโนมัติ การพัฒนาฟูลสแต็ก — ซึ่งโหมดความล้มเหลวของโมเดลเดียวคือการหลุดรางไปกลางทางระหว่างการรันที่ยาวนาน หากอัตราค่าเอาต์พุต $30 ทำให้คุณทำงานเสร็จตั้งแต่รอบแรกแทนที่จะเป็นรอบที่สาม ค่าพรีเมียมต่อโทเคนก็ไม่สำคัญเลย
มีหลักฐานสนับสนุนจากฝั่งของผู้ขายเอง แม้ว่าจะเป็นหลักฐานที่เอื้อประโยชน์ต่อผู้ขายและควรอ่านโดยคำนึงถึงข้อเท็จจริงนั้น เอกสารเปิดตัวของ xAI สำหรับ Grok 4.6 ระบุว่าประมาณ 53 เทิร์นและโทเค็นอินพุตราว 0.5 พันล้านโทเค็นเพื่อทำงานที่มีขอบเขตยาวให้สำเร็จ เทียบกับประมาณ 103 เทิร์นและโทเค็นอินพุต 2.0 พันล้านโทเค็นของโมเดลแนวหน้าคู่แข่ง — เป็นข้อโต้แย้งว่า Grok เองมีต้นทุนคุ้มค่าต่อภารกิจ แม้ราคาต่อโทเค็นจะต่ำ ทั้งสองบริษัทกำลังเดินหมากเดียวกัน: ผลักคุณออกจากตารางราคาและมุ่งสู่ต้นทุนต่องานที่เสร็จสมบูรณ์
ซึ่งหมายความว่าตัวเลขที่ชี้ขาดคือตัวเลขที่ไม่มีผู้จำหน่ายรายใดเปิดเผย และคุณต้องวัดด้วยตัวเอง นั่นก็คือ จำนวนโทเค็นที่ใช้ไป ตั้งแต่ต้นจนจบ บนงานที่คล้ายกับงานของคุณ
ตรงจุดที่แต่ละอันอ่อนแอจริงๆ
จุดอ่อนที่เปิดเผยของ Grok 4.6 คืองานด้านเทอร์มินัล คะแนน Terminal-Bench v3.0 ของมันอยู่ที่ 26% ตามหลังผู้นำของวงการอยู่ไกล แม้ว่าโมเดลเดียวกันนี้จะทำได้ถึง 88.4% ซึ่งแข็งแกร่งกว่ามากบน Terminal-Bench v2.1 ที่เก่ากว่า — สองอันนั้นเป็นการทดสอบที่แตกต่างกัน และการนำมาปนกันเป็นความผิดพลาดที่คุณจะพบเห็นได้ในรายงานข่าวจำนวนมาก มันยังมีคะแนน GPQA Diamond สูงที่สุดในกลุ่มของมันที่ 94.9% แต่ต่อมา GPQA Diamond ถูกตัดออกจากดัชนีของ Artificial Analysis เนื่องจากอิ่มตัวแล้ว ดังนั้นคะแนนที่สูงในส่วนนั้นจึงไม่สามารถแยกแยะระหว่างโมเดลระดับแนวหน้าได้อีกต่อไปเหมือนที่เคยทำได้เมื่อปีที่แล้ว
ในด้านการประเมินอิสระ Artificial Analysis ให้คะแนน Grok 4.6 ที่ 44 บนดัชนี Intelligence Index v4.3 ของตน อยู่อันดับ #20 จาก 200 ด้วยต้นทุนต่องาน 1.86 ดอลลาร์ ตัวเลข 61 ที่มักถูกเผยแพร่กันบ่อยนั้นมาจากมาตรวัดดัชนีที่ถูกแทนที่แล้ว และไม่ควรนำมาอ้างโดยไม่ระบุว่าเวอร์ชันใดสร้างค่านั้นขึ้นมา
จุดอ่อนของ Fugu Ultra v2 คือการยืนยันผล ณ เวลาที่เผยแพร่ ยังไม่มีข้ออ้างใด ๆ ของ Sakana เกี่ยวกับมัน — ไม่ว่าจะเป็นผลลัพธ์ห้ารายการที่ดีที่สุดหรือดีที่สุดร่วม คะแนน Chartography 48.3 เทียบกับ 27.3 ของ Opus 5 และ 29.5 ของ Fable 5 หรือ DeepSWE 74.3 — ที่ได้รับการทำซ้ำโดยอิสระ ยังไม่มีตัวเลข latency หรือ throughput ที่เผยแพร่อีกด้วย ซึ่งสำคัญต่อ orchestrator มากกว่าต่อโมเดลเดี่ยว เพราะเวลาตอบสนองของมันขึ้นอยู่กับสิ่งที่มันตัดสินใจจะเรียกใช้ทั้งหมด สำหรับ Fugu Ultra รุ่นก่อน ผู้ทดสอบรายงานต่อสาธารณะว่าการรันยืดเยื้อถึงประมาณ 30 นาที นั่นคือโมเดลรุ่นมิถุนายน 2026 ไม่ใช่ v2 แต่มันคือรูปแบบความล้มเหลวที่ต้องทดสอบก่อนที่คุณจะตัดสินใจใช้เส้นทางโปรดักชัน

หมายเหตุเกี่ยวกับชื่อผู้ขาย
จุดที่ควรรู้ก่อนที่คุณจะไปค้นหา Grok 4.6 ในคอนโซลสำหรับนักพัฒนา: โมเดลนี้ถูกเรียกชื่ออย่างสม่ำเสมอว่า Grok 4.6 แต่การสร้างแบรนด์ของผู้ขายรอบ ๆ โมเดลนี้กำลังอยู่ในช่วงเปลี่ยนแปลง เอกสารของ xAI เองตอนนี้ใช้ชื่อ SpaceXAI ซึ่งเป็นการเปลี่ยนแปลงที่สื่อที่รายงานการเปิดตัวส่วนใหญ่ยังตามไม่ทัน ตัวระบุโมเดลและพื้นผิว API ไม่เปลี่ยนแปลง — Grok 4.6 เป็นโมเดล OpenAI Responses ระดับเฟิร์สคลาสและเสียบเข้ากับลูปการเรียกใช้เครื่องมือที่มีอยู่ได้โดยไม่ต้องมีเลเยอร์แปล — แต่ถ้าคุณกำลังค้นหาการ์ดโมเดลแล้วแบรนด์ดูผิด ก็ไม่ใช่ความผิดของคุณ
การเรียกใช้สิ่งใดสิ่งหนึ่งเหล่านี้ในทางปฏิบัติ
Grok 4.6 อยู่บน OrcaRouter ในอัตราของผู้ให้บริการเอง — 2.00 ดอลลาร์ต่ออินพุตหนึ่งล้าน และ 6.00 ดอลลาร์ต่อเอาต์พุตหนึ่งล้าน ส่งผ่านโดยไม่มีมาร์กอัปใด ๆ ดังนั้นการเปลี่ยนแปลงราคาจากผู้ขายจึงมาถึงที่นี่ภายในวันเดียวกัน แทนที่จะเป็นตามกำหนดการโยกย้าย มันเข้ากันได้กับ OpenAI บน URL หลักเดียวกันกับทุกอย่างอื่นในแค็ตตาล็อก ซึ่งหมายความว่าคุณสามารถวางมันไว้หลังเชนสำรองหรือกฎการกำหนดเส้นทางแทนการฮาร์ดโค้ดมันได้ และคุณสามารถทำ A/B ทดสอบเทียบกับโมเดลอื่นได้โดยไม่ต้องมีสัญญาฉบับที่สองหรือแก้ไขโค้ด
Fugu Ultra v2 ไม่ได้ถูกกำหนดเส้นทางโดยเรา มันมีให้ใช้ผ่าน API ที่เข้ากันได้กับ OpenAI ของ Sakana AI เอง และบริษัทกล่าวว่าการผสานรวม Fugu ที่มีอยู่จะย้ายมาใช้มันได้ด้วยการเปลี่ยนพารามิเตอร์เพียงตัวเดียว หากคุณต้องการเปรียบเทียบทั้งสองบนปริมาณงานของคุณ วิธีที่ประหยัดที่สุดคือปล่อย Grok 4.6 ไว้บนเกตเวย์ของคุณ และเรียก Fugu Ultra v2 โดยตรงจาก Sakana ภายใต้ฟีเจอร์แฟล็ก — ทั้งคู่ใช้รูปแบบคำขอเดียวกัน ดังนั้นชุดทดสอบเดียวกันจึงใช้ได้กับทั้งคู่

คำตัดสิน
Grok 4.6 เป็นตัวเลือกเริ่มต้นที่สมเหตุสมผลสำหรับทีมส่วนใหญ่ และราคาไม่ได้ใกล้เคียงกันเลย ด้วยราคา $2.00 / $6.00 พร้อมการอ่านแคชที่ $0.50 และหน้าต่าง 500K จึงรองรับการให้เหตุผลกับเอกสารยาว เอเจนต์เขียนโค้ด และงานไฟล์แบบมัลติโมดัล ในอัตราเอาต์พุตเพียงหนึ่งในห้าของ Fugu Ultra v2 อีกทั้งยังได้รับการให้คะแนนและเปรียบเทียบประสิทธิภาพจากหน่วยงานอิสระ จุดเสี่ยงของมันคือความยาวพรอมต์ — หน้าผา 200K ทำให้คำขอทั้งคำขอมีค่าใช้จ่ายเป็นสองเท่า — และลูปเอเจนต์ที่ใช้งานเทอร์มินัลหนัก ๆ ซึ่งคะแนนที่เผยแพร่ของมันไม่สามารถแข่งขันได้
Fugu Ultra v2 จะคุ้มค่ากับราคาที่สูงกว่าก็ต่อเมื่อคุณมีรูปแบบงานแบบหนึ่งโดยเฉพาะ นั่นคืองานที่ยาวนาน มีหลายขั้นตอน และเน้นการทำงานอัตโนมัติสูง ซึ่งโมเดลเดียวมีแนวโน้มจะออกนอกลู่ และเป็นงานที่คุณต้องการคุณสมบัติเชิงสถาปัตยกรรมที่ Sakana กำลังขายอยู่นั่นด้วย นั่นคือระดับขีดความสามารถที่ไม่ต้องพึ่งพาว่าผู้ขายรายใดรายหนึ่งระดับแนวหน้าจะยังคงให้บริการอยู่หรือยังคงมีราคาถูก นั่นเป็นสิ่งที่อยากได้จริง ๆ แต่ทว่า มันเป็นเพียงข้อกล่าวอ้าง ยังไม่ใช่การวัดผล และช่องว่าง DeepSWE ที่ทำให้มันดูน่าเชื่อถือนั้นเป็นเพียงเบนช์มาร์กเดียวจากผู้ขายรายเดียวในวันเปิดตัว
ถ้าคุณยังบอกไม่ได้ว่างานใดของคุณในตอนนี้ที่ล้มเหลวในความพยายามครั้งที่สองหรือครั้งที่สาม คุณก็ยังไม่มีตัวเลขที่จะพิสูจน์ความต่างของราคาได้ วัดสิ่งนั้นก่อน ส่วนการ์ดอัตราค่าบริการบอกอย่างอื่นให้คุณครบแล้ว
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
