
Fugu Ultra v2 กับ Qwen3.8-Max: ทำไมป้ายราคาจึงเป็นตัวเลขที่ไม่ถูกต้อง
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2 มีค่าใช้จ่าย $30.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน Qwen3.8-Max มีค่าใช้จ่าย $6.00 นั่นคือช่องว่าง 5 ต่อ 1 และถ้าคุณเลือกระหว่างระบบเอเจนต์สองระบบนี้โดยดูจากอัตราส่วนนั้น คุณจะเลือกผิด — เพราะจริง ๆ แล้วไม่มีระบบใดถูกคิดค่าบริการตามที่รายการราคาของมันบอกไว้ จากการวัดของ Artificial Analysis เอง Qwen3.8-Max สร้างโทเคนเอาต์พุต 180 ล้านโทเคนเพื่อทำ Intelligence Index ให้เสร็จ มากกว่าสองเท่าของค่ามัธยฐานของโมเดลซึ่งอยู่ที่ 89 ล้านโทเคน ด้วยต้นทุน $2.67 ต่องาน มันเป็นโมเดลที่ประหยัดถ้าดูที่โทเคน และเป็นโมเดลที่ฟุ่มเฟือยถ้าดูที่คำตอบ Fugu Ultra v2 ของ Sakana AI ซึ่งเปิดตัวเมื่อวันที่ 11 กันยายน 2026 มีลักษณะตรงกันข้าม: กลุ่มโมเดลจากห้องแล็บอื่นที่ไม่เปิดเผย ซึ่งมันเรียกใช้และประสานงานตามแต่ละคำขอ โดยคิดค่าบริการในอัตราแบบผสมอัตราเดียว ซึ่ง Sakana กล่าวว่าจะไม่ทวีคูณเมื่อเพิ่มเอเจนต์ ตัวหนึ่งเป็นโมเดลเดี่ยวขนาด 2.4 ล้านล้านพารามิเตอร์ที่คิดออกมาให้เห็นเป็นเวลานาน อีกตัวเป็นผู้ประสานงานขนาดเล็กที่จ้างความช่วยเหลือ การเปรียบเทียบราคาโทเคนของทั้งสองแทบไม่ได้บอกอะไรคุณเลยว่าระบบใดถูกกว่าในการรัน
สองวิธีที่ตรงกันข้ามที่จะมีราคาแพง
เริ่มจากกลไกก่อน เพราะมันอธิบายความแตกต่างอื่น ๆ ทั้งหมดในการเปรียบเทียบนี้
Qwen3.8-Max เป็นโมเดลแบบ sparse mixture-of-experts — มีพารามิเตอร์รวม 2.4 ล้านล้านตัว โดยมีพารามิเตอร์ที่ทำงานจริงราว 95,000 ล้านตัวต่อโทเคน — ที่ไปถึงผลลัพธ์ระดับใกล้เคียงแนวหน้าได้ด้วยการทำงานนานขึ้น ไม่ใช่ด้วยการมีขนาดใหญ่ขึ้น Artificial Analysis วัดความเร็วได้ 37.8 โทเคนเอาต์พุตต่อวินาที จัดอยู่อันดับ #154 จาก 200 โมเดลด้านความเร็ว โดยปล่อยโทเคนเอาต์พุต 180 ล้านโทเคนตลอดการทดสอบ Intelligence Index (#70 จาก 200 ด้านความเยิ่นเย้อ) ต้นทุนต่อหนึ่งงานใน Intelligence Index อยู่ที่ $2.67 และส่วนลดแคชของมันลึกเป็นพิเศษถึง 88% ซึ่งเป็นคันโยกที่ควบคุมค่าใช้จ่ายได้จริงในกรณีนี้: การรันเอเจนต์แบบยาวที่อ่านบริบทเดิมซ้ำ ๆ นั้นถูก ส่วนการรันที่สร้างข้อความใหม่ไปเรื่อย ๆ นั้นไม่ถูก
Fugu Ultra v2 เข้าแก้ปัญหาเดียวกันจากอีกด้านหนึ่ง มันเป็นตัวจัดระบบ — ผู้ประสานงานขนาดเล็กที่ผ่านการฝึกฝน ซึ่งมีรายงานว่ามีพารามิเตอร์ประมาณ 7 พันล้านตัว ที่อ่านคำขอ แล้วประกอบทีมเอเจนต์ตามบทบาท Thinker, Worker และ Verifier จากงาน TRINITY ของ Sakana จากนั้นจึงสังเคราะห์คำตอบ ค่าโทเค็นของมันคือผลรวมของสิ่งที่เอเจนต์ย่อยผลิตขึ้นบวกกับข้อความสังเคราะห์ของตัวประสานงานเอง Sakana ระบุในคำถามที่พบบ่อยเกี่ยวกับการกำหนดราคาว่าคุณจะถูกคิดในอัตราผสมเดียวที่ตรึงไว้กับโมเดลระดับสูงสุดที่เกี่ยวข้อง และการเพิ่มเอเจนต์จะไม่ทำให้ค่าใช้จ่ายทวีคูณ ซึ่งขจัดปัญหาการระเบิดของค่าใช้จ่ายแบบหลายเอเจนต์คลาสสิกที่การกระจายงานทำให้ต้นทุนทวีคูณ สิ่งที่มันไม่ได้ขจัดออกไปคือปริมาณ ที่ราคา $30.00 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น ตัวเลขที่สำคัญคือจำนวนเอเจนต์ที่ทำงานและปริมาณที่พวกมันเขียน และนั่นคือตัวเลขที่ทั้งคุณและ Sakana ต่างก็ไม่สามารถคาดเดาได้จากหน้าการกำหนดราคา
นั่นคือการวางกรอบช่องว่างด้านราคาอย่างตรงไปตรงมา: มันเป็นอัตรา ไม่ใช่ยอดรวม อัตราที่สูงกว่าห้าเท่าซึ่งใช้กับภาระงานที่คุณไม่อาจคาดการณ์ปริมาณผลลัพธ์ได้ ไม่ได้หมายความว่าต้นทุนจะสูงเป็นห้าเท่า — หากแต่เป็นตัวคูณที่ไร้ขอบเขตโดยมีขั้นต่ำที่คาดการณ์ได้

สเปกชีต และแถวเดียวที่ชี้ขาด
• ราคา — Fugu Ultra v2 $5.00 ต่ออินพุต / $30.00 ต่อเอาต์พุต ต่อ 1M โทเคน เทียบกับ Qwen3.8-Max $2.00 ต่ออินพุต / $6.00 ต่อเอาต์พุต
• อินพุตที่แคชไว้ — Fugu Ultra v2 $0.50 ต่อ 1M เทียบกับ Qwen3.8-Max $0.25 ต่อ 1M สำหรับการอ่าน และส่วนลดแคช 88% ที่วัดโดย Artificial Analysis
• ค่าธรรมเนียมเพิ่มสำหรับบริบทขนาดยาว — Fugu Ultra v2 อินพุตเพิ่มเป็นสองเท่าเป็น $10.00 และเอาต์พุตเป็น $45.00 เมื่อเกิน 272K โทเค็น เทียบกับ Qwen3.8-Max ที่ไม่มีค่าธรรมเนียมเพิ่มสำหรับพรอมป์ยาว คิดราคาคงที่จนถึงขีดจำกัดหน้าต่าง
• หน้าต่างบริบท — Fugu Ultra v2 1M โทเคน เทียบกับ Qwen3.8-Max 1M โทเคน
• เพดานเอาต์พุต — Fugu Ultra v2 ไม่ได้เปิดเผยเป็นตัวเลขเดียว เทียบกับ Qwen3.8-Max ประมาณ 128K โทเคน
• รูปแบบอินพุต — Fugu Ultra v2 รองรับข้อความ โดยมีความสามารถของพูลเองเป็นเบื้องหลัง เทียบกับ Qwen3.8-Max ที่รองรับข้อความ รูปภาพ วิดีโอ และ PDF
• น้ำหนักโมเดล — Fugu Ultra v2 เป็นแบบปิด โดยไม่เปิดเผยสมาชิกภาพในพูลตามการออกแบบ เทียบกับ Qwen3.8-Max ที่เผยแพร่น้ำหนักแบบเปิดสำหรับเช็กพอยต์ระดับ Max ภายใต้สัญญาอนุญาตแบบกำหนดเอง
• ความพร้อมจำหน่ายตามภูมิภาค — Fugu Ultra v2 ไม่วางจำหน่ายใน EU/EEA เทียบกับ Qwen3.8-Max ที่มีจำหน่ายโดยไม่มีข้อจำกัดด้านภูมิภาค
• การประเมินอิสระ — Fugu Ultra v2 ยังไม่มีผลเผยแพร่ และไม่มีหน้า Artificial Analysis สำหรับโมเดล Fugu ใด ๆ ขณะที่ Qwen3.8-Max เป็นรายการ Artificial Analysis ที่ใช้งานจริง ซึ่งมีตัวเลขความเร็ว ความยาวคำตอบ และค่าใช้จ่ายต่องานที่เผยแพร่
อ่านสองแถวสุดท้ายประกอบกัน แล้วการเปรียบเทียบก็คมชัดขึ้น Qwen3.8-Max เป็นโมเดลที่คุณระบุเวอร์ชันได้ อ่านสัญญาอนุญาตได้ ดาวน์โหลดเช็กพอยต์ได้ และตรวจสอบเทียบกับกระดานคะแนนของบุคคลที่สามได้ Fugu Ultra v2 เป็นระบบที่คุณตรวจสอบภายในไม่ได้ โฮสต์เองไม่ได้ ซื้อในยุโรปไม่ได้ และตรวจสอบเทียบกับใครก็ตามนอก Sakana ไม่ได้ ค่าธรรมเนียมส่วนเพิ่มที่ 272K ยิ่งซ้ำเติมเรื่องนี้: เมื่อเกินเกณฑ์ดังกล่าว อัตราอินพุตของ Fugu Ultra v2 จะเป็นสองเท่า และอัตราเอาต์พุตเพิ่มขึ้นครึ่งหนึ่ง ขณะที่อัตราของ Qwen3.8-Max ไม่ขยับ สำหรับงานเอกสารและรีโพซิทอรีระยะยาวที่ทั้งสองระบบถูกสร้างมาเพื่อรองรับ ราคาที่ถูกกว่าบนหัวกระดาษก็เป็นราคาที่ราบเรียบกว่าเช่นกัน
ตัวเลข Qwen3.8-Max ที่ทุกคนอ้างถึงกันนั้นล้าสมัยแล้ว
หากคุณได้อ่านเกี่ยวกับโมเดลนี้ที่ใดก็ตามในช่วงสองสัปดาห์ที่ผ่านมา คุณคงเคยเห็น Artificial Analysis Intelligence Index อยู่ที่ 58 หรือ 58.1 หรือ 58.4 ตัวเลขเหล่านั้นเป็นค่าจริงในตอนนั้นและไม่ใช่ค่าปัจจุบันอีกต่อไป Artificial Analysis ได้ปรับเทียบดัชนีใหม่เป็น v4.3 เมื่อวันที่ 7 กันยายน 2026 ทำให้คะแนนโดยรวมถูกบีบให้ต่ำลง และหน้า Qwen3.8-Max แบบเรียลไทม์ในตอนนี้แสดง 40 ซึ่งอยู่ในอันดับที่ 30 จาก 200 โมเดล — พร้อมป้าย "Updated" ที่บ่งชี้ว่าเป็นคะแนนที่ถูกปรับใหม่ บทความเก่า ๆ ยังระบุต้นทุนความพยายาม (effort tax) ที่วัดตามมาตรวัดเดิมด้วย: 64 เทิร์นต่องาน เทียบกับ 14 เทิร์นของ Qwen เจนเนอเรชันก่อนหน้า และประมาณ $1.14 ต่องานใน Intelligence Index หน้าปัจจุบันแสดง $2.67 ต่องาน, 37.8 โทเคนเอาต์พุตต่อวินาที และ 180 ล้านโทเคนเอาต์พุตบนดัชนี
มีสองเรื่องตามมา เรื่องแรก บนสเกลที่ปรับเทียบใหม่ Qwen3.8-Max อยู่ในช่วงเดียวกับส่วนที่เหลือของชั้นสองแห่งแนวหน้า มากกว่าจะอยู่ระดับเดียวกับแนวหน้า และการเปรียบเทียบใดก็ตามที่คุณอ่านซึ่งจัดอันดับมันเทียบกับ Claude Opus 5 หรือ Kimi K3 บนคะแนน 58 กำลังเปรียบเทียบสแนปช็อตจากสเกลที่ต่างกัน เรื่องที่สอง และเป็นประโยชน์กว่าสำหรับการจับคู่นี้ การแก้ไขเป็นไปในทิศทางเดียว: Qwen3.8-Max มีตัวเลขที่อาจผิดแล้วแก้ไขได้ ส่วน Fugu Ultra v2 ไม่มีตัวเลข ทุกตัวเลขของ Fugu ในบทความนี้มาจากการประเมินของ Sakana เอง และ ณ วันที่ 11 กันยายน ไม่มีหน้า Artificial Analysis สำหรับ Fugu Ultra v2 หรือโมเดล Fugu อื่นใด — URL ขึ้น 404 เมื่อผู้ขายเผยแพร่กระดานคะแนนและไม่มีบุคคลที่สามรายใดรันโมเดล กระดานคะแนนก็คือบันทึกทั้งหมด
ตรงที่พวกมันทับซ้อนกันจริง ๆ และตรงที่พวกมันไม่ทับซ้อนกัน
Sakana รายงานว่า Fugu Ultra v2 ดีที่สุดหรือดีที่สุดร่วมในห้าในแปดเบนช์มาร์ก ได้แก่ GDP.pdf, Chartography, SWEFish, DeepSWE และ Toolathon และติดสองอันดับแรกในเจ็ดจากแปด ตัวเลขชัดเจนสองตัวในการเปิดตัวคือ Chartography ที่ 48.3 เมื่อเทียบกับ 27.3 ของ Claude Opus 5 และ 29.5 ของ Claude Fable 5 ในตารางเดียวกัน และ DeepSWE ที่ 74.3 แถวข้อมูลที่ Alibaba เผยแพร่เองสำหรับ Qwen3.8-Max ได้แก่ Terminal-Bench 2.1 ที่ 86.6, OSWorld-Verified ที่ 86.1, GPQA Diamond ที่ 92.6 และ SWE-bench Pro ที่ 67.7
สังเกตว่าสองรายการนั้นมีอะไรเหมือนกันไหม: ไม่มีเลย ไม่มี benchmark อันใดปรากฏในตารางผู้ขายทั้งสองตาราง ไม่มีแถวใดที่คุณจะวางตัวเลขของ Sakana กับตัวเลขของ Alibaba ไว้ข้างกันแล้วอ่านหาผู้ชนะได้ ซึ่งหมายความว่าคำตอบที่ซื่อตรงต่อคำถามที่ว่า "อะไรเก่งกว่ากันในฐานะเอเจนต์เขียนโค้ด" คือไม่มีหลักฐานที่เผยแพร่ใดตอบคำถามนี้ สิ่งที่มีอยู่คือระบบหนึ่งที่มีแปดแถวซึ่งผู้ขายเลือกเองและไม่มีการตรวจสอบจากภายนอก กับอีกระบบหนึ่งที่มีแถวของผู้ขายบวกกับรายการอิสระหนึ่งรายการที่วัดต้นทุนและความเร็ว แทนที่จะวัดความสามารถแบบเทียบตรงกัน นั่นคือช่องว่างในหลักฐาน ไม่ใช่ช่องว่างในตัวโมเดล และมันควรเปลี่ยนวิธีที่คุณซื้อ: คุณเลือกไม่ได้ระหว่างสิ่งเหล่านี้บน benchmark ดังนั้นจงเลือกจากคุณสมบัติที่คุณตรวจสอบได้จริง

น้ำหนักแบบเปิด เทียบกับพูลที่ไม่เปิดเผย
นี่คือจุดที่ข้อโต้แย้งเรื่องการผูกติดตามปกติพลิกกลับ และมันเป็นสิ่งที่น่าสนใจที่สุดเกี่ยวกับการจับคู่นี้
จุดขายของ Sakana สำหรับ Fugu Ultra v2 คืออธิปไตย พูลของโมเดลแบบเปิดและโมเดลเฉพาะทางที่สับเปลี่ยนได้ หมายความว่าการตัดสินใจด้านราคา กำหนดการยกเลิกการสนับสนุน หรือการเปลี่ยนแปลงนโยบายของผู้ขายรายใดรายหนึ่ง จะทำให้ผลิตภัณฑ์ของคุณล่มไม่ได้ และการเปิดตัวครั้งนี้ก็เน้นประเด็นดังกล่าวอย่างชัดเจนโดยระบุว่าองค์ประกอบของพูลเปลี่ยนไปใน v2 บริษัทยังระบุอย่างตรงไปตรงมาว่าคะแนนของ Fugu Ultra v2 ทำได้โดยไม่มี Claude Fable 5, Claude Fable 5.1 หรือ GPT-6 Astra อยู่ในพูลเอเจนต์ — โดยอ้างว่าชนะโมเดลที่แข็งแกร่งที่สุดสามรุ่นที่มีให้ใช้ พร้อมทั้งยืนยันว่าไม่ได้เรียกใช้โมเดลใดในสามรุ่นนั้นเลย ไม่ว่าพูลจะมีอะไรอยู่ก็ตาม เมื่อนับตามเกณฑ์ของ Sakana เอง มันก็ไม่ใช่สุดยอดของตลาด
แต่การป้องกันความเสี่ยงนี้มีต้นทุนที่ไม่ได้อยู่ในรายการราคา คุณไม่สามารถเห็นพูล คุณไม่สามารถเลือกให้สมาชิกคนใดคนหนึ่งเข้า หรือออกจากระดับ Ultra ได้ คุณไม่สามารถโฮสต์ส่วนใดส่วนหนึ่งของมันเองได้ และคุณไม่สามารถรันมันใน EU/EEA ได้เลย — การประสานงานที่ตั้งอยู่ในสิงคโปร์บนเวตของแล็บอื่นมีโปรไฟล์ความเสี่ยงที่แตกต่างจากการเป็นเจ้าของเวตเอง Qwen3.8-Max พลิกกลับตรงกันข้ามทั้งหมด มันเป็นโมเดลของผู้ขายรายเดียว จึงเผชิญกับการตัดสินใจของผู้ขายรายเดียว แต่ Alibaba เผยแพร่เวตแบบเปิดสำหรับเช็กพอยต์ Qwen3.8-2.4T-A95B ระดับ Max ภายใต้สัญญาอนุญาตแบบกำหนดเอง ซึ่งหมายความว่าทางหนีนั้นมีจริง ไม่ใช่แค่สำนวนโวหาร: หากราคาหรือเงื่อนไขเปลี่ยนไป โมเดลนี้สามารถให้บริการจากโครงสร้างพื้นฐานของคุณเองได้ สำหรับทีมที่มีความกลัวที่แท้จริงคือผู้ขายถอนเสื่อออกไป เช็กพอยต์ที่ดาวน์โหลดได้คือหลักประกันที่แข็งแกร่งกว่าคำสัญญาเกี่ยวกับพูลที่คุณไม่ได้รับอนุญาตให้ตรวจสอบ
มีประเด็นระดับรองสำหรับใครก็ตามที่รันเอเจนต์บนทั้งสองฝั่งQwen3.8-Max อยู่ในแคตตาล็อกของเราในราคาขาเข้า $2.00 และขาออก $6.00 ซึ่งเป็นราคาตั้งของ Alibaba โดยมีส่วนบวกเพิ่ม 0% ที่ส่งผ่านไป — การเปลี่ยนแปลงราคาจากผู้ขายจะกระทบคีย์เดียวกันในวันเดียวกัน และการสลับไปใช้ระบบสำรองอัตโนมัติจะครอบคลุมเส้นทางของผู้ให้บริการที่ถูกจำกัดอัตราหรือมีประสิทธิภาพลดลง Fugu Ultra v2 ไม่ได้อยู่บน OrcaRouter มันมาถึงคุณผ่าน API ที่เข้ากันได้กับ OpenAI ของ Sakana เองและแพลตฟอร์มบุคคลที่สามหลายแห่ง และการย้ายจาก Fugu รุ่นก่อนหน้าเป็นการเปลี่ยนพารามิเตอร์เพียงบรรทัดเดียว เราเตอร์ไม่ใช่สิ่งทดแทนผู้ประสานงาน และผู้ประสานงานก็ไม่ใช่สิ่งทดแทนความสามารถในการสลับไปใช้ระบบสำรอง หากคุณต้องการทั้งสองคุณสมบัติ คุณกำลังรันระบบของผู้ขายสองราย และควรตั้งงบไว้สำหรับสองบิล
คุณควรเลือกอันไหน
เลือก Qwen3.8-Max หากคุณต้องการโมเดลที่คุณสามารถคาดการณ์ ตรวจสอบ และถอยหนีออกมาได้ มันมีอัตราการสร้างเอาต์พุตเพียงหนึ่งในสามของ Fugu Ultra v2 ที่ราคาป้าย มันไม่มีหน้าผาบริบทแบบยาว มันรับภาพ วิดีโอ และ PDF ได้ ขณะที่ modality ของกลุ่ม Fugu ขึ้นอยู่กับว่าเอเจนต์เบื้องหลังรองรับอะไร มันเผยแพร่ checkpoint ที่คุณถอยกลับไปใช้ได้ มันขายทุกที่ และมีรายการวัดอิสระแบบสดที่วัดสิ่งที่ขับเคลื่อนบิลของคุณจริง ๆ — 37.8 โทเคนต่อวินาที และตัวเลขค่าใช้จ่ายต่องานที่คุณจำลองแบบก่อนตัดสินใจได้ จุดอ่อนของมันก็เฉพาะเจาะจงพอกันและควรค่าแก่การเอ่ยถึง: มันช้า อยู่อันดับ #154 จาก 200 ด้านความเร็ว มันverbose มหาศาลที่ 180 ล้านโทเคนบนดัชนี และ Artificial Analysis วัดอัตราการ hallucinate ของมันแยกต่างหาก โดยพบว่าเพิ่มขึ้นจาก 23% เป็น 40% เมื่อเทียบกับรุ่นก่อนหน้า ซึ่งเป็นข้อกังวลร้ายแรงสำหรับงานหลายขั้นตอนอัตโนมัติแบบอิสระที่มันถูกทำการตลาดมารองรับนั้นโดยตรง เผื่องบประมาณสำหรับตัวตรวจสอบไว้ และใช้ส่วนลดแคชเชิงลึกอย่างเชิงรุก
เลือก Fugu Ultra v2 หากงานของคุณเป็นแบบระยะยาวและตรวจสอบได้ งบประมาณของคุณเป็นการสำรวจมากกว่าการใช้งานจริงในโปรดักชัน และคุณอยู่นอก EU/EEA เหตุผลเชิงโครงสร้างสำหรับผู้ประสานงาน (coordinator) นั้นมีจริง และตัวอย่างของผู้ขายเองก็ชี้ไปทางนั้นอย่างสม่ำเสมอ — การรันวิจัยอัตโนมัติ 123 การทดลองเป็นเวลาสิบสี่ชั่วโมงบน H100 เครื่องเดียว, ตัวแก้รูบิกส์คิวบ์แบบ pure-Python ที่ไขลูกบาศก์ที่ถูกสลับครบทั้ง 300 ลูก โดยที่ baseline ชั้นแนวหน้าแบบไม่ระบุชื่อสองตัวล่มไปเลย นั่นเป็นตัวอย่างที่ผู้ขายเลือกมา พร้อม baseline แบบไม่ระบุชื่อ และพิสูจน์ได้น้อยกว่าที่ดูเหมือน แต่รูปแบบนั้นสอดคล้องกัน: ในงานที่ความถูกต้องตรวจสอบได้ และส่วนที่ยากคือความเพียรพยายาม การสร้าง verifier ขึ้นมาดีกว่าไปเค้นโมเดลเดียวให้หนักขึ้น สิ่งที่คุณกำลังซื้อคือความเพียรพยายามนั้น ในอัตราที่เป็นห้าเท่าของ Qwen3.8-Max ในระบบที่คุณไม่สามารถตรวจสอบคุณภาพได้ และไม่สามารถตรึงพูลของมันได้ ลองนำร่องแบบจำกัดขอบเขต วัดโทเค็นเอาต์พุตต่องานที่เสร็จสิ้นแทนที่จะต่อโทเค็น และตั้งเพดานก่อนการรันครั้งแรก

เหตุผลที่ป้ายราคาเป็นตัวเลขผิดก็คือ ผลิตภัณฑ์ทั้งสองนี้ได้ย้ายต้นทุนของคำตอบออกไปจากต้นทุนของโทเค็น Fugu Ultra v2 ทำเช่นนี้โดยการกระจายไปยังโมเดลที่มันจะไม่เอ่ยชื่อ Qwen3.8-Max ทำเช่นนี้โดยการคิดเป็นเวลา 180 ล้านโทเค็น หากคุณรู้ปริมาณโทเค็นต่องานของคุณอยู่แล้ว การคำนวณก็เป็นเรื่องจิ๊บจ๊อยและคุณควรทำ ทีมส่วนใหญ่ไม่รู้ตัวเลขนั้น และสำหรับพวกเขา การตัดสินใจก็ลดทอนลงเหลือสิ่งที่ง่ายกว่า: Qwen3.8-Max คือตัวเลือกที่คุณตรวจสอบ กำหนดราคา และเลิกใช้ได้ ส่วน Fugu Ultra v2 คือตัวเลือกที่เดิมพันว่าการประสานงานเอาชนะความสามารถ ทั้งสองต่างมีเหตุผลรองรับ มีเพียงตัวเดียวเท่านั้นที่มาพร้อมหลักฐาน
