
Fugu Max vs Kimi K3: Sakana เลือกใช้ไม้บรรทัดนี้ งั้นเรามาอ่านกันเลย
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
การเปิดตัว Fugu Max ของ Sakana AI ระบุชื่อโมเดลไว้สามรุ่นพอดีเพื่อสนับสนุนการตั้งราคาของตน และ Kimi K3 ของ Moonshot AI ก็เป็นหนึ่งในนั้น ข้อกล่าวอ้างคืออัตราค่าเอาต์พุตของ Fugu Max ต่ำกว่ารุ่นทั้งสามนั้น 40 ถึง 60 เปอร์เซ็นต์ ซึ่งทำให้ Kimi K3 — ไม่ใช่ Grok 4.6 ไม่ใช่ Qwen3.8-Max — เป็นเกณฑ์มาตรฐานที่ Sakana เองเลือกใช้สำหรับความคุ้มค่า นั่นเป็นสิ่งที่ผู้ขายทำอย่างใจกว้างผิดปกติ: มอบไม้บรรทัดให้คุณและบอกว่าควรจับมันตรงไหน ดังนั้นหน้านี้จึงทำสิ่งที่ชัดเจนและจับมันไว้ Fugu Max เปิดตัวเมื่อวันที่ 11 กันยายน 2026 ในราคา $2.00 ต่ออินพุต 1 ล้านโทเค็น และ $6.00 ต่อเอาต์พุต 1 ล้านโทเค็น Kimi K3 ตั้งราคาไว้ที่ $3.00 และ $15.00 ข้อกล่าวอ้าง 60 เปอร์เซ็นต์เกี่ยวกับเอาต์พุตนั้นถูกต้องตามหลักเลขคณิต สิ่งที่ประโยคไม่ได้กล่าวถึงคือ โมเดลที่มันกำลังตัดราคานั้นเผยแพร่บันทึกผลการวัดโดยอิสระอย่างครบถ้วน ส่วนโมเดลที่กำลังตัดราคาไม่ได้เผยแพร่สิ่งใดเลย
ประโยค 40 ถึง 60 เปอร์เซ็นต์ เมื่อพิจารณาแล้ว
• อินพุต — Fugu Max $2.00 ต่อ 1M โทเคน เทียบกับ Kimi K3 $3.00 ต่อ 1M โทเคน ประหยัดได้ 33 เปอร์เซ็นต์ ไม่ใช่ 40 ถึง 60 เปอร์เซ็นต์ที่เอกสารเผยแพร่นำเสนอ
• เอาต์พุต — Fugu Max $6.00 ต่อ 1M โทเคน เทียบกับ Kimi K3 $15.00 ต่อ 1M โทเคน ซึ่งต่ำกว่า 60 เปอร์เซ็นต์ ซึ่งเป็นจุดสูงสุดของช่วงที่ Sakana ระบุไว้
• อินพุตที่แคชไว้ — Fugu Max $0.25 ต่อ 1M โทเคน เทียบกับ Kimi K3 $0.30 ต่อ 1M โทเคน ความต่างเล็กพอที่ลูปซึ่งใช้แคชหนักจะไม่สังเกตเห็น
• หน้าต่างบริบท — Fugu Max ไม่มีการเปิดเผยตัวเลขในประกาศเปิดตัว เทียบกับ Kimi K3 1,048,576 โทเคน
• การกำหนดราคาใหม่สำหรับพรอมป์ต์ยาว — Fugu Max ไม่ระบุระดับที่ชัดเจน เมื่อเทียบกับ Kimi K3 ที่คิดราคาคงที่ตลอดทั้งหน้าต่าง โดยไม่มีค่าธรรมเนียมเพิ่มไม่ว่าจะมีความยาวเท่าใด
• การปรับใช้ — Fugu Max ใช้เฉพาะ API ของผู้ขาย โดยไม่เปิดเผยการเป็นสมาชิกพูล เทียบกับน้ำหนักโมเดล Kimi K3 ที่ดาวน์โหลดได้ภายใต้ Kimi K3 License
• การประเมินอิสระ — Fugu Max ไม่มี และไม่มีหน้า Artificial Analysis สำหรับโมเดล Fugu ใด ๆ เทียบกับ Kimi K3 ซึ่งมีดัชนี Artificial Analysis Intelligence Index อยู่ที่ 44 และคะแนนมาตรฐาน 93.40% บน SWE-bench Verified จาก Vals AI
สังเกตโครงร่างของแถวแรกนั้น ช่วงที่ขึ้นพาดหัวคือ 40 ถึง 60 เปอร์เซ็นต์ เป็นช่วงคร่อมคู่แข่งสามรายที่ระบุชื่อ และ Kimi K3 คือตัวที่ให้ค่า 60 หากดูเฉพาะอินพุต การเปรียบเทียบอยู่ที่ 33 เปอร์เซ็นต์ ซึ่งยังเป็นการประหยัดจริง แต่เป็นอีกประโยคหนึ่ง นั่นไม่ใช่การวิจารณ์เรื่องราคา — $2.00 และ $6.00 เป็นตัวเลขที่ต่ำจริงสำหรับระบบที่อ้างว่ามีผลลัพธ์ใกล้เคียงระดับแนวหน้า มันเป็นข้อสังเกตว่าตัวเลขใดในประกาศเปิดตัวที่กำลังทำหน้าที่โน้มน้าว และย่อหน้าถูกจัดวางโดยมีตัวเลขนั้นเป็นศูนย์กลางอย่างไร
Kimi K3 อยู่ในแคตตาล็อกของเราในราคาที่ Moonshot ตั้งเอง — 3.00 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเค็น, 0.30 ดอลลาร์เมื่อแคชฮิต, 15.00 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเค็น — ส่งต่อโดยบวกกำไร 0% ดังนั้นหาก Moonshot ปรับราคา ราคาใหม่จะมีผลกับคีย์เดิมภายในวันเดียวกัน แทนที่จะรอรอบการย้ายระบบ ซึ่งตรงนี้สำคัญกว่าปกติ เพราะการลดราคาต้นทางคือสิ่งที่กัดกร่อนหรือขยายช่องว่าง 60 เปอร์เซ็นต์ที่การเปรียบเทียบทั้งหมดนี้อาศัยอยู่นั่นเอง
สิ่งที่ไม้บรรทัดวัดเผยแพร่
สถิติของ Kimi K3 ตรงกันข้ามกับคำว่ามีน้อยเลย การ์ดโมเดลของ Moonshot เองรายงานว่า Terminal-Bench 2.1 อยู่ที่ 88.3, GPQA Diamond อยู่ที่ 93.5, HLE-Full อยู่ที่ 43.5 และเพิ่มขึ้นเป็น 56.0 เมื่อใช้เครื่องมือ, SWE-Marathon อยู่ที่ 42.0, OSWorld-Verified อยู่ที่ 84.8, MCPMark-Verified อยู่ที่ 94.5 และ DeepSWE อยู่ที่ 67.5 ทั้งหมดเป็นตัวเลขที่ผู้พัฒนารายงานเอง และมีอยู่เป็นจำนวนมากทีเดียว
เลเยอร์อิสระก็มีอยู่เช่นกัน ซึ่งเป็นส่วนที่สำคัญสำหรับการเปรียบเทียบนี้ Artificial Analysis ให้คะแนน Kimi K3 ที่ 44 บน v4.3 Intelligence Index — เป็นอันดับสองในบรรดาโมเดล open-weight รองจาก GLM-5.3 ที่ 45 — โดยมีอัตราการประมวลผลที่บันทึกไว้ 37.9 โทเคนเอาต์พุตต่อวินาที และเวลาถึงโทเคนแรก 3.80 วินาที ฮาร์เนสแบบเอเจนต์มาตรฐานของ Vals AI ให้คะแนนไว้ที่ 93.40% บน SWE-bench Verified ตามหลัง Claude Opus 5 และ DeepSeek V4 Pro แต่ก็ใกล้เคียง นอกจากนี้ยังนำใน Frontend Code Arena ที่ 1679 Elo เหนือกว่า Claude Fable 5 ที่ 1631 และ GPT-5.6 Sol ที่ 1618 ข้อควรระวังประการหนึ่ง: หากคุณเคยเห็น Kimi K3 ถูกอ้างอิงไว้ที่ 57 หรือ 60 บน Intelligence Index ตัวเลขเหล่านั้นเป็นตัวเลขก่อนการปรับปรุงใหม่จากก่อนที่ Artificial Analysis จะปรับมาตรฐานสเกลใหม่ในเดือนกันยายน 2026 และไม่ควรนำมาอ้างซ้ำควบคู่กับตัวเลขปัจจุบัน
ยังมีสัญญาณการใช้งานอีกด้วย และมันมาจากเกตเวย์ของเราเอง ไม่ใช่มาจากการตลาดของใคร: Kimi K3 ส่งผ่านโทเคนราว 3.27 พันล้านโทเคนผ่าน OrcaRouter ในช่วงเจ็ดวันที่ผ่านมา ซึ่งเป็นทราฟฟิกที่หนักที่สุดในบรรดาโมเดลทั้งหมดในการเปรียบเทียบนี้ นั่นไม่ใช่การวัดคุณภาพ แต่มันเป็นตัวอย่างขนาดใหญ่ของสิ่งที่นักพัฒนาเลือกหยิบมาใช้ เมื่อต้นทุนเดียวในการเลือกคือราคาโทเคน และมันบอกว่าหน้าต่าง 1M แบบคงที่และน้ำหนักแบบเปิดได้คว้าส่วนแบ่งที่มากมายของงานระยะยาวจริงไปแล้ว

สกอร์บอร์ดที่ไม่มีตัวเลขอยู่บนนั้น
Sakana รายงานว่า Fugu Max ได้คะแนนรวมดีที่สุดในหกเบนช์มาร์ก: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench และ SWEFish นอกจากนี้ยังระบุว่า Max ขยายพรมแดน Pareto ด้านต้นทุน-ประสิทธิภาพในเจ็ดจากสิบเบนช์มาร์ก ทั้งสองข้อเป็นข้อความเกี่ยวกับอันดับบนกราฟ ทั้งสองข้อไม่ได้มาพร้อมกับค่าใด ๆ ส่วนต่าง หรือตัวเลขของคู่แข่งข้าง ๆ
สองรายการแทบจะไม่ตรงกัน ซึ่งเป็นปัญหาในทางปฏิบัติ Kimi K3 รายงานผล Terminal-Bench 2.1 อยู่ที่ 88.3; Sakana กล่าวว่า Fugu Max ได้ผลดีที่สุดโดยรวมบน Terminal Bench 2.1 และไม่เปิดเผยตัวเลขใด ๆ ให้เปรียบเทียบกับมัน แถวเดียวนี้เป็นภาพประกอบที่ชัดเจนที่สุดของการเปรียบเทียบทั้งหมด: ทั้งสองเจ้าต่างระบุชื่อการทดสอบเดียวกัน รายหนึ่งพิมพ์ตัวเลข และอีกรายพิมพ์คำว่า "best" จนกว่า Sakana จะเผยแพร่ตัวเลขนั้น ไม่มีหลักฐานที่เผยแพร่ใด ๆ ที่ตอบได้ว่า Fugu Max เอาชนะ Kimi K3 บนเบนช์มาร์กที่ Sakana เลือกนำเสนอเป็นหลักหรือไม่
มีการตีความการเปิดตัวนี้อย่างเป็นธรรมที่ควรกล่าวถึง Fugu Max คือระดับต้นทุน — เปิดตัววันเดียวกับ Fugu Ultra v2 ซึ่งเป็นการผลักดันขีดความสามารถที่ราคาอินพุต $5.00 และเอาต์พุต $30.00 — และข้อโต้แย้งของมันวางอยู่บนกราฟพาเรโตที่คะแนนต่อดอลลาร์ ไม่ใช่คะแนน เป็นข้ออ้าง ภายใต้กรอบนั้น ตัวเลขเบนช์มาร์กเปล่า ๆ จะเป็นสถิติที่ซื่อสัตย์น้อยกว่า ปัญหาคือการเปิดตัวนี้ยังละเว้นตัวส่วน: การรายงานของ Sakana เองยอมรับว่าการสลับโมเดลกลางงานอาจลดการนำแคชบริบทกลับมาใช้ซ้ำและสร้างโทเค็นสำหรับการประสานงานเพิ่มเติม และยืนยันว่าบริษัทไม่ได้เปิดเผยอัตราการฮิตแคชของ Max หรือต้นทุนโทเค็นรวมต่องานของมัน ดังนั้นการวัดเพียงหนึ่งเดียวที่จะชี้ขาดข้อโต้แย้งเรื่องระดับต้นทุนได้ ก็คือการวัดที่ไม่ได้ถูกให้มา
ตุ้มน้ำหนักที่คุณถือได้ หรือสระว่ายน้ำที่คุณมองไม่เห็น
นี่คือจุดที่ผลิตภัณฑ์ทั้งสองเริ่มเปรียบเทียบกันไม่ได้เลย
Kimi K3 มาพร้อมเวตที่ดาวน์โหลดได้ ซึ่งเป็นทางออกสำรองที่แท้จริง: หากราคาหรือข้อกำหนดเปลี่ยนไป โมเดลก็สามารถให้บริการจากโครงสร้างพื้นฐานของคุณเองได้ สัญญาอนุญาตนั้นแคบกว่าที่คำว่า "open weights" มักสื่อโดยทั่วไป มันคือสัญญาอนุญาต Kimi K3 ไม่ใช่การให้สิทธิ์ที่ได้รับอนุมัติจาก OSI และคำอธิบายที่ถูกพูดซ้ำบ่อยว่ามันเป็น MIT ดัดแปลงนั้นเป็นที่โต้แย้ง ข้อกำหนดกำหนดให้ต้องมีข้อตกลงแยกต่างหากกับ Moonshot สำหรับธุรกิจ model-as-a-service ที่มีรายได้เกิน 20 ล้านดอลลาร์ในช่วงสิบสองเดือนติดต่อกันใด ๆ รวมถึงการให้เครดิตสำหรับผลิตภัณฑ์ที่มีผู้ใช้เกิน 100 ล้านคนต่อเดือน หรือมีรายได้ 20 ล้านดอลลาร์ต่อเดือน โดยการใช้งานภายในได้รับการยกเว้น และขนาดในทางปฏิบัติก็เป็นเรื่องจริง: checkpoint มีขนาดประมาณ 1.5 เทระไบต์ และ Moonshot แนะนำให้ใช้ตัวเร่ง 64 ตัวขึ้นไป ดังนั้นการโฮสต์เองจึงเป็นการตัดสินใจระดับคลัสเตอร์สำหรับการอนุมาน มากกว่าจะเป็นเรื่องของแล็ปท็อป
Fugu Max ไม่มีสิ่งเหล่านั้นเลย — ไม่มีเวต ไม่มีพูลที่ตรวจสอบได้ ไม่มีตัวเลือกให้โฮสต์เอง — และแลกมาด้วยการไม่กำหนดเงื่อนไขสัญญาอนุญาต เพราะไม่มีอะไรให้อนุญาต ประโยชน์ที่ Sakana ระบุไว้คือสิ่งที่ตรงข้ามกับการควบคุม: พูลที่ครอบคลุมทั้งโมเดลเปิดเวตและโมเดลเฉพาะทาง ซึ่งขยายสำหรับ Max ด้วยตระกูล NVIDIA Nemotron หมายความว่าการเลิกสนับสนุนหรือการปรับราคาของผู้ขายต้นทางรายเดียวไม่อาจทำให้ผลิตภัณฑ์ของคุณล่มได้ นั่นคือการป้องกันความเสี่ยงที่แท้จริง อีกทั้งยังไม่อาจตรวจสอบได้จากภายนอก เพราะสมาชิกภาพจงใจไม่เปิดเผย และหมายความว่าผลลัพธ์จาก Fugu Max มีวันหมดอายุ ซึ่งผลลัพธ์จาก Kimi K3 ไม่มี
เวตแบบเปิดและพูลที่ไม่เปิดเผยเป็นสองคำตอบที่แตกต่างกันสำหรับความกลัวเดียวกัน อันหนึ่งบอกว่าคุณออกไปได้ อีกอันบอกว่าไม่มีอะไรให้จากไป
ที่ซึ่งหน้าต่างแบนเป็นตัวชี้ขาด
คอนเท็กซ์ขนาด 1,048,576 โทเคนของ Kimi K3 คิดราคาแบบคงที่ — ไม่มีระดับสำหรับคอนเท็กซ์ยาว ไม่มีค่าธรรมเนียมเพิ่มไม่ว่าจะความยาวเท่าใด การเปิดตัว Fugu Max ไม่ได้ระบุขนาดหน้าต่างไว้เลย จึงไม่มีอะไรให้เปรียบเทียบและไม่มีอะไรให้ใช้ประกอบการวางแผน สำหรับงานเขียนโค้ดแบบเอเจนต์ระยะยาวที่ทั้งสองผลิตภัณฑ์มุ่งเป้า ซึ่งเซสชันใช้เวลาส่วนใหญ่ไปกับคอนเท็กซ์ที่ลึก ความไม่สมมาตรนั้นสำคัญกว่าตารางอัตราค่าบริการ
ความเร็วเป็นภาพสะท้อนด้านกลับของปัญหาเดียวกัน Kimi K3 วัดได้ 37.9 โทเคนต่อวินาที โดยมีเวลาไปยังโทเคนแรก 3.80 วินาที และมันช้า — เป็นข้อจำกัดจริง ๆ สำหรับโมเดลที่สร้างขึ้นเพื่อการวนลูปยาว ๆ และ Artificial Analysis ชี้ว่ามันตอบยาวเกินจำเป็นอย่างเห็นได้ชัด ส่วน Fugu Max นั้น Sakana ไม่ได้เผยแพร่ตัวเลขความหน่วงหรือปริมาณงาน throughput ใด ๆ ซึ่งสำหรับออร์เคสเตรเตอร์แล้ว อาจถือได้ว่าเป็นความซื่อสัตย์มากกว่าการเลี่ยงคำตอบ เพราะเวลาตอบสนองขึ้นอยู่กับว่าเลือกใช้โมเดลใดและวนซ้ำกี่รอบ แต่นั่นหมายความว่าคุณไม่สามารถจำลองต้นทุนเวลาแบบนาฬิกาจริงของการสลับได้ หากไม่วัดด้วยตัวเอง สำหรับ Fugu Ultra รุ่นก่อนหน้านี้ ผู้ใช้รายงานต่อสาธารณะว่าการรันยืดเยื้อไปจนเกือบ 30 นาที นั่นคือโมเดลจากเดือนมิถุนายน 2026 และไม่ใช่หลักฐานเกี่ยวกับ Max แต่ก็เป็นตัวเลขที่ต้องเอาชนะให้ได้เมื่อคุณทำ benchmarking

คำตัดสิน ในถ้อยคำของ Sakana เอง
Sakana เลือก Kimi K3 เป็นหนึ่งในสามโมเดลที่ Fugu Max ตั้งราคาต่ำกว่า และในแง่อัตราค่าใช้จ่ายเอาต์พุต ข้อกล่าวอ้างนี้ก็เป็นจริง: $6.00 เทียบกับ $15.00 นั้นต่ำกว่าอยู่ 60 เปอร์เซ็นต์ ซึ่งตรงกับขอบบนของช่วงที่ระบุไว้พอดี ถ้าเชื่อตามที่ข่าวประชาสัมพันธ์ระบุไว้ Fugu Max ก็เป็นผลิตภัณฑ์ที่ถูกกว่า
ตอนนี้จงใช้มาตรวัดที่การเปิดตัวหลีกเลี่ยง Kimi K3 แพงกว่าถึง 33 เปอร์เซ็นต์ในฝั่งอินพุต และแพงกว่าถึง 150 เปอร์เซ็นต์ในฝั่งเอาต์พุต — และด้วยเงินจำนวนนั้น มันให้หน้าต่าง 1M โทเคนที่ไม่มีหน้าผาการปรับราคา, checkpoint ที่ดาวน์โหลดได้ภายใต้สัญญาอนุญาตแบบมีเงื่อนไขรายได้, การจัดอันดับใน Intelligence Index แบบอิสระที่ 44, คะแนน SWE-bench Verified แบบมาตรฐานที่ 93.40%, อันดับหนึ่งบน Frontend Code Arena, และปริมาณทราฟฟิกจริงที่สูงที่สุดในบรรดาโมเดลทั้งหมดในการเปรียบเทียบนี้ Fugu Max ให้อัตราที่ต่ำกว่าทั้งสองด้านของโทเคน, ชัยชนะบน benchmark หกครั้งที่ไม่ได้ระบุตัวเลข, อัตราแคชเป็นครึ่งหนึ่งของ K3 โดยไม่มีอัตราการฮิตที่เผยแพร่, และพูลที่คุณตรวจสอบไม่ได้
ข้อสรุปที่ตรงไปตรงมาคือ Sakana เลือกไม้บรรทัดวัดที่เข้าข้างตัวเองในเรื่องราคา และไม่ได้ให้อะไรกับคุณเลยสำหรับใช้ตรวจสอบขีดความสามารถ หากปริมาณงานของคุณสูงมากและงานของคุณเป็นแบบที่ผู้ประสานงานสามารถแยกย่อยได้อย่างเชื่อถือได้ ส่วนต่างของอัตราคือเงินจริง และ Fugu Max ควรค่าแก่การนำร่องแบบจำกัดขอบเขตโดยเปิดการคิดบัญชีโทเคนตั้งแต่คำขอแรก หากคุณต้องการการตัดสินใจสำหรับงานโปรดักชันที่คุณปกป้องได้ในไตรมาสนี้ — กรอบเวลาที่คุณใช้วางแผนได้ คะแนนที่คุณชี้ให้ดูได้ และโมเดลที่คุณยังรันได้หากผู้ขายหายไป — Kimi K3 คือคำตอบ และมันอยู่บน OrcaRouter ในราคาตามที่ Moonshot กำหนด โดยส่งผ่านอัตราของผู้ให้บริการไปโดยไม่ถูกแตะต้อง

