
Ember-1 vs Qwen3.8-Max: รุ่นย่อยที่ประหยัดโทเคนเมื่อเทียบกับเรือธง
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
โมเดลทั้งสองในคู่เปรียบเทียบนี้ต่างก็มีตัวเลขจริงบน benchmark เดียวกัน และมันก็ยังไม่ได้ยุติอะไร Ember-1 คือเวอร์ชันเฉพาะทางที่ต่อยอดโดย Fireworks Research จาก Kimi K3 ของ Moonshot AI เผยแพร่เมื่อ 23 กันยายน 2026 รายงานว่าได้ 82.0% บน Terminal Bench 2.1 โดยใช้โทเคนประมาณครึ่งหนึ่งของที่โมเดลฐานใช้ Qwen3.8-Max คือเรือธงของ Alibaba — โมเดล sparse mixture-of-experts ขนาดประมาณ 2.4 ล้านล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่ทำงานอยู่ราว 95 พันล้านตัวต่อโทเคน — เปิดให้ใช้ทั่วไปตั้งแต่ 3 สิงหาคม 2026 รายงานว่าได้ 86.6% บน benchmark เดียวกัน ตัวเลขทั้งสองนั้นเป็นข้อมูลที่ผู้ขายรายงานเอง ทั้งสองแล็บรันฮาร์เนสของตนเอง และช่องว่าง 4.6 จุดระหว่างชุดการประเมินที่ไม่เปิดเผยสองชุดก็ไม่ใช่คำตัดสิน สิ่งที่เทียบกันได้คือเรื่องเงิน และนั่นคือจุดที่การเปรียบเทียบนี้เริ่มน่าสนใจ: แก่นความคิดทั้งหมดของโมเดลหนึ่งคือคุณไม่ควรจ่ายสำหรับโทเคนที่คุณไม่จำเป็นต้องใช้ ส่วนอีกโมเดลเป็นเรือธงที่ตั้งราคาไว้ที่ $2 ต่อล้านโทเคนขาเข้า และ $6 ต่อล้านโทเคนขาออก
แต่ละโมเดลจริงๆ แล้วคืออะไร
Ember-1 ไม่ใช่โมเดลใหม่ในแง่สถาปัตยกรรมใด ๆ มันคือ Kimi K3 ที่ถูกฝึกใหม่ให้ให้เหตุผลอย่างกระชับยิ่งขึ้น สร้างโดย Fireworks Research ผ่านการทดลองฝึกมากกว่า 50 ครั้งและการประเมินมากกว่า 200 ครั้งบนสแต็กการฝึกแบบไร้เซิร์ฟเวอร์ของตัวเอง ข้ออ้างของห้องแล็บคือการให้เหตุผลของ K3 ยาวนานกว่าที่งานต้องการ และส่วนเกินนั้นสามารถตัดออกได้โดยไม่เปลี่ยนคำตอบ — ความยาวของการให้เหตุผลลดลง 35–50% โดยไม่สูญเสียความแม่นยำในเจ็ดเบนช์มาร์กและการทดสอบ A/B ในการผลิตของลูกค้าสองราย มันมีให้ใช้ในรูปแบบ research preview บนแพลตฟอร์มไร้เซิร์ฟเวอร์ของผู้ขายเอง โดยไม่เปิดเผยน้ำหนักโมเดลและไม่เปิดเผยราคา
Qwen3.8-Max เป็นสิ่งที่แตกต่างไปโดยสิ้นเชิง เป็นระดับแนวหน้าของ Alibaba ที่เป็นมัลติโหมดโดยธรรมชาติสำหรับอินพุตข้อความ รูปภาพ และวิดีโอ มีหน้าต่างบริบทหนึ่งล้านโทเคน และได้รับการรีเฟรชสองครั้งนับตั้งแต่เปิดตัว: การอัปเดตหลังการฝึกเมื่อวันที่ 2 กันยายน 2026 ซึ่งมุ่งเป้าไปที่การเขียนโค้ดและงานสำนักงานระดับมืออาชีพ และระดับการให้บริการที่เร็วกว่าซึ่งประกาศเมื่อวันที่ 22 กันยายน 2026 Alibaba วางตำแหน่งให้แข่งขันกับ GPT-5.5, Claude Opus 4.7 และ Gemini 3.1 Pro และเอกสารการประเมินที่เผยแพร่สะท้อนความทะเยอทะยานนั้น — GPQA Diamond 92.6, OSWorld-Verified 86.1, SWE-bench Pro 67.7, PaperBench 93.0, IFBench 82.8 และ Humanity's Last Exam ที่ 43.6 ซึ่งทั้งหมดเป็นข้อมูลที่ผู้ขายรายงาน

เรตการ์ดเคียงข้างกัน
หนึ่งในสิ่งเหล่านี้มีราคา และอีกสิ่งหนึ่งไม่มี ซึ่งเป็นความไม่สมมาตรในทางปฏิบัติประการแรก
• อินพุต — Ember-1: ไม่มีข้อมูลที่เผยแพร่; ชีตเกณฑ์มาตรฐานคำนวณเป็นดอลลาร์จากเรตการ์ดของ Kimi K3. Qwen3.8-Max: $2.00 ต่อล้านโทเค็นบน OrcaRouter
• เอาต์พุต — Ember-1: ไม่มีการเผยแพร่ Qwen3.8-Max: $6.00 ต่อล้านโทเค็น
• อินพุตที่แคชไว้ — Ember-1: ไม่เกี่ยวข้อง Qwen3.8-Max: $0.25 ต่อล้านโทเคนสำหรับการอ่านจากแคช ซึ่งเป็นหนึ่งในแปดของอัตราค่าอินพุต และมีความสำคัญอย่างมหาศาลในลูปของเอเจนต์ที่บริบทเดิมถูกส่งซ้ำในทุกเทิร์น
• หน้าต่างบริบท — Ember-1: ไม่ได้เผยแพร่สำหรับพรีวิว; โมเดลฐานของมันมีความจุ 1,048,576 โทเคน Qwen3.8-Max: 1,000,000 โทเคน
• ความสามารถแบบมัลติโมดัล — Ember-1: ข้อความ Qwen3.8-Max: รับข้อความ รูปภาพ และวิดีโอเข้า ส่งออกเป็นข้อความ
• น้ำหนักโมเดล — Ember-1: ไม่มี. Qwen3.8-Max: มีรุ่นที่เปิดเผยน้ำหนักให้ใช้งานแล้ว แต่รองรับเฉพาะข้อความ และขาดหน้าต่างบริบทเต็มรูปแบบกับอินพุตภาพของเอนด์พอยต์ที่ให้บริการ
• การเข้าถึง — Ember-1: พรีวิวสำหรับงานวิจัย, หน้าต่างแบบไร้เซิร์ฟเวอร์สองสัปดาห์, ความถาวรขึ้นอยู่กับความต้องการ. Qwen3.8-Max: พร้อมให้ใช้งานทั่วไปและมีราคาแล้ว
ก่อนจะเริ่มสร้างโมเดลอะไร โปรดทราบเรื่องหนึ่งเกี่ยวกับอัตราของ Qwen3.8-Max: Alibaba ได้ปรับแพ็กเกจจิงของโมเดลนี้ซ้ำแล้วซ้ำเล่าตั้งแต่เปิดตัว และการ์ดอัตราระหว่างประเทศไม่ได้ตรงกับราคาพาดหัวในเดือนสิงหาคมเสมอไป ให้ถือว่า $2.00 และ $6.00 เป็นราคาเส้นทางปัจจุบันบนแพลตฟอร์มของเรา — ซึ่งส่งต่อราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม ดังนั้นการเปลี่ยนแปลงจากผู้ขายจะแสดงให้เห็นในวันเดียวกัน — และตรวจสอบการ์ดก่อนที่คุณจะกำหนดงบประมาณให้กับมัน
ทำไมการเปรียบเทียบ benchmark จึงไม่ทำงาน
82.0% ของ Ember-1 และ 86.6% ของ Qwen3.8-Max ต่างก็เป็นคะแนนจาก Terminal Bench 2.1 ซึ่งทำให้ทั้งคู่ดูเทียบเคียงกันได้ แต่ไม่ได้หมายความว่าเทียบเคียงกันได้ แผ่นผลของ Ember-1 รายงานตัวเลขของตนโดยเทียบกับ Kimi K3 หลายรูปแบบที่ประเมินโดย Fireworks Research บน 89 ตัวอย่าง พร้อมแนบส่วนต่างของโทเคนและค่าใช้จ่ายมาด้วย ส่วนตัวเลขของ Qwen3.8-Max มาจากแผ่นประเมินของ Alibaba เอง ต่างห้องแล็บ ต่างชุดทดสอบ ต่างโครงสร้างเอเจนต์ และในเบนช์มาร์กที่คะแนนขยับได้หลายจุดเพียงเพราะการเลือกโครงสร้างเท่านั้น ช่องว่าง 4.6 จุดจึงอยู่ภายในระดับเสียงรบกวนของระเบียบวิธี
สิ่งที่คุณอ่านได้จากชีตของ Ember-1 คือคอลัมน์โทเคน ซึ่งเป็นสิ่งเดียวที่โมเดลถูกฝึกให้เปลี่ยนแปลง เมื่อเทียบกับฐานของตัวเอง Ember-1 ใช้โทเคนน้อยลง 51.9% บน Terminal Bench 2.1 น้อยลง 32.5% บน SWE-Interact น้อยลง 23.7% บน DeepSWE 1.1 และน้อยลงเพียง 5.9% บน τ-2 Bench Airline ช่วงการกระจายที่ต่างกันนี้คือพาดหัวที่ซื่อตรง โมเดลที่ลดการครุ่นคิดมีค่ามหาศาลบนเบนช์มาร์กที่โมเดลฐานคิดมากเกินไป และแทบไม่มีค่าเลยในที่ที่มันไม่เป็นเช่นนั้น และคุณไม่อาจรู้ได้ว่าคุณมีภาระงานแบบไหนโดยไม่วัดของคุณเอง
ต้นทุนต่องานที่เสร็จสมบูรณ์ ซึ่งคำนวณจนครบ
นี่คือการคำนวณที่ตัดสินเรื่องนี้จริง ๆ โดยใช้ราคาที่ประกาศของ Kimi K3 เป็นตัวแทนสำหรับต้นทุนของ Ember-1 เนื่องจาก Ember-1 ไม่มีราคา Kimi K3 อยู่ที่ $3.00 ต่อล้านโทเคนอินพุต, $0.30 สำหรับแคช และ $15.00 เอาต์พุต — ตรงกับตารางราคาที่ Fireworks Research ใช้ในการเปรียบเทียบของตัวเอง Qwen3.8-Max อยู่ที่ $2.00 อินพุต และ $6.00 เอาต์พุต โดยการอ่านแคชอยู่ที่ $0.25
ในฝั่งอินพุต Qwen3.8-Max ถูกกว่าอยู่แล้วถึงหนึ่งในสาม ส่วนในฝั่งเอาต์พุตมันถูกกว่าถึง 2.5 เท่าต่อโทเคน นั่นหมายความว่าการลดจำนวนโทเคนของ Ember-1 ไม่ได้กำลังแข่งกับบิลที่เป็นค่าคงที่ แต่กำลังแข่งกับโมเดลเรือธงที่ถูกกว่าต่อโทเคนตั้งแต่ก่อนจะมีการทำงานด้านประสิทธิภาพใด ๆ ด้วยซ้ำ การทดสอบ A/B ในสภาพโปรดักชันของ Fireworks Research เองแสดงให้เห็นว่าโทเคนเอาต์พุตลดลงจาก 49.3K เหลือ 29.9K คิดเป็นการลดลงรวม 39% ถ้านำไปใช้กับอัตราค่าเอาต์พุตของ Qwen3.8-Max ก็จะได้ส่วนประหยัด 39% เท่ากัน ซึ่งเป็นชัยชนะเชิงตัวเลขที่น้อยกว่าการประหยัดด้วยเปอร์เซ็นต์เดียวกันเมื่อนำไปใช้กับอัตรา 15 ดอลลาร์ของ K3
ดังนั้น ข้อโต้แย้งเรื่องประสิทธิภาพของ Ember-1 จึงแข็งแกร่งที่สุดเมื่อวัดเทียบกับโมเดลฐานของตัวเอง และนั่นก็เป็นข้อโต้แย้งที่การเปิดตัวครั้งนี้ยกมาพอดี เมื่อเทียบกับ Qwen3.8-Max การเปรียบเทียบจะเปลี่ยนไปที่ความสามารถต่อดอลลาร์ โดยบริบทที่ใหญ่กว่า อินพุตแบบมัลติโมดัล และความพร้อมจำหน่ายที่มีการตั้งราคาของเรือธงคือข้อโต้แย้งกลับ — และเป็นจุดที่ยังไม่มีใครเผยแพร่การเปรียบเทียบแบบตัวต่อตัวที่จะตัดสินเรื่องนี้ได้

สิ่งที่ข้อมูลการกำหนดเส้นทางของเราเองแสดงให้เห็น
สองในสามโมเดลที่เกี่ยวข้องในที่นี้เป็นเส้นทางที่ใช้งานจริงบน OrcaRouter ซึ่งให้มุมมองที่ไม่มีอยู่ในตาราง benchmark ใด ๆ Qwen3.8-Max ให้บริการที่บริบทขนาด 1,000,000 โทเคน โดยมีความหน่วงของโทเคนแรกแบบมัธยฐานประมาณ 2.0 วินาที และประมาณ 52.7 โทเคนเอาต์พุตต่อวินาทีในช่วงเจ็ดวันที่ผ่านมา พร้อมอัตราข้อผิดพลาดประมาณ 4.2% Kimi K3 — โมเดลฐานของ Ember-1 และเป็นจุดอ้างอิงสำหรับทุกการประหยัดที่ Ember-1 กล่าวอ้าง — ทำงานที่บริบท 1,048,576 โทเคน ความหน่วงมัธยฐานใกล้ 8.0 วินาที ประมาณ 43.6 โทเคนเอาต์พุตต่อวินาที และอัตราข้อผิดพลาดประมาณ 0.27% บนปริมาณการใช้งานที่สูงกว่าอย่างมีนัยสำคัญ ส่วน Ember-1 เองไม่ได้อยู่บน OrcaRouter
ตัวเลขเหล่านั้นทำให้ต้องมองการตัดสินใจนี้ใหม่ Kimi K3 ใช้เวลาถึงโทเคนแรกนานกว่าอย่างเห็นได้ชัด และมีค่าใช้จ่ายต่อโทเคนเอาต์พุตแพงกว่า Qwen3.8-Max ราวสองเท่า ขณะเดียวกันก็มีอัตราข้อผิดพลาดต่ำกว่ามากภายใต้ภาระงานที่หนักกว่ามาก อนุพันธ์แบบประหยัดโทเคนของ K3 ช่วยลดช่องว่างด้านต้นทุนให้แคบลง แต่ไม่ได้ปิดช่องว่างด้านความหน่วง เพราะการทำให้กระบวนการคิดสั้นลงนั้นย่นระยะการสร้างคำตอบ ไม่ได้ย่นระยะการรอในคิว ถ้างานของคุณอ่อนไหวต่อความหน่วงมากกว่าอ่อนไหวต่อค่าใช้จ่าย รุ่นเรือธงคือเส้นทางที่ดีกว่าในตอนนี้ และเรื่องประสิทธิภาพก็ไม่ใช่ประเด็นสำคัญ
จะจัดเส้นทางอันไหน
เลือกใช้ Qwen3.8-Max เมื่อคุณต้องการหน้าต่างบริบท อินพุตแบบมัลติโมดัล ราคาที่เผยแพร่ และบริการที่คุณสามารถตั้งงบประมาณรองรับได้ มันเป็นตัวเลือกที่ปลอดภัยกว่าจากสองตัวโดยโครงสร้าง: พร้อมใช้งานทั่วไป มีการกำหนดราคา และได้รับการรีเฟรชถึงสองครั้งในสองเดือนโดยผู้ให้บริการที่มีประวัติในการทำให้เอนด์พอยต์เป็นปัจจุบันอยู่เสมอ
ลองใช้ Ember-1 เมื่อค่าใช้จ่ายของคุณถูกครอบงำด้วยโทเคนการให้เหตุผลในลูปเอเจนต์ยาว ๆ และคุณรันกับโมเดลแบบโฮสต์แทนฮาร์ดแวร์ของคุณเอง การทดสอบที่เหมาะสมคือสองสัปดาห์ที่พรีวิวให้คุณ โดยรันแบบเงียบเทียบกับทราฟฟิกโปรดักชัน วัดโทเคนต่องานที่ทำเสร็จ แทนที่จะวัดโทเคนต่อคำขอ สิ่งที่คุณไม่ควรทำคือสลับมันเข้ามาเป็นตัวแทนแบบเทียบเคียงได้กับรุ่นเรือธง โดยอาศัยตัวเลข 40% ที่อยู่ในช่วงตั้งแต่ 6% ถึง 52% ขึ้นอยู่กับภาระงาน
ถ้าคำถามจริง ๆ คือยังควรใช้ Kimi K3 ต่อไปหรือไม่ ข้อนั้นคุณตอบได้วันนี้โดยไม่ต้องมีพรีวิวเลย: ทั้ง Kimi K3 และ Qwen3.8-Max อยู่บน OrcaRouter ภายใต้คีย์เดียว โดยคิดราคาตามราคาประกาศของผู้ให้บริการโดยไม่บวกเพิ่ม พร้อมกับ การสลับไปใช้ผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดเหตุขัดข้อง การเปรียบเทียบค่าใช้จ่ายของเวิร์กโหลดของคุณบนทั้งสองแบบเป็นการเปลี่ยนเส้นทาง ไม่ใช่โครงการจัดซื้อ — และมันให้ค่าพื้นฐานที่ทำให้ข้ออ้างเรื่องประสิทธิภาพใด ๆ เกี่ยวกับ Ember-1 วัดผลได้จากตัวเลขของคุณเอง ไม่ใช่ของห้องแล็บ

สรุปตามตรงก็คือ โมเดลทั้งสองนี้ถูกปรับให้เหมาะสมภายใต้ข้อจำกัดที่แตกต่างกัน Qwen3.8-Max ถูกสร้างขึ้นเพื่อเป็นตัวที่มีความสามารถสูงสุดเท่าที่มีจำหน่าย และตั้งราคาให้สอดคล้องกัน ส่วน Ember-1 ถูกสร้างขึ้นเพื่อทำให้โมเดลที่แพงอยู่แล้วมีต้นทุนการรันที่ถูกลง ทั้งคู่ล้วนสมเหตุสมผล และเหตุผลที่การเทียบกันครั้งนี้ตัดสินให้ชัดเจนได้ยากก็คือ การประหยัดของโมเดลที่ต่อยอดมานั้นถูกนิยามโดยอ้างอิงกับเรตการ์ดที่เรือธงกดราคาต่ำกว่าอย่างมีนัยสำคัญ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
