
Ember-1 ลดความสามารถในการให้เหตุผลของ Kimi K3 ลง 40% — และรายละเอียดในตัวอักษรเล็กคือเรื่องราวที่แท้จริง
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ตัวเลขที่จะถูกอ้างถึงคือ 40% Fireworks Research เผยแพร่ Ember-1 เมื่อวันที่ 23 กันยายน 2026 โดยอธิบายว่าเป็นอนุพันธ์เฉพาะทางของ Kimi K3 จาก Moonshot AI ที่รักษาความแม่นยำของ K3 ไว้ได้ ขณะที่ใช้โทเคนน้อยลงราว 40% เพื่อให้ได้ผลลัพธ์เท่ากัน นั่นเป็นคำกล่าวอ้างที่จริงและเจาะจงอย่างผิดปกติ และมันมาพร้อมกับสามสิ่งแนบมาด้วย: ชีต benchmark ฉบับเต็มที่มีคอลัมน์การลดจำนวนโทเคน, การทดสอบ A/B ของลูกค้าสองรายจากทราฟฟิกการเขียนโค้ดในโปรดักชัน, และสถานะการเปิดตัวที่ไม่ใช่การพร้อมใช้งานทั่วไป Ember-1 เปิดให้ใช้ในสถานะ research preview บนแพลตฟอร์มเซิร์ฟเวอร์เลสของผู้ให้บริการเอง โดยมีช่วงเวลาการเข้าถึงสองสัปดาห์ และการตัดสินใจเรื่องความถาวรที่ขึ้นอยู่กับความต้องการ การทำความเข้าใจว่าส่วนใดของสิ่งนี้คือผลิตภัณฑ์ที่ส่งมอบแล้ว และส่วนใดคือผลการวิจัยที่มีเหตุผลรองรับอย่างดี คือหัวใจของเรื่องทั้งหมด
ยังมีชื่อที่ชนกันอยู่ ซึ่งควรทำให้กระจ่างก่อนเรื่องอื่นใด โครงการวิจัยเปิดแยกต่างหากชื่อ Ember (v0.1.5 จาก Slow Lit Labs) ใช้เวลาตลอดปี 2026 ในการเผยแพร่การประเมินความสอดคล้องระยะยาว และมันไม่เกี่ยวข้องกับโมเดลนี้ในทางใดเลย อะไรก็ตามที่คุณอ่านเกี่ยวกับ Ember ที่ไม่สามารถเอาชนะ Qwen3-8B ภายใต้การตั้งค่าการอนุมานที่เทียบเคียงกัน ล้วนเป็นเรื่องของโครงการนั้น Ember-1 ซึ่งเป็นหัวข้อในที่นี้ เป็นโมเดลที่พัฒนาต่อยอดมาจาก Kimi K3 จาก Fireworks Research
Ember-1 จริง ๆ แล้วคืออะไร
Ember-1 ไม่ใช่สถาปัตยกรรมใหม่ และไม่ใช่โมเดลฐานใหม่ มันคือ Kimi K3 ที่ถูกฝึกใหม่ให้ใช้เหตุผลอย่างกระชับยิ่งขึ้น Fireworks Research ได้ทำการทดลองฝึกมากกว่า 50 ครั้งและการประเมินมากกว่า 200 ครั้งบนสแต็กการฝึกแบบไร้เซิร์ฟเวอร์ของตนเอง ครอบคลุมด้านคณิตศาสตร์ การเขียนโค้ด การทำตามคำสั่ง การสนทนา การค้นหา การใช้เครื่องมือ และวิศวกรรมซอฟต์แวร์ โดยมีเป้าหมายชัดเจนในการกำจัดเหตุผลที่ไม่เปลี่ยนคำตอบ ทางห้องแล็บกล่าวว่าความยาวของเหตุผลสามารถลดลงได้ 35–50% โดยไม่สูญเสียความแม่นยำในเจ็ดเบนช์มาร์กและชุดทราฟฟิกจริงจากสภาพแวดล้อมการผลิตของลูกค้าสองชุด ตัวเลขทั้งหมดเหล่านั้นเป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่ได้รับการทำซ้ำอย่างอิสระ ยังไม่มีบุคคลที่สามรายใดเผยแพร่การรัน Ember-1 ณ เวลาที่เขียนนี้
การวางกรอบเรื่องนี้สำคัญ เพราะทางเลือกที่ชัดเจนมีอยู่แล้ว Kimi K3 มาพร้อมการตั้งค่าระดับความพยายามในการใช้เหตุผล และวิธีประหยัดที่จะใช้โทเคนน้อยลงก็คือลดระดับความพยายามลง Fireworks Research บอกว่าลองทำแบบนั้นแล้ว และการตั้งค่าระดับต่ำก็สูญเสียคุณภาพไปมากเกินไป — ซึ่งเป็นผลลัพธ์ที่คุ้นเคยสำหรับใครก็ตามที่เคยปรับระดับความพยายามบนโมเดลใช้เหตุผล ข้ออ้างของ Ember-1 คือปุ่มปรับความพยายามนั้นหยาบ และการฝึกใหม่นั้นละเอียด

ทำไมโทเค็นการให้เหตุผลจึงคุ้มค่ากับความพยายามมากขนาดนี้
ค่าใช้จ่ายของโมเดลการให้เหตุผลไม่ได้ถูกครอบงำด้วยคำตอบของมัน Fireworks Research ตั้งข้อสังเกตว่า K3 อาจใช้โทเค็นที่สร้างขึ้นมากกว่า 90% ไปกับการให้เหตุผลภายใน ก่อนที่มันจะเขียนสิ่งที่ผู้ใช้มองเห็น ในคำขอเดียว นั่นเป็นเพียงเรื่องของค่าใช้จ่ายที่สูง แต่ในลูปเอเจนต์แบบหลายเทิร์น สิ่งนี้จะทบต้น เพราะแต่ละเทิร์นจะเล่นบทสนทนาก่อนหน้าซ้ำ ดังนั้นร่องรอยการให้เหตุผลจากเทิร์นก่อน ๆ จึงถูกอ่านซ้ำและถูกคิดค่าใช้จ่ายซ้ำในการเรียกครั้งถัดไปทุกครั้ง Fireworks Research อธิบายว่าบริบทเติบโตประมาณแบบกำลังสองตามจำนวนเทิร์น นั่นคือเป้าหมายจริงของการเปิดตัวครั้งนี้ และเป็นเหตุผลว่าทำไมตัวเลขชี้วัดหลักจึงเป็นโทเค็นที่ลดลงประมาณ 40% แทนที่จะเป็นการก้าวกระโดดด้านคุณภาพ
กลไกนี้อธิบายความเสี่ยงด้วย การบีบอัดที่กำจัดความครุ่นคิดที่เสียเปล่าเป็นสิ่งที่ไม่ต้องแลกอะไร แต่การบีบอัดที่กำจัดขั้นตอนที่โมเดลจำเป็นต้องใช้กลับไม่ใช่ รูปแบบความล้มเหลวที่ถูกรายงานอย่างกว้างขวางของการลดการใช้เหตุผลที่มากเกินไป คือโมเดลที่ข้ามการตรวจสอบขั้นกลางแล้วกระโดดไปสู่ข้อสรุป ซึ่งในเอเจนต์จะปรากฏให้เห็นในภายหลังมากในรูปของการเรียกใช้เครื่องมือที่ผิด มากกว่าประโยคที่ผิด การเน้นย้ำซ้ำ ๆ ของ Fireworks Research เกี่ยวกับคุณภาพที่เทียบเท่ากันอ่านได้ว่าเป็นคำตอบต่อความกังวลนั้น และตัวเลข A/B นั้นเป็นสิ่งที่ใกล้เคียงกับหลักฐานมากที่สุดสำหรับเรื่องนี้ — โดยมีข้อแม้ตามปกติว่า ชุดทดสอบ เกณฑ์การผ่าน และขนาดตัวอย่าง ล้วนถูกเลือกโดยฝ่ายที่กล่าวอ้าง
ชีตเกณฑ์มาตรฐาน พร้อมที่มาแนบมาด้วย
นี่คือตัวเลขของ Fireworks Research ที่ยังไม่ได้ทำซ้ำ คอลัมน์ด้านขวาคือส่วนที่ควรอ่านอย่างละเอียด โดยจะจับคู่แต่ละคะแนนเข้ากับจำนวนโทเคนและจำนวนดอลลาร์ที่ใช้ไปเมื่อเทียบกับ K3 Max
• Terminal Bench 2.1 (n=89) — Ember-1 82.0% เทียบกับ K3 Max 80.9%, K3 High 77.6%, K3 Low 76.4%; ใช้โทเค็นน้อยลง 51.9%, ประหยัดกว่า $23.10 ต่องาน
• SWE-bench Verified (n=500) — Ember-1 92.2% เทียบกับ K3 Max 93.2%; ใช้โทเค็นน้อยลง 15.5% และค่าใช้จ่ายต่องานน้อยลง $68.10
• SWE-Interact (n=75) — Ember-1 20.0% เทียบกับ K3 Max 21.3%, K3 High 13.3%, K3 Low 6.7%; ใช้โทเค็นน้อยลง 32.5%
• DeepSWE 1.1 (n=113) — Ember-1 75.2% เทียบกับ K3 Max 66.4%; ใช้โทเค็นน้อยลง 23.7% ค่าใช้จ่ายลดลง $126.90 ต่องาน
• τ-2 Bench Airline (n=50) — Ember-1 66% เทียบกับ K3 Max 64%, โดย K3 High และ Low ได้ 64% ทั้งคู่; ใช้โทเคนน้อยลง 5.9% และถูกลง $0.30 ต่องาน
มีสองสิ่งที่น่าสังเกต ประการแรก Ember-1 ชนะขาดใน Terminal Bench 2.1 และ DeepSWE 1.1 แต่แพ้อย่างหวุดหวิดใน SWE-bench Verified และ SWE-Interact — รูปแบบที่สอดคล้องกับโมเดลที่ไม่ได้สูญเสียความสามารถมากเท่ากับเปลี่ยนว่างานใดที่มันใช้เวลาไตร่ตรอง ประการที่สอง การประหยัดโทเคนไม่สม่ำเสมออย่างมาก: 51.9% บน Terminal Bench เทียบกับ 5.9% บน τ-2 Airline ไม่ว่า Ember-1 จะเรียนรู้อะไร มันไม่ใช่การตัดลดการใช้ความคิดลง 40% แบบสม่ำเสมอ ตัวเลข “ประมาณ 40%” ในพาดหัวคือค่าเฉลี่ยของช่วงที่กระจายตั้งแต่ราว 6% ถึงราว 52% และทีมที่มีภาระงานคล้าย τ-2 Airline ไม่ควรคาดหวังว่าจะรู้สึกถึงผลนี้
การทดสอบ A/B ในโปรดักชันเป็นหลักฐานที่โน้มน้าวใจกว่า ก็เพราะมันไม่ได้ถูกสร้างขึ้นมาให้เป็นเบนช์มาร์ก ในเวิร์กโหลดการเขียนโค้ดของลูกค้ารายหนึ่ง Ember-1 ทำคะแนนได้ 0.753 เทียบกับ 0.751 ของ K3 ใช้ 21.4 ขั้นตอน เทียบกับ 23.8 และปล่อยโทเคนเอาต์พุต 29.9K เทียบกับ 49.3K — ลดโทเคนการให้เหตุผลลง 71.3% และลดโทเคนรวมลง 39% โดยมีคุณภาพใกล้เคียงกัน ลูกค้ารายที่สองพบว่าใช้โทเคนต่อภารกิจน้อยลงประมาณ 35% ที่คุณภาพเทียบเคียงได้ และ Fireworks Research กล่าวว่าบริษัทได้สลับมาใช้กับทราฟฟิกการเขียนโค้ดและ coworking ภายในของตัวเองก่อน โดยผลลัพธ์ที่รายงานคือไม่มีใครสังเกตเห็น ให้ถือว่าทั้งหมดนี้เป็นข้อมูลที่ผู้ขายรายงาน แต่ให้ถือว่ามันเป็นรูปแบบที่แข็งแกร่งที่สุดของข้อมูลที่ผู้ขายรายงาน: ข้อมูลความชอบจาก A/B และข้อมูลการทำภารกิจให้สำเร็จนั้นยากที่จะปั่นมากกว่าลีดเดอร์บอร์ด
มีการประเมินอีกหนึ่งรายการบน Bedside Bench ของ Doximity — กรณีทางคลินิก 500 กรณีที่ผ่านการตรวจสอบโดยแพทย์ในสิบหมวดหมู่ — ซึ่ง Fireworks Research อ้างว่า Ember-1 สร้างพรมแดนพาเรโตใหม่ในด้านต้นทุนต่องาน โดยเปรียบเทียบกับโมเดลแบบเปิดและแบบปิด รวมถึง GPT-5.6 Sol, GPT-6 Astra และ Claude Opus 5 นั่นเป็นคำกล่าวอ้างของผู้ขายเกี่ยวกับตำแหน่งพาเรโต ซึ่งเป็นคำกล่าวอ้างเกี่ยวกับการแลกเปลี่ยนแบบสองมิติมากกว่าคะแนนเพียงค่าเดียว และคำกล่าวอ้างนั้นจะเชื่อถือได้เพียงใดก็ขึ้นอยู่กับสมมติฐานด้านต้นทุนที่รองรับอยู่เบื้องหลัง สมมติฐานเหล่านั้นมาจากตารางอัตราค่าบริการ API สาธารณะของ Kimi K3 ซึ่งนำเรามาสู่ส่วนของเรื่องที่ผู้อ่านสามารถตรวจสอบได้จริงในวันนี้

โมเดลฐานคือส่วนที่คุณสามารถกำหนดเส้นทางได้อยู่แล้ว
ข้อโต้แย้งเรื่องต้นทุนทั้งหมดของ Ember-1 ถูกวัดเทียบกับอัตราที่ประกาศเผยแพร่ของ Kimi K3 Kimi K3 เปิดให้ใช้งานแล้วบน OrcaRouterในราคา $3.00 ต่ออินพุตโทเคนหนึ่งล้านโทเคน, $0.30 ต่ออินพุตโทเคนที่แคชไว้หนึ่งล้านโทเคน และ $15.00 ต่อเอาต์พุตโทเคนหนึ่งล้านโทเคน พร้อมหน้าต่างบริบทขนาด 1,048,576 โทเคน นั่นคือตารางอัตราเดียวกันกับที่การเปรียบเทียบของ Fireworks Research ใช้ และเป็นเรื่องที่ควรรู้ว่าการประหยัดในคอลัมน์การลดโทเคนเหล่านั้นคำนวณจากตัวเลขที่คุณสามารถดูได้ด้วยตัวเอง ไม่ใช่จากโมเดลต้นทุนภายในของผู้ขาย
Ember-1 เองไม่ได้อยู่บน OrcaRouter โดยมีให้ใช้เฉพาะผ่านแพลตฟอร์มแบบเซิร์ฟเวอร์เลสของผู้ขายเองเท่านั้น ในฐานะพรีวิวสำหรับงานวิจัย และ Fireworks Research ยังไม่ได้เผยแพร่ราคาสำหรับมัน — ดังนั้นตัวเลขดอลลาร์ในตารางเปรียบเทียบประสิทธิภาพจึงได้มาจากอัตราของ K3 และจำนวนโทเคน ไม่ได้มาจากเรทการ์ดของ Ember-1 ที่มีอยู่จริง หากสิ่งที่คุณสนใจคือการคำนวณ ลำดับขั้นที่ตรงไปตรงมาคือการตีราคาภาระงานตามเส้นทางของ K3 ในวันนี้ ใช้เปอร์เซ็นต์การลดโทเคนเป็นขอบเขตบนของสิ่งที่การเปลี่ยนอาจให้ได้ และรออัตราที่เผยแพร่ก่อนที่จะจำลองการประหยัดเป็นตัวเงิน
จุดที่ OrcaRouter ช่วยได้ตรงนี้คือเรื่องการป้องกันความเสี่ยง โมเดลพรีวิวสำหรับการวิจัยที่มีช่วงเวลาการเข้าถึงสองสัปดาห์เป็นโมเดลแบบที่คุณอยากลองใช้โดยไม่ต้องเดิมพันเส้นทางโปรดักชันกับมันพอดี และวิธีทำเช่นนั้นโดยไม่ต้องมีสัญญาฉบับที่สองคือการวางมันไว้เบื้องหลังเอนด์พอยต์เดียวกับทุกอย่างอื่นที่คุณเรียกใช้ OrcaRouter ให้บริการมากกว่า 200 โมเดลผ่าน API เดียวที่มีการสลับสำรองอัตโนมัติ ดังนั้นโมเดลพรีวิวที่กลายเป็นไม่พร้อมใช้งานในเดือนหน้าก็เป็นเพียงการเปลี่ยนเส้นทาง ไม่ใช่การโยกย้าย ไม่มีอะไรเกี่ยวกับ Ember-1 ที่จำเป็นต้องทำเช่นนั้น — แต่ก็ไม่มีอะไรเกี่ยวกับช่วงเวลาสองสัปดาห์ที่คัดค้านแนวทางนี้เช่นกัน
จะทำอย่างไรกับรีลีสนี้
หากคุณรัน Kimi K3 ในลูปเอเจนต์อยู่แล้ว ตัวเลขของ Ember-1 ก็อธิบายบิลของคุณ ปัญหาการรีเพลย์หลายเทิร์นเป็นเรื่องจริง มันเป็นต้นทุนหลักในการรันเอเจนต์ที่ยาวนาน และโมเดลที่ย่อเทรซของตัวเองให้สั้นลงโดยไม่เปลี่ยนคำตอบก็คุ้มค่ากับเวลาที่ใช้ประเมิน การทดสอบที่ถูกต้องไม่ใช่ตาราง benchmark แต่เป็นทราฟฟิกของคุณเอง โดยรันแบบ shadow — ส่งคำขอจริงส่วนหนึ่งไปยังทั้งสองโมเดล เปรียบเทียบผลลัพธ์ และเก็บผลลัพธ์ที่ใช้งานจริงไว้ไม่แตะต้องเป็นเวลาหนึ่งหรือสองสัปดาห์ก่อนที่จะเปลี่ยนแปลงอะไร นั่นก็เป็นคำแนะนำที่ผู้อ่านสายวิจารณ์ของรีลีสนี้กำลังให้เช่นกัน และมันก็สมเหตุสมผล
หากคุณรันเวิร์กโหลดแบบใช้การไตร่ตรองต่ำ หรือเวิร์กโหลดที่ถูกครอบงำด้วยการเรียกแบบเทิร์นเดียวสั้น ๆ การประหยัดส่วนใหญ่จะหายไป และแถว τ-2 Airline คือสิ่งที่คุณควรคาดหวังได้จริง และหากคุณต้องการคำมั่นระดับโปรดักชัน — ไม่ว่าจะเป็นราคา ระดับบริการ หรือการรับประกันว่า endpoint จะยังมีอยู่ในอีกหกเดือน — Ember-1 ยังไม่เสนอสิ่งนั้น มันเป็นพรีวิวงานวิจัยที่ Fireworks Research ผูกความคงอยู่ไว้กับความต้องการอย่างชัดเจน คำถามที่น่าสนใจในเดือนต่อไปคือ หน้าต่างสองสัปดาห์จะกลายเป็นทางเลือกในการให้บริการแบบถาวรหรือไม่ และบุคคลที่สามจะทำซ้ำตัวเลขใด ๆ เหล่านั้นได้หรือไม่ จนกว่าหนึ่งในสิ่งเหล่านั้นจะเกิดขึ้น นี่เป็นผลลัพธ์ที่แข็งแกร่งสำหรับอ่าน แต่เป็นผลลัพธ์ที่แย่สำหรับใช้ตั้งงบประมาณ

ทั้งหมดนั้นไม่ควรถูกตีความว่าเป็นการลดทอนคุณค่าของงานนี้ การตัดความสามารถในการให้เหตุผลออกโดยไม่ทำให้ความแม่นยำลดลงเป็นปัญหาที่ยากกว่าการเพิ่มมันเข้าไป และการทำเช่นนั้นบนโมเดลระดับแนวหน้าของคนอื่นแทนที่จะฝึกโมเดลของคุณเอง คือรูปแบบที่งานด้านขีดความสามารถจำนวนมากในปี 2026 ได้เป็นมา Ember-1 เป็นการเปิดตัวแรกในสิ่งที่ Fireworks Research บอกว่าจะเป็นซีรีส์ที่ดำเนินต่อไป และเทมเพลตนี้ — เอาโมเดลที่เก่งอยู่แล้ว มาเทรนใหม่ในแกนหนึ่งของพฤติกรรมมัน แล้วขายส่วนต่างเป็นโทเคน — เป็นสิ่งที่ควรจับตามอง ไม่ว่าพรีวิวเฉพาะนี้จะออกมาเป็นอย่างไร
