การ์ดชื่อเรื่องที่สร้างขึ้นโดยมีข้อความ "Ember-1" พร้อมคำโปรย "คุณภาพระดับ Kimi K3 โทเค็นการให้เหตุผลน้อยลงประมาณ 40%" และการ์ดสามใบ: การลดการให้เหตุผล 35-50%, Terminal Bench 2.1 82.0%, เปิดตัวพรีวิวงานวิจัย บรรทัดท้ายระบุว่า: ตัวเลขที่รายงานโดย Fireworks ยังไม่ได้รับการทำซ้ำ; เผยแพร่ 23 กันยายน 2026
Guides & Insights

Ember-1 ลดความสามารถในการให้เหตุผลของ Kimi K3 ลง 40% — และรายละเอียดในตัวอักษรเล็กคือเรื่องราวที่แท้จริง

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ตัวเลขที่จะถูกอ้างถึงคือ 40% Fireworks Research เผยแพร่ Ember-1 เมื่อวันที่ 23 กันยายน 2026 โดยอธิบายว่าเป็นอนุพันธ์เฉพาะทางของ Kimi K3 จาก Moonshot AI ที่รักษาความแม่นยำของ K3 ไว้ได้ ขณะที่ใช้โทเคนน้อยลงราว 40% เพื่อให้ได้ผลลัพธ์เท่ากัน นั่นเป็นคำกล่าวอ้างที่จริงและเจาะจงอย่างผิดปกติ และมันมาพร้อมกับสามสิ่งแนบมาด้วย: ชีต benchmark ฉบับเต็มที่มีคอลัมน์การลดจำนวนโทเคน, การทดสอบ A/B ของลูกค้าสองรายจากทราฟฟิกการเขียนโค้ดในโปรดักชัน, และสถานะการเปิดตัวที่ไม่ใช่การพร้อมใช้งานทั่วไป Ember-1 เปิดให้ใช้ในสถานะ research preview บนแพลตฟอร์มเซิร์ฟเวอร์เลสของผู้ให้บริการเอง โดยมีช่วงเวลาการเข้าถึงสองสัปดาห์ และการตัดสินใจเรื่องความถาวรที่ขึ้นอยู่กับความต้องการ การทำความเข้าใจว่าส่วนใดของสิ่งนี้คือผลิตภัณฑ์ที่ส่งมอบแล้ว และส่วนใดคือผลการวิจัยที่มีเหตุผลรองรับอย่างดี คือหัวใจของเรื่องทั้งหมด

ยังมีชื่อที่ชนกันอยู่ ซึ่งควรทำให้กระจ่างก่อนเรื่องอื่นใด โครงการวิจัยเปิดแยกต่างหากชื่อ Ember (v0.1.5 จาก Slow Lit Labs) ใช้เวลาตลอดปี 2026 ในการเผยแพร่การประเมินความสอดคล้องระยะยาว และมันไม่เกี่ยวข้องกับโมเดลนี้ในทางใดเลย อะไรก็ตามที่คุณอ่านเกี่ยวกับ Ember ที่ไม่สามารถเอาชนะ Qwen3-8B ภายใต้การตั้งค่าการอนุมานที่เทียบเคียงกัน ล้วนเป็นเรื่องของโครงการนั้น Ember-1 ซึ่งเป็นหัวข้อในที่นี้ เป็นโมเดลที่พัฒนาต่อยอดมาจาก Kimi K3 จาก Fireworks Research

Ember-1 จริง ๆ แล้วคืออะไร

Ember-1 ไม่ใช่สถาปัตยกรรมใหม่ และไม่ใช่โมเดลฐานใหม่ มันคือ Kimi K3 ที่ถูกฝึกใหม่ให้ใช้เหตุผลอย่างกระชับยิ่งขึ้น Fireworks Research ได้ทำการทดลองฝึกมากกว่า 50 ครั้งและการประเมินมากกว่า 200 ครั้งบนสแต็กการฝึกแบบไร้เซิร์ฟเวอร์ของตนเอง ครอบคลุมด้านคณิตศาสตร์ การเขียนโค้ด การทำตามคำสั่ง การสนทนา การค้นหา การใช้เครื่องมือ และวิศวกรรมซอฟต์แวร์ โดยมีเป้าหมายชัดเจนในการกำจัดเหตุผลที่ไม่เปลี่ยนคำตอบ ทางห้องแล็บกล่าวว่าความยาวของเหตุผลสามารถลดลงได้ 35–50% โดยไม่สูญเสียความแม่นยำในเจ็ดเบนช์มาร์กและชุดทราฟฟิกจริงจากสภาพแวดล้อมการผลิตของลูกค้าสองชุด ตัวเลขทั้งหมดเหล่านั้นเป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่ได้รับการทำซ้ำอย่างอิสระ ยังไม่มีบุคคลที่สามรายใดเผยแพร่การรัน Ember-1 ณ เวลาที่เขียนนี้

การวางกรอบเรื่องนี้สำคัญ เพราะทางเลือกที่ชัดเจนมีอยู่แล้ว Kimi K3 มาพร้อมการตั้งค่าระดับความพยายามในการใช้เหตุผล และวิธีประหยัดที่จะใช้โทเคนน้อยลงก็คือลดระดับความพยายามลง Fireworks Research บอกว่าลองทำแบบนั้นแล้ว และการตั้งค่าระดับต่ำก็สูญเสียคุณภาพไปมากเกินไป — ซึ่งเป็นผลลัพธ์ที่คุ้นเคยสำหรับใครก็ตามที่เคยปรับระดับความพยายามบนโมเดลใช้เหตุผล ข้ออ้างของ Ember-1 คือปุ่มปรับความพยายามนั้นหยาบ และการฝึกใหม่นั้นละเอียด

A single-column scoreboard titled "Ember-1 — the scoreboard": base model Kimi K3 (Moonshot AI); what changed, shorter reasoning with the same answers; token reduction claimed 35-50% across seven benchmarks; Terminal Bench 2.1 82.0% against K3 Max 80.9%; SWE-bench Verified 92.2% against K3 Max 93.2%; weights and price, none published — research preview. The footer states every figure is Fireworks-reported and unreproduced.

ทำไมโทเค็นการให้เหตุผลจึงคุ้มค่ากับความพยายามมากขนาดนี้

ค่าใช้จ่ายของโมเดลการให้เหตุผลไม่ได้ถูกครอบงำด้วยคำตอบของมัน Fireworks Research ตั้งข้อสังเกตว่า K3 อาจใช้โทเค็นที่สร้างขึ้นมากกว่า 90% ไปกับการให้เหตุผลภายใน ก่อนที่มันจะเขียนสิ่งที่ผู้ใช้มองเห็น ในคำขอเดียว นั่นเป็นเพียงเรื่องของค่าใช้จ่ายที่สูง แต่ในลูปเอเจนต์แบบหลายเทิร์น สิ่งนี้จะทบต้น เพราะแต่ละเทิร์นจะเล่นบทสนทนาก่อนหน้าซ้ำ ดังนั้นร่องรอยการให้เหตุผลจากเทิร์นก่อน ๆ จึงถูกอ่านซ้ำและถูกคิดค่าใช้จ่ายซ้ำในการเรียกครั้งถัดไปทุกครั้ง Fireworks Research อธิบายว่าบริบทเติบโตประมาณแบบกำลังสองตามจำนวนเทิร์น นั่นคือเป้าหมายจริงของการเปิดตัวครั้งนี้ และเป็นเหตุผลว่าทำไมตัวเลขชี้วัดหลักจึงเป็นโทเค็นที่ลดลงประมาณ 40% แทนที่จะเป็นการก้าวกระโดดด้านคุณภาพ

กลไกนี้อธิบายความเสี่ยงด้วย การบีบอัดที่กำจัดความครุ่นคิดที่เสียเปล่าเป็นสิ่งที่ไม่ต้องแลกอะไร แต่การบีบอัดที่กำจัดขั้นตอนที่โมเดลจำเป็นต้องใช้กลับไม่ใช่ รูปแบบความล้มเหลวที่ถูกรายงานอย่างกว้างขวางของการลดการใช้เหตุผลที่มากเกินไป คือโมเดลที่ข้ามการตรวจสอบขั้นกลางแล้วกระโดดไปสู่ข้อสรุป ซึ่งในเอเจนต์จะปรากฏให้เห็นในภายหลังมากในรูปของการเรียกใช้เครื่องมือที่ผิด มากกว่าประโยคที่ผิด การเน้นย้ำซ้ำ ๆ ของ Fireworks Research เกี่ยวกับคุณภาพที่เทียบเท่ากันอ่านได้ว่าเป็นคำตอบต่อความกังวลนั้น และตัวเลข A/B นั้นเป็นสิ่งที่ใกล้เคียงกับหลักฐานมากที่สุดสำหรับเรื่องนี้ — โดยมีข้อแม้ตามปกติว่า ชุดทดสอบ เกณฑ์การผ่าน และขนาดตัวอย่าง ล้วนถูกเลือกโดยฝ่ายที่กล่าวอ้าง

ชีตเกณฑ์มาตรฐาน พร้อมที่มาแนบมาด้วย

นี่คือตัวเลขของ Fireworks Research ที่ยังไม่ได้ทำซ้ำ คอลัมน์ด้านขวาคือส่วนที่ควรอ่านอย่างละเอียด โดยจะจับคู่แต่ละคะแนนเข้ากับจำนวนโทเคนและจำนวนดอลลาร์ที่ใช้ไปเมื่อเทียบกับ K3 Max

• Terminal Bench 2.1 (n=89) — Ember-1 82.0% เทียบกับ K3 Max 80.9%, K3 High 77.6%, K3 Low 76.4%; ใช้โทเค็นน้อยลง 51.9%, ประหยัดกว่า $23.10 ต่องาน

• SWE-bench Verified (n=500) — Ember-1 92.2% เทียบกับ K3 Max 93.2%; ใช้โทเค็นน้อยลง 15.5% และค่าใช้จ่ายต่องานน้อยลง $68.10

• SWE-Interact (n=75) — Ember-1 20.0% เทียบกับ K3 Max 21.3%, K3 High 13.3%, K3 Low 6.7%; ใช้โทเค็นน้อยลง 32.5%

• DeepSWE 1.1 (n=113) — Ember-1 75.2% เทียบกับ K3 Max 66.4%; ใช้โทเค็นน้อยลง 23.7% ค่าใช้จ่ายลดลง $126.90 ต่องาน

• τ-2 Bench Airline (n=50) — Ember-1 66% เทียบกับ K3 Max 64%, โดย K3 High และ Low ได้ 64% ทั้งคู่; ใช้โทเคนน้อยลง 5.9% และถูกลง $0.30 ต่องาน

มีสองสิ่งที่น่าสังเกต ประการแรก Ember-1 ชนะขาดใน Terminal Bench 2.1 และ DeepSWE 1.1 แต่แพ้อย่างหวุดหวิดใน SWE-bench Verified และ SWE-Interact — รูปแบบที่สอดคล้องกับโมเดลที่ไม่ได้สูญเสียความสามารถมากเท่ากับเปลี่ยนว่างานใดที่มันใช้เวลาไตร่ตรอง ประการที่สอง การประหยัดโทเคนไม่สม่ำเสมออย่างมาก: 51.9% บน Terminal Bench เทียบกับ 5.9% บน τ-2 Airline ไม่ว่า Ember-1 จะเรียนรู้อะไร มันไม่ใช่การตัดลดการใช้ความคิดลง 40% แบบสม่ำเสมอ ตัวเลข “ประมาณ 40%” ในพาดหัวคือค่าเฉลี่ยของช่วงที่กระจายตั้งแต่ราว 6% ถึงราว 52% และทีมที่มีภาระงานคล้าย τ-2 Airline ไม่ควรคาดหวังว่าจะรู้สึกถึงผลนี้

การทดสอบ A/B ในโปรดักชันเป็นหลักฐานที่โน้มน้าวใจกว่า ก็เพราะมันไม่ได้ถูกสร้างขึ้นมาให้เป็นเบนช์มาร์ก ในเวิร์กโหลดการเขียนโค้ดของลูกค้ารายหนึ่ง Ember-1 ทำคะแนนได้ 0.753 เทียบกับ 0.751 ของ K3 ใช้ 21.4 ขั้นตอน เทียบกับ 23.8 และปล่อยโทเคนเอาต์พุต 29.9K เทียบกับ 49.3K — ลดโทเคนการให้เหตุผลลง 71.3% และลดโทเคนรวมลง 39% โดยมีคุณภาพใกล้เคียงกัน ลูกค้ารายที่สองพบว่าใช้โทเคนต่อภารกิจน้อยลงประมาณ 35% ที่คุณภาพเทียบเคียงได้ และ Fireworks Research กล่าวว่าบริษัทได้สลับมาใช้กับทราฟฟิกการเขียนโค้ดและ coworking ภายในของตัวเองก่อน โดยผลลัพธ์ที่รายงานคือไม่มีใครสังเกตเห็น ให้ถือว่าทั้งหมดนี้เป็นข้อมูลที่ผู้ขายรายงาน แต่ให้ถือว่ามันเป็นรูปแบบที่แข็งแกร่งที่สุดของข้อมูลที่ผู้ขายรายงาน: ข้อมูลความชอบจาก A/B และข้อมูลการทำภารกิจให้สำเร็จนั้นยากที่จะปั่นมากกว่าลีดเดอร์บอร์ด

มีการประเมินอีกหนึ่งรายการบน Bedside Bench ของ Doximity — กรณีทางคลินิก 500 กรณีที่ผ่านการตรวจสอบโดยแพทย์ในสิบหมวดหมู่ — ซึ่ง Fireworks Research อ้างว่า Ember-1 สร้างพรมแดนพาเรโตใหม่ในด้านต้นทุนต่องาน โดยเปรียบเทียบกับโมเดลแบบเปิดและแบบปิด รวมถึง GPT-5.6 Sol, GPT-6 Astra และ Claude Opus 5 นั่นเป็นคำกล่าวอ้างของผู้ขายเกี่ยวกับตำแหน่งพาเรโต ซึ่งเป็นคำกล่าวอ้างเกี่ยวกับการแลกเปลี่ยนแบบสองมิติมากกว่าคะแนนเพียงค่าเดียว และคำกล่าวอ้างนั้นจะเชื่อถือได้เพียงใดก็ขึ้นอยู่กับสมมติฐานด้านต้นทุนที่รองรับอยู่เบื้องหลัง สมมติฐานเหล่านั้นมาจากตารางอัตราค่าบริการ API สาธารณะของ Kimi K3 ซึ่งนำเรามาสู่ส่วนของเรื่องที่ผู้อ่านสามารถตรวจสอบได้จริงในวันนี้

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window, and a Python snippet calling the model at api.orcarouter.ai/v1.

โมเดลฐานคือส่วนที่คุณสามารถกำหนดเส้นทางได้อยู่แล้ว

ข้อโต้แย้งเรื่องต้นทุนทั้งหมดของ Ember-1 ถูกวัดเทียบกับอัตราที่ประกาศเผยแพร่ของ Kimi K3 Kimi K3 เปิดให้ใช้งานแล้วบน OrcaRouterในราคา $3.00 ต่ออินพุตโทเคนหนึ่งล้านโทเคน, $0.30 ต่ออินพุตโทเคนที่แคชไว้หนึ่งล้านโทเคน และ $15.00 ต่อเอาต์พุตโทเคนหนึ่งล้านโทเคน พร้อมหน้าต่างบริบทขนาด 1,048,576 โทเคน นั่นคือตารางอัตราเดียวกันกับที่การเปรียบเทียบของ Fireworks Research ใช้ และเป็นเรื่องที่ควรรู้ว่าการประหยัดในคอลัมน์การลดโทเคนเหล่านั้นคำนวณจากตัวเลขที่คุณสามารถดูได้ด้วยตัวเอง ไม่ใช่จากโมเดลต้นทุนภายในของผู้ขาย

Ember-1 เองไม่ได้อยู่บน OrcaRouter โดยมีให้ใช้เฉพาะผ่านแพลตฟอร์มแบบเซิร์ฟเวอร์เลสของผู้ขายเองเท่านั้น ในฐานะพรีวิวสำหรับงานวิจัย และ Fireworks Research ยังไม่ได้เผยแพร่ราคาสำหรับมัน — ดังนั้นตัวเลขดอลลาร์ในตารางเปรียบเทียบประสิทธิภาพจึงได้มาจากอัตราของ K3 และจำนวนโทเคน ไม่ได้มาจากเรทการ์ดของ Ember-1 ที่มีอยู่จริง หากสิ่งที่คุณสนใจคือการคำนวณ ลำดับขั้นที่ตรงไปตรงมาคือการตีราคาภาระงานตามเส้นทางของ K3 ในวันนี้ ใช้เปอร์เซ็นต์การลดโทเคนเป็นขอบเขตบนของสิ่งที่การเปลี่ยนอาจให้ได้ และรออัตราที่เผยแพร่ก่อนที่จะจำลองการประหยัดเป็นตัวเงิน

จุดที่ OrcaRouter ช่วยได้ตรงนี้คือเรื่องการป้องกันความเสี่ยง โมเดลพรีวิวสำหรับการวิจัยที่มีช่วงเวลาการเข้าถึงสองสัปดาห์เป็นโมเดลแบบที่คุณอยากลองใช้โดยไม่ต้องเดิมพันเส้นทางโปรดักชันกับมันพอดี และวิธีทำเช่นนั้นโดยไม่ต้องมีสัญญาฉบับที่สองคือการวางมันไว้เบื้องหลังเอนด์พอยต์เดียวกับทุกอย่างอื่นที่คุณเรียกใช้ OrcaRouter ให้บริการมากกว่า 200 โมเดลผ่าน API เดียวที่มีการสลับสำรองอัตโนมัติ ดังนั้นโมเดลพรีวิวที่กลายเป็นไม่พร้อมใช้งานในเดือนหน้าก็เป็นเพียงการเปลี่ยนเส้นทาง ไม่ใช่การโยกย้าย ไม่มีอะไรเกี่ยวกับ Ember-1 ที่จำเป็นต้องทำเช่นนั้น — แต่ก็ไม่มีอะไรเกี่ยวกับช่วงเวลาสองสัปดาห์ที่คัดค้านแนวทางนี้เช่นกัน

จะทำอย่างไรกับรีลีสนี้

หากคุณรัน Kimi K3 ในลูปเอเจนต์อยู่แล้ว ตัวเลขของ Ember-1 ก็อธิบายบิลของคุณ ปัญหาการรีเพลย์หลายเทิร์นเป็นเรื่องจริง มันเป็นต้นทุนหลักในการรันเอเจนต์ที่ยาวนาน และโมเดลที่ย่อเทรซของตัวเองให้สั้นลงโดยไม่เปลี่ยนคำตอบก็คุ้มค่ากับเวลาที่ใช้ประเมิน การทดสอบที่ถูกต้องไม่ใช่ตาราง benchmark แต่เป็นทราฟฟิกของคุณเอง โดยรันแบบ shadow — ส่งคำขอจริงส่วนหนึ่งไปยังทั้งสองโมเดล เปรียบเทียบผลลัพธ์ และเก็บผลลัพธ์ที่ใช้งานจริงไว้ไม่แตะต้องเป็นเวลาหนึ่งหรือสองสัปดาห์ก่อนที่จะเปลี่ยนแปลงอะไร นั่นก็เป็นคำแนะนำที่ผู้อ่านสายวิจารณ์ของรีลีสนี้กำลังให้เช่นกัน และมันก็สมเหตุสมผล

หากคุณรันเวิร์กโหลดแบบใช้การไตร่ตรองต่ำ หรือเวิร์กโหลดที่ถูกครอบงำด้วยการเรียกแบบเทิร์นเดียวสั้น ๆ การประหยัดส่วนใหญ่จะหายไป และแถว τ-2 Airline คือสิ่งที่คุณควรคาดหวังได้จริง และหากคุณต้องการคำมั่นระดับโปรดักชัน — ไม่ว่าจะเป็นราคา ระดับบริการ หรือการรับประกันว่า endpoint จะยังมีอยู่ในอีกหกเดือน — Ember-1 ยังไม่เสนอสิ่งนั้น มันเป็นพรีวิวงานวิจัยที่ Fireworks Research ผูกความคงอยู่ไว้กับความต้องการอย่างชัดเจน คำถามที่น่าสนใจในเดือนต่อไปคือ หน้าต่างสองสัปดาห์จะกลายเป็นทางเลือกในการให้บริการแบบถาวรหรือไม่ และบุคคลที่สามจะทำซ้ำตัวเลขใด ๆ เหล่านั้นได้หรือไม่ จนกว่าหนึ่งในสิ่งเหล่านั้นจะเกิดขึ้น นี่เป็นผลลัพธ์ที่แข็งแกร่งสำหรับอ่าน แต่เป็นผลลัพธ์ที่แย่สำหรับใช้ตั้งงบประมาณ

A screenshot of OrcaRouter's model catalogue headed "Models — 203 models · 15 providers · one API, one bill", with filter panels for input modalities, context length and input price, a "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions, and model cards for OpenAI GPT-6 Luna, OpenAI GPT-6 Sol, Anthropic Claude Opus 5 and Grok 4.7 with their per-million-token rates.

ทั้งหมดนั้นไม่ควรถูกตีความว่าเป็นการลดทอนคุณค่าของงานนี้ การตัดความสามารถในการให้เหตุผลออกโดยไม่ทำให้ความแม่นยำลดลงเป็นปัญหาที่ยากกว่าการเพิ่มมันเข้าไป และการทำเช่นนั้นบนโมเดลระดับแนวหน้าของคนอื่นแทนที่จะฝึกโมเดลของคุณเอง คือรูปแบบที่งานด้านขีดความสามารถจำนวนมากในปี 2026 ได้เป็นมา Ember-1 เป็นการเปิดตัวแรกในสิ่งที่ Fireworks Research บอกว่าจะเป็นซีรีส์ที่ดำเนินต่อไป และเทมเพลตนี้ — เอาโมเดลที่เก่งอยู่แล้ว มาเทรนใหม่ในแกนหนึ่งของพฤติกรรมมัน แล้วขายส่วนต่างเป็นโทเคน — เป็นสิ่งที่ควรจับตามอง ไม่ว่าพรีวิวเฉพาะนี้จะออกมาเป็นอย่างไร

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube