
Ember-1 vs LFM2.5 2.6B Base: พฤติกรรมที่ผ่านการขัดเกลาแล้วกับสับสเตรตดิบ
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ทั้ง Ember-1 และ LFM2.5 2.6B Base ต่างก็ไม่ใช่โมเดลที่คุณหยิบมาใช้ได้ทันที และทั้งสองใช้งานไม่ได้ด้วยเหตุผลที่ตรงกันข้ามกัน Ember-1 ซึ่งเผยแพร่โดย Fireworks Research เมื่อวันที่ 23 กันยายน 2026 เป็นเวอร์ชันเฉพาะทางที่พัฒนามาจาก Kimi K3 ของ Moonshot AI ซึ่งทางห้องแล็บได้เทรนใหม่เพื่อให้ได้ความแม่นยำระดับ K3 โดยใช้โทเค็นน้อยลงประมาณ 40% — เป็นพฤติกรรมที่สมบูรณ์แล้ว เปิดให้ใช้เฉพาะในรูปแบบ research preview บนแพลตฟอร์ม serverless ของผู้ขายเอง โดยไม่มี weights และไม่มีราคาที่เปิดเผย LFM2.5 2.6B Base ซึ่งเผยแพร่โดย Liquid AI เมื่อวันที่ 4 สิงหาคม 2026 เป็น checkpoint ที่ผ่านการ pretrain ขนาด 2.69B พารามิเตอร์ภายใต้ LFM Open License v1.0 ที่ยังไม่ได้ instruction-tune เลย และจะต่อข้อความของคุณแทนที่จะตอบคำถามของคุณ — เป็น substrate ดิบ ที่ดาวน์โหลดได้วันนี้ และจงใจทำให้ยังไม่สมบูรณ์ การอ่านทั้งสองแบบเทียบกันเป็นวิธีที่ดีในการเห็นข้อโต้แย้งสองข้อที่กำลังถูกกล่าวถึงเกี่ยวกับว่าปัจจุบันประสิทธิภาพที่เพิ่มขึ้นมาจากไหน
คำถามที่ทั้งสองโมเดลกำลังตอบ
การเปิดตัวทั้งสองครั้งตั้งอยู่บนสมมติฐานเดียวกัน นั่นคือ ชัยชนะแบบง่าย ๆ จากการทำให้โมเดลใหญ่ขึ้นนั้นถูกเก็บเกี่ยวไปมากแล้ว และงานที่น่าสนใจได้เคลื่อนไปสู่คำถามว่าโมเดลใช้สิ่งที่มันมีอยู่แล้วอย่างไร ห้องแล็บทั้งสองตอบคำถามนี้ต่างกัน Fireworks Research นำโมเดลระดับแนวหน้าที่มีอยู่แล้วมาเปลี่ยนพฤติกรรมของมัน Liquid AI สร้างโมเดลขนาดเล็กขึ้นใหม่ตั้งแต่ต้นและเปลี่ยนสเกล ทั้งสองไม่ใช่เรื่องราวของสถาปัตยกรรมใหม่ และทั้งสองก็ไม่ได้พยายามขึ้นอันดับหนึ่งในลีดเดอร์บอร์ด
คำตอบของ Ember-1: คงโมเดลไว้ แต่ฝึกพฤติกรรมใหม่
เอมเบอร์-1 ปล่อยสถาปัตยกรรมของ Kimi K3 ไว้เหมือนเดิม และโจมตีจุดที่ไม่มีประสิทธิภาพจุดหนึ่งโดยเฉพาะ โมเดลการให้เหตุผลสามารถใช้โทเค็นที่สร้างขึ้นมากกว่า 90% ไปกับการใคร่ครวญภายใน และในลูปเอเจนต์แบบหลายรอบ ร่องรอยเหล่านั้นจะถูกเล่นซ้ำและเรียกเก็บเงินใหม่ในทุกๆ รอบถัดไป — Fireworks Research อธิบายว่าการเติบโตของบริบทที่เป็นผลลัพธ์นั้นประมาณได้ว่าเป็นกำลังสองเมื่อเทียบกับจำนวนรอบ ข้ออ้างของทางแล็บคือ การให้เหตุผลของ K3 นั้นยาวนานกว่าที่งานต้องการ และส่วนที่เกินมานั้นสามารถตัดออกได้โดยไม่เปลี่ยนคำตอบ โดยรายงานว่ามีการทดลองฝึกมากกว่า 50 ครั้งและการประเมินมากกว่า 200 ครั้งบนสแต็กการฝึกแบบเซิร์ฟเวอร์เลสของตัวเอง และกล่าวว่าความยาวของการให้เหตุผลลดลง 35–50% โดยไม่สูญเสียความแม่นยำในเจ็ดเบนช์มาร์กและชุดข้อมูลทราฟฟิกการผลิตของลูกค้าสองชุด ทั้งหมดนี้เป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่มีการทำซ้ำ
ผลลัพธ์ไม่สม่ำเสมอในแบบที่ตัวเลขพาดหัวซ่อนเอาไว้ การลดโทเคนของ Ember-1 มีตั้งแต่ 51.9% บน Terminal Bench 2.1 ไปจนถึง 5.9% บน τ-2 Bench Airline ในการทดสอบ A/B งานเขียนโค้ดในสภาพแวดล้อมโปรดักชันของลูกค้ารายหนึ่ง จำนวนโทเคนเอาต์พุตลดลงจาก 49.3K เหลือ 29.9K ขณะที่คะแนนคงอยู่ที่ 0.753 เทียบกับ 0.751 — เป็นการลดโทเคนการให้เหตุผลลง 71.3% นั่นคือผลกระทบขนาดใหญ่ต่อรูปแบบภาระงานแบบหนึ่ง และแทบมองไม่เห็นต่ออีกรูปแบบหนึ่ง ซึ่งเป็นสิ่งที่คุณคาดว่าจะเห็นได้จากโมเดลที่ถูกฝึกให้หยุดคิดมากเกินไป มากกว่าที่จะคิดน้อยลง

คำตอบของ LFM2.5 2.6B Base: เปลี่ยนสเกล แต่คงสูตรเดิม
LFM2.5 2.6B Base คือการเดิมพันแบบที่ต่างออกไป มันคือสถาปัตยกรรมไฮบริดของ Liquid AI ในระดับเล็ก: 30 เลเยอร์ โดย 22 เลเยอร์เป็นบล็อก short-convolution แบบ dual-gated และ 8 เลเยอร์เป็นเลเยอร์ grouped-query-attention ฝึกบนข้อมูลราว 34 ล้านล้านโทเคนครอบคลุม 16 ภาษา พร้อมหน้าต่างบริบท 131,072 โทเคน เช็กพอยต์ทั้งหมดมีพารามิเตอร์แบบ dense 2.69B — เล็กพอจนบทสนทนาเรื่องต้นทุนไม่ใช่เรื่องจำนวนโทเคนอีกต่อไป แต่กลายเป็นเรื่องว่า GPU ตัวเดียวที่คุณมีเหลือว่างคือรุ่นไหน
สิ่งที่ทำให้มันไม่ธรรมดาคือสิ่งที่มันจงใจไม่ทำ ไม่มีการปรับแต่งด้วยคำสั่ง (instruction tuning) ซึ่งนั่นคือประเด็นทั้งหมดของคำต่อท้าย “Base”: ลองยื่นคำถามให้มัน แล้วมันจะต่อข้อความในสไตล์ของคำถามนั้นแทนที่จะตอบคำถามนั้น การ์ดโมเดลของ Liquid AI เองแนะนำให้ใช้กับงานที่ต้องอาศัยการปรับละเอียดอย่างหนัก นอกจากนี้ยังไม่มีการเผยแพร่ผลการประเมินมัน และนั่นไม่ใช่การละเลย — การประเมินเช็กพอยต์แบบ base ด้วยเบนช์มาร์กด้านการทำตามคำสั่งจะวัดอะไรไม่ได้เลย เพราะพฤติกรรมที่กำลังวัดนั้นยังไม่ได้รับการฝึกเข้ามา
ความต่าง โดยหนึ่งบรรทัดต่อมิติ
• มันคืออะไร — Ember-1: เวอร์ชันดัดแปลงที่ฝึกใหม่ของ Kimi K3 โดยมีการให้เหตุผลที่สั้นลง LFM2.5 2.6B Base: เช็กพอยต์ที่พรีเทรนตั้งแต่เริ่มต้นใหม่ โดยไม่มีการปรับจูนตามคำสั่ง
• พารามิเตอร์ — Ember-1: ไม่เปิดเผย; สืบทอดมาจาก Kimi K3. LFM2.5 2.6B Base: 2.69B แบบ dense
• น้ำหนักโมเดล — Ember-1: ไม่มีการเผยแพร่ LFM2.5 2.6B Base: มีให้ใช้งานภายใต้ LFM Open License v1.0
• ราคา — Ember-1: ไม่มีการเผยแพร่; จำนวนเงินดอลลาร์สำหรับการเปรียบเทียบจะใช้เรตการ์ดของ Kimi K3 LFM2.5 2.6B Base: ดาวน์โหลดฟรี; คุณต้องจัดห�าร์ดแวร์เอง
• บริบท — Ember-1: ไม่ได้เผยแพร่สำหรับพรีวิว LFM2.5 2.6B Base: 131,072 โทเคน
• การประเมินที่เผยแพร่ — Ember-1: เบนช์มาร์กเจ็ดรายการและการทดสอบ A/B สองรายการ ทั้งหมดดำเนินการโดยผู้ขาย LFM2.5 2.6B Base: ไม่มี โดยเจตนา
• สิ่งที่คุณได้รับในตอนท้าย — Ember-1: เอนด์พอยต์ที่สร้างการให้เหตุผลที่สั้นลงด้วยความแม่นยำระดับ K3. LFM2.5 2.6B Base: จุดเริ่มต้นที่มีพฤติกรรมเป็นอะไรก็ตามที่คุณฝึกให้มัน
การคิดถึงสองแบบที่แตกต่างกัน
ช่องว่างในสองรุ่นนี้ดูสมมาตรแต่ไม่ได้เป็นเช่นนั้น การประเมินที่ขาดหายไปของ LFM2.5 2.6B Base เป็นคุณสมบัติของอาร์ติแฟกต์: เช็คพอยต์ฐานไม่มีพฤติกรรมให้คะแนน และการปรับแต่งคำสั่งที่ขาดหายไปเป็นคุณสมบัติที่มีการบันทึกไว้มากกว่าจะเป็นข้อบกพร่อง การไม่มีอยู่ไม่ได้สร้างความไม่แน่นอนทางการค้า เพราะสิ่งที่คุณกำลังซื้อคือไฟล์ที่มีใบอนุญาตแนบมาด้วย และสิ่งที่ส่งมอบจะสมบูรณ์ทันทีที่การดาวน์โหลดเสร็จสิ้น
ชิ้นส่วนที่ขาดหายไปของ Ember-1 ยังคงไม่ได้รับการคลี่คลายอย่างแท้จริง ไม่มีราคาที่เผยแพร่ ดังนั้นข้ออ้างเรื่องต้นทุนจึงเป็นการคำนวณทางเลขคณิตบนเรตการ์ดของ Kimi K3 มากกว่าที่จะเป็นอัตราที่คุณใช้ตั้งงบได้ ไม่มีการปล่อยเวท ดังนั้นโมเดลจึงไม่สามารถอยู่ได้นานกว่าการตัดสินใจของเจ้าของผู้ให้บริการที่จะให้บริการต่อไป และหน้าต่างการเข้าถึงถูกอธิบายว่าเป็นแบบชั่วคราว: Fireworks Research กำหนดกรอบการเปิดตัวงานวิจัยของตนเป็นหน้าต่างแบบเซิร์ฟเวอร์เลสสองสัปดาห์ ซึ่งความถาวรขึ้นอยู่กับความต้องการของชุมชน พรีวิวที่อาจไม่มีอยู่ในเดือนหน้าเป็นข้อเสนอที่แตกต่างจากพรีวิวที่เพียงแค่ยังไม่ถูกพิสูจน์ และการทดสอบ A/B กับลูกค้ารายที่สองในประกาศ — โทเค็นต่องานลดลงราว 35% — บอกคุณว่าห้องแล็บคาดหวังอะไร ไม่ใช่สิ่งที่ยังจะเข้าถึงได้ในเดือนพฤศจิกายน
ความไม่สมมาตรนั้นคือคำตอบที่ตรงไปตรงมาต่อคำถามที่ว่า "ในบรรดาสิ่งเหล่านี้ อันไหนพร้อมมากกว่ากัน" ไม่มีอันใดพร้อมในความหมายของการเป็น dependency สำหรับโปรดักชันที่เสียบใช้ได้ทันที LFM2.5 2.6B Base เสร็จสมบูรณ์ในฐานะวัตถุดิบ แต่ยังไม่เสร็จสมบูรณ์ในฐานะโมเดล Ember-1 เสร็จสมบูรณ์ในฐานะโมเดล แต่ยังไม่เสร็จสมบูรณ์ในฐานะบริการ

ทำอะไรกับแต่ละรายการในไตรมาสนี้
ถ้าคุณมีไปป์ไลน์ fine-tuning และงานเฉพาะทางที่มีเลเบลสะอาด LFM2.5 2.6B Base คือตัวที่คาดเดาได้ง่ายกว่าในสองตัวนี้ checkpoint มีขนาดเล็ก สัญญาอนุญาตเป็นแบบผ่อนปรน สถาปัตยกรรมถูกออกแบบมาให้มีประสิทธิภาพตอน inference และงานในการเปลี่ยนมันให้เป็นสิ่งที่มีประโยชน์ — supervised fine-tuning, ชุดประเมินผล, serving stack — เป็นงานที่คุณเป็นเจ้าของอยู่แล้วแบบครบวงจร ไม่ว่าทางไหนคุณก็จะรัน eval ของตัวเองอยู่ดี เพราะ Liquid AI ไม่ได้เผยแพร่อะไรเลย
หากคุณมีเวิร์กโหลดเอเจนต์แบบโฮสต์ที่ค่าใช้จ่ายถูกครอบงำด้วยโทเคนการให้เหตุผล Ember-1 จัดการกับพจน์จริงในสมการต้นทุนของคุณ และมันคุ้มค่ากับเวลาสองสัปดาห์ การทดสอบที่ถูกต้องคือการใช้ทราฟฟิกเงาเทียบกับระบบเดิมของคุณ ส่งคำขอจริงส่วนหนึ่งไปยังทั้งสองระบบ เปรียบเทียบเอาต์พุต และปล่อยผลลัพธ์สดไว้ตามเดิม นั่นก็เป็นคำแนะนำจากบทวิเคราะห์เชิงวิจารณ์อิสระเกี่ยวกับการเปิดตัวครั้งนี้เช่นกัน พร้อมคำเตือนที่ยุติธรรม — การบีบอัดการใคร่ครวญมีความเสี่ยงที่จะทำให้สูญเสียขั้นตอนที่โมเดลจำเป็นต้องใช้ และในเอเจนต์ สิ่งนั้นจะปรากฏในภายหลังเป็นการเรียกเครื่องมือที่ผิด มากกว่าจะเป็นประโยคที่ผิด
ไม่มีโมเดลใดอยู่บน OrcaRouter หากคุณต้องการทดสอบแพตเทิร์นนี้แทนที่จะทดสอบอาร์ติแฟกต์ทั้งสองชิ้นนี้ — โมเดลขนาดเล็กที่ปรับแต่งเพิ่มได้และตัวให้เหตุผลขนาดใหญ่ที่โฮสต์ไว้ในไปป์ไลน์เดียว — นั่นคือสิ่งที่ routing DSL มีไว้เพื่อพอดี: ประกอบโมเดลหลายตัวเข้าเป็นการเรียกครั้งเดียว และให้แต่ละตัวจัดการส่วนที่มันถนัด ภายใต้ คีย์เดียวและบิลเดียว การเปรียบเทียบในที่นี้คุ้มค่าที่จะทำในระดับสถาปัตยกรรม แม้ว่าปลายทางเฉพาะทั้งสองยังคงอยู่นอกเหนือการเข้าถึงก็ตาม
การค้าที่กล่าวไว้เพียงครั้งเดียว
Ember-1 ขายความแน่นอนด้านพฤติกรรมและความไม่แน่นอนด้านอุปทาน: โมเดลที่คุณภาพถูกถกเถียงกันอย่างรอบคอบ และความพร้อมใช้งานนั้นมีเงื่อนไขอย่างชัดเจน LFM2.5 2.6B Base ขายความแน่นอนด้านอุปทานและความไม่แน่นอนด้านพฤติกรรม: ไฟล์ที่คุณจะมีไว้เสมอ และความสามารถของมันขึ้นอยู่กับการฝึกที่คุณใส่ลงไปทั้งหมด ทีมที่มีปัญหาเรื่องการให้บริการและไม่มีความสามารถในการฝึก ควรจับตาดูพรีวิวและหวังว่ามันจะกลายเป็นถาวร ทีมที่มีความสามารถในการฝึกและมีงานเฉพาะแคบ ควรดาวน์โหลด base และเลิกคอยโรดแมปของใครก็ตาม

สิ่งที่การจับคู่นี้แสดงให้เห็นจริง ๆ คือ “ประสิทธิภาพ” ไม่ได้หมายถึงสิ่งเดียวอีกต่อไปแล้ว สำหรับ Ember-1 มันหมายถึงโทเค็นที่น้อยลงโดยได้คุณภาพเท่าเดิมบนฮาร์ดแวร์ของคนอื่น สำหรับ LFM2.5 2.6B Base มันหมายถึงโมเดลที่เล็กพอจนฮาร์ดแวร์ไม่ใช่ของคนอื่นอีกต่อไปเลย ทั้งสองอย่างนี้เป็นคำตอบที่ดีทั้งคู่ และใช้แทนกันไม่ได้
