การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งเขียนว่า "Ember-1 vs LFM2.5 2.6B Base" พร้อมคำโปรยรอง "พฤติกรรมที่สมบูรณ์แล้ว เทียบกับฐานดิบ" เหนือการ์ดสองใบ: Ember-1 — "Kimi K3 ที่ฝึกใหม่" และ "ให้บริการ ไม่ใช่ดาวน์โหลด"; LFM2.5 2.6B Base — "เช็กพอยต์แบบ dense ขนาด 2.69B" และ "ไม่มีการปรับจูนตามคำสั่ง"
Guides & Insights

Ember-1 vs LFM2.5 2.6B Base: พฤติกรรมที่ผ่านการขัดเกลาแล้วกับสับสเตรตดิบ

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ทั้ง Ember-1 และ LFM2.5 2.6B Base ต่างก็ไม่ใช่โมเดลที่คุณหยิบมาใช้ได้ทันที และทั้งสองใช้งานไม่ได้ด้วยเหตุผลที่ตรงกันข้ามกัน Ember-1 ซึ่งเผยแพร่โดย Fireworks Research เมื่อวันที่ 23 กันยายน 2026 เป็นเวอร์ชันเฉพาะทางที่พัฒนามาจาก Kimi K3 ของ Moonshot AI ซึ่งทางห้องแล็บได้เทรนใหม่เพื่อให้ได้ความแม่นยำระดับ K3 โดยใช้โทเค็นน้อยลงประมาณ 40% — เป็นพฤติกรรมที่สมบูรณ์แล้ว เปิดให้ใช้เฉพาะในรูปแบบ research preview บนแพลตฟอร์ม serverless ของผู้ขายเอง โดยไม่มี weights และไม่มีราคาที่เปิดเผย LFM2.5 2.6B Base ซึ่งเผยแพร่โดย Liquid AI เมื่อวันที่ 4 สิงหาคม 2026 เป็น checkpoint ที่ผ่านการ pretrain ขนาด 2.69B พารามิเตอร์ภายใต้ LFM Open License v1.0 ที่ยังไม่ได้ instruction-tune เลย และจะต่อข้อความของคุณแทนที่จะตอบคำถามของคุณ — เป็น substrate ดิบ ที่ดาวน์โหลดได้วันนี้ และจงใจทำให้ยังไม่สมบูรณ์ การอ่านทั้งสองแบบเทียบกันเป็นวิธีที่ดีในการเห็นข้อโต้แย้งสองข้อที่กำลังถูกกล่าวถึงเกี่ยวกับว่าปัจจุบันประสิทธิภาพที่เพิ่มขึ้นมาจากไหน

คำถามที่ทั้งสองโมเดลกำลังตอบ

การเปิดตัวทั้งสองครั้งตั้งอยู่บนสมมติฐานเดียวกัน นั่นคือ ชัยชนะแบบง่าย ๆ จากการทำให้โมเดลใหญ่ขึ้นนั้นถูกเก็บเกี่ยวไปมากแล้ว และงานที่น่าสนใจได้เคลื่อนไปสู่คำถามว่าโมเดลใช้สิ่งที่มันมีอยู่แล้วอย่างไร ห้องแล็บทั้งสองตอบคำถามนี้ต่างกัน Fireworks Research นำโมเดลระดับแนวหน้าที่มีอยู่แล้วมาเปลี่ยนพฤติกรรมของมัน Liquid AI สร้างโมเดลขนาดเล็กขึ้นใหม่ตั้งแต่ต้นและเปลี่ยนสเกล ทั้งสองไม่ใช่เรื่องราวของสถาปัตยกรรมใหม่ และทั้งสองก็ไม่ได้พยายามขึ้นอันดับหนึ่งในลีดเดอร์บอร์ด

คำตอบของ Ember-1: คงโมเดลไว้ แต่ฝึกพฤติกรรมใหม่

เอมเบอร์-1 ปล่อยสถาปัตยกรรมของ Kimi K3 ไว้เหมือนเดิม และโจมตีจุดที่ไม่มีประสิทธิภาพจุดหนึ่งโดยเฉพาะ โมเดลการให้เหตุผลสามารถใช้โทเค็นที่สร้างขึ้นมากกว่า 90% ไปกับการใคร่ครวญภายใน และในลูปเอเจนต์แบบหลายรอบ ร่องรอยเหล่านั้นจะถูกเล่นซ้ำและเรียกเก็บเงินใหม่ในทุกๆ รอบถัดไป — Fireworks Research อธิบายว่าการเติบโตของบริบทที่เป็นผลลัพธ์นั้นประมาณได้ว่าเป็นกำลังสองเมื่อเทียบกับจำนวนรอบ ข้ออ้างของทางแล็บคือ การให้เหตุผลของ K3 นั้นยาวนานกว่าที่งานต้องการ และส่วนที่เกินมานั้นสามารถตัดออกได้โดยไม่เปลี่ยนคำตอบ โดยรายงานว่ามีการทดลองฝึกมากกว่า 50 ครั้งและการประเมินมากกว่า 200 ครั้งบนสแต็กการฝึกแบบเซิร์ฟเวอร์เลสของตัวเอง และกล่าวว่าความยาวของการให้เหตุผลลดลง 35–50% โดยไม่สูญเสียความแม่นยำในเจ็ดเบนช์มาร์กและชุดข้อมูลทราฟฟิกการผลิตของลูกค้าสองชุด ทั้งหมดนี้เป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่มีการทำซ้ำ

ผลลัพธ์ไม่สม่ำเสมอในแบบที่ตัวเลขพาดหัวซ่อนเอาไว้ การลดโทเคนของ Ember-1 มีตั้งแต่ 51.9% บน Terminal Bench 2.1 ไปจนถึง 5.9% บน τ-2 Bench Airline ในการทดสอบ A/B งานเขียนโค้ดในสภาพแวดล้อมโปรดักชันของลูกค้ารายหนึ่ง จำนวนโทเคนเอาต์พุตลดลงจาก 49.3K เหลือ 29.9K ขณะที่คะแนนคงอยู่ที่ 0.753 เทียบกับ 0.751 — เป็นการลดโทเคนการให้เหตุผลลง 71.3% นั่นคือผลกระทบขนาดใหญ่ต่อรูปแบบภาระงานแบบหนึ่ง และแทบมองไม่เห็นต่ออีกรูปแบบหนึ่ง ซึ่งเป็นสิ่งที่คุณคาดว่าจะเห็นได้จากโมเดลที่ถูกฝึกให้หยุดคิดมากเกินไป มากกว่าที่จะคิดน้อยลง

A two-column scoreboard titled "Ember-1 vs LFM2.5 2.6B Base — the scoreboard" comparing six dimensions. Ember-1: a retrained Kimi K3 derivative; parameters undisclosed; no published weights; context not published (base model 1M); published evaluation is seven benchmarks plus two A/B tests, vendor-run; obtained only as a serving preview. LFM2.5 2.6B Base: a pretrained base checkpoint with no instruction tuning; 2.69B dense parameters; weights under the LFM Open License v1.0; 131,072-token context; no published evaluation, by design; obtained by downloading and fine-tuning.

คำตอบของ LFM2.5 2.6B Base: เปลี่ยนสเกล แต่คงสูตรเดิม

LFM2.5 2.6B Base คือการเดิมพันแบบที่ต่างออกไป มันคือสถาปัตยกรรมไฮบริดของ Liquid AI ในระดับเล็ก: 30 เลเยอร์ โดย 22 เลเยอร์เป็นบล็อก short-convolution แบบ dual-gated และ 8 เลเยอร์เป็นเลเยอร์ grouped-query-attention ฝึกบนข้อมูลราว 34 ล้านล้านโทเคนครอบคลุม 16 ภาษา พร้อมหน้าต่างบริบท 131,072 โทเคน เช็กพอยต์ทั้งหมดมีพารามิเตอร์แบบ dense 2.69B — เล็กพอจนบทสนทนาเรื่องต้นทุนไม่ใช่เรื่องจำนวนโทเคนอีกต่อไป แต่กลายเป็นเรื่องว่า GPU ตัวเดียวที่คุณมีเหลือว่างคือรุ่นไหน

สิ่งที่ทำให้มันไม่ธรรมดาคือสิ่งที่มันจงใจไม่ทำ ไม่มีการปรับแต่งด้วยคำสั่ง (instruction tuning) ซึ่งนั่นคือประเด็นทั้งหมดของคำต่อท้าย “Base”: ลองยื่นคำถามให้มัน แล้วมันจะต่อข้อความในสไตล์ของคำถามนั้นแทนที่จะตอบคำถามนั้น การ์ดโมเดลของ Liquid AI เองแนะนำให้ใช้กับงานที่ต้องอาศัยการปรับละเอียดอย่างหนัก นอกจากนี้ยังไม่มีการเผยแพร่ผลการประเมินมัน และนั่นไม่ใช่การละเลย — การประเมินเช็กพอยต์แบบ base ด้วยเบนช์มาร์กด้านการทำตามคำสั่งจะวัดอะไรไม่ได้เลย เพราะพฤติกรรมที่กำลังวัดนั้นยังไม่ได้รับการฝึกเข้ามา

ความต่าง โดยหนึ่งบรรทัดต่อมิติ

• มันคืออะไร — Ember-1: เวอร์ชันดัดแปลงที่ฝึกใหม่ของ Kimi K3 โดยมีการให้เหตุผลที่สั้นลง LFM2.5 2.6B Base: เช็กพอยต์ที่พรีเทรนตั้งแต่เริ่มต้นใหม่ โดยไม่มีการปรับจูนตามคำสั่ง

• พารามิเตอร์ — Ember-1: ไม่เปิดเผย; สืบทอดมาจาก Kimi K3. LFM2.5 2.6B Base: 2.69B แบบ dense

• น้ำหนักโมเดล — Ember-1: ไม่มีการเผยแพร่ LFM2.5 2.6B Base: มีให้ใช้งานภายใต้ LFM Open License v1.0

• ราคา — Ember-1: ไม่มีการเผยแพร่; จำนวนเงินดอลลาร์สำหรับการเปรียบเทียบจะใช้เรตการ์ดของ Kimi K3 LFM2.5 2.6B Base: ดาวน์โหลดฟรี; คุณต้องจัดห�าร์ดแวร์เอง

• บริบท — Ember-1: ไม่ได้เผยแพร่สำหรับพรีวิว LFM2.5 2.6B Base: 131,072 โทเคน

• การประเมินที่เผยแพร่ — Ember-1: เบนช์มาร์กเจ็ดรายการและการทดสอบ A/B สองรายการ ทั้งหมดดำเนินการโดยผู้ขาย LFM2.5 2.6B Base: ไม่มี โดยเจตนา

• สิ่งที่คุณได้รับในตอนท้าย — Ember-1: เอนด์พอยต์ที่สร้างการให้เหตุผลที่สั้นลงด้วยความแม่นยำระดับ K3. LFM2.5 2.6B Base: จุดเริ่มต้นที่มีพฤติกรรมเป็นอะไรก็ตามที่คุณฝึกให้มัน

การคิดถึงสองแบบที่แตกต่างกัน

ช่องว่างในสองรุ่นนี้ดูสมมาตรแต่ไม่ได้เป็นเช่นนั้น การประเมินที่ขาดหายไปของ LFM2.5 2.6B Base เป็นคุณสมบัติของอาร์ติแฟกต์: เช็คพอยต์ฐานไม่มีพฤติกรรมให้คะแนน และการปรับแต่งคำสั่งที่ขาดหายไปเป็นคุณสมบัติที่มีการบันทึกไว้มากกว่าจะเป็นข้อบกพร่อง การไม่มีอยู่ไม่ได้สร้างความไม่แน่นอนทางการค้า เพราะสิ่งที่คุณกำลังซื้อคือไฟล์ที่มีใบอนุญาตแนบมาด้วย และสิ่งที่ส่งมอบจะสมบูรณ์ทันทีที่การดาวน์โหลดเสร็จสิ้น

ชิ้นส่วนที่ขาดหายไปของ Ember-1 ยังคงไม่ได้รับการคลี่คลายอย่างแท้จริง ไม่มีราคาที่เผยแพร่ ดังนั้นข้ออ้างเรื่องต้นทุนจึงเป็นการคำนวณทางเลขคณิตบนเรตการ์ดของ Kimi K3 มากกว่าที่จะเป็นอัตราที่คุณใช้ตั้งงบได้ ไม่มีการปล่อยเวท ดังนั้นโมเดลจึงไม่สามารถอยู่ได้นานกว่าการตัดสินใจของเจ้าของผู้ให้บริการที่จะให้บริการต่อไป และหน้าต่างการเข้าถึงถูกอธิบายว่าเป็นแบบชั่วคราว: Fireworks Research กำหนดกรอบการเปิดตัวงานวิจัยของตนเป็นหน้าต่างแบบเซิร์ฟเวอร์เลสสองสัปดาห์ ซึ่งความถาวรขึ้นอยู่กับความต้องการของชุมชน พรีวิวที่อาจไม่มีอยู่ในเดือนหน้าเป็นข้อเสนอที่แตกต่างจากพรีวิวที่เพียงแค่ยังไม่ถูกพิสูจน์ และการทดสอบ A/B กับลูกค้ารายที่สองในประกาศ — โทเค็นต่องานลดลงราว 35% — บอกคุณว่าห้องแล็บคาดหวังอะไร ไม่ใช่สิ่งที่ยังจะเข้าถึงได้ในเดือนพฤศจิกายน

ความไม่สมมาตรนั้นคือคำตอบที่ตรงไปตรงมาต่อคำถามที่ว่า "ในบรรดาสิ่งเหล่านี้ อันไหนพร้อมมากกว่ากัน" ไม่มีอันใดพร้อมในความหมายของการเป็น dependency สำหรับโปรดักชันที่เสียบใช้ได้ทันที LFM2.5 2.6B Base เสร็จสมบูรณ์ในฐานะวัตถุดิบ แต่ยังไม่เสร็จสมบูรณ์ในฐานะโมเดล Ember-1 เสร็จสมบูรณ์ในฐานะโมเดล แต่ยังไม่เสร็จสมบูรณ์ในฐานะบริการ

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing 16,541 downloads in the last month, a safetensors model size of 3B parameters in BF16, the LFM1.0 licence, 16 languages, and a Model Details table listing LFM2.5-2.6B-Base as the pre-trained base model for fine-tuning alongside LFM2.5-2.6B for post-trained agentic workloads.

ทำอะไรกับแต่ละรายการในไตรมาสนี้

ถ้าคุณมีไปป์ไลน์ fine-tuning และงานเฉพาะทางที่มีเลเบลสะอาด LFM2.5 2.6B Base คือตัวที่คาดเดาได้ง่ายกว่าในสองตัวนี้ checkpoint มีขนาดเล็ก สัญญาอนุญาตเป็นแบบผ่อนปรน สถาปัตยกรรมถูกออกแบบมาให้มีประสิทธิภาพตอน inference และงานในการเปลี่ยนมันให้เป็นสิ่งที่มีประโยชน์ — supervised fine-tuning, ชุดประเมินผล, serving stack — เป็นงานที่คุณเป็นเจ้าของอยู่แล้วแบบครบวงจร ไม่ว่าทางไหนคุณก็จะรัน eval ของตัวเองอยู่ดี เพราะ Liquid AI ไม่ได้เผยแพร่อะไรเลย

หากคุณมีเวิร์กโหลดเอเจนต์แบบโฮสต์ที่ค่าใช้จ่ายถูกครอบงำด้วยโทเคนการให้เหตุผล Ember-1 จัดการกับพจน์จริงในสมการต้นทุนของคุณ และมันคุ้มค่ากับเวลาสองสัปดาห์ การทดสอบที่ถูกต้องคือการใช้ทราฟฟิกเงาเทียบกับระบบเดิมของคุณ ส่งคำขอจริงส่วนหนึ่งไปยังทั้งสองระบบ เปรียบเทียบเอาต์พุต และปล่อยผลลัพธ์สดไว้ตามเดิม นั่นก็เป็นคำแนะนำจากบทวิเคราะห์เชิงวิจารณ์อิสระเกี่ยวกับการเปิดตัวครั้งนี้เช่นกัน พร้อมคำเตือนที่ยุติธรรม — การบีบอัดการใคร่ครวญมีความเสี่ยงที่จะทำให้สูญเสียขั้นตอนที่โมเดลจำเป็นต้องใช้ และในเอเจนต์ สิ่งนั้นจะปรากฏในภายหลังเป็นการเรียกเครื่องมือที่ผิด มากกว่าจะเป็นประโยคที่ผิด

ไม่มีโมเดลใดอยู่บน OrcaRouter หากคุณต้องการทดสอบแพตเทิร์นนี้แทนที่จะทดสอบอาร์ติแฟกต์ทั้งสองชิ้นนี้ — โมเดลขนาดเล็กที่ปรับแต่งเพิ่มได้และตัวให้เหตุผลขนาดใหญ่ที่โฮสต์ไว้ในไปป์ไลน์เดียว — นั่นคือสิ่งที่ routing DSL มีไว้เพื่อพอดี: ประกอบโมเดลหลายตัวเข้าเป็นการเรียกครั้งเดียว และให้แต่ละตัวจัดการส่วนที่มันถนัด ภายใต้ คีย์เดียวและบิลเดียว การเปรียบเทียบในที่นี้คุ้มค่าที่จะทำในระดับสถาปัตยกรรม แม้ว่าปลายทางเฉพาะทั้งสองยังคงอยู่นอกเหนือการเข้าถึงก็ตาม

การค้าที่กล่าวไว้เพียงครั้งเดียว

Ember-1 ขายความแน่นอนด้านพฤติกรรมและความไม่แน่นอนด้านอุปทาน: โมเดลที่คุณภาพถูกถกเถียงกันอย่างรอบคอบ และความพร้อมใช้งานนั้นมีเงื่อนไขอย่างชัดเจน LFM2.5 2.6B Base ขายความแน่นอนด้านอุปทานและความไม่แน่นอนด้านพฤติกรรม: ไฟล์ที่คุณจะมีไว้เสมอ และความสามารถของมันขึ้นอยู่กับการฝึกที่คุณใส่ลงไปทั้งหมด ทีมที่มีปัญหาเรื่องการให้บริการและไม่มีความสามารถในการฝึก ควรจับตาดูพรีวิวและหวังว่ามันจะกลายเป็นถาวร ทีมที่มีความสามารถในการฝึกและมีงานเฉพาะแคบ ควรดาวน์โหลด base และเลิกคอยโรดแมปของใครก็ตาม

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

สิ่งที่การจับคู่นี้แสดงให้เห็นจริง ๆ คือ “ประสิทธิภาพ” ไม่ได้หมายถึงสิ่งเดียวอีกต่อไปแล้ว สำหรับ Ember-1 มันหมายถึงโทเค็นที่น้อยลงโดยได้คุณภาพเท่าเดิมบนฮาร์ดแวร์ของคนอื่น สำหรับ LFM2.5 2.6B Base มันหมายถึงโมเดลที่เล็กพอจนฮาร์ดแวร์ไม่ใช่ของคนอื่นอีกต่อไปเลย ทั้งสองอย่างนี้เป็นคำตอบที่ดีทั้งคู่ และใช้แทนกันไม่ได้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube