
LFM2.5-8B-A1B-DSpark เทียบกับ Qwen3-8B: ดราฟต์ที่เร่งความเร็วโมเดล สู้กับ 8B ที่ทุกคนรันกันอยู่แล้ว
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 145 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 182 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Liquid AI เปิดตัวดราฟต์เช็คพอยต์ LFM2.5-8B-A1B-DSpark เมื่อวันที่ 20 สิงหาคม 2026 — ตัวช่วย speculative decoding ที่มีพารามิเตอร์ 327.7M ซึ่งทำให้ LFM2.5-8B-A1B edge MoE สร้างผลลัพธ์ได้เร็วขึ้นสูงสุด 3.18× บน H100 ตัวเดียว ก่อนที่การเปรียบเทียบนี้จะยุติธรรมได้ ต้องวางข้อเท็จจริงหนึ่งข้อไว้บนโต๊ะ: เช็คพอยต์ DSpark ไม่ใช่โมเดลที่คุณเรียกใช้ได้โดยตรง มันทำหน้าที่เร่งความเร็วให้อีกโมเดลหนึ่งเท่านั้น ดังนั้นคำถามเรื่องการปรับใช้จริงที่การเปิดตัวครั้งนี้ตอบคือคำถามที่หลายทีมกำลังไตร่ตรองตลอดทั้งปี — ระหว่าง LFM2.5-8B-A1B กับ Qwen3-8B สองโมเดล open-weight ระดับ 8B ที่อยู่ในช่วงเวลาที่แตกต่างกันมากของชีวิต
กรอบการเปรียบเทียบในที่นี้สำคัญกว่าปกติ เพราะทั้งสองฝั่งไม่ใช่สิ่งประเภทเดียวกัน Qwen3-8B เป็นโมเดลที่สมบูรณ์และนำไปใช้งานได้จริง คุณสามารถโฮสต์ด้วยตนเองหรือซื้อโทเคนได้ตั้งแต่วันนี้ LFM2.5-8B-A1B ก็เป็นโมเดลที่สมบูรณ์และนำไปใช้งานได้เช่นกัน — ดราฟต์ DSpark เป็นส่วนเสริมของมัน ไม่ใช่เวอร์ชันหนึ่งของมัน ทุกสิ่งที่ดราฟต์สัญญาไว้ล้วนวัดผลโดยผู้ผลิตและเพิ่งเกิดขึ้นเมื่อวานนี้ ส่วนทุกอย่างที่เกี่ยวกับ repos และรูปแบบไฟล์นั้นมีไว้ให้ตรวจสอบได้โดยตรง บทความนี้แยกสองหมวดหมู่นี้ออกจากกันอย่างชัดเจน
ประการแรก คำว่า "DSpark" ไม่ใช่คำนามในประโยคนี้
การถอดรหัสเชิงคาดเดา (speculative decoding) รันโมเดลร่างต้นทุนต่ำล่วงหน้าไปก่อนโมเดลจริง: ตัวร่างทายโทเคนสองสามตัวถัดไป ส่วนโมเดลเป้าหมายตรวจสอบทั้งบล็อกในการ forward pass เพียงครั้งเดียว และยอมรับเฉพาะส่วนที่เห็นตรงกัน เมื่อการทายดี คุณจะได้โทเคนหลายตัวในราคาของการโหลดเวตเพียงรอบเดียว throughput จึงเพิ่มขึ้นโดยไม่ต้องแตะต้องเวตของโมเดลเป้าหมาย — และเพราะโมเดลเป้าหมายตรวจสอบทุกโทเคนที่ถูกเสนอ ผลลัพธ์ภายใต้ greedy decoding จึงเหมือนกับการรัน LFM2.5-8B-A1B เพียงลำพังทุกประการ Liquid เรียกสิ่งนี้ว่า "lossless by construction" ซึ่งเป็นเหตุผลทั้งหมดที่ทำให้การต่อร่าง (draft) เข้าไปนั้นปลอดภัย
LFM2.5-8B-A1B-DSpark ของ Liquid คือโมเดลร่าง (drafter) ที่จงใจออกแบบให้มีขนาดเล็ก: ประกอบด้วยห้าชั้นแบบ attention-only, บล็อกโทเคนที่เสนอเก้าตัวต่อขั้น และ Markov head เหนือคำศัพท์ 128,000 โทเคนของโมเดลเป้าหมาย โดยฝึก 15 epochs บนข้อมูลที่ผสมระหว่างแชท โค้ด และการเรียกฟังก์ชัน และเลือก checkpoint จากอัตราการยอมรับ (acceptance rate) มากกว่าค่า loss มันเป็นหนึ่งในสามโมเดลร่างที่ผู้ผลิตปล่อยออกมาในวันนั้น คู่กับ LFM2.5-1.2B-Instruct และ LFM2.5-2.6B โดยแต่ละตัวมาในรูปแบบ Safetensors และ GGUF พร้อมรองรับ SGLang และ llama.cpp ตั้งแต่วันแรกที่วางจำหน่าย และที่สำคัญสำหรับใครก็ตามที่อ่านการเปรียบเทียบกับโมเดลระดับ 8B: โมเดลนี้ไม่มีผู้ให้บริการ inference รายใดรองรับ และไม่มีราคาต่อโทเคน มันอยู่เฉพาะใน speculative-decoding stack ของคุณเองเท่านั้น

โมเดลทั้งสองที่นำไปใช้งานจริง
เมื่อลบฉบับร่างออกไป การเปรียบเทียบที่แท้จริงคือระหว่างโมเดลที่มันเร่งความเร็วกับโมเดลเดิมที่ครองตำแหน่งอยู่ ทั้งสองเป็นแบบ open-weight และมีขนาดประมาณคลาส 8B จากนั้นความคล้ายคลึงก็สิ้นสุดลงเพียงเท่านั้น:
• สถาปัตยกรรม — LFM2.5-8B-A1B เป็นโมเดล MoE แบบสปาร์ส (sparse MoE) ที่มีพารามิเตอร์รวม 8.3B แต่มีการใช้งานเพียง ~1.5B ต่อโทเคน ส่วน Qwen3-8B เป็นโมเดลแบบหนาแน่น (dense) ที่มีขนาด 8.2B ซึ่งเปิดใช้งานพารามิเตอร์ทั้งหมดในทุกโทเคน
• การเปิดตัว — LFM2.5-8B-A1B วางจำหน่ายเมื่อวันที่ 28 พฤษภาคม 2026 ส่วน Qwen3-8B วางจำหน่ายเมื่อเดือนเมษายน 2025 และมีอายุเกินหนึ่งปีแล้ว ถูกเลิกใช้งานบนแพลตฟอร์มที่ให้บริการบางแห่งแล้ว
บริบท — LFM2.5-8B-A1B รองรับบริบทเนทีฟ 128K พร้อมคลังคำศัพท์ 128K โทเคน; Qwen3-8B รองรับ 32K แบบเนทีฟ ขยายได้ถึงประมาณ 128K ผ่าน YaRN
• การให้เหตุผล — LFM2.5-8B-A1B เป็นโมเดลการให้เหตุผลที่แสดงห่วงโซ่ความคิดอย่างชัดเจน; Qwen3-8B สลับระหว่างโหมดคิดและโหมดไม่คิดตามคำขอ
• ความฉลาด — ตามข้อมูลจาก Artificial Analysis, LFM2.5-8B-A1B ได้คะแนน Intelligence Index เท่ากับ 8 และ Qwen3-8B ได้ 8–8.3 ซึ่งทั้งคู่ต่ำกว่าค่ามัธยฐานที่ 9 สำหรับโมเดลโอเพนเวตที่เทียบเคียงได้; ไม่มีตัวใดเป็นสมองระดับแนวหน้า และทั้งคู่ก็ซื่อสัตย์ในเรื่องนี้
• ความเร็ว — ตามข้อมูลจาก Artificial Analysis, LFM2.5-8B-A1B ให้ผลลัพธ์ประมาณ 340 โทเคนต่อวินาทีในผู้ให้บริการทุกราย; ส่วน Qwen3-8B อยู่ที่ประมาณ 37–40 โทเคนต่อวินาที ซึ่งถือว่าอยู่ในกลุ่มที่ช้าที่สุดในคลาสเดียวกัน
• สัญญาอนุญาต — LFM2.5-8B-A1B อยู่ภายใต้ LFM Open License ของ Liquid เวอร์ชัน 1.0; Qwen3-8B อยู่ภายใต้ Apache-2.0

ความเร็วคือจุดที่ทำให้เรื่องนี้ไม่สูสีอีกต่อไป
เหตุผลที่ใหญ่ที่สุดที่ทำให้การสนทนาในวงการโมเดล open-weight ระดับ 8B ขยับไปคือความเร็วต่อหน่วยหน่วยความจำ Qwen3-8B เป็นโมเดลแบบ dense: ทุกโทเคนที่มันผลิตออกมาจะต้องส่งน้ำหนักทั้งหมด 8.2B ผ่านบัสหน่วยความจำ ซึ่งเป็นเหตุผลว่าทำไมมันถึงช้าสำหรับขนาดของมัน และทำไมมันถึงต้องใช้ VRAM จริง LFM2.5-8B-A1B ส่งทุกโทเคนผ่านพารามิเตอร์ที่ทำงานอยู่ประมาณ 1.5B ซึ่งเป็นจุดออกแบบหลักทั้งหมด — MoE บนอุปกรณ์ที่คงความเร็วและมีขนาดเล็ก การอ้างสิทธิ์ของ Liquid เองไปไกลกว่านั้น: ประมาณ 253 โทเคนต่อวินาทีบน CPU M5 Max ภายใต้หน่วยความจำ 6GB ตามที่ผู้จำหน่ายรายงาน สำหรับปริมาณงานดิบของโมเดลที่ปรับใช้ได้จริง โมเดลดราฟต์ไม่ได้มีความสำคัญในส่วนนี้ของเรื่องด้วยซ้ำ — MoE เร็วกว่าโมเดล dense ระดับ 8B หลายเท่าอยู่แล้วก่อนที่จะเพิ่ม speculation
ในเรื่องราคา ทั้งสองเป็น open weights ดังนั้นการโฮสต์เองก็มีค่าใช้จ่ายตามต้นทุนฮาร์ดแวร์ของคุณ การเปรียบเทียบแบบโฮสต์ไม่สมดุลในด้านความพร้อมให้บริการ: Qwen3-8B ให้บริการผ่าน API ของ Alibaba ในราคาที่กำหนดไว้ที่ $0.18 ต่อล้าน input tokens และ $2.10 ต่อล้าน output tokens และยังมีผู้ให้บริการโฮสต์ open-model จากบุคคลที่สามอีกหลายราย; LFM2.5-8B-A1B ไม่มีราคาโฮสต์ token จากผู้ผลิตโดยตรงที่โดดเด่น และ draft ก็ไม่มีเลย ซึ่งหมายความว่าวิธีที่ใช้งานได้จริงสำหรับทีมส่วนใหญ่ในการรัน Liquid's edge MoE ในปัจจุบันคือการโฮสต์เอง บนแล็ปท็อป อุปกรณ์ edge หรือ GPU ที่เป็นของตัวเอง — และนั่นคือสภาพแวดล้อมที่ DSpark draft กลายเป็นตัวแปรที่เกี่ยวข้อง
ร่างดังกล่าวเปลี่ยนแปลงอะไรจริง ๆ สำหรับการตัดสินใจนี้
โมเดลดราฟต์เปลี่ยนแปลงเพียงแกนเดียวเท่านั้น: ความเร็วที่ LFM2.5-8B-A1B สร้างโทเคนในสแตกการให้บริการที่คุณควบคุมได้ มันไม่ได้ทำให้โมเดลฉลาดขึ้น และไม่ได้เปลี่ยนสิ่งที่โมเดลตอบ — ผลลัพธ์แบบ greedy นั้นเหมือนกันทุกบิตกับโมเดลเป้าหมายเพียงลำพัง จุดที่ช่วยได้คือการให้บริการ GPU ที่ปริมาณงานต่อคำขอเดียว: Liquid วัดค่าเฉลี่ยได้ 2.54 เท่าบน H100 ตัวเดียวจากห้าเบนช์มาร์ก (418 → 1,074 โทเคนต่อวินาที) โดยค่าที่ดีที่สุดคือ 3.18 เท่าบน MATH500 ที่ขนาดแบตช์ 1 และอุณหภูมิ 0 จุดที่แทบไม่ช่วยคือ Apple silicon: โมเดลเดียวกันนี้ได้ค่าเฉลี่ยเพียง 1.18 เท่าบน M4 Max (90 → 106 tok/s) เพราะการตรวจสอบบล็อกของดราฟต์โทเคนกระตุ้นผู้เชี่ยวชาญใน Metal MoE backend ปัจจุบันของ llama.cpp มากขึ้นและเพิ่มการเคลื่อนย้ายน้ำหนัก — ซึ่งเป็นต้นทุนที่ speculative decoding ตั้งใจจะเฉลี่ยออกมา ตัวเลขทั้งหมดนี้เป็นตัวเลขจากผู้จำหน่ายในวันเปิดตัว ไม่ได้ผ่านการทดสอบซ้ำโดยอิสระ
การแบ่งแยกนั้นสอดคล้องโดยตรงกับกฎการตัดสินใจ หากคุณให้บริการ LFM2.5-8B-A1B บน GPU ที่คุณเป็นเจ้าของ ดราฟต์ถือเป็นกลไกด้านต้นทุนที่แท้จริง — ให้โทเค็นต่อวินาทีมากกว่าราว 2.5 เท่าจากซิลิคอนตัวเดียวกัน โดยที่ผลลัพธ์ไม่เปลี่ยนแปลง และคุณเพียงแค่ต้องมีบิลด์ที่มีการผสานรวม DSpark วันที่ 20 สิงหาคม ในทางกลับกัน หากคุณเรียกใช้โมเดลผ่าน API ผู้ให้บริการจะเป็นผู้ได้ประโยชน์จากความเร็วที่เพิ่มขึ้น และดราฟต์ก็ไม่เกี่ยวข้องกับคุณ และหากอุปกรณ์เป็นแล็ปท็อปหรือโทรศัพท์ ดราฟต์สำหรับโมเดลเฉพาะนี้แทบจะไม่มีผลในปัจจุบัน ดราฟต์คู่หูสำหรับโมเดล dense อย่าง LFM2.5-1.2B-Instruct และ LFM2.5-2.6B ต่างหากที่มีชัยชนะบนอุปกรณ์ ที่ 2.54 เท่าและ 2.27 เท่าตามลำดับ ในส่วนของ Qwen3-8B ไม่ต้องใช้ดราฟต์เลย — มันเป็นเพียงโมเดลที่ช้ากว่าและหนาแน่นกว่า ซึ่งไม่จำเป็นต้องใช้การถอดรหัสแบบคาดการณ์เพื่อให้สามารถนำไปใช้งานได้

ทางเลือก หนึ่งปีในชีวิตของ Qwen3-8B
Qwen3-8B คือค่าเริ่มต้นที่ถูกต้องแต่น่าเบื่อ: โตเต็มที่, Apache-2.0, รองรับ 119 ภาษา, โหมดคิดและไม่คิด, ให้บริการได้ทุกที่ และยังคงเป็นตัวเลือกอเนกประสงค์ที่ดีสำหรับแชท โค้ด และข้อความที่มีโครงสร้าง ปัญหาของมันคืออายุและความเร็ว — โมเดล 8B แบบ dense ที่มีอายุ 16 เดือน ซึ่งช้าเมื่อเทียบกับระดับเดียวกัน และถูกเลิกใช้งานบนบางแพลตฟอร์มแล้ว ซึ่งเป็นสัญญาณด้านการบำรุงรักษาที่ควรพิจารณาอย่างจริงจัง หากคุณกำลังเริ่มโปรเจกต์ใหม่ในวันนี้
LFM2.5-8B-A1B คือการเดิมพันที่ใหม่กว่าและแคบกว่า: โมเดล MoE แบบ edge-first ที่สร้างขึ้นสำหรับการเรียกใช้เครื่องมือและการทำตามคำสั่งด้วยความเร็วบนฮาร์ดแวร์สำหรับผู้บริโภค โดยมี DSpark draft เป็นตัวเสริมการให้บริการทางเลือกสำหรับกรณีที่โฮสต์ GPU ด้วยตนเอง มันไม่ใช่โมเดลที่ฉลาดกว่า — ทั้งคู่อยู่ต่ำกว่าค่ามัธยฐานของ open-weights บน Artificial Analysis — แต่มันเร็วกว่าอย่างเห็นได้ชัด โดยใช้หน่วยความจำต่อโทเค็นเพียงเศษเสี้ยว ซึ่งเป็นการแลกเปลี่ยนที่สำคัญสำหรับเอเจนต์ที่ทำงานบนอุปกรณ์ ข้อควรระวังของมันคือภาพสะท้อนของ Qwen3-8B: เผยแพร่ใหม่กว่า ไม่มีราคาโฮสต์จากฝั่งผู้ผลิตเอง และเรื่อง speculative decoding ที่ตัวเลขยังไม่มีใครนอกเหนือจากผู้จำหน่ายสามารถทำซ้ำได้เลย
ชั้นการจัดเส้นทางที่อยู่ข้างใต้ยังคงเหมือนเดิมไม่ว่าจะด้วยวิธีใด ทั้ง LFM2.5-8B-A1B และ Qwen3-8B ต่างก็ไม่อยู่ในแคตตาล็อกโฮสต์ของ OrcaRouter ในขณะนี้ ดังนั้นกรอบการมองที่ตรงไปตรงมาก็คือสิ่งที่เราเตอร์ทำสำหรับชุดโมเดลผสมนี้: API เดียวครอบคลุมโมเดลโฮสต์มากกว่า 200 รายการ โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านด้วยมาร์กอัป 0% ดังนั้นการลดราคาของผู้ให้บริการจึงมีผลบนแพลตฟอร์มในวันเดียวกับที่ประกาศ; การเฟลโอเวอร์อัตโนมัติ เพื่อให้โมเดลใหม่ที่ยังไม่ผ่านการพิสูจน์เป็นสิ่งที่คุณลองใช้กับทราฟฟิกจริง มากกว่าที่จะเดิมพันกับเส้นทางการผลิต; และ DSL สำหรับการจัดเส้นทางที่สามารถนำหน้าโมเดลที่คุณให้บริการด้วยตนเองได้ ซึ่งเป็นวิธีที่สแตก LFM2.5-8B-A1B ที่โฮสต์ด้วยตนเองอยู่ร่วมกับเอนด์พอยต์โฮสต์ภายใต้คีย์เดียว
ถ้าคุณกำลังพัฒนาเพื่อแล็ปท็อปหรืออุปกรณ์เอจ (edge box) และให้ความสำคัญกับความเร็วในการเรียกใช้เครื่องมือ LFM2.5-8B-A1B คือทิศทางที่ควรทดสอบ และโมเดลดราฟต์ให้ความเร็วเพิ่มขึ้น 2.5 เท่าโดยไม่เสียค่าใช้จ่ายบนเส้นทางการให้บริการ GPU เมื่อถึงเวลา หากคุณต้องการโมเดลเอนกประสงค์ที่คิดแล้ววางใจได้ Qwen3-8B ก็ยังใช้งานได้ — เพียงรู้ไว้ว่านี่คือโมเดลจากต้นปี 2025 ที่ระบบนิเวศกำลังเริ่มเลิกใช้ สิ่งหนึ่งที่ทั้งดราฟต์และโมเดลเป้าหมายไม่ได้เปลี่ยนแปลงคือสถานะที่ตรงไปตรงมาของหลักฐาน: ทุกอย่างที่เร็วเกี่ยวกับการเปิดตัว DSpark คือการวัดผลจากผู้จำหน่ายรายเดียวในวันเดียว และเกณฑ์วัดอิสระคือประเด็นที่ค้างอยู่ซึ่งจะเป็นตัวตัดสินว่าคุณควรเชื่อถือสิ่งนี้มากแค่ไหน
