
LFM2.5-8B-A1B-DSpark เทียบกับ LFM2.5-2.6B-Base: ความเร็วเทียบกับวัตถุดิบ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 144 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
เมื่อจัดเรียงตระกูล LFM2.5 ตามสิ่งที่แต่ละ checkpoint ทำได้ด้วยตัวเอง LFM2.5-8B-A1B-DSpark และ LFM2.5-2.6B-Base จะอยู่คนละปลายสุดของเส้น — และทั้งสองปลายต่างก็ไม่สามารถตอบคำถามได้ ตัวแรกเป็นโมเดล draft ที่มีพารามิเตอร์ 327.7M ซึ่งมีไว้เพื่อทำให้โมเดล mixture-of-experts สำหรับ edge ของ Liquid AI สร้าง token ได้เร็วขึ้นเท่านั้น ตัวที่สองเป็น checkpoint ดิบที่ผ่านการ pre-trained ขนาด 2.69B พารามิเตอร์ ซึ่งมีไว้เพื่อนำไป fine-tune เป็นอย่างอื่นเท่านั้น ทั้งคู่เปิดตัวในเดือนสิงหาคม 2026 ภายใต้ LFM Open License v1.0 ของ Liquid และทั้งคู่ก็ห่างแค่การดาวน์โหลดครั้งเดียวบน Hugging Face และทั้งคู่ก็ง่ายมากที่จะเผลอดาวน์โหลดผิดตัว — เพราะชื่อของพวกมันทำให้ฟังดูเหมือนเป็นสองเวอร์ชันของสิ่งเดียวกัน
ชื่อเหล่านี้คือกับดัก "DSpark" ฟังดูเหมือนเรือธงใหม่ที่เปล่งประกายของตระกูล ส่วน "Base" ฟังดูเหมือนค่าเริ่มต้นธรรมดา ๆ ที่คุณรันได้จริง ทั้งคู่ไม่เป็นความจริง checkpoint ของ DSpark ไม่สามารถตอบอะไรได้ด้วยตัวเอง — มันแค่เสนอโทเคนให้ LFM2.5-8B-A1B ตรวจสอบ ส่วน Base ก็ตอบอะไรไม่ได้เช่นกัน แต่ด้วยเหตุผลตรงกันข้าม — มันคือฐานที่ไม่ได้ปรับจูนซึ่งคาดเดาข้อความได้ แต่ไม่เคยถูก post-training ให้เป็นโมเดลแชทหรือเอเจนต์ นี่ไม่ใช่การแข่งขัน — แต่มันคือไปป์ไลน์ checkpoint หนึ่งอยู่ที่ปลายสุดของสแตกการให้บริการ ส่วนอีกอันอยู่ที่จุดเริ่มต้นสุดของการเทรนนิ่งรัน
จุดตรวจสองแห่งที่มีชื่อเดียวกัน ไม่ใช้งาน
LFM2.5-8B-A1B-DSpark (เผยแพร่เมื่อวันที่ 20 สิงหาคม ค.ศ. 2026) เป็นโมเดลร่างสำหรับการถอดรหัสแบบคาดการณ์ล่วงหน้า (speculative-decoding draft model): เครือข่ายแบบ attention เพียงห้าชั้น, บล็อกโทเค็นที่เสนอจำนวนเก้าตัวต่อขั้นตอน, และหัวแบบมาร์คอฟ (Markov head) ครอบคลุมคลังคำศัพท์ 128,000 โทเค็นของโมเดลเป้าหมาย คุณโหลดมันคู่กับ LFM2.5-8B-A1B — MoE ที่มีพารามิเตอร์รวม 8.3B และทำงานจริง ~1.5B ซึ่งวางจำหน่ายไปเมื่อวันที่ 28 พฤษภาคม — โดยโมเดลร่างจะเดาโทเค็นสองสามตัวถัดไป และโมเดลเป้าหมายจะตรวจสอบทั้งบล็อกในฟอร์เวิร์ดพาสเดียว แล้วเก็บเฉพาะที่มันยอมรับ เนื่องจากโมเดลเป้าหมายตรวจสอบทุกโทเค็น ผลลัพธ์ภายใต้ greedy decoding จึงเหมือนกันกับการรัน LFM2.5-8B-A1B เพียงลำพัง: "ไม่สูญเสียโดยการออกแบบ" ในวลีของ Liquid โมเดลร่างเป็นส่วนที่เพิ่มความเร็ว ไม่ใช่สมอง มันถูกเผยแพร่พร้อมกับโมเดลร่างพี่น้องสำหรับ LFM2.5-1.2B-Instruct และ LFM2.5-2.6B โดยแต่ละตัวมาในรูปแบบ Safetensors และ GGUF พร้อมการรองรับตั้งแต่วันแรกใน SGLang และ llama.cpp
LFM2.5-2.6B-Base (เผยแพร่เมื่อวันที่ 4 สิงหาคม 2026) เป็นปลายอีกด้านหนึ่งของไปป์ไลน์: โมเดลพื้นฐานขนาด 2.69B พารามิเตอร์ ในโครงสร้างแบบไฮบริด 30 ชั้น — 22 บล็อก double-gated short-convolution บวก 8 บล็อก grouped-query attention — ผ่านการ pretrain ด้วยโทเคนประมาณ 34 ล้านล้านโทเคน พร้อมช่วง mid-training ที่ขยายบริบทเป็น 128K มันไม่มีแชทเทมเพลต ไม่มีการปรับแต่งด้วยคำสั่ง และไม่มีการเผยแพร่ benchmark และการ์ดโมเดลของ Liquid เองแนะนำให้ใช้เพื่อการ fine-tuning อย่างละเอียดเท่านั้น จุดประสงค์ทั้งหมดของมันคือการเป็นวัตถุดิบที่ไปป์ไลน์หลังการฝึกอบรม 4 ขั้นตอน — การ SFT 2 รอบ, การทำ teacher specialization, การกลั่นแบบ on-policy, จากนั้นจึงเป็นการเรียนรู้เสริมแรงแบบ agentic — จะเปลี่ยนให้กลายเป็นเอเจนต์เรียกใช้เครื่องมือ LFM2.5-2.6B ตระกูลเดียวกัน ไลเซนส์เดียวกัน หน้าดาวน์โหลดเดียวกัน แต่หน้าที่ต่างกันโดยสิ้นเชิง
เคียงข้างกัน: เจ็ดมิติ สองงาน
เนื่องจากจุดตรวจทั้งสองทำหน้าที่ต่างกัน การเปรียบเทียบอย่างตรงไปตรงมาจึงรักษาบทบาทของทั้งสองฝ่ายให้ถูกต้อง:
• มันคืออะไร — {{1}}LFM2.5-8B-A1B-DSpark{{/1}} คือโมเดลดราฟต์สำหรับ speculative decoding ขนาด {{2}}0.3B{{/2}} ส่วน {{3}}LFM2.5-2.6B-Base{{/3}} คือโมเดลพื้นฐานที่ผ่านการ pre-train แบบดิบขนาด {{4}}2.69B{{/4}}
• มันทำงานร่วมกับอะไร — DSpark draft จับคู่กับ LFM2.5-8B-A1B MoE (รวม 8.3B, ทำงาน ~1.5B ต่อ token); ส่วน Base รันด้วยตัวเอง แต่เป็นเพียงการทำนายข้อความที่ไม่ผ่านการปรับแต่ง (untuned text prediction) เท่านั้น
• การใช้งานแบบสแตนด์อโลน — DSpark ไม่ได้สร้างอะไรด้วยตัวเอง มันเพียงเร่งความเร็วให้กับเป้าหมายเท่านั้น Base สร้างข้อความแต่ไม่มีพฤติกรรมผลิตภัณฑ์ที่เป็นประโยชน์ — ไม่มีการทำตามคำสั่ง ไม่มีการเรียกใช้เครื่องมือ ไม่มีเทมเพลตแชท
• คุณภาพของเอาต์พุต — DSpark สืบทอดเอาต์พุตแบบ greedy ที่ตรงกับเป้าหมายทุกประการ เนื่องจากทุกโทเค็นที่เสนอนั้นถูกตรวจสอบยืนยัน; ส่วน Base ไม่มีเกณฑ์มาตรฐานที่เผยแพร่ในงานใดๆ เลย โดยการออกแบบ
• ความเร็ว — DSpark เพิ่มค่าเฉลี่ยที่วัดโดยผู้จำหน่ายที่ 2.54× บน H100 (สูงสุด 3.18× บน MATH500) และ 1.18× บน M4 Max เข้าไปในเป้าหมายของตน ซึ่งยังไม่มีการทำซ้ำ; Base ไม่ได้อ้างความเร็วในการอนุมานแต่อย่างใด
• รอยเท้าหน่วยความจำ — DSpark เพิ่มน้ำหนักร่างประมาณ 0.3GB ข้างๆ เป้าหมาย; Base คือ 2.69B เต็มรูปแบบ รันได้ในต่ำกว่า 2.5GB ซึ่งเป็นพื้นฐานที่จริงจังที่เล็กที่สุดในตระกูล
• รูปแบบและความพร้อมใช้งาน — DSpark มาพร้อมกับรูปแบบ Safetensors และ GGUF โดยรองรับ SGLang และ llama.cpp ตั้งแต่วันแรกที่เปิดตัว ส่วน Base มาพร้อมกับ Safetensors รวมถึง GGUF, ONNX และ MLX และทำงานบน Transformers, vLLM, SGLang, llama.cpp และ MLX ปัจจุบันยังไม่มีผู้ให้บริการ inference ใดให้บริการทั้งสองรุ่นนี้ — ทั้งคู่เป็น checkpoint ที่ต้องโฮสต์ด้วยตัวเอง

ตัวเลขเพียงชุดเดียวในการแข่งขันนี้มาจากห้องปฏิบัติการแห่งเดียว
สิ่งที่เป็นตัวเลขทั้งหมดในที่นี้เป็นการวัดจากผู้ขายรายเดียว ซึ่งวัดในวันที่เผยแพร่ร่างและยังไม่มีการทำซ้ำโดยอิสระ — ควรอ่านว่าเป็นสิ่งที่น่าจะเป็นไปได้ ยังไม่ได้รับการยืนยัน Liquid วัด LFM2.5-8B-A1B-DSpark ที่ batch size 1, temperature 0, บน H100 ขนาด 80GB ตัวเดียว ในรูปแบบ BF16 ภายใต้ SGLang และบน MacBook Pro รุ่น M4 Max ในรูปแบบ FP16 GGUF ภายใต้ Metal kernels แบบทดลองของ llama.cpp บน H100 คู่ดังกล่าวเฉลี่ย 2.54× (418 → 1,074 โทเคนต่อวินาที) โดยผลลัพธ์เดียวที่ดีที่สุดคือ 3.18× บน MATH500 (428 → 1,362 tok/s) และอัตราการยอมรับเฉลี่ยประมาณ 7 จาก 10 โทเคนที่เสนอ บน M4 Max คู่เดียวกันเฉลี่ยเพียง 1.18× (90 → 106 tok/s) — ซึ่งเป็นกรณีขอบบนอุปกรณ์ที่ Liquid เองก็ชี้ไว้ เนื่องจากการตรวจสอบบล็อกจะเปิดใช้งานผู้เชี่ยวชาญ (experts) มากขึ้นในแบ็กเอนด์ MoE Metal ปัจจุบัน และย้ายปริมาณน้ำหนัก (weight) ข้ามบัสหน่วยความจำมากขึ้น
ฝั่ง Base ของแมตช์อัปนี้ไม่มีตัวเลขใดๆ เลย และการที่ไม่มีตัวเลขนั้นเองคือสเปกของมัน LFM2.5-2.6B-Base ผ่านการ pre-train มา ไม่ใช่ post-train และไม่เคยถูกประเมินสำหรับการแชท การใช้เครื่องมือ หรือพฤติกรรมของ agent เพราะไม่มีใครตั้งใจจะนำไปใช้ในลักษณะนั้น ตัวเลขที่มีความหมายของมันคือเชิงสถาปัตยกรรม: พารามิเตอร์ 2.69B, บริบท 128K, tokenizer รองรับ 16 ภาษา, ใช้หน่วยความจำไม่ถึง 2.5GB ในการรัน คุณไม่วัดประสิทธิภาพของรากฐาน คุณวัดประสิทธิภาพของสิ่งที่คุณนำไป fine-tune ให้กลายเป็นต่างหาก
มีความประชดในตระกูลหนึ่งที่ควรเอ่ยถึงก่อนที่คุณจะตัดสินใจอะไร ร่างที่บทความนี้พูดถึง — ร่างสำหรับ 8B-A1B — คือร่างที่ได้ประโยชน์น้อยที่สุดบนแล็ปท็อป (1.18×) ในขณะที่ร่างพี่น้องสำหรับตระกูล 2.6B ซึ่งเร่งความเร็วให้พี่น้องหลังการฝึกของ Base ตัวนี้เอง เฉลี่ย 2.27× บน M4 Max พร้อมลดความหน่วงของการเรียกใช้ฟังก์ชันหลายเครื่องมือลง 57% หากอุปกรณ์ที่เป็นปัญหาเป็นโทรศัพท์หรือแล็ปท็อป มากกว่ากล่อง GPU เส้นทาง 2.6B คือที่ที่เรื่องราวความเร็วอาศัยอยู่

แล้วจะดาวน์โหลดอันไหน?
คุณไม่จำเป็นต้องเลือกระหว่างสองสิ่งนี้โดยตรง เพราะมันไม่ใช่ทางเลือก — แต่คุณจำเป็นต้องรู้ว่าคุณกำลังทำหน้าที่ไหน:
หากคุณให้บริการ LFM2.5-8B-A1B บน GPU ที่คุณเป็นเจ้าของ และต้องการโทเคนต่อวินาทีมากขึ้นจากซิลิคอนตัวเดิม LFM2.5-8B-A1B-DSpark คือส่วนเสริมที่ย้อนกลับได้: สร้าง SGLang หรือ llama.cpp ด้วยการผสาน DSpark วันที่ 20 สิงหาคม ระบุชื่อ draft ในคำสั่งเปิดใช้ คงการถอดรหัสแบบ greedy ไว้ และขนาดบล็อกจะถูกอ่านจากคอนฟิกของ draft โดยอัตโนมัติ ข้อดีคือปริมาณงานเพิ่มขึ้นประมาณ 2.5 เท่า โดยผลลัพธ์ไม่เปลี่ยนแปลงเลย ข้อเสียคือน้ำหนักเพิ่ม 0.3GB และบิลด์ที่ใหม่พอที่จะมี PRs เหล่านั้นอยู่ หากลบแฟล็ก speculative สองตัวออก คุณก็กลับไปที่เป้าหมายธรรมดา
ถ้าคุณต้องการสร้างผู้เชี่ยวชาญของคุณเอง — โมเดลเฉพาะโดเมน, ผู้ช่วยภาษาที่กำหนดเอง, หรือการ fine-tune บนข้อมูลเฉพาะขององค์กร — LFM2.5-2.6B-Base คือจุดเริ่มต้นที่จริงจังและคุ้มค่าที่สุดจุดหนึ่งในระบบนิเวศโอเพนเวต: 2.6B, ใช้พื้นที่ต่ำกว่า 2.5GB, รองรับบริบท 128K, และโทเคไนเซอร์หลายภาษา เช็คพอยต์ DSpark ไม่สามารถช่วยคุณในเรื่องนั้นได้เลย เพราะมันไม่ใช่โมเดลฐาน
หากคุณต้องการเอเจนต์บนอุปกรณ์ของ Liquid จริงๆ — การเรียกใช้เครื่องมือ งานหลายขั้นตอน — แสดงว่าคุณไม่ต้องการทั้งสองอย่างนี้ คุณต้องการ LFM2.5-2.6B ที่ผ่านการ post-train และคุณสามารถตัดสินใจภายหลังได้ว่าจะเพิ่ม draft ของตัวเองหรือไม่ Base คือวัตถุดิบสำหรับคนที่ต้องการฝึก; draft 8B-A1B คือชิ้นส่วนความเร็วสำหรับคนที่ปรับใช้ MoE อยู่แล้ว การเคลื่อนไหวที่ผิดคือการดาวน์โหลด Base เพราะคุณต้องการเอเจนต์ที่เร็วขึ้น หรือดาวน์โหลดตัว draft เพราะคุณต้องการพื้นฐานสำหรับการฝึก

จุดที่ทั้งสองเชื่อมต่อกัน — และตำแหน่งของเราเตอร์
เช็คพอยต์ทั้งสองเป็นกรณีของการโฮสต์ด้วยตนเอง ตัว draft เป็นส่วนเสริมในเลเยอร์การให้บริการที่มีอยู่ภายในสแตก SGLang หรือ llama.cpp ของคุณเองเท่านั้น ส่วน Base เป็นอาร์ติแฟกต์จากการฝึก ทั้งคู่ไม่ปรากฏในแคตตาล็อกโฮสต์ใดๆ และไม่มีราคาป้ายต่อโทเค็น ในทางปฏิบัติแล้ว นั่นหมายความว่าไม่ว่าคุณจะเลือกเส้นทางไหน มันก็จะไปอยู่ข้างๆ โมเดลโฮสต์ที่คุณเรียกใช้อยู่แล้ว และการผสมผสานแบบนั้นคือโครงสร้างพื้นฐานที่เลเยอร์การจัดเส้นทางมีไว้เพื่อยุบรวมให้หายไป
ในฝั่งเซิร์ฟวิ่ง เศรษฐศาสตร์ของดราฟต์นั้นเรียบง่ายและเป็นจริง: โทเค็นต่อวินาทีที่เพิ่มขึ้น 2.5 เท่าจาก GPU ตัวเดียวกัน หมายถึงเวลาในการประมวลผลที่ลดลง 2.5 เท่า และใช้ GPU น้อยลงประมาณ 2.5 เท่าสำหรับเวิร์กโหลดเท่าเดิม โดยที่คุณภาพไม่เปลี่ยนแปลง แต่กลไกนั้นจะเกิดขึ้นได้ก็ต่อเมื่อคุณเป็นเจ้าของอินเฟอเรนซ์เท่านั้น เมื่อใดก็ตามที่คุณเรียกใช้ 8B-A1B ผ่าน API ผู้ให้บริการจะเก็บความเร็วที่เพิ่มขึ้นนั้นไว้เอง — ซึ่งเป็นจุดที่การเปรียบเทียบในฝั่ง API กลายเป็นสิ่งที่สำคัญ: ผู้ให้บริการคิดค่าบริการเท่าไร และการลดราคาจะถึงมือคุณในวันเดียวกับที่ประกาศหรือไม่ นั่นคือจุดประสงค์ของพาส-ทรูเราเตอร์ (pass-through router): API เดียวที่ครอบคลุมโมเดลกว่า 200 รุ่น ราคารายการของผู้ให้บริการถูกส่งผ่านโดยไม่มีการบวกเพิ่ม (0% markup) ดังนั้นการลดราคาจากผู้ขายจึงมีผลกับคุณทันที พร้อมระบบเฟลโอเวอร์อัตโนมัติ เพื่อไม่ให้ความหน่วงที่พุ่งสูงของผู้ให้บริการรายหนึ่งกลายเป็นความหน่วงของคุณเอง คุณยังสามารถวางสแตก LFM ที่โฮสต์เองไว้ด้านหน้าเอนด์พอยต์เดียวกันได้ ซึ่งเป็นวิธีทดลองโมเดลดราฟต์ใหม่เอี่ยมกับทราฟฟิกจริงโดยไม่ต้องเดิมพันเส้นทางการผลิตไปกับมัน
LFM2.5-8B-A1B-DSpark และ LFM2.5-2.6B-Base ใช้ชื่อตระกูลเดียวกันแต่มีหน้าที่ตรงข้ามกัน: ตัวหนึ่งเป็นชิ้นส่วนเร่งความเร็วที่ต่อพ่วงกับ MoE แบบ edge ส่วนอีกตัวเป็นสมองที่ยังไม่ได้ปรับแต่งซึ่งเอเจนต์ 2.6B เติบโตมาจาก ไม่มีตัวใดทำงานได้ด้วยตัวเอง เลือก drafter เพื่อเร่ง MoE ที่คุณให้บริการบน GPU อยู่แล้ว เลือก Base เพื่อ fine-tune รากฐานขนาด 2.6B ให้กลายเป็นโมเดลของคุณเอง และข้ามทั้งสองตัวไปหากสิ่งที่คุณต้องการคือเอเจนต์ที่ใช้งานได้จริง — เพราะสิ่งเดียวที่ checkpoint ทั้งสองมีร่วมกันคือ ไม่มีตัวใดเลยที่ตัวมันเองจะทำอะไรที่คุณนำไปใช้ได้
คำถามที่พบบ่อย
ฉันสามารถรัน LFM2.5-8B-A1B-DSpark ด้วยตัวมันเองได้ไหม?
ไม่ มันเป็นโมเดลร่างที่ไม่มีเอาต์พุตแบบสแตนด์อโลน — มันเสนอโทเคนตัวเลือกที่โมเดลเป้าหมาย LFM2.5-8B-A1B ตรวจสอบในภายหลัง ดังนั้นมันจึงมีอยู่เฉพาะในสแตกการให้บริการแบบ speculative-decoding ที่สร้างขึ้นจากการผสานรวม SGLang หรือ llama.cpp เมื่อวันที่ 20 สิงหาคม การดาวน์โหลดมันเพียงอย่างเดียวไม่ได้ให้อะไรที่คุณสอบถามได้
LFM2.5-2.6B-Base คือ checkpoint ที่ทำงานบนอุปกรณ์ในฐานะ agent หรือไม่
ไม่ใช่ในสภาพดั้งเดิม Base คือโมเดลพื้นฐานที่ผ่านการเตรียมฝึกมาแบบดิบ โดยไม่มีการปรับแต่งด้วยคำสั่ง และไม่มีเทมเพลตแชท โมเดลที่ทำงานเป็นเอเจนต์บนอุปกรณ์ของ Liquid คือ LFM2.5-2.6B ที่ผ่านการฝึกขั้นหลัง ซึ่งสร้างขึ้นจาก Base ด้วยกระบวนการฝึกขั้นหลังสี่ขั้นตอน — และหากต้องการให้เร็วขึ้น ก็จับคู่กับดราฟต์ LFM2.5-2.6B-DSpark
