
LFM2.5-VL-3B-DSpark: Drafter ขนาด 279.5M ของ Liquid AI เปิดตัวก่อนที่ใครจะประกาศถึงหกวัน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
มีอีกเวอร์ชันหนึ่งของเรื่องราวนี้ที่ LFM2.5-VL-3B-DSpark เป็นโมเดลใหม่ แต่มันไม่ใช่ มันคือโมเดลดราฟต์สำหรับการถอดรหัสแบบคาดการณ์ (speculative decoding) ขนาด 279.5M พารามิเตอร์ ที่มีอยู่เพื่อจุดประสงค์เดียวเท่านั้น — ทำให้โมเดลด้านภาพและภาษาของ Liquid AI เองอย่าง LFM2.5-VL-3B ถอดรหัสได้เร็วขึ้น — และมันไม่สามารถสร้างคำตอบที่ใช้งานได้ด้วยตัวเอง เหตุผลที่ยังควรอ่านเกี่ยวกับมันอยู่ดีคือไทม์ไลน์: น้ำหนักโมเดลถูกอัปโหลดขึ้น Hugging Face เมื่อวันที่ 18 กันยายน 2026 โดยไม่มีประกาศใด ๆ แนบมาด้วย อยู่เฉย ๆ ตรงนั้นเป็นเวลาหกวัน และเพิ่งได้บทความบล็อกจากผู้พัฒนาเมื่อวันที่ 24 กันยายน Radar ตรวจพบ repo ในช่วงช่องว่างนั้น
ช่องว่างนั้นยังเป็นขอบเขตของสิ่งที่เรารู้ได้ในตอนนี้ด้วย ทุกอย่างในที่เก็บโค้ด — รายละเอียดพารามิเตอร์ ขนาดบล็อก การผสานรวมกับเฟรมเวิร์ก สัญญาอนุญาต — ล้วนเป็นไฟล์บนดิสก์ที่คุณหรือฉันเปิดได้ ตัวเลขความเร็วที่เพิ่มขึ้นทุกตัวล้วนมาจากการวัดของผู้ขาย จากชุดทดสอบเบนช์มาร์กของ Liquid เอง และไม่มีใครนอกบริษัทเผยแพร่การทำซ้ำ บทความนี้จงใจแยกสองกองนั้นออกจากกัน
สิ่งที่ repository มีอยู่จริง
เปิดการ์ดโมเดลขึ้นมา แล้วรูปร่างของสิ่งนี้ก็ชัดเจนไม่กำกวม LFM2.5-VL-3B-DSpark เป็นโมเดลฉบับร่างที่เป้าหมายถูกกำหนดตายตัวไว้ในเมทาดาทาของมัน: base_model: LiquidAI/LFM2.5-VL-3Bคุณไม่กำหนดให้มันชี้ไปที่โมเดลอื่น และคุณไม่ให้บริการมันตามลำพัง
• พารามิเตอร์ทั้งหมดของดราฟต์ — 279.5M, BF16 ซึ่งในจำนวนนี้ 193.0M เป็นสแต็กดีโคเดอร์ 4 ชั้น, 65.5M เป็นเฮดมาร์คอฟ, 21.0M เป็นการฉายสถานะซ่อน และ 6.4k เป็นนอร์มบวกเฮดความมั่นใจ
• โครงข่ายหลัก — 4 เลเยอร์ full attention, ขนาด hidden 2,048, ขนาด intermediate 6,144 พร้อม SiLU/SwiGLU, grouped-query attention ที่ 32 attention heads และ 8 key-value heads, ขนาดมิติ head 64
• heads เพิ่มเติม — head แบบ Markov ที่ rank 256 และ head ค่าความเชื่อมั่น ซึ่งเป็นสิ่งที่ทำให้การดราฟต์ของ DSpark แตกต่างจากตัวดราฟต์แบบขนานธรรมดา
• ขนาดบล็อก — 9 ระหว่างการฝึก; 8 หรือ 9 ตอน inference ขึ้นอยู่กับฮาร์ดแวร์ และ 8 โดยเฉพาะบน Apple silicon
• คำศัพท์ — 128,000 ผูกกับฉบับเป้าหมายมากกว่าที่จะติดมากับฉบับร่าง
• น้ำหนักในสแตกที่นำไปใช้งาน — Liquid ระบุว่าดราฟเตอร์เพิ่มจำนวนพารามิเตอร์ที่นำไปใช้งานขึ้น 8.9%

8.9% คือตัวเลขที่ควรจดจำไว้ คำโฆษณาของโมเดลระดับนี้ไม่เคยเป็น "การอนุมานที่เร็วขึ้นนั้นฟรี" แต่เป็น "การอนุมานที่เร็วขึ้นทำให้คุณต้องแลกด้วยหน่วยความจำประมาณหนึ่งในสิบของขนาดโมเดล" ด้วยพารามิเตอร์เพิ่มเติม 279.5M เหนือโมเดลเป้าหมายขนาด 3.1B นั่นเป็นภาษีที่น้อยกว่าที่ขนาดของดราฟเตอร์เพียงอย่างเดียวจะบ่งชี้ เพราะ embedding และ LM head ถูกผูกกับโมเดลเป้าหมายและไม่ได้ถูกทำซ้ำ
DSpark เป็นเทคนิคของ DeepSeek มากกว่าที่จะเป็นโมเดลของ Liquid
การตั้งชื่อนี้อาจชวนให้สับสน จึงควรพูดให้ชัดเจน DSpark ไม่ใช่สิ่งประดิษฐ์ของ Liquid AI และไม่ใช่ตระกูลโมเดล มันเป็นเฟรมเวิร์กการถอดรหัสแบบคาดเดา (speculative decoding) จากสายงานวิจัยอีกสายหนึ่ง ซึ่งอธิบายไว้ในบทความเดือนกรกฎาคม 2026 ว่าเป็นการถอดรหัสแบบคาดเดาที่จัดตารางตามความมั่นใจ (confidence-scheduled speculative decoding) ร่วมกับการสร้างแบบกึ่งออโตเรเกรสซีฟ (semi-autoregressive generation) แนวคิดสามประการของมันคือ แบ็กโบนแบบขนานที่ร่างทั้งบล็อกใน forward pass เดียว โมดูลลำดับน้ำหนักเบาที่คืนความสัมพันธ์บางส่วนระหว่างโทเคนร่างที่อยู่ติดกัน เพื่อไม่ให้อัตราการยอมรับดิ่งลงที่ปลายบล็อก และตัวตรวจสอบที่ย่อหน้าต่างการตรวจสอบต่อคำขอ เมื่อความมั่นใจของร่างเองบ่งชี้ว่าส่วนท้ายจะถูกปฏิเสธ
สิ่งที่ Liquid ทำคือนำสูตรนั้นไปใช้กับโมเดลภาพ-ภาษาและปล่อยเช็กพอยต์ออกมา การ์ดโมเดลยอมรับตรง ๆ ว่าการถ่ายโอนนี้ไม่หวือหวาเท่าที่ฟังดู จากมุมมองของดราฟเตอร์ มอดาลิตีไม่เกี่ยวข้องเลย เพราะกว่าที่โทเคนจะไปถึงเลเยอร์ซ่อน แพตช์ภาพกับโทเคนข้อความก็เป็นแค่เทนเซอร์ทั้งคู่ นั่นคือเหตุผลที่เทคนิคซึ่งพัฒนาบนโมเดลข้อความสามารถพอร์ตไปยัง VLM ได้โดยไม่ต้องคิดค้นใหม่ — และนั่นก็เป็นเหตุผลที่ดราฟเตอร์ไม่สามารถถูกขายเป็นความสามารถใหม่ได้
Liquid ได้ปล่อยดราฟเตอร์ข้อความ DSpark ไปแล้ว — รุ่นคู่หู 2.6B, 8B-A1B และ 1.2B-Instruct เผยแพร่ในเดือนสิงหาคม 2026 โดยมีการส่งออก GGUF ตามมาในวันที่ 19 สิงหาคม ดราฟเตอร์ด้านภาพเป็นแนวคิดเดียวกันที่ขยายไปยังสาขามัลติโมดัล และเป็นรายการที่สี่หรือห้าในสายผลิตภัณฑ์ ไม่ใช่การเปิดตัวครั้งแรก
ตัวเลขความเร็วที่เพิ่มขึ้น และใครเป็นผู้วัด
ตัวเลขทุกตัวด้านล่างนี้เป็นข้อมูลของ Liquid เอง เก็บรวบรวมบนโครงสร้างพื้นฐานสำหรับการวัดประสิทธิภาพของ Liquid และไม่มีตัวใดเลยที่มีการทำซ้ำโดยอิสระ ให้ถือว่ามันเป็นเพดานสูงสุดของผู้ขาย ไม่ใช่ผลลัพธ์ที่คาดหวัง การ์ดนี้แยกความเร็วที่เพิ่มขึ้นของการถอดรหัส (decode speedup) ออกจากความเร็วที่เพิ่มขึ้นแบบ end-to-end ซึ่งสำคัญกว่าตัวเลขที่พาดหัว
• การเพิ่มความเร็วในการถอดรหัสที่ดีที่สุด — 3.13× บน COCO วัดด้วย MLX-VLM บน Apple M5 Max ที่ขนาดบล็อก 8, FP16, ขนาดแบตช์ 1, อุณหภูมิ 0
• อัตราเร่งการถอดรหัสด้วย GPU ที่ดีที่สุด — 2.66× บน COCO, SGLang บน H100 80GB เพียงตัวเดียว, BF16, ขนาดบล็อก 9
• ความเร็วในการถอดรหัส llama.cpp ที่ดีที่สุด — 2.14 เท่าบน COCO, Apple M3 Ultra, ขนาดบล็อก 8
• ช่วงการถอดรหัสของ H100 across six vision tasks — 2.04× ถึง 2.66× โดยแบบ end-to-end อยู่ที่ 1.64× ถึง 2.27×
• ช่วงถอดรหัสของ M5 Max — 2.30× ถึง 3.13×, แบบต้นจนจบ 1.56× ถึง 2.62×
• ช่วงถอดรหัสของ M3 Ultra — 1.57× ถึง 2.14×, แบบต้นทางถึงปลายทาง 1.30× ถึง 1.77×
• การยอมรับฉบับร่าง — โดยประมาณ 3.2 ถึง 4.5 โทเคนที่ได้รับการยอมรับต่อรอบการตรวจสอบเป้าหมาย บนทั้งสามสแตก
รูปแบบในช่วงเหล่านั้นคือส่วนที่ตรงไปตรงมา ผลได้แบบ end-to-end จะเป็นครึ่งที่เล็กกว่าของแต่ละคู่เสมอ เพราะ drafter เร่งการถอดรหัสและไม่มีอย่างอื่น สังเกตด้วยว่า drafter ตัวเดิมที่ขนาดบล็อกเดียวกันให้ 3.13× บนสแต็กหนึ่ง และ 1.57× บนอีกสแต็กหนึ่ง — อัตราการยอมรับเป็นคุณสมบัติของ drafter และภาระงาน แต่กำไรแบบ wall-clock เป็นคุณสมบัติของฮาร์ดแวร์และโอเวอร์เฮดของรันไทม์ คำกล่าวอ้างว่า "เร็วขึ้น 2.66×" โดยไม่ระบุสแต็กที่ใช้ ไม่ใช่คำกล่าวอ้างที่คุณนำไปลงมือทำได้
จุดถูกต้องสองข้อจากการ์ดนี้ควรกล่าวให้ชัดเจน เพราะมันคือสิ่งที่ทำให้ดราฟเตอร์เป็นที่ยอมรับได้ในการใช้งานจริงตั้งแต่แรก ภายใต้การถอดรหัสแบบละโมบ การถอดรหัสเชิงคาดการณ์นั้นแม่นตรง โมเดลเป้าหมายจะตรวจสอบทุกโทเคนที่เสนอมา ดังนั้นข้อความที่ได้จึงเป็นข้อความที่โมเดลเป้าหมายจะสร้างขึ้นเองหากทำงานลำพัง ภายใต้การตั้งค่าการสุ่มที่จับคู่กันที่อุณหภูมิที่ไม่เป็นศูนย์ มันจะรักษาการแจกแจงผลลัพธ์ของโมเดลเป้าหมายไว้ ถ้อยคำของ Liquid ที่ว่า คุณได้ความเร็วที่เพิ่มขึ้น ไม่ใช่โมเดลที่แตกต่าง นั้นถูกต้องเท่าที่มันไปถึง และการ์ดก็ซื่อสัตย์ว่าการเพิ่มอุณหภูมิจะลดอัตราการยอมรับ และด้วยเหตุนี้จึงบั่นทอนประโยชน์ด้านทรูพุต
สิ่งที่โพสต์ของ Liquid เองยอมรับ

โพสต์บล็อกวันที่ 24 กันยายน มีประโยชน์มากกว่าการ์ดโมเดลด้วยเหตุผลหนึ่ง: มันระบุขีดจำกัด การอนุมานแบบภาพ-ภาษา (vision-language inference) ต้องจ่ายต้นทุนการประมวลผลล่วงหน้า (prefill) ที่การอนุมานแบบข้อความ (text inference) ไม่ต้องจ่าย — ภาพจะต้องผ่านตัวเข้ารหัสภาพ (vision encoder) และแกนหลักทางภาษา (language backbone) จะต้องประมวลผลโทเค็นภาพ (visual tokens) หลายร้อยรายการที่ตัวเข้ารหัสนั้นสร้างขึ้น บนอุปกรณ์ prefill นั้นครองเวลาแฝงแบบ end-to-end การถอดรหัสแบบคาดการณ์ (speculative decoding) เร่งความเร็วเฉพาะการถอดรหัส (decode) เท่านั้น การเข้ารหัสภาพ (vision encoding) และ prefill ไม่ได้รับการแตะต้อง Liquid อ้าง Amdahl's law กับผลิตภัณฑ์ของตัวเอง และชี้ให้เห็นว่าเมื่อ prefill คิดเป็นสัดส่วนใหญ่ของเวลาจริง (wall time) การเร่งความเร็ว decode ที่มากจะให้การปรับปรุงแบบ end-to-end เพียงเล็กน้อยเท่านั้น
นั่นเป็นข้อจำกัดจริงในการตัดสินใจซื้อ และมันอธิบายว่าทำไมเวลาถึงโทเคนแรก (time-to-first-token) จึงไม่อยู่ในรายการสิ่งที่ดราฟเตอร์นี้ปรับปรุง นอกจากนี้ยังบ่งชี้ว่าเวิร์กโหลดที่ได้ประโยชน์สูงสุดคือเวิร์กโหลดที่สร้างเอาต์พุตยาวๆ จากภาพขนาดพอเหมาะ — เช่น คำบรรยายภาพ, การถอดข้อความ OCR แบบยาว, การสนทนาหลายรอบโดยมีภาพหนึ่งภาพส่งต่อไป — มากกว่าเวิร์กโหลดที่ตอบคำถามสั้นๆ เกี่ยวกับภาพขนาดใหญ่
โพสต์นี้เพิ่มข้อจำกัดขอบเขตอีกสองข้อ ตัวเลขทั้งหมดใช้การประมวลผลแบบ 16-บิตสำหรับทั้งตัวเข้ารหัสภาพและแกนหลักภาษา และการเร่งความเร็วของโมเดลที่ควอนไทซ์อยู่นอกขอบเขตของรุ่นนี้ เมื่อพิจารณาว่าจุดขายทั้งหมดของ VLM ขนาด 3B สำหรับเอดจ์คือการทำงานด้วยหน่วยความจำเพียงไม่กี่กิกะไบต์ "ความเร็วที่เพิ่มขึ้นถูกวัดที่ FP16" จึงเป็นข้อควรระวังที่มีความหมายสำหรับใครก็ตามที่วางแผนจะใช้คู่กับการส่งออกแบบ 4-บิต Liquid ยังระบุด้วยว่า drafter ถูกฝึกทั้งหมดบนฮาร์ดแวร์ AMD
กำลังรันมัน

การรองรับตั้งแต่วันแรกเป็นของจริงและครอบคลุมสามรันไทม์ ซึ่งมากกว่าที่ดราฟเตอร์ส่วนใหญ่ได้รับ SGLang บน NVIDIA ต้องใช้ v0.5.19 หรือใหม่กว่า และพาดราฟเตอร์ผ่าน --speculative-algorithm DSPARK ด้วยเส้นทางดราฟต์และขนาดบล็อก 9 MLX-VLM บน Apple silicon ต้องใช้ v0.7.2 หรือใหม่กว่า และตรวจจับดราฟเตอร์เมื่อส่งผ่านด้วย --draft-model; มีจุดที่ต้องระวังหนึ่งจุด — การถอดรหัส DSpark ใน MLX-VLM ปัจจุบันใช้ greedy sampling ดังนั้นจึงต้องตั้งค่า temperature เป็น 0 สำหรับ llama.cpp มีที่เก็บ GGUF แยกต่างหาก โดยมีไฟล์ส่งออก F16 เพียงไฟล์เดียวขนาดประมาณ 567 MB และการ์ดระบุไว้ชัดเจนว่าให้จับคู่ดราฟเตอร์แบบควอนไทซ์กับเป้าหมายแบบควอนไทซ์ ไม่ใช่กับเช็กพอยต์ safetensors ต้นฉบับ
จุดที่เลเยอร์การจัดเส้นทางมีที่ยืนในที่นี้ไม่ใช่บนโมเดลนี้ — OrcaRouter ไม่ได้จัดเส้นทางให้ LFM2.5-VL-3B-DSpark หรือ LFM2.5-VL-3B และนี่คือการจับคู่ drafter แบบโฮสต์เองที่คุณดาวน์โหลดและให้บริการเอง แต่เป็นบนส่วนอื่น ๆ ของสแต็กที่อยู่รอบ ๆ มัน แอปพลิเคชันเดียวกันที่รันโมเดลวิชันขนาดเล็กแบบ open-weight บนอุปกรณ์มักมีเส้นทางสำรองสำหรับคำถามที่โมเดลขนาดเล็กจัดการไม่ได้ และการชี้เส้นทางนั้นไปที่ ปลายทางเดียวที่ครอบคลุมโมเดล 200+ รายการ — คิดค่าบริการตามราคาที่ประกาศของแต่ละผู้ให้บริการโดยไม่มีการบวกเพิ่ม พร้อมการสลับสำรองอัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลง — เป็นการผสานรวมที่เล็กกว่าการจัดตั้งสัญญากับผู้ให้บริการรายที่สอง drafter ช่วยปรับปรุงขาขาหนึ่งของสถาปัตยกรรมนั้น ส่วนเราเตอร์คือสิ่งที่ทำให้ขาอีกขาไม่กลายเป็นโปรเจกต์ที่สอง
อะไรที่ยังไม่เป็นที่รู้กัน
รีโพซิทอรีมี 37 ดาวน์โหลดและ 6 ไลก์ ณ เวลาที่เขียน ไม่มีรายการสำหรับดราฟเตอร์นี้บนแหล่งรวบรวมเบนช์มาร์กสาธารณะใด ๆ ไม่มีการทำซ้ำช่วงอัตราเร่งใด ๆ โดยบุคคลที่สาม และไม่มีการวัดอัตราการยอมรับอย่างอิสระบนฮาร์ดแวร์ที่ Liquid ไม่ได้ทดสอบ ยังไม่มีเบนช์มาร์กคุณภาพบนการ์ดด้วยเหตุผลที่ชัดเจน — ดราฟเตอร์นี้รักษาผลลัพธ์ให้คงเดิมโดยโครงสร้าง ดังนั้นตัวเลขคุณภาพจึงเป็นของ LFM2.5-VL-3B และการ์ดชี้ไปที่เบนช์มาร์กของโมเดลนั้นแทนที่จะสร้างขึ้นเอง
รายละเอียดหนึ่งในเมทาดาทาเป็นเบาะแสเล็ก ๆ ที่บ่งบอกว่าสิ่งนี้ใหม่อยู่แค่ไหน: โมเดลนี้มีแท็กไลบรารี SGLang และแฟล็กอัลกอริทึม SGLang ที่มีอยู่โดยเฉพาะเพื่อเรียกใช้งานมัน การรองรับในเฟรมเวิร์กต้องเสร็จสิ้นลงก่อนที่จะมีการประกาศออกมา ซึ่งสอดคล้องกับช่องว่างหกวันระหว่างรีโพซิทอรีกับบล็อกโพสต์
ดังนั้น: ชิ้นงานวิศวกรรมที่แท้จริง มีประโยชน์ และมีขอบเขตแคบ ๆ ซึ่งประกาศออกมาหนึ่งสัปดาห์หลังจากที่มันเปิดตัวแล้ว โดยข้อเสนอคุณค่าทั้งหมดของมันคือตัวเลขที่ผู้ขายวัดเองบนฮาร์ดแวร์ที่คุณอาจไม่ได้เป็นเจ้าของ หากคุณกำลังให้บริการ LFM2.5-VL-3B บน H100 หรือ Mac ซีรีส์ M และปริมาณงานของคุณเน้นการถอดรหัสเป็นหลัก ค่าใช้จ่ายหน่วยความจำอยู่ที่ 8.9% และข้อเสียแทบจะเป็นศูนย์ เพราะเอาต์พุตพิสูจน์ได้ว่าเป็นของเป้าหมาย หากเวลาแฝงของคุณถูกครอบงำด้วยพรีฟิลล์ หรือคุณกำลังพึ่งพาการส่งออกแบบ 4-bit โพสต์ของ Liquid เองก็บอกคุณว่ามันจะไม่ช่วย การทำซ้ำ เมื่อมันมาถึง คือสิ่งที่ต้องรอ
OrcaRouter นำโมเดลกว่า 200 รายการมาอยู่เบื้องหลังคีย์เดียวในราคาตามที่ผู้ให้บริการระบุ โดยบวกเพิ่ม 0% และแสดงเส้นทางสำรองเป็นเลเยอร์การจัดเส้นทางแทนที่จะเป็นโค้ดแอปพลิเคชัน ดราฟเตอร์โฮสต์เองไม่ว่าจะทางใดก็ตาม - เราเตอร์คือสิ่งที่ทำให้ช่วงที่โมเดลขนาดเล็กของคุณส่งต่อไปนั้นไม่กลายเป็นโปรเจกต์ที่สอง
