การ์ดชื่อเรื่องหลักอ่านว่า 'LFM2.5-VL-3B-DSpark' ภายใต้คำโปรย 'ดราฟเตอร์ภาพ-ภาษา' พร้อมคำบรรยายย่อย 'ดราฟเตอร์ขนาด 279.5M สำหรับ LFM2.5-VL-3B ของ Liquid AI — น้ำหนักโมเดลจะเปิดให้ใช้ในวันที่ 18 กันยายน 2026 หกวันก่อนที่ใครจะประกาศออกมา' การ์ดสามใบด้านล่างอ่านว่า 'พารามิเตอร์ดราฟต์ 279.5M — 4 เลเยอร์, เฮด Markov, เฮดความเชื่อมั่น', 'ขนาดบล็อก 9 — 8 บน Apple silicon; มีโทเคนที่ได้รับการยอมรับ 3.2-4.5 ตัวต่อรอบ' และ 'หน่วยความจำเพิ่มขึ้น 8.9% — เอาต์พุตพิสูจน์ได้ว่าเป็นของโมเดลเป้าหมาย โดยไม่เปลี่ยนแปลง' ส่วนท้ายอ่านว่า 'ตัวเลขความเร็วที่เพิ่มขึ้นทุกค่าถูกวัดโดยผู้ขายอย่าง Liquid AI; ยังไม่มีการทำซ้ำผลโดยอิสระ' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Engineering & Research

LFM2.5-VL-3B-DSpark: Drafter ขนาด 279.5M ของ Liquid AI เปิดตัวก่อนที่ใครจะประกาศถึงหกวัน

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

มีอีกเวอร์ชันหนึ่งของเรื่องราวนี้ที่ LFM2.5-VL-3B-DSpark เป็นโมเดลใหม่ แต่มันไม่ใช่ มันคือโมเดลดราฟต์สำหรับการถอดรหัสแบบคาดการณ์ (speculative decoding) ขนาด 279.5M พารามิเตอร์ ที่มีอยู่เพื่อจุดประสงค์เดียวเท่านั้น — ทำให้โมเดลด้านภาพและภาษาของ Liquid AI เองอย่าง LFM2.5-VL-3B ถอดรหัสได้เร็วขึ้น — และมันไม่สามารถสร้างคำตอบที่ใช้งานได้ด้วยตัวเอง เหตุผลที่ยังควรอ่านเกี่ยวกับมันอยู่ดีคือไทม์ไลน์: น้ำหนักโมเดลถูกอัปโหลดขึ้น Hugging Face เมื่อวันที่ 18 กันยายน 2026 โดยไม่มีประกาศใด ๆ แนบมาด้วย อยู่เฉย ๆ ตรงนั้นเป็นเวลาหกวัน และเพิ่งได้บทความบล็อกจากผู้พัฒนาเมื่อวันที่ 24 กันยายน Radar ตรวจพบ repo ในช่วงช่องว่างนั้น

ช่องว่างนั้นยังเป็นขอบเขตของสิ่งที่เรารู้ได้ในตอนนี้ด้วย ทุกอย่างในที่เก็บโค้ด — รายละเอียดพารามิเตอร์ ขนาดบล็อก การผสานรวมกับเฟรมเวิร์ก สัญญาอนุญาต — ล้วนเป็นไฟล์บนดิสก์ที่คุณหรือฉันเปิดได้ ตัวเลขความเร็วที่เพิ่มขึ้นทุกตัวล้วนมาจากการวัดของผู้ขาย จากชุดทดสอบเบนช์มาร์กของ Liquid เอง และไม่มีใครนอกบริษัทเผยแพร่การทำซ้ำ บทความนี้จงใจแยกสองกองนั้นออกจากกัน

สิ่งที่ repository มีอยู่จริง

เปิดการ์ดโมเดลขึ้นมา แล้วรูปร่างของสิ่งนี้ก็ชัดเจนไม่กำกวม LFM2.5-VL-3B-DSpark เป็นโมเดลฉบับร่างที่เป้าหมายถูกกำหนดตายตัวไว้ในเมทาดาทาของมัน: base_model: LiquidAI/LFM2.5-VL-3Bคุณไม่กำหนดให้มันชี้ไปที่โมเดลอื่น และคุณไม่ให้บริการมันตามลำพัง

• พารามิเตอร์ทั้งหมดของดราฟต์ — 279.5M, BF16 ซึ่งในจำนวนนี้ 193.0M เป็นสแต็กดีโคเดอร์ 4 ชั้น, 65.5M เป็นเฮดมาร์คอฟ, 21.0M เป็นการฉายสถานะซ่อน และ 6.4k เป็นนอร์มบวกเฮดความมั่นใจ

• โครงข่ายหลัก — 4 เลเยอร์ full attention, ขนาด hidden 2,048, ขนาด intermediate 6,144 พร้อม SiLU/SwiGLU, grouped-query attention ที่ 32 attention heads และ 8 key-value heads, ขนาดมิติ head 64

• heads เพิ่มเติม — head แบบ Markov ที่ rank 256 และ head ค่าความเชื่อมั่น ซึ่งเป็นสิ่งที่ทำให้การดราฟต์ของ DSpark แตกต่างจากตัวดราฟต์แบบขนานธรรมดา

• ขนาดบล็อก — 9 ระหว่างการฝึก; 8 หรือ 9 ตอน inference ขึ้นอยู่กับฮาร์ดแวร์ และ 8 โดยเฉพาะบน Apple silicon

• คำศัพท์ — 128,000 ผูกกับฉบับเป้าหมายมากกว่าที่จะติดมากับฉบับร่าง

• น้ำหนักในสแตกที่นำไปใช้งาน — Liquid ระบุว่าดราฟเตอร์เพิ่มจำนวนพารามิเตอร์ที่นำไปใช้งานขึ้น 8.9%

A single-column infographic titled 'LFM2.5-VL-3B-DSpark - the numbers' with the subtitle 'Every figure below was measured by Liquid AI, on Liquid AI's hardware'. Six rows read: 'Decode speedup, single H100 80GB - SGLang' at '2.04x - 2.66x'; 'Decode speedup, Apple M5 Max - MLX-VLM' at '2.30x - 3.13x'; 'End-to-end speedup across all three stacks' at '1.30x - 2.62x'; 'Draft tokens accepted per verification pass' at '3.2 - 4.5'; 'Extra memory in the deployed stack' at '8.9%'; and 'Repository interest at time of writing' at '37 downloads, 6 likes'. The footer reads 'Vendor-measured. No third-party reproduction of any figure in this table exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

8.9% คือตัวเลขที่ควรจดจำไว้ คำโฆษณาของโมเดลระดับนี้ไม่เคยเป็น "การอนุมานที่เร็วขึ้นนั้นฟรี" แต่เป็น "การอนุมานที่เร็วขึ้นทำให้คุณต้องแลกด้วยหน่วยความจำประมาณหนึ่งในสิบของขนาดโมเดล" ด้วยพารามิเตอร์เพิ่มเติม 279.5M เหนือโมเดลเป้าหมายขนาด 3.1B นั่นเป็นภาษีที่น้อยกว่าที่ขนาดของดราฟเตอร์เพียงอย่างเดียวจะบ่งชี้ เพราะ embedding และ LM head ถูกผูกกับโมเดลเป้าหมายและไม่ได้ถูกทำซ้ำ

DSpark เป็นเทคนิคของ DeepSeek มากกว่าที่จะเป็นโมเดลของ Liquid

การตั้งชื่อนี้อาจชวนให้สับสน จึงควรพูดให้ชัดเจน DSpark ไม่ใช่สิ่งประดิษฐ์ของ Liquid AI และไม่ใช่ตระกูลโมเดล มันเป็นเฟรมเวิร์กการถอดรหัสแบบคาดเดา (speculative decoding) จากสายงานวิจัยอีกสายหนึ่ง ซึ่งอธิบายไว้ในบทความเดือนกรกฎาคม 2026 ว่าเป็นการถอดรหัสแบบคาดเดาที่จัดตารางตามความมั่นใจ (confidence-scheduled speculative decoding) ร่วมกับการสร้างแบบกึ่งออโตเรเกรสซีฟ (semi-autoregressive generation) แนวคิดสามประการของมันคือ แบ็กโบนแบบขนานที่ร่างทั้งบล็อกใน forward pass เดียว โมดูลลำดับน้ำหนักเบาที่คืนความสัมพันธ์บางส่วนระหว่างโทเคนร่างที่อยู่ติดกัน เพื่อไม่ให้อัตราการยอมรับดิ่งลงที่ปลายบล็อก และตัวตรวจสอบที่ย่อหน้าต่างการตรวจสอบต่อคำขอ เมื่อความมั่นใจของร่างเองบ่งชี้ว่าส่วนท้ายจะถูกปฏิเสธ

สิ่งที่ Liquid ทำคือนำสูตรนั้นไปใช้กับโมเดลภาพ-ภาษาและปล่อยเช็กพอยต์ออกมา การ์ดโมเดลยอมรับตรง ๆ ว่าการถ่ายโอนนี้ไม่หวือหวาเท่าที่ฟังดู จากมุมมองของดราฟเตอร์ มอดาลิตีไม่เกี่ยวข้องเลย เพราะกว่าที่โทเคนจะไปถึงเลเยอร์ซ่อน แพตช์ภาพกับโทเคนข้อความก็เป็นแค่เทนเซอร์ทั้งคู่ นั่นคือเหตุผลที่เทคนิคซึ่งพัฒนาบนโมเดลข้อความสามารถพอร์ตไปยัง VLM ได้โดยไม่ต้องคิดค้นใหม่ — และนั่นก็เป็นเหตุผลที่ดราฟเตอร์ไม่สามารถถูกขายเป็นความสามารถใหม่ได้

Liquid ได้ปล่อยดราฟเตอร์ข้อความ DSpark ไปแล้ว — รุ่นคู่หู 2.6B, 8B-A1B และ 1.2B-Instruct เผยแพร่ในเดือนสิงหาคม 2026 โดยมีการส่งออก GGUF ตามมาในวันที่ 19 สิงหาคม ดราฟเตอร์ด้านภาพเป็นแนวคิดเดียวกันที่ขยายไปยังสาขามัลติโมดัล และเป็นรายการที่สี่หรือห้าในสายผลิตภัณฑ์ ไม่ใช่การเปิดตัวครั้งแรก

ตัวเลขความเร็วที่เพิ่มขึ้น และใครเป็นผู้วัด

ตัวเลขทุกตัวด้านล่างนี้เป็นข้อมูลของ Liquid เอง เก็บรวบรวมบนโครงสร้างพื้นฐานสำหรับการวัดประสิทธิภาพของ Liquid และไม่มีตัวใดเลยที่มีการทำซ้ำโดยอิสระ ให้ถือว่ามันเป็นเพดานสูงสุดของผู้ขาย ไม่ใช่ผลลัพธ์ที่คาดหวัง การ์ดนี้แยกความเร็วที่เพิ่มขึ้นของการถอดรหัส (decode speedup) ออกจากความเร็วที่เพิ่มขึ้นแบบ end-to-end ซึ่งสำคัญกว่าตัวเลขที่พาดหัว

• การเพิ่มความเร็วในการถอดรหัสที่ดีที่สุด — 3.13× บน COCO วัดด้วย MLX-VLM บน Apple M5 Max ที่ขนาดบล็อก 8, FP16, ขนาดแบตช์ 1, อุณหภูมิ 0

• อัตราเร่งการถอดรหัสด้วย GPU ที่ดีที่สุด — 2.66× บน COCO, SGLang บน H100 80GB เพียงตัวเดียว, BF16, ขนาดบล็อก 9

• ความเร็วในการถอดรหัส llama.cpp ที่ดีที่สุด — 2.14 เท่าบน COCO, Apple M3 Ultra, ขนาดบล็อก 8

• ช่วงการถอดรหัสของ H100 across six vision tasks — 2.04× ถึง 2.66× โดยแบบ end-to-end อยู่ที่ 1.64× ถึง 2.27×

• ช่วงถอดรหัสของ M5 Max — 2.30× ถึง 3.13×, แบบต้นจนจบ 1.56× ถึง 2.62×

• ช่วงถอดรหัสของ M3 Ultra — 1.57× ถึง 2.14×, แบบต้นทางถึงปลายทาง 1.30× ถึง 1.77×

• การยอมรับฉบับร่าง — โดยประมาณ 3.2 ถึง 4.5 โทเคนที่ได้รับการยอมรับต่อรอบการตรวจสอบเป้าหมาย บนทั้งสามสแตก

รูปแบบในช่วงเหล่านั้นคือส่วนที่ตรงไปตรงมา ผลได้แบบ end-to-end จะเป็นครึ่งที่เล็กกว่าของแต่ละคู่เสมอ เพราะ drafter เร่งการถอดรหัสและไม่มีอย่างอื่น สังเกตด้วยว่า drafter ตัวเดิมที่ขนาดบล็อกเดียวกันให้ 3.13× บนสแต็กหนึ่ง และ 1.57× บนอีกสแต็กหนึ่ง — อัตราการยอมรับเป็นคุณสมบัติของ drafter และภาระงาน แต่กำไรแบบ wall-clock เป็นคุณสมบัติของฮาร์ดแวร์และโอเวอร์เฮดของรันไทม์ คำกล่าวอ้างว่า "เร็วขึ้น 2.66×" โดยไม่ระบุสแต็กที่ใช้ ไม่ใช่คำกล่าวอ้างที่คุณนำไปลงมือทำได้

จุดถูกต้องสองข้อจากการ์ดนี้ควรกล่าวให้ชัดเจน เพราะมันคือสิ่งที่ทำให้ดราฟเตอร์เป็นที่ยอมรับได้ในการใช้งานจริงตั้งแต่แรก ภายใต้การถอดรหัสแบบละโมบ การถอดรหัสเชิงคาดการณ์นั้นแม่นตรง โมเดลเป้าหมายจะตรวจสอบทุกโทเคนที่เสนอมา ดังนั้นข้อความที่ได้จึงเป็นข้อความที่โมเดลเป้าหมายจะสร้างขึ้นเองหากทำงานลำพัง ภายใต้การตั้งค่าการสุ่มที่จับคู่กันที่อุณหภูมิที่ไม่เป็นศูนย์ มันจะรักษาการแจกแจงผลลัพธ์ของโมเดลเป้าหมายไว้ ถ้อยคำของ Liquid ที่ว่า คุณได้ความเร็วที่เพิ่มขึ้น ไม่ใช่โมเดลที่แตกต่าง นั้นถูกต้องเท่าที่มันไปถึง และการ์ดก็ซื่อสัตย์ว่าการเพิ่มอุณหภูมิจะลดอัตราการยอมรับ และด้วยเหตุนี้จึงบั่นทอนประโยชน์ด้านทรูพุต

สิ่งที่โพสต์ของ Liquid เองยอมรับ

A screenshot of Liquid AI's own blog post 'LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond', dated SEP 24, 2026, on the company's English-language site. A bar chart above the headline compares 'LFM2.5-VL-3B (Baseline)' with 'LFM2.5-VL-3B-DSpark', labelling the pair '67 tok/s' and '220 tok/s'. The visible opening text reads 'Today, we release an experimental DSpark draft model for our vision-language model (VLM) LFM2.5-VL-3B' and quotes 'decoding throughput improvements of up to 2.66 on GPUs and 3.13x on edge devices, with end-to-end throughput gains of up to 2.27 and 2.62', noting the model 'is available on Hugging Face, with support in llama.cpp, SGLang, and MLX-VLM'.

โพสต์บล็อกวันที่ 24 กันยายน มีประโยชน์มากกว่าการ์ดโมเดลด้วยเหตุผลหนึ่ง: มันระบุขีดจำกัด การอนุมานแบบภาพ-ภาษา (vision-language inference) ต้องจ่ายต้นทุนการประมวลผลล่วงหน้า (prefill) ที่การอนุมานแบบข้อความ (text inference) ไม่ต้องจ่าย — ภาพจะต้องผ่านตัวเข้ารหัสภาพ (vision encoder) และแกนหลักทางภาษา (language backbone) จะต้องประมวลผลโทเค็นภาพ (visual tokens) หลายร้อยรายการที่ตัวเข้ารหัสนั้นสร้างขึ้น บนอุปกรณ์ prefill นั้นครองเวลาแฝงแบบ end-to-end การถอดรหัสแบบคาดการณ์ (speculative decoding) เร่งความเร็วเฉพาะการถอดรหัส (decode) เท่านั้น การเข้ารหัสภาพ (vision encoding) และ prefill ไม่ได้รับการแตะต้อง Liquid อ้าง Amdahl's law กับผลิตภัณฑ์ของตัวเอง และชี้ให้เห็นว่าเมื่อ prefill คิดเป็นสัดส่วนใหญ่ของเวลาจริง (wall time) การเร่งความเร็ว decode ที่มากจะให้การปรับปรุงแบบ end-to-end เพียงเล็กน้อยเท่านั้น

นั่นเป็นข้อจำกัดจริงในการตัดสินใจซื้อ และมันอธิบายว่าทำไมเวลาถึงโทเคนแรก (time-to-first-token) จึงไม่อยู่ในรายการสิ่งที่ดราฟเตอร์นี้ปรับปรุง นอกจากนี้ยังบ่งชี้ว่าเวิร์กโหลดที่ได้ประโยชน์สูงสุดคือเวิร์กโหลดที่สร้างเอาต์พุตยาวๆ จากภาพขนาดพอเหมาะ — เช่น คำบรรยายภาพ, การถอดข้อความ OCR แบบยาว, การสนทนาหลายรอบโดยมีภาพหนึ่งภาพส่งต่อไป — มากกว่าเวิร์กโหลดที่ตอบคำถามสั้นๆ เกี่ยวกับภาพขนาดใหญ่

โพสต์นี้เพิ่มข้อจำกัดขอบเขตอีกสองข้อ ตัวเลขทั้งหมดใช้การประมวลผลแบบ 16-บิตสำหรับทั้งตัวเข้ารหัสภาพและแกนหลักภาษา และการเร่งความเร็วของโมเดลที่ควอนไทซ์อยู่นอกขอบเขตของรุ่นนี้ เมื่อพิจารณาว่าจุดขายทั้งหมดของ VLM ขนาด 3B สำหรับเอดจ์คือการทำงานด้วยหน่วยความจำเพียงไม่กี่กิกะไบต์ "ความเร็วที่เพิ่มขึ้นถูกวัดที่ FP16" จึงเป็นข้อควรระวังที่มีความหมายสำหรับใครก็ตามที่วางแผนจะใช้คู่กับการส่งออกแบบ 4-บิต Liquid ยังระบุด้วยว่า drafter ถูกฝึกทั้งหมดบนฮาร์ดแวร์ AMD

กำลังรันมัน

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention (32 attention heads, 8 key-value heads, head_dim 64), a Markov head of rank 256 plus a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'. A related-papers panel lists 'MMSpec: Benchmarking Speculative Decoding for Vision-Language' (arXiv 2603.14989).

การรองรับตั้งแต่วันแรกเป็นของจริงและครอบคลุมสามรันไทม์ ซึ่งมากกว่าที่ดราฟเตอร์ส่วนใหญ่ได้รับ SGLang บน NVIDIA ต้องใช้ v0.5.19 หรือใหม่กว่า และพาดราฟเตอร์ผ่าน --speculative-algorithm DSPARK ด้วยเส้นทางดราฟต์และขนาดบล็อก 9 MLX-VLM บน Apple silicon ต้องใช้ v0.7.2 หรือใหม่กว่า และตรวจจับดราฟเตอร์เมื่อส่งผ่านด้วย --draft-model; มีจุดที่ต้องระวังหนึ่งจุด — การถอดรหัส DSpark ใน MLX-VLM ปัจจุบันใช้ greedy sampling ดังนั้นจึงต้องตั้งค่า temperature เป็น 0 สำหรับ llama.cpp มีที่เก็บ GGUF แยกต่างหาก โดยมีไฟล์ส่งออก F16 เพียงไฟล์เดียวขนาดประมาณ 567 MB และการ์ดระบุไว้ชัดเจนว่าให้จับคู่ดราฟเตอร์แบบควอนไทซ์กับเป้าหมายแบบควอนไทซ์ ไม่ใช่กับเช็กพอยต์ safetensors ต้นฉบับ

จุดที่เลเยอร์การจัดเส้นทางมีที่ยืนในที่นี้ไม่ใช่บนโมเดลนี้ — OrcaRouter ไม่ได้จัดเส้นทางให้ LFM2.5-VL-3B-DSpark หรือ LFM2.5-VL-3B และนี่คือการจับคู่ drafter แบบโฮสต์เองที่คุณดาวน์โหลดและให้บริการเอง แต่เป็นบนส่วนอื่น ๆ ของสแต็กที่อยู่รอบ ๆ มัน แอปพลิเคชันเดียวกันที่รันโมเดลวิชันขนาดเล็กแบบ open-weight บนอุปกรณ์มักมีเส้นทางสำรองสำหรับคำถามที่โมเดลขนาดเล็กจัดการไม่ได้ และการชี้เส้นทางนั้นไปที่ ปลายทางเดียวที่ครอบคลุมโมเดล 200+ รายการ — คิดค่าบริการตามราคาที่ประกาศของแต่ละผู้ให้บริการโดยไม่มีการบวกเพิ่ม พร้อมการสลับสำรองอัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลง — เป็นการผสานรวมที่เล็กกว่าการจัดตั้งสัญญากับผู้ให้บริการรายที่สอง drafter ช่วยปรับปรุงขาขาหนึ่งของสถาปัตยกรรมนั้น ส่วนเราเตอร์คือสิ่งที่ทำให้ขาอีกขาไม่กลายเป็นโปรเจกต์ที่สอง

อะไรที่ยังไม่เป็นที่รู้กัน

รีโพซิทอรีมี 37 ดาวน์โหลดและ 6 ไลก์ ณ เวลาที่เขียน ไม่มีรายการสำหรับดราฟเตอร์นี้บนแหล่งรวบรวมเบนช์มาร์กสาธารณะใด ๆ ไม่มีการทำซ้ำช่วงอัตราเร่งใด ๆ โดยบุคคลที่สาม และไม่มีการวัดอัตราการยอมรับอย่างอิสระบนฮาร์ดแวร์ที่ Liquid ไม่ได้ทดสอบ ยังไม่มีเบนช์มาร์กคุณภาพบนการ์ดด้วยเหตุผลที่ชัดเจน — ดราฟเตอร์นี้รักษาผลลัพธ์ให้คงเดิมโดยโครงสร้าง ดังนั้นตัวเลขคุณภาพจึงเป็นของ LFM2.5-VL-3B และการ์ดชี้ไปที่เบนช์มาร์กของโมเดลนั้นแทนที่จะสร้างขึ้นเอง

รายละเอียดหนึ่งในเมทาดาทาเป็นเบาะแสเล็ก ๆ ที่บ่งบอกว่าสิ่งนี้ใหม่อยู่แค่ไหน: โมเดลนี้มีแท็กไลบรารี SGLang และแฟล็กอัลกอริทึม SGLang ที่มีอยู่โดยเฉพาะเพื่อเรียกใช้งานมัน การรองรับในเฟรมเวิร์กต้องเสร็จสิ้นลงก่อนที่จะมีการประกาศออกมา ซึ่งสอดคล้องกับช่องว่างหกวันระหว่างรีโพซิทอรีกับบล็อกโพสต์

ดังนั้น: ชิ้นงานวิศวกรรมที่แท้จริง มีประโยชน์ และมีขอบเขตแคบ ๆ ซึ่งประกาศออกมาหนึ่งสัปดาห์หลังจากที่มันเปิดตัวแล้ว โดยข้อเสนอคุณค่าทั้งหมดของมันคือตัวเลขที่ผู้ขายวัดเองบนฮาร์ดแวร์ที่คุณอาจไม่ได้เป็นเจ้าของ หากคุณกำลังให้บริการ LFM2.5-VL-3B บน H100 หรือ Mac ซีรีส์ M และปริมาณงานของคุณเน้นการถอดรหัสเป็นหลัก ค่าใช้จ่ายหน่วยความจำอยู่ที่ 8.9% และข้อเสียแทบจะเป็นศูนย์ เพราะเอาต์พุตพิสูจน์ได้ว่าเป็นของเป้าหมาย หากเวลาแฝงของคุณถูกครอบงำด้วยพรีฟิลล์ หรือคุณกำลังพึ่งพาการส่งออกแบบ 4-bit โพสต์ของ Liquid เองก็บอกคุณว่ามันจะไม่ช่วย การทำซ้ำ เมื่อมันมาถึง คือสิ่งที่ต้องรอ

OrcaRouter นำโมเดลกว่า 200 รายการมาอยู่เบื้องหลังคีย์เดียวในราคาตามที่ผู้ให้บริการระบุ โดยบวกเพิ่ม 0% และแสดงเส้นทางสำรองเป็นเลเยอร์การจัดเส้นทางแทนที่จะเป็นโค้ดแอปพลิเคชัน ดราฟเตอร์โฮสต์เองไม่ว่าจะทางใดก็ตาม - เราเตอร์คือสิ่งที่ทำให้ช่วงที่โมเดลขนาดเล็กของคุณส่งต่อไปนั้นไม่กลายเป็นโปรเจกต์ที่สอง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube