
LFM2.5-8B-A1B-DSpark vs LFM2.5-2.6B-Base: Phần Tốc Độ vs Nguyên Liệu Thô
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
Sắp xếp gia đình LFM2.5 theo những gì mỗi checkpoint có thể tự làm, thì LFM2.5-8B-A1B-DSpark và LFM2.5-2.6B-Base nằm ở hai đầu đối lập của dãy — và không đầu nào có thể trả lời một câu hỏi. Checkpoint đầu tiên là mô hình nháp có 327,7 triệu tham số, tồn tại chỉ để giúp mô hình hỗn hợp chuyên gia biên của Liquid AI tạo token nhanh hơn. Checkpoint thứ hai là checkpoint tiền huấn luyện thô có 2,69 tỷ tham số, tồn tại chỉ để được tinh chỉnh thành một thứ khác. Cả hai đều được phát hành vào tháng 8 năm 2026 theo LFM Open License v1.0 của Liquid, cả hai đều chỉ cách một cú nhấp tải về trên Hugging Face, và cả hai đều rất dễ bị tải nhầm — vì tên của chúng khiến chúng nghe như hai phiên bản của cùng một thứ.
Cái tên chính là cái bẫy. "DSpark" nghe như flagship mới đầy sức sống của gia đình, còn "Base" nghe như bản mặc định đơn giản mà bạn thực sự có thể chạy. Cả hai đều sai. Checkpoint DSpark không thể tự mình trả lời bất cứ điều gì — nó chỉ đề xuất token cho LFM2.5-8B-A1B kiểm chứng. Base cũng không thể trả lời gì, nhưng vì lý do ngược lại — nó là nền tảng chưa tinh chỉnh, dự đoán văn bản nhưng chưa từng được hậu huấn luyện thành mô hình chat hay agent. Đây không phải là sự đối đầu; đây là một pipeline. Một checkpoint nằm ở cuối cùng của ngăn xếp phục vụ, còn cái kia nằm ở ngay điểm khởi đầu của một đợt huấn luyện.
Hai trạm kiểm soát có chung tên gọi, không chung công việc
LFM2.5-8B-A1B-DSpark (phát hành ngày 20 tháng 8 năm 2026) là một mô hình dự thảo giải mã suy đoán: một mạng chỉ gồm năm lớp attention, một khối chín token được đề xuất cho mỗi bước, và một đầu Markov trên bộ từ vựng 128.000 token của mô hình đích. Bạn tải nó bên cạnh LFM2.5-8B-A1B — một MoE có tổng 8,3B tham số, ~1,5B tham số hoạt động, ra mắt vào ngày 28 tháng 5 — mô hình dự thảo đoán vài token tiếp theo, và mô hình đích xác minh toàn bộ khối trong một lượt truyền xuôi, giữ lại những gì nó chấp nhận. Vì mô hình đích kiểm tra từng token, đầu ra khi giải mã tham lam giống hệt việc chạy riêng LFM2.5-8B-A1B: "lossless by construction," theo cách nói của Liquid. Mô hình dự thảo là một bộ phận tăng tốc, không phải bộ não. Nó được phát hành cùng với các mô hình dự thảo anh em cho LFM2.5-1.2B-Instruct và LFM2.5-2.6B, mỗi mô hình ở định dạng Safetensors và GGUF, với hỗ trợ ngay ngày đầu trên SGLang và llama.cpp.
LFM2.5-2.6B-Base (phát hành ngày 4 tháng 8 năm 2026) là đầu còn lại của quy trình: một mô hình nền tảng 2,69 tỷ tham số trong một chồng 30 lớp lai — 22 khối tích chập ngắn hai cổng cộng với 8 khối chú ý truy vấn nhóm — được tiền huấn luyện trên khoảng 34 nghìn tỷ token, với giai đoạn huấn luyện giữa chừng mở rộng ngữ cảnh lên 128K. Nó không có mẫu chat, không tinh chỉnh theo chỉ dẫn, và không có điểm chuẩn nào được công bố; thẻ mô hình của chính Liquid cũng chỉ khuyến nghị dùng nó để tinh chỉnh sâu rộng. Toàn bộ mục đích của nó là làm nguyên liệu thô để một quy trình hậu huấn luyện bốn giai đoạn — hai vòng SFT, chuyên môn hóa giáo viên, chưng cất on-policy, rồi học tăng cường tác nhân — biến thành tác nhân gọi công cụ LFM2.5-2.6B. Cùng gia đình, cùng giấy phép, cùng trang tải xuống. Nhưng công việc hoàn toàn khác nhau.
Đối chiếu song song: bảy phương diện, hai công việc
Vì hai trạm kiểm soát đảm nhiệm những công việc khác nhau, sự so sánh trung thực giúp phân biệt rõ vai trò của cả hai bên:
• Nó là gì — LFM2.5-8B-A1B-DSpark là mô hình nháp giải mã suy đoán 0.3B; LFM2.5-2.6B-Base là mô hình nền tảng tiền huấn luyện thô 2.69B.
• Nó chạy cùng với gì — bản nháp DSpark kết hợp với MoE LFM2.5-8B-A1B (tổng 8.3B, ~1.5B kích hoạt cho mỗi token); bản Base chạy độc lập, nhưng chỉ dưới dạng dự đoán văn bản chưa được tinh chỉnh.
• Sử dụng độc lập — DSpark tự nó không tạo ra gì; nó chỉ tăng tốc một mục tiêu. Base tạo ra văn bản nhưng không có hành vi sản phẩm hữu ích — không tuân theo chỉ dẫn, không gọi công cụ, không có mẫu trò chuyện.
• Chất lượng đầu ra — DSpark kế thừa đầu ra tham lam chính xác của mục tiêu, vì mọi token được đề xuất đều được xác minh; Base không có bất kỳ benchmark nào được công bố trên bất kỳ tác vụ nào, theo thiết kế.
• Tốc độ — DSpark thêm mức trung bình đo bởi nhà cung cấp là 2.54× trên H100 (lên tới 3.18× trên MATH500) và 1.18× trên M4 Max cho mục tiêu của nó, chưa được tái lập; Base không có bất kỳ tuyên bố nào về tốc độ suy luận.
• Dung lượng bộ nhớ — DSpark thêm khoảng 0,3GB trọng số draft bên cạnh mô hình đích; Base là mô hình 2,69B đầy đủ, chạy được trong dưới 2,5GB, nền tảng nghiêm túc nhỏ nhất trong dòng sản phẩm.
• Định dạng và tính khả dụng — DSpark được phát hành dưới dạng Safetensors và GGUF với hỗ trợ SGLang và llama.cpp ngay từ ngày đầu; Base được phát hành dưới dạng Safetensors cùng với GGUF, ONNX và MLX và chạy trên Transformers, vLLM, SGLang, llama.cpp và MLX. Hiện tại, không mô hình nào được phục vụ bởi bất kỳ nhà cung cấp suy luận nào — cả hai đều là các checkpoint tự lưu trữ.

Những con số duy nhất trong cuộc so sánh này đến từ một phòng thí nghiệm.
Mọi số liệu định lượng ở đây là đo lường từ một nhà cung cấp duy nhất, được thực hiện vào ngày bản nháp được phát hành và chưa được tái lập độc lập — hãy xem đây là kết quả hứa hẹn, chưa được xác minh. Liquid đã đo LFM2.5-8B-A1B-DSpark ở kích thước lô 1, nhiệt độ 0, trên một H100 80GB ở BF16 dưới SGLang và trên MacBook Pro M4 Max ở FP16 GGUF dưới các nhân Metal thử nghiệm của llama.cpp. Trên H100, cặp này đạt trung bình 2,54× (418 → 1.074 token mỗi giây), với kết quả đơn lẻ tốt nhất là 3,18× trên MATH500 (428 → 1.362 token/giây) và tỷ lệ chấp nhận trung bình khoảng 7 trên 10 token được đề xuất. Trên M4 Max, cùng cặp này chỉ đạt trung bình 1,18× (90 → 106 token/giây) — trường hợp cạnh trên thiết bị mà chính Liquid đã nêu, vì việc xác minh một khối sẽ kích hoạt nhiều chuyên gia hơn trong backend MoE Metal hiện tại và chuyển nhiều lưu lượng trọng số hơn qua bus bộ nhớ.
{{1}}Phía Base của cặp so sánh này không có con số nào cả, và chính sự vắng mặt đó là thông số kỹ thuật.{{/1}} {{2}}LFM2.5-2.6B-Base được tiền huấn luyện, không phải hậu huấn luyện; nó chưa từng được đánh giá cho hội thoại, sử dụng công cụ hay hành vi tác tử, vì không ai có ý định dùng nó theo cách đó.{{/2}} {{3}}Những con số có ý nghĩa của nó thuộc về kiến trúc: 2.69B tham số, ngữ cảnh 128K, tokenizer 16 ngôn ngữ, dưới 2.5GB để chạy.{{/3}} {{4}}Bạn không benchmark một mô hình nền tảng; bạn benchmark thứ bạn tinh chỉnh nó thành.{{/4}}
Có một sự trớ trêu trong nội bộ dòng mô hình đáng nêu ra trước khi bạn quyết định bất cứ điều gì. Bản nháp mà bài viết này đề cập — bản dành cho 8B-A1B — chính là bản đạt được lợi ích ít nhất trên laptop (1.18×), trong khi bản nháp anh em dành cho dòng 2.6B, vốn tăng tốc cho bản hậu huấn luyện anh em của chính Base này, đạt trung bình 2.27× trên M4 Max với mức giảm 57% độ trễ gọi hàm đa công cụ. Nếu thiết bị được nhắc đến là điện thoại hoặc laptop thay vì một cỗ máy GPU, thì hướng đi 2.6B mới là nơi câu chuyện tốc độ thực sự sống động.

Vậy bạn tải về cái nào?
Bạn không bao giờ phải chọn trực tiếp giữa hai điều này, vì chúng không phải là các lựa chọn thay thế — nhưng bạn phải biết mình đang ở trong công việc nào:
Nếu bạn phục vụ LFM2.5-8B-A1B trên các GPU bạn sở hữu và muốn có nhiều token hơn mỗi giây từ cùng một silicon, LFM2.5-8B-A1B-DSpark là một thành phần bổ sung có thể tháo gỡ: biên dịch SGLang hoặc llama.cpp với các tích hợp DSpark ngày 20 tháng 8, chỉ định tên bản nháp trong lệnh khởi chạy, giữ nguyên giải mã tham lam, và kích thước khối sẽ được đọc tự động từ cấu hình của bản nháp. Lợi ích là thông lượng tăng gấp khoảng 2,5 lần mà đầu ra không đổi; nhược điểm là thêm 0,3GB trọng số và cần một bản build đủ mới để chứa các PR. Gỡ hai cờ suy đoán là bạn quay trở lại mục tiêu thông thường.
Nếu bạn muốn tự xây dựng một chuyên gia riêng — một mô hình miền, một trợ lý ngôn ngữ tùy chỉnh, một bản fine-tune trên dữ liệu độc quyền — thì LFM2.5-2.6B-Base là một trong những điểm khởi đầu nghiêm túc rẻ nhất trong hệ sinh thái open-weights: 2.6B, dưới 2.5GB, ngữ cảnh 128K, một tokenizer đa ngôn ngữ. Checkpoint DSpark hoàn toàn không thể giúp bạn làm điều đó, vì nó không phải là một mô hình base.
Nếu bạn thực sự muốn agent trên thiết bị của Liquid — gọi công cụ, tác vụ nhiều bước — thì cả hai đều không phải thứ bạn cần. Bạn cần bản LFM2.5-2.6B đã hậu huấn luyện, và sau đó bạn có thể quyết định có gắn thêm bản draft riêng của nó hay không. Base là nguyên liệu thô cho những người muốn huấn luyện; bản draft 8B-A1B là bộ phận tăng tốc cho những người đã triển khai MoE. Sai lầm là tải Base vì bạn muốn một agent nhanh hơn, hoặc tải bản draft vì bạn muốn một nền tảng để huấn luyện.

Nơi hai thứ kết nối — và vai trò của bộ định tuyến
Cả hai checkpoint đều là những câu chuyện self-host. Bản nháp là một phụ kiện của tầng serving, chỉ tồn tại bên trong stack SGLang hoặc llama.cpp của riêng bạn; còn Base là một sản phẩm của quá trình huấn luyện. Cả hai đều không xuất hiện trong bất kỳ danh mục hosted nào, và cũng không có giá niêm yết theo token. Điều đó có nghĩa trong thực tế là dù đi theo hướng nào, chúng cũng sẽ nằm ngay cạnh các mô hình hosted mà bạn vẫn đang gọi — và chính cái hỗn hợp đó là thứ mà một tầng định tuyến tồn tại để gom về một mối.
Về phía phục vụ, hiệu quả kinh tế của mô hình draft rất đơn giản và thực tế: cùng một GPU tạo ra gấp 2,5 lần token mỗi giây nghĩa là thời gian giảm 2,5 lần và số GPU cho cùng một khối lượng công việc giảm khoảng 2,5 lần, mà chất lượng không đổi. Nhưng đòn bẩy đó chỉ tồn tại nếu bạn tự vận hành suy luận. Ngay khi bạn gọi 8B-A1B qua một API, nhà cung cấp giữ lại phần tăng tốc — và đây là lúc so sánh phía API trở thành điều quan trọng: nhà cung cấp tính phí bao nhiêu, và liệu mức giảm giá có đến tay bạn ngay trong ngày công bố hay không. Đó chính là ý nghĩa của bộ định tuyến chuyển tiếp trực tiếp: một API cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được truyền nguyên vẹn với 0% phụ phí để đợt giảm giá từ họ có hiệu lực ngay phía bạn, cùng cơ chế chuyển đổi dự phòng tự động để cú tăng vọt độ trễ của một nhà cung cấp không trở thành độ trễ của bạn. Bạn cũng có thể đưa hệ thống LFM tự lưu trữ của mình ra phía trước qua cùng một endpoint — đó là cách bạn thử một mô hình draft hoàn toàn mới với lưu lượng thực mà không cần đặt cược một đường vận hành sản xuất vào nó.
LFM2.5-8B-A1B-DSpark và LFM2.5-2.6B-Base có chung một cái tên nhưng đảm nhiệm hai vai trò đối lập: một là bộ phận tăng tốc gắn vào MoE biên, còn lại là bộ não chưa được tinh chỉnh mà từ đó agent 2.6B hình thành. Cả hai đều không thể tự vận hành. Chọn drafter để tăng tốc một MoE mà bạn đã phục vụ trên GPU, chọn Base để tinh chỉnh một nền tảng 2.6B thành thứ của riêng bạn, và bỏ qua cả hai nếu thứ bạn cần là một agent hoạt động được — vì điểm chung duy nhất của hai checkpoint này là cả hai, tự mình, đều chẳng làm được gì hữu ích.
Câu hỏi thường gặp
Tôi có thể chạy LFM2.5-8B-A1B-DSpark một mình không?
Không. Đây là mô hình draft không có đầu ra độc lập — nó đề xuất các token ứng viên mà mô hình đích LFM2.5-8B-A1B sau đó xác minh, vì vậy nó chỉ tồn tại bên trong một ngăn xếp phục vụ giải mã suy đoán được xây dựng trên các tích hợp SGLang hoặc llama.cpp ngày 20 tháng 8. Chỉ tải riêng nó về sẽ không cho bạn thứ gì có thể truy vấn.
LFM2.5-2.6B-Base có phải là checkpoint chạy trực tiếp trên thiết bị như một agent không?
Không phải nguyên trạng. Base là nền tảng tiền huấn luyện thô, không có tinh chỉnh theo chỉ dẫn và không có mẫu trò chuyện. Mô hình chạy như tác nhân trên thiết bị của Liquid là LFM2.5-2.6B sau hậu huấn luyện, được tạo ra từ Base bằng quy trình hậu huấn luyện bốn giai đoạn — và, nếu bạn muốn nó nhanh hơn, kết hợp với bản nháp LFM2.5-2.6B-DSpark.
