Một thẻ tiêu đề anh hùng cho bài so sánh LFM2.5-8B-A1B-DSpark vs Qwen3-8B, với phụ đề 'Bản nháp giúp tăng tốc mô hình, đối đầu với mô hình 8B mà mọi người đều đang chạy', hiển thị bên trái một hộp 'Draft 327M' gửi các chip token vào thẻ MoE 'LFM2.5-8B-A1B' dạng các ô xếp chồng với kim đồng hồ tốc độ cao bên dưới nhãn 'SPECULATIVE DECODING', và bên phải một thẻ bong bóng trò chuyện có nhãn 'Qwen3-8B' với biểu tượng tia sáng và đồng hồ bên dưới nhãn 'GENERALIST MODEL', kèm thẻ ngày 'August 2026' và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

LFM2.5-8B-A1B-DSpark vs Qwen3-8B: Bản nháp tăng tốc mô hình, đấu với 8B mà ai cũng đang chạy

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

{{1}}Liquid AI đã phát hành checkpoint nháp LFM2.5-8B-A1B-DSpark vào ngày 20 tháng 8 năm 2026{{/1}} — {{2}}một công cụ hỗ trợ giải mã suy đoán với 327,7 triệu tham số{{/2}} giúp {{3}}MoE biên LFM2.5-8B-A1B{{/3}} tạo sinh nhanh hơn tới 3,18 lần trên một GPU H100. Để cuộc so sánh này có thể trung thực, một sự thật phải được đặt lên bàn: {{4}}checkpoint DSpark không phải là một mô hình bạn có thể gọi{{/4}}. Nó chỉ tăng tốc một mô hình khác. Vì vậy, {{5}}câu hỏi triển khai thực tế mà bản phát hành này hướng tới{{/5}} là câu hỏi mà hầu hết các đội ngũ đã cân nhắc suốt cả năm — LFM2.5-8B-A1B hay Qwen3-8B, hai mô hình trọng số mở thuộc phân khúc 8B ở những thời điểm rất khác nhau trong vòng đời của chúng.

Khung so sánh ở đây quan trọng hơn thường lệ, vì hai bên không phải là cùng một loại đối tượng. Qwen3-8B là một mô hình hoàn chỉnh, có thể triển khai mà bạn có thể tự lưu trữ hoặc mua token ngay hôm nay. LFM2.5-8B-A1B cũng là một mô hình hoàn chỉnh, có thể triển khai — bản nháp DSpark là một phần bổ sung cho nó, không phải là một phiên bản của nó. Mọi thứ mà bản nháp hứa hẹn đều do nhà cung cấp đo lường và mới chỉ có một ngày tuổi; mọi thứ về kho lưu trữ và định dạng chỉ đơn giản là để kiểm tra. Bài viết này giữ hai phạm trù đó tách biệt.

Đầu tiên, từ "DSpark" không phải là danh từ trong câu này.

Speculative decoding chạy một mô hình nháp giá rẻ phía trước mô hình thật: mô hình nháp đoán trước vài token tiếp theo, mô hình đích xác minh toàn bộ khối trong một lượt truyền tiến duy nhất và giữ những gì nó đồng thuận. Khi dự đoán chính xác, bạn có thể tiến được nhiều token với giá của một lần nạp trọng số, nhờ đó thông lượng tăng lên mà không cần đụng tới trọng số của mô hình đích — và vì mô hình đích kiểm tra từng token đề xuất, đầu ra khi giải mã tham lam (greedy decoding) giống hệt khi chỉ chạy LFM2.5-8B-A1B. Liquid gọi đây là "lossless by construction" (không mất mát về mặt thiết kế), và đó chính là lý do vì sao việc gắn thêm một mô hình nháp là an toàn.

LFM2.5-8B-A1B-DSpark của Liquid là một mô hình draft có chủ đích nhỏ gọn: năm lớp chỉ dùng cơ chế attention, một khối chín token đề xuất cho mỗi bước, và một đầu Markov trên từ vựng 128.000 token của mô hình đích, được huấn luyện trong 15 epoch trên hỗn hợp dữ liệu chat, mã nguồn và gọi hàm, với các checkpoint được chọn theo tỷ lệ chấp nhận thay vì theo loss. Đây là một trong ba bản draft mà hãng phát hành vào ngày hôm đó, cùng với LFM2.5-1.2B-Instruct và LFM2.5-2.6B, mỗi bản đều có định dạng Safetensors và GGUF với hỗ trợ SGLang và llama.cpp ngay từ ngày đầu. Điều này cũng quan trọng đối với bất kỳ ai đang đọc một bài so sánh với mô hình lớp 8B: nó không được phục vụ bởi bất kỳ nhà cung cấp suy luận nào và không có giá cho mỗi token. Nó chỉ tồn tại bên trong ngăn xếp giải mã suy đoán của chính bạn.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Hai mô hình thực sự được triển khai

Gạt bản nháp sang một bên và sự so sánh thực sự nằm giữa mô hình mà nó tăng tốc và mô hình đương nhiệm. Cả hai đều có trọng số mở và thuộc lớp khoảng 8B, và rồi sự giống nhau kết thúc tại đó:

• Kiến trúc — LFM2.5-8B-A1B là một MoE thưa với 8.3B tổng tham số nhưng chỉ có ~1.5B tham số hoạt động cho mỗi token; Qwen3-8B là một mô hình dense 8.2B kích hoạt mọi tham số trên mọi token.

• Phát hành — LFM2.5-8B-A1B ra mắt ngày 28 tháng 5 năm 2026; Qwen3-8B ra mắt tháng 4 năm 2025 và đã hơn một năm tuổi, đã bị xem là lỗi thời trên một số nền tảng phục vụ.

• Ngữ cảnh — LFM2.5-8B-A1B cung cấp ngữ cảnh gốc 128K với bộ từ vựng 128K token; Qwen3-8B cung cấp 32K gốc, có thể mở rộng lên khoảng 128K thông qua YaRN.

• Suy luận — LFM2.5-8B-A1B là mô hình suy luận phát ra chuỗi suy nghĩ tường minh; Qwen3-8B chuyển đổi giữa chế độ suy nghĩ và không suy nghĩ theo từng yêu cầu.

• Trí tuệ — theo Artificial Analysis, LFM2.5-8B-A1B đạt chỉ số Trí tuệ là 8 và Qwen3-8B đạt 8–8.3, cả hai đều dưới mức trung vị là 9 cho các mô hình open-weight tương đương; cả hai đều không phải là trí tuệ tiên phong, và cả hai đều trung thực về điều đó.

• Tốc độ — theo Artificial Analysis, LFM2.5-8B-A1B xuất ra khoảng 340 token mỗi giây trên các nhà cung cấp; Qwen3-8B đạt khoảng 37–40 token mỗi giây, một trong những mô hình chậm nhất trong phân khúc của nó.

• Giấy phép — LFM2.5-8B-A1B được phát hành theo Giấy phép Mở LFM v1.0 của Liquid; Qwen3-8B theo Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

Tốc độ chính là điểm mà cuộc đua này không còn sát nút nữa.

Lý do lớn nhất khiến cuộc thảo luận về mô hình open-weight lớp 8B chuyển hướng là tốc độ trên mỗi đơn vị bộ nhớ. Qwen3-8B là một mô hình dense: mỗi token mà nó tạo ra đều truyền toàn bộ 8,2B trọng số qua bus bộ nhớ, đó là lý do vì sao nó chậm so với kích thước của nó và vì sao nó cần VRAM thật sự. LFM2.5-8B-A1B định tuyến mỗi token qua khoảng 1,5B tham số hoạt động, đó chính là toàn bộ điểm thiết kế — một MoE trên thiết bị luôn nhanh và nhỏ gọn. Tuyên bố của chính Liquid còn đi xa hơn: khoảng 253 token mỗi giây trên CPU M5 Max với dưới 6GB bộ nhớ, do nhà cung cấp báo cáo. Về thông lượng thô của mô hình triển khai được, bản nháp thậm chí không quan trọng trong phần này của câu chuyện — MoE đã nhanh hơn vài lần so với mô hình dense 8B trước khi bạn thêm cơ chế suy đoán.

Về giá cả, cả hai đều là mô hình trọng số mở, nên việc tự lưu trữ mô hình nào cũng chỉ tốn đúng chi phí phần cứng bạn sở hữu. So sánh về dịch vụ lưu trữ có sự chênh lệch rõ về mức độ sẵn có: Qwen3-8B được phục vụ qua API của Alibaba với giá niêm yết 0,18 USD cho mỗi triệu token đầu vào và 2,10 USD cho mỗi triệu token đầu ra, cùng với một loạt nhà cung cấp mô hình mở bên thứ ba; còn LFM2.5-8B-A1B không có mức giá token lưu trữ chính hãng nào đáng chú ý, và bản draft thì hoàn toàn không có gì. Điều đó có nghĩa cách thực tế mà hầu hết các đội nhóm sẽ vận hành mô hình edge MoE của Liquid hiện nay là tự lưu trữ — trên laptop, một thiết bị edge, hoặc một GPU họ sở hữu — và đó chính xác là thiết lập mà bản draft DSpark trở thành biến số quan trọng.

Bản dự thảo thực sự thay đổi điều gì cho quyết định này

Mô hình nháp chỉ thay đổi một trục duy nhất: tốc độ tạo token của LFM2.5-8B-A1B trong một ngăn xếp phục vụ mà bạn kiểm soát. Nó không làm cho mô hình thông minh hơn và không thay đổi câu trả lời — đầu ra greedy giống hệt từng bit so với chỉ dùng mô hình đích. Nơi nó thực sự hữu ích là phục vụ GPU ở thông lượng một yêu cầu: Liquid đo được mức trung bình 2.54× trên một H100 qua năm benchmark (418 → 1,074 token mỗi giây), với mức tốt nhất là 3.18× trên MATH500, ở batch size 1 và temperature 0. Nơi nó hầu như không giúp gì là Apple silicon: cùng mô hình đó chỉ đạt trung bình 1.18× trên M4 Max (90 → 106 tok/s), vì việc xác minh một khối token nháp kích hoạt nhiều expert hơn trong backend Metal MoE hiện tại của llama.cpp và làm tăng lưu lượng trọng số — chính là chi phí mà speculative decoding nhằm bù đắp. Tất cả những con số này đều là số liệu từ nhà cung cấp vào ngày phát hành, chưa được kiểm chứng độc lập.

Sự phân tách đó ánh xạ trực tiếp thành một quy tắc quyết định. Nếu bạn phục vụ LFM2.5-8B-A1B trên một GPU bạn sở hữu, bản nháp (draft) là một đòn bẩy chi phí thực sự — khoảng 2.5× token mỗi giây từ cùng một silicon, với đầu ra không đổi, và bạn chỉ cần một bản build có tích hợp DSpark ngày 20 tháng 8. Nếu bạn gọi mô hình qua API thay vào đó, nhà cung cấp giữ lại phần tăng tốc và bản nháp không liên quan đến bạn. Và nếu thiết bị là máy tính xách tay hoặc điện thoại, bản nháp cho riêng mô hình này gần như không có tác dụng vào thời điểm hiện tại; các bản nháp anh em dành cho các mô hình dense LFM2.5-1.2B-Instruct và LFM2.5-2.6B mới là những bản mang lại hiệu quả trên thiết bị, lần lượt ở mức 2.54× và 2.27×. Về phần Qwen3-8B, nó không cần bản nháp nào cả — nó chỉ đơn giản là một mô hình chậm hơn, dense hơn và không yêu cầu giải mã suy đoán (speculative decoding) để có thể triển khai.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

Sự lựa chọn, một năm sau khi Qwen3-8B ra đời

Qwen3-8B là lựa chọn mặc định nhàm chán nhưng đúng đắn: trưởng thành, Apache-2.0, 119 ngôn ngữ, chế độ suy luận và không suy luận, được phục vụ ở khắp nơi, và vẫn là một mô hình đa năng hoàn toàn tốt cho trò chuyện, mã và văn bản có cấu trúc. Vấn đề của nó là tuổi đời và tốc độ — một mô hình dense 8B đã 16 tháng tuổi, chậm so với phân khúc và đã bị ngừng hỗ trợ trên một số nền tảng, một tín hiệu bảo trì đáng được xem xét nghiêm túc nếu bạn đang bắt đầu một dự án greenfield ngay hôm nay.

LFM2.5-8B-A1B là canh bạc mới hơn, hẹp hơn: {{1}}một MoE ưu tiên edge được xây dựng để gọi công cụ và tuân theo chỉ dẫn với tốc độ cao trên phần cứng tiêu dùng{{/1}}, với mô hình nháp DSpark như một tùy chọn tăng tốc phục vụ cho trường hợp tự lưu trữ bằng GPU. Đây không phải là mô hình thông minh hơn — {{2}}cả hai đều nằm dưới mức trung vị của các mô hình trọng số mở trên Artificial Analysis{{/2}} — nhưng nó nhanh hơn đáng kể với bộ nhớ trên mỗi token chỉ bằng một phần nhỏ, đây chính là sự đánh đổi quan trọng đối với các tác nhân chạy trên thiết bị. Những hạn chế của nó là hình ảnh phản chiếu của Qwen3-8B: {{3}}bản phát hành mới hơn, không có giá lưu trữ từ nhà cung cấp chính thức, và câu chuyện giải mã suy đoán mà số liệu của nó chưa ai ngoài nhà cung cấp tái lập được{{/3}}.

Lớp định tuyến bên dưới vẫn không đổi trong cả hai trường hợp. Hiện tại, cả LFM2.5-8B-A1B lẫn Qwen3-8B đều không nằm trong danh mục lưu trữ của OrcaRouter, nên cách diễn đạt trung thực là những gì một router làm cho tổ hợp này: một API duy nhất trên hơn 200 mô hình lưu trữ với giá niêm yết của nhà cung cấp được truyền thẳng qua với mức phụ giá 0%, nhờ đó một đợt giảm giá của nhà cung cấp có hiệu lực trên nền tảng ngay trong ngày được công bố; tự động chuyển đổi dự phòng để một mô hình mới chưa được kiểm chứng là thứ bạn thử nghiệm với lưu lượng thực tế thay vì thứ bạn đặt cược cả một tuyến sản xuất vào; và một DSL định tuyến có thể đứng trước một mô hình bạn tự lưu trữ, và đó là cách một hệ thống LFM2.5-8B-A1B tự lưu trữ cùng tồn tại với các endpoint lưu trữ đằng sau một khóa duy nhất.

{{1}}Nếu bạn đang xây dựng cho laptop hoặc thiết bị edge và quan tâm đến tốc độ gọi công cụ{{/1}}, {{2}}LFM2.5-8B-A1B là hướng nên thử nghiệm{{/2}}, {{3}}và mô hình draft là một mức tăng 2.5× miễn phí trên đường phục vụ GPU khi đến lúc{{/3}}. {{4}}Nếu bạn muốn một mô hình đa năng mà bạn có thể yên tâm chọn{{/4}}, {{5}}Qwen3-8B vẫn hoạt động tốt — chỉ cần biết rằng đây là mô hình từ đầu năm 2025 mà hệ sinh thái đang bắt đầu loại bỏ dần{{/5}}. {{6}}Điều duy nhất mà cả mô hình draft lẫn mô hình đích đều không thay đổi được là thực trạng trung thực của bằng chứng{{/6}}: {{7}}mọi điểm nhanh của bản phát hành DSpark đều là số đo của một nhà cung cấp duy nhất trong một ngày duy nhất{{/7}}, {{8}}và các bài benchmark độc lập là vấn đề còn bỏ ngỏ{{/8}} {{9}}quyết định mức độ bạn thực sự tin vào những điều này{{/9}}.