Một thẻ tiêu đề chính cho 'Spark-X2.5-4B và Spark-X2.5-1.7B', với phụ đề 'Các mô hình Agent nhỏ gọn chạy trên thiết bị, có ngữ cảnh 1M tích hợp sẵn'. Một biểu tượng thiết bị nhỏ kết hợp điện thoại và máy tính xách tay nằm bên trái; ở giữa là một viên ngữ cảnh bo tròn ghi nhãn '1M TOKENS'; còn phía bên phải liệt kê '200+ ngôn ngữ', 'Apache 2.0' và 'vLLM ngay ngày đầu'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Spark-X2.5-4B và Spark-X2.5-1.7B: Các mô hình Agent nhỏ gọn chạy trên thiết bị với ngữ cảnh gốc 1M

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Spark-X2.5-4B và Spark-X2.5-1.7B được phát hành công khai vào ngày 1 tháng 9 năm 2026, khi SparkLLM — công ty con XHToken (词元星火) của iFlytek — mở mã nguồn cả hai mô hình nhỏ gọn này theo giấy phép Apache 2.0, với trọng số, mã nguồn và tài liệu triển khai được đưa lên Hugging Face và GitHub ngay trong cùng ngày. Điểm đáng chú ý nhất là cửa sổ ngữ cảnh 1.000.000 token nguyên bản trên các mô hình đủ nhỏ để chạy trên thiết bị, được hỗ trợ bởi tuyên bố về kho từ vựng bao phủ hơn 200 ngôn ngữ và thiết kế cơ chế chú ý lai (hybrid-attention) mà nhà cung cấp cho biết được tối ưu cho các tác vụ tác tử AI. Những gì có thể biết được từ các kho mã nguồn cho đến nay là khá đáng kể; điều chưa được xác nhận là mọi thứ chỉ có thể được quyết định thông qua đánh giá chuẩn độc lập, bởi một mô hình vừa được phát hành vài giờ trước thì vẫn chưa có bất kỳ đánh giá trung lập nào. Dòng X2.5 còn sắp có một phiên bản lớn hơn — Spark-X2.5-293B, được công bố ra mắt vào ngày 7 tháng 9.

Những gì các repo thực sự cho thấy

Bộ sưu tập Hugging Face bao gồm sáu kho lưu trữ: các phiên bản được tinh chỉnh theo hướng dẫn là Spark-X2.5-4B và Spark-X2.5-1.7B, các checkpoint gốc của chúng, và bản chuyển đổi GGUF của cả hai. Thẻ của phiên bản 4B mô tả một kiến trúc chú ý lai — một lớp chú ý toàn phần cho mỗi ba lớp chú ý cửa sổ trượt — đây chính xác là dạng kiến trúc bạn cần khi con số tiếp thị là 1 triệu token, vì chú ý toàn phần trên một triệu token nếu không sẽ tốn kém theo cấp số bậc hai. Thẻ nêu rõ cửa sổ ngữ cảnh gốc lên tới 1 triệu token, với giai đoạn huấn luyện ngữ cảnh dài đã mở rộng độ dài chuỗi lên 1 triệu trong quá trình tiền huấn luyện.

Kiến trúc — attention lai, một lớp full-attention cho mỗi ba lớp sliding-window; BF16 safetensors.

Ngữ cảnh — hỗ trợ gốc lên tới 1.000.000 token; quá trình huấn luyện ngữ cảnh dài đã chạy các chuỗi lên tới 1M.

Ngôn ngữ — hơn 200, theo thẻ mô hình (bản 1.7B cũng đưa ra tuyên bố tương tự).

Tiền huấn luyện — khoảng 20 nghìn tỷ token từ các trang web, sách, ấn phẩm học thuật, mã nguồn và tài liệu bách khoa, được huấn luyện từ đầu đến cuối trên các cụm Huawei Ascend.

Hậu huấn luyện — SFT tiếp theo là RL quy mô lớn trên các phương diện suy luận, lập trình, hành vi tác tử và khả năng làm theo chỉ dẫn, với các chính sách theo miền được hợp nhất qua một kỹ thuật mà bài báo gọi là MOPD.

Giấy phép — Apache 2.0 cho cả hai kích thước, không kèm các điều khoản về doanh thu hay khu vực như một số phòng nghiên cứu Trung Quốc khác gắn vào các bản phát hành mở.

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

Các con số về agent — và chúng ta nên tin tưởng chúng đến mức nào

Thẻ mô hình công bố một bảng benchmark đầy đủ về agent và lý luận, và toàn bộ số liệu đều do nhà cung cấp tự báo cáo, chưa được tái lập kết quả — hãy ghi chú rõ điều đó, vì câu hỏi thú vị đối với một mô hình 4B mới ra mắt một ngày là liệu có phần nào trong số đó trụ vững khi va chạm với các đánh giá độc lập. Ngay trên bảng số liệu của chính nhà cung cấp, Spark-X2.5-4B đạt 65.1 trên BFCL-V4 (function calling), 75.1 trên τ²-bench (tác vụ agent tầm xa), 40.9 trên BrowseComp, 44.4 trên SWE-Bench Pro, 90.7 trên AIME 2026, 81.2 trên HMMT February 2026, 74.2 trên IMO-AnswerBench và 67.4 trên GPQA. Bản 1.7B có khoảnh khắc của mình ở bài kiểm tra nhà thông minh: độ chính xác lệnh đầu-cuối 90.3% với độ trễ trung bình 0.85 giây trên bộ dữ liệu Domux. Nhà cung cấp cũng khẳng định bản 4B "sánh ngang các mô hình đám mây có kích thước gấp 2–3 lần" ở khả năng triển khai thuật toán, hoàn thiện và sinh mã — một tuyên bố đồng thời là câu hữu ích nhất trong bản phát hành và lại là câu cần một sự kiểm chứng trung lập nhất.

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

Điều thú vị về mặt cấu trúc hơn bất kỳ con số đơn lẻ nào là bản phát hành này hướng tới các agent ngay từ đầu. Thẻ mô hình liệt kê khả năng tích hợp với các harness Codex, Claude Code, OpenClaw và Hermes, hỗ trợ gọi công cụ với trình phân tích chuyên dụng trong SGLang, cùng khả năng suy luận được bật theo mặc định (một cờ runtime, enable_thinking, sẽ tắt tính năng này). Nói cách khác, nhà cung cấp đã định vị một mô hình 4B như một mô hình sử dụng công cụ, không phải chatbot, và đây là một canh bạc thực sự: các mô hình agent nhỏ là nơi thị trường on-device thực sự đang hướng tới.

Hệ sinh thái Day-0, và câu chuyện về vLLM

Spark-X2.5-4B và Spark-X2.5-1.7B được vLLM hỗ trợ ngay từ đầu thông qua một plugin tổng quát ngoài cây mã nguồn (out-of-tree), thay vì hợp nhất trực tiếp vào nhánh upstream. Phần tích hợp nằm trong repository XHToken/Spark-plugin: bạn clone nó về rồi chạy uv pip install ., sau đó serve mô hình bằng vllm serve--trust-remote-code cùng một chat template tùy chỉnh. Còn với SGLang, bạn khởi chạy một Docker image dựng sẵn với --tool-call-parser spark25--context-length 1048576 — một cửa sổ ngữ cảnh trọn một triệu token ngay trong lệnh khởi chạy; đây cũng là cách nhanh nhất để kiểm chứng tuyên bố về khả năng ngữ cảnh trên phần cứng thực tế.

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

Ngoài vLLM và SGLang, mô hình còn chạy được trên nhánh llama.cpp, MLX (Apple silicon và CPU Linux), Ollama và LM Studio thông qua GGUF, với khả năng tinh chỉnh được hỗ trợ qua một nhánh LLaMA-Factory. Hỗ trợ phần cứng là điểm nhấn còn lại: NVIDIA, Huawei, Hygon và HOUMO.AI — cộng thêm Apple silicon — điều này quan trọng vì {{1}}hiếm khi một mô hình từ phòng thí nghiệm Trung Quốc ra mắt ngay từ ngày đầu với tài liệu triển khai cho Ascend, Hygon và chip nội địa, chứ không phải chỉ là một lời hứa{{/1}}.

Mô hình on-device 1M token dùng để làm gì?

Độ dài ngữ cảnh chính là điểm nhấn, và nó hướng đến các tác vụ cụ thể. Một triệu token ngữ cảnh gốc trên mô hình 4B nghĩa là toàn bộ mã nguồn, hoặc một bộ tài liệu dài, được nạp vào một mô hình chạy cục bộ — không cần đường ống RAG, không cần chia nhỏ. Phần trình diễn của chính nhà cung cấp, được xây dựng trên bộ công cụ văn phòng Loomy của họ, cho mô hình 4B viết một tập lệnh để tổng hợp bảng tính doanh số, trích xuất các chỉ số và xu hướng chính, rồi tạo một báo cáo song ngữ dài khoảng 3.000 từ. Góc độ robot là nửa còn lại: cả hai kích thước đều được định vị cho các tác vụ nhận thức và thực thi trên robot và tại biên, bao gồm điều khiển, theo dõi mục tiêu và điều hướng — một phân khúc hợp lý cho mô hình 1.7B với khả năng phản hồi trong chưa đầy một giây.

Nước đi lớn hơn: Spark-X2.5-293B

Hai mô hình nhỏ là bước đi mở đầu. Vào ngày 7 tháng 9, SparkLLM cho biết sẽ phát hành Spark-X2.5-293B, một mô hình nền tảng có 293 tỷ tham số, theo thông báo, với khả năng lập trình và tác tử (agent) được nâng cấp. Các mô hình nhỏ X2.5 thực chất là nửa phần trên thiết bị của một câu chuyện hai tầng; mô hình lớn là nơi định hình mức trần của cả dòng sản phẩm. Coi bản phát hành 4B và 1.7B là toàn bộ đợt ra mắt sẽ bỏ lỡ định hướng phát triển.

Cách thử nó và những điều cần lưu ý

API đã hoạt động trên nền tảng Xingchen MaaS của iFlytek và miễn phí trong thời gian giới hạn; các trọng số mô hình có trên Hugging Face, ModelScope và thư viện Ollama. Về mặt định tuyến, Spark-X2.5-4B còn quá mới nên chưa có bên tổng hợp nào phục vụ nó — OrcaRouter hiện không định tuyến mô hình này, và không gì trên trang này nên được hiểu như thể OrcaRouter đã định tuyến nó. Nhưng ngày một nhà cung cấp trong mạng định tuyến bổ sung mô hình này, chi phí sẽ thay đổi theo một cách có thể dự đoán: OrcaRouter chuyển tiếp đúng giá niêm yết của nhà cung cấp với mức chênh lệch 0%, nên nhà cung cấp định giá bao nhiêu thì bạn trả bấy nhiêu, với đúng API key bạn vốn đang dùng, và tự động chuyển đổi dự phòng để một mô hình ngày đầu ra mắt không bao giờ phải là một canh bạc khi đưa vào production. Đó là cách tiếp cận chuẩn mà blog này dành cho một mô hình hoàn toàn mới, và điều đó đáng được nói thẳng ra.

Bốn yếu tố sẽ quyết định liệu bản phát hành này là một khoảnh khắc đáng nhớ hay chỉ là một dòng chú thích bên lề. Thứ nhất, liệu {{1}}các đánh giá độc lập{{/1}} — một mục trong bảng chỉ số Artificial Analysis, một vị trí trên arena, một lần chạy τ²-bench được tái lập — có tiến gần đến bảng số mà nhà cung cấp công bố hay không; một mô hình 4B đạt 90.7 trên AIME là một con số lớn, và những con số lớn trên thẻ thông số ngày phát hành chính là những con số bị đem ra kiểm chứng. Thứ hai, liệu {{2}}ngữ cảnh 1M token{{/2}} có trụ vững trên ngăn xếp hybrid-attention dưới tải phục vụ thực tế hay không, chứ không chỉ trong lệnh khởi chạy lúc ra mắt. Thứ ba, liệu {{3}}các trọng số được huấn luyện trên Ascend{{/3}} có hoạt động tốt trên phần cứng NVIDIA khi triển khai thực tế hay không. Thứ tư, {{4}}Spark-X2.5-293B{{/4}} thực sự mang lại điều gì vào ngày 7 tháng 9. Cho đến lúc đó, bản tổng kết trung thực về {{5}}Spark-X2.5-4B và Spark-X2.5-1.7B{{/5}} là: đầy hứa hẹn, mở, và hoàn toàn chưa được xác minh — điều đó, đối với một mô hình được tung ra sáng nay, là trạng thái chính xác.