Thẻ tiêu đề chính cho bài viết {{1}}'Spark3 — BÁO CÁO RÒ RỈ'{{/1}} kèm huy hiệu {{2}}'CHƯA XÁC MINH'{{/2}}, phụ đề {{3}}'Các mô hình nhỏ Spark3-1.7B và Spark3-4B của iFLYTEK đang được tích hợp vào vLLM — PR nói gì và điều gì vẫn còn chưa rõ'{{/3}}, ba chip hiển thị {{4}}'Nguồn: vLLM PR #53373'{{/4}}, {{5}}'22 Thg 8, 2026'{{/5}} và {{6}}'XHToken / iFLYTEK'{{/6}}, thẻ bên trái hiển thị {{7}}'Tín hiệu: một PR vLLM mở thêm hỗ trợ Spark3 gốc cho mô hình không có trọng số công khai'{{/7}}, và thẻ bên phải hiển thị {{8}}'Dự kiến: 1.7B và 4B, ngữ cảnh 1M token gốc, ngân sách tư duy 4 cấp độ'{{/8}}. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Spark3 Rò Rỉ: Mô Hình Nhỏ 1.7B và 4B Của iFLYTEK Đang Được Tích Hợp Vào vLLM

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Spark3 không có trọng số công khai, không có model card, không có thông báo chính thức — vậy mà tuần này một pull request đã xuất hiện trong engine suy luận vLLM mô tả chi tiết đáng kể hai mô hình, Spark3-1.7B và Spark3-4B. Pull request #53373 trong kho lưu trữ vLLM, "[Model] Add Spark3 Model," thêm hỗ trợ phục vụ gốc cho kiến trúc Spark3: sliding-window attention, ngân sách tư duy có thể kiểm soát với bốn cấp độ, ngữ cảnh triệu token gốc trên cả hai kích thước, và một model ID trỏ tới iFLYTEK. Không điều nào trong số đó được nhà cung cấp xác nhận, và chưa có gì được phát hành. Đây là bài viết dạng what-we-know-so-far: pull request là có thật, và mọi thứ mà các mô hình được cho là làm đều chưa được xác minh cho đến khi iFLYTEK — hoặc bên nào phát hành Spark3 — thực sự công bố trọng số.

Vụ rò rỉ: một pull request giống như một bảng thông số kỹ thuật

Tín hiệu là một PR vLLM đang mở, được gửi bởi một người dùng GitHub tên là KnightYao (một nhà đóng góp sống tại Hefei, ghi danh tại Đại học Khoa học và Công nghệ Trung Quốc), và tính đến ngày 23 tháng 8 năm 2026, PR vẫn chưa được hợp nhất. Một người bảo trì vLLM đã yêu cầu thay đổi vào ngày 22 tháng 8 với ghi chú "tạm hoãn để thảo luận." PR còn sớm và đang gây tranh cãi, điều này bình thường đối với loại tích hợp này — và nó cũng chi tiết một cách bất thường đối với một PR khung phần mềm về một mô hình mà không ai bên ngoài phòng thí nghiệm có thể tải xuống.

Bản diff này chạm vào tám tệp. Nó bổ sung một triển khai Spark3ForCausalLM trong bộ thực thi mô hình của vLLM, một Spark3Config gốc được đăng ký trong sổ đăng ký cấu hình và mô hình của vLLM, hỗ trợ attention cửa sổ trượt và attention đầy đủ cùng với cổng đầu ra attention theo từng head, nạp trọng số song song tensor và song song pipeline, và một trình phân tích công cụ XML Spark3 để các lời gọi công cụ của mô hình có thể được giải mã một cách có cấu trúc. Nó cũng thêm một dòng vào tài liệu về các mô hình được hỗ trợ của vLLM, liệt kê checkpoint là XHToken/Spark3-1.7B. Phần mô tả thậm chí còn tuyên bố rằng tích hợp này đã được đo hiệu năng: 500 yêu cầu đồng thời, thành công 100%, khoảng 106 yêu cầu mỗi giây và 13.5K token đầu ra mỗi giây trên thiết lập thử nghiệm của tác giả. Những con số này là do chính người viết PR tự báo cáo, không phải là một điểm chuẩn độc lập, và chúng nên được hiểu theo đúng nghĩa đó.

Tại sao iFLYTEK là công ty mẹ hiển nhiên — nhưng chưa được xác nhận

Không có gì trong PR nêu tên nhà cung cấp. Nhưng ID checkpoint mà PR đăng ký, XHToken/Spark3-1.7B, nằm dưới tổ chức XHToken trên Hugging Face, và tổ chức đó là của iFLYTEK: trang của tổ chức liệt kê đây là một công ty, có liên kết đến opensource.iflytek.com, và hiện hiển thị 0 mô hình công khai và 0 bộ dữ liệu công khai. "XH" là cách viết tắt tự nhiên của 星火 (Xinghuo, "Spark"), dòng mô hình của iFLYTEK. Thêm vào vị trí Hợp Phì (Hefei) của tác giả — iFLYTEK có trụ sở chính tại Hợp Phì — và suy luận này gần như chắc chắn nhất có thể trước khi nhà cung cấp xác nhận.

Điều này phù hợp với xu hướng gần đây của iFLYTEK. Mẫu Spark X2 của công ty, ra mắt vào tháng 2 năm 2026, được định hướng rõ ràng cho các trường hợp sử dụng trong giáo dục, y tế, ô tô và agent, cùng với đó là dòng mô hình trên thiết bị SparkAuto-EMM có kích thước nhỏ từ 0,5B đến 7B. Hai ngày trước khi thông cáo báo chí này được đưa ra, tại hội nghị công bố kết quả kinh doanh giữa kỳ vào ngày 21 tháng 8, iFLYTEK cho biết một mô hình đa năng chủ lực mới được xây dựng hoàn toàn trên nền tảng tính toán nội địa sắp ra mắt, với phiên bản theo giai đoạn dự kiến "trước cuối tháng 8" và ra mắt đầy đủ tại Ngày hội Nhà phát triển 1024 vào tháng 10. Liệu Spark3-1.7B và Spark3-4B có nằm trong đợt phát hành theo giai đoạn đó hay là một nhánh riêng tập trung vào điện toán biên vẫn là câu hỏi mở mà thông cáo báo chí không trả lời.

A two-column infographic titled 'Spark3 — what we know / what we don't'. Left column 'What we know (from the PR)': 'Open vLLM PR #53373, review requested Aug 22, 2026', 'Two sizes: Spark3-1.7B and Spark3-4B', 'Native 1M-token context on both', 'Thinking budget: none / low / medium / high', '200+ languages; strong Gaokao and K-12 results', 'Model ID under iFLYTEK's XHToken HF org'. Right column 'What we don't': 'Release date — no weights, no announcement', 'Vendor confirmation — iFLYTEK has not commented', 'Independent benchmarks — PR figures are self-reported', 'Pricing and license — undisclosed', 'Whether it is the phased flagship due end of August', 'Whether the 1M context is native or rope-scaled'. Footer: 'All model claims unverified; only the pull request is confirmed.' The OrcaRouter logo is composited in the bottom-right corner.

Các mô hình được cho là gì

Các tuyên bố của PR, tất cả đều chưa được xác minh:

Hai kích thước. Spark3-1.7B và Spark3-4B. Cả hai đều được mô tả là các thiết kế ưu tiên hiệu quả, sử dụng attention cửa sổ trượt thay vì bố cục full-attention dày đặc.

Ngữ cảnh gốc 1M token trên cả hai. Không phải là lời hứa ở chế độ mở rộng — PR cho biết ngữ cảnh này là gốc của kiến trúc, điều này sẽ đặt một triệu token trên một mô hình đủ nhỏ để có thể khả thi trên một GPU duy nhất.

Ngân sách suy luận bốn cấp độ. Suy luận có thể được đặt ở mức không, thấp, trung bình hoặc cao, một thiết kế có thể chuyển đổi tư duy cho phép ứng dụng đánh đổi độ sâu suy luận với độ trễ và chi phí mỗi lần gọi.

200+ ngôn ngữ và thế mạnh về kỳ thi Trung Quốc. Thông cáo báo chí tuyên bố hiệu suất trả lời câu hỏi mạnh mẽ ở bậc K-12 và kỳ thi Gaokao — một dấu ấn của iFLYTEK, nhờ vào mảng kinh doanh giáo dục của công ty — cùng khả năng bao phủ đa ngôn ngữ lên tới 200+ ngôn ngữ.

Định hướng về lập trình và tác tử. Các tuyên bố về khả năng tạo mã mạnh mẽ, sử dụng công cụ, thực thi nhiều bước và suy luận ngữ cảnh dài so với kích thước của nó, được hỗ trợ bởi trình phân tích cú pháp XML cho công cụ đi kèm trong cùng PR.

Việc hỗ trợ ngữ cảnh 1M nguyên bản trên một mô hình 1.7B là điều đáng chú ý

Độ dài ngữ cảnh là nơi các mô hình nhỏ bị mắc kẹt. Trong bối cảnh open-weight hiện tại, một mô hình 1.7B–4B thường được phát hành với cửa sổ native 32K–256K: các checkpoint nhỏ của Qwe​n3 có native 32K, mở rộng lên 131K nhờ rope scaling, và ngay cả việc Qwen3.5 nâng native lên 256K trên các biến thể nhỏ cũng chỉ là bước tiến gần đây. Ngữ cảnh triệu token từ trước đến nay vẫn là đặc trưng của mô hình lớn — các checkpoint ngữ cảnh 1M của G​LM có hàng trăm tỷ tham số. Nếu Spark3 thực sự mang lại cửa sổ native 1M trên mô hình 4B, đó sẽ là một thông số thực sự bất thường, và kiến trúc sliding-window attention chính là cách khiến điều đó rẻ về bộ nhớ. Điều cần lưu ý kèm theo: con số 1M native thì dễ viết trong PR nhưng khó để hữu ích trong thực tế. Chất lượng ngữ cảnh dài — liệu mô hình có thực sự tìm và dùng được một thông tin cách 700K token về trước — là câu hỏi tách biệt với việc có bao nhiêu token nằm vừa trong cửa sổ, và hiện vẫn chưa có đánh giá độc lập nào.

Ngân sách tư duy có thể kiểm soát cũng quan trọng vì lý do tương tự. Bốn mức suy luận (không / thấp / trung bình / cao) là một thiết kế tư duy có thể chuyển đổi theo tinh thần của chế độ tư duy bật/tắt của Qwe​n3, nhưng phong phú hơn: thay vì lựa chọn nhị phân, một ứng dụng có thể chọn một mức cho mỗi yêu cầu — không cần tư duy cho bản dịch, mức cao cho một lượt tác vụ đa bước của agent — và chỉ trả chi phí cho phần suy luận mà nó thực sự cần. Với khối lượng công việc dạng agent hoặc xử lý hàng loạt, đây chính xác là núm điều chỉnh biến một mô hình nhỏ "có khả năng nhưng đắt đỏ" thành một mô hình được quản lý chi phí hiệu quả.

Công thức hậu huấn luyện phù hợp với mô hình năm 2026.

Bài PR nói rằng Spark3 được hậu huấn luyện với "Scaled Reinforcement Learning và MOPD." MOPD — Multi-Teacher On-Policy Distillation — là một kỹ thuật thực tế và hiện tại, được mô tả trong một bài báo arXiv (2606.30406): huấn luyện song song các giáo viên RL chuyên sâu theo từng lĩnh vực, sau đó chưng cất chúng trở lại thành một học sinh duy nhất trên các rollout của chính học sinh đó, tối thiểu hóa reverse KL theo từng token so với giáo viên phù hợp cho từng prompt. Đây là công thức của năm 2026 cho phép một mô hình duy nhất kế thừa các kỹ năng toán, lập trình và tác tử mà không có một lần chạy RL nào xung đột với lần chạy khác, và nó đã được công khai ghi nhận trong quá trình hậu huấn luyện của các mô hình như MiMo Flash V2, DeepSeek V4 và Nemotron 3 Ultra. Việc Spark3 trích dẫn cùng công thức đó đặt nó vào thế hệ đó — các mô hình nhỏ, kỹ thuật hậu huấn luyện tiên tiến. Nó cũng có nghĩa là các "tuyên bố mạnh mẽ về lập trình và tác tử" có một cơ chế hợp lý đằng sau. Hợp lý không giống như đã được chứng minh: các tuyên bố vẫn chỉ do nhà cung cấp báo cáo cho đến khi trọng số xuất hiện và các đánh giá độc lập được chạy.

Điều gì thực sự chưa được biết đến?

Hầu như mọi thứ có lịch trên đó:

Ngày phát hành. Không có trọng số trên Hugging Face, không có thông báo, không có lịch trình. Tổ chức XHToken hiện đang trống rỗng.

Xác nhận của nhà cung cấp. iFLYTEK chưa nói gì về Spark3. Liên kết tổ chức XHToken là bằng chứng mạnh mẽ, không phải tuyên bố chính thức.

Liệu đây có phải là flagship theo giai đoạn hay không. Phiên bản theo giai đoạn “cuối tháng Tám” của iFLYTEK cho flagship mới của họ có thể là cái này — hoặc không liên quan. Thông cáo báo chí không đưa ra ngày tháng nào cả.

Giá cả và giấy phép. Không có gì được tiết lộ. Dòng Spark của iFLYTEK trong lịch sử chủ yếu được phục vụ qua API thay vì cung cấp trọng số mở, vì vậy liệu Spark3-1.7B và Spark3-4B là các checkpoint mở hay chỉ là mục tiêu phục vụ nội bộ vẫn là một câu hỏi mở.

Mọi điểm chuẩn. Các số liệu throughput trong PR là bài kiểm tra serving do chính tác giả thực hiện, không phải là một đánh giá độc lập, và không có bảng xếp hạng nào chấm điểm mô hình vì không có mô hình nào tồn tại công khai.

A screenshot of the XHToken Hugging Face organization page (captured August 23, 2026) showing the organization name 'XHToken', listed as a company with a link to opensource.iflytek.com, and the text 'None public yet' with zero public models and zero public datasets — confirming no Spark3 weights have been released.

Xem gì

Tổ chức XHToken trên Hugging Face là kênh phát hành cần theo dõi. Nếu mô hình là thật, trọng số của nó — hoặc ít nhất là một model card — sẽ xuất hiện ở đó, và tổ chức này chuyển từ không có kho lưu trữ công khai nào thành một là tín hiệu quan trọng nhất. Một vài điều cần kiểm tra ngay khi điều đó xảy ra:

Số ngữ cảnh. 1M là native, hay rope-extended kèm đánh đổi chất lượng? PR nói là native; model cards là nơi để xác nhận điều đó.

API ngân sách tư duy. Cách bốn mức độ suy luận được hiển thị — dưới dạng tham số lấy mẫu, trường mẫu trò chuyện, hoặc biến thể mô hình riêng — quyết định mức độ dễ sử dụng thực tế.

Giấy phép. Việc mở trọng số sẽ khiến Spark3 trở thành mô hình dưới 5B đầu tiên hỗ trợ sẵn ngữ cảnh 1M và có thể tự lưu trữ; việc ra mắt chỉ qua API sẽ biến nó thành một loại sản phẩm khác.

Lịch công bố của iFLYTEK. Sản phẩm chủ lực theo giai đoạn được hứa hẹn ra mắt vào cuối tháng 8 và ra mắt đầy đủ tại sự kiện 1024 Developer Day vào tháng 10. Nếu Spark3 là một phần của một trong hai, mô tả chính thức sẽ nói rõ điều mà bài thông cáo báo chí để ngỏ.

Liệu PR có được merge hay không.Việc hỗ trợ vLLM quan trọng như một tín hiệu chất lượng lẫn hạ tầng: runtime đầu tiên có hỗ trợ Spark3 nguyên bản giúp mô hình có thể chạy trong production ngay khi trọng số được phát hành.

Điều một nhà phát triển nên làm ngay bây giờ

Không có gì cả. Không có mô hình nào để gọi, không có trọng số nào để tải về, không có khóa API nào để cấp phát — bất kỳ công cụ nào tuyên bố phục vụ Spark3 hôm nay thực ra đang phục vụ thứ gì đó khác. Điều bạn có thể làm là quyết định cách bạn sẽ đánh giá nó vào ngày nó xuất hiện, vì đây là một mô hình có lời hứa rất dễ kiểm chứng: một mô hình 1.7B hoặc 4B đọc được một triệu token và suy luận ở bốn cấp độ hoặc là một hạng mục mô hình nhỏ thực sự mới, hoặc chỉ là câu chuyện trên bảng thông số kỹ thuật, và sự khác biệt có thể đo lường được trong một buổi chiều trên chính khối lượng công việc của bạn.

Đó cũng chính là nơi mà một lớp định tuyến chứng tỏ giá trị của mình. Trên OrcaRouter, một mô hình không phải là một hợp đồng mà bạn cam kết; nó là một mục trong danh mục mà bạn gọi qua một API duy nhất, và giá niêm yết của nhà cung cấp được truyền thẳng mà không đội giá — nên khi một mô hình mới xuất hiện trong danh mục của nhà cung cấp, giá thực của nó có hiệu lực ngay trong ngày hôm đó ở phía chúng tôi, và việc dùng thử không cần tích hợp thêm lần hai và không cần đàm phán lại. Đối với một mô hình chưa được kiểm chứng như Spark3, cách làm hợp lý cũng chính là cách bạn dùng cho bất kỳ một mô hình rò rỉ đầy triển vọng nào: đặt nó sau cơ chế chuyển đổi dự phòng tự động trong DSL định tuyến, để một phần lưu lượng truy cập vào nó, và giữ một mô hình đã được kiểm chứng ở phía bên kia quy tắc để một kết quả đánh giá tệ, một bất ngờ về giấy phép, hoặc một kết quả ngữ cảnh dài đáng thất vọng chỉ là một thay đổi định tuyến chứ không phải một sự cố. Một khóa, một endpoint, hơn 200 mô hình — và khi Spark3-1.7B hoặc Spark3-4B thực sự chạy được, cơ chế truyền thẳng và chuyển đổi dự phòng sẽ áp dụng cho chúng như mọi mô hình khác.

A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.

Bản tóm tắt trung thực là một câu, không phải một phán quyết: một bản PR khung được viết trong tuần này tuyên bố iFLYTEK có hai mô hình nhỏ với ngữ cảnh một triệu token gốc và ngân sách tư duy bốn cấp, và chưa có một chút bằng chứng nào được công bố để hậu thuẫn cho bất kỳ điều đó. Hãy theo dõi tổ chức XHToken, theo dõi lời hứa cuối tháng Tám của iFLYTEK, và khi các trọng số là thật, hãy đưa chúng qua một quy tắc định tuyến có failover trước khi bạn đặt cược một đường production vào chúng. Đó là toàn bộ kịch bản cho một vụ rò rỉ — tin vào hạ tầng, xác minh mô hình, và giữ lối thoát rẻ.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube