Karta tytułowa hero dla 'Spark-X2.5-4B i Spark-X2.5-1.7B' z podtytułem 'Kompaktowe modele agentowe na urządzenia z natywnym kontekstem 1M'. Po lewej stronie znajduje się mała ikona urządzenia łącząca telefon i laptop, pośrodku zaokrąglona pigułka okna kontekstu oznaczona '1M TOKENS', a po prawej stronie widnieje lista '200+ języków', 'Apache 2.0' i 'Day-0 vLLM'. Logo OrcaRouter jest umieszczone w prawym dolnym rogu.
Guides & Insights

Spark-X2.5-4B i Spark-X2.5-1.7B: Kompaktowe modele agentowe na urządzeniu z natywnym kontekstem 1M

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Spark-X2.5-4B i Spark-X2.5-1.7B zostały udostępnione publicznie 1 września 2026 roku, kiedy to SparkLLM — spółka zależna iFlytek, XHToken (词元星火) — opublikowała oba kompaktowe modele na licencji Apache 2.0, a tego samego dnia wagi, kod i dokumentacja wdrożeniowa trafiły na Hugging Face i GitHub. Najważniejszą specyfikacją jest natywny kontekst 1 000 000 tokenów w modelach na tyle małych, by działać lokalnie na urządzeniu, wspierany przez deklarowane słownictwo obejmujące ponad 200 języków oraz hybrydową architekturę uwagi, którą producent określa jako dostrojoną do pracy agentowej. To, co dziś można ustalić na podstawie repozytoriów, jest znaczące; nie potwierdzono natomiast jeszcze tego, co może rozstrzygnąć wyłącznie niezależne testowanie porównawcze, ponieważ model opublikowany kilka godzin temu nie ma jeszcze neutralnych ewaluacji. Rodzina X2.5 ma również większego członka — Spark-X2.5-293B, zapowiadanego na 7 września.

Co tak naprawdę pokazują repozytoria

Kolekcja Hugging Face obejmuje sześć repozytoriów: dostrojone do instrukcji modele Spark-X2.5-4B i Spark-X2.5-1.7B, ich bazowe punkty kontrolne oraz konwersje GGUF obu modeli. Karta modelu 4B opisuje architekturę hybrydowej uwagi — jedną warstwę pełnej uwagi na trzy warstwy uwagi z przesuwanym oknem — co jest dokładnie taką strukturą, jakiej potrzebujesz, gdy marketingowa liczba wynosi 1M tokenów, ponieważ pełna uwaga nad milionem tokenów byłaby w przeciwnym razie kwadratowo kosztowna. Karta podaje natywne okno kontekstowe do 1M tokenów oraz etap treningu na długich kontekstach, który w trakcie pretreningu wydłużył długość sekwencji do 1M.

Architektura — hybrydowa uwaga, jedna warstwa pełnej uwagi na trzy warstwy przesuwnego okna; BF16 safetensors.

Kontekst — natywnie do 1 000 000 tokenów; trenowanie na długich kontekstach obejmowało sekwencje do 1M.

Języki — ponad 200, według karty modelu (wersja 1.7B również to podaje).

Pretrenowanie — około 20 bilionów tokenów stron internetowych, książek, publikacji naukowych, kodu i materiałów encyklopedycznych, trenowanych end-to-end na klastrach Huawei Ascend.

Po treningu — SFT, a następnie RL na dużą skalę w zakresie rozumowania, kodowania, zachowań agentowych i wykonywania instrukcji, przy czym polityki domenowe są konsolidowane za pomocą techniki, którą autorzy artykułu nazywają MOPD.

Licencja — Apache 2.0 dla obu rozmiarów, bez klauzul dotyczących przychodów ani regionów, jakie kilka innych chińskich laboratoriów dołącza do otwartych wydań.

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

Liczby agentów — i na ile im ufać

Karta modelu publikuje pełną tabelę benchmarków dla agentów i rozumowania, która jest w całości raportowana przez dostawcę i niezreprodukowana – tak właśnie ją oznacz, bo w przypadku dopiero wydanego modelu 4B najciekawsze pytanie brzmi, czy cokolwiek z tego przetrwa kontakt z niezależnymi ewaluacjami. Na tabeli samego dostawcy Spark-X2.5-4B uzyskuje 65,1 w BFCL-V4 (wywoływanie funkcji), 75,1 w τ²-bench (długoterminowe zadania agentowe), 40,9 w BrowseComp, 44,4 w SWE-Bench Pro, 90,7 w AIME 2026, 81,2 w HMMT February 2026, 74,2 w IMO-AnswerBench i 67,4 w GPQA. Model 1.7B ma swój moment w teście inteligentnego domu: 90,3% dokładności wykonywania poleceń end-to-end przy średnim opóźnieniu 0,85 sekundy na zbiorze Domux. Dostawca twierdzi również, że model 4B „dorównuje modelom chmurowym 2–3 razy większym” w implementacji algorytmów, uzupełnianiu i generowaniu kodu – to twierdzenie jest jednocześnie najbardziej użytecznym zdaniem w komunikacie i tym, które najbardziej potrzebuje neutralnej weryfikacji.

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

To, co jest strukturalnie bardziej interesujące niż jakakolwiek pojedyncza liczba, to fakt, że to wydanie od początku skierowane jest do agentów. Karta ta wymienia integrację z harnessami Codex, Claude Code, OpenClaw i Hermes, obsługę wywoływania narzędzi z dedykowanym parserem w SGLang oraz rozumowanie domyślnie włączone (flaga czasu wykonania, enable_thinking, wyłącza je). Innymi słowy, dostawca pozycjonuje model 4B jako model do korzystania z narzędzi, a nie czatbota, co jest prawdziwym zakładem: małe modele agentowe to kierunek, w którym faktycznie zmierza rynek on-device.

Ekosystem Day-0 i historia vLLM

Modele Spark-X2.5-4B i Spark-X2.5-1.7B są obsługiwane w vLLM od samego początku za pomocą ogólnej wtyczki spoza głównego drzewa (out-of-tree), a nie przez scalenie w repozytorium nadrzędnym. Integracja znajduje się w repozytorium XHToken/Spark-plugin: sklonuj je i uruchom uv pip install ., a następnie serwuj model za pomocą vllm serve oraz --trust-remote-code przy użyciu niestandardowego szablonu czatu. Ścieżka SGLang to gotowy obraz Dockera uruchamiany z argumentami --tool-call-parser spark25 oraz --context-length 1048576 — pełne okno kontekstu na milion tokenów w poleceniu uruchomieniowym, co jest najszybszym sposobem na weryfikację deklaracji o kontekście na prawdziwym sprzęcie.

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

Poza vLLM i SGLang model działa również na forku llama.cpp, MLX (Apple silicon i Linux CPU), Ollama oraz LM Studio poprzez GGUF, a fine-tuning jest obsługiwany przez fork LLaMA-Factory. Wsparcie sprzętowe to drugi kluczowy temat: NVIDIA, Huawei, Hygon i HOUMO.AI — a także Apple silicon — co ma znaczenie, ponieważ rzadko się zdarza, aby model z chińskiego laboratorium od pierwszego dnia miał dokumentację wdrożeniową dla układów Ascend, Hygon i rodzimych chipów, a nie jedynie obietnicę na przyszłość.

Do czego służy model on-device o 1M tokenów

Długość kontekstu jest kluczową funkcją i wskazuje na konkretne zastosowania. Milion tokenów natywnego kontekstu w modelu 4B oznacza cały kod źródłowy lub obszerny zestaw dokumentów załadowany do modelu działającego lokalnie — bez potoku RAG, bez dzielenia na fragmenty. Prezentacja samego dostawcy, zbudowana na jego narzędziu biurowym Loomy, pokazuje, jak model 4B pisze skrypt agregujący arkusz sprzedaży, wyodrębnia kluczowe metryki i trendy oraz generuje dwujęzyczny raport liczący około 3000 słów. Aspekt robotyczny stanowi drugą połowę: oba rozmiary są pozycjonowane pod roboty i brzegowe przetwarzanie percepcji oraz wykonywania działań, obejmujące sterowanie, śledzenie celów i nawigację, co jest wiarygodną niszą dla modelu 1.7B odpowiadającego w mniej niż sekundę.

Większa rozgrywka: Spark-X2.5-293B

Dwa małe modele to ruch otwierający. 7 września SparkLLM zapowiada wydanie Spark-X2.5-293B, modelu bazowego z 293 miliardami parametrów, który — zgodnie z ogłoszeniem — ma ulepszone możliwości kodowania i działania agentowego. Małe modele X2.5 to w praktyce lokalna połowa dwupoziomowej układanki; to duży model wyznacza pułap możliwości całej rodziny. Traktowanie modeli 4B i 1.7B jako całej premiery oznaczałoby przeoczenie kierunku rozwoju.

Jak to wypróbować i na co uważać

API jest dostępne na platformie Xingchen MaaS firmy iFlytek i przez ograniczony czas jest bezpłatne; wagi są w Hugging Face, ModelScope i bibliotece Ollama. Jeśli chodzi o routing, Spark-X2.5-4B jest zbyt nowy, by jakikolwiek agregator już go obsługiwał — OrcaRouter dziś go nie routuje i nic na tej stronie nie powinno być czytane tak, jakby to robił. Ale gdy dostawca objęty routingiem go doda, ekonomia zmieni się w przewidywalny sposób: OrcaRouter przekazuje dalej cenę katalogową dostawcy bez marży, więc płacisz dokładnie tyle, ile zażąda ten dostawca, z tym samym kluczem API, którego już używasz, i masz automatyczne przełączanie awaryjne, dzięki czemu model w dniu premiery nigdy nie musi być ryzykiem produkcyjnym. To jest standardowy sposób, w jaki ten blog patrzy na nowy model, i warto to powiedzieć wprost.

Cztery rzeczy przesądzą, czy to wydanie będzie momentem, czy tylko przypisem. Po pierwsze, czy niezależne ewaluacje — wpis w indeksie Artificial Analysis, miejsce na arenie, powtórzony przebieg τ²-bench — choć w przybliżeniu zbliżą się do deklaracji producenta; wynik 4B na poziomie 90.7 w AIME to duża liczba, a duże liczby z karty premiowej to dokładnie te, które są sprawdzane. Po drugie, czy kontekst 1M tokenów utrzyma się na stosie hybrydowej uwagi przy rzeczywistych obciążeniach serwerowych, nie tylko w poleceniu startowym. Po trzecie, czy wagi trenowane na Ascend będą się dobrze zachowywać na sprzęcie NVIDIA w terenie. Po czwarte, co Spark-X2.5-293B faktycznie dostarczy 7 września. Do tego czasu uczciwe podsumowanie modeli Spark-X2.5-4B i Spark-X2.5-1.7B brzmi: obiecujące, otwarte i całkowicie niezweryfikowane — co w przypadku modelu, który wypuszczono dziś rano, jest właściwym statusem.