Karta tytułowa hero artykułu „Spark3 — LEAK REPORT” z plakietką „NIEZWERYFIKOWANE”, podtytułem „Modele Spark3-1.7B i Spark3-4B firmy iFLYTEK są integrowane z vLLM — co mówi PR, a co pozostaje nieznane”, trzema chipami: „Źródło: vLLM PR #53373”, „22 sierpnia 2026” oraz „XHToken / iFLYTEK”, lewą kartą z napisem „Sygnał: otwarty PR do vLLM dodający natywne wsparcie Spark3 dla modelu bez publicznych wag” i prawą kartą z napisem „Oczekiwane: 1.7B i 4B, natywny kontekst 1 mln tokenów, 4-poziomowy budżet myślenia”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Przeciek Spark3: Małe modele 1.7B i 4B firmy iFLYTEK są integrowane z vLLM

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Spark3 nie ma publicznych wag, żadnej karty modelu ani ogłoszenia — a jednak w tym tygodniu w silniku inferencyjnym vLLM pojawił się pull request szczegółowo opisujący dwa modele: Spark3-1.7B i Spark3-4B. Pull request #53373 w repozytorium vLLM, „[Model] Add Spark3 Model”, dodaje natywne wsparcie serwowania dla architektury Spark3: uwagę z przesuwanym oknem (sliding-window attention), konfigurowalny budżet myślenia z czterema poziomami, natywny kontekst miliona tokenów w obu rozmiarach oraz identyfikator modelu wskazujący na iFLYTEK. Nic z tego nie zostało potwierdzone przez producenta i nic nie zostało opublikowane. To tekst typu „co wiemy do tej pory”: pull request jest prawdziwy, a wszystko, co modele rzekomo robią, pozostaje niezweryfikowane, dopóki iFLYTEK — lub ktokolwiek wypuści Spark3 — faktycznie nie opublikuje wag.

Wyciek: pull request, który czyta się jak specyfikacja techniczna

Sygnałem jest otwarty PR w vLLM, zgłoszony przez użytkownika GitHuba o nazwie KnightYao (współpracownika z Hefei, który na swoim profilu podaje Uniwersytet Nauki i Technologii w Chinach); według stanu na 23 sierpnia 2026 r. nie został on jeszcze scalony. Maintainer vLLM poprosił o zmiany 22 sierpnia z notatką „wstrzymać do czasu dyskusji”. Ten PR jest na wczesnym etapie i kontestowany, co jest normalne dla tego rodzaju integracji — a także jest niezwykle szczegółowy jak na PR w frameworku dotyczący modelu, którego nikt poza laboratorium nie może pobrać.

Diff dotyka ośmiu plików. Dodaje implementację Spark3ForCausalLM w executorze modeli vLLM, natywny Spark3Config zarejestrowany w rejestrze konfiguracji i modeli vLLM, obsługę attention z przesuwanym oknem oraz pełnego attention, a także bramkowanie wyjścia attention per głowa, ładowanie wag równolegle w wymiarze tensorowym i potokowym, oraz parser narzędzi XML Spark3, dzięki któremu wywołania narzędzi modelu można dekodować w ustrukturyzowany sposób. Dodaje też wiersz do dokumentacji wspieranych modeli vLLM, wymieniający punkt kontrolny jako XHToken/Spark3-1.7B. W opisie pojawia się nawet twierdzenie, że integracja była testowana wydajnościowo: 500 równoczesnych żądań, 100% sukcesów, około 106 żądań na sekundę i 13,5 tys. tokenów wyjściowych na sekundę na konfiguracji testowej autora. Te liczby pochodzą od osoby, która napisała PR, a nie z niezależnego benchmarku, i należy je tak właśnie czytać.

Dlaczego iFLYTEK jest oczywistą — ale niepotwierdzoną — spółką matką

Nic w PR-ze nie wymienia dostawcy. Jednak identyfikator punktu kontrolnego, który rejestruje, XHToken/Spark3-1.7B, znajduje się w organizacji XHToken na Hugging Face, a ta organizacja należy do iFLYTEK: strona organizacji określa ją jako firmę, linkuje do opensource.iflytek.com i obecnie pokazuje zero publicznych modeli i zero publicznych zbiorów danych. „XH" to naturalny skrót od 星火 (Xinghuo, „Spark"), rodziny modeli iFLYTEK. Dodaj lokalizację autora w Hefei — iFLYTEK ma siedzibę w Hefei — a wniosek jest tak mocny, jak to tylko możliwe, zanim dostawca go potwierdzi.

To wpisuje się w najnowszy wzorzec działań iFLYTEK. Jej model Spark X2, wydany w lutym 2026 roku, był wyraźnie ukierunkowany na edukację, medycynę, motoryzację i przypadki użycia agentów, a linia modeli on-device SparkAuto-EMM jest dostępna w małych wariantach od 0,5B do 7B. Dwa dni przed pojawieniem się tego komunikatu prasowego, podczas konferencji poświęconej wynikom śródrocznym 21 sierpnia, iFLYTEK zapowiedział nowy flagowy model ogólnego przeznaczenia zbudowany w całości na krajowych zasobach obliczeniowych, którego wersja etapowa miała się ukazać „do końca sierpnia”, a pełna premiera nastąpić podczas 1024 Developer Day w październiku. To, czy Spark3-1.7B i Spark3-4B są częścią tej etapowej premiery, czy odrębnej ścieżki skoncentrowanej na urządzeniach brzegowych, pozostaje otwartym pytaniem, na które komunikat prasowy nie odpowiada.

A two-column infographic titled 'Spark3 — what we know / what we don't'. Left column 'What we know (from the PR)': 'Open vLLM PR #53373, review requested Aug 22, 2026', 'Two sizes: Spark3-1.7B and Spark3-4B', 'Native 1M-token context on both', 'Thinking budget: none / low / medium / high', '200+ languages; strong Gaokao and K-12 results', 'Model ID under iFLYTEK's XHToken HF org'. Right column 'What we don't': 'Release date — no weights, no announcement', 'Vendor confirmation — iFLYTEK has not commented', 'Independent benchmarks — PR figures are self-reported', 'Pricing and license — undisclosed', 'Whether it is the phased flagship due end of August', 'Whether the 1M context is native or rope-scaled'. Footer: 'All model claims unverified; only the pull request is confirmed.' The OrcaRouter logo is composited in the bottom-right corner.

To, czym rzekomo są modele.

Twierdzenia PR-a, wszystkie niezweryfikowane:

Dwa rozmiary. Spark3-1.7B i Spark3-4B. Oba są opisane jako projekty stawiające na wydajność, wykorzystujące uwagę przesuwanego okna zamiast gęstego pełnego układu uwagi.

Natywny kontekst 1M tokenów w obu. To nie obietnica trybu rozszerzonego — PR mówi, że kontekst jest natywny dla architektury, co oznaczałoby milion tokenów na modelu na tyle małym, że byłby możliwy do uruchomienia na pojedynczym GPU.

Czteropoziomowy budżet myślenia. Rozumowanie można ustawić na: brak, niskie, średnie lub wysokie — konstrukcja z przełączanym myśleniem, która pozwala aplikacji wymieniać głębię rozumowania na opóźnienie i koszt pojedynczego wywołania.

200+ języków i skuteczność na chińskich egzaminach. Komunikat prasowy deklaruje wysoką skuteczność w odpowiadaniu na pytania z zakresu K-12 i egzaminu Gaokao — znak rozpoznawczy iFLYTEK, biorąc pod uwagę edukacyjny profil firmy — oraz obsługę ponad 200 języków.

Orientacja na kodowanie i agentowość.Twierdzenia o silnym generowaniu kodu, używaniu narzędzi, wieloetapowym wykonywaniu zadań i rozumowaniu w długich kontekstach — jak na swój rozmiar — poparte parserem narzędzi XML zawartym w tym samym PR.

Natywny kontekst 1M w modelu 1.7B to aspekt wart uwagi.

Długość kontekstu to obszar, w którym małe modele utknęły. W obecnym krajobrazie modeli o otwartych wagach model {{1}}1.7B–4B{{/1}} zwykle ma natywne okno 32K–256K: {{2}}Małe checkpointy Qwe​n3 mają natywne 32K i 131K dzięki skalowaniu rope{{/2}}, a nawet ulepszone natywne 256K w małych wariantach Qwen3.5 to niedawny krok. Kontekst o długości miliona tokenów był dotąd cechą dużych modeli — {{3}}checkpointy G​LM z kontekstem 1M mają setki miliardów parametrów{{/3}}. Jeśli Spark3 rzeczywiście dostarczy natywne okno 1M w modelu 4B, byłaby to naprawdę niezwykła specyfikacja, a architektura uwagi z przesuwanym oknem to dokładnie sposób na to, aby było to tanie pamięciowo. Zastrzeżenie, które musi temu towarzyszyć: {{4}}natywna liczba 1M w nagłówku łatwo napisać w PR, ale trudno sprawić, by była użyteczna w praktyce{{/4}}. Jakość długiego kontekstu — czy model faktycznie potrafi znaleźć i wykorzystać fakt sprzed 700K tokenów — to inne pytanie niż to, ile tokenów mieści się w oknie, i nie istnieje jeszcze żadna niezależna ocena.

Kontrolowany budżet myślenia ma znaczenie z tego samego powodu. Cztery poziomy rozumowania (brak / niski / średni / wysoki) to rozwiązanie z przełączanym myśleniem w duchu trybu myślenia włącz/wyłącz modelu Qwe​n3, ale bogatsze: zamiast binarnego wyboru aplikacja może wybrać poziom dla każdego żądania — brak myślenia dla tłumaczenia, wysoki dla wieloetapowej tury agenta — i płacić tylko za rozumowanie, którego potrzebuje. W przypadku obciążenia agentowego lub wsadowego to dokładnie ten przełącznik, który zmienia „wydajny, ale drogi” mały model w model o kontrolowanych kosztach.

Przepis post-trainingowy pasuje do wzorca z 2026 roku.

Jak podaje PR, Spark3 był trenowany w fazie post-training przy użyciu „Skalowanego uczenia przez wzmacnianie i MOPD". MOPD — destylacja od wielu nauczycieli w oparciu o politykę on-policy — to realna i aktualna technika, opisana w artykule na arXiv (2606.30406): trenuje się równolegle wyspecjalizowanych nauczycieli RL, a następnie destyluje ich wiedzę z powrotem do jednego ucznia na jego własnych trajektoriach, minimalizując per-tokenowy odwrotny KL względem właściwego nauczyciela dla danego promptu. To przepis z 2026 roku, dzięki któremu pojedynczy model może przejąć umiejętności matematyczne, kodowania i agentowe bez walki między osobnymi przebiegami RL. Technika ta została publicznie uznana za wykorzystaną w post-trainingu modeli takich jak MiMo Flash V2, DeepSeek V4 i Nemotron 3 Ultra. To, że Spark3 powołuje się na ten sam przepis, sytuuje go w tym pokoleniu — małe modele, techniki post-trainingowe z czołówki. Oznacza to również, że „mocne deklaracje dotyczące kodowania i zdolności agentowych" mają za sobą prawdopodobny mechanizm. Jednak „prawdopodobny" to nie to samo co „wykazany": dopóki nie pojawią się wagi i nie zostaną przeprowadzone niezależne ewaluacje, twierdzenia pozostają wyłącznie deklaracjami producenta.

Co jest naprawdę nieznane

Prawie wszystko z kalendarzem:

Data wydania. Brak wag na Hugging Face, brak ogłoszenia, brak harmonogramu. Organizacja XHToken jest dziś pusta.

Potwierdzenie producenta. iFLYTEK nie powiedział nic o Spark3. Link do organizacji XHToken jest mocnym dowodem, a nie oficjalnym oświadczeniem.

Czy to jest flagowiec fazowy. Fazowa wersja nowego flagowca iFLYTEK na „koniec sierpnia” może być właśnie tym — lub nie mieć z tym związku. Komunikat prasowy nie podaje żadnych dat.

Ceny i licencja. Nic nie zostało ujawnione. Rodzina Spark firmy iFLYTEK była historycznie w większości udostępniana przez API, a nie jako otwarte wagi, więc to, czy Spark3-1.7B i Spark3-4B są otwartymi checkpointami, czy wewnętrznym celem serwowania, pozostaje otwartą kwestią.

Każdy benchmark. Wartości przepustowości w PR to własny test serwowania autora, a nie niezależna ewaluacja, i żaden leaderboard nie ocenił modelu, ponieważ żaden model nie istnieje publicznie.

A screenshot of the XHToken Hugging Face organization page (captured August 23, 2026) showing the organization name 'XHToken', listed as a company with a link to opensource.iflytek.com, and the text 'None public yet' with zero public models and zero public datasets — confirming no Spark3 weights have been released.

Co obejrzeć

Organizacja XHToken na Hugging Face to kanał wydawniczy, który warto obserwować. Jeśli model jest prawdziwy, jego wagi — a przynajmniej karta modelu — powinny się tam pojawić, a przejście organizacji z zera do jednego publicznego repozytorium to najważniejszy sygnał. Kilka rzeczy do sprawdzenia w momencie, gdy to nastąpi:

Długość kontekstu. Czy 1M jest natywne, czy rozszerzone rope z kompromisem jakościowym? PR mówi, że natywne; karty modeli to miejsce, gdzie to się rozstrzyga.

API budżetu myślenia. Sposób, w jaki udostępniane są cztery poziomy rozumowania — jako parametr próbkowania, pole szablonu czatu lub osobny wariant modelu — decyduje o tym, jak łatwo jest z niego faktycznie korzystać.

Licencja. Otwarte wagi uczyniłyby ze Spark3 pierwszy model poniżej 5B z natywnym kontekstem 1M dostępnym do samodzielnego hostowania; premiera wyłącznie przez API uczyniłaby z niego inny rodzaj produktu.

Kalendarz ogłoszeń iFLYTEK. Flagowiec wprowadzany etapami ma zostać zapowiedziany do końca sierpnia, a pełna premiera odbędzie się podczas październikowego Dnia Dewelopera 1024. Jeśli Spark3 będzie częścią któregoś z tych wydarzeń, oficjalny opis ujawni to, czego nie zdradza komunikat prasowy.

Czy PR zostanie scalony. Wsparcie vLLM ma znaczenie jako sygnał jakości i infrastruktura: pierwsze środowisko uruchomieniowe z natywną obsługą Spark3 sprawia, że model można uruchomić w produkcji w dniu, w którym pojawią się wagi.

Co programista powinien teraz zrobić

Nic. Nie ma modelu do wywołania, żadnych wag do pobrania, żadnego klucza API do skonfigurowania — każde narzędzie, które twierdzi, że dziś obsługuje Spark3, tak naprawdę obsługuje coś innego. Jedyne, co możesz zrobić, to zdecydować, jak je ocenisz w dniu, w którym się pojawi, ponieważ to model z bardzo weryfikowalną obietnicą: wersja 1.7B lub 4B, która czyta milion tokenów i rozumuje na czterech poziomach głębi, to albo prawdziwie nowa kategoria małych modeli, albo historyjka z arkusza specyfikacji — a różnicę da się zmierzyć w jedno popołudnie na własnym obciążeniu.

To również miejsce, w którym warstwa routingu udowadnia swoją wartość. W OrcaRouter model nie jest kontraktem, do którego się zobowiązujesz; to wpis w katalogu, który wywołujesz przez jedno API, a ceny katalogowe dostawców są przekazywane dalej z zerową marżą — więc gdy nowy model pojawia się w katalogu dostawcy, jego rzeczywista cena jest aktywna po naszej stronie tego samego dnia, a przetestowanie go nie wymaga drugiej integracji ani ponownych negocjacji. Dla modelu tak niesprawdzonego jak Spark3 rozsądny wzorzec to ten sam, którego użyłbyś w przypadku każdego obiecującego wycieku: umieść go za automatycznym failover w DSL routingu, pozwól, by część ruchu do niego trafiała, a po drugiej stronie reguły trzymaj sprawdzony model, tak aby zły wynik ewaluacji, niespodzianka licencyjna lub rozczarowujący rezultat dla długiego kontekstu oznaczały zmianę routingu, a nie incydent. Jeden klucz, jeden endpoint, ponad 200 modeli — a gdy Spark3-1.7B lub Spark3-4B będzie można faktycznie uruchomić, przekazywanie dalej i failover będą go dotyczyć tak samo jak każdego innego modelu.

A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.

Uczciwe podsumowanie to zdanie, a nie werdykt: PR frameworka napisany w tym tygodniu twierdzi, że iFLYTEK ma dwa małe modele z natywnym kontekstem miliona tokenów i czteropoziomowym budżetem myślenia, a żadne dowody nie zostały opublikowane, by to potwierdzić. Obserwuj organizację XHToken, obserwuj obietnicę iFLYTEK z końca sierpnia, a gdy wagi będą prawdziwe, przepuść je przez regułę routingu z trybem failover, zanim postawisz na nich ścieżkę produkcyjną. To cały scenariusz na wyciek — ufaj infrastrukturze, weryfikuj model i utrzymuj niskie koszty wyjścia.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube