Grafika hero dla A.X K2 DSpark vs A.X K2: model szkicowy proponujący równolegle cztery kandydujące tokeny, które A.X K2 (688B / 33B aktywnych) weryfikuje, z podpisem „ta sama odpowiedź, szybsze dekodowanie”.
Guides & Insights

A.X K2 DSpark vs A.X K2: Co tak naprawdę zyskujesz dzięki modelowi wyłącznie szkicującemu

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najdziwniejsze w porównaniu A.X K2 DSpark z A.X K2 jest to, że tak naprawdę to nie jest porównanie. A.X K2 DSpark nie może być używany zamiast A.X K2 — nie może być używany w ogóle samodzielnie. To „checkpoint wyłącznie do draftowania", który SK Telecom po cichu opublikował na Hugging Face na początku sierpnia bez żadnego ogłoszenia: model draftujący do dekodowania spekulatywnego, którego jedynym zadaniem jest sprawić, by A.X K2 — flagowy model typu Mixture-of-Experts firmy o otwartych wagach i 688 miliardach parametrów — generował tokeny szybciej, pozostawiając jego odpowiedzi bez zmian. Tak więc prawdziwe pytanie, na którym opiera się to zestawienie, nie brzmi „który jest lepszy". Brzmi: „czy uruchamiać A.X K2 z DSpark, czy bez?" Wszystko w tym artykule jest oznaczone źródłem, ponieważ przepaść między tym, co mówi nam repozytorium, a tym, co faktycznie zmierzono, stanowi całą historię.

Czym tak naprawdę jest A.X K2 DSpark

Karta modelu SK Telecom jest niezwykle dosadna, jeśli chodzi o przeznaczenie modelu. A.X K2 DSpark „to model szkicowy DSpark do dekodowania spekulacyjnego dla A.X K2" oraz „punkt kontrolny wyłącznie do szkicowania: nie ma samodzielnego zastosowania i ma być ładowany przez vLLM wraz z A.X K2 poprzez dekodowanie spekulacyjne". W praktyce oznacza to, że pobierasz model, wskazujesz kompatybilnemu vLLM zarówno na niego, jak i na A.X K2, a oba współpracują jak zespół: DSpark proponuje tokeny-kandydatów, A.X K2 je weryfikuje, a tylko zweryfikowane tokeny są emitowane.

Dwa szczegóły mechanizmu draftu można poznać z repozytorium. Po pierwsze, DSpark proponuje wiele tokenów-kandydatów równolegle, zamiast zapisywać sekwencję draftu token po tokenie, opierając się na własnych ukrytych reprezentacjach A.X K2 oraz lekkim modelowaniu lokalnych zależności. Po drugie, całość jest zaprojektowana jako bezstratna: każdy kandydat jest weryfikowany przez model docelowy, zanim zostanie zatwierdzony, więc rozkład wyjściowy A.X K2 pozostaje niezmieniony z założenia.

Samo wydanie jest wstępną zapowiedzią. Na karcie napisano, że model jest „obecnie w końcowej walidacji i planowany jest do publicznego udostępnienia w ciągu najbliższych kilku dni”, a ocena jest „obecnie w toku” — wszystkie metryki przepustowości, TPOT i średniej długości akceptowanej na karcie są nadal oznaczone jako TBD.

Dlaczego to „versus” to tak naprawdę „z versus bez”

Ponieważ A.X K2 DSpark nie ma samodzielnego zastosowania, nie istnieje scenariusz, w którym wybiera się je zamiast A.X K2. Wybór dotyczy samego A.X K2 albo A.X K2 z dołączonym modelem szkicowym. Pod względem jakości wyników obie konfiguracje są z założenia identyczne; jedynym parametrem, który może się zmieniać, jest szybkość dekodowania.

Dla porządku, oto czym jest A.X K2: dekoder typu Mixture-of-Experts o łącznej skali 688B i 33B aktywnych parametrów, z 256 ekspertami plus jednym współdzielonym ekspertem (8 aktywnych na jedno przejście w przód), 61 warstwami, 64 głowicami uwagi i słownikiem liczącym 163 840 tokenów, wydany z otwartymi wagami na licencji Apache 2.0 29 lipca. Był wstępnie trenowany na około 8,2 biliona tokenów natywnie w MXFP8, wykorzystuje Sparse Gated Attention od SK Telecom dla efektywności na długich kontekstach i obsługuje kontekst 262 144 tokenów (natywne 128K rozszerzone do 256K za pomocą YaRN). SK Telecom podaje, że średnio wypada on o +32,2 punktu procentowego lepiej niż A.X K1 w 14 benchmarkach, a wyniki dla długiego kontekstu i agentów są wyższe o około 83,9 punktu — wszystko to dane deklarowane przez producenta, a niezależny wynik zbiorczy nie został jeszcze opublikowany.

DSpark jest zaprojektowany specjalnie dla tej architektury. Według karty jest dopasowany do struktury MoE, układu uwagi i natywnej konfiguracji 256K modelu A.X K2 i nie jest walidowany względem żadnego innego celu. Dziedziczy ten sam kontekst 262 144 tokenów, więc jego uruchomienie nic nie kosztuje pod względem rozmiaru okna.

A comparison scoreboard for A.X K2 DSpark and A.X K2: drafter-only checkpoint vs 688B / 33B-active MoE target; identical output by construction; shared 262,144-token context and Apache 2.0 license; DSpark's 60-85% faster decode labeled as a paper claim not yet measured on A.X K2; A.X K2 live open weights since 7-29.

Czytanie karty modelu: poznawalne, jeszcze niepotwierdzone.

Repo daje ci jasny obraz tego, czym jest model, oraz krótką listę rzeczy, których ci nie mówi.

Poznawalne dziś:

Jest to punkt kontrolny wyłącznie dla draftera, bez samodzielnego zastosowania, ładowany przez vLLM wraz z A.X K2 poprzez spekulacyjne dekodowanie.

Licencja to Apache 2.0; wagi można bezpłatnie pobierać i używać.

Długość kontekstu odpowiada A.X K2, czyli 262 144 tokeny.

• Działa poprzez fork vLLM firmy SK Telecom (repozytorium SKT-AI/vllm, gałąź axk2-v0.23.0) przy użyciu flagi --speculative-config.

Metoda została udokumentowana w artykule „DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv:2607.05147, złożony 6 lipca 2026 r.) — ten artykuł jest również źródłem przytaczanych liczb dotyczących przyspieszenia.

• Żaden dostawca inferencji nie wdraża go obecnie, więc nie ma hostowanego API do wywołania.

Jeszcze niepotwierdzone:

• Oficjalne ogłoszenie — karta obiecuje publiczne wydanie „w ciągu najbliższych kilku dni”.

• Jakakolwiek wartość przyspieszenia specyficzna dla A.X K2. Ocena jest w toku, a każda metryka wydajności jest TBD.

• Jak bardzo faktycznie pomaga pod obciążeniem, co karta określa jako „zależne od obciążenia”.

Jakikolwiek niezależny pomiar modelu roboczego dokonany przez stronę trzecią.

The Hugging Face model card for skt/A.X-K2-DSpark, showing it is a DSpark speculative-decoding draft model and a drafter-only checkpoint for A.X K2 with no standalone use, Apache 2.0 license, a 262,144-token context, release status 'planned for public release within the next few days,' and the note that no inference provider deploys it.

Czym DSpark różni się od zwykłego spekulatywnego dekodowania

Spekulatywne dekodowanie to dobrze znany trik: mały, szybki model wstępny tworzy przewidywanie kilku kolejnych tokenów, a duży model sprawdza całe przewidywanie w jednym przejściu w przód, akceptując prefiks, który przetrwa weryfikację, zanim wykona jeden krok korekcyjny. Wykonane dobrze, drastycznie skraca opóźnienia bez utraty jakości.

Haczyk, jak ujmuje to artykuł DSpark, polega na tym, że nowoczesne równoległe drafters — które proponują długie sekwencje w jednym przebiegu — cierpią na „szybki zanik akceptacji”, ponieważ późniejsze tokeny w szkicu nie zależą od wcześniejszych, więc są odrzucane znacznie częściej. A ślepe weryfikowanie długich bloków marnuje wydajność wsadową na tokeny, które prawdopodobnie zostaną odrzucone, co szkodzi przepustowości właśnie w systemach obsługujących wysoką współbieżność.

DSpark atakuje oba problemy:

• Draftowanie semi-autoregresyjne. Łączy ono równoległy backbone z lekkim modułem sekwencyjnym, dodając modelowanie zależności wewnątrz bloku, dzięki czemu późniejsze tokeny draftu zależą od wcześniejszych — to właśnie łagodzi zanik sufiksu.

• Weryfikacja planowana według ufności. Zamiast weryfikować stałą długość bloku, dostosowuje długość weryfikacji do każdego żądania, na podstawie szacowanych prawdopodobieństw przetrwania prefiksu oraz profilu przepustowości silnika. Weryfikacja staje się świadoma obciążenia.

Liczby w artykule — i czego ci nie mówią

Oto liczba, która zostanie przywołana: DSpark „przyspiesza prędkości generowania na użytkownika o 60 do 85 procent" przy wyrównanych poziomach przepustowości, w porównaniu z produkcyjną bazą MTP-1. W artykule odnotowano również znacznie lepszą zaakceptowaną długość w porównaniu z najnowocześniejszymi autoregresywnymi i równoległymi drafterami w testach offline, oraz stwierdzono, że DSpark zapobiega poważnej degradacji przepustowości przy ścisłych ograniczeniach interaktywności.

Przeczytaj drobny druk, bo ma to znaczenie w tym konkretnym zestawieniu: ten wskaźnik 60–85% zmierzono w systemie serwującym DeepSeek-V4 przy rzeczywistym ruchu użytkowników — nie na A.X K2. To twierdzenie o metodzie DSpark wdrożonej na stosie innego modelu. Karta A.X K2 DSpark, w przeciwieństwie do tego, nie ma jeszcze żadnej liczby dotyczącej przyspieszenia. Uczciwa punktacja dla tej pary jest zatem następująca: identyczne wyniki z założenia oraz przyspieszenie, które — jak sugeruje artykuł o metodzie — jest prawdopodobne, ale którego SK Telecom sam jeszcze nie zmierzył na modelu, dla którego zbudowano ten wstępny checkpoint.

The arXiv abstract page for the DSpark paper (arXiv 2607.05147), stating that DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput against the MTP-1 production baseline, deployed in the DeepSeek-V4 serving system.

Co tak naprawdę potrzeba, aby to prowadzić.

Warunkiem wstępnym jest element, który odstraszy większość ludzi: musisz samodzielnie hostować A.X K2. Nie ma hostowanego API dla modelu docelowego — ma on otwarte wagi, a serwowanie MoE z 688B/33B aktywnymi parametrami to poważne zobowiązanie infrastrukturalne. DSpark ma znaczenie tylko dla zespołów, które już to zobowiązanie podjęły.

Jeśli masz, koszt krańcowy dodania modelu wstępnego jest niewielki:

• Pobierz wstępny checkpoint Apache 2.0 i uruchom fork vLLM firmy SK Telecom (gałąź axk2-v0.23.0).

• Włącz dekodowanie spekulatywne za pomocą flagi --speculative-config, wskazując ją na punkt kontrolny DSpark.

• Zarezerwuj dodatkową pamięć na wagi szkicu i zaakceptuj, że pracujesz teraz na forku vLLM od producenta, a nie na wersji standardowej — to kwestia utrzymania.

• Pamiętaj o zastrzeżeniu samego artykułu, że weryfikacja nie jest darmowa: przy wysokiej współbieżności nieostrożna weryfikacja pochłania przepustowość partii, a to jest dokładnie ten tryb awarii, którym ma zarządzać weryfikacja planowana według poziomu ufności.

Jeszcze jedna rzecz, o której warto wiedzieć: Hugging Face podaje, że pobrania „nie są śledzone dla tego modelu”, więc nie ma publicznego sygnału, ile zespołów faktycznie go wypróbowało.

Kto powinien wybrać, które

Uruchom zwykły A.X K2, jeśli którekolwiek z tych Cię opisuje:

Używasz standardowego vLLM i nie chcesz drugiego checkpointu ani forka dostawcy w ścieżce.

Twoje obciążenia są ograniczone przepustowością, ale nie opóźnieniami, a użytkownicy tolerują czekanie na długie generowanie.

• Wolałbyś poczekać na oficjalną premierę i pierwsze niezależne pomiary.

Uruchom A.X K2 plus DSpark, jeśli to ty:

• Samodzielnie hostujesz A.X K2, a problemem jest opóźnienie generowania lub przepustowość tokenów.

• Długokontekstowe i agentowe obciążenia zmuszają użytkowników do czekania na długie wyniki — to reżim, dla którego stworzono spekulatywne dekodowanie.

• Czujesz się komfortowo z uruchomieniem komponentu zapowiadającego, którego ryzyko jest ograniczone: w najgorszym przypadku nie pomoże, a nie może zmienić jakości wyników.

Nie wybieraj żadnego z nich, jeśli w ogóle nie hostujesz samodzielnie modelu MoE o parametrach 688B. Suwerenność i mocne strony języka koreańskiego A.X K2 docierają do Ciebie tylko wtedy, gdy go uruchomisz, a wiele zespołów zamiast tego sięgnie po najbardziej zaawansowane otwarte modele przez katalog hostowany. Właśnie wtedy opłaca się utrzymywać integrację niezależną od modelu: jeden endpoint OrcaRouter zgodny z OpenAI obejmuje ponad 200 modeli w cenie listowej dostawcy z 0% marży, automatycznym przełączaniem awaryjnym oraz DSL do routingu umożliwiającym komponowanie kilku modeli w jedno wywołanie. (Ani A.X K2, ani A.X K2 DSpark nie są dziś nigdzie hostowane — w tym na OrcaRouter — więc chodzi o resztę Twojego stosu technologicznego, a nie o routing tej pary.) To podejście wciąż się sprawdza: wypróbuj niezweryfikowany model na części ruchu i automatycznie przełączaj awaryjnie, zamiast stawiać na niego ścieżkę produkcyjną.

Co obejrzeć dalej

Stan gry jest prosty: repo jest prawdziwe, metoda jest udokumentowana, a pomiary nie. Trzy rzeczy, na które warto zwrócić uwagę, to obiecane publiczne wydanie (na karcie napisano „w ciągu najbliższych kilku dni"), pierwsze liczby dotyczące przepustowości lub opóźnień specyficzne dla A.X K2, gdy zakończy się ewaluacja SK Telecom, oraz to, czy któryś dostawca inferencji zainteresuje się tą parą — to właśnie sprawiłoby, że DSpark stałby się istotny dla zespołów, które nie hostują samodzielnie.

Często zadawane pytania

Czy A.X K2 DSpark może zastąpić A.X K2?

Nie. To checkpoint przeznaczony wyłącznie do draftowania, bez samodzielnego zastosowania — istnieje po to, aby przyspieszyć dekodowanie A.X K2, a nie być dla niego alternatywą. Nie można uruchomić A.X K2 DSpark bez A.X K2.

Czy DSpark zmienia jakość wyjścia A.X K2?

Nie, z założenia. Każdy kandydat na token jest weryfikowany przez A.X K2 zanim zostanie zatwierdzony, więc rozkład wyjściowy pozostaje niezmieniony — karta opisuje to podejście jako bezstratne.

Czy muszę samodzielnie hostować A.X K2, aby używać DSpark?

Tak. DSpark jest ładowany przez vLLM wraz z A.X K2, więc nie ma dla niego nic do draftowania, chyba że uruchamiasz model docelowy 688B. Obecnie nie ma hostowanego API dla żadnego z tych modeli.

Czy DSpark działa z innymi modelami?

SK Telecom zaprojektowało to dla architektury MoE, struktury uwagi i kontekstu 256K modelu A.X K2 i nie zweryfikowało tego pod kątem żadnego innego celu.

Werdykt

A.X K2 DSpark vs A.X K2 to „versus", na które uczciwa odpowiedź brzmi „oba". Jeśli już uruchamiasz A.X K2, a użytkownicy czekają na długie generacje, model draftowy to darmowy, niskoryzykowny eksperyment: wagi Apache 2.0, w najgorszym razie brak przyspieszenia i brak możliwej regresji jakości z założenia. Jeśli nie jesteś ograniczony opóźnieniami — lub w ogóle nie hostujesz samodzielnie 688B MoE — możesz go bezpiecznie zignorować, dopóki nie pojawią się wyniki ewaluacji SK Telecom, a obiecane publiczne wydanie nie uczyni modelu oficjalnym. To, czego nie powinieneś robić, to mylić liczbę 60–85% z pracy z pomiarem tego modelu: w tej chwili wszystko, co specyficzne dla DSpark w A.X K2, pozostaje TBD.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube