Generierte Hero-Titelkarte für den Artikel über K-EXAONE-2.0-750B-A37B-DSpark. Großer Titeltext 'K-EXAONE-2.0-750B-A37B-DSpark' mit einem Pill-Label 'VLLM PR · LEAK / WAS WIR BISHER WISSEN', Untertitel 'LGs 750B koreanisches MoE bekommt DeepSeeks DSpark in vLLM' und drei Spec-Chips '750B gesamt · 37B aktiv', '5 DSpark-Draft-Schichten', '262.144-Token-Kontext', im hauseigenen Blau-Cyan-B2B-Stil mit einem kleinen Knotenmotiv vom Draft-Modell zum großen Modell, OrcaRouter-Logo unten rechts eingebettet.
Guides & Insights

K-EXAONE-2.0-750B-A37B-DSpark: LGs 750B Korean-MoE kommt zu vLLM

Autor

Jim Song

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 9. August 2026 wurde im vLLM-Repository ein Pull-Request eröffnet, um K-EXAONE-2.0-750B-A37B-DSpark hinzuzufügen — die spekulative Dekodierungsvariante des koreanischen Flaggschiffs von LG AI Research mit 750 Milliarden Parametern. Eine Zeile im Changelog, aber sie schließt eine echte Lücke. Das Basismodell K-EXAONE-2.0-750B-A37B wurde am 31. Juli unter Apache 2.0 veröffentlicht, und zum Start konnte vLLM es mit der MTP-Draft-Methode bedienen, aber nicht mit DSpark — dem Drafter, den LG ebenfalls ausliefert und der eine 3–5-fache Decode-Beschleunigung wert sein soll. Die DSpark-Variante war in ihrer gesamten Existenz praktisch auf SGLang beschränkt. DSpark selbst ist die Methode von Deep​Seek, derselbe semiautoregressive Drafter, der auf DeepSeek-V4-Pro-DSpark und DeepSeek-V4-Flash-DSpark läuft, daher ist dieser PR auch das deutlichste Zeichen dafür, dass die spekulative Dekodierungs-Infrastruktur von Deep​Seek zum Standard für offene Gewichte wird.

Dies ist ein Bericht über das, was wir bisher wissen, keine Launch-Story. Der PR ist offen und nicht gemerged, der DSpark-Checkpoint hat keinen unabhängigen Benchmark, und LGs Speedup-Angabe ist eine Herstellerbehauptung. Alles unten ist entsprechend gekennzeichnet. Was heute real ist: Die Gewichte sind auf Hugging Face verfügbar, das Basismodell wurde ausgeliefert, und die vLLM-Unterstützung für die DSpark-Variante ist derzeit in Arbeit.

Die Kurzfassung.

• PR #51558, eröffnet am 9. August 2026, fügt K-EXAONE-2.0-750B-A37B-DSpark zu vLLM hinzu; er ist offen und hat noch keine Genehmigungen.

DSpark ist der von DeepSeek als Open Source veröffentlichte Drafter der EAGLE-Familie und ist auf DeepSeek-V4-Pro-DSpark und DeepSeek-V4-Flash-DSpark verfügbar; LG ist die bisher prominenteste Adoption durch ein anderes Labor.

• Die DSpark-Variante ist das 78-Schichten-750B-MoE plus fünf zusätzliche Draft-Schichten; LG gibt an, dass DSpark und MTP jeweils eine etwa 3–5-fache Decode-Beschleunigung bieten, ausgelegt für langfristige agentische Workloads.

• Zum Start unterstützte vLLM MTP für K-EXAONE 2.0, aber nicht für DSpark; dieser PR führt die DSpark-Unterstützung ein.

• Kein Anbieter hostet heute einen K-EXAONE-2.0-Checkpoint, und jede Benchmark auf der Karte stammt von LG selbst.

Was der Pull Request ist (und was er nicht ist)

vLLM PR #51558, „[Model] Add K-EXAONE-2.0-750B-A37B-DSpark", wurde von lkm2835 eröffnet – demselben Mitwirkenden, der zuvor die K-EXAONE-Unterstützung in vLLM (#50524 für das Basismodell) und in SGLang (#33648) beigesteuert hat. Es ist ein Fork-PR mit dem Label „new-model", und es wurde eine Überprüfung durch die vLLM-Codebesitzer angefordert, aber es hat noch keine Genehmigungen. Die Beschreibung umfasst drei Zeilen: Sie fügt Unterstützung für den DSpark-Checkpoint hinzu, „entwickelt von LG AI Research", verlinkt die Hugging-Face-Modellkarte und den technischen Bericht zu K-EXAONE 2.0 (arXiv 2608.04505) und verweist auf die frühere vLLM-Arbeit in #50524.

Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.

Lies diesen Status wörtlich. „Unterstützung wird hinzugefügt“ ist nicht „Unterstützung ist verfügbar“: Bis der PR gemerged und in einem Release veröffentlicht wird, wird ein Standard-vLLM-Build die DSpark-Variante weiterhin nicht laden. Die Modellkarte selbst sagt, dass das Serving von K-EXAONE 2.0 mit DSpark auf vLLM derzeit nicht unterstützt wird, das stattdessen MTP verwendet. Dieser PR ist der Schritt, der diesen Satz ändert – falls und sobald er durchgeht.

Warum DSpark hier die eigentliche Geschichte ist.

Der Modellname sagt schon viel aus. „A37B“ bedeutet 37 Milliarden aktive Parameter pro Token. „DSpark“ ist der von DeepSeek in diesem Jahr eingeführte Spekulations-Dekodierungs-Drafter: ein semiautoregressives Draft-Modell aus der EAGLE-Familie, das in einem einzigen Durchlauf einen Block von Token vorschlägt und das Zielmodell diese überprüfen lässt, sodass die Ausgabequalität unverändert bleibt, während die Generierung schneller wird. DeepSeek hat es als Open Source veröffentlicht und liefert den Drafter mit seinen eigenen DeepSeek-V4-Pro-DSpark- und DeepSeek-V4-Flash-DSpark-Checkpoints aus. In der Community gemeldete Beschleunigungen liegen bei 60–85 % für Flash und 57–78 % für Pro gegenüber einer Einzel-Token-MTP-Baseline.

K-EXAONE-2.0-750B-A37B-DSpark behält die 78 Schichten des Basismodells und fügt fünf DSpark-Draft-Layer hinzu. Die Modellkarte von LG gibt an, dass sowohl DSpark als auch MTP die Generierung um etwa das 3- bis 5-Fache beschleunigen — eigene Zahlen, die auf „langfristige Workloads wie agentische Aufgaben“ abzielen, bei denen die Dekodierungslatenz der Engpass ist. Daraus folgen zwei Dinge. Erstens wird spekulative Dekodierung zu einem erstklassigen Feature offener Frontier-Modelle, nicht zu einem Serving-Trick, den man nachträglich aufpfropft. Zweitens ist es der Draft-Stack von Deep​Seek, der zum Standard wird — genau deshalb ist ein von der koreanischen Regierung unterstütztes souveränes Flaggschiff, das damit ausgeliefert wird, über die übliche „neues Modell“-Meldung hinaus von Bedeutung.

Das Modell hinter dem PR

K-EXAONE-2.0-750B-A37B-DSpark ist eine Variante von K-EXAONE 2.0, dem Nachfolger der 236B-K-EXAONE-Reihe von LG und Südkoreas größtem einheimischen Basismodell, das im Rahmen des staatlichen Sovereign-AI-Programms entwickelt wurde. Das Basismodell — 750B Gesamtparameter, 37B aktiv, Mixture-of-Experts mit 256 Experten und 8 aktiven pro Token, ein Kontextfenster von 262.144 Token, zehn Sprachen, Apache 2.0 — wurde am 31. Juli 2026 auf Hugging Face veröffentlicht; es entstand durch Upcycling aus dem 236B-Vorgänger und nicht durch Training von Grund auf.

Screenshot of the Hugging Face model card for LGAI-EXAONE/K-EXAONE-2.0-750B-A37B-DSpark, captured August 9, 2026. It shows a 751B-parameter Mixture-of-Experts model under Apache 2.0 with F32/BF16 tensors, ten languages, 659 downloads in the last month, the notice that the model is not deployed by any inference provider, and a link to the K-EXAONE 2.0 technical report. English UI.

LGs eigene Benchmark-Durchschnittswerte (24 Benchmarks, insgesamt 70,1) zeigen die erwartete Form für ein koreanisches souveränes Modell: starke berichtete Ergebnisse bei Long-Context-Retrieval, koreanischer gesellschaftlicher Sicherheit und agentischem Kodieren, zusammen mit Werten, die hinter Alibabas Qwen3.5 beim allgemeinen Denken zurückbleiben (83,5 gegenüber 89,8 bei MMLU-Pro, zum Beispiel). Nichts davon ist bisher unabhängig verifiziert. Die DSpark-Variante ändert keinen dieser Werte – sie ist ein Serving-Artefakt, ein schnellerer Weg, dasselbe Modell auszuführen – genau deshalb taucht sie in einem Pull-Request eines Inferenz-Frameworks auf und nicht in einer Ankündigung.

Die Serving-Realität hinter einem 750B-MoE

Hier zeigt sich, wo die DSpark-Unterstützung tatsächlich eine Rolle spielt. K-EXAONE-2.0-750B-A37B-DSpark ist ein Checkpoint mit 751 Milliarden Parametern in BF16/F32, und LGs Empfehlung lautet mindestens zwei Knoten mit je acht NVIDIA-H200-GPUs (16 GPUs, Tensor-Parallelismus 16). In dieser Größenordnung ist der Decode-Durchsatz das A und O — Tokens pro Sekunde und die Kosten einer langen agentischen Interaktion — und genau das greift spekulatives Decoding an. Ein 3–5-facher Decode-Speedup, sofern er außerhalb von LGs Testumgebung hält, entscheidet darüber, ob ein H200-Cluster wirtschaftlich ist oder nicht. LG dokumentiert außerdem ein Problem mit dem Generierungskollaps auf B200-GPUs, das bis zur Behebung den Workaround --disable-prefill-cuda-graph erfordert — eine Erinnerung daran, dass dies hochmodernes Serving ist, kein Plug-and-Play.

Generated single-model scoreboard for K-EXAONE-2.0-750B-A37B-DSpark: Parameters 750B total / 37B active; Draft layers 5 DSpark on 78 main; Context 262,144 tokens; Spec decode DSpark + MTP (3-5x, LG-claimed); License Apache 2.0; Independent score none yet. Footer reads 'All figures LG AI Research model card, August 2026 (vendor-reported). vLLM support pending PR #51558.' OrcaRouter logo composited bottom-right.

Was es kostet, und wie man es tatsächlich ausprobieren würde.

Heute stellt keine API K-EXAONE 2.0 bereit. Die Hugging-Face-Karte für die DSpark-Variante sagt weiterhin „dieses Modell wird von keinem Inferenzanbieter bereitgestellt“, und ein 16×H200-Fußabdruck bedeutet, dass es eine gehostete API nur dann erreicht, wenn jemand mit dieser Hardware beschließt, es zu hosten. Das ist der eigentliche Reibungspunkt: Die Grenze der offenen Gewichte ist zunehmend ein Serving-Problem, kein Verfügbarkeitsproblem.

Wenn ein Anbieter es aufgreift, wird sich die Beschleunigung durch spekulative Dekodierung im Preis pro Token niederschlagen, und die Wechselkosten, um es auszuprobieren, sollten nahezu null sein, wenn Ihre Anwendung bereits modellagnostisch ist. Auf OrcaRouter — einem OpenAI-kompatiblen Endpunkt für über 200 Modelle, mit durchgereichtem Listenpreis des Anbieters bei 0 % Aufschlag — wird ein Modell, das bei einem beliebigen vorgelagerten Anbieter landet, zu einer Routing-Änderung statt einer Neu-Integration, und automatisches Failover bedeutet, dass ein brandneues 750B-MoE, das sich als langsam oder instabil herausstellt, ohne Zwischenfall auf ein bekannt gutes Modell zurückfällt. Um es klar zu sagen: OrcaRouter hostet K-EXAONE-2.0-750B-A37B-DSpark heute nicht, und das tut auch keine andere API, die wir finden konnten. Der Sinn der Routing-Ebene ist es, für den Tag gerüstet zu sein, an dem einer von ihnen es tut.

Was wir uns ansehen

Das Zusammenführen des PRs. #51558 ist offen und hat keine Freigaben. Merge plus Release ist das, was "DSpark support" von einem Pull-Request in ein Flag verwandelt, das du tatsächlich übergeben kannst.

Eine erste unabhängige Punktzahl. Jeder Benchmark auf der Karte wird von LG durchgeführt. Der erste Datenpunkt von Artificial Analysis oder Arena zu einem 750B koreanischen MoE wird die erste Zahl sein, die nicht vom Anbieter stammt.

DSpark über Deep​Seek hinaus. Deep​Seek veröffentlicht bereits DSpark-Drafter für andere Ziele; LG ist der prominenteste Anwender aus einem anderen Labor. Ob die Methode zum Open-Weights-Standard wird, ist für sich genommen eine Beobachtung wert.

Quantisiertes Serving.LG liefert FP8- und NVFP4-Checkpoints des Basismodells aus; eine quantisierte DSpark-Variante, die mit weniger GPUs auskommt, würde die Wirtschaftlichkeit schneller verändern als jeder Benchmark.

FAQ

Ist K-EXAONE-2.0-750B-A37B-DSpark veröffentlicht?

Die Gewichte liegen auf Hugging Face unter Apache 2.0, aber das ist keine Launch-Geschichte: Der vLLM-Support ist ein offener, nicht gemergter Pull-Request (#51558), die Speedup-Zahl stammt von LG selbst, und kein Anbieter hostet das Modell.

Was ist der Unterschied zwischen K-EXAONE-2.0-750B-A37B und der DSpark-Variante?

Die 78 Schichten des Basismodells plus fünf DSpark-Draft-Schichten für spekulative Dekodierung – darunter dieselben Gewichte, dieselben Benchmarks und ein schneller zu dekodierendes Bereitstellungsartefakt anstatt eines anderen Modells.

Gehört DSpark zu LG oder zu DeepSeek?

DSpark ist die Open-Source-Methode von Deep​Seek für spekulative Dekodierung, die auch auf DeepSeek-V4-Pro-DSpark und DeepSeek-V4-Flash-DSpark verfügbar ist; LG ist der bisher prominenteste Anwender, und dessen Modellkarte gibt denselben Beschleunigungsbereich von 3–5× an.

Kann ich K-EXAONE-2.0-750B-A37B-DSpark heute auf meiner eigenen Hardware ausführen?

Nur durch Selbsthosting: Die Vorgaben von LG sehen mindestens sechzehn NVIDIA H200 GPUs vor, und die Standard-Releases von vLLM, SGLang und Transformers benötigen weiterhin nicht gemergte Forks, um die Architektur zu erkennen.

Was das hier sehenswert macht, ist nicht der Pull-Request selbst, sondern das, was er signalisiert: Ein souveränes koreanisches Flaggschiffmodell mit 750 Milliarden Parametern und Apache-2.0-Lizenz hat sich dafür entschieden, DeepSeek's Speculative-Decoding-Stack auszuliefern, und das Serving-Ökosystem zieht nun Schicht für Schicht nach – zuerst SGLang, dann vLLM. So werden Open-Source-Spitzenmodelle wirklich real – nicht in dem Moment, in dem die Gewichte veröffentlicht werden, sondern in dem Moment, in dem die Drafters gemerged werden.

© 2026 OrcaRouter

Für Anbieter

Sie betreiben eine Inferenz-Plattform? Bringen Sie Ihre Modelle auf OrcaRouter.

Kontaktieren Sie uns

Community beitreten

DiscordEmailXGitHubYouTube