
Intern-Decision-0.8B vs. Qwen 3.8: 853 Millionen Parameter und eine geschlossene Antwortmenge
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 592 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Intern-Decision-0.8B ist das kleinste von drei Entscheidungsmodellen, die InternLM am Morgen des 26. September 2026 auf Hugging Face veröffentlichte, und es ist nicht das schnellste von ihnen. Das ist das Erste, was man wissen sollte. Nach den eigenen Messungen des Labors läuft das 2B-Geschwistermodell geringfügig schneller – 33,28 ms gegenüber 33,98 ms – und erzielt im selben Sieben-Suite-Durchschnitt sechs Punkte mehr, sodass der Grund, zu einem Checkpoint unter einer Milliarde Parameter zu greifen – rohe Geschwindigkeit –, hier nicht gilt. Was zählt, ist die Größe: 852.985.920 Parameter, 1,71 GB bf16-Gewichte – klein genug, um dauerhaft in den Restkapazitäten einer Maschine Platz zu finden, die eigentlich etwas anderes zu tun hat. Setzt man das gegen Qwen3.8-Max – die gehostete Bereitstellung des 2,4-Billionen-Parameter-Kerns vom Typ Sparse Mixture-of-Experts, den der Anbieter im August veröffentlichte, mit einem Preis von 2,00 $ und 6,00 $ pro Million Token –, dann konkurrieren die beiden nicht um dieselbe Aufgabe. Das eine gibt eine Wahrscheinlichkeitsverteilung über Optionen zurück, die man im Voraus vorgegeben hat. Das andere schreibt.
Die kurze Antwort: Intern-Decision-0.8B lohnt sich, wenn Sie eine Entscheidung aus einem geschlossenen Satz benötigen, die auf Hardware bewertet wird, die Sie bereits besitzen, und wenn 1,71 GB statt 4,43 GB den Unterschied zwischen Auslieferung und Nicht-Auslieferung ausmachen. Es lohnt sich nicht, wenn Sie den genauesten kleinen Scorer wollen, den InternLM diese Woche veröffentlicht hat – das ist der 4B –, oder wenn Ihre Antwort nicht bereits in Ihrem Prompt aufgeführt ist; in diesem Fall ist keiner der beiden das richtige Werkzeug, und Qwen 3.8 ist der einzige des Paares, der die Aufgabe überhaupt erledigen kann.
Was das Repository sagt – und was sonst nichts tut
Beginnen wir mit den Belegen, denn davon gibt es nur sehr wenige. InternLM hat keine Ankündigung zu diesem Modell gemacht. Kein Launch-Beitrag, kein Paper, keine Repository-Beschreibung. Die Hugging-Face-Karte verlinkt einen Demo-Space und ein GitHub-Repository, und zum Zeitpunkt dieses Schreibens gibt der Space 401 und der GitHub-Link 404 zurück — die beiden Stellen, auf die die Karte für weitere Informationen verweist, sind geschlossen. Drei Checkpoints erschienen innerhalb von vierzig Sekunden voneinander gegen 05:36 UTC am 26. September: Intern-Decision-0.8B, Intern-Decision-2B und Intern-Decision-4B, alle mit denselben Tags — Entscheidungsfindung, multimodal, strukturierte Vorhersage — und alle Fine-Tunes von Qwen-Checkpoints, in diesem Fall Qwen3.5-0.8B.
Was sich aus dem Repository erfahren lässt, ist für eine nicht angekündigte Veröffentlichung ungewöhnlich präzise, weil das Labor sein eigenes Inferenzmodul zusammen mit den Gewichten ausgeliefert hat. Das 0.8B-Modell wird über eine 16 KB große inference.py im Modellverzeichnis geladen, erfordert Python 3.12 oder neuer sowie torch 2.9.1 mit transformers 5.14.1 und stellt eine DecisionEngine-Klasse bereit, die man einmal instanziiert und wiederverwendet. Ein Python-dict rein, ein Antwort-dict raus. Was sich nicht erfahren lässt: ob dies ein fertiges Release oder ein früher Push ist, ob ein gehosteter Endpunkt kommt und ob die beiden Checkpoints, zwischen denen es liegt, als dasselbe Produkt in unterschiedlichen Größen gedacht sind oder als drei verschiedene Produkte, die zufällig denselben Namen teilen. Niemand außerhalb von InternLM hat irgendeines davon ausgeführt.

Das Geschwisterproblem: Der 2B ist schneller und besser
Hier ist der Teil von InternLMs eigener veröffentlichter Tabelle, der die 0.8B schwer einordnen lässt. Liest man die drei Größen entlang derselben sieben Suites:
• Geschwindigkeit — 0,8B: 33,98 ms Mittelwert, 33,44 ms Median, 37,50 ms bei p95. 2B: 33,28 ms, 33,15 ms, 33,55 ms. 4B: 44,16 ms, 44,03 ms, 44,60 ms. Alle Werte pro Abfrage auf einer einzelnen RTX 4090 über den lokalen Hugging Face-Pfad gemessen.
• Durchschnitt über sieben Suites — 0.8B: 79.38. 2B: 84.68. 4B: 90.02.
• Kalibrierung — 0,8B: Brier 0,530, ECE 0,066. 2B: Brier 0,437, ECE 0,100. 4B: Brier 0,347, ECE 0,065.
Speicherbedarf auf der Festplatte bei bf16 – 0,8B: 1,71 GB. 2B: 4,43 GB. 4B: 9,08 GB.
Das 2B ist im Mittel schneller, am Tail dramatisch enger und genauer – und das alles gleichzeitig. Die Aussage „Kleiner bedeutet schneller“ ist in dieser Familie also falsch – und zwar doppelt, denn das 4B ist langsamer als beide. Die einzige Achse, auf der das 0.8B klar gewinnt, ist die, die niemand benchmarkt: 1,71 GB gegenüber 4,43 GB beim 2B und 9,08 GB beim 4B. Wenn Sie einen Scorer in ein festes Speicherbudget einpassen – eine kleine Always-on-Box, eine gemeinsam genutzte GPU, einen Edge-Knoten, auf dem ein Sprachmodell bereits den Großteil der Karte belegt –, dann ist das das ganze Argument – und ein triftiges noch dazu.
Der Rest der Tabelle ist ein Lehrstück darüber, wo kleine Modelle ungleichmäßig einbrechen. Der Wert des 0.8B bei Typed Decision liegt bei 77,35 gegenüber 80,55 beim 4B – drei Punkte Unterschied bei einem Fünftel der Parameteranzahl. Doch Jevbench-Original fällt von 98,61 auf 80,56, und WildJailBreak stürzt von 89,86 auf 64,48 ab. Was auch immer diese beiden Suiten messen – die Modellkarte sagt es nicht, und die Modellkarte gibt überhaupt keine Suite-Definitionen an –, sie sind diejenigen, die den kleinen Checkpoint am härtesten bestrafen. Ein Modell, das auf einer Achse standhält und auf zwei anderen abstürzt, ist kein einheitlich schwächeres Modell. Es ist ein Modell mit einer bestimmten Kompetenzgrenze, und man möchte wissen, wo die eigene Workload liegt, bevor man die Flotte darauf festlegt.
Noch eine Warnung zur Kalibrierungszeile. Der ECE des 0.8B von 0,066 ist sein bester Wert – besser als Jevs 0,095 in derselben Suite –, während sein Brier-Score von 0,530 schlechter ist als Jevs 0,358. Kalibrierter Fehler und mittlerer quadratischer Wahrscheinlichkeitsfehler sind nicht dieselbe Messgröße, und eine Tabelle, in der das eine stark und das andere schwach aussieht, sagt Ihnen, dass die Verteilung in der Nähe ihrer Konfidenzspitzen gut geformt und dazwischen breiter ist, als sie sein sollte. Wenn Ihr System auf Basis der Konfidenz Schwellenwerte setzt, zählt dieser Unterschied mehr als der Durchschnitt.
Was 1,71 GB tatsächlich bringen
Der Inferenzpfad in diesem Modell ist ein Scorer, kein Generator, und der Kostenunterschied ist struktureller Natur, nicht inkrementell. Sie übergeben ihm einen gemeinsamen Zustand, ein Schema benannter Fragen und optional bis zu acht Bilder. Jede Frage hat einen von drei Typen: Auswahl (eine aus einer geordneten Optionsmenge), Punktwert (eine ordinale Skala, zurückgegeben als wahrscheinlichkeitsgewichteter Erwartungswert), oder noul (binär Nein/Ja). Der Zustand, das Schema und ein vollständiges Assistenten-JSON-Gerüst werden mit einem Platzhalter pro Feld gerendert, das Modell führt einen einzigen kausalen Vorwärtsdurchlauf aus, und die Logits werden an der Position unmittelbar vor jedem Platzhalter ausgelesen. Eine Softmax wird nur über die zulässigen Kandidatensymbole dieses Feldes gebildet, die angepasste Kalibrierung des Checkpoints wird angewendet, Symbole werden zurück auf Ihre Optionswerte abgebildet.
Daraus ergeben sich drei Konsequenzen. Es gibt kein Ausgabe-Token und daher keinen Ausgabepreis – eine Million Entscheidungen kosten keine Tokens. Es gibt keine Decodierungsschleife und keine geschweifte Klammer, die man vergessen könnte, sodass fehlerhaftes JSON kein Fehlerfall ist. Und weil der Antwortraum jedes Feldes pro Anfrage zusammengestellt wird, muss ein Schema, das Sie heute Nachmittag erfinden, nicht neu trainiert werden: Fügen Sie eine Frage hinzu, und ihre Optionen werden zu Kandidatensymbolen für dieses Feld.
Die Limits sind genauso schlicht angegeben. Eine bis sechzehn Fragen, jeweils bis zu 62 Optionen, bis zu acht Bilder und eine standardmäßige Obergrenze von 8.192 Token – wobei Eingaben, die darüber hinausgehen, abgelehnt statt gekürzt werden. Diese letzte Klausel ist eine Designentscheidung, über die es sich nachzudenken lohnt, denn stilles Kürzen ist die Art und Weise, wie ein Klassifikator ganz leise beginnt, eine andere Frage zu beantworten als die, die man gestellt hat. InternLM schlägt stattdessen laut fehl, was korrekt ist und zugleich eine operative Falle: Ein langer Ticket-Thread plus ein Schema plus Bilder werden 8.192 schneller überschreiten, als man erwartet, und es gibt keinen eleganten Weg, wenn es dazu kommt.
Und die 1,71 GB erkaufen eine Laufzeitökonomie, die Sie hochrechnen können. Bei 33,98 ms pro Entscheidung ergeben eine Million Entscheidungen 9,44 Stunden auf einer RTX 4090. Das 4B-Modell braucht für dieselbe Million 12,3 Stunden und gibt zehneinhalb Punkte Genauigkeit auf, im Tausch gegen die 7,37 GB, die Sie nicht hatten. Keine der beiden Zahlen enthält die Kosten für die Box, und keine von beiden enthält den Teil, den die Leute vergessen: Sie betreiben einen Dienst, und im Repository gibt es keinen Server.

Qwen 3.8 ist nicht ein einzelnes Modell, und das günstige Ende ist das, das man beachten sollte.
Qwen 3.8 ist, als eigenständiger Name betrachtet, Qwen3.8-2.4T-A95B: der Sparse-Mixture-of-Experts-Kern mit 2,4 Billionen Parametern, den Alibaba am 12. August 2026 als offene Gewichte veröffentlichte, mit rund 95 Milliarden pro Token aktiven Parametern und einer eigenen Lizenz statt Apache 2.0. Die gehostete Bereitstellung desselben Kerns ist Qwen3.8-Max, allgemein verfügbar über eine kostenpflichtige API seit dem 3. August und aktualisiert als datierter Snapshot vom 2. September. Sie sind ein Gehirn, das auf zwei Arten verkauft wird, und die zweite Bereitstellung ist die, die die meisten Leute tatsächlich aufrufen werden.
Unabhängigen Zahlen zufolge misst Artificial Analysis den September-Snapshot von Qwen3.8-Max mit einem Intelligence Index von 45,4 – Platz fünfzehn von 145 indexierten Modellen – bei einem AA Coding Score von 76,2 auf Platz neun von 138, GPQA Diamond bei 92,8, Humanity's Last Exam bei 43,1 und einem Long-Context-Recall-Score von 80,3. Der offene Checkpoint liegt mit 39,9 hinter der API zurück, aus der er destilliert wurde. In unserem eigenen siebentägigen Playground-Fenster liegt Qwen3.8-Max bei einem p50 von 2.578 ms und einem p95 von 9.539 ms bei 55,5 Output-Tokens pro Sekunde, mit einer Fehlerrate von 1,57 %. Qwen3.8-Max ist auf OrcaRouter zum Listenpreis des Anbieters mit 0 % Aufschlag aufrufbar, sodass eine Preisänderung von Alibaba bei uns noch am selben Tag live ist und nicht erst zum nächsten Abrechnungszyklus.
Das dichte Geschwistermodell ist jedoch dasjenige, das man gegen einen lokalen 1,71 GB großen Checkpoint abwägen sollte, denn es ist der günstigste Weg, allgemeine Fähigkeiten in dieser Familie zu erwerben. Qwen3.8-27B ist Apache 2.0, verfügt über einen nativen Kontext von 262.144 Token, und Qwen3.8-27B liegt in unserem Katalog bei 0,33 $ und 2,40 $ pro Million Token. Sein Artificial Analysis Intelligence Index beträgt 33,7. Es hat etwa zweiunddreißigmal so viele Parameter wie Intern-Decision-0.8B, ist immer noch generativ und immer noch das falsche Instrument für eine Entscheidung mit geschlossenem Set bei hohem Volumen – aber es ist die ehrliche mittlere Option und das einzige Mitglied dieses Vergleichs, das zugleich wirklich günstig und wirklich allgemein ist.
Scorer gegen Generator, klar gesagt
• Kontext — Qwen3.8-Max verfügt über ein Fenster von 1.000.000 Token. Intern-Decision-0.8B lehnt alles jenseits von 8.192 ab. Ein Faktor von 122, erzwungen statt abgeschnitten.
• Eingabe — Qwen3.8-Max verarbeitet Text, Bild und Video. Intern-Decision-0.8B verarbeitet Text und bis zu acht Bilder, wobei die Bild-Tokens auf dasselbe Budget von 8.192 angerechnet werden.
• Ausgabe — Qwen3.8-Max schreibt, schlussfolgert, ruft Tools auf und gibt auf Anfrage JSON aus. Intern-Decision-0.8B kann weder einen Absatz noch eine Begründung noch einen Plan erstellen. Es kann nur die Optionen bewerten, die Sie bereits aufzulisten gedacht haben.
• Kosten pro Aufruf — ein realistischer Triage-Aufruf mit 800 Eingabe-Tokens und 150 Ausgabe-Tokens kostet auf Qwen3.8-Max etwa $0,0025, noch ohne jegliche Reasoning-Tokens, und seine Ausgabeseite ist optimistisch klein angesetzt, weil es ein Reasoning-Modell ist. Eine Million solcher Aufrufe kostet ungefähr $2.500. Intern-Decision-0.8B hat überhaupt keinen Token-Preis: Eine Million Entscheidungen entsprechen 9,44 Stunden auf einer 4090, die Sie besitzen oder mieten.
• Latenz — 2.578 ms im Median bei Qwen3.8-Max über die letzten sieben Tage, einschließlich Netzwerk und Warteschlange. Die 33,98 ms von Intern-Decision-0.8B sind ein reiner Forward-Pass auf einer lokalen Karte und keine dieselbe Messung; der ehrliche Vergleich ist eine Größenordnung, nicht achtzigmal.
• Belege — jede Intern-Decision-0.8B-Zahl hier ist vom Anbieter gemeldet auf InternLMs eigenen Testumgebungen und von niemandem reproduziert, einschließlich der Latenz. Jede Qwen-3.8-Zahl ist entweder Alibabas eigene oder eine Messung von Artificial Analysis, und sie sind oben separat gekennzeichnet.
Unabhängige Bewertung – Qwen3.8-Max hat eine. Intern-Decision-0.8B hat überhaupt keine, kein Inferenzanbieter setzt es ein.

Zwei Möglichkeiten, diese Pipeline auszuführen
Die operative Weggabelung ist schärfer als die Benchmark-Weggabelung. Intern-Decision-0.8B ist ein Modul, kein Dienst. Es gibt keinen OpenAI-kompatiblen Endpunkt, keinen Batching-Server, keinen Health-Check, keine Retry-Richtlinie und keine zweite Replik, es sei denn, Sie bauen eine. Es lädt in einem Prozess und beantwortet jeweils ein Dict, und wenn Sie Failover brauchen, sind Sie das Failover. Das ist eine faire Beschreibung eines Forschungs-Checkpoints mit 853 Millionen Parametern, der ohne Launch-Notiz veröffentlicht wurde, und das sollte entsprechend in die Entscheidung eingepreist werden.
Die generative Hälfte derselben Pipeline ist ein Netzwerkaufruf, und für einen Netzwerkaufruf ist ein Router da. Sowohl Qwen3.8-Max als auch Qwen3.8-27B sind über einen OpenAI-kompatiblen Endpunkt erreichbar, und automatisches Failover bedeutet, dass ein beeinträchtigtes Upstream nicht zu Ihrem Vorfall wird – hier erwähnenswert, weil die Live-Fehlerquote von Qwen3.8-Max über sieben Tage auf unserer Seite 1,57 % beträgt, was niedrig ist, bis es Ihre Anfrage ist. Das Muster, das Sinn ergibt, ist genau das, das diese Kombination seit Längerem still beschreibt: den günstigen Closed-Set-Scorer lokal ausführen, weil er schnell ist und pro Aufruf nichts kostet, und den Reasoning-Schritt routen, weil dort die Preissenkungen, der Modellwechsel und die Ausfälle tatsächlich passieren.
Zwei Dinge werden wir nicht behaupten. Intern-Decision-0.8B ist keine unserer Routen und wird es auch nicht sein, bis InternLM es irgendwo hostet — wir werden nichts anderes suggerieren. Und wir hosten heute überhaupt kein InternLM-Modell, daher ist nichts in diesem Artikel ein Pitch dafür, das Subjekt über uns laufen zu lassen.
Was würde die Antwort ändern?
Drei offene Fragen, alle innerhalb weniger Tage beantwortbar. Veröffentlicht InternLM das GitHub-Repository, auf das die eigene Model Card verlinkt, und damit eine Beschreibung, wie diese Gewichte abgestimmt wurden? Folgt den Checkpoints ein Launch-Post, der einen stillen Push in ein dokumentiertes Release mit einer dargelegten Deployment-Story verwandelt? Und reproduziert jemand unabhängig den Durchschnitt von 79,38 oder den Kalibrierungsfehler von 0,066 auf Hardware, die nicht von InternLM stammt?
Bis eines davon erscheint, ist die ehrliche Lesart von Intern-Decision-0.8B eng und spezifisch: Es ist der günstigste Closed-Set-Scorer in einer Familie aus drei, auf einem Footprint, der dort passt, wo sein eigenes schnelleres und genaueres Geschwistermodell nicht passt, veröffentlicht ohne Ankündigung und ohne das eine Artefakt, das dir verraten würde, worauf es abgestimmt wurde. Wenn deine Entscheidung ein Closed-Set ist, deine Antworten in einem Prompt aufzählbar sind und 1,71 GB die Zahl ist, auf die es bei deinem Deployment tatsächlich ankommt, dann ist es die richtige Wahl, und in dieser Größe gibt es nichts Vergleichbares. Wenn deine Antwort nicht im Voraus aufzählbar ist, oder dein Zustand über 8.192 Tokens hinausgeht, oder du eine Begründung brauchst, die du einem Menschen zeigen kannst, dann war der Vergleich nie knapp — und das Modell, das du willst, war nie das mit 853 Millionen Parametern.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
