
Intern-Decision-2B vs. Qwen 3.8: Ein Backbone, zwei sehr unterschiedliche Aufgaben
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 584 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Öffne die Konfiguration für internlm/Intern-Decision-2B und die Konfiguration für Qwen/Qwen3.5-2B nebeneinander, und fast nichts unterscheidet sich. Gleiche 24 Schichten, gleiche 2.048 Hidden-Größe, gleiche 8 Query-Heads gegenüber 2 Key-Value-Heads, gleiche Head-Dimension von 256, gleiche Obergrenze von 262.144 Positionen für Embeddings, gleiches Vokabular von 248.320 Token, dasselbe wiederkehrende Muster aus drei Linear-Attention-Schichten auf eine Full-Attention-Schicht. Intern-Decision-2B ist keine neue Architektur. Es ist dieses Backbone, dem die Fähigkeit zur Textgenerierung entfernt und dessen Konfidenz kalibriert wurde – und genau diese eine Subtraktion macht den Vergleich mit Qwen3.8-Max, dem 2,4-Billionen-Parameter-Flaggschiff, auf das sich der gesamte Familienname „Qwen 3.8“ am oberen Ende bezieht, wertvoller als ein Parameter-Countdown.
Die beiden sind keine Konkurrenten, und das Duell ist kein Wettkampf. Intern-Decision-2B ist ein Fine-Tuning von Qwen3.5-2B mit 2.213.241.664 Parametern, am 26. September 2026 um 05:36 UTC zusammen mit drei nicht angekündigten Geschwistermodellen auf Hugging Face hochgeladen, und es gibt keine Tokens aus: Es nimmt einen Zustand und typisierte Fragen entgegen, führt einen kausalen Vorwärtsdurchlauf aus, liest Logits an festen Platzhalterpositionen und gibt eine kalibrierte Verteilung pro Feld zurück. Qwen3.8-Max ist Alibabas gehostetes Flaggschiff, ein Sparse-Mixture-of-Experts-Modell mit etwa 95 Milliarden pro Token aktiven Parametern, einem multimodalen Kontextfenster von 1 Million Tokens und Listenpreisen von 2,00 US-Dollar pro Million Eingabe-Tokens und 6,00 US-Dollar pro Million Ausgabe-Tokens. Eines ist eine Komponente. Das andere ist ein Dienst. Die nützliche Frage ist, wo die Naht zwischen ihnen in einer Pipeline hingehört, für die Sie bereits bezahlen.
Die Subtraktion, genau
Was Decision-Tuning verändert hat, ist es wert, genau benannt zu werden, denn es macht klar, was das Basismodell bereits in sich trug.
Die Aufgabe wird im Repository als autoregressive masked language modelling bezeichnet. Die Assistenteneingabe enthält ein vollständiges JSON-Gerüst mit einem <decision>-Token pro Feld; die Ground-Truth-Antwortsymbole erscheinen nur in den Labels, niemals in der Eingabe. Beim Training wird die gewöhnliche kausale Next-Token-Ausrichtung verwendet, bei der das Logit unmittelbar vor einem Marker die Antwort dieses Felds vorhersagt und alle Felder einen einzigen Forward Pass teilen. Bei der Inferenz werden die Logits auf die zulässigen Single-Token-Antwortsymbole beschränkt — A–Z, a–z, 0–9, woher die Obergrenze von 62 Optionen stammt —, anschließend softmax-normalisiert und wieder auf deine Labels abgebildet.
Die Next-Token-Mechanik des Basismodells ist also intakt und unverändert. Antrainiert wurde eine Präferenz dafür, eine von einer Handvoll Antwortpositionen zu besetzen, statt einen Satz fortzusetzen, plus eine checkpointspezifische Temperatur von 2,100509348278, die mittels negativer Log-Likelihood über 1.728 ausgewiesene Kalibrierungsfälle mit 1.693 zurückgehaltenen Fällen angepasst wurde. Die Model Card stellt unmissverständlich klar, dass Generierung nicht vorgesehen ist: Die API „führt ein strukturiertes Kandidaten-Scoring durch. Sie ruft weder generate() auf noch sampelt sie Freitext.“
Das Repository hält außerdem fest, was das Tuning nicht berührt hat: Es „stimmt das Sprach-Backbone von Qwen3.5 fein ab, während der Vision-Turm und der Projektor eingefroren werden“. Der 612.517.440 Byte große Vision-Shard beim 2B hat dieselbe Byte-Anzahl wie beim 4B-Entscheidungs-Checkpoint, was eher auf geerbte als auf trainierte Komponenten hindeutet. Der Bildpfad funktioniert; er war einfach nicht das, wofür der Entscheidungsdurchlauf sein Budget ausgegeben hat.

Was 2,2 Milliarden Parameter nicht können – und was die 2,4 Billionen stattdessen tun
Alles trennt sich an einer Achse: ob deine Antwort bereits als Liste existiert.
Intern-Decision-2B beantwortet eine geschlossene Menge. Ein bis sechzehn Fragen, jeweils bis zu 62 Optionen, bis zu acht Bilder, alles innerhalb eines Budgets von 8.192 Tokens, das die Engine lieber ablehnt als kürzt. Zurückgegeben als Wahrscheinlichkeiten. Bei durchschnittlich 33,28 ms pro Anfrage auf einer einzelnen RTX 4090 mit einem P95 von 33,55 ms, und nichts wird pro Aufruf berechnet, weil es keine Ausgabe gibt, für die abgerechnet werden könnte.
Qwen3.8-Max schreibt. Ein Kontext von 1 Million Token, Text-, Bild- und Videoeingabe, Reasoning mit einem Thinking-Modus, native Tool-Aufrufe, strukturierte Ausgaben, bis zu 131.000 Ausgabe-Token im Build mit Datum 0902. Es kann grundsätzlich auch dieselbe Routing-Entscheidung treffen, die Intern-Decision-2B trifft – man kann es auffordern, unter Optionen zu wählen und JSON zurückzugeben. Drei Dinge gehen schief, wenn man das tut. Man bezahlt für die Token, die es für die Entscheidungsfindung verbraucht. Man erhält eine Zeichenkette, deren Parsen gelingen kann oder auch nicht. Und die Zahl in dieser Zeichenkette ist die, die der Sampler erzeugt hat, kein Softmax, auf das man einen Schwellenwert von 0,8 anwenden und auf dessen Grundlage handeln kann.
Beide Darstellungen sind zutreffend, und keine hebt die andere auf. Das Flaggschiff mit 2,4 Billionen Parametern existiert, weil die meisten Probleme keine abgeschlossenen Mengen sind. Der 2,2-Milliarden-Parameter-Scorer existiert, weil die Teilmenge, auf die das zutrifft, ein kostengünstigeres Instrument verdient.
Anzeigetafel

• Parameter — Intern-Decision-2B 2.213.241.664 in BF16 plus einem Vision-Tower und einem Projektor, etwa 4,46 GB auf der Festplatte; Qwen3.8-Max insgesamt ungefähr 2,4 Billionen mit etwa 95 Milliarden aktiven pro Token, bereitgestellt, nicht heruntergeladen.
• Kontext — 8.192 Token, darüber abgelehnt; 1.000.000 Token mit 131.000 maximaler Ausgabe beim Build 0902.
• Ausgabe — kalibrierte Wahrscheinlichkeiten und ein Argmax, kein generierter Text; generierter Text einschließlich eines Reasoning-Trace.
• Eingabemodalitäten — Text plus bis zu acht Bilder; Text, Bild und Video.
• Kosten — keine Gebühr pro Aufruf, und Sie besitzen die GPU; 2,00 $ pro Million Input-Tokens, 6,00 $ pro Million Output, mit Cache-Lesevorgängen zu 0,25 $ und Cache-Schreibvorgängen zu 2,50 $.
• Veröffentlichte Belege — eine herstellerseitige Tabelle mit sieben Suiten, die über 10.751 Testzeilen hinweg einen Durchschnitt von 84,68 sowie Brier 0,437 und ECE 0,100 aufweist, von niemandem außerhalb von InternLM reproduziert, auf einem Checkpoint mit einem Like und null Downloads; ein Artificial Analysis Intelligence Index von 45,4 auf Rang 15 von 145 und ein AA Coding Index von 76,2 auf Rang 9 von 138, beide unabhängig gemessen.
• Latenz — 33,28 ms im Mittel pro Anfrage auf einer RTX 4090, sinkend, wenn Batching hinzugefügt wird; 2,655 Sekunden P50 bis zum ersten Token, wie der Katalog es ausweist, steigend mit der Last.
Die Evidenzzeilen sind nicht gleichwertig und sollten nicht so ausgegeben werden, als wären sie es. Hinter Alibabas Flaggschiff steht ein unabhängiger Indexwert. Der Checkpoint von InternLM hat eine Tabelle, die seine eigenen Autoren erstellt haben, und gerade die Kalibrierungszahl sollte als gut dokumentierte Absicht gelesen werden, bis sie auf die Daten von jemand anderem trifft – umso mehr hier, weil diese spezielle Größe den schlechtesten erwarteten Kalibrierungsfehler der drei von InternLM ausgelieferten Modelle aufweist, 0,100 gegenüber 0,066 für das Modell mit der halben Größe und 0,065 für dasjenige, das fast doppelt so groß ist.
Die Naht, und wie man sie ausführt
Die Pipeline, die Sinn ergibt, ist keine Wahl zwischen diesen beiden, sondern eine Aufteilung: Der Scorer übernimmt die aufgezählten Entscheidungen, und ein Frontier-Modell übernimmt alles, dessen Antwort keine Liste ist. Eine Support-Triage, die an eines von sechs Teams weiterleitet und die Dringlichkeit auf einer dreistufigen Skala bewertet, braucht keine 95 Milliarden aktiven Parameter; sie braucht eine Wahrscheinlichkeit und einen Schwellenwert. Der Eskalationspfad, der dem Kunden schließlich eine Antwort schreibt, schon.
Diese Aufteilung hat eine operative Form. Intern-Decision-2B ist nicht auf OrcaRouter — unsere Modellseite dafür liefert 404, und es gibt nirgends eine gehostete Route, die wir finden konnten — also läuft es auf Ihrer eigenen Hardware, was bedeutet, dass es eine Komponente ist, die Sie betreiben und überwachen. Qwen3.8-Max ist eine Route: ein Schlüssel für über 200 Modelle, der Listenpreis des Anbieters ohne Aufschlag durchgereicht, was bedeutet, dass eine Preisänderung des Anbieters beim Flaggschiff noch am selben Tag auf Ihrer Rechnung ankommt, an dem sie erfolgt. Das gehostete Teilstück der Pipeline hinter diese eine Oberfläche zu legen, ist es, was das günstigere Teilstück günstig hält: Der Scorer sorgt dafür, dass das Anfragevolumen niedrig bleibt, und das Frontier-Modell wird nur für die Fälle herangezogen, die es tatsächlich brauchen.

Wenn Sie noch abwägen, welcher Scorer in diesen Slot gehört – dieser hier hat keine unabhängige Evaluierung, und seine Kalibrierung ist die schwächste in seiner eigenen Familie –, automatisches Failover über Anbieter hinweg ist der Weg, ihn in einem Pfad auszuprobieren, hinter dem bereits eine funktionierende Alternative steht, anstatt diese Alternative vollständig zu ersetzen.
Das ehrliche Urteil
Wenn es bei Ihrem Problem um eine Entscheidung über eine aufzählbare Menge von Antworten geht und der Zustand in achttausend Token passt, erledigt Intern-Decision-2B das in dreiunddreißig Millisekunden kostenlos pro Aufruf, und kein Frontier-Modell wird es auf dieser Achse schlagen, egal wie viele Parameter Sie mieten. Bringen Sie Ihre eigene Kalibrierung daran an, bevor Sie sich auf die Konfidenz verlassen, die es meldet.
Wenn es bei Ihrem Problem um etwas anderes geht – logisches Schlussfolgern, langen Kontext, Tool-Nutzung, Video, ein Dokument mit einer Million Token oder einfach eine Antwort, die noch nicht geschrieben wurde –, dann ist Qwen3.8-Max nicht nur besser. Es ist das einzige der beiden, das die Aufgabe überhaupt bewältigen kann.
Und wenn du noch nicht sagen kannst, welche der beiden du hast, ist die Antwort wahrscheinlich, dass du beide hast, in derselben Pipeline, was die Architektur ist, die dir die Parameterzahlen die ganze Zeit über leise verraten haben.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
