Eine Hero-Titelkarte mit dem Text „Intern-Decision-0.8B vs LFM2.5 2.6B Base“ und dem Untertitel „Zwei Wege, etwas selbst zu bauen“, die die Badges „einer gibt eine Verteilung zurück“ und „einer gibt einen Trainingslauf zurück“ trägt, mit dem in der Ecke eingefügten OrcaRouter-Logo.
Guides & Insights

Intern-Decision-0.8B vs. LFM2.5 2.6B Base: Zwei Wege, etwas selbst zu bauen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stell Intern-Decision-0.8B neben LFM2.5 2.6B Base, und die erste ehrliche Feststellung ist, dass keiner von beiden ein Produkt in dem Sinn ist, den ein Käufer normalerweise meint. Intern-Decision-0.8B ist der Checkpoint, den InternLM am 26. September 2026 ohne jede Ankündigung auf Hugging Face hochgeladen hat — ein Fine-Tune von Qwen3.5-0.8B mit 852.985.920 Parametern, der eingetippte Fragen beantwortet und keinen Text ausgibt, veröffentlicht unter Apache 2.0 mit einem GitHub-Link, der 404 liefert. LFM2.5 2.6B Base ist Liquid AIs vortrainierter Text-Checkpoint mit 2,69 Milliarden Parametern, am 1. August 2026 als Grundlage für die LFM2.5-Familie veröffentlicht, und auf der zugehörigen Modellkarte steht, er sei „nur für Aufgaben empfohlen, die umfangreiches Fine-Tuning erfordern". Der eine ist fertig und eng gefasst. Der andere ist unfertig und allgemein. Beide gehen davon aus, dass du die Arbeit machst — und die Arbeit ist nicht dieselbe.

Diese Unterscheidung macht den ganzen Vergleich aus, und sie ist der Grund, warum eine reine Spezifikationstabelle in die Irre führen würde. Die Frage, die ein Leser tatsächlich hat, lautet „Welche davon lade ich herunter?“, und die Antwort hängt davon ab, ob das, was Sie bauen müssen, eine Entscheidungsschicht oder eine Sprachfähigkeit ist. Das sind unterschiedliche Projekte mit unterschiedlichen Zeitplänen.

Was jedes Modell Ihnen liefert

Intern-Decision-0.8B kommt als funktionierendes System. Das Repository liefert inference.py/, eine DecisionEngine/-Klasse, ein dokumentiertes Anfrage-Schema und ein Antwort-Schema sowie ein ausgearbeitetes Beispiel, das Sie ausführen können, nachdem Sie vier festgelegte Python-Abhängigkeiten installiert haben. Sie geben einen Zustand, ein bis sechzehn benannte Fragen mit bis zu 62 Optionen jeweils und optional bis zu acht Bilder an, und Sie erhalten eine kalibrierte Verteilung plus ein Argmax-Label pro Feld zurück. Die Engine liest Logits an festen Positionen in einem vorgerenderten Skelett, anstatt etwas zu generieren, daher gibt es keinen Dekodierungsschritt, keine Ausgabe-Tokens und kein JSON zu reparieren. Sie läuft mit etwa 1,73 GB an Dateien.

LFM2.5 2.6B Base liefert Ihnen das Gegenteil: rohe Leistungsfähigkeit ohne Schnittstelle. Es ist ein rein textbasiertes kausales Sprachmodell mit 30 Schichten, angeordnet als 22 doppelt gegatete Kurzfaltungsblöcke und 8 Grouped-Query-Attention-Schichten, vortrainiert auf etwa 34 Billionen Tokens über 16 Sprachen hinweg, mit einem Vokabular von 128.000 Tokens und einem Kontextfenster von 131.072 Tokens. Es verfügt über kein eigenes Instruction-Tuning und keine Aufgaben-Benchmarks auf der Modellkarte, denn ein Basis-Checkpoint wird nicht bewertet – die Modelle, die Sie daraus trainieren, werden bewertet. Liquids eigene Post-Training-Pipeline ist es, die daraus das agentische LFM2.5-2.6B macht, und genau diese Pipeline sollen Sie – teilweise oder vollständig – für Ihre eigene Domäne reproduzieren.

Die Achse ist also nicht die Größe. Sie ist, ob das fehlende Teil ein Entscheidungsvertrag oder ein Trainingslauf ist.

Die Anzeigetafel, mit den daran geknüpften Vorbehalten

• Zeit bis zum ersten Ergebnis — Intern-Decision-0.8B: ein Nachmittag, um einen Checkpoint zu laden und den Aufruf von predict()/. LFM2.5 2.6B Base: so lange, wie dein Continued-Pre-Training- oder SFT-Lauf dauert, plus die Datenarbeit, um ihn vorzubereiten.

• Parameter — Intern-Decision-0.8B: 852.985.920 über ein 1,50 GB großes Sprach-Shard, ein 176 MB großes Vision-Shard und einen 25 MB großen Projektor. LFM2.5 2.6B Base: 2,69B, ungefähr 2,5 GB an Gewichten.

• Eingabemodalitäten — Intern-Decision-0.8B: Text plus bis zu acht Bilder, wobei die Vision-Gewichte im Repo vorhanden sind. LFM2.5 2.6B Base: nur Text, konstruktionsbedingt — die multimodale Arbeit in der LFM2.5-Familie findet in den VL-Varianten statt.

• Praktischer Kontext — Intern-Decision-0.8B: 8.192 Token, abgelehnt statt abgeschnitten, trotz einer maximalen Positionseinbettung von 262.144 in der Konfiguration. LFM2.5 2.6B Base: 131.072 Token nativ.

• Ausgabe — Intern-Decision-0.8B: eine kalibrierte Wahrscheinlichkeitsverteilung und ein Argmax-Label pro Feld, deterministisch. LFM2.5 2.6B Base: fortgesetzter Text, gesampelt.

• Benchmarks — Intern-Decision-0.8B: eine vollständige Herstellertabelle über sieben Benchmarks, von niemandem reproduziert. LFM2.5 2.6B Base: keine für das Base selbst veröffentlicht, bewusst.

• Lizenz — Intern-Decision-0.8B: Apache 2.0, mit einer beibehaltenen LICENSE-QWEN/ für die Upstream-Gewichte. LFM2.5 2.6B Base: LFM Open License v1.0.

A two-column scoreboard comparing Intern-Decision-0.8B with LFM2.5 2.6B Base on six shared rows: parameters 852,985,920 against 2.69B in about 2.5 GB, what you get a working engine and a documented schema against raw pre-trained weights with no interface, time to first result an afternoon against a continued pre-training or SFT run, input text plus up to eight images against text only with a 131,072-token context, benchmarks a vendor table unreproduced against none published for the base, and licence Apache 2.0 plus LICENSE-QWEN against the LFM Open License v1.0 and its $10M threshold.

Die Lizenzzeile verdient einen eigenen Abschnitt.

Auf beiden Karten steht „open“, und die beiden Wörter bedeuten wesentlich unterschiedliche Dinge. Intern-Decision-0.8B ist Apache 2.0 — keine Umsatzbedingung, keine Einschränkung des Nutzungsbereichs, keine separate kommerzielle Lizenz, über die verhandelt werden müsste. Die zweite Lizenzdatei im Repository ist die Qwen-Lizenz, die weitergeführt wird, weil das Modell ein Derivat von Qwen3.5-0.8B ist, was die korrekte Handhabung und keine Einschränkung ist.

LFM2.5 2.6B Base wird unter der LFM Open License v1.0 vertrieben, und Abschnitt 5 dieser Lizenz sollte vollständig gelesen werden, bevor sich ein kommerzielles Vorhaben darauf stützt. Die für Commercial Use gewährten Rechte sind daran geknüpft, dass Sie oder Ihre juristische Person eine in der Lizenz definierte Schwelle nicht überschreiten: einen Jahresumsatz von 10 Millionen US-Dollar oder mehr. Oberhalb dieser Grenze ist die kommerzielle Nutzung des Werks oder eines abgeleiteten Werks nicht durch die Vereinbarung lizenziert. Gemeinnützige und Forschungsnutzung sind ausgenommen. Das ist eine reale und durchsetzbare Grenze, und da sie auch für abgeleitete Werke gilt, pflanzt sie sich in alles fort, was Sie vom Base-Modell aus fein-tunen – was dem gesamten beabsichtigten Verwendungszweck dieses Checkpoints entspricht.

Hier gibt es eine naheliegende Lesart: Wenn Sie kommerziell entwickeln und Ihr Unternehmen 10 Mio. US-Dollar Jahresumsatz überschreitet, ist LFM2.5 2.6B Base nicht dieselbe Art von Asset wie Intern-Decision-0.8B, unabhängig davon, wie die beiden abschneiden. Wenn Sie unterhalb der Schwelle liegen, forschen oder für einen nichtkommerziellen Zweck feinabstimmen, spielt diese Unterscheidung keine Rolle. So oder so ist es eine Frage, die vor dem Trainingslauf beantwortet werden sollte, nicht danach.

Wo jeder einzelne tatsächlich der richtige Download ist

LFM2.5 2.6B Base ist die richtige Wahl, wenn die Fähigkeit, die Sie benötigen, in einem fertigen Modell noch nicht existiert. In der Modellkarte von Liquid sind die vorgesehenen Anwendungsfälle explizit aufgeführt: sprachspezifische Assistenten wie etwa für Japanisch, domänenspezifische Assistenten wie etwa für den medizinischen Bereich, Training mit proprietären Daten, die Sie nicht an eine API senden können, oder Experimentieren mit neuartigen Post-Training-Ansätzen. Der Gedanke hinter dieser Liste ist, dass 34 Billionen Token mehrsprachigen Pre-Trainings teuer zu reproduzieren und nahezu kostenlos zu erben sind – Sie kaufen einen Ausgangspunkt, der bereits über 16 Sprachen und einen 128K-Kontext hinweg kompetent ist, und investieren Ihre eigene Rechenleistung in den Teil, der für Sie spezifisch ist.

Die Ökosystem-Unterstützung für diesen Plan ist für ein so neues Modell ungewöhnlich vollständig. Liquid dokumentiert kontinuierliches Pre-Training, SFT, DPO und GRPO über Unsloth und TRL, mit Notebooks für jede, und der Checkpoint wird von Transformers, vLLM, SGLang, llama.cpp, MLX und LM Studio unterstützt. Das ist kein Werbetext — es ist der Unterschied zwischen einem Basismodell, das man diese Woche noch feinabstimmen kann, und einem, für das man zwei Wochen damit verbringt, es in einen Trainer zu kleben.

Intern-Decision-0.8B ist die richtige Wahl, wenn die Fähigkeit, die Sie benötigen, bereits existiert und das Problem in der Form liegt. Wenn Ihre Aufgabe eine begrenzte Entscheidung mit einer geschlossenen Antwortmenge ist – dieses Ticket weiterleiten, diesen Anspruch bewerten, diesen Datensatz anhand einer Rubrik klassifizieren –, dann ist ein generatives Modell ein umständlicher Weg, ein Label zu erhalten, und ein Basismodell ist überhaupt kein Weg, eines zu erhalten. Was Sie wollen, ist etwas, das die Verteilung zurückgibt, Ihnen seine Konfidenz mitteilt und das jedes Mal in denselben 34 Millisekunden erledigt. Die gemessene Latenz von InternLM auf einer einzelnen RTX 4090 beträgt im Mittel 33,98 ms bei einem p95 von 37,50 ms, und die eigenen Zahlen der Karte zeigen das 2B-Schwestermodell bei 33,28 ms im Mittel – ein Hinweis darauf, dass bei diesen Prompt-Längen die Kosten im Lesen des Schemas liegen, nicht im Ausführen der Gewichte.

Der Tausch, den du machst, ist Flexibilität gegen einen Vertrag. Ein Basismodell kann irgendwann alles werden, wenn du die Daten und die Rechenleistung hast. Ein Entscheidungs-Head ist bereits genau das, und er wird nie etwas anderes werden. Wenn sich die Form deines Schemas jeden Monat ändert, sind das echte Kosten. Wenn nicht, ist es überhaupt kein Kostenfaktor.

Was Ihnen niemand über die Intern-Decision-Tabelle sagen kann

Jede Leistungsangabe für Intern-Decision-0.8B stammt vom Anbieter, und der Vorbehalt ist hier schwerer wiegend als üblich, weil die Veröffentlichung erst eine Woche alt und völlig undokumentiert ist. Es gibt kein Paper, keine Sammlung, die die drei Größen zusammenführt, kein funktionierendes GitHub-Repository und keine unabhängige Evaluierung. Eine Suche bei Artificial Analysis liefert zu dem Modell nichts.

InternLM wählte die Benchmarks aus, wählte die Vergleichsmodelle aus – eine Gruppe, die von Entscheidungsmodellen dominiert wurde, darunter TypeSafe's Jev, Convai's Laya und Kev – und veröffentlichte die Tabelle ohne einen Launch-Post.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Mit diesem Etikett versehen, ist die Form dennoch lesenswert. Intern-Decision-0.8B erzielt 97,92 / 80,56 / 52,25 über die drei Jevbench-Splits, 77,35 bei Typed Decision und 94,52 bei ToolACE, was einem Durchschnitt von 79,38 entspricht. Sein Kalibrierungsprofil ist der interessanteste Eintrag: ein Brier von 0,530 und ein erwarteter Kalibrierungsfehler von 0,066, was ein besserer ECE ist als Jevs 0,095, trotz eines schlechteren Brier. In einfachen Worten ist es weniger genau, aber ehrlicher darüber, wie genau es ist, und für einen schwellenwertbasierten Workflow ist diese Reihenfolge wichtiger als der Durchschnitt. Die Spalte, die eine Bereitstellung stoppen sollte, ist WildJailBreak mit 64,48 gegenüber Jevs 96,29. Ein so großes Defizit bei der Ablehnungsrobustheit ist eine Eigenschaft des Fine-Tunings, und ob es auf die Qwen3.5-0.8B-Basis, das Decision-Tuning-Ziel oder die Parameteranzahl zurückzuführen ist, ist nirgendwo auf der Karte dokumentiert.

Beim Vergleich mit LFM2.5 2.6B Base auf dieser Achse geht es nicht darum, „wer höher punktet“, denn das Base-Modell hat keine Punktzahlen. Vielmehr geht es darum, dass die Zahlen des einen Modells ungeprüft sind und die Zahlen des anderen Modells nicht existieren, und ein Leser, der zwischen ihnen wählt, entscheidet sich damit, mit welcher Art von Unbekanntem er arbeiten will.

Die Pipeline, die die meisten Leute tatsächlich am Ende bauen

Es gibt eine Konfiguration, die beides verwendet, und es lohnt sich, sie zu benennen, denn dort landen die meisten Produktionssysteme. Die Entscheidungsschicht übernimmt die geschlossenen Aufrufe – Triage, Routing, Rubrikbewertung –, bei denen die Antwortmenge bekannt ist, sich die Latenz über eine Million Datensätze hinweg summiert und Ausgabe-Tokens reiner Overhead sind. Die Sprachschicht übernimmt alles, was Prosa, Synthese oder langen Kontext benötigt: die Eskalationszusammenfassung, die dem Label beigefügte Erklärung, den Entwurf, den ein Mensch bearbeitet. LFM2.5 2.6B Base ist ein plausibles Substrat für die zweite Hälfte, wenn Sie über Domänendaten verfügen, auf denen sich Training lohnt; ein Entscheidungs-Head ist die natürliche Form der ersten.

Die beiden zusammenzusetzen ist der fummelige Teil, und es ist der Teil, den man nicht von Hand bauen sollte. OrcaRouters Routing-DSL drückt Routing als Code aus — YAML mit CEL-Bedingungen, bereitgestellt ohne ein erneutes Deployment — sodass eine Pipeline, die eine Klasse von Anfragen an einen Decision-Endpunkt und eine andere an ein Sprachmodell sendet, eine Routing-Regel ist statt eines Load Balancers, den Sie selbst warten. Das Gateway deckt über 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel ab, wobei der Listenpreis des Anbieters ohne Aufschlag durchgereicht wird, und es erhebt keinen Aufschlag auf das Modell, das Sie auswählen. Um die Grenze präzise zu benennen: Weder Intern-Decision-0.8B noch LFM2.5 2.6B Base stammen von uns — beides sind Checkpoints, die Sie herunterladen und lokal ausführen, und in beiden Fällen ist genau das der Punkt, denn der Grund, ein 2-GB-Modell zu wählen, ist, dass es dort läuft, wo Ihre Daten bereits sind. Wofür ein Gateway da ist, ist die Hälfte des Stacks, die Sie sonst extern aufrufen würden.

Wenn die Entscheidungsschicht der Teil ist, den Sie testen möchten, ohne dafür einen Trainingslauf anzusetzen, ist ein gehostetes Entscheidungsmodell das günstigere Experiment, und Jev 1.13 von TypeSafe ist das Modell, gegen das InternLM gebenchmarkt hat — heute über einen einzigen OpenAI-kompatiblen Endpunkt aufrufbar, zu 0,042 US-Dollar pro Million Eingabe-Tokens, wobei die Ausgabe mit null berechnet wird.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Welches denn?

Wähle LFM2.5 2.6B Base, wenn die Fähigkeit noch nicht existiert und du sowohl die Domänendaten als auch die Bereitschaft für einen Fine-Tuning-Lauf hast, und prüfe die Umsatzschwelle von 10 Mio. US-Dollar in der LFM Open License, bevor du kommerziell darauf aufbaust. Wähle Intern-Decision-0.8B, wenn die Fähigkeit existiert, die Antworten in deinem Prompt bereits aufzählbar sind und du einen schnellen, deterministischen, lizenzrechtlich sauberen Weg brauchst, um das Label zu bekommen — und dabei akzeptierst, dass seine Dokumentation fehlt, seine Benchmarks nicht auditiert sind und sein Verweigerungsverhalten bei adversarialen Eingaben von niemandem außerhalb des Labors getestet wurde, das es abgestimmt hat. Der zweite ist der kürzere Weg und die größere Unbekannte. Der erste ist der längere Weg und der besser dokumentierte, und nichts davon ist gleichbedeutend mit besser.