Eine generierte Titelkarte mit der Aufschrift „Intern-Decision-4B vs ContextPilot-8B“, dem Untertitel „Der eine verweigert langen Kontext, der andere meistert ihn“, sowie drei Chips mit der Aufschrift „keine unabhängigen Evaluierungen für beide“, „beide ohne Ankündigung veröffentlicht“ und „keiner ist heute routbar“. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Engineering & Research

Intern-Decision-4B vs. ContextPilot-8B: Ein Modell, das den Kontext verkleinert, gegen ein Modell, das ihn verwaltet

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Such dir dein Gift aus: internlm/Intern-Decision-4Bweigert sich, mehr als 8.192 Token zu lesen, und tencent/ContextPilot-8Bexistiert eigens dafür, Kontexte zu überstehen, die grenzenlos wachsen. Sie gehören derselben Größenklasse an, sind beide Fine-Tunes eines Qwe​n-Basismodells, und beide landeten auf dem Hub ohne Ankündigung des Anbieters und ohne irgendeine unabhängige Evaluation — ContextPilot-8B am 27. August 2026, Intern-Decision-4B am 26. September 2026 — und sie lösen entgegengesetzte Probleme. Intern-Decision-4B ist ein strukturiertes Entscheidungsmodell mit 4,5 Milliarden Parametern, das einen einzigen Forward-Pass ausführt, Logits liest und für jede gestellte Frage eine kalibrierte Wahrscheinlichkeit zurückgibt; es schreibt niemals ein Token. ContextPilot-8B ist ein Textgenerator mit 8,19 Milliarden Parametern, der darauf trainiert ist, während eines langen Agentenlaufs seinen eigenen Arbeitskontext zu planen, sich zu merken und auszulagern. Ein Vergleich der beiden ist nicht wirklich eine Benchmark-Frage. Es ist die Frage, welche Hälfte deines Problems du lieber vom Modell verschlucken lassen würdest.

Zuerst das, was sie wirklich gemeinsam haben

Keines der beiden Modelle verfügt über auch nur eine einzige Zahl, die irgendjemand außerhalb seines eigenen Labors verifiziert hat. Das ist ungewöhnlich genug, um es vor allem anderen zu erwähnen, weil sich die meisten Vergleiche in diesem Blog zumindest für eine Seite auf ein unabhängiges Leaderboard stützen können.

Intern-Decision-4B veröffentlicht eine vollständige Evaluierungstabelle auf seiner Model Card – einen Durchschnitt von 90,02 über sieben Sets, einen Brier-Score von 0,347 und einen erwarteten Kalibrierungsfehler von 0,065 – alles gemessen von InternLM mit InternLMs eigenem Harness. ContextPilot-8B veröffentlicht überhaupt keine Tabelle. Seine Model Card behauptet, das Framework „übertreffe durchgängig bestehende Baselines über verschiedene Basismodelle und Benchmarks hinweg“, und verweist für Details auf ein Paper und eine Evaluierungspipeline. Für diese Gegenüberstellung ist die ehrliche Quellenangabe also kurz: Die eine Seite ist herstellerseitig berichtet und nicht reproduziert, die andere herstellerseitig behauptet und unveröffentlicht, und nichts auf dieser Seite ist unabhängig.

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

Die beiden Wetten, klar ausgedrückt

Die Wette von Intern-Decision-4B ist, dass der schwierige Teil einer Entscheidung nicht das Schlussfolgern ist, sondern das Festlegen. Gib ihm einen Zustand, ein Schema benannter Fragen und bis zu acht Bilder, und es liefert eine Verteilung über deine eigenen Optionsstrings zurück. Das Inferenzverfahren ist deterministisch und formfixiert: Optionen auf Ein-Token-Symbole abbilden, ein Assistant-JSON-Gerüst mit einem Platzhalter pro Feld rendern, einen einzigen kausalen Vorwärtsdurchlauf ausführen, die Logits unmittelbar vor jedem Platzhalter auslesen, Softmax nur über die Kandidaten dieses Felds anwenden, die gefittete Temperatur anwenden. Es gibt keine Decodierungsschleife, also gibt es keinen Parser und keine Angriffsfläche für Freitext-Halluzinationen. Der Preis dieser Wette ist eine harte Obergrenze für Eingaben — die Karte sagt, dass Eingaben über DecisionEngine(max_length=8192) „ohne Trunkierung zurückgewiesen“ werden.

Die Wette von ContextPilot-8B ist das Spiegelbild: Der Agent schreibt weiterhin Tokens, lernt aber, das zu bearbeiten, was er mit sich führt. Es fügt Planung, strukturiertes Langzeitgedächtnis, Retrieval und weiche Kontextauslagerung zum Toolset des Agenten hinzu und trainiert dann den Checkpoint mit einem RL-Rezept, das Verzweigungen rund um die entscheidenden Kontextbearbeitungsentscheidungen sampelt und Credit auf Aktionsebene statt auf Trajektorienebene zuweist. Die Model Card spricht offen über die Konsequenz für das Packaging: Das Laden des Checkpoints liefert kein Kontextmanagement. Die Tool-Definitionen, die Agent-Runtime und die Evaluationspipeline liegen woanders und müssen mitgebracht werden.

Anzeigetafel, Dimension für Dimension

• Ausgabe — Intern-Decision-4B gibt überhaupt keinen Text aus, nur Wahrscheinlichkeiten über Ihre Optionswerte; ContextPilot-8B generiert normal, und seine Antworten sind Prosa und Tool-Aufrufe, die Sie parsen müssen.

• Eingabeobergrenze — Intern-Decision-4B lehnt alles jenseits von 8.192 Tokens ab; ContextPilot-8B erbt das 40.960-Token-Positionslimit von Qwen3-8B und ist darauf ausgelegt, weiterzuarbeiten, während der effektive Kontext wächst.

• Parameter — 4,54B BF16 für Intern-Decision-4B, verteilt über einen Text-Tower, einen Vision-Tower und einen Projektor; 8,19B BF16 für ContextPilot-8B, ein einfaches dichtes kausales Qwen3-Sprachmodell.

• Latenz — Intern-Decision-4B erreicht laut eigener Modellkarte 44,16 ms im Mittel und 44,60 ms bei P95 auf einer einzelnen RTX 4090; ContextPilot-8B veröffentlicht keine Latenzzahl, und seine Kosten sind grundlegend anders, weil es Tokens generiert statt sie zu bewerten.

• Bilder — Intern-Decision-4B verarbeitet bis zu acht, und Bild-Tokens werden auf die Obergrenze von 8.192 angerechnet; die Modellkarte von ContextPilot-8B beschreibt einen Textgenerierungs-Checkpoint ohne multimodalen Pfad.

• Lizenz — Intern-Decision-4B steht unter Apache-2.0, wobei die vorgelagerte Qwen-Lizenz daneben erhalten bleibt; die Lizenz von ContextPilot-8B beginnt mit Abschnitt 0: „ausschließlich zum Zweck der wissenschaftlichen Forschung und Entwicklung bereitgestellt. Sie dürfen es nicht für andere Zwecke verwenden.“

• Veröffentlichte Belege — auf der einen Seite eine Tabelle mit sieben Sets samt Kalibrierungsdiagnostiken; auf der anderen Seite ein Paper-Abstract und ein Verweis auf ein Evaluierungs-Repository.

• Erfolgsbilanz — bei beiden herrscht Ruhe. Intern-Decision-4B verzeichnet seit dem 26. September 2026 ein Like und null Downloads; ContextPilot-8B kommt seit dem 27. August 2026 auf 11 Likes und rund tausend Downloads, was zwar mehr Aufmerksamkeit bedeutet, aber weiterhin keine Bewertung durch Dritte.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

Wo jedes Einzelne tatsächlich bricht

Der Fehlermodus von Intern-Decision-4B ist struktureller Natur, und es lohnt sich, konkret zu werden. Wenn die Evidenz für eine Entscheidung nicht in 8.192 Tokens passt, degradiert das Modell nicht sanft – es lehnt die Anfrage ab. Das ist eine vertretbare Engineering-Entscheidung und eine denkbar schlechte Passung für genau die Arbeitslast, für die ContextPilot-8B gebaut wurde. Die Konfiguration der Karte selbst verschärft die Spannung noch: Der Text-Tower unter dem Wrapper deklariert ein Positionslimit von 262.144 Tokens. Das Backbone kann eine Viertelmillion Tokens adressieren, und der veröffentlichte Wrapper akzeptiert nicht mehr als achttausend.

Der Fehlermodus von ContextPilot-8B besteht darin, dass es kein Drop-in-Ersatz für irgendetwas ist. Es ist ein Checkpoint innerhalb eines Frameworks, und das Framework ist der Ort, an dem das Verhalten steckt. Nimmt man die Gewichte ohne die Tool-Definitionen und die Agent-Runtime, hat man ein Qwen3-8B-Fine-Tuning, dessen unterscheidende Fähigkeit wirkungslos ist. Hinzu kommt Abschnitt 0 der Lizenz, und die praktische Antwort für einen kommerziellen Einsatz ist, dass man es so, wie es ausgeliefert wird, überhaupt nicht nutzen kann — was auch bedeutet, dass es für uns kein in Frage kommender Weg ist, weder jetzt noch in naher Zukunft.

Wenn Sie jedes bereitstellen wollten

Intern-Decision-4B will eine kleine GPU und keinen Serving-Stack, der den Namen verdient: Installiere PyTorch 2.9.1 und Transformers 5.14.1 unter Python 3.12, lade die vier Shards einmal, halte die Engine resident und führe das Scoring aus. Da der Forward-Pass eine feste Form hat, liegen P50 und P95 nur sechs Zehntelmillisekunden auseinander, sodass es bei der Kapazitätsplanung um Parallelität statt um Tail-Latenz geht. Der unangenehme Teil ist, dass es als importierbare Python-Klasse statt als HTTP-Service ausgeliefert wird, sodass man es selbst wrappen muss, um es einem Produktionsaufrufer vorzuschalten.

ContextPilot-8B will die entgegengesetzte Behandlung: einen echten Serving-Pfad, einen Tool-Executor, Memory-Stores und eine branch-fähige Rollout-Umgebung, wenn Sie jemals beabsichtigen, es wie vorgesehen neu zu trainieren oder zu evaluieren. Dies ist kein Modell, das man an einem Nachmittag ausprobiert; es ist ein Forschungsframework, das man übernimmt.

Hilft ein Router hier?

Teilweise – und die ehrliche Version ist enger gefasst als üblich. OrcaRouter führt Intern-Decision-4B, ContextPilot-8B oder einen vergleichbaren Checkpoint zur Entscheidungsbewertung nicht in seinem Katalog – unsere Modellseiten liefern für beide ein 404, und nichts in diesem Beitrag sollte als Verfügbarkeitsaussage gelesen werden. Was ein einheitlicher Endpunkt tatsächlich bringt, ist die Möglichkeit, ein gescheitertes Experiment hinter ein Fallback zu stellen: ein Schlüssel für über 200 Modelle, durchgereichter Listenpreis des Anbieters mit 0 % Aufschlag, und automatisches Failover, damit ein Scorer, den Sie noch evaluieren, nie zum Single Point of Failure wird. Das ist ein echter Vorteil für die Intern-Decision-Seite dieses Vergleichs, wo das Modell tatsächlich günstig und lokal läuft. Bei ContextPilot-8B ist das irrelevant, denn eine Lizenz nur für Forschung und Entwicklung schließt einen kommerziellen Weg aus, unabhängig davon, was irgendein Router unterstützt.

Welches denn?

Wenn Ihre Frage eine geschlossene Menge von Antworten hat, mit angehängten Belegen eintrifft und eine Wahrscheinlichkeit statt einer Erklärung erfordert, ist Intern-Decision-4B das interessantere Objekt – kostengünstig, formstabil, durch Konstruktion kalibriert und ehrlich in Bezug auf die Eingabe, die es nicht akzeptiert. Wenn Ihr Problem darin besteht, dass die Belege nicht aufhören einzutreffen, wird Ihnen kein Entscheidungs-Scorer helfen, und ContextPilot-8B zielt auf das richtige Ziel, mit dem Vorbehalt, dass Sie eher ein Framework und eine Forschungslizenz als ein Modell übernehmen.

Was die Sache klären würde, ist ein Test, den keiner der beiden Anbieter durchgeführt hat: beiden dieselbe kurze, strukturierte Entscheidung vorzulegen, deren Antwort aus dem Zustand berechenbar ist, und zu sehen, ob der 90,02-Durchschnitt des Scorers außerhalb seiner eigenen Testumgebung Bestand hat. Bis jemand das tut, ist die richtige Lesart dieses Duells, dass die beiden Modelle überhaupt nicht um denselben Platz konkurrieren.

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.