Eine generierte Titelkarte für den Artikel „Mistral Large 4 ist eine 1T-Parameter-Vorschau“, die den Titel in fetter geometrischer serifenloser Schrift zeigt, darunter den Untertitel „Die Gewichte wurden noch nicht veröffentlicht“, und darüber eine Reihe aus drei flachen Liniensymbolen – ein geschlossenes Vorhängeschloss, ein ausgegrauter Download-Pfeil und ein Schild – auf weißem Hintergrund mit blau- und cyanfarbenen Farbverlaufsakzenten und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Mistral Large 4 ist eine 1T-Parameter-Vorschau: Die Gewichte wurden noch nicht veröffentlicht

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Mistral Large 4 erschien am 6. Oktober 2026 als öffentliche Vorschau – ein Mixture-of-Experts-Modell mit einer Billion Parametern, 49 Milliarden aktiven Parametern, einem 1,6-Milliarden-Parameter-Vision-Encoder und der Behauptung seines Herstellers, es sei das stärkste Open-Weight-Modell, das außerhalb Chinas entwickelt wurde. Was nicht angekommen ist, ist der Teil, den die Worte „Open-Weight“ beschreiben. Heute gibt es keine Checkpoints zum Herunterladen, keine Lizenzdatei und kein Repository. Mistral sagt, die Gewichte kommen „Ende dieses Monats“, nach einem Red-Teaming-Fenster, in dem geprüfte Partner und nationale Behörden einen entsperrten Build mit reduzierter Moderation und erweiterter Cyber-Fähigkeit erhalten. Die treffende Beschreibung von Mistral Large 4 in dieser Woche ist also eine Vorschau-API, die man aufrufen kann, und ein Modell, das man noch nicht besitzen kann.

Diese Trennung ist die eigentliche Geschichte, nicht eine Fußnote dazu. Jede Zahl, die Mistral zusammen mit der Ankündigung veröffentlicht hat – die Coding-Scores, die Cyber-Scores, die Finanz- und Rechtsbewertungen –, wurde auf einem Build erzeugt, der noch verändert wird, und jede Schlagzeile, die es mit einem geschlossenen Frontier-Modell vergleicht, vergleicht ein Artefakt, das nicht das Artefakt sein wird, das Sie herunterladen. Sinnvoll bei einem Launch wie diesem ist es, zu trennen, was Sie heute überprüfen können, von dem, was Sie einfach glauben sollen, und mistral.ais eigener Post ist ungewöhnlich großzügig darin, zu sagen, was was ist.

Was ist am 6. Oktober tatsächlich live

Die Preview-API ist auf Mistral Studio unter der Modell-ID mistral-large-4-0 verfügbar. Mistrals eigene Modellkarte beschreibt sie als „ein hochmodernes, offengewichtetes, universelles multimodales Modell“, das auf einer granularen MoE-Architektur basiert, und schlüsselt die Parameterzahl auf: 49 Mrd. aktive gegenüber 1,05 Bio. insgesamt, plus den Vision-Encoder. Das Unternehmen hat es von Grund auf auf 3.000 NVIDIA Grace Blackwell GPUs in seinen eigenen europäischen Rechenzentren trainiert, und die Preview wird auf derselben Infrastruktur bereitgestellt – ein Souveränitätsargument, das Mistral genauso laut vertritt wie das Leistungsargument.

Die Spezifikation, wie der Anbieter sie angibt:

• Gesamt- vs. aktive Parameter — 1,05 Billionen gesamt, 49 Milliarden aktiv pro Token, sparse MoE

• Modalitäten — Text und Bild als Eingabe, Text als Ausgabe; von Natur aus multimodal statt eines nachträglich angeflanschten Adapters

• Kontextfenster — Mistrals Dokumentation gibt 1 Mio. an; Artificial Analysis ermittelt 524.288 bei der von ihm getesteten Konfiguration, daher sollte man die 1 Mio. als Obergrenze des Anbieters und nicht als das tatsächlich bereitgestellte Fenster betrachten

• Preis — 1,36 $ pro Million Eingabe-Tokens und 4,18 $ pro Million Ausgabe-Tokens, wobei zwischengespeicherte Eingabe 0,14 $ kostet, laut Mistrals veröffentlichter Preisübersicht

• Einführungsangebot — dieselbe Karte zeigt eine durchgestrichene $0,68 / $2,09-Aktion mit $0,07 für zwischengespeicherte Eingabe, d. h. halber Preis

• Gewichte — nicht veröffentlicht; „Ende dieses Monats“ laut der Ankündigung

• Lizenz — weder in der Ankündigung noch auf der Dokumentationsseite genannt, die den Eintrag nur als „Open“ kennzeichnet

Zwei dieser Zeilen verdienen es, zweimal gelesen zu werden. Das Kontextfenster unterscheidet sich um den Faktor zwei, je nachdem, ob man die Angaben des Anbieters oder des unabhängigen Testlabors liest, was für eine Vorschauversion, deren Serving-Konfiguration sich noch ändert, nicht ungewöhnlich ist, aber man sollte es wissen, bevor man eine Workload darauf dimensioniert. Und der Preis, den Sie zahlen werden, hängt davon ab, ob der Aktionspreis über das Startfenster hinaus Bestand hat; $1.36 / $4.18 ist der Preis, den Mistrals eigene Preisliste aufführt, und $0.68 / $2.09 ist der Preis, der derzeit berechnet wird. Gehen Sie von Ersterem aus, wenn Sie Ihre Rechnung kalkulieren.

A generated single-column scoreboard titled 'Mistral Large 4 Preview — the scoreboard', listing the API id mistral-large-4-0 and rows: Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; context 1M stated by the vendor against 524,288 tested; input $1.36 now $0.68; output $4.18 now $2.09; cached input $0.14 now $0.07; weights promised end of October; licence unnamed; announced 6 October 2026. The footer reads that index and per-task figures are per Artificial Analysis Intelligence Index v4.3 read 6 October 2026, prices are per the vendor's own rate card, and AA still flags the model isOpenWeights: false.

Die Benchmark-Zahlen und wer sie durchgeführt hat

Mistrals Beitrag ist sorgfältig mit Blick auf die Provenienz, und diese Vorsicht sollte man weiter mittragen. Drei der zentralen Agentic-Coding-Werte — 61,7 % auf DeepSWE v1.1, 59,4 % auf SWE-Atlas-QnA und 28,3 % auf Terminal-Bench 4.0, die zusammen einen Coding Agent Index Score von 49,8 % ergeben — sind, in Mistrals eigenen Worten, „die Zahlen, die von Artificial Analysis privat evaluiert wurden, bevor der öffentliche Start des Harness erfolgte.“ Sie stehen noch nicht im öffentlichen Index von Artificial Analysis. Das werden sie sein, sobald der Harness erscheint. Bis dahin sind es vom Anbieter veröffentlichte Zahlen, die ein Dritter erzeugt, aber noch nicht veröffentlicht hat, was eine stärkere Provenienz ist als bei den meisten Launch-Behauptungen und dennoch nicht dasselbe wie ein reproduzierbarer öffentlicher Score.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed with a version tag of v26.10 and the description 'A state-of-the-art, open-weight, general-purpose multimodal model' — the description Mistral Large 3 beside it shares, while only Large 3 carries an APACHE 2.0 licence badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, and the OCR MODELS section begins below.

Was heute öffentlich und unabhängig ist, abgelesen auf der Modellseite von Artificial Analysis am 6. Oktober: Mistral Large 4 Preview erreicht 38,4 auf dem Intelligence Index v4.3, benötigt etwa 507 Sekunden pro Aufgabe, mit Terminal-Bench 4.0 bei 26,8 % und Long-Context Reasoning bei 81,3 %. Dieselbe Seite listet es als Open-Weights-Modell, das tatsächlich nicht Open-Weights ist – das Flag lautet isOpenWeights: false mit der Kategorisierung „proprietary“, weil das, was existiert, ein Preview ist, das vom eigenen Cluster des Anbieters ausgeliefert wird. Dieses Flag ist die klarste einzelne Illustration der Lücke, um die es in diesem Artikel geht.

A screenshot of the Artificial Analysis model page for Mistral Large 4 Preview, showing the header describing it as a proprietary model released October 2026, percentile ranks of #64 of 225 for intelligence, #51 for speed, #56 for cost and #105 for verbosity, pricing of $1.36 in and $4.18 out with a 90% cache discount, an Intelligence Index of 38, a cost-per-task figure of $1.13, and a summary paragraph noting a 524k-token context window, text and image input, and roughly 200M tokens generated during the index run.

Das zitierfähigste Ergebnis ist das, das Mistral nicht selbst durchgeführt hat. Surge AI, ein Drittanbieter-Unternehmen für Annotation, führte eine blinde menschliche Bewertung der Coding-Qualität durch, bei der die Identitäten der Modelle verborgen blieben, und professionelle Annotatoren bewerteten Mistral Large 4 Preview mit 3,74 auf einer Skala von 1–5 — Zweitplatzierter von fünf, vor Kimi K3 mit 3,59, GLM-5.3 mit 3,60 und GLM-5.2 mit 3,40, und liegt nur hinter Claude Opus 5 mit 4,22 zurück. Eine blinde menschliche Evaluation mit einem namentlich genannten Labor auf der anderen Seite ist eine andere Art von Beleg als ein selbst durchgeführter Benchmark, und sie ist der einzelne stärkste unabhängige Datenpunkt in der Ankündigung.

Dann gibt es da noch den Cyber-Bereich, in dem Mistral seine schärfste Behauptung aufstellt. Im Cyber Index von Artificial Analysis gibt das Unternehmen an, dass Mistral Large 4 weltweit zu den Top fünf zählt und die außerhalb Chinas entwickelten Open-Weight-Modelle anführt. In einem konkreten Test – eine echte Schwachstelle in Open-Source-Software reproduzieren und sie dann patchen – erreicht es 82 %, was als der höchste Wert aller Modelle bezeichnet wird, sowie 93 % bei den 40 Wettbewerbsaufgaben von Cybench. Mistral ergänzt eine spitze Beobachtung: Mehrere führende geschlossene Modelle, Claude Opus 5.5 und GPT-6 Astra darunter genannt, erreichen bei genau diesem Test nahezu null, weil sie die Aufgabe verweigern. Ohne die Drittanbieter-Seite vor sich ist die 82-%-Angabe eine Herstellerzahl; das Argument mit der Verweigerungsrate ist eine Herstellerinterpretation. Beides ist plausibel, und nichts davon ist heute unabhängig bestätigt.

Warum die Vorschau-Rahmung die Preisberechnung verändert

Eine Preview ist nicht bloß ein Phasen-Label. Sie bedeutet, dass das Modell mit kürzerer Ankündigungsfrist als bei einem GA-Release umgelenkt, neu bepreist oder außer Betrieb genommen werden kann, und sie bedeutet, dass die Serving-Konfiguration, gegen die du benchmarkst, nicht mit der übereinstimmen muss, auf der du deployst. Für eine Routing-Entscheidung ist das ein echter Kostenfaktor: Eine Pipeline, die auf den Build dieser Woche abgestimmt wurde, bringt eine Revalidierungsrechnung mit sich, die du nicht eingeplant hast.

Auf OrcaRouter, wo über 200 Modelle hinter einem einzigen OpenAI-kompatiblen Endpunkt zum Listenpreis des Anbieters stehen und 0 % Aufschlag direkt durchgereicht werden, ist eine Preisänderung auf der eigenen Preisliste eines Anbieters am selben Tag auch eine Preisänderung auf unserer – was hier gerade deshalb zählt, weil dieser Launch zwei Preise ausliefert, von denen einer durchgestrichen ist. Automatisches Failover ist die andere Hälfte der Antwort bei einer noch unerprobten Preview: Es erlaubt dir, einen Bruchteil des Produktionsverkehrs auf Mistral Large 4 zu legen, während ein First-Party-Modell den Rest trägt, sodass eine Preview, die unter deiner realen Workload regressiert, zu einem Reroute wird statt zu einem Incident. Was aufmerksame Leser nicht annehmen sollten, ist, dass Mistral Large 4 heute auf OrcaRouter routbar ist. Es ist nicht im Katalog – die Preview erreicht man über Mistrals eigene API und mehrere Drittplattformen, und ihre Gewichte werden, wenn sie kommen, ein Fall für Self-Hosting sein.

Die Open-Weight-Behauptung ist derzeit ein Versprechen

Mistrals Darstellung besagt, dass Mistral Large 4 „die Grenze der Open-Weight-Leistung verschiebt“ und dass offene Gewichte der Mechanismus sind, mit dem Unternehmen die Kontrolle über ein Modell behalten. Das ist ein verteidigbares Argument für das Modell, das Mistral ausliefern will. Bei dem Modell, das diese Woche ausgeliefert wurde, fehlt dieser Mechanismus: kein Hugging-Face-Repository, kein Lizenztext, kein herunterladbarer Checkpoint. Die eigene Hugging-Face-Organisation des Unternehmens, überprüft am 6. Oktober, hat nichts Neueres als Juli, und ihre neuesten Einträge stehen in keinem Zusammenhang mit der Large-Reihe.

Das ist keine Kritik an dem Plan; eine gestaffelte Gewichtsfreigabe nach einem Red-Teaming-Fenster ist eine kohärente Strategie, und Mistral ist diesbezüglich explizit. Es ist eine Warnung hinsichtlich des Adjektivs. „Open-weight“ leistet Marketingarbeit in einem Absatz, in dem die Gewichte noch vier Wochen entfernt sind und die Lizenz, die sie regelt, nicht genannt wurde. Eine permissive Lizenz und Bedingungen nach Apache-Art sind eine Möglichkeit; eine reine Forschungs- oder umsatzgedeckelte Lizenz ist eine andere, und die Ankündigung trifft keine Wahl zwischen ihnen.

Was Sie vor Ende Oktober prüfen sollten

Fünf Dinge würden aus dieser Vorschau eine feststehende Tatsache machen, und jedes davon ist überprüfbar, ohne Mistral irgendetwas fragen zu müssen:

• Ein Repository auf Hugging Face unter der Mistral-Organisation, das den Checkpoint und eine Lizenzdatei enthält — das Release, zu dem sich Mistral für diesen Monat verpflichtet hat

• Der Lizenzname selbst, der darüber entscheidet, ob „Open Weight“ eine Freiheit nach Art von Apache-2.0 oder eine Gewährung mit Nutzungsobergrenze bedeutet

• Ob der Aktionspreis von 0,68 $ / 2,09 $ bestehen bleibt oder auf die 1,36 $ / 4,18 $ der Preisliste zurückfällt

• Ob Artificial Analysis die privat evaluierten Coding-Zahlen auf seinen öffentlichen Index überträgt, wenn das Harness ausgeliefert wird, und ob sie bei denselben Werten bleiben

• Das bereitgestellte Kontextfenster, derzeit vom Anbieter mit 1M angegeben und vom unabhängigen Labor als 524.288 ausgelesen

Bis diese geklärt sind, ist die richtige Haltung gegenüber Mistral Large 4 diejenige, zu der sein eigener Launch einlädt: Rufen Sie es auf, messen Sie es an Ihrer Workload, und halten Sie den Produktionspfad auf einem Modell, dessen Verhalten nicht planmäßig geändert wird. Die Gewichte sind das Ereignis. Die Vorschau ist der Trailer.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert