Eine Hero-Titelkarte für „Mercury 2.5 vs Mercury 2.5 Preview“ mit dem Untertitel „Ein Diffusionsmodell, zwei Veröffentlichungstermine – was das Produktions-Upgrade tatsächlich ändert“. Darunter verlaufen drei Chips: ein Glyph mit geteilten Spalten, beschriftet mit „SAME ENGINE“, ein Blitz-Glyph, beschriftet mit „1,107 tok/s CLAIM“, und ein Uhren-Glyph, beschriftet mit „AUG 31 vs SEP 8“. Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.
Guides & Insights

Mercury 2.5 vs. Mercury 2.5 Preview: Ein Diffusionsmodell, zwei Veröffentlichungstermine

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Hier ist ein Kopf-an-Kopf-Vergleich, bei dem beide Kontrahenten eine gemeinsame Modellkarte haben. Inceptions Mercury 2.5 Preview, veröffentlicht am 31. August 2026, und Mercury 2.5, veröffentlicht am 8. September 2026, sind dasselbe Diffusions-Sprachmodell im Abstand von acht Tagen: ein Vorschaukanal, den Inception für Entwickler eröffnete, und die „unternehmensreife“ Produktionsversion, die eine Woche später gestartet wurde. Inception hat für Mercury 2.5 keinen anderen Checkpoint, keine andere Geschwindigkeitsangabe und keinen anderen Preis offengelegt – und die Zahlen, die sich zwischen den beiden Ankündigungen tatsächlich bewegten, wirken wie eine Bereinigung, nicht wie ein neues Modell. Die Kontextangabe wurde von 256K auf der Vorschauseite auf 260K beim Start korrigiert, und der Intelligenzzuwachs gegenüber Mercury 2 wurde von „mehr als 10 Punkten“ (Vorschau-Materialien) auf „40 Prozent“ (Startmaterialien) umformuliert. Die Engine, die Angabe von 1.107 Token pro Sekunde und die Preisliste sind identisch. Dies ist also kein üblicher Spec-Sheet-Kampf, und eines davon aufzublähen wäre unehrlich. Der Vergleich, der zwischen diesen beiden Namen zählt, dreht sich um Verpackung und Timing: Was der Produktionsstart tatsächlich verändert hat, was das Preview-Label wirklich aussagte und welchen Namen Ihre API-Aufrufe jetzt verwenden sollten.

Warum ein Modell mit sich selbst verglichen wird

Anbieter zeigen normalerweise eine Vorschau eines Modells und überführen es dann stillschweigend in den Hauptnamen; die Vorschau-Seite verschwindet und niemand dokumentiert den Vergleich. Inception hingegen führte die beiden Namen eine Woche lang nebeneinander, und erst jetzt wird die Identität der Vorschau ausgemustert — genau deshalb hat dieser Vergleich Substanz. Die Preview war der schnelle Weg, den Inception nutzte, um seine Diffusions-Wette vor Entwickler zu bringen. Sie erschien am 31. August mit dem Datenblatt, das jetzt das von Mercury 2.5 ist: ein Diffusions-LLM (dLLM), das Token-Blöcke parallel erzeugt und verfeinert, statt ein Token nach dem anderen auszugeben; eine behauptete Geschwindigkeit von 1.107 Tokens pro Sekunde auf Standard-GPUs; eine behauptete Zeit bis zum ersten Token von unter 300 ms; ein Kontextfenster von 260.000 Tokens mit einer Ausgabe von 65.536 Tokens; einstellbare Denkstufen; native Werkzeugnutzung, parallele Werkzeugaufrufe und strukturierte Ausgabe. {{1}}Jede dieser Zahlen stammt von Inception selbst, und kein unabhängiges Labor hatte das Modell vermessen, als die Preview herauskam.{{/1}}

Am 8. September brachte Inception Mercury 2.5 als „die nächste Stufe der Intelligenz für Diffusion-LLMs" und sein schnellstes Reasoning-Modell in Produktion auf den Markt – unternehmensreif, ausgerichtet auf Sprachagenten, Coding-Subagenten, Unternehmenssuche und Support-Workloads. Gleiche Spezifikationen, gleiche Positionierung, gleiche Preisliste. Der Start stellte außerdem zwei Geschwister vor, die verdeutlichen, wohin die Reise bei Inception geht: Mercury Voice, ein dLLM, das für eine First-Token-Zeit von unter 170 ms für Sprachagenten optimiert ist, und Mercury Router, der Prompts je nach Qualität, Geschwindigkeit und Kosten auf Modelle verteilt. Mercury 2.5 ist das Flaggschiff einer Familie, die für latenzsensitive, agentische Workloads gebaut wurde und nicht für die Spitzenqualitätsklasse.

Was der Start am 8. September tatsächlich verändert hat

Vergleichen Sie die beiden Namen Zeile für Zeile, und der Unterschied ist nicht der Motor — es ist alles, was den Motor umgibt:

Status — Mercury 2.5 Preview: eine geschlossene Vorschau, die „Verhalten oder Verfügbarkeit ändern“ könnte. Mercury 2.5: ein Produktionsmodell, das mit einer Enterprise-Ready-Verpflichtung, einem Vertriebskanal und einer datierten Produktionsliste auf den Markt gebracht wurde.

Identität — Die Seite mit den Modellen von Inception führt jetzt Mercury 2.5, Mercury Voice und Mercury Router auf; von Preview ist nichts mehr zu sehen. Die zugehörige Support-Fußnote nennt Mercury 1, Mercury 2 und Mercury Edit 2 als die Modelle, die „für bestehende Kunden weiterhin unterstützt werden“. Preview taucht in keiner der Listen auf. Aus Sicht des Anbieters ist das Preview-Label inzwischen in Mercury 2.5 aufgegangen.

Endpoint — Die Entwicklerplattform von Inception stellt das Modell als mercury-2.5 bereit; der Produktions-Eintrag, der am 8. September live ging, ist der, über den neuer Traffic ausgeliefert wird. Im Katalog, der die Preview Ende August zuerst führte, verweist der Name „Preview“ inzwischen auf keinen aktiven Serving-Endpoint mehr, während der am 8. September hinzugefügte Eintrag Mercury 2.5 antwortet. Wer gegen die Preview unter ihrem Namen codiert hat, sollte auf Mercury 2.5 umstellen und überprüfen, was der Anbieter tatsächlich abrechnet — die ID, die in der ersten Woche integriert wurde, ist die, die ausgemustert wird.

Preis — identischer Listenpreis und identischer Rabatt. Beide kosten 0,20 $ pro Million Input und 0,75 $ pro Million Output, mit gecachtem Input bei 0,02 $, und beide starteten mit rund 80 % Rabatt: 0,04 $ / 0,15 $, gecacht 0,004 $. Der Preview-Rabatt war ausdrücklich bis zum 8. September befristet; Mercury 2.5 startete mit demselben Rabatt von 80 %, und genau dieser rabattierte Preis steht zum Zeitpunkt des Schreibens noch immer in seiner Produktionsliste. Das ist die Falle, die unten aufgeschlüsselt wird.

Onboarding — der Produktionsstart führte ein kostenloses Token-Kontingent für neue Entwicklerkonten ein — die Launch-Materialien nennen 100 Millionen Tokens — und eröffnete einen Enterprise-Kontaktweg, den eine Vorschauversion nie hatte.

Belege — unverändert. Keiner der beiden Namen hat einen unabhängigen Benchmark, und die Behauptungen des Anbieters sind dieselben Behauptungen mit leicht anderem Wortlaut: Ein Intelligenzsprung von „mehr als 10 Punkten“ gegenüber Mercury 2 in den Vorschauunterlagen wird zu einer Steigerung „um 40 Prozent“ in den Startunterlagen, zusammen mit derselben angegebenen Parität mit der kostenoptimierten Frontier-Stufe (GPT-5.6 Luna im Low-Effort-Modus, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) und denselben vom Anbieter gemeldeten 79 % bei GPQA Diamond und 77 % bei IFBench. Eine wiederholte Behauptung ist keine verifizierte Behauptung.

A two-column comparison card titled 'Mercury 2.5 Preview vs Mercury 2.5 — what actually changed'. Left column 'Mercury 2.5 Preview, released Aug 31, 2026': Release Aug 31, 2026; Status closed preview; Engine diffusion dLLM, 260K ctx; Serving preview id retired from the catalog; Price $0.20/$0.75 list, 80% off intro; Evidence none independent. Right column 'Mercury 2.5, released Sep 8, 2026': Release Sep 8, 2026; Status production, enterprise-ready; Engine same, no new checkpoint disclosed; Serving mercury-2.5 id live, serving traffic; Price $0.20/$0.75 list, 80% off launch; Evidence none independent. Footer reads 'Same engine under two labels — the delta is lifecycle, not spec. All figures vendor-reported.' The OrcaRouter logo is in the bottom-right corner.

Die Preisfalle im Herzen der Paarung

Da die beiden Namen denselben Listenpreis und denselben 80-%-Teaser tragen, geht man leicht davon aus, dass sie immer gleich viel kosten. Das müssen sie nicht. Der Rabatt der Preview endete hart am 8. September; der Einführungsrabatt von Mercury 2.5 läuft nach einer frischen Uhr. Eine Woche lang war es durchaus möglich, 0,20 $ / 0,75 $ für einen Anruf an die Preview zu zahlen, während dieselbe Engine unter ihrem Produktionsnamen für 0,04 $ / 0,15 $ antwortete – oder, wahrscheinlicher, auf einer Preview-ID zu sein, die stillschweigend keinen Dienst mehr tat, während die Rechnung weiter eintraf. Ein Einführungsrabatt, der nach Endpunkt ausläuft, ist genau die Art von Kleingedrucktem, die aus einer Geschichte von „gleiches Modell, gleicher Preis“ einen echten Kostenunterschied macht.

Die verlässliche Zahl ist der Listenpreis, und der verlässliche Rat lautet, das Budget daran auszurichten: 0,20 $ / 0,75 $ pro Million, gecachter Input 0,02 $ – günstig für ein Reasoning-Modell mit 260K-Kontext, deutlich unterhalb der Flaggschiff-Stufe, aber nicht die 0,04 $ / 0,15 $, die auf den Startbannern beworben werden. Behandeln Sie den Rabattpreis als zeitlich begrenzten Testpreis, prüfen Sie, was Ihr Anbieter für die exakte Modell-ID in Ihrem Code abrechnet, und nicht für den Namen auf der Marketingseite, und wenn Sie über die Preview eingestiegen sind, migrieren Sie zu Mercury 2.5, bevor ein Ablaufdatum oder ein eingestellter Endpunkt für Sie entscheidet.

Dies ist auch die Art von Problem, zu dessen Beseitigung eine Routing-Ebene existiert. Ein Modell-Router, der die Listenpreise der Anbieter mit 0 % Aufschlag durchreicht, zeigt den Preis, den ein Anbieter tatsächlich in Rechnung stellt und der am selben Tag aktualisiert wird, an dem ein Einführungsrabatt greift oder ausläuft. Automatisches Failover sorgt dafür, dass Aufrufe weiterlaufen, wenn ein Endpunkt im Hintergrund außer Betrieb genommen wird. Mercury 2.5 ist zum Zeitpunkt dieses Artikels nicht auf OrcaRouter — Inception stellt es über eine eigene API und mehrere Drittanbieter-Plattformen bereit — weshalb die Modellübersicht des Anbieters vorerst die maßgebliche Quelle für den Preis ist. Sobald ein Anbieter es listet, erhält man mit einem Schlüssel genau diese Durchreich-Mechanik, und Preissenkungen oder auslaufende Rabatte erscheinen bei uns am selben Tag, an dem sie angekündigt werden.

Das Evidenzproblem, das beiden Namen gemeinsam ist.

Die ehrliche Bilanz dieser Paarung ist kurz, denn die beiden Spalten sind dasselbe Modell mit demselben Fehlen von Beweisen. Weder Mercury 2.5 noch Mercury 2.5 Preview haben einen unabhängigen Indexwert, einen reproduzierten Lauf oder eine Arena-Platzierung zum Stand des 9. September 2026. Inceptions eigene Behauptungen – der Intelligenzsprung gegenüber Mercury 2, die Parität mit dem Haiku-4.5-Niveau, die 79 % im GPQA Diamond, die 1.107 Tokens pro Sekunde – sind das Wort des Unternehmens, und sie sind für beide Namen identisch, weil das Modell identisch ist.

Das einzige unabhängige Beweisstück in der Modellfamilie zeigt, wie die Geschwindigkeitsangabe zu lesen ist. Artificial Analysis hat Mercury 2, den Vorgänger, am Produktionsendpunkt mit 684 Token pro Sekunde gemessen und ihm im Intelligence Index 22 Punkte gegeben – wirklich schnell und ein Beweis, dass der Diffusionsansatz keine Luftspiegelung ist, aber weit unter den rund 1.000 Token pro Sekunde, die Inception für dieses Modell auf Blackwell-Hardware bewirbt. Erwarten Sie eine ähnliche Kluft zwischen dem 1.107er-Wert von Mercury 2.5 und dem, was ein gemeinsam genutzter Multi-Tenant-Endpunkt unter realer Last tatsächlich liefert. Dieselbe Vorsicht gilt für die Qualität: Ein brandneues Diffusionsmodell, das nur von seinem Hersteller gemessen wurde, sollte man nicht beim Wort nehmen, wenn es darum geht, mit Claude Haiku 4.5 mitzuhalten – bis ein Dritter es getestet hat.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the predecessor Mercury 2.5 builds on, showing its Intelligence Index score of 22, its independently measured output speed of 684 tokens per second, its $0.25 input / $0.75 output pricing, and its 128K context window.

Die Tracker, die begonnen haben, die Veröffentlichung abzudecken, spiegeln genau diesen Stand wider. Ein BenchLM-Eintrag für Mercury 2.5, veröffentlicht am 8. September, weist dem Modell keine öffentliche Punktzahl und keinen öffentlichen Rang zu; er führt Inceptions 79 % GPQA Diamond und 77 % IFBench-Werte mit der ausdrücklichen Kennzeichnung als anbieterberichtet auf und vermerkt, dass die unabhängige Laufzeitgeschwindigkeit nicht gemessen wurde. Der erste Eintrag im Artificial-Analysis-Index, eine LMArena-Platzierung oder ein reproduzierter GPQA-Lauf werden Mercury 2.5 von einer Behauptung in ein vergleichbares Objekt verwandeln – und dies wird gleichzeitig für beide Namen gelten, denn es gibt nur ein einziges Modell, das gemessen werden kann.

A screenshot of the BenchLM model record for Mercury 2.5 (captured September 9, 2026), showing 'No public score yet' and 'No public rank', the model noted as released September 8, 2026 with a 260K context window, and the decision note that Inception reports 79% on GPQA Diamond and 77% on IFBench as provider-reported results with independent runtime speed not yet measured.

Welchen Namen solltest du rufen?

Neue Integration, keine Altlasten: nenne es Mercury 2.5 und ignoriere die Preview. Der Produktionsname beinhaltet dieselbe Engine, vorerst denselben Rabatt, die Enterprise-Bedingungen und die Garantie, dass es sich um die ID handelt, die der Anbieter tatsächlich ausliefert. Die Preview fügt Instabilitätsrisiko hinzu und sonst nichts.

Falls Sie die Preview bereits integriert haben, prüfen Sie heute, was Ihr Anbieter unter diesem Namen ausliefert und was er Ihnen dafür in Rechnung stellt. Richten Sie Ihren Client neu auf die Mercury-2.5-ID aus und bestätigen Sie den Tarif. Den Namen „Preview“ im Produktionscode zu behalten, ist jetzt eine Wette darauf, dass ein ausdrücklich zeitlich befristeter Preview-Kanal seine eigene Stilllegung überlebt.

Enterprise- oder produktionskritischer Datenverkehr:Mercury 2.5 wird über den Enterprise-Pfad von Inception bereitgestellt, nicht als Preview-Label ohne dahinterstehende Verbindlichkeit. Sprach- und Routing-Anforderungen verweisen auf Mercury Voice bzw. Mercury Router, die selbst noch Previews sind.

Wer die Diffusionsstufe bewertet: Beide Namen sind dasselbe Bewertungsziel. Führen Sie Ihre Bewertung also einmal gegen Mercury 2.5 durch und behandeln Sie das Ergebnis als für die gesamte Modelllinie gültig. Kalkulieren Sie mit dem Listenpreis und gewichten Sie die Herstellerangaben als Hypothesen, bis ein unabhängiger Score vorliegt.

Was zu sehen

Drei Dinge werden diese Paarung in den nächsten Wochen klären. Erstens: Der erste unabhängige Benchmark – eine Index-Platzierung oder ein reproduzierter GPQA- oder AIME-Lauf – wird die Paritätsbehauptung auf den Prüfstand stellen, auf der das gesamte kommerzielle Kalkül beruht. Zweitens: Ob die Preview-Identität vollständig aus dem Modell-Ökosystem verschwindet, wie Inceptions eigene Modellseite bereits andeutet. Drittens: Was aus dem Einführungsrabatt von 80 % wird, nachdem der 8. September, an den die Preview gekoppelt war, überschritten ist. Eine Verlängerung macht Mercury 2.5 strukturell günstig, während eine Rückkehr zu $0.20 / $0.75 es lediglich wettbewerbsfähig macht. Bis dahin lautet die richtige Antwort auf die Frage „Mercury 2.5 oder Mercury 2.5 Preview?“: Es handelt sich um ein und dasselbe Modell, und Sie sollten das aufrufen, das noch ein Produkt ist.