Eine Hero-Titelkarte für „Mercury 2.5 Preview vs Grok 4.6“ mit dem Untertitel „Kann eine Preview mit 1,107 Token/s den Preis-Leistungs-Champion unterbieten?“, die einen Blitz-Chip mit der Beschriftung „1,107 tok/s“, einen Waage-Chip mit der Beschriftung „PREIS vs. GESCHWINDIGKEIT“, einen Pokal-Chip mit der Beschriftung „AA #3“ und das OrcaRouter-Logo in der unteren rechten Ecke zeigt.
Guides & Insights

Mercury 2.5 Preview vs. Grok 4.6: Kann eine Preview mit 1.107 Token/s den Preis-Leistungs-Sieger unterbieten?

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Hier ist die Antwort in einem Satz: Mercury 2.5 Preview ist das günstigste glaubwürdige Reasoning-Modell, das derzeit für 0,04 $ / 0,15 $ pro Million Tokens in Produktion ist, und Grok 4.6 ist das günstigste Modell in der Frontier-Klasse für 2,00 $ / 6,00 $ – die praktische Frage zwischen ihnen lautet also, ob ein Preview-Diffusionsmodell, von dem Inception nur behauptet, es sei „vergleichbar mit“ GPT-5.6 Luna (Low) und Claude Haiku 4.5, die Aufgaben erledigen kann, für die man sonst die Frontier-Klasse bezahlt. Mercury 2.5 Preview, veröffentlicht am 31. August 2026, erzeugt Tokens parallel und gibt an, auf Standard-GPUs 1.107 Tokens pro Sekunde zu erreichen. Grok 4.6 – das am 12. August 2026 veröffentlichte Flaggschiff der Frontier-Klasse – erreicht 61 Punkte im Artificial Analysis Intelligence Index und liegt damit gleichauf mit Platz 3 weltweit; und das zu einem Preis, wie ihn das Frontier-Segment bisher nicht gesehen hat. Dieser Zusammenprall – der Anspruch auf Höchstgeschwindigkeit am unteren Ende der Preiskurve trifft auf das beste Preis-Leistungs-Verhältnis an deren oberem Ende – ist das Thema dieses Artikels.

Wichtige Erkenntnisse

• Grok 4.6 für 2,00 $ / 6,00 $ mit einem AA Intelligence Index von 61 ist der Preis-Leistungs-Champion in der Frontier-Klasse; Mercury 2.5 Preview für 0,04 $ / 0,15 $ ist eine Wette darauf, dass gut genug Qualität bei einem Fünfzigstel des Preises die Frontier-Qualität schlägt, die man nur selten braucht.

• Die Geschwindigkeits- und Qualitätsangaben von Mercury 2.5 Preview stammen vollständig von Inception; am ersten Tag gab es keine unabhängigen Benchmark-Ergebnisse.

Der 80%-Einführungsrabatt auf Mercury 2.5 Preview läuft am 8. September 2026 aus. Danach beträgt der Listenpreis $0.20 / $0.75 – immer noch 10× günstiger als Grok 4.6 beim Input, aber eine kleinere Geschichte.

• Grok 4.6 wird heute über OrcaRouter zum Listenpreis geroutet; Mercury 2.5 Preview ist noch nicht geroutet und wird über die eigene API von Inception sowie mehrere Drittanbieter-Plattformen bereitgestellt.

Die Anzeigetafel

A two-column scoreboard titled 'Mercury 2.5 Preview vs Grok 4.6 — the scoreboard': left column Mercury 2.5 Preview — Intelligence claimed cheap-tier parity, Price $0.04/$0.15 (80% off), Speed 1,107 tok/s (claimed), Context 260K, Agentic no public scores, Weights closed; right column Grok 4.6 — Intelligence AA Index 61 (#3), Price $2.00/$6.00, Speed not a headline spec, Context 500K, Agentic APEX-Agents 57.5, Weights closed; footer 'Mercury figures vendor-reported, unreproduced; Grok per xAI and Artificial Analysis'.

Intelligenz — Mercury 2.5 Preview: kein unabhängiger Index verfügbar; Inception beansprucht Parität mit der kostenoptimierten Stufe. Grok 4.6: AA Intelligence Index 61, weltweit geteilter Platz 3 (laut Artificial Analysis; bei den eigenen Zahlen des Labors handelt es sich um Herstellerangaben).

Preis — Mercury 2.5 Preview: 0,04 $ / 0,15 $ pro 1M (80 % Rabatt gegenüber 0,20 $ / 0,75 $, bis zum 8. September 2026). Grok 4.6: 2,00 $ / 6,00 $ pro 1M, verdoppelt auf 4,00 $ / 12,00 $ für Prompts ab 200K Tokens.

Geschwindigkeit — Mercury 2.5 Preview: 1.107 Token/s laut Anbieter. Grok 4.6: Geschwindigkeit ist kein Hauptmerkmal; das Modell ist auf lange agentische Abläufe ausgelegt, nicht auf schnelle Streams.

Kontext — Mercury 2.5 Preview: 260K. Grok 4.6: 500K.

Agentische Arbeit — Mercury 2.5 Preview: keine öffentlichen Scores, obwohl parallele Tool-Aufrufe unterstützt werden. Grok 4.6: APEX-Agents 57,5, DeepSWE v1.1 65,9, CursorBench v3.2 69,9 (vom Anbieter gemeldet, weitgehend nicht reproduziert).

Gewichte — Mercury 2.5 Preview: geschlossen, proprietär. Grok 4.6: geschlossen, proprietär.

Der Preis-Leistungs-Champion und die Preislücke

Die Position von Grok 4.6 ist ungewöhnlich. Es belegt den dritten Platz im Intelligenz-Ranking des Artificial-Analysis-Index – gleichauf mit GPT-5.6 Sol Max – und ist dabei günstiger als jedes Modell, das innerhalb von zehn Punkten zu ihm liegt. Die Berichterstattung zum Start hob zudem lange Agenten-Läufe hervor, die in einer vom Anbieter durchgeführten Evaluierung im Durchschnitt bei etwa 0,84 $ pro Aufgabe endeten. Das ist die Definition eines Preis-Leistungs-Champions: Leistung nahe der Spitzenklasse zu einem Preis, der die Kosten pro Aufgabe in einer Tabellenkalkulation sichtbar macht. Mercury 2.5 Preview versucht nicht, das zu sein. Inception positioniert es gegen Modelle wie GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite und Claude Haiku 4.5 – also in der kostenoptimierten Stufe, nicht an der Spitze. Wenn Inception recht hat, liegt Mercury 2.5 Preview bei der Leistungsfähigkeit eine Stufe unter Grok 4.6 und beim Preis mehrere Stufen darunter – ein völlig stimmiges Produkt: ein Preisübersprung für Arbeitslasten, bei denen die Spitzenklasse Verschwendung ist.

Was Parallel-Decoding tatsächlich verändert

Die Architektur ist der Teil, der es wert ist, verstanden zu werden, denn sie verändert, was „schnell“ bedeutet. Autoregressive Modelle emittieren ein Token pro Schritt, daher ist der Durchsatz durch die sequenzielle Latenz begrenzt. Ein Diffusions-LLM wie Mercury 2.5 Preview erzeugt dagegen einen Block von Token parallel und verfeinert ihn über mehrere Denoising-Schritte, wodurch der Durchsatz von der Anzahl der erzeugten Token entkoppelt wird. Deshalb kann Inception auf Standard-GPUs 1.107 Token pro Sekunde beanspruchen – ohne spezielle Beschleuniger, ohne Batching-Tricks – und deshalb ist die eigentliche Produktaussage bei interaktiven Workloads eine Zeit bis zum ersten Token von unter 300 Millisekunden. Für einen Sprachagenten, eine Suchpipeline oder einen Code-Subagenten, der das Modell bei jeder Runde aufruft, ist dieser Latenzunterschied das Produkt: Er ist der Unterschied zwischen einer Sprachschleife, die sich wie live anfühlt, und einer, die pausiert. Der Haken ist, dass Diffusions-Sprachmodelle ein junges Forschungsgebiet sind, dass die Zahl von 1.107 Token pro Sekunde von Inception stammt und dass kein unabhängiges Labor die Geschwindigkeit reproduziert oder die Qualitätsdrift – sofern vorhanden – gemessen hat, die die parallele Generierung bei langen oder adversarialen Prompts hervorruft.

Wo Grok 4.6 den Job immer noch beherrscht.

Nichts an Mercury 2.5 Preview berührt die Bereiche des Marktes, die Grok 4.6 tatsächlich gewinnt. Groks Zugewinne gegenüber Grok 4.5 konzentrierten sich auf agentische und Coding-Benchmarks – DeepSWE plus 11,9 Punkte, APEX-Agents plus 10,4, Terminal-Bench plus 10,3 – und sein 500K-Kontextfenster existiert für langfristig agierende Agenten, die die gesamte Aufgabe im Kontext halten müssen. Mercury 2.5 Preview bietet parallele Tool-Aufrufe, aber ein Modell ohne eigene agentische Bewertungen, mit einem Ausgabelimit von 65.536 Tokens und einem 260K-Kontext ist nicht das Werkzeug für einen 50-Schritte-Softwareentwicklungslauf. Die beiden Modelle überschneiden sich in der Nutzung kaum: Grok 4.6 ist die Engine für Arbeit, die tatsächlich abgeschlossen werden muss; Mercury 2.5 Preview ist die Engine für Arbeit, die sich sofort anfühlen und fast nichts pro Aufruf kosten muss.

Das Fenster mit 80 % Rabatt

Die hier genannten Preise haben ein Ablaufdatum, und das ändert die Entscheidung. Der Preis von Mercury 2.5 Preview in Höhe von $0.04 / $0.15 ist 80 % günstiger als ein Listenpreis von $0.20 / $0.75, und Inception hat angekündigt, dass die Aktion bis zum 8. September 2026 läuft. Der stabile Listenpreis von Grok 4.6 beträgt $2.00 / $6.00 und ist klar strukturiert: gecachter Input kostet $0.50, eine Prioritätsstufe kostet das Zweifache, und bei langen Prompts ab 200K Tokens wird die gesamte Anfrage zum höheren Satz abgerechnet. Wenn man die heutigen Zahlen vergleicht, wirkt Mercury beim Input 50× günstiger und beim Output 40× günstiger; läuft der Rabatt wie geplant aus, beträgt die tatsächliche langfristige Differenz beim Input das 10-Fache und beim Output das 5-Fache. Keine dieser Darstellungen ist irreführend – es handelt sich nur um unterschiedliche Zeithorizonte, und eine Pipeline, die mit dem Rabattpreis kalkuliert, ohne einen Überprüfungspunkt einzuplanen, wird am 9. September überrascht werden. Der Preis von $2.00 / $6.00 für Grok 4.6 ist genau das, was Sie bei OrcaRouter zahlen, wobei der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht wird – wenn der Anbieter eine Zahl ändert, ist sie am selben Tag unter demselben Schlüssel live, mit automatischem Failover, falls ein Anbieterpfad ein Rate-Limit erreicht.

Das einzeilige Urteil

Wenn die Aufgabe erledigt werden muss und Sie Frontier-Fähigkeit zum besten Preis in der Stufe möchten, kaufen Sie Grok 4.6 — es ist ein bewährter Preis-Leistungs-Champion, heute live auf OrcaRouter für $2.00 / $6.00. Wenn es um hochvolumiges, latenzempfindliches Text-Reasoning geht, bei dem sich ausreichend gute Antworten günstig verifizieren lassen, ist Mercury 2.5 Preview für $0.04 / $0.15 ein Preis-Leistungs-Ausreißer, den es innerhalb des Rabattfensters zu testen lohnt — denken Sie nur daran: Jede Behauptung auf seiner Seite der Tafel stammt von Inception, und der Beweis steht noch aus.

A screenshot of the Inception documentation page 'Models, Endpoints, and Pricing' (captured September 1, 2026), showing the Mercury family pricing table — Mercury 2 and Mercury Edit 2 both at $0.25 input / $0.025 cached / $0.75 output per 1M tokens — and a cURL chat-completions API example.A screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the '$2.00' price badge, and the model description noting the August 12, 2026 release.

OrcaRouter gibt die Listenpreise der Anbieter zu 0 % Aufschlag mit automatischem Failover weiter, sodass eine Preisänderung des Anbieters am selben Tag live auf demselben Schlüssel ist.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube