Hero-Titelkarte für „Realtime-Venus vs. Grok Voice Think Fast 2.0“, untertitelt mit „Eines kann man heute Nachmittag kaufen. Eines ist ein Download.“, mit drei Karten mit der Aufschrift „Grok Voice Think Fast 2.0: 0,08 $ pro Audiominute, 0,70 s bis zum ersten Audio“, „Realtime-Venus: Apache-2.0-Gewichte, keine API, keine Preisliste“ und „Die gemeinsame Wette: denken, während man spricht, nicht vorher“, über einem Fußzeilenstreifen mit der Aufschrift „Grok-Zahlen gemäß Artificial Analysis und xAI-Dokumentation; Realtime-Venus-Zahlen aus seinem technischen Bericht, nicht reproduziert.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Realtime-Venus vs. Grok Voice Think Fast 2.0: Nur eine davon hat einen Preis

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stellt man Realtime-Venus und Grok Voice Think Fast 2.0 nebeneinander, ist der erste Unterschied kein Benchmark, sondern eine Bestellung. Grok Voice Think Fast 2.0 ist ein gehostetes Speech-to-Speech-Modell, das am 29. Juli 2026 für 0,08 US-Dollar pro Audiominute in den Verkauf ging, mit einer veröffentlichten Time-to-First-Audio von 0,70 Sekunden und Benchmark-Ergebnissen von einem Dritten. Realtime-Venus ist ein 9B-Full-Duplex-System vom Venus-Team der Ant Group und der Tsinghua-Universität, das als Apache-2.0-Gewichte, ein technischer Bericht vom 12. September 2026 und nichts, was man anrufen kann, existiert. Eines davon kann man noch vor Ende der Woche an eine Telefonleitung anschließen. Das andere kann man lesen. Diese Asymmetrie erweist sich als ein viel nützlicherer Vergleich, als es ein Scoreboard wäre, weil die beiden Modelle fast dieselbe architektonische Wette eingegangen sind und dann völlig auseinandergingen, was sie damit anfangen.

Die kurze Antwort

Wählen Sie Grok Voice Think Fast 2.0, wenn Sie jetzt einen funktionierenden Voice-Agenten brauchen, im Produktivbetrieb, mit einer Preisliste, die Sie in ein Budget aufnehmen können, und einer Latenzgarantie, die Sie testen können. Wählen Sie Realtime-Venus, wenn Sie den Stack selbst besitzen müssen – wenn Ihre Daten Ihre Infrastruktur nicht verlassen dürfen, wenn Sie das Frontend feinabstimmen müssen oder wenn Sie die Architektur evaluieren statt ein Produkt auszuliefern. Es gibt keinen dritten Fall, in dem sie konkurrieren, denn das eine hat eine API und das andere nicht.

Sie sind sich über das schwierige Problem einig.

Das Interessante ist, wie ähnlich die Diagnose ist. Beide Modelle existieren wegen desselben Widerspruchs: Gesprächssteuerung muss mit Sub-Sekunden-Granularität laufen, und Schlussfolgern dauert Sekunden. Ein Modell, das innehält, um zu denken, hört auf, sich präsent anzufühlen.

Grok Voice Think Fast 2.0 löst dies, indem es während des Sprechens denkt. Die Think-Fast-Reihe wurde auf der Idee aufgebaut, dass das Modell nicht zuerst inferieren und dann Sprache generieren sollte; stattdessen streamt es Sprache und denkt parallel, sodass ein Tool-Aufruf ausgelöst werden kann, bevor der Agent seinen ersten Satz beendet hat. xAI berichtet, dass Version 2.0 ungefähr 0,4-mal so viele Reasoning-Tokens wie sein Vorgänger verwendet, was eher als Kosten- und Latenzverbesserung denn als Qualitätsverbesserung dargestellt wird.

Realtime-Venus löst es, indem es es gar nicht erst im Frontend löst. Seine Dual-Loop-Runtime hält eine einsekündige Interaktionsschleife am Laufen – Wahrnehmung, Turn-Steuerung, Sprachgenerierung – und übergibt alles Aufwendige über asynchrone Delegationsmarker, die in der eigenen verborgenen Sequenz des Modells ausgegeben werden, an eine separate Komponente namens Realtime-Venus-Harness. Das Vordergrundgespräch pausiert nie. Hintergrund-Ergebnisse werden wieder eingebunden, sobald sie eintreffen.

Das sind unterschiedliche technische Antworten auf dieselbe Frage, und sie haben unterschiedliche Fehlermodi. Das Schlussfolgern während des Sprechens bürdet dem Modell die Last auf, beide Threads kohärent zu halten. Delegation bürdet der Laufzeitumgebung die Last auf, die beiden Schleifen davon abzuhalten, sich gegenseitig zu korrumpieren — weshalb die kausale Aufgabenerfassung des Realtime-Venus-Papiers, ein isolierter Zustands-Snapshot pro delegierter Aufgabe, das Detail ist, das das Design trägt.

Die eine Metrik, an der beide gemessen werden können

Vollduplex-Benchmarks sind der einzige Bereich, in dem sich diese beiden überschneiden, und sie überschneiden sich nicht sauber.

• Unterbrechungsbehandlung — Realtime-Venus meldet, auf 75 % der Nutzerunterbrechungen im Full-Duplex-Bench v1.5 zu reagieren. Grok Voice Think Fast 2.0 erreicht laut Artificial Analysis 95,1 % im Full Duplex Bench, gegenüber 77,8 % bei Version 1.0.

• Fortsetzung bei Überlappung — Realtime-Venus berichtet von 97 % Fortsetzung bei Backchannels, 88 % bei an andere gerichteter Sprache und 86 % bei Hintergrundsprache und gibt an, Gemini 3.1 Live und GPT-4o in allen drei Kategorien zu übertreffen.

• Unterschiedliche Instrumente, unterschiedliche Autoren — die Realtime-Venus-Zahlen stammen aus ihrem eigenen technischen Bericht, ohne externe Reproduktion. Die Grok-Zahlen stammen von einem Dritten, der das Modell ausgeführt hat. Eine selbstberichtete Zahl mit einer unabhängig gemessenen zu vergleichen, ist kein Vergleich, und die obige Diskrepanz ist ebenso wahrscheinlich methodisch wie real.

Die ehrliche Einschätzung: Nach der verfügbaren Beweislage ist Grok Voice Think Fast 2.0 das einzige der beiden, dessen Vollduplex-Verhalten von jemandem gemessen wurde, der kein Eigeninteresse am Ergebnis hat.

Wo die unabhängigen Zahlen Grok Voice Think Fast 2.0 einordnen

Die derzeit sauberste Auswertung stammt aus der Speech Agent Arena von Artificial Analysis, die Modelle anhand blinder Präferenz bei Live-Sprachgesprächen zu Aufgaben wie dem Buchen eines Zahnarzttermins und dem Bestellen von Essen zum Mitnehmen bewertet. Stand 18. September 2026 liegt Grok Voice Think Fast 2.0 High mit einem Elo von 1.011 bei 552 Stichproben auf Platz sieben von mehr als zwanzig Einträgen – hinter Googles Gemini 3.1 Flash Live Minimal mit 1.096, Gemini 3.8 Live mit 1.083 und GPT-Live-1 mit 1.053 und deutlich vor seinem eigenen Vorgänger, Grok Voice Think Fast 1.0, mit 908.

Die Spalte neben dem Elo ist die interessantere. Bei der Erfolgsquote bei Aufgaben verzeichnet Grok Voice Think Fast 2.0 94,6 % – der höchste Wert überhaupt in den sichtbaren Top 20 – und liegt damit über Gemini 3.8 Live mit 93,2 %, GPT-Realtime-2.1 High mit 91,5 % und GPT-Live-1 mit 90,9 %. Auf Platz sieben bei der Präferenz und auf Platz eins bei der Aufgabenbewältigung zu stehen, ist ein ungewöhnliches und recht spezifisches Profil: Die Zuhörer lieben die Stimme nicht, aber sie erledigt die Aufgabe. Wenn Ihr Produkt Dinge tut, statt zu chatten, ist das die Spalte, die Ihr Ergebnis vorhersagt, und sie ist der stärkste unabhängige Beleg, den eines dieser beiden Modelle vorzuweisen hat.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

Die Zahlen, die xAI bei der Einführung veröffentlichte, sind ein anderes Instrument und sollten getrennt betrachtet werden: 82,9 % im Speech-to-Speech-Qualitätsindex von Artificial Analysis, Platz eins im agentischen τ-Voice-Benchmark mit 56,5 %, 97,2 % bei Big Bench Audio und 95,1 % bei Full Duplex Bench. Das waren die Platzierungen, als das Modell Ende Juli 2026 auf den Markt kam, und Ranglisten in dieser Kategorie ändern sich monatlich – genau deshalb ist die oben stehende Arena-Tabelle, heute gelesen, mehr wert als die Zahlen zum Marktstart.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

Die Rechnung und die Teile davon, die nicht auf der Rechnung stehen

Grok Voice Think Fast 2.0 kostet 0,08 $ pro Minute Audio, ungefähr 4,80 $ pro Stunde, plus 0,004 $ für jede Texteingabe-Nachricht. Das ist eine Steigerung um 60 % gegenüber den 0,05 $ pro Minute, welche die Version 1.0 zum Start berechnete, und xAI hat den rollierenden grok-voice-latest Alias am 5. August 2026 automatisch auf 2.0 umgestellt, sodass Teams, die beim alten Preis bleiben wollten, vor diesem Datum eine explizite Version pinnen mussten. Das Minutenmodell bedeutet außerdem, dass Effizienzverbesserungen dem Anbieter zugutekommen: Wenn das Modell besser darin wird, Anrufe schneller zu beenden, sinkt Ihre Rechnung pro Anruf, aber Ihre Kosten pro Minute nicht.

Realtime-Venus hat keine Rechnung, weil es keinen Dienst hat. Was es stattdessen hat, ist eine Hardware-Untergrenze. Zwei 9B-Checkpoints in BF16 umfassen jeweils grob achtzehn Gigabyte Gewichte, bevor Aktivierungsspeicher hinzukommt, und die Karte dokumentiert eine sekündliche Streaming-Schleife, die kontinuierlich laufen muss. Ein GPU-Knoten, der dazu in der Lage ist, verursacht monatliche Kosten, und zwar feste — Sie zahlen sie, ob jemand Aufrufe tätigt oder nicht. Für ein Produkt mit stetigem Verkehr ist das günstiger als 4,80 $ pro Stunde. Für ein Produkt mit sporadischem Verkehr ist es dramatisch teurer, und der Übergangspunkt ist die einzige finanzielle Frage, die hier zählt.

Gewichtungen, Steuerung und was sich mit jeder einzelnen ändern lässt

An diesem Punkt sind die beiden Modelle überhaupt nicht mehr vergleichbar.

• Feintuning — Realtime-Venus liefert Gewichte mit. Du kannst sie feintunen, quantisieren, air-gapped ausführen und jede Schicht inspizieren. Grok Voice Think Fast 2.0 ist ein geschlossenes gehostetes Modell; was du ändern kannst, sind der Prompt, die Stimmauswahl und die Tools, die du registrierst.

• Stimme — Grok Voice Think Fast 2.0 liefert voreingestellte Stimmen mit und unterstützt benutzerdefiniertes Stimmklonen anhand von ungefähr einer Minute Sprachaufnahme. Realtime-Venus liefert eine Referenzstimme und einen mitgelieferten Token-zu-Waveform-Decoder mit, und alles, was darüber hinausgeht, ist Ihr Problem.

• Reichweite — Grok Voice Think Fast 2.0 unterstützt über 25 Sprachen und überträgt standardmäßig PCM16 mit 24 kHz, mit μ-law für Telefonie, über eine WebSocket-Sitzung, die OpenAI Realtime-kompatibel ist. Diese Kompatibilität ist ein echter Migrationsvorteil: Der meiste bestehende Echtzeit-Sprachcode benötigt nur eine geänderte Basis-URL und einen geänderten Schlüssel. Realtime-Venus dokumentiert Englisch und Chinesisch.

• Video — Realtime-Venus-Omni nimmt Streaming-Video und Bilder über einen SigLIP2-Encoder entgegen und betreibt kontinuierliche visuelle Wahrnehmung. Grok Voice Think Fast 2.0 ist auf Audio und Text beschränkt; einen Kamerapfad gibt es nicht.

• Langer Kontext — Realtime-Venus verfügt über einen Kontext von 40.960 Tokens sowie ein trainingsfreies Langvideo-Gedächtnis, das für ein Zeitfenster von vierzig Minuten aktiviert werden kann. Grok Voice Think Fast 2.0 ist ein Sitzungsmodell ohne vergleichbare veröffentlichte Gedächtnisfunktion.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Wo jedes einzelne bricht

Die Ausfälle, für die es sich zu planen lohnt, sind genau entgegengesetzt. Die Risikoexposition von Grok Voice Think Fast 2.0 besteht in Anbieterkonzentration und nicht überprüfbarem Marketing: xAIs Starlink-A/B-Ergebnisse, seine Transkriptionsgenauigkeits-Multiplikatoren und seine Geschwindigkeitsdarstellung sind alle unternehmenseigene Angaben ohne veröffentlichte Datengrundlage, und ein Pro-Minute-Modell, das den Preis zwischen Versionen um 60 % ändert, hat bewiesen, dass es den Preis ändern wird. Pinnen Sie Ihre Version und führen Sie Ihre eigenen Evaluierungen mit Ihrem eigenen Audio durch.

Realtime-Venus ist insofern exponiert, als niemand es ausgeführt hat. Seine Benchmarks sind selbst angegeben, sein Test-Harness ist im Verhältnis zu seiner Bedeutung undokumentiert, und seine Latenz bei einem realen Deployment ist unbekannt – der Bericht beschreibt eine Interaktionskadenz von einer Sekunde, was ein Designparameter ist, keine gemessene Zeit bis zum ersten Audio. Ein Modell ohne API und ohne Reproduktion hat keine Erfolgsbilanz, nur eine Spezifikation.

Es gibt einen Mittelweg, den es wert ist, klar zu benennen, denn er ist genau das, was die meisten Teams tatsächlich tun werden. Wenn Sie ein delegationsbasiertes System bauen – wählen Sie Ihr eigenes Frontend, übergeben Sie die teure Arbeit an ein Textmodell –, müssen Frontend und Reasoning-Teil nicht aus derselben Quelle stammen. OrcaRouter führt weder Realtime-Venus noch Grok Voice Think Fast 2.0; beide Voice-Layer liegen außerhalb dessen, was wir anbieten, und das sagen wir auch, statt etwas anderes anzudeuten. Der delegierte Teil ist eine andere Sache. Fast 200 Textmodelle stehen hinter einem einzigen Schlüssel zum Listenpreis des Anbieters, ohne Aufschlag, mit automatischem Failover, damit ein Ausfall eines Upstream-Anbieters nicht einen laufenden Anruf abbricht, einer Routing-DSL, um mehrere Modelle zu einem Aufruf zusammenzusetzen, und Modell-Fusion für Entscheidungen, die mehr als eine Meinung verdienen. Das ist die Hälfte eines Voice-Agenten, die davon profitiert, austauschbar zu sein, und es ist die Hälfte, die Sie ändern können, ohne das Modell anzufassen, das das Gespräch führt.

Welches soll man wählen?

Wählen Sie in diesem Quartal Grok Voice Think Fast 2.0. Es ist verfügbar, es ist unabhängig gebenchmarkt, es steht an erster Stelle in der agentischen Evaluierung, die vorhersagt, ob Ihr Agent überhaupt etwas Nützliches tun kann, und 0,70 Sekunden bis zum ersten Audio sind eine Zahl, auf der Sie ein Nutzererlebnis aufbauen können. Planen Sie die 60 % Preiserhöhung gegenüber 1.0 ein und fixieren Sie Ihre Modellversion.

Wähle Realtime-Venus nur, wenn die Einschränkung Ownership ist. Wenn dein Deployment keine externe API aufrufen kann, wenn du das konversationelle Frontend feinabstimmen musst oder wenn du die Kamera brauchst – diese drei Fälle machen den ganzen Fall aus, und sie wiegen schwer, wenn sie zutreffen.

Was es nicht entscheiden sollte, ist die Benchmark-Tabelle, denn ihre beiden Seiten wurden von verschiedenen Personen unter unterschiedlichen Bedingungen erstellt. Die Zahlen von Grok Voice Think Fast 2.0 wurden von jemand anderem gemessen. Die von Realtime-Venus nicht. Solange sich das nicht ändert, ist der Vergleich, der tatsächlich verfügbar ist, der zwischen einem Produkt und einem Paper.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert