google/gemini-3.1-flash-tts-preview vs. Gemini 3.5 Flash Vergleich: Benchmarks, Preise & Geschwindigkeit (September 2026)

Ein direkter Vergleich von google/gemini-3.1-flash-tts-preview (google) und Gemini 3.5 Flash (google) auf OrcaRouter — Preise, Kontextfenster, Latenz, Durchsatz und Benchmark-Qualität nebeneinander, damit Sie das richtige Modell für Ihre Arbeitslast wählen können.

Fazit

Beim Preis ist google/gemini-3.1-flash-tts-preview die günstigere Option — etwa 33% unter Gemini 3.5 Flash bei Eingabe-Tokens. Für latenzsensible Arbeitslasten liefert google/gemini-3.1-flash-tts-preview das erste Token schneller. Bei der Benchmark-Qualität führt Gemini 3.5 Flash den zusammengesetzten Index an. google/gemini-3.1-flash-tts-preview führt sowohl bei den Kosten als auch bei der medianen Latenz und ist damit die Standardwahl – wechseln Sie zu Gemini 3.5 Flash, wenn dieses Modell bei der für Ihre Workload entscheidenden Dimension vorn liegt.

Kostenlos starten · beide Modelle mit einem Schlüssel · Abrechnung zum Anbieterpreis, kein Token-Aufschlag

google/gemini-3.1-flash-tts-preview und Gemini 3.5 Flash sind beide über denselben OrcaRouter-Endpoint zum Anbieterpreis ohne jeglichen Token-Aufschlag verfügbar; der Wechsel zwischen beiden ist eine einzeilige Änderung, und die Zahlen unten sind das, was Sie tatsächlich zahlen.

Vollständige Analyse lesen

Dieser Vergleich zieht Live-Preise, die veröffentlichte Context Window sowie OrcaRouters eigene Latency- und Throughput-Messungen heran, damit Sie Kosten gegen Leistung für Ihre konkrete Arbeitslast abwägen können, statt sich auf den Schaufenster-Benchmark eines Anbieters zu verlassen. Die richtige Wahl hängt fast immer von der Form Ihres Traffics ab — Promptlänge, wie viel Text Sie erzeugen, wie latenzempfindlich Ihre Nutzer sind und wie schwer das Reasoning ist —, weshalb die folgenden Abschnitte die Entscheidung Dimension für Dimension aufschlüsseln und mit einer konkreten Empfehlung enden. Wo eine Metrik für eines der beiden Modelle fehlt, wird die Zeile ausgelassen statt geraten, sodass jede Aussage hier durch eine echte Zahl gestützt ist.

Auf einen Blick

  • Eingabe $/M$1.00google/gemini-3.1-flash-tts-preview 33%
  • p50-Latenz2500 msgoogle/gemini-3.1-flash-tts-preview 34%
  • Qualität9.0Gemini 3.5 Flash 350%

Modellvergleich

Preise, Kontext, Latenz, Durchsatz und Qualität für google/gemini-3.1-flash-tts-preview und Gemini 3.5 Flash.
Metrikgoogle/gemini-3.1-flash-tts-previewGemini 3.5 FlashFazit
Eingabe $/M$1.00$1.50google/gemini-3.1-flash-tts-preview ist bei Eingabe-Tokens 33% günstiger als Gemini 3.5 Flash.
Ausgabe $/M$20.00$9.00Gemini 3.5 Flash ist bei Ausgabe-Tokens 55% günstiger als google/gemini-3.1-flash-tts-preview.
Kontext1M
p50-Latenz2500 ms3778 msgoogle/gemini-3.1-flash-tts-preview antwortet im Median 34% schneller als Gemini 3.5 Flash.
Durchsatz224 tok/s964 tok/sGemini 3.5 Flash streamt Tokens 330% schneller als google/gemini-3.1-flash-tts-preview.
Qualität2.09.0Gemini 3.5 Flash erzielt beim zusammengesetzten Qualitätsindex 350% mehr als google/gemini-3.1-flash-tts-preview.

Beim Preis ist google/gemini-3.1-flash-tts-preview die günstigere Option — etwa 33% unter Gemini 3.5 Flash bei Eingabe-Tokens. Für latenzsensible Arbeitslasten liefert google/gemini-3.1-flash-tts-preview das erste Token schneller. Bei der Benchmark-Qualität führt Gemini 3.5 Flash den zusammengesetzten Index an. google/gemini-3.1-flash-tts-preview führt sowohl bei den Kosten als auch bei der medianen Latenz und ist damit die Standardwahl – wechseln Sie zu Gemini 3.5 Flash, wenn dieses Modell bei der für Ihre Workload entscheidenden Dimension vorn liegt.

Beide Modelle, ein API-Schlüssel. Starten Sie mit einem und verlagern Sie den Traffic zwischen ihnen, sobald sich Ihre Zahlen ändern.

API-Schlüssel holen

google/gemini-3.1-flash-tts-preview und Gemini 3.5 Flash mit einem API-Schlüssel nutzen

Sie müssen sich nicht entscheiden. Beide Modelle sind auf OrcaRouter über einen einzigen API-Schlüssel erreichbar und werden zum Preis des vorgelagerten Anbieters ohne Token-Aufschlag abgerechnet. Die beiden sprechen unterschiedliche Request-Protokolle, jeder Aufruf nutzt also das Format seines Modells — es bleibt aber ein Konto und ein Satz Zugangsdaten.

Genau das macht den obigen Kompromiss im Produktivbetrieb handhabbar: Schicken Sie den Großteil des Traffics an das Modell, das bei der für Sie entscheidenden Dimension vorn liegt, halten Sie das andere für die Anfragen bereit, die es brauchen, und verschieben Sie die Aufteilung, sobald sich Ihre Zahlen ändern.

Praxistest: google/gemini-3.1-flash-tts-preview vs. Gemini 3.5 Flash im Battle-Modus

Battle-Modus — beide nebeneinander ausprobierenLive
Im Playground öffnen
google/gemini-3.1-flash-tts-preview
$1.00 /M · p50 2500ms
Gemini 3.5 Flash
$1.50 /M · p50 3778ms

Preis- und Kostenanalyse

Bei Eingabe-Tokens kostet google/gemini-3.1-flash-tts-preview $1.00 pro 1 Mio. gegenüber $1.50 bei Gemini 3.5 Flash, und bei der Ausgabe $20.00 gegenüber $9.00 pro 1 Mio.

Vollständige Analyse lesen

Die Rechnung entscheidet sich meist bei den Ausgabe-Tokens: Eine Chat- oder Agent-Arbeitslast, die lange Completions erzeugt, wird vom Ausgabetarif dominiert, sodass ein bei der Eingabe günstiger wirkendes Modell Ende zu Ende dennoch die teurere Wahl sein kann. Schätzen Sie Ihr tatsächliches Eingabe-zu-Ausgabe-Verhältnis, bevor Sie allein nach Preis wählen — ein abrufintensiver Prompt mit kurzer Antwort und ein kurzer Prompt mit langer Generierung liegen an entgegengesetzten Enden dieser Tabelle. Praktisch dimensionieren Sie das, indem Sie eine repräsentative Stichprobe Ihrer Prompts nehmen, die durchschnittlichen Eingabe- und Ausgabe-Tokens zählen und jeweils mit den entsprechenden Tarifen der beiden Modelle multiplizieren; das Modell mit den niedrigeren Mischkosten (blended) auf Ihrem tatsächlichen Mix ist das zu schlagende. Denken Sie daran, dass beide Preise hier der reine Anbietertarif sind — OrcaRouter schlägt nichts auf —, sodass der Vergleich gleichwertig ist und die berechnete Ersparnis die Ersparnis ist, die Sie behalten.

Beide Preise sind der reine Anbieterpreis – OrcaRouter schlägt nichts auf, die berechnete Ersparnis bleibt Ihnen also erhalten.

Kostenlos starten

Token-Preise im Vergleich

Eingabe $/M
google/gemini-3.1-flash-tts-preview$1.00
Gemini 3.5 Flash$1.50
Ausgabe $/M
google/gemini-3.1-flash-tts-preview$20.00
Gemini 3.5 Flash$9.00

pro 1 Mio. Tokens

Geschwindigkeit und Latenz

Latency und Throughput entscheiden, wie sich das Modell in der Produktion anfühlt. Die mediane (p50) Antwort-Latency ist die Wartezeit einer typischen Anfrage bis zum ersten Token; der Throughput (Tokens pro Sekunde) legt fest, wie schnell die Antwort streamt, sobald sie beginnt.

Vollständige Analyse lesen

Für interaktiven Chat und Agent-Schleifen zählt eine niedrige p50-Latency am meisten, weil der Nutzer auf das erste Token wartet; für Batch-Generierung und Langformausgaben dominiert der Throughput die Gesamtzeit, weil die Antwort lang ist. Die 7-Tage-Trendcharts oben zeigen, ob die Latency jedes Modells stabil ist oder driftet — etwas, das eine einzelne Schlagzeilen-Zahl verbirgt: Ein Modell mit hervorragendem Durchschnitt, aber verrauschtem Tail kann ein striktes p95-SLA dennoch verfehlen. Hat Ihr Produkt ein Latency-Budget, lesen Sie sowohl den Median als auch die Form der Kurve, und denken Sie daran, dass die Ende-zu-Ende-Latency auch Ihren Netzwerk-Hop sowie alle Abrufe oder Tool-Aufrufe rund um das Modell umfasst.

In den letzten 7 Tagen hält google/gemini-3.1-flash-tts-preview die niedrigere mediane Antwortlatenz.

google/gemini-3.1-flash-tts-preview
Gemini 3.5 Flash

Benchmarks und Qualität

Benchmark-Werte nähern die Fähigkeit an, ersetzen aber nicht das Testen mit Ihren eigenen Prompts.

Vollständige Analyse lesen

Die hier gezeigten zusammengesetzten Indizes aggregieren mehrere öffentliche Evaluierungen, und das Perzentil markiert, wo jedes Modell gegenüber allen vergleichbaren Modellen im Katalog liegt — ein nützliches Vorauswahl-Signal, keine Garantie für Ihre Aufgabe. Ein bei einem Index für allgemeine Intelligenz führendes Modell kann in Ihrer Domäne (Coding, Extraktion, mehrsprachig, Long-Context-Reasoning) dennoch zurückliegen; nutzen Sie die Benchmarks also zum Eingrenzen des Feldes und lassen Sie dann beide Modelle auf einem repräsentativen Ausschnitt Ihres Traffics laufen. Achten Sie auf den spezifischen Index, der zu Ihrem Anwendungsfall passt, statt auf die Kopfzahl: Ein codelastiges Produkt sollte den Coding-Index gewichten, ein Rechercheassistent den Reasoning-Index. Benchmarks veralten außerdem, während Modelle aktualisiert werden, behandeln Sie sie daher als Ausgangshypothese, die Sie mit Ihrem eigenen Evaluierungssatz bestätigen.

google/gemini-3.1-flash-tts-preview
Gemini 3.5 Flash
70.1
AA Coding
Besser als 81 % der verglichenen Modelle
Nr. 26 von 138
33.0
AA Intelligence
Besser als 67 % der verglichenen Modelle
Nr. 45 von 141
51.0
AA Math
Besser als 27 % der verglichenen Modelle
Nr. 60 von 82

Welches sollten Sie wählen?

Ist Kosten die bindende Einschränkung, beginnen Sie mit dem günstigeren Modell auf Ihrem tatsächlichen Eingabe-zu-Ausgabe-Mix und steigen Sie nur auf, wenn die Qualität nicht reicht.

Vollständige Analyse lesen

Hat Reaktionsfähigkeit Priorität — nutzerseitiger Chat, Agents, alles, wo jemand wartet — gewichten Sie p50-Latency und Throughput höher als eine kleine Preisdifferenz. Treiben Sie das anspruchsvollste Reasoning, Coding oder Long-Context-Arbeit voran, lassen Sie den Sieger bei Benchmark und Context Window führen und akzeptieren Sie den höheren Tarif dort, wo er sich rechnet. Da beide Modelle hinter derselben API sitzen, ist der risikoarme Schritt, einen Bruchteil des echten Traffics an jedes zu routen und Kosten, Latency und Antwortqualität auf Ihren eigenen Prompts zu vergleichen, bevor Sie sich festlegen. Ein gängiges Muster ist die Staffelung (Tier): Schicken Sie den Großteil einfacher, hochvolumiger Anfragen an das günstigere oder schnellere Modell und reservieren Sie das stärkere Modell für die Anfragen, die es wirklich brauchen — das holt den größten Teil des Qualitätsvorteils zu einem Bruchteil der Kosten. Was Sie auch wählen, halten Sie den Wechsel reversibel — Sie verschieben den Traffic zurück, sobald sich die Zahlen oder Ihre Anforderungen ändern.

Oder entscheiden Sie sich nicht — verteilen Sie pro Anfrage auf beide, mit einem Schlüssel und einer Rechnung.

Beide holen

Am besten für

  • Latenzkritische Chats und Agentengoogle/gemini-3.1-flash-tts-preview
  • Anspruchsvollstes Reasoning und CodingGemini 3.5 Flash

google/gemini-3.1-flash-tts-preview vs Gemini 3.5 Flash FAQ

Ist google/gemini-3.1-flash-tts-preview oder Gemini 3.5 Flash günstiger?
google/gemini-3.1-flash-tts-preview ist bei Eingabe-Tokens günstiger mit $1.00 pro 1M gegenüber $1.50 pro 1M.
Welches ist bei Ausgabe-Tokens günstiger, google/gemini-3.1-flash-tts-preview oder Gemini 3.5 Flash?
Gemini 3.5 Flash hat den niedrigeren Ausgabepreis mit $9.00 pro 1 Mio. gegenüber $20.00 pro 1 Mio. Die Ausgabe-Preisgestaltung zählt bei generierungslastigen Arbeitslasten meist mehr als die Eingabe, also gewichten Sie entsprechend.
Welches ist schneller, google/gemini-3.1-flash-tts-preview oder Gemini 3.5 Flash?
google/gemini-3.1-flash-tts-preview hat in den Live-Messungen von OrcaRouter die niedrigere mediane (p50) Antwortlatenz.
Welches streamt schneller, google/gemini-3.1-flash-tts-preview oder Gemini 3.5 Flash?
Gemini 3.5 Flash hat den höheren gemessenen Throughput (Tokens pro Sekunde), sodass lange Completions früher fertig sind, sobald die Generierung beginnt.
Welches schneidet bei Benchmarks besser ab, google/gemini-3.1-flash-tts-preview oder Gemini 3.5 Flash?
Gemini 3.5 Flash führt beim oben gezeigten zusammengesetzten Qualitätsindex, doch Benchmark-Vorsprünge übertragen sich nicht immer auf eine bestimmte Domäne — validieren Sie mit Ihren eigenen Prompts, bevor Sie standardisieren.
Sollte ich google/gemini-3.1-flash-tts-preview oder Gemini 3.5 Flash verwenden?
Wählen Sie google/gemini-3.1-flash-tts-preview oder Gemini 3.5 Flash je nach Priorität: Kosten, Kontextfenster, Latenz oder Benchmark-Qualität. Die Tabelle oben zeigt, welches Modell bei jedem Kriterium gewinnt; ordnen Sie den Sieger der Dimension zu, die für Ihre Arbeitslast am wichtigsten ist.
Wie werden google/gemini-3.1-flash-tts-preview und Gemini 3.5 Flash auf OrcaRouter abgerechnet?
Beide werden zum Tarif des vorgelagerten Anbieters ohne jeglichen Token-Aufschlag abgerechnet — Sie zahlen denselben Preis pro Token, den Sie dem Anbieter direkt zahlen würden, über einen einzigen OrcaRouter-API-Schlüssel und -Endpoint.
Kann ich google/gemini-3.1-flash-tts-preview und Gemini 3.5 Flash mit demselben Code aufrufen?
Ja. Beide werden über OrcaRouters OpenAI-compatible API bereitgestellt, sodass Sie nur den Modellnamen ändern, um zwischen ihnen zu routen — kein SDK-Wechsel, keine separaten Anmeldedaten.

Mit google/gemini-3.1-flash-tts-preview oder Gemini 3.5 Flash starten

Ein Schlüssel. Beide Modelle. Über 40 Anbieter.

Abgerechnet zum Anbieterpreis ohne Token-Aufschlag. Kostenlos starten, beide aus einem Konto betreiben und die Entscheidung umkehrbar halten.

Kostenloses Konto erstellen