Gemini 3.6 Flash

google/gemini-3.6-flash
NeuEmpfohlen
VisionAudioToolsJSONReasoning
von Google · 2026-07-21

Gemini 3.6 Flash ist Googles neuestes schnelles, kosteneffizientes Modell der Gemini-3-Familie – ein nativ multimodales Modell, das Text, Bilder, Videos, Audio und Dateien liest und in Text antwortet, mit einem Kontextfenster von 1M-Token und bis zu 64K Ausgabe-Token. Es wurde für Teams entwickelt, die frontier-nahe Qualität bei Flash-Geschwindigkeit und -Preis benötigen, und ist eine starke Standardwahl für Coding-Agenten, Dokumenten- und Medienverständnis, Retrieval-Augmented Generation und Hochdurchsatz-Automatisierung. Gegenüber dem vorherigen 3.5 Flash ist es deutlich token-effizienter und weniger wortreich – es erreicht die gleiche oder bessere Qualität bei geringerer Anzahl ausgegebener Token, was direkt Kosten und Latenz bei langen agentischen Abläufen senkt. Es unterstützt konfigurierbaren Reasoning-Aufwand (sodass Anrufer pro Anfrage Tiefe gegen Geschwindigkeit abwägen können), natives Tool Calling und strukturierte Ausgaben und schneidet bei Evaluierungen für lange Kontexte und agentisches Coding in seiner Klasse stark ab, darunter 91,8 % beim 128k-Durchschnitts-Multi-Needle-Retrieval und wettbewerbsfähige Ergebnisse bei SWE-Bench Pro, Terminal-Bench und OSWorld. Gemini 3.6 Flash spricht sowohl das OpenAI-Chat-Completions-Format als auch die native generateContent-API von Gemini, was es zu einem nahtlosen Upgrade für bestehende Gemini- und OpenAI-kompatible Integrationen macht. Verwenden Sie es als tägliches Arbeitstier, wenn Sie den Großteil der Intelligenz eines Frontier-Modells wünschen, ohne Frontier-Preise zu zahlen.

Ktx1.05M Tokens
Max. Ausgabe65.5K
Eingabetext + image + video + file + audio
Ausgabetext
p50 TTFT1.67 s
EINGABE$1.50/ 1M Tokens
AUSGABE$7.50/ 1M Tokens
p50 TTFT1.67 s7 T
p95 TTFT5.38 s7 T
DATENVERKEHR7.6KTokens / 7 T

Google Gemini 3.6 Flash ist ein großes multimodales Modell, das von Google entwickelt und über die OrcaRouter-API mit transparenter Preisgestaltung (ohne Aufschlag) angeboten wird. Es akzeptiert…

Was ist Google Gemini 3.6 Flash und für wen ist es gedacht?

Wie unterscheidet sich die Flash-Variante von anderen Gemini-Modellen?

Welche Eingabemodalitäten unterstützt Gemini 3.6 Flash?

Code-Beispiele

Aus jedem SDK aufrufen

OpenAI-kompatibel — behalte dein bisheriges SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.6-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Unterstützte Parameter

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Preise

Eingabe / 1M Tokens$1.50
Ausgabe / 1M Tokens$7.50
Cache-Lesen / 1M$0.150
WährungUSD

Kostenrechner

Tokens / Monat10MM
Eingabeanteil70%%
Geschätzt / Monat $33.00 · Mit Prompt-Caching $28.28

Schätzung auf Basis des Listenpreises

Token- und Kostenschätzer

Eingabe-Tokens: 27Kosten pro Anfrage: $0.003791

Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.

Leistung

p50 TTFT
1.67 s
Ausgabegeschwindigkeit
712 tok/s
p95 TTFT
5.38 s
Fehlerquote
25.0%

Öffentliche Benchmarks

69.2
AA Coding
Besser als 87 % der verglichenen Modelle
Nr. 16 von 122
50.1
AA Intelligence
Besser als 82 % der verglichenen Modelle
Nr. 22 von 124
CharXiv Reasoning (no tools)
85.2
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
49.0
GDM-MRCR v2 8-needle (128k avg)
91.8
GDM-MRCR v2 8-needle (1M pointwise)
54.0
GPQA Diamond
92.8
Humanity's Last Exam
38.3
Long-Context Recall
69.7
MLE-Bench
63.9
OSWorld-Verified
83.0
SciCode
52.7
SWE-Bench Pro (Public)
58.7
tau_banking
24.5
Terminal-bench 2.1 (Terminus-2)
78.0
terminalbench_v2_1
77.5
Quelle: artificialanalysis.ai, deepmind.google

Im Vergleich

Gemini 3.6 FlashGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Eingabe $/M$1.50$2.00$4.00$0.50
Ausgabe $/M$7.50$12.00$18.00$3.00
Kontext1.0M1.0M1.0M1.0M
Qualität8/1010/1010/109/10
Nebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichen

FAQ

Was kostet die Nutzung von Gemini 3.6 Flash über OrcaRouter?
Der Preis beträgt 1,50 $ pro 1 Million Eingabe-Token und 7,50 $ pro 1 Million Ausgabe-Token. OrcaRouter berechnet zum Anbieterpreis ohne Aufschlag. Es gibt keine zusätzlichen Gebühren.
Was ist das Kontextfenster von Gemini 3.6 Flash?
Der Kontextfenster beträgt 1.048.576 Tokens (ungefähr 1 Million Tokens). Die maximale Ausgabe beträgt 65.536 Tokens. Der Kontext umfasst alle Eingabemodalitäten (Text, Bild, Video, Datei, Audio).
Was sind die Hauptstärken dieses Modells?
Gemini 3.6 Flash bietet ein sehr großes Kontextfenster, unterstützt fünf Eingabemodalitäten (Text, Bild, Video, Datei, Audio) und erreicht einen starken Retrieval-Benchmark-Wert von 91.8 auf GDM-MRCR v2 8-needle (128k avg). Es ist zudem als Flash-Variante kosteneffizient.
Wie vergleicht sich Gemini 3.6 Flash mit GPT-4o oder Claude 3.5 Sonnet?
Es hat einen größeren Kontextbereich (1M vs 128K/200K) und niedrigere Preise pro Token ($1,50/$7,50 vs ~$2,50/$10 oder $3/$15). Die Benchmark-Ergebnisse sind nicht direkt vergleichbar, aber Gemini Flash ist für Langkontext-Abruf optimiert. GPT-4o und Claude können bei einigen Aufgaben eine höhere Argumentationsgenauigkeit bieten.
Wie behandelt OrcaRouter meine Daten, wenn ich dieses Modell verwende?
OrcaRouter leitet Ihre Anfragen an die Inferenzserver von Google weiter. OrcaRouter trainiert nicht mit Ihren Daten und speichert Prompts nicht über das für die Verarbeitung und Abrechnung erforderliche Maß hinaus. Die Datenschutzrichtlinien von Google gelten. Weitere Informationen finden Sie in der Datenschutzerklärung von OrcaRouter.
Kann ich Gemini 3.6 Flash mit dem OpenAI Python SDK aufrufen?
Ja. Setzen Sie die Basis-URL auf https://api.orcarouter.ai/v1 und die Modell-ID auf "google/gemini-3.6-flash". Verwenden Sie die OpenAI Python-Bibliothek mit Ihrem OrcaRouter-API-Schlüssel. Beispiel: client = OpenAI(api_key="your_key", base_url="https://api.orcarouter.ai/v1") dann client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...]).
Unterstützt das Modell Streaming und Funktionsaufrufe?
Über OrcaRouter, ja. Sie können stream=true setzen und Tools in die Anfrage einfügen. Die API übersetzt das OpenAI-Format in die Google-API. Testen Sie mit Ihrem Anwendungsfall, um die vollständige Kompatibilität zu bestätigen.
Was bedeutet die Benchmark-Bewertung 91.8 auf GDM-MRCR v2 8-needle?
Es misst die Genauigkeit des Modells beim Abrufen mehrerer spezifischer Informationen aus einem langen Kontext (durchschnittlich 128K Token). Ein Wert von 91.8% bedeutet, dass das Modell in 91.8% der getesteten Abrufszenarien korrekt geantwortet hat. Dies deutet auf eine starke Leistung bei Aufgaben mit langem Kontext hin.

Dieses Abzeichen einbetten

Google: Gemini 3.6 Flash$1.50/M in1666ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.6-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg" alt="Google: Gemini 3.6 Flash auf OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.6 Flash](https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg)](https://www.orcarouter.ai/models/google/gemini-3.6-flash)

Modellkarte als Daten

GET /api/public/models/google/gemini-3.6-flashÖffnen
Maschinenlesbar:/llms.txt/llms-full.txt