Gemini 3.5 Flash-Lite

google/gemini-3.5-flash-lite
NeuEmpfohlen
VisionAudioToolsJSONReasoning
von Google · 2026-07-21

Gemini 3.5 Flash-Lite ist Googles kosteneffizientestes Gemini-Modell, speziell entwickelt für Workloads mit sehr hohem Volumen und niedriger Latenz, bei denen die Kosten pro Aufruf dominieren. Trotz seines Preispunkts ist es nativ multimodal – es akzeptiert Text, Bilder, Video, Audio und Dateien mit Textausgabe – und hat denselben 1-Million-Token-Kontextfenster und bis zu 64K Ausgabetoken wie die größere Flash-Stufe, sodass lange Dokumente und gemischte Medieneingaben erreichbar bleiben. Mit etwa einem Fünftel des Preises von 3.6 Flash ist es das richtige Werkzeug für Klassifizierung, Extraktion, Routing, Zusammenfassung, leichtgewichtige Agenten, synthetische Datengenerierung und jede Pipeline, die millionenfach ausgeführt wird. Es unterstützt weiterhin konfigurierbaren Reasoning-Aufwand, native Tool-Aufrufe und strukturierte Ausgaben und übertrifft sein Gewicht bei agentischen und langen Kontext-Benchmarks für ein Lite-Modell – zum Beispiel 74,0% bei OSWorld-Verified und 72,2% bei 128k Multi-Needle Retrieval, deutlich vor dem vorherigen 3.1 Flash-Lite. Es spricht sowohl das OpenAI-Chat-Completions-Format als auch die native generateContent-API von Gemini, sodass Sie es mit schwereren Modellen hinter einer einzigen Integration mischen können – leichten, hochvolumigen Traffic an Flash-Lite weiterleiten und schwierige Aufgaben an 3.6 Flash oder ein Pro-Modell eskalieren.

Ktx1.05M Tokens
Max. Ausgabe65.5K
Eingabetext + image + video + file + audio
Ausgabetext
p50 TTFT1.30 s
EINGABE$0.30/ 1M Tokens
AUSGABE$2.50/ 1M Tokens
p50 TTFT1.30 s7 T
p95 TTFT10.00 s7 T
DATENVERKEHR5.9MTokens / 7 T

Google Gemini 3.5 Flash-Lite ist ein multimodales Sprachmodell, das von Google entwickelt wurde und über die OpenAI-kompatible API von OrcaRouter angeboten wird. Es akzeptiert Text-, Bild-, Video-,…

Was ist Google Gemini 3.5 Flash-Lite?

Für wen ist dieses Modell gedacht?

Welche Modalitäten unterstützt das Modell?

Wie groß sind das Kontextfenster und die maximale Ausgabe?

Code-Beispiele

Aus jedem SDK aufrufen

OpenAI-kompatibel — behalte dein bisheriges SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Unterstützte Parameter

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Preise

Eingabe / 1M Tokens$0.300
Ausgabe / 1M Tokens$2.50
Cache-Lesen / 1M$0.030
WährungUSD

Kostenrechner

Tokens / Monat10MM
Eingabeanteil70%%
Geschätzt / Monat $9.60 · Mit Prompt-Caching $8.66

Schätzung auf Basis des Listenpreises

Token- und Kostenschätzer

Eingabe-Tokens: 27Kosten pro Anfrage: $0.001258

Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.

Leistung

p50 TTFT
1.30 s
Ausgabegeschwindigkeit
829 tok/s
p95 TTFT
10.00 s
Fehlerquote
5.0%

Öffentliche Benchmarks

49.3
AA Coding
Besser als 60 % der verglichenen Modelle
Nr. 49 von 122
36.5
AA Intelligence
Besser als 54 % der verglichenen Modelle
Nr. 57 von 124
CharXiv Reasoning (no tools)
74.5
CharXiv Reasoning (with tools)
76.5
GDM-MRCR v2 8-needle (128k avg)
72.2
GDM-MRCR v2 8-needle (1M pointwise)
21.3
GPQA Diamond
83.8
Humanity's Last Exam
17.5
Long-Context Recall
62.0
MLE-Bench
39.2
OSWorld-Verified
74.0
SciCode
40.9
SWE-Bench Pro (Public)
54.2
tau_banking
16.5
Terminal-bench 2.1 (Terminus-2)
54.0
terminalbench_v2_1
53.6
Quelle: artificialanalysis.ai, deepmind.google

Im Vergleich

Gemini 3.5 Flash-LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Eingabe $/M$0.30$2.00$4.00$0.50
Ausgabe $/M$2.50$12.00$18.00$3.00
Kontext1.0M1.0M1.0M1.0M
Qualität6/1010/1010/109/10
Nebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichen

FAQ

Was ist der Preis pro Token für Gemini 3.5 Flash-Lite auf OrcaRouter?
Der Preis beträgt $0,30 pro Million eingegebener Tokens und $2,50 pro Million ausgegebener Tokens. Dies sind die Anbieterraten ohne Aufschlag. Eingegebene Tokens umfassen alle Modalitäten (Text, Bild, Video, Audio, Datei). Ausgegebene Tokens sind generierter Text.
Wie groß ist das Kontextfenster?
Das Kontextfenster umfasst 1.048.576 Token (ungefähr 1 Million). Die maximale Ausgabelänge beträgt 65.536 Token. Dies ermöglicht die Verarbeitung sehr langer Dokumente, Videos oder Audioaufnahmen in einer einzigen API-Anfrage.
Was sind die Hauptstärken dieses Modells?
Seine Hauptstärken sind: sehr niedrige Kosten pro Token, Unterstützung für fünf Eingabemodalitäten (Text, Bild, Video, Audio, Datei), ein enormes 1M-Kontextfenster und die Fähigkeit zur Werkzeugnutzung (CharXiv Reasoning Score 76.5 mit Werkzeugen). Es ist für leistungsstarke, kostenempfindliche Produktionspipelines ausgelegt.
Wie schneidet es im Vergleich zu größeren Modellen wie Gemini 3.5 Pro ab?
Es werden keine direkten Benchmark-Vergleiche bereitgestellt. Als flash‑lite Variante priorisiert dieses Modell Effizienz und niedrige Kosten gegenüber roher Leistung. Größere Modelle wie Gemini 3.5 Pro würden wahrscheinlich eine höhere Genauigkeit bei komplexen Denkaufgaben erzielen, kosten aber deutlich mehr pro Token. Verwenden Sie dieses Modell, wenn Kosten und Durchsatz entscheidend sind.
Cached das Modell Prompts, um Kosten zu reduzieren?
Die bereitgestellten Informationen erwähnen keinen Caching-Mechanismus oder ermäßigte Preise für gecachte Token. Sie sollten davon ausgehen, dass alle Token zum Standard-Eingabesatz abgerechnet werden. Falls Caching wichtig ist, erkundigen Sie sich bei OrcaRouter oder Google nach möglichen Rabatten.
Wie kann ich auf dieses Modell über eine OpenAI-kompatible API zugreifen?
Verwenden Sie die API von OrcaRouter unter der Basis-URL https://api.orcarouter.ai/v1. Setzen Sie den Modellparameter auf "google/gemini-3.5-flash-lite". Die API ist vollständig kompatibel mit dem OpenAI Chat Completions Format, einschließlich multimodaler Inhalte und Tool-Definitionen.
Welche Datenverarbeitung und welchen Datenschutz kann ich erwarten?
Die Datenverarbeitung unterliegt den Richtlinien von Google (der Anbieter) und den Bedingungen von OrcaRouter. Das Modell verarbeitet Ihre Eingaben und gibt die Ausgabe an Sie zurück. Für dieses Modell werden keine spezifischen Datenschutzzertifikate bereitgestellt. Prüfen Sie bei sensiblen Daten die Datenverarbeitungsvereinbarung des Anbieters.
Kann ich dieses Modell für Echtzeitanwendungen verwenden?
Latenzdetails sind nicht angegeben. Das Modell kann für kurze Eingaben innerhalb von Sekunden Antworten liefern, aber die Verarbeitung sehr langer Prompts (nahe 1M Token) kann mehrere zehn Sekunden dauern. Es eignet sich für nahezu Echtzeitanwendungen mit moderaten Eingabegrößen. Für strenge Echtzeitanforderungen testen Sie mit Ihren erwarteten Eingabelängen.
Was ist der CharXiv Reasoning Benchmark-Score?
Das Modell erreichte einen Wert von 76.5 bei CharXiv Reasoning mit Tools. Dieser Benchmark testet das Verständnis und die Argumentation von Diagrammen. Der Wert deutet auf eine moderate Leistung hin; das Modell kann Diagramme interpretieren und Fragen beantworten, jedoch nicht auf dem Niveau spezialisierter Reasoning-Modelle. Es werden keine weiteren Benchmark-Werte angegeben.
Gibt es eine Mindestgebühr oder Bindung für die Nutzung von OrcaRouter?
OrcaRouter erlegt keine Mindestmonatsausgaben auf. Ihnen werden nur die Token berechnet, die Sie zu den Aufschlag-freien Anbietertarifen nutzen. Es fallen keine Vorabgebühren oder langfristigen Verträge an. Melden Sie sich einfach für einen API-Schlüssel an und beginnen Sie mit Anfragen.

Dieses Abzeichen einbetten

Google: Gemini 3.5 Flash-Lite$0.30/M in1298ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg" alt="Google: Gemini 3.5 Flash-Lite auf OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.5 Flash-Lite](https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite)

Modellkarte als Daten

GET /api/public/models/google/gemini-3.5-flash-liteÖffnen
Maschinenlesbar:/llms.txt/llms-full.txt