Gemini 3.5 Flash-Lite ist Googles kosteneffizientestes Gemini-Modell, speziell entwickelt für Workloads mit sehr hohem Volumen und niedriger Latenz, bei denen die Kosten pro Aufruf dominieren. Trotz seines Preispunkts ist es nativ multimodal – es akzeptiert Text, Bilder, Video, Audio und Dateien mit Textausgabe – und hat denselben 1-Million-Token-Kontextfenster und bis zu 64K Ausgabetoken wie die größere Flash-Stufe, sodass lange Dokumente und gemischte Medieneingaben erreichbar bleiben. Mit etwa einem Fünftel des Preises von 3.6 Flash ist es das richtige Werkzeug für Klassifizierung, Extraktion, Routing, Zusammenfassung, leichtgewichtige Agenten, synthetische Datengenerierung und jede Pipeline, die millionenfach ausgeführt wird. Es unterstützt weiterhin konfigurierbaren Reasoning-Aufwand, native Tool-Aufrufe und strukturierte Ausgaben und übertrifft sein Gewicht bei agentischen und langen Kontext-Benchmarks für ein Lite-Modell – zum Beispiel 74,0% bei OSWorld-Verified und 72,2% bei 128k Multi-Needle Retrieval, deutlich vor dem vorherigen 3.1 Flash-Lite. Es spricht sowohl das OpenAI-Chat-Completions-Format als auch die native generateContent-API von Gemini, sodass Sie es mit schwereren Modellen hinter einer einzigen Integration mischen können – leichten, hochvolumigen Traffic an Flash-Lite weiterleiten und schwierige Aufgaben an 3.6 Flash oder ein Pro-Modell eskalieren.
Google Gemini 3.5 Flash-Lite ist ein multimodales Sprachmodell, das von Google entwickelt wurde und über die OpenAI-kompatible API von OrcaRouter angeboten wird. Es akzeptiert Text-, Bild-, Video-,…
Gemini 3.5 Flash-Lite ist in der Lage, eine Vielzahl von Aufgaben zu bewältigen, dank seiner multimodalen Eingabe und Unterstützung für die Werkzeugnutzung. Es bewältigt rein textbasierte Aufgaben wie Zusammenfassung, Fragenbeantwortung und Codegenerierung. Mit Bildern kann es Szenen beschreiben, Text aus Dokumenten extrahieren oder Diagramme interpretieren. Videoeingaben ermöglichen Aktivitätserkennung, Beschriftung und zeitliches Denken. Audioeingaben ermöglichen Transkription, Sprachidentifikation und sprachbasierte Analyse. Das Modell unterstützt auch das Aufrufen von Werkzeugen, wie sein CharXiv Reasoning Score von 76.5 (mit Werkzeugen) zeigt. Das bedeutet, dass es in agentische Arbeitsabläufe integriert werden kann, bei denen es externe APIs oder Datenbanken aufruft. Allerdings ist es nicht für kreatives Schreiben, hochgradig abstraktes Denken oder Aufgaben konzipiert, die tiefgehendes Fachwissen erfordern. Seine Stärke liegt in Geschwindigkeit, Kosten und der Breite der Modalitätsunterstützung, nicht in der rohen Leistung.
Sie sollten Gemini 3.5 Flash-Lite wählen, wenn Kosten und Durchsatz die Hauptanliegen sind und die Aufgabe in ihr Leistungsspektrum fällt. Es eignet sich hervorragend für hochvolumige Pipelines wie die Indexierung Tausender Dokumente, die Transkription stundenlanger Audiodateien oder die Durchführung von Echtzeit-Klassifikationen von Bildströmen. Sein großes Kontextfenster (1M Token) macht es ideal für Aufgaben, die ein globales Verständnis langer Eingaben erfordern, wie die Analyse von Gerichtsfällen oder das Refactoring von Codebasen. Größere Modelle (z. B. Gemini 3.5 Pro) können bei komplexen Benchmarks eine höhere Genauigkeit erzielen, sind jedoch mit deutlich höheren Kosten pro Token und einem geringeren Durchsatz verbunden. Wenn Ihre Anwendung geringfügige Qualitätseinbußen für eine 10‑100x Kostensenkung tolerieren kann, ist dieses Modell eine gute Wahl. Umgekehrt wird für Aufgaben, die faktische Genauigkeit, kreative Generierung oder modernste Argumentation erfordern, ein größeres Modell empfohlen.
Ja, das Modell akzeptiert nativ Video- und Audioeingaben zusammen mit Text, Bildern und Dateien. Videoeingaben können als Bildsequenz oder Videodatei bereitgestellt werden; das Modell verarbeitet visuelle Frames und die dazugehörige Tonspur. Audioeingaben funktionieren mit gängigen Formaten wie WAV, MP3 oder FLAC. Das große Kontextfenster ermöglicht die Verarbeitung langer Aufnahmen in einer einzigen Anfrage – beispielsweise könnte eine einstündige Audioaufnahme mit hoher Detailgenauigkeit rund 10.000 Token verbrauchen. Dies ist nützlich für Zusammenfassungen von Meetings, Podcast-Analysen oder sprachbasierte Kundenbetreuung. Hinweis: Das Modell generiert keine Audio- oder Videoausgaben; Antworten erfolgen stets in Textform. Die Qualität des multimodalen Verständnisses entspricht der Flash-Lite-Stufe des Modells: ausreichend für Extraktion und Klassifikation, aber möglicherweise übersehen subtile Details im Vergleich zu größeren multimodalen Modellen.
Gemini 3.5 Flash-Lite unterstützt Tool Calling, wie durch seine Benchmark-Leistung bei CharXiv Reasoning with tools (Punktzahl 76.5) angezeigt wird. Das bedeutet, dass Sie Funktionen oder APIs definieren können, die das Modell während der Antwortgenerierung aufrufen kann. Typische Anwendungsfälle umfassen Datenbankabfragen, Websuchen oder arithmetische Operationen. Das Modell wählt basierend auf der Anweisung des Benutzers und dem Kontext aus, wann ein Tool aufgerufen werden soll. Die Verwendung von Tools kann die faktische Genauigkeit verbessern und komplexes mehrschrittiges Denken ermöglichen. Da das Modell jedoch eine Flash-Lite-Variante ist, kann seine Zuverlässigkeit beim Tool-Aufruf geringer sein als die eines größeren spezialisierten Modells. Wenn Ihre Anwendung stark von einwandfreier Tool-Orchestrierung abhängt, müssen Sie möglicherweise Validierungsebenen oder Fallback-Logik hinzufügen. OrcaRouter übergibt Tool-Definitionen im gleichen Format wie die API von OpenAI, was die Integration unkompliziert macht.
Das Modell erreichte eine Punktzahl von 76,5 im CharXiv Reasoning Benchmark, bewertet mit Werkzeugen. CharXiv testet die Fähigkeit, reasoning über diagrammbasierte visuelle Daten durchzuführen, wobei das Modell ein Diagrammbild interpretieren und Fragen dazu beantworten muss. Die Bedingung „mit Werkzeugen“ bedeutet, dass das Modell externe Funktionen (z. B. einen Taschenrechner) zur Unterstützung aufrufen konnte. Diese Punktzahl deutet auf eine moderate Leistung hin – es ist zu diagrammbezogenem Reasoning fähig, jedoch nicht auf dem Niveau von Spezialmodellen. Es wurden keine weiteren Benchmark-Ergebnisse für dieses Modell angegeben. Zum Vergleich würden größere Modelle wie Gemini 3.5 Pro bei dieser Aufgabe wahrscheinlich höhere Punktzahlen erzielen. Der Wert ist als Referenzpunkt nützlich: Sie können eine vernünftige Diagramminterpretation erwarten, sollten aber gründlich testen, wenn Ihre Anwendung hohe Genauigkeit bei visuellen Reasoning-Aufgaben erfordert.
Es wurde nur der CharXiv Reasoning (mit Tools) Score bereitgestellt: 76.5. Keine zusätzlichen Benchmark-Daten – wie MMLU, HumanEval oder Long‑Context Retrieval Scores – sind in den bereitgestellten Informationen für Gemini 3.5 Flash‑Lite verfügbar. Das bedeutet, dass die Verallgemeinerung seiner Leistung auf andere Aufgaben empirische Tests mit Ihren eigenen Daten erfordert. Angesichts der Flash‑Lite-Natur des Modells ist zu erwarten, dass es bei den meisten standardisierten Benchmarks schlechter abschneidet als vollwertige Modelle. Allerdings überwiegen seine Effizienz und die niedrigen Kosten oft diese Nachteile in Produktionsumgebungen. Falls Sie eine bestätigte Leistung bei einem bestimmten Benchmark benötigen (z. B. Codegenerierung oder mehrsprachiges Verständnis), sollten Sie Ihre eigene Evaluierung durchführen. OrcaRouter hostet keine separaten Benchmark-Ergebnisse; die hier zitierten Zahlen stammen direkt vom Anbieter.
Latenzdetails sind in den bereitgestellten Daten nicht angegeben. Als Faustregel gilt: flash‑lite Modelle sind im Vergleich zu ihren größeren Geschwistern auf niedrige Latenz ausgelegt, aber die tatsächliche Antwortzeit hängt von vielen Faktoren ab: Eingabelänge, Ausgabelänge, gleichzeitige Anfragelast und die zugrunde liegende Hardware. Bei einem 1M-Kontextfenster kann die Verarbeitung sehr langer Eingabeaufforderungen aufgrund der quadratischen Skalierung der Aufmerksamkeit die Latenz erheblich erhöhen. Bei kurzen Eingaben (z. B. einigen hundert Token) können Sie Antworten im Subsekundenbereich erwarten. Bei Eingaben nahe der 1M-Token-Grenze kann die Latenz Dutzende von Sekunden erreichen. OrcaRouter garantiert keine spezifischen Latenz-SLAs für dieses Modell. Wenn niedrige Latenz kritisch ist, sollten Sie die Verwendung eines kleineren Kontexts (z. B. durch Trunkierung) oder eines dedizierten Endpunkts in Betracht ziehen. Sie können die Antwortzeiten über das OrcaRouter-Dashboard überwachen.
Gemini 3.5 Flash-Lite ist nicht für hochmoderne Genauigkeit konzipiert. Seine Stärken liegen in Geschwindigkeit, Kosten und großem Kontext. Zu den Einschränkungen gehören eine geringere Leistung bei komplexen Denk-Benchmarks, eine reduzierte Faktenwiedergabe im Vergleich zu größeren Modellen und eine Tendenz zum „Halluzinieren“ bei mehrdeutigen Eingaben. Das Modell könnte bei Aufgaben, die tiefes Fachwissen erfordern (z. B. juristische Argumentation, medizinische Diagnose) oder nuancierte kreative Arbeit, Schwierigkeiten haben. Die Fähigkeit zur Nutzung von Tools ist zwar funktionsfähig, aber möglicherweise nicht so zuverlässig wie die eines dedizierten Agentenmodells. Da nur ein Benchmark-Score angegeben wird (CharXiv Reasoning 76.5 mit Tools), können Sie ohne Tests nicht von einer guten Leistung in anderen Bereichen ausgehen. Für kritische Anwendungen sollten Sie stets mit Ihren eigenen Daten benchmarken und bei geringem Vertrauen einen Fallback auf ein leistungsfähigeres Modell in Betracht ziehen.
Die Preise betragen $0.30 pro 1 Million Eingabe-Token und $2.50 pro 1 Million Ausgabe-Token. Diese Preise sind die Anbieterpreise, die ohne Aufschlag von OrcaRouter berechnet werden. Eingabe-Token umfassen alle Token in der Eingabeaufforderung (Text, Bild-Token, Videobilder, Audiobeispiele, Dateiinhalte) unabhängig von der Modalität. Ausgabe-Token sind die generierten Text-Token. Für eine typische Abfrage mit langem Kontext, die 100.000 Eingabe-Token und 1.000 Ausgabe-Token verbraucht, würden die Kosten ungefähr ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325 pro Anfrage betragen. Im großen Maßstab kann dieses Modell Millionen von Abfragen für ein paar hundert Dollar verarbeiten. Vergleichen Sie dies mit größeren Modellen, die oft 10‑50x mehr pro Token kosten. Die niedrigen Ausgabepreise sind besonders vorteilhaft für Anwendungen, die lange Antworten generieren (z. B. Zusammenfassungen ganzer Dokumente).
Die bereitgestellten Informationen enthalten keine Angaben zu einem Caching-Mechanismus oder ermäßigten Preisen für gecachte Token. Daher sollten Sie davon ausgehen, dass jedes an das Modell gesendete Token zum Standard-Eingabesatz von $0.30 pro Million Token abgerechnet wird, unabhängig von Wiederholungen. Einige Anbieter bieten automatisches Prompt-Caching an, bei dem wiederholte Präfixe zu einem niedrigeren Satz (z. B. 50 % Rabatt) abgerechnet werden. Für dieses Modell wurde ein solcher Caching-Rabatt nicht angekündigt. Wenn Sie häufig denselben Kontext (z. B. einen großen System-Prompt) erneut senden, sollten Sie prüfen, ob OrcaRouter oder Google transparentes Caching implementieren. In Ermangelung expliziter Informationen ist es am sichersten, für alle Eingaben die vollen Kosten pro Token einzuplanen. Eine Optimierung durch Kürzen wiederverwendeter Inhalte kann Ihre effektive Rechnung reduzieren.
Null Aufschlag bedeutet, dass OrcaRouter genau den Anbieterpreis berechnet, ohne eine zusätzliche Marge hinzuzufügen. Für Gemini 3.5 Flash-Lite beträgt der Eingabepreis $0.30/1M Token und der Ausgabepreis $2.50/1M Token – das ist, was Google berechnet, und OrcaRouter gibt es ohne Aufschlag weiter. Sie zahlen keine zusätzliche Plattformgebühr pro Token. Das ist ungewöhnlich unter API-Gateways, die normalerweise 10‑20% oder mehr aufschlagen. Das Fehlen eines Aufschlags macht dieses Modell noch kosteneffizienter, wenn es über OrcaRouter genutzt wird. Sie zahlen weiterhin für die Bandbreite und API-Infrastruktur, aber diese Kosten sind im Anbieterpreis enthalten; OrcaRouter führt sie nicht separat auf. Dieses Preismodell ist transparent: Die in Ihrem Nutzungs-Dashboard angezeigten Kosten sind die endgültigen Kosten.
Sie rufen es über die OpenAI-kompatible API von OrcaRouter unter der Basis-URL https://api.orcarouter.ai/v1 auf. Setzen Sie den Modellparameter auf "google/gemini-3.5-flash-lite". Sowohl Chat-Completions (POST /v1/chat/completions) als auch Embeddings (falls unterstützt) funktionieren. Für multimodale Eingaben strukturieren Sie Nachrichten mit einem roles-Array und content-Objekten, die text-, image_url- oder file_url-Felder enthalten können. Beispiel-cURL-Anfrage: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' Sie müssen einen OrcaRouter-API-Schlüssel verwenden, keinen Google-API-Schlüssel.
Das Modell unterstützt standardmäßige OpenAI‑kompatible Parameter: model, messages, max_tokens (bis zum Grenzwert des Modells von 65.536), temperature, top_p, stop, frequency_penalty, presence_penalty und tools (für Funktionsaufrufe). Zusätzliche Google‑spezifische Parameter (wie safety_settings) sind möglicherweise nicht direkt verfügbar; falls Sie sie benötigen, prüfen Sie die OrcaRouter-Dokumentation auf Entsprechungen. Das Modell respektiert die max_tokens-Grenze. Für multimodale Eingaben unterstützt das content-Feld die folgenden Typen: text, image_url, video_url (falls OrcaRouter dies bereitstellt), audio_url und file_url. Der Dateityp kann PDFs, CSVs usw. akzeptieren. Beachten Sie, dass große Mediendateien möglicherweise vorab als Data-URIs kodiert oder öffentlich gehostet werden müssen. OrcaRouter kann zudem verlangen, dass die Datei eine bestimmte Größe nicht überschreitet. Konsultieren Sie stets die aktuellste API-Dokumentation für die genaue Parameterunterstützung.
Um von einem anderen API-Anbieter (z. B. Google AI Studio, Vertex AI oder anderen Gateways) zu OrcaRouter zu migrieren, ersetzen Sie die Basis-URL durch `https://api.orcarouter.ai/v1` und setzen Sie die Modell-ID auf `"google/gemini-3.5-flash-lite"`. Falls Ihr bestehender Code den OpenAI Python-Client verwendet, übergeben Sie `base_url` und `api_key`. Beispiel: ```python from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="IHR_ORCAROUTER_API_SCHLÜSSEL") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) ``` Möglicherweise müssen Sie die Formatierung multimodaler Nachrichten anpassen, falls Ihr vorheriger Anbieter ein anderes Schema verwendet hat (z. B. Anthropic). OrcaRouter erwartet das OpenAI-Format. Benutzerinhalts-Arrays können mehrere Teile enthalten. Tool-Definitionen sind ebenfalls im OpenAI-Stil gehalten. Es fallen keine zusätzlichen Migrationsgebühren an; Sie zahlen nur pro Token wie beschrieben.
Es werden keine direkten Vergleichsdaten bereitgestellt, aber wir können qualitativ argumentieren. Gemini 2.0 Flash (falls es existiert) wäre wahrscheinlich ein Flash-Modell einer früheren Generation. Gemini 3.5 Flash‑Lite ist eine neuere, leichte Variante mit einem größeren Kontextfenster (1M vs. vermutlich 128K) und niedrigeren Preisen. Die Kosten pro Token für Gemini 3.5 Flash‑Lite betragen $0.30/$2.50 pro Million Tokens, was sehr niedrig ist. Ältere Flash-Modelle können höhere Kosten pro Token und kürzere Kontextfenster haben. Allerdings könnte Gemini 2.0 Flash eine bessere Rohgenauigkeit aufweisen, wenn es sich um ein vollständiges Flash-Modell und nicht um eine Lite-Variante handelt. Wenn Ihre Aufgabe die höchste Qualität erfordert und Sie höhere Kosten in Kauf nehmen können, könnte das ältere vollständige Flash-Modell besser sein. Wenn Sie ein großes Kontextfenster und niedrige Kosten benötigen, ist die 3.5 Flash‑Lite die logische Wahl.
GPT-4o mini von OpenAI ist ein ähnlich kostengünstiges, multimodales Modell. Es hat einen Kontextfenster von 128K Tokens (deutlich kleiner als 1M) und kostet $0.15 pro Million Eingabe-Tokens und $0.60 pro Million Ausgabe-Tokens (Stand Anfang 2025; Preise können sich geändert haben). Gemini 3.5 Flash‑Lite bietet ein 8x größeres Kontextfenster zum 2-fachen Eingabepreis und 4-fachen Ausgabepreis. Daher ist Gemini pro Token teurer, bietet aber eine viel größere Kontextkapazität. Für Aufgaben, bei denen der volle 1M-Kontext benötigt wird (z. B. Verarbeitung ganzer Bücher), ist Gemini Flash‑Lite kosteneffizienter, als zu versuchen, die Eingabe auf mehrere GPT‑4o mini-Aufrufe aufzuteilen. Wenn der Kontext kurz ist, ist GPT‑4o mini günstiger und hat möglicherweise eine bessere Benchmark-Leistung. Keine der Benchmark-Ergebnisse sind ohne Daten direkt vergleichbar.
Es werden keine Benchmark-Vergleiche bereitgestellt. Llama 3.2 90B (vorausgesetzt, dieses Modell existiert) ist ein großes Open-Weight-Modell mit einem kleineren Kontextfenster (typischerweise 128K Tokens) und höheren Kosten pro Token, wenn es über eine API ausgeführt wird. Gemini 3.5 Flash‑Lite ist ein proprietäres Modell mit einem weitaus größeren Kontextfenster und sehr niedrigen Preisen – eines der günstigsten multimodalen Modelle pro Token, die verfügbar sind. Llama 3.2 90B könnte aufgrund seiner Größe eine höhere Genauigkeit bei vielen NLP-Benchmarks erzielen, ist jedoch nicht multimodal und hat eine strengere Kontextbegrenzung. Wenn Ihre Aufgabe rein textbasiert ist und Sie die höchste Genauigkeit benötigen, könnte Llama 90B (falls über OrcaRouter zugänglich) besser geeignet sein. Für multimodale, langkontextuelle oder durchsatzstarke Szenarien hat Gemini Flash‑Lite klare Vorteile. Die Wahl hängt von den spezifischen Anforderungen Ihrer Anwendung ab.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Eingabe / 1M Tokens | $0.300 |
| Ausgabe / 1M Tokens | $2.50 |
| Cache-Lesen / 1M | $0.030 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/google/gemini-3.5-flash-liteÖffnen @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite