Hero-Titelkarte für 'Ling 3.0 Tiny vs. Gemini 3.5 Flash-Lite' mit dem Untertitel 'Kostenlos ist nicht billig — der Platzhirsch bleibt die sichere Bank' und zwei Statistik-Karten: Ling 3.0 Tiny (AA-Index 23, sehr wortreich, kostenlos bis 14. August) und Gemini 3.5 Flash-Lite (AA-Index 36, ~490 tok/s, $0.30 / $2.50). OrcaRouter-Logo unten rechts eingefügt.
Guides & Insights

Ling 3.0 Tiny gegen Gemini 3.5 Flash-Lite: Kostenlos ist nicht billig, und der etablierte Anbieter bleibt die sichere Wahl.

Autor

Jim Song

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

„Free" ist das teuerste Wort im Vokabular des Modellmarkts, denn es bedeutet meist, dass man gleich für etwas anderes zur Kasse gebeten wird als für den angegebenen Preis. Das ist die Falle, die in dem Vergleich zwischen Ling 3.0 Tiny, dem neuen MoE-Reasoning-Modell mit 7,9 Milliarden Parametern von Ant Group InclusionAI, und Gemini 3.5 Flash-Lite, Go​ogles günstigster und schnellster aktueller Ge​mini-Tarif, steckt. Ling 3.0 Tiny ist derzeit kostenlos abrufbar und kostet nach der Aktion vom 14. August 0,06 $ / 0,18 $ pro Million Tokens — aber Artificial Analysis hat gemessen, dass es 210 Millionen Ausgabe-Tokens verbrannt hat, nur um in seiner Klasse von 56 Modellen zu punkten, gegenüber einem Median von 63 Millionen, und hat es als „sehr gesprächig" eingestuft. Gemini 3.5 Flash-Lite kostet fünfmal so viel pro Token, nämlich 0,30 $ / 2,50 $, hat aber einen unabhängigen Intelligence Index von 36 — 13 Punkte über Ling 3.0 Tiny — und eine Ausgabegeschwindigkeit von rund 490 Tokens pro Sekunde. Das billigere Preisschild, der schnellere Redner und die niedrigere Punktzahl sind ein und dasselbe Modell. Das ist die ganze Geschichte dieses Vergleichs und der ganze Grund, zweimal nachzudenken, bevor man sich allein wegen des Preises für den Neuling entscheidet.

Beide Modelle befinden sich in der Budget-Kategorie, allerdings an unterschiedlichen Punkten ihres Lebenszyklus. Gemini 3.5 Flash-Lite ist der etablierte Platzhirsch: veröffentlicht am 21. Juli 2026, kontinuierlich von einem Dritten neu vermessen und weit verbreitet als Standard-Tier für hochvolumige, latenzempfindliche Agenten-Aufgaben. Ling 3.0 Tiny ist eine Woche alt, preislich darauf ausgelegt, Nutzer zu gewinnen, und wurde genau einmal bewertet. Dieser Artikel trennt, was jedes Modell tatsächlich ist, was die unabhängigen Zahlen aussagen und warum der „kostenlose“ Preis die am wenigsten aussagekräftige Zahl im Vergleich ist.

Ling 3.0 Tiny, der Neuling mit Messgerät

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite, der bisherige Spitzenreiter

Gemini 3.5 Flash-Lite ist Googles Antwort auf dieselbe Frage – eine Stufe tiefer in der Gemini-3.5-Reihe angesiedelt. Es ist nativ multimodal beim Input – Text, Bilder, Video, Audio und Dateien – mit Textausgabe, einem Kontextfenster von 1M Token, bis zu 64K Ausgabe-Token und konfigurierbarem Reasoning-Aufwand (minimal, niedrig, höher), sodass eine Pipeline die Tiefe und die Kosten pro Anfrage einstellen kann. Sein unabhängiger Score ist ein echter Generationssprung: Artificial-Analysis-Intelligence-Index 36, Rang #12 von 151 erfassten Modellen, gegenüber 25 für Gemini 3.1 Flash-Lite. In puncto Geschwindigkeit ist es das schnellste Modell der 3.5-Serie – Google nannte beim Start 350 Ausgabe-Token pro Sekunde, und AAs Live-Seite hat etwa 490 Token pro Sekunde gemessen, Rang #2 unter den erfassten Modellen. Seine vom Anbieter gemeldeten agentischen Kennzahlen – 74,0 % bei OSWorld-Verified, 54 % bei Terminal-Bench 2.1, 72,2 % bei einem 128K-Multi-Needle-Retrieval-Test – stammen von Google selbst und sind eher richtungsweisend als verbindlich, und eine offene Frage (Computer-Use wird in Googles Blog als integriert aufgeführt, in der API-Dokumentation jedoch nicht unterstützt) sollte man prüfen, bevor man sich darauf verlässt.

Pro Token ist er für seine Klasse ebenfalls nicht günstig. Der Name „Lite“ beschreibt die Position des Modells in der Produktreihe, nicht einen sinkenden Listenpreis: Gemini 2.5 Flash-Lite kostete $0,10 / $0,40, 3.1 Flash-Lite $0,25 / $1,50 und 3.5 Flash-Lite kostet $0,30 / $2,50 pro Million Token, mit gecachtem Input bei $0,03. Der Effizienzvorteil ergibt sich aus Geschwindigkeit und Token-Ökonomie, und die eigenen Messungen von Artificial Analysis zeigen, dass sich die realen Kosten pro Aufgabe von Generation zu Generation ungefähr verdoppelten, während sich die Zeit pro Aufgabe halbierte.

Die unabhängige Anzeigetafel, im Kontext gelesen

Setzt man die beiden Modelle auf denselben Index, ist der Abstand eklatant: Gemini 3.5 Flash-Lite bei 36, Ling 3.0 Tiny bei 23. Doch dieser plakative Vergleich zeigt nur die halbe Wahrheit, denn die beiden Modelle werden nicht gegen dasselbe Feld bewertet. AA platziert Ling 3.0 Tiny auf Platz 6 von 56 in seiner Tiny-Modell-Klasse, bei einem Klassenmedian von 8 – weit über dem Durchschnitt für ein Modell seiner Größe. Gemini 3.5 Flash-Lite liegt auf Platz 12 von 151 im breiteren erfassten Feld. Das eine ist ein außergewöhnliches Tiny-Modell; das andere ist ein solides Budget-Modell im offenen Pool. Beide Aussagen sind wahr, und sie bedeuten unterschiedliche Dinge. Ling 3.0 Tiny bietet für seine Größenklasse ein besseres Preis-Leistungs-Verhältnis als Gemini 3.5 Flash-Lite für seine Kategorie – und Gemini 3.5 Flash-Lite ist auf derselben unabhängigen Skala dennoch mit deutlichem Abstand das leistungsfähigere Modell.

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Die Maße, jeweils eine Zeile:

• Unabhängiger Score — Ling 3.0 Tiny AA Index 23 (#6/56, Klassenmedian 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).

• Preis — Ling 3.0 Tiny $0,06 / $0,18 pro 1M nach einer kostenlosen Aktion vs. Gemini 3.5 Flash-Lite $0,30 / $2,50 pro 1M (Cache-Eingabe $0,03).

• Ausführlichkeit — Ling 3.0 Tiny: 210M Output-Tokens während des Index-Runs vs. Gemini 3.5 Flash-Lite: gemessen, aber laut diesem Flag nicht ausführlich.

• Modalität — Ling 3.0 Tiny nur Text vs. Gemini 3.5 Flash-Lite Text, Bild, Video, Audio und Dateieingabe.

• Kontext — 256K bei Ling 3.0 Tiny vs. 1M bei Gemini 3.5 Flash-Lite, mit einer maximalen Ausgabe von 64K bei beiden.

• Geschwindigkeit — {{1}}Ling 3.0 Tiny ~90–264 Token/s über die Endpunkte, die einen Wert veröffentlicht haben{{/1}} vs. {{2}}Gemini 3.5 Flash-Lite ~490 Token/s in der Live-Messung von AA{{/2}}.

Die Geschwindigkeitszeile ist diejenige, die sich am ehesten verschiebt. Die Ausgabegeschwindigkeit von Ling 3.0 Tiny ist tatsächlich ungeklärt: Artificial Analysis listet sie als N/A, während Vercel 264 Token/Sekunde angibt. Die ~490 Token/Sekunde von Gemini 3.5 Flash-Lite sind eine Live-AA-Messung, die erst lange nach dem Abklingen der eigenen Startschwankungen erfasst wurde. Für eine latenzsensitive Stufe ist das der Unterschied zwischen einer bekannten Größe und einer offenen Frage.

Die Ökonomie der Ausführlichkeit: Warum kostenlos nicht billig ist.

Hier ist die Rechnung, die diesen Vergleich normalerweise entscheidet. Lässt man nach dem Auslaufen der Promo-Aktion von Ling 3.0 Tiny dieselbe reasoning-intensive Aufgabe durch beide Modelle laufen — sagen wir 4.000 Eingabe-Tokens und 2.000 Ausgabe-Tokens —, berechnet Ling 3.0 Tiny (4.000 × 0,06 $ + 2.000 × 0,18 $) / 1.000.000, also etwa 0,0006 $. Gemini 3.5 Flash-Lite berechnet (4.000 × 0,30 $ + 2.000 × 2,50 $) / 1.000.000, also etwa 0,0062 $. Bei identischen Token-Anzahlen ist Ling 3.0 Tiny zehnmal günstiger. Dann kommt die Ausführlichkeit hinzu: Ein Reasoning-Modell, das Denk-Tokens als Ausgabe erzeugt, produziert keine identischen Token-Anzahlen. Wenn das Ausführlichkeitsverhältnis von Ling 3.0 Tiny von 210M zu 63M bei Ihrer Workload zutrifft, verdreifachen sich die effektiven Kosten pro Aufgabe auf der Ausgabeseite ungefähr, und der 10-fache Vorteil schrumpft auf etwa das 3- bis 4-fache. Immer noch günstiger — aber nicht mehr gratis und nicht in derselben Liga, wie es die 210M-Zahl vermuten lässt.

Die ehrliche Einordnung ist, dass die beiden Modelle nicht bei gleicher Qualität austauschbar sind. Ling 3.0 Tinys 23 ist ein außergewöhnlicher Wert für ein Modell mit 1,3B aktiven Parametern; Gemini 3.5 Flash-Lites 36 ist eine andere Liga an Leistungsfähigkeit, dazu Vision, 1M Kontext und etablierte Geschwindigkeit. Man zahlt für diese Lücke – den fünffachen Preis pro Token und mehr pro Aufgabe, sobald man Geschwindigkeitsunterschiede berücksichtigt – aber es ist eine echte Leistungslücke, keine Marketing-Lücke. Wenn Ihre Workload mit der Qualität des günstigeren Modells leben kann, ist Ling 3.0 Tiny das bessere Preis-Leistungs-Verhältnis. Wenn Ihre Workload die Leistungsfähigkeit benötigt, schließt kein Preisvorteil die Lücke.

Wo ein Router seinen Wert beweist

Genau diese Art von Workload ist es, bei der eine Routing-Ebene besser abschneidet als die Festlegung auf ein einzelnes Modell, und die konkreten Hosting-Bedingungen sind entscheidend dafür, wie man sie aufbaut. Gemini 3.5 Flash-Lite ist live auf OrcaRouter zum Listenpreis des Anbieters — 0,30 $ Input / 2,50 $ Output pro 1M Tokens, mit 0 % Aufschlag durchgereicht, sodass die Zahl auf Go​ogles Preisliste exakt der Zahl bei uns entspricht und jede künftige Preissenkung noch am selben Tag greift. Es sitzt hinter demselben OpenAI-kompatiblen Endpunkt wie 200+ andere Modelle, mit automatischem Failover über die Anbieter hinweg, falls ein Basis-Anbieter mitten im Lauf nachlässt, und die Routing-DSL kann einen Prompt an mehrere Modelle senden und die beste Antwort behalten.

Ling 3.0 Tiny ist nicht auf OrcaRouter; es wird über eigene Endpunkte bereitgestellt, heute kostenlos. Diese Kombination macht das Argument für Routing tatsächlich stärker statt schwächer. Nutzen Sie das kostenlose Zeitfenster, um Ling 3.0 Tiny gegen Ihren eigenen Traffic zu benchmarken, bevor es Geld kostet. Bauen Sie dann den Produktionspfad auf der gehosteten Stufe auf — Gemini 3.5 Flash-Lite für die Aufrufe, die Vision, langen Kontext oder ein etabliertes Geschwindigkeitsprofil benötigen, wobei die Routing-Ebene die Freiheit hat, für die schwierige Minderheit auf ein teureres Modell zu eskalieren. Eine kostenlose Stufe ist ein großartiges Experiment und eine fragile Abhängigkeit; die gehostete Stufe ist das, worauf Sie ein Produkt aufbauen können. Auf OrcaRouter können Sie beide im selben Graphen ausführen — Ling 3.0 Tiny über direkten Endpunkt, Gemini 3.5 Flash-Lite per Schlüssel — und den Router pro Anfrage entscheiden lassen.

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

Urteil

Wenn Sie sich zwischen diesen beiden entscheiden und sie nicht zusammen routen, ist die Entscheidung einfach zu formulieren, aber schwer zu akzeptieren. Ling 3.0 Tiny ist das bessere Angebot und das schwächere Modell: eine erst eine Woche alte, rein textbasierte Reasoning-Stufe mit einem hervorragenden Ergebnis für ihre Größe, einem aggressiven Preis und einem ungeklärten Bild bei Geschwindigkeit und Ausführlichkeit — einen sofortigen kostenlosen Test wert, und man sollte wissen, dass sie am 14. August nach Verbrauch abgerechnet wird. Gemini 3.5 Flash-Lite ist der sicherere Produktionsstandard: unabhängig 13 Punkte höher bewertet, multimodal, 1M-Kontext, nach gesicherter Messung fünfmal schneller und entsprechend bepreist. Kostenlos ist nicht billig, wenn das Modell dreimal so viel redet, um bei einer niedrigeren Leistungsgrenze zu denken — und das etablierte Modell ist aus gutem Grund die sichere Bank.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Sie betreiben eine Inferenz-Plattform? Bringen Sie Ihre Modelle auf OrcaRouter.

Kontaktieren Sie uns

Community beitreten

DiscordEmailXGitHubYouTube