
Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite: gratis is niet goedkoop, en de gevestigde partij blijft de veilige gok
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenNIEUWQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekNIEUWDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- qwenNIEUWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 586 tok/s
- orcaNIEUWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligentie42Coderen
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligentie39Coderen
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligentie72Coderen
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligentie52Coderen57Wiskunde
- z-aiZ.ai: GLM 5.22026-06-1653Intelligentie69Coderen60Wiskunde
"Free" is het duurste woord in de woordenschat van de modelmarkt, omdat het meestal betekent dat iemand je iets gaat berekenen anders dan de adviesprijs. Dat is de valkuil die schuilgaat in de vergelijking tussen Ling 3.0 Tiny, het nieuwe 7,9B-parameter MoE-redeneermodel van Ant Group InclusionAI, en Gemini 3.5 Flash-Lite, het goedkoopste en snelste huidige Gemini-niveau van Google. Ling 3.0 Tiny is nu gratis aan te roepen en kost $0,06 / $0,18 per miljoen tokens na de promotie van 14 augustus — maar Artificial Analysis mat dat het 210M output-tokens verbruikte om alleen al zijn klasse van 56 modellen te scoren, tegen een mediaan van 63M, en bestempelde het als "zeer breedsprakig." Gemini 3.5 Flash-Lite kost vijf keer zoveel per token, namelijk $0,30 / $2,50, maar heeft een onafhankelijke Intelligence Index van 36 — 13 punten boven Ling 3.0 Tiny — en een outputsnelheid van ongeveer 490 tokens per seconde. Het goedkopere prijskaartje, de snellere prater en de lagere score zijn allemaal hetzelfde model. Dat is het hele verhaal van deze vergelijking, en de hele reden om twee keer na te denken voordat je standaard voor de nieuwkomer kiest op basis van prijs alleen.
Beide modellen bevinden zich in de budgetcategorie, maar ze zitten in verschillende fasen van de levenscyclus. Gemini 3.5 Flash-Lite is de volwassen gevestigde speler: uitgebracht op 21 juli 2026, voortdurend opnieuw gemeten door een onafhankelijke partij, en breed ingezet als standaardcategorie voor grootschalig, latentiegevoelig agentisch werk. Ling 3.0 Tiny is een week oud, geprijsd om gebruikers te werven, en precies één keer gemeten. Dit artikel ontleedt wat elk model werkelijk is, wat de onafhankelijke cijfers zeggen, en waarom de "gratis"-prijs het minst bruikbare getal in de vergelijking is.
Ling 3.0 Tiny, de nieuwkomer met een meter
Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.
The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Gemini 3.5 Flash-Lite, de huidige
Gemini 3.5 Flash-Lite is Google's antwoord op dezelfde vraag, geleverd een niveau lager in de Gemini 3.5-lijn. Het is van nature multimodaal qua invoer — tekst, afbeeldingen, video, audio en bestanden — met tekstuitvoer, een contextvenster van 1M-tokens, tot 64K-uitvoertokens en configureerbare redeneerinspanning (minimaal, laag, hoger), zodat een pijplijn de diepte en de rekening per verzoek kan instellen. De onafhankelijke score is een echte generatiesprong: Artificial Analysis Intelligence Index 36, gerangschikt #12 van 151 gevolgde modellen, tegenover 25 voor Gemini 3.1 Flash-Lite. Op snelheid is het het snelste model in de 3.5-serie — Google noemde 350 uitvoertokens per seconde bij de lancering, en AA's live-pagina heeft ongeveer 490 tokens per seconde gemeten, gerangschikt #2 onder gevolgde modellen. De door de leverancier gerapporteerde agentische cijfers — 74,0% op OSWorld-Verified, 54% op Terminal-Bench 2.1, 72,2% op een 128K multi-needle-retrievaltest — zijn Google's eigen en richtinggevend in plaats van heilig, en één open vraag (computer-use vermeld als ingebouwd op Google's blog maar niet ondersteund in de API-documentatie) is het controleren waard voordat u erop vertrouwt.
Het is ook, per token, niet goedkoop voor zijn klasse. De naam "Lite" beschrijft de plaats van het model in de line-up, niet een dalend prijskaartje: Gemini 2.5 Flash-Lite was $0.10 / $0.40, 3.1 Flash-Lite was $0.25 / $1.50, en 3.5 Flash-Lite is $0.30 / $2.50 per miljoen tokens, met gecachete invoer voor $0.03. De efficiëntiewinst komt van snelheid en tokeneconomie, en de eigen metingen van Artificial Analysis laten zien dat de werkelijke kosten per taak ruwweg verdubbelden van generatie op generatie, terwijl de tijd per taak halveerde.
Het onafhankelijke scorebord, gelezen in context
Zet de twee modellen op dezelfde index en het verschil is groot: Gemini 3.5 Flash-Lite op 36, Ling 3.0 Tiny op 23. Maar die kopvergelijking is slechts de helft van het beeld, want de twee modellen worden niet tegen hetzelfde veld gescoord. AA plaatst Ling 3.0 Tiny op #6 van 56 in zijn tiny-modelklasse, tegen een klassenmediaan van 8 — ruim boven het gemiddelde voor een model van zijn grootte. Gemini 3.5 Flash-Lite staat op #12 van 151 in het bredere gevolgde veld. De ene is een uitzonderlijk klein model; de andere is een solide budgetmodel in de open pool. Beide uitspraken zijn waar, en ze betekenen verschillende dingen. Ling 3.0 Tiny is een betere waarde voor zijn grootteklasse dan Gemini 3.5 Flash-Lite voor zijn categorie — en Gemini 3.5 Flash-Lite is nog steeds het capabelere model met een ruime marge op dezelfde onafhankelijke schaal.

De afmetingen, één regel per stuk:
• Onafhankelijke score — Ling 3.0 Tiny AA Index 23 (#6/56, klassemediaan 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).
• Prijs — Ling 3.0 Tiny $0.06 / $0.18 per 1M na een gratis promotie vs Gemini 3.5 Flash-Lite $0.30 / $2.50 per 1M (gecachete invoer $0.03).
• Verbositeit — Ling 3.0 Tiny 210M outputtokens gedurende de indexrun versus Gemini 3.5 Flash-Lite gemeten maar niet verbose volgens die vlag.
• Modaliteit — Ling 3.0 Tiny uitsluitend tekst vs Gemini 3.5 Flash-Lite tekst-, beeld-, video-, audio- en bestandsinvoer.
• Context — 256K op Ling 3.0 Tiny versus 1M op Gemini 3.5 Flash-Lite, met maximaal 64K output op beide.
• Snelheid — Ling 3.0 Tiny ~90–264 tokens/s over de endpoints die een getal hebben gepubliceerd vs Gemini 3.5 Flash-Lite ~490 tokens/s op de live-meting van AA.
De snelheidsrij is de rij die het meest waarschijnlijk zal veranderen. De outputsnelheid van Ling 3.0 Tiny is echt nog niet vastgesteld: Artificial Analysis vermeldt het als N/A, terwijl Vercel 264 tokens per seconde opgeeft. De ~490 tokens per seconde van Gemini 3.5 Flash-Lite is een live AA-meting die ruim na het bedaren van de volatiliteit rond de lancering is gedaan. Voor een latentiegevoelige laag is dat het verschil tussen een bekend gegeven en een openstaande vraag.
De economie van breedsprakigheid: waarom gratis niet goedkoop is
Hier is de rekenkunde die deze vergelijking gewoonlijk beslist. Voer dezelfde redeneringsintensieve taak uit — zeg 4.000 invoertokens, 2.000 uitvoertokens — door beide modellen nadat Ling 3.0 Tiny's promotie eindigt. Ling 3.0 Tiny factureert (4.000 × $0,06 + 2.000 × $0,18) / 1.000.000, ongeveer $0,0006. Gemini 3.5 Flash-Lite factureert (4.000 × $0,30 + 2.000 × $2,50) / 1.000.000, ongeveer $0,0062. Bij identieke tokentellingen is Ling 3.0 Tiny 10x goedkoper. Voeg dan de breedsprakigheid toe: een redeneringsmodel dat denktokens als uitvoer produceert, levert geen identieke tokentellingen op. Als Ling 3.0 Tiny's verhouding van 210M tegenover 63M op uw workload van toepassing is, verdrievoudigt de effectieve kost per taak ongeveer aan de uitvoerzijde, en krimpt het 10x voordeel naar 3–4x. Nog steeds goedkoper — maar niet langer gratis, en niet in dezelfde klasse als het 210M-getal doet vermoeden.
De eerlijke benadering is dat de twee modellen geen substituten zijn op hetzelfde kwaliteitsniveau. De 23 van Ling 3.0 Tiny is een uitzonderlijke score voor een model met 1,3B actieve parameters; de 36 van Gemini 3.5 Flash-Lite is een heel ander kaliber, plus vision, plus 1M context, plus bewezen snelheid. Je betaalt voor die kloof — vijf keer de prijs per token, en meer per taak als je rekening houdt met snelheidsverschillen — maar het is een echte capaciteitskloof, geen marketingkloof. Als je workload kan rondkomen met de kwaliteit van het goedkopere model, is Ling 3.0 Tiny de betere waar voor je geld. Als je workload de capaciteit nodig heeft, kan geen prijsvoordeel de kloof dichten.
Waar een router zijn waarde bewijst
Dit is precies het type workload waarbij een routinglaag beter presteert dan een commitment aan één model, en de hosting-feiten doen ertoe voor hoe je het bouwt. Gemini 3.5 Flash-Lite is live op OrcaRouter tegen de lijstprijs van de provider — $0,30 in / $2,50 uit per 1M, doorgegeven met 0% opslag, zodat het tarief op de prijslijst van Google ook het onze is, en elke toekomstige prijsverlaging gaat dezelfde dag in. Het draait achter hetzelfde OpenAI-compatibele endpoint als 200+ andere modellen, met automatische failover tussen providers voor het geval een basisprovider halverwege een run verslechtert, en de routing-DSL kan een prompt naar meerdere modellen sturen en het beste antwoord bewaren.
Ling 3.0 Tiny draait niet op OrcaRouter; het wordt vandaag gratis via eigen endpoints aangeboden. Die combinatie maakt de routing-case juist sterker in plaats van zwakker. Gebruik de gratis periode om Ling 3.0 Tiny te benchmarken tegen je eigen verkeer voordat het geld gaat kosten. Bouw daarna het productiepad op de hosted tier — Gemini 3.5 Flash-Lite voor de calls die visie, lange context of een stabiel snelheidsprofiel nodig hebben, met de routinglaag die vrij is om op te schalen naar een duurder model voor de lastige minderheid. Een gratis tier is een geweldig experiment en een kwetsbare afhankelijkheid; de hosted tier is waar je een product op kunt bouwen. Op OrcaRouter kun je beide in dezelfde graph draaien — Ling 3.0 Tiny via een direct endpoint, Gemini 3.5 Flash-Lite via key — en de router per verzoek laten beslissen.

Vonnis
Als je tussen deze twee kiest en ze niet samen routeert, is de beslissing eenvoudig te verwoorden maar moeilijk te verkroppen. Ling 3.0 Tiny is de betere deal en het zwakkere model: een week oude, text-only redeneertier met een uitstekende score voor zijn omvang, een agressieve prijs en een onopgehelderd beeld qua snelheid en uitvoerigheid, een directe proefevaluatie waard en goed om te weten dat het op 14 augustus op verbruiksbasis gaat. Gemini 3.5 Flash-Lite is de veiligere productiestandaard: onafhankelijk 13 punten hoger scorend, multimodaal, 1M-context, vijf keer sneller volgens een definitieve meting, en dienovereenkomstig geprijsd. Gratis is niet goedkoop wanneer het model drie keer zoveel praat om na te denken met een lager capaciteitsplafond — en de gevestigde partij is niet voor niets de veilige gok.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
