Gegenereerde redactionele hero-kaart met de titel "Ling-3.1-flash vs Gemini 3.8 Flash" en de ondertitel "Een gratis proefperiode van 256K tegen een productie-API van 1M tokens". Twee vergelijkingsrijen luiden "Ling-3.1-flash: gratis proefperiode van twee weken, context van 262.144 tokens, geen gewichten gepubliceerd" en "Gemini 3.8 Flash: $0,75 / $3,75 per 1M tokens, context van 1.048.576 tokens, multimodale invoer", boven een voettekst met "Ling-cijfers door de leverancier gerapporteerd; Gemini-cijfers volgens OrcaRouter en Artificial Analysis."
Guides & Insights

Ling-3.1-flash vs Gemini 3.8 Flash: een 256K-proefmodel tegenover een live model met 1M tokens

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Ling-3.1-flash en Gemini 3.8 Flash naast elkaar, en het verschil gaat niet over intelligentie — het gaat over status. Ling-3.1-flash, het mixture-of-expertsmodel van Ant Group met ~560 miljard parameters, aangekondigd op 29 en 30 september 2026, is een gratis proefperiode van twee weken met een geserveerd contextvenster van 256K, een uitvoerlimiet van 32.768 tokens, invoer met alleen tekst en geen gepubliceerde gewichten, licentie of prijs. Gemini 3.8 Flash, het Flash-tier reasoningmodel van Google dat op 2 september 2026 werd uitgebracht, is een algemeen beschikbare API met een volledig venster van 1.048.576 tokens, uitvoer van 65.536 tokens, multimodale invoer en een openbare tariefkaart. Op papier is dat een vergelijking van twee modellen; in de praktijk is het een vergelijking van een model waarop je vandaag kunt bouwen tegen een model dat je alleen deze maand kunt testen.

Dat is geen reden om Ling-3.1-flash af te schrijven. Een gratis 560B MoE met een agentische inslag is twee weken evaluatietijd van wie dan ook waard. Maar het verandert waarvoor een head-to-head dient: niet "op welke ik me moet standaardiseren", maar "is het proefmodel goed genoeg dat ik over vijftien dagen een slag om de arm moet houden ten aanzien van het antwoord." Dat zijn verschillende vragen, en ze hebben op elke as hieronder een ander antwoord.

De drie dingen die de doorslag geven voordat welke benchmark dan ook dat doet

De meeste vergelijkingen beginnen met scores. Deze zou moeten beginnen met beschikbaarheid, want het verschil daar is niet gradueel.

• Prijsstelling — Ling-3.1-flash is gratis voor de duur van de proefperiode en heeft helemaal geen gepubliceerde prijslijst na de proefperiode. Gemini 3.8 Flash staat voor $0,75 per miljoen inputtokens en $3,75 per miljoen outputtokens tijdens de promotieperiode, en gaat op 1 januari 2027 terug naar $1,50 / $7,50. Door leveranciers gerapporteerde lijstprijzen; beide kunnen wijzigen.

• Context — Ling-3.1-flash biedt 262.144 tokens in de proefversie, waarbij 1.000.000 wordt genoemd als het uiteindelijke doel. Gemini 3.8 Flash biedt vandaag de volledige 1.048.576 tokens. Als je werkbelasting afhankelijk is van het miljoen-tokenvenster, heeft slechts één van deze twee dat nu.

• Gewichten — Ling-3.1-flash heeft er geen gepubliceerd: geen repository, geen licentie, geen checkpoint, alleen een uitgesproken intentie om na de proefperiode open-source te gaan. Gemini 3.8 Flash is gesloten en zal dat altijd blijven, maar het is een beheerde API die je vandaag zonder ambiguïteit kunt aanroepen.

Samen gelezen maken die drie één punt: de belangrijkste voordelen van het Ling-model zijn ofwel promotioneel (gratis) ofwel toekomstgericht (1M-context, open gewichten), terwijl de voordelen van het Gemini-model contractueel zijn. Die asymmetrie loopt door alles wat volgt.

Waar het Ling-model echt wint

Twee plekken, en beide zijn echt.

Het eerste is de kosten tijdens de evaluatie. Een gratis proefperiode van twee weken voor een model van deze omvang is geen marketinggimmick om weg te wuiven — het is de goedkoopste manier om erachter te komen of een 560B mixture-of-experts je prompts aankan. Gemini 3.8 Flash, wat de prijs ook is, is niet gratis, en een serieuze evaluatie met een paar duizend calls kost echt geld.

Het tweede is het openheidstraject. Ling-3.1-flash is de opvolger van een model dat wel MIT-gelicenseerde gewichten uitbracht, en Ant heeft publiekelijk gezegd dat het van plan is deze ook open-source te maken. Als dat met een permissieve licentie gebeurt, krijg je iets wat Gemini 3.8 Flash nooit kan bieden: de optie om een 560B-basismodel zelf te hosten, fine-tunen of distilleren. Het addertje onder het gras is het belangrijkste: je wedt op een belofte, en de belofte van de vorige generatie werd nagekomen met een vertraging van twee weken, geen garantie.

Waar Gemini 3.8 Flash niet in de buurt van verliezen is

Haal het proces en de openheidskwestie weg en de operationele vergelijking helt scheef over in de richting van Google.

• Invoer — Gemini 3.8 Flash accepteert tekst, afbeelding, video, bestand en audio. Ling-3.1-flash accepteert tekst en retourneert tekst. Voor document-, screenshot- of videoworkflows is dit geen voorkeur, maar een capaciteitsgrens.

• Outputplafond — 65.536 tokens tegenover 32.768. Relevant zodra je rapporten, codebestanden of lange gestructureerde output in één keer genereert.

• Doorvoer — onafhankelijke tests schatten de mediane outputsnelheid van Gemini 3.8 Flash op bijna 249 tokens per seconde, terwijl OrcaRouter's eigen telemetrie over zeven dagen 552 tokens per seconde meet bij een p50 van 4,95 seconden tot het eerste token. De proefhosting van Ling-3.1-flash zou naar verluidt rond 63 tokens per seconde liggen. Het Gemini-model bevindt zich in een andere snelheidsklasse.

• Referentiediepte — Gemini 3.8 Flash heeft een geheel van onafhankelijke metingen achter zich; de cijfers van Ling-3.1-flash zijn allemaal first-party, op een gloednieuw endpoint, en nog geen enkele derde partij heeft ze opnieuw uitgevoerd.

• Multimodale agenten — alles wat een screenshot, een pdf of een opgenomen gesprek moet lezen, is per constructie een Gemini-taak, niet vanwege de kwaliteit.

Headless capture of the OrcaRouter model page for Gemini 3.8 Flash, model ID google/gemini-3.8-flash. It is marked FEATURED and credited to Google with a 2026-09-02 date, carries Vision, Audio, Tools, JSON and Reasoning capability chips, and describes the model as Google's most intelligent Flash model with significant gains over 3.7 Flash on software engineering, agentic tasks and multi-step reasoning. A stat strip reads input $0.75 and output $3.75 per 1M tokens, p50 time to first token 4.95 s, p95 10.00 s and 149.9M tokens of traffic over seven days; the pricing table lists $0.750 input, $3.75 output and $0.075 cache read per 1M tokens.

Benchmarks, en waarom de twee sets niet echt te vergelijken zijn

De door de leverancier gerapporteerde onderbouwing voor Ling-3.1-flash komt neer op een totaalscore van 81,0 over vijf benchmarks, met 40,4% op Terminal-Bench 4.0, 55,9% op Atlas en 65,35% op HealthBench; Ant zelf voegt daar 1.673 Elo op GDPVal-AA v2.1 en 75,16 op FrontierSWE aan toe. Elk van die cijfers is Ants eigen meting. Er is geen harness gepubliceerd en, belangrijker nog, geen gewichten waarmee iemand de suite opnieuw kan draaien.

Het beeld van Gemini 3.8 Flash is van een andere orde. In de huidige build (v4.3.2) van de Intelligence Index van Artificial Analysis scoort Gemini 3.8 Flash 40,9 bij hoge redeneerinspanning, 39,8 bij gemiddelde en 33,5 bij lage — en het is het vermelden waard dat de index onlangs is herzien, dus cijfers die eerder dit najaar over dit model zijn gepubliceerd, zijn berekend op een andere build en zijn niet direct vergelijkbaar met deze. De eigen claims van Google voor het model omvatten 54,9 op HLE-Verified en sterke Terminal-Bench 2.1-resultaten in de hoge 80. Onafhankelijke en leverancierscijfers, naast elkaar, beide legitiem, geen van beide onderling uitwisselbaar.

Er is één zuivere onderlinge vergelijking die de moeite waard is, omdat beide tot dezelfde benchmarkfamilie behoren. Op Terminal-Bench 4.0 is het door de leverancier opgegeven cijfer voor Ling-3.1-flash 40,4%. Claude Sonnet 5.5 — een middenklassemodel, geen vlaggenschip — scoort 70,6% op diezelfde versie. Die ene rij is het sterkste argument tegen het opvatten van Ants modelkaart als 'aan de frontier grenzend': het model is competitief op de agentische maatstaven die Ant uitkoos om te benadrukken en loopt duidelijk achter op de terminal-coding-maatstaf waarvoor een extern cijfer bestaat.

Generated two-column scoreboard titled "Ling-3.1-flash vs Gemini 3.8 Flash - the scoreboard". The Ling-3.1-flash column reads Context 262,144, Output 32,768, Input text only, Price free trial, Weights none, Speed ~63 tok/s. The Gemini 3.8 Flash column reads Context 1,048,576, Output 65,536, Input text, image, audio, Price $0.75 / $3.75, Weights closed, Speed 552 tok/s. A footer reads "Ling figures vendor-reported; Gemini figures per OrcaRouter and Artificial Analysis."

De praktische vorm van de keuze

Als je de komende twee weken iets moet bouwen, is het antwoord niet moeilijk, en het is geen kritiek op Ling-3.1-flash. Gemini 3.8 Flash is de enige van de twee die je een stabiel endpoint, een gepubliceerde prijs, een volledig venster van een miljoen tokens, multimodale invoer en een licentie die je kunt lezen biedt. Het is een productiemodel in de Flash-klasse.

Ling-3.1-flash is een evaluatiedoelwit. De waarde ervan op dit moment is dat de evaluatie gratis is en het model interessant is: een 560B MoE met slechts ~25B actief per token is een gok op sparsity, en Ant positioneerde het precies voor de agent-, zoek- en kantoorautomatiseringsworkloads waar Flash-tier-modellen om concurreren. Je eigen prompts er tijdens de proefperiode doorheen laten lopen is de moeite waard, precies omdat niemand buiten Ant het nog heeft gedaan — je zou een van de eersten zijn met een niet-leveranciersmening.

De beslissingsboom die deze maand logisch is: leid productie naar Gemini 3.8 Flash, gebruik de gratis proefperiode om Ling-3.1-flash te draaien tegen je moeilijkste prompts, en zie de open-weightkwestie als de echte splitsing. Als de gewichten permissief beschikbaar komen en de prijs in de buurt van de Flash-tier komt, wordt Ling-3.1-flash een echte tweede optie — een die je zelf kunt hosten, wat Gemini nooit zal zijn. Als er beperkende voorwaarden aan kleven, eindigt de proefperiode en daarmee ook de vergelijking.

Beide vanaf één sleutel laten draaien, en eerlijk zijn over wat er ontbreekt.

Gemini 3.8 Flash staat vandaag op de OrcaRouter-catalogus onder de model-ID google/gemini-3.8-flash, tegen Googles eigen adviesprijs zonder markup — dus wanneer het promotietarief in januari terugkeert naar het standaardtarief, volgt de prijs die je hier betaalt die automatisch, in plaats van dat er een nieuw contract nodig is. DeepSeek-V4.1-Flash, het andere goedkope Flash-tier-model dat de moeite waard is om in hetzelfde experiment te meten, staat in dezelfde catalogus tegen de adviesprijs van zijn provider, zodat een drieledige test van een proefmodel tegen gevestigde Flash-tier-opties achter één enkele API-sleutel loopt met automatische failover tussen hen.

Ling-3.1-flash staat niet in onze catalogus, en een opzoeking tegen onze publieke model-API levert not-found op voor zowel dit model als voor de vorige generatie — dus de eerlijke voorstelling van zaken is dat de proef draait waar die draait, via het eigen kanaal van de leverancier en inferentieplatforms van derden, en dat wij niet beweren het te hosten. Dat is het deel van deze vergelijking dat het snelst kan veranderen: een model in een gratis proefperiode met een niet-aangekondigde prijs is precies het soort ding dat op een routeringslaag belandt zodra Ant en zijn hosts een tariefkaart publiceren, en een doorrekening zonder opslag betekent dat op de dag dat dit gebeurt, de prijs hier de prijs daar is.

Dus het oordeel is nauwer dan de parameteraantallen suggereren. Ling-3.1-flash is het ambitieuzere model en het interessantere onderzoeksresultaat; Gemini 3.8 Flash is het model dat je kunt uitbrengen. Zolang er geen licentie en een prijs bestaan, is dat het hele verschil — en dat is niet iets wat een benchmarkrij zal beslechten.

Headless capture of the Artificial Analysis page for Gemini 3.8 Flash (High), marked "Released September 2026". Summary tiles read Intelligence 41 (rank 50 of 224), Speed 248.5 output tokens per second (rank 4 of 224), Cost $1.24 per Intelligence Index task at $0.75 input and $3.75 output per 1M tokens with a 90% cache discount (rank 62 of 224), and Verbosity 170M output tokens (rank 96 of 224). The comparison summary states the model is notably fast but very verbose, takes text, image, speech and video input, outputs text, and has a 1M-token context window, and the page names the current Artificial Analysis Intelligence Index build as v4.3.2.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt