Gegenereerde redactionele hero-kaart met de titel "Ling-3.1-flash vs Qwen3.8-Flash" met de ondertitel "Twee antwoorden op dezelfde vraag: hoe bouw je een snelle tier?" Linkerpaneel met als kop "Opschalen en aankondigen" met het onderschrift "~560B totaal · ~25B actief · 1M context" en een tag met de tekst "weights: binnenkort beschikbaar". Rechterpaneel met als kop "Verkleinen en uitbrengen" bevat "125B totaal · 6B actief · previewt Qwen4" en een tag met de tekst "weights: op Hugging Face".
Engineering & Research

Ling-3.1-flash vs Qwen3.8-Flash: twee manieren om een snelle tier te bouwen, en slechts één ervan wordt uitgebracht

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee Chinese labs keken dit najaar naar hetzelfde probleem — hoe bouw je een goedkoop, snel model dat goed genoeg is om in een agent-loop te zitten — en kwamen tot tegenovergestelde antwoorden. Ling-3.1-flash, op 30 september 2026 aangekondigd door Ant Group, is een mixture-of-experts met ruwweg 560 miljard parameters die ongeveer 25 miljard parameters per token activeert, met een contextvenster dat naar verluidt tot 1 miljoen tokens bedraagt en de aangekondigde intentie om "binnenkort" open source te gaan. Qwen3.8-Flash, op 26 augustus 2026 uitgebracht door het Aliba​s Qwe​n-team, is een multimodale mixture-of-experts met 125 miljard parameters die ongeveer 6 miljard parameters per token activeert, met gewichten die al op Hugging Face staan onder de naam Qwen3.8-Flash-Next, een productiemodel dat live staat op de QwenCloud API voor $0,15 per miljoen inputtokens en $0,47 per miljoen outputtokens, en day-0-ondersteuning in SGLang. Het ene lab schaalde op en kondigde aan. Het andere schaalde terug en leverde uit. Dat verschil is leerzamer dan welke benchmark dan ook die een van beide labs publiceerde.

Het is ook de reden dat deze vergelijking zorgvuldig moet worden gelezen. Ling-3.1-flash heeft geen gewichten, geen licentie, geen modelkaart, geen API-prijs en geen onafhankelijke evaluatie; het volledige gepubliceerde materiaal bestaat uit een aankondigingsbericht, een benchmarkgrafiek van de leverancier en een plek in het eigen Ling Studio-product van Ant. Qwen3.8-Flash heeft dat allemaal wel, plus een voorsprong van vier weken doordat het al wordt gebruikt door mensen die niet bij Alibaba werken. Een architectuurkeuze vergelijken is eerlijk. Capaciteiten vergelijken is dat nog niet.

De twee ontwerpbeslissingen, en waarom ze uiteenlopen

De gok van Qwen is dat de snelle tier structureel anders moet zijn dan het vlaggenschip, en niet alleen kleiner. Qwen3.8-Flash activeert 6 miljard van zijn 125 miljard parameters — ongeveer 95% sparsity — en haalt zijn capaciteit uit waar de rekenkracht naartoe wordt geleid in plaats van uit ruwe breedte. Alibaba heeft expliciet aangegeven dat de onderliggende architectuur, die Gated DeltaNet combineert met Qwen Sparse Attention en een N-gram-embeddingtabel, een vroege preview is van de Qwen4-generatie, met opzet vroeg gepubliceerd zodat inferentie-engines, kwantisatie-tooling en deploymentpatronen zich eromheen kunnen ontwikkelen voordat de dure modellen er bovenop worden gebouwd. Het resultaat is een model dat per token goedkoop is door zijn constructie: ongeveer 6 miljard parameters aan werk per token, tegen een prijs die Alibaba heeft vastgesteld op $0,15 in en $0,47 uit per miljoen.

De inzet van Ant ligt, voor zover de aankondiging die onthult, dichter bij conventionele opschaling met een zeer lange context. Ling-3.1-flash behoudt een grote actieve fractie — ruwweg 25 miljard parameters per token van de 560 miljard, dus ongeveer één op tweeëntwintig — en noemt een venster van maximaal 1 miljoen tokens, vier keer zoveel als de vorige Ling-generatie biedt. De Ling Studio-app beschrijft het als gebouwd voor "algemene agents, zoeken, routinekantoorwerk en software-/codeontwikkeling", wat positionering in de snelle categorie is, maar de parametereconomie is die van een veel zwaarder model. Bij identieke input kost een token dat door 25 miljard actieve parameters gaat ongeveer vier keer zoveel rekenkracht als een token dat door 6 miljard gaat, voordat er ook maar een prijsbeslissing in beeld komt.

Geen van beide benaderingen is fout, en beide zijn verdedigbare antwoorden op de vraag "wat beperkt een goedkoop model". Qwen zet in op het idee dat sparsity en een nieuwe attention-stack het plafond vormen. Ant zet in op het idee dat het plafond context en wereldkennis is, en dat het zich het rekenvermogen kan veroorloven. Wat hen voor een lezer onderscheidt, is niet de ontwerpfilosofie maar de levering: een ontwerp dat je kunt downloaden en meten tegenover een ontwerp waarover je alleen kunt lezen.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

Wat elk ervan je kost, en wat dat in de praktijk betekent.

Het prijsverschil is niet subtiel en het is niet klein. Qwen3.8-Flash wordt gepubliceerd tegen $0,15 per miljoen inputtokens, $0,47 per miljoen output en $0,018 per miljoen voor cache-reads — dezelfde cijfers in de aankondiging van Alibaba, op de productiemodelkaart van de leverancier en op de gerouteerde modelpagina die wij aanbieden, wat is hoe een pass-through met 0% opslag eruitziet wanneer je die tegen drie bronnen controleert. Ant heeft helemaal geen tarief gepubliceerd voor Ling-3.1-flash — geen API-prijs, geen cachekorting, niets vergelijkbaars. Het enige gepubliceerde cijfer voor de Ling-lijn is dat van de vorige generatie, die wordt vermeld tegen $0,075 in en $0,22 uit per miljoen, ongeveer de helft van het inputtarief van Qwen en minder dan de helft van zijn outputtarief. Als de nieuwe Ling-tier in de buurt wordt geprijsd van waar de oude lag, zou die Qwen3.8-Flash op papier onderbieden; als de prijs ergens in de buurt komt van de compute die de 25B actieve parameters impliceren, zal dat niet gebeuren. Dat is hoe dan ook een gok, want het cijfer bestaat niet.

Context is waar de claim van Ling daadwerkelijk groter is. Ant noemt tot 1 miljoen tokens voor Ling-3.1-flash; Qwen3.8-Flash wordt geleverd met een standaardcontext van 1M tokens op de productie-API en een native venster van 262.144 tokens op de open weights, uitbreidbaar. Er kleven twee kanttekeningen aan het Ling-cijfer en geen van beide is opgelost. Ten eerste is 'tot 1M' een specificatie, geen meting — niemand heeft long-context retrievalgedrag gepubliceerd voor een model dat niemand buiten Ant kan aanroepen. Ten tweede had de vorige Ling-generatie precies dezelfde kloof tussen het geadverteerde venster en het architectuurverhaal erachter, en het antwoord kwam pas toen de gewichten, het formaat en de contextlimieten eindelijk werden gepubliceerd. De 1M in de kop is een belofte. De 1M op Qwen3.8-Flash is een geserveerde standaard waartegen je de claim van Ant kunt afzetten.

Waarom "preview" aan één kant hiervan het eerlijke woord is

Alibaba’s eigen framing van Qwen3.8-Flash is dat het een architectuurpreview is die onder een productienaam is uitgebracht — de open gewichten dragen het achtervoegsel “Next” juist zodat niemand het prototype verwart met het getunede serveermodel. Die framing is bevestigd door gebeurtenissen in plaats van door marketing: SGLang leverde op de releasedag day-0-ondersteuning voor Qwen3.8-Flash-Next, waarbij het model ook werd geconfigureerd voor Transformers, vLLM en TokenSpeed, en de gewichten zijn sindsdien opgepikt in kwantiseringsgemeenschappen. Versies werden al snel gewoon, wat is hoe een uitgebracht model eruitziet.

De aankondiging van Ant heeft dezelfde vorm, één stap eerder: een specificatie-publicatie voorafgaand aan de release, met de expliciete verklaring dat het model binnenkort open source zal worden gemaakt. Dit is een legitieme manier om te lanceren — Ling-3.0-flash volgde in juli exact dat pad, en de gewichten werden op 7 augustus onder MIT uitgebracht, ongeveer twee weken later. Maar de staat van de twee projecten vandaag is niet vergelijkbaar, en geen enkele hoeveelheid grafiekinterpretatie dicht de kloof. Het is de moeite waard om specifiek te zijn over wat een buitenstaander aan elk kan bijdragen.

Wat vandaag onafhankelijk controleerbaar is voor Ling-3.1-flash: dat de aankondiging bestaat en op 30 september is gedateerd; dat de cijfers voor parameters, actieve parameters en context van Ant zelf zijn; dat het model voorkomt in het Ling Studio-product van Ant; en dat er geen gewichten, licentie of modelkaart zijn gepubliceerd. Wat onafhankelijk controleerbaar is voor Qwen3.8-Flash: dat de gewichten downloadbaar zijn in BF16 en FP8; dat de licentievoorwaarden leesbaar zijn; dat de API-prijs is gepubliceerd; en dat Alibaba's benchmarkclaims sinds eind augustus openstaan voor reproductie. De tweede lijst is langer, en dat is de hele vergelijking in het klein.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

Hoe de twee daadwerkelijk zouden worden geëvalueerd

Ant publiceerde een benchmarkkaart met Ling-3.1-flash die het tegenover GPT-5.6 Sol, Claude Opus 5, Kimi K3, twee GLM-varianten en DeepSeek-V4.1-Flash plaatst, met kopcijfers van 1.673 Elo op GDPVal-AA v2.1, 75,16 op FrontierSWE en 65,35 op HealthBench Professional. Twee problemen kleven aan die kaart nog voordat iemand over de cijfers begint te discussiëren. Het eerste is de vergelijkingsset: beide frontiermodellen die Ant koos, lopen een generatie achter, aangezien Claude Opus 5.5 en GPT-6 Sol op 22 september 2026 live gingen en nu routeerbaar zijn, wat betekent dat de kaart een oktobermodel benchmarkt tegen de frontier van juli in plaats van de huidige. Het tweede is een voetnoot op de kaart zelf, die stelt dat het HealthBench Professional-resultaat uit de "AQ-omgeving" kwam en dat de zorgcapaciteiten van het model momenteel alleen in AQ kunnen worden ervaren — een omgeving die geen enkele openbare documentatie definieert. Een kopscore waarvan de evaluatieomgeving niet wordt genoemd, is zelfs in principe niet reproduceerbaar.

De vergelijkbare claims van Qwen3.8-Flash daarentegen werden gemaakt toen de gewichten al beschikbaar waren, en Alibaba zette zijn positionering in op een claim die iedereen kan testen: dat de sparsityratio, en niet het aantal parameters, bepaalt waar de capaciteit vandaan komt. Vier weken gebruik is geen eindoordeel, maar het is lang genoeg dat de claims niet meer onbetwist zijn — wat de nuttige toestand is voor een model.

Wat je hier eigenlijk mee moet doen, vandaag

Voor ontwikkelaars is de praktische tweedeling eenvoudig. Ling-3.1-flash is geen component die je deze week kunt inzetten: er is geen endpoint om aan te roepen, geen gewichten om te hosten, geen licentie om te controleren en geen prijs waarop je kunt budgetteren. Wat het uiteindelijke model ook blijkt te zijn, de nuttige stap nu is om een trigger in te stellen — gewichten gepubliceerd, een permissieve licentie, een onafhankelijke score op FrontierSWE die ergens in de buurt van 75,16 komt — en er later op terug te komen. De eigen geschiedenis van de vorige generatie laat zien dat de gewichten twee weken na de aankondiging kunnen arriveren, dus die trigger kan snel afgaan.

Qwen3.8-Flash is al een component. Het is beschikbaar in onze catalogus als een gerouteerd model tegen de lijstprijs van de provider, zonder markup — de gerouteerde kaart vermeldt $0,15 in, $0,47 out en $0,018 per miljoen cache-reads, dezelfde cijfers die Alibaba publiceert, wat een 0%-markupbeleid in de praktijk betekent in plaats van op een slide. Achter één key staat het naast Claude Opus 5, GPT-5.6 Sol en DeepSeek-V4.1-Flash, zodat de vergelijking waartoe Ant uitnodigt — een kandidaat tegen de huidige frontier — kan worden uitgevoerd door een configuratie naar twee routes te laten wijzen in plaats van twee integraties te onderhouden, terwijl automatische failover het weekend opvangt waarin een provider hapert. Dat is het verschil tussen een architectuurdiscussie en een experiment.

Het oordeel, voor zover dat te geven valt: Qwen waagde de stoutmoedigere architectonische gok en had het vertrouwen om die vroeg te publiceren en mensen ermee aan de haal te laten gaan. Ant waagde de zwaardere gok — meer parameters, meer actieve rekenkracht per token, meer context — en heeft tot nu toe een grafiek gepubliceerd in plaats van een model. De grafiek ziet er goed uit. De grafiek is ook het enige dat iemand heeft.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt