
Qwen3.8-Flash-Next is uit: Alibaba levert de Qwen4-architectuur voordat Qwen4 bestaat
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens · 84 tok/s
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Qwen3.8-Flash-Next heeft eindelijk cijfers die Alibaba niet heeft geproduceerd — en ze zeggen niet wat de meest luidruchtige versie van het verhaal zegt. Op de Artificial Analysis Intelligence Index, herzien naar v4.3 op 7 september, scoort Alibaba's open-weight preview 40 en staat op de vijfde plaats van de 113 modellen in zijn vergelijkingsklasse. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — het model waarmee het steeds wordt vergeleken — scoort 35 en staat op de negende plaats. Dat is geen gelijkwaardigheid; het is een voorsprong van vijf punten voor het kleinere model. Het is ook het eerste brede, onafhankelijke scorebord dat een model bereikt waarvan de enige gepubliceerde cijfers tot deze maand die van de leverancier zelf waren. Het model zelf is niet nieuw: de gewichten gingen op 24 augustus live op Hugging Face en de formele ModelScope-release verscheen op 26 augustus. Wat deze maand is veranderd, is dat een lezer de claims nu kan controleren in plaats van ze zonder meer aan te nemen.
De aanleiding om deze post opnieuw te bekijken kwam van @teortaxesTex op X, die vroeg of de preview stilletjes te weinig hype krijgt: zogenaamd op hetzelfde Artificial Analysis-niveau als DeepSeek V4 Flash 0731, "bijna 4x kleiner," met "bijna 3x minder actieve parameters." Twee van die drie beweringen overleven het contact met de gepubliceerde data niet — en de correctie valt in het voordeel van het model uit, want op de cijfers die ertoe doen, loopt de preview voor op het model waarmee hij wordt vergeleken, in plaats van er gelijk mee te staan.
Begin met de grootte, waar de getallen eenduidig zijn. Qwen3.8-Flash-Next heeft ruwweg 180B parameters — een 125B mixture-of-experts-body, een aparte n-gram-embeddingtabel van 51B, en ongeveer 4B aan multi-token-prediction-lagen — en activeert 6B daarvan per token. DeepSeek V4 Flash 0731 heeft 284B en activeert 13B. Dat zijn de cijfers op Qwens modelkaart en in de documentatie van DeepSeek, en het zijn de cijfers die Artificial Analysis op beide modelpagina's vermeldt. De verhoudingen die ze opleveren zijn 1,6x op opgeslagen parameters en 2,2x op actieve parameters. Dat is een echt efficiëntieverhaal, en het is de reden dat deze architectuur ertoe doet — maar het is niet 4x en niet 3x. We konden nergens een gepubliceerd cijfer vinden dat de grotere vermenigvuldigingsfactoren ondersteunt. Als de bedoeling de geheugenvoetafdruk tijdens het serveren was in plaats van het aantal parameters, dan is dat cijfer ook niet gepubliceerd.
Wat werd er aangekondigd?
Alibaba publiceerde de Qwen4-architectuur voordat het een Qwen4-model publiceerde. Qwen3.8-Flash-Next — een open-weight, multimodaal mixture-of-experts-model gebouwd op de architectuur van de volgende generatie die de Qwen4-familie zal aandrijven — kwam in twee stappen uit: de officiële Qwen/Qwen3.8-Flash-Next-repository ging op 24 augustus live op Hugging Face, twee dagen voor de ModelScope-release waarnaar de teaser-timer had verwezen. De formele ModelScope-release verscheen op 26 augustus om 23:00 UTC+08:00, waarbij de geserveerde Qwen3.8-Flash-variant tegelijkertijd werd geprijsd. De belangrijkste claim op de modelkaart, die sindsdien de ronde doet, is dat een model dat 6B parameters per token activeert Claude Opus 4.6 Max verslaat op 8 van de 9 vergelijkbare benchmarks in Alibaba's eigen tabel. De volledige Qwen4-familie, blijft Alibaba zeggen, komt later.
Als je deze maand Alibaba's cadans niet hebt gevolgd, is Qwen3.8-Max het ijkpunt — het vlaggenschip met 2,4 biljoen parameters dat op 3 augustus werd uitgebracht en minder dan twee weken later open source werd gemaakt als Qwen3.8-2.4T-A95B. De gewichten van Qwen3.8-Flash-Next zijn minder dan een maand daarna beschikbaar. Hetzelfde lab dat een open-weightmodel met 2,4 biljoen parameters uitbracht, geeft nu de architectuur voor de generatie daarna weg, nog voordat het vlaggenschip van die generatie zelfs maar een naam heeft.

Het deel dat de moeite van het herlezen waard is, is Alibaba's eigen framing. Het model wordt beschreven als gebouwd op de architectuur van de volgende generatie "die de aanstaande Qwen4-familie zal aandrijven" — en expliciet niet als Qwen4 zelf. Alibaba's aangevoerde reden is dat de architectuurwijzigingen in handen van de community moeten zijn voordat de familie arriveert, zodat runtimes, kwantisaties en applicaties klaar zijn wanneer het echte product wordt uitgebracht. Dat is een marketingpositionering, maar het is ook een technische toezegging: eerst een preview geven van het moeilijke deel, de community meenemen.
Wat de modelkaart beslecht, en wat niet:
• Bevestigd, volgens de officiële modelkaart: Qwen3.8-Flash-Next is een open-gewicht, multimodaal en mixture-of-experts-model op de Qwen4-architectuur — de kaart noemt het "een experimentele preview van de architectuur die Qwen4 zal ondersteunen."
• Bevestigd, volgens de modelkaart en configuratie: twee belangrijke architectuurwijzigingen — Gated Delta Network (GDN) en Qwen Sparse Attention (QSA) — in een hybride van 48 lagen die 36 lineaire-aandachtslagen en 12 volledige-aandachtslagen bevat.
• Bevestigd vanuit de repository: 125B totale parameters met 6B geactiveerd per token (512 experts, 10 gerouteerde plus één gedeelde) — Artificial Analysis vermeldt 180B zodra de afzonderlijke 51B n-gram-embeddingtabel en de MTP-lagen worden meegeteld — met een native context van 262.144 tokens, uitbreidbaar tot 1.000.000 onder de Qwen Community License 1.0.
• Niet langer onbevestigd: het model is nu onafhankelijk gescoord, tweemaal. De tabel van Alibaba is nog steeds die van de leverancier zelf en nog steeds niet gereproduceerd, maar het is niet langer het enige bewijs in de kamer.
De eerste onafhankelijke scores zijn binnen — en ze zeggen "voor", niet "gelijk".
Artificial Analysis bracht op 7 september Intelligence Index v4.3 uit, en de herscoring is de reden dat dit überhaupt vergelijkbaar is. De v4.3-update verving Terminal-Bench v2.1 door het veel moeilijkere Terminal-Bench v4.0 en wisselde τ³-Banking in voor AutomationBench-AA, een agentische workflowbenchmark gebouwd met Zapier op een privé, achtergehouden testset van 657 taken. De weging van de privé-achtergehouden set steeg naar 45%. Het verklaarde doel was om te voorkomen dat de frontier de index zou manipuleren, en het effect op de scores was groot: GPT-6 Astra en Claude Fable 5.1, de twee koplopers, kwamen beide op 53 uit, nadat ze op de oude schaal in de zestig waren gescoord.
Dat is belangrijk als je de cijfers uit de community leest. De "56 versus 52"-cijfers die begin september circuleerden voor Qwen3.8-Flash-Next en DeepSeek V4 Flash 0731, werden berekend op de pre-v4.3-index; onder v4.3 staat het paar op 40 en 35. De ene set tegenover de andere stellen is twee verschillende examens met elkaar vergelijken.
Op de huidige index zie je hoe de twee modellen daadwerkelijk met elkaar te vergelijken zijn op basis van de eigen evaluaties van Artificial Analysis:
• Intelligence Index — Qwen3.8-Flash-Next 40 (5e van 113 in de klasse) vs DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 35 (9e van 113).
• Agentisch kenniswerk — AA-Briefcase 1587 vs 1259; GDPval-AA v2 1647 vs 1468; AutomationBench-AA 56% vs 54%.
• Terminal en programmeren — Terminal-Bench v4.0 25% vs 12%; SciCode 51% vs 50%.
• Algemene en wetenschappelijke redenering — Humanity's Last Exam 38% vs 39%; CritPt 11% vs 17%; GDP.pdf 16% vs 11%; AA-LCR v1.1 80% vs 80%.
• Feitelijke herinnering versus confabulatie — AA-Omniscience −10 vs −14, een voorsprong van vier punten voor de Qwen preview.
• Prijs — $0,15 per miljoen input / $0,47 per miljoen output vs. $0,44 / $1,32; gecombineerd $0,0882 per miljoen tokens vs. $0,2298. Kosten per Intelligence Index-taak: $0,37 vs. $0,22.
• Snelheid en latentie — 53 uitvoertokens per seconde vs. 210; tijd tot eerste token 2,80 s vs. 0,98 s; end-to-end respons 49,76 s vs. 12,88 s; tijd per taak 1.572,60 s vs. 221,65 s.
• Tokengebruik — 108k outputtokens per taak versus 62k, waarvan 72k redeneertokens versus 45k. Artificial Analysis noemt de preview "zeer uitgebreid" en "langzamer dan gemiddeld".
• Context en omvang — 256k tokens vs 1.000k; 180B totaal / 6B actief vs 284B / 13B.
Samen gelezen is dat een scherper antwoord dan "hetzelfde niveau." Qwen3.8-Flash-Next wint het pleidooi voor nauwkeurigheid en efficiëntie op bijna elke as die Artificial Analysis meet — het is het model met de hogere score, het is kleiner, en het kost ongeveer een derde zoveel per token. DeepSeek V4 Flash 0731 wint het productieargument met overmacht: vier keer de doorvoer, een kwart van de end-to-end latentie, zeven keer minder kloktijd per voltooide taak, en vier keer het contextvenster. En qua kosten per voltooide taak — het getal dat token-uitvoerigheid overleeft — DeepSeek is het goedkopere model met $0,22 tegen $0,37, ondanks de hogere adviesprijs. Als "underhyped" betekent "beter dan zijn reputatie qua kwaliteit per parameter", dan is het label terecht. Als het betekent "je zou dit in plaats daarvan moeten draaien", dan zeggen de snelheids- en latentiekolommen het tegendeel.

Er is ook onafhankelijk bewijs buiten Artificial Analysis. Een testharnas van een derde partij, smf-bench, publiceerde op 5 september een 'Official A'-run: Qwen3.8-Flash-Next in NVIDIA's NVFP4-kwantisatie op één enkele DGX Spark, met thinking uitgeschakeld, scoorde 137 van 157 (87,3%) met een foutloze 30 van 30 op de coding-sectie, tegenover 117 van 157 voor een DeepSeek V4 Flash Vision-Exp-run op twee Sparks op hetzelfde testharnas met 157 tests. Dat is één testharnas op één machineklasse, en het is geen vervanging voor een brede evaluatie — maar het is een tweede datapunt dat in dezelfde richting wijst, en het komt van iemand die geen belang heeft bij een van beide leveranciers.
Wat de Qwen4-architectuur eigenlijk is
Twee mechanismen schragen het verhaal. Het eerste, GDN — Gated Delta Network — is de linear-attentionlaag van Alibaba. Waar een standaardtransformer een key-valuecache bijhoudt die meegroeit met de sequentielengte, onderhoudt een GDN-laag een recurrente toestand met vaste grootte en werkt die bij met een aangeleerde gatingregel; de afstamming loopt via DeltaNet en Mamba-2. De winst is degene die de Qwen-lijn sinds Qwen3-Next stilletjes aandrijft: lange contexten blijven goedkoop omdat de toestand niet groeit, terwijl een minderheid van full-attentionlagen in de mix blijft om de precieze retrieval te doen waarin lineaire attention slecht is. In de huidige generatie ligt die verhouding op ongeveer drie GDN-lagen per full-attentionlaag — een communityanalyse van het Qwen3.8-2.4T-A95B-checkpoint telt 69 GDN-lagen tegenover 23 attentionlagen. Qwen3.8-Flash-Next vertoont dezelfde drie-tegen-één-verdeling: 36 linear-attentionlagen tegenover 12 full-attentionlagen.
Het tweede, QSA — Qwen Sparse Attention — is het werkelijk nieuwe onderdeel, en de publieke beschrijving ervan is nog steeds summier: de modelkaart voegt toe dat het op microblokniveau werkt met een budget van 512 blokken / 2048 tokens, maar er bestaat nog geen volledige technische uiteenzetting. Die schaarste aan details is zelf deel van het patroon. De preview van Qwen3-Next eind 2025 introduceerde Gated DeltaNet met dezelfde summiere documentatie, en de architectuur werd pas volledig gespecificeerd toen de Qwen3.5-serie die overnam. Voor een lezer is de praktische conclusie beide keren hetzelfde: de architectuur-kanarie verschijnt eerst, de documentatie en de productiemodellen verschijnen daarna.
Het draaiboek dat al eens werkte.
Alibaba heeft deze exacte zet eerder uitgevoerd, en het werkte. Eind 2025 gaf Qwen3-Next een voorproefje van Gated DeltaNet en een hybride van lineaire en volledige attention. Toen de Qwen3.5-serie uitkwam, werd die blauwdruk op schaal overgenomen — en de hybride is sindsdien doorgetrokken in de Qwen3.8-generatie, inclusief het 2,4T-topmodel. De reden dat het precedent hier van belang is, is de timing die het impliceert. De volledige Qwen4-familie moet aan de andere kant van deze preview worden verwacht, niet erbinnen; als de Qwen3-Next-kloof als leidraad geldt, wordt de afstand tussen "hier is de architectuur" en "hier is de familie" in maanden gemeten. Niets in de modelkaart bevestigt dat — het is een gevolgtrekking uit een patroon dat Alibaba inmiddels twee keer heeft uitgevoerd.
Wat we nog niet weten
De onbekenden zijn gekrompen, maar ze zijn niet verdwenen:
• De benchmarktabel van de leverancier is nog steeds die van de leverancier. Artificial Analysis heeft het model nu onafhankelijk gescoord, wat het grootste gat in de lanceerberichtgeving dicht — maar de eigen hoofdclaim van Alibaba, dat het model Claude Opus 4.6 Max verslaat op 8 van de 9 vergelijkbare benchmarks, berust op de eigen interne evaluaties van Alibaba (CoWorkBench, JobBench, AndroidWorld) naast publieke evaluaties, en geen daarvan is door een derde partij gereproduceerd.
• Of de preview hetzelfde model is als het via de service aangeboden model. De kaart positioneert Qwen3.8-Flash-Next als de experimentele open-weight preview, terwijl de productievariant die via de service wordt aangeboden — Qwen Cloud's Qwen3.8-Flash — een standaardcontext van 1.000.000 tokens en ingebouwde tools toevoegt. Of dat aangeboden model dezelfde architectuur is onder een groter contextvenster, wordt nog steeds niet vermeld, en de onafhankelijke scores hierboven zijn voor de open-weight preview, niet voor het via de API aangeboden model.
• De licentie is bekend en is een echte licentie: de Qwen Community License 1.0 staat commercieel gebruik toe, inclusief het verkopen van afgeleide werken, maar vereist een afzonderlijke commerciële overeenkomst met Alibaba als je een Model-as-a-Service- of AI-werkassistentbedrijf runt dat een bepaalde omzet- en maandelijks-actieve-gebruikersdrempel overschrijdt. Ze is niet hetzelfde als de op omzet gebaseerde Qwen3.8-Max-licentie, maar het is de moeite waard om ze te lezen voordat je op de gewichten voortbouwt.
• Eén praktijkrapport dat het vermelden waard is: een verslag van 6 september over een community-NVFP4-build registreert een fout bij grammatica-beperkte tool-calling wanneer zowel thinking als multi-tokenvoorspelling zijn ingeschakeld, herleid tot het constrained-decodingpad van xgrammar. Dat is eerder een runtimebug in een gekwantiseerde community-build dan een eigenschap van het model — maar als je evaluatieharnas steunt op grammatica-beperkte tool calls, is dat het eerste dat je moet testen.
Een familie die om de twee weken itereert
De cadans eromheen is een verhaal op zich. Qwen3.8-Max, het vlaggenschip met 2,4 biljoen parameters, uitgebracht op 3 augustus; de open-weight Qwen3.8-2.4T-A95B volgde op 12–13 augustus; de gratis Apache-2.0 Qwen3.8-27B verscheen enkele dagen later; en nu, nog voordat de maand voorbij is, wordt de architectuur van de volgende generatie gepresenteerd — en een week later onafhankelijk gebenchmarkt. Geen enkel ander lab itereert momenteel op dit ritme. Voor een lezer die modellen uitkiest, is de praktische consequentie dat "de beste Qwen" een beweeglijk doelwit is — en dat het verschil tussen generaties sneller komt dan het omringende ecosysteem doorgaans kan bijbenen. Een beslissing kopen in plaats van een model is in toenemende mate de verdedigbare zet.
Wat een ontwikkelaar nu moet doen
De efficiëntiecijfers veranderen de afweging voor lokaal serveren meer dan de lancering zelf deed. Een model met 6B actieve parameters dat 40 scoort op de huidige index is comprimeerbaar: NVIDIA's officiële NVFP4-quantisatie is degene die de smf-bench-run van 5 september gebruikte, en community-NVFP4- en FP8-builds daarnaast zijn al in omloop, en dat is precies wat een implementatie op single-GPU-niveau van een 180B-opgeslagen model überhaupt aannemelijk maakt. De kanttekening is onveranderd — dit is een onbewezen preview, de leverancierstabel is niet gereproduceerd, en de vorm van de onafhankelijke scores (sterk op kenniswerk en terminaltaken, zwakker op langetermijn-repo-generatie en one-shot agent-slaagpercentages) betekent dat de zwakke punten van het model precies opduiken waar productiecodewijzigingen plaatsvinden. Draai er een low-stakes kopie van een echte workload tegenaan voordat het iets aanraakt dat ertoe doet, en laat automatische failover de momenten opvangen waarop een preview zich misdraagt.
Wat de prijs betreft: het beeld dat bij de lancering nog troebel was, is nu concreet. Artificial Analysis noemt het serveertarief van de preview $0,15 per miljoen inputtokens en $0,47 per miljoen outputtokens, tegenover $0,44 en $1,32 voor DeepSeek V4 Flash 0731 — dezelfde orde van grootte als de geserveerde Qwen3.8-Flash-variant, die Qwen Cloud voor ¥1 en ¥3 noemt (ongeveer $0,16 en $0,47). De productievariant is degene die je vandaag daadwerkelijk kunt aanroepen: die wordt hier gerouteerd als qwen/qwen3.8-flash, en OrcaRouter geeft de lijstprijs van de leverancier door met 0% opslag, dus wanneer Alibaba dat bedrag aanpast, beweegt het endpoint dezelfde dag mee. Hetzelfde geldt voor het vergelijkingsmodel in dit artikel — DeepSeek V4 Flash 0731 wordt gerouteerd als deepseek/deepseek-v4-flash-0731 tegen de lijstprijs van de provider, waardoor het kosten-per-token-deel van de bovenstaande vergelijking testbaar wordt tegen je eigen verkeer in plaats van tegen de tokenaantallen van een benchmark. Wat hier niet wordt gerouteerd, is de open-weight Flash-Next-preview zelf: om hem vandaag te gebruiken, haal je de gewichten op en serveer je ze zelf, en dat is precies waarom het kwantisatieverhaal hierboven belangrijker is dan de lijstprijs. Het plafond dat deze generatie moet doorbreken, is nog steeds zichtbaar op hetzelfde endpoint: Qwen3.8-Max (qwen/qwen3.8-max) staat op $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens, ook doorgegeven tegen de lijstprijs van de leverancier.

De praktische volgorde is niet veel veranderd, maar het vertrouwen erachter wel. Als je de geserveerde productievariant wilt zonder 100 GB aan gewichten op te halen, is Qwen3.8-Flash al aanroepbaar tegen de lijstprijs. Als je de architectuur wilt — GDN, QSA, de n-gramtabel, de offload-trucs — zijn de gewichten downloadbaar en staan de runtimes klaar: vLLM serveert het vanaf dag één met een offload-pad dat de 51B-parameter n-gram-embeddingtabel in het hostgeheugen houdt in plaats van permanent in VRAM, SGLang en TensorRT-LLM staan in NVIDIA's Day 0-lijst, en Ollama's bibliotheek bevat een MLX-build die je op Apple Silicon kunt pullen. Het enige dat je moet stoppen met doen, is het model als een onbekende qua kwaliteit behandelen. Het is nu gemeten, en het kwam er goed uit.
Wat nu te kijken
• Of de onafhankelijke cijfers standhouden naarmate de index volwassener wordt. De 40 van Qwen3.8-Flash-Next gaat gepaard met een ongewoon hoge tokenrekening — het verbruikte 245M tokens tijdens de indexrun, tegenover een mediaan van 140M — en de eigen notitie van Artificial Analysis noemt het "zeer breedsprakig." Een score die tot stand komt door langer te redeneren, is nog steeds een score, maar het is het soort ding dat verschuift wanneer de evaluatie verandert. De volgende herziening van de index is de echte test of 40 een niveau was of een lokaal maximum.
• Of de aangeboden Qwen3.8-Flash apart wordt gescoord. Elk onafhankelijk cijfer in dit stuk is voor de open-weight preview. De productievariant met de 1M-context en ingebouwde tools heeft geen eigen onafhankelijke score, en als het dezelfde architectuur is onder een langere context, is dat een goedkope evaluatie die iemand zou moeten publiceren.
• Hoe de dag-0-servingondersteuning in de praktijk standhoudt — de door de leverancier opgegeven GB300-doorvoercijfers zijn nog steeds door de leverancier opgegeven, en de TP4-expert-parallel- en KV-offloadconfiguraties zijn nog nieuw genoeg om fragiel te zijn.
• Hoe lang Alibaba wacht voordat de volledige Qwen4-familie de preview volgt.
Het deel van dit verhaal dat we tot nu toe kennen, is nu grotendeels afgesloten. Het specificatieblad is openbaar, de gewichten zijn downloadbaar, de architectuur is bevestigd, de geserveerde Qwen3.8-Flash-variant is live op gehoste API's tegen listprijs, en het model is onafhankelijk beoordeeld door twee afzonderlijke partijen — waarbij het kleinere model het kwaliteitsargument won en het grotere het doorvoerargument. Wat nog open is, is of een 6B-actieve preview generaliseert voorbij de benchmarks waartegen hij is afgestemd, en hoe lang Alibaba wacht voordat de volledige Qwen4-familie volgt. Die laatste vraag is nog steeds de vraag die de release onbeantwoord laat, en het is nog steeds de vraag die het meest zal uitmaken.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
