Een gegenereerde hero-titelkaart met de tekst 'Gemini 3.1 Pro vs Qwen3.8-27B', met als ondertitel 'Een preview van zeven maanden versus een checkpoint dat je kunt downloaden', met twee kaarten: Gemini 3.1 Pro, in preview sinds 19 februari 2026, tegen $2,00 input en $12,00 output per 1 miljoen tokens en een Artificial Analysis Intelligence Index van 29,7, tegenover Qwen3.8-27B, open gewichten sinds 14 augustus 2026, tegen $0,50 input en $3,00 output per 1 miljoen tokens en een index van 33,7, met een VS-medaille tussen beide en het OrcaRouter-logo rechtsonder. Voettekst: 'Artificial Analysis Intelligence Index v4.3.2, vastgelegd op 2026-09-23; prijzen zijn de lijsttarieven van de provider.'
Guides & Insights

Gemini 3.1 Pro vs Qwen3.8-27B: een vooruitblik van zeven maanden vs een checkpoint die je kunt downloaden

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 18 september 2026 begonnen gebruikers op het eigen AI-ontwikkelaarsforum van de leverancier te melden dat Gemini 3.1 Pro was verdwenen uit de modelkiezer van AI Studio — betaalde accounts inbegrepen, ongeacht het wissen van de cache en incognitovensters. De thread waarin de leverancier werd gevraagd of het "een bug of opzettelijk" was, liep op 21 september nog steeds. Er is geen kennisgeving van stopzetting, geen migratiepad en geen reactie van medewerkers. Ondertussen kan Qwen3.8-27B, die het lab op 14 augustus onder Apache 2.0 open source heeft gemaakt, niemand die het heeft gedownload worden afgenomen. Die asymmetrie — niet de kloof in benchmarks, die reëel maar bescheiden is — is waar het in deze vergelijking werkelijk om draait, en daarom concurreren de twee modellen niet echt om dezelfde plek, ook al zetten de vergelijkingstabellen ze naast elkaar.

Wat volgt is de directe vergelijking op basis van de cijfers die er zijn, elk voorzien van een label: cijfers van Artificial Analysis uit vastleggingen van 23 september 2026, Alibaba's eigen modelkaart, Google's lanceringspost, en onze eigen routingtelemetrie, steeds apart gehouden. Waar niets is gemeten, zegt deze pagina dat in plaats van te gokken.

Wat er deze week is gebeurd, en wat het wel en niet betekent

De meldingen zijn specifiek en ze komen van het eigen forum van Google in plaats van de blog van een concurrent. Een thread met de titel "Gemini 3.1 Pro ontbreekt in AI Studio sinds 2026-09-18 — bug of opzettelijk?" beschrijft betalende gebruikers die het model kwijtraken zonder aankondiging, Google One-support die irrelevante probleemoplossingsstappen aanbiedt, en de Google-statuspagina waarop niets mis is te zien. Een tweede thread, "Gemini 3.1 Pro Preview-model niet beschikbaar in AI Studio om een app te bouwen", verzamelt dezelfde klacht, ook van een gebruiker wiens codeerassistent maandenlang op de preview was gebouwd en die zegt dat Flash 'rommel produceert' op hun codebase.

Drie eerlijke kanttekeningen. Het is een verdwijning uit de ontwikkelaarsconsole, geen bevestigde API-storing: Gemini 3.1 Pro staat nog steeds vermeld en is routeerbaar in onze eigen catalogus, waar het de afgelopen zeven dagen 94,7M tokens heeft verwerkt. Het is door gebruikers gemeld — Google heeft niets gezegd, dus niemand buiten Google kan "stille deprecatie" onderscheiden van "capaciteitsprobleem" en van "consolebug." En de timing is niet flatteus, aangezien dit model sinds 19 februari 2026 in preview is — zeven maanden, zonder gepubliceerde GA-datum, terwijl Google een reeks Flash-modellen eronder uitbracht. Apart hiervan heeft GitHub Copilot Gemini 3.1 Pro op 1 september 2026 met een opzegtermijn van 30 dagen buiten gebruik gesteld, wat een andere en ongerelateerde gebeurtenis is, maar het wijst dezelfde kant op: een preview-endpoint zonder GA-toezegging is een afhankelijkheid waarover je nerveus mag zijn.

Eén cijfer van onze kant is het waard om naast die context te zetten, want we kunnen het niet verklaren, en dat zeggen we liever ook. Onze zevendaagse telemetrie op de catalogusvermelding van Gemini 3.1 Pro toont een foutpercentage van 80,5%; de naburige modellen die we diezelfde ochtend hebben gecontroleerd — Qwen3.8-Max, Claude Fable 5.1 — zitten op 5,9% en 6,9%. We weten niet of dat hetzelfde probleem is dat het forum meldt, een slechte week voor één upstream-aanbieder, of een instrumentatie-artefact. Zie het als een reden om een canary te draaien voordat je je vastlegt, niet als een oordeel over het model.

Dezelfde meetlat, twee verschillende scores

Dit is het onderdeel waarop de meeste vergelijkingspagina's de fout ingaan, dus het loont om het zorgvuldig te doen. Artificial Analysis scoort beide modellen op Intelligence Index v4.3.2. We hebben beide pagina's op 23 september 2026 vastgelegd, en beide hebben dezelfde revisie — dus anders dan bij de meeste cross-modelindexclaims is dit dezelfde momentopname, en het verschil is reëel.

• Qwen3.8-27B (xhigh) — Intelligentie-index 33.7

Gemini 3.1 Pro Preview — Intelligentie-index 29,7

Qwen leidt met vier punten op de huidige meetlat. De moeilijkere vraag is wat dat betekent, want de meetlat zelf is dit jaar minstens drie keer verschoven. In februari publiceerde Artificial Analysis een artikel waarin Gemini 3.1 Pro Preview 'de nieuwe leider in AI' werd genoemd, vier punten voor op Claude Opus 4.6, en de berichtgeving in de pers van dat moment meldde een score van 57 op wat toen Index v4.0 was. Op v4.3.2 is dat 29,7. Artificial Analysis kondigde v4.3 aan op 7 september 2026, vier dagen na v4.2, en de herziening verving Terminal-Bench 2.1 door de veel moeilijkere Terminal-Bench 4.0 met 66 taken en verving τ³-Banking door AutomationBench-AA. De sterke punten van Gemini 3.1 Pro in februari lagen in evaluaties die de nieuwe index heeft geschrapt of anders gewogen. Dus: het model is niet slechter geworden, het examen wel. Maar als je vandaag een model kiest, is het getal van vandaag het enige waarop je echt kunt handelen, en het getal van vandaag valt in het voordeel van Qwen uit.

Waar de twee echt uiteenlopen

Geaggregeerde scores verbergen de vorm van het verschil, en de vorm is het nuttige deel. Elk cijfer hieronder komt uit dezelfde vastlegging van 23 september van de v4.3.2-pagina's van Artificial Analysis voor beide modellen, op dezelfde revisie.

• Redeneren en kennis — Gemini loopt duidelijk voorop. GPQA Diamond 94,1 vs 90,5; Humanity's Last Exam 47,0 vs 33,9; SciCode 58,7 vs 46,6; CritPt 17,7 vs 5,4.

• Beroepstaken uit de praktijk — Qwen leidt, en met een flinke voorsprong. GDPval genormaliseerd 45,4% vs 13,8%.

• Agentisch bankieren en transacties — Qwen leidt. τ-Banking 48,0 vs Gemini's 21,4.

• Agentisch toolgebruik op een algemene benchmark — Gemini leidt waar Qwen niet is gemeten. τ²-Bench 95,6 voor Gemini; er bestaat geen cijfer voor Qwen3.8-27B.

• Terminalwerk — dicht bij elkaar, en beide slecht op de nieuwe benchmark. Terminal-Bench 2.1: Qwen 79.8, Gemini 73.8. Terminal-Bench 4.0: Qwen 5.6%, Gemini 4.0% — beide eencijferig.

• Kalibratie — de scherpste divergentie op beide pagina's. Op AA-Omniscience scoort Gemini 31,9 met 54,9% nauwkeurigheid en een hallucinatiegraad van 50,9%; Qwen scoort −10,0 met 15,6% nauwkeurigheid en een hallucinatiegraad van 30,3%. Gemini weet meer en verzint het in meer dan de helft van de gevallen; Qwen weigert vaak te antwoorden en hallucineert bij ongeveer een derde van wat het wel beantwoordt.

• Lange context — volledig aan elkaar gewaagd bij long-context recall, 82,0 elk. Bij multimodale long-context recall: Qwen 21,7% vs Gemini 15,6%.

Lees de vermeldingen "niet gemeten" als wat ze zijn. Voor Gemini is er geen genormaliseerd GDPval-AA-cijfer gepubliceerd tegenover Qwens 45,4%, en Qwen heeft geen cijfer voor τ²-Bench, IFBench, Terminal-Bench Hard of ITBench-SRE tegenover Gemini's 77,1, 53,8 en 30,3. Elk van die lege plekken is een plek waar een overzichtstabel stilletjes een winnaar zou hebben geplant.

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

De divergentie die budgetten bepaalt: dezelfde kosten om de index te draaien

Qwen3.8-27B is dramatisch goedkoper per token. Volgens de marktcijfers die Artificial Analysis publiceert, is het $0,50 per miljoen input en $3,00 per miljoen output, met een cachekorting van 80% en een gemengd 7:2:1-tarief van $0,47. Gemini 3.1 Pro Preview is $2,00 en $12,00 — vier keer de inputprijs en vier keer de outputprijs — met een cachekorting van 90% en een gemengd tarief van $1,74.

Dan het getal dat niemand publiceert: de eigen boekhouding van Artificial Analysis stelt de kosten voor het draaien van de volledige Intelligence Index op $1.310,21 voor Gemini 3.1 Pro Preview en $1.335,92 voor Qwen3.8-27B. Qwen is niet goedkoper om te draaien. Het is heel iets duurder, omdat het er langer over doet om er te komen. Van Qwens outputrekening was $512,36 redeneertokens tegenover $82,51 aan daadwerkelijk antwoord; van die van Gemini was $691,82 redeneertokens tegenover $113,08 aan antwoord. De prijs per token is een tarief, geen rekening.

Nog twee prijsfeiten die vergelijkingstabellen weglaten. Ten eerste: de prijs van Gemini 3.1 Pro is getrapt naar de grootte van de invoer per aanvraag: $2,00/$12,00 tot 200K invoertokens, daarna $4,00/$18,00 daarboven, waarbij cache-reads verdubbelen van $0,20 naar $0,40. Het contextvenster van een miljoen tokens is echt, maar de laatste 800.000 tokens ervan kosten het dubbele. Ten tweede: onze eigen catalogusvermelding voor Qwen3.8-27B — geserveerd met block-FP8, vision tower op volledige precisie — vermeldt $0,40 invoer en $4,21 uitvoer, wat goedkoper is op invoer en duurder op uitvoer dan het marktcijfer hierboven, en publiceert helemaal geen tarief voor gecachte tokens. Verschillende aanbieders, verschillende verdeling. Controleer het tarief waartegen je daadwerkelijk wordt gefactureerd.

Beide modellen zijn bereikbaar via één OrcaRouter-sleutel tegen de listprijs van de provider met 0% opslag, dus een prijswijziging van een leverancier komt dezelfde dag nog aan onze kant terecht in plaats van pas na een herprijzingscyclus — wat meer dan anders van belang is wanneer een van de twee een staffelgrens op 200K tokens heeft.

Latentie: de snelste eerste token behoort toe aan het langzamere model

Dit is het meest misleidende paar getallen in de hele vergelijking, en het is precies het paar waarop een lezer het snelst de verkeerde conclusie zal baseren.

• Tijd tot eerste chunk — Qwen 4,04s vs Gemini 28,37s. Qwen lijkt zeven keer sneller.

• Tijd tot het daadwerkelijke antwoord — Gemini 28,37 s vs. Qwen 52,52 s. Gemini wint met ongeveer 1,8x, omdat Qwen 48,48 seconden nadenkt tussen de eerste chunk en de eerste antwoordtoken.

• Uitvoersnelheid — Gemini 116,5 tokens per seconde vs Qwen 41,3. Gemini is 2,8x sneller zodra het begint te schrijven, tegen een vergelijkingsmediaan die Artificial Analysis op 95,4 tokens per seconde stelt. Qwens eigen pagina noemt het "opvallend traag."

Als je product een eerste token naar een gebruiker streamt, is de headline-latentie van Qwen een leugen die je jezelf één keer zult vertellen. Als je product op een volledig antwoord wacht, is Gemini het snellere model. Beide cijfers zijn metingen van Artificial Analysis; beide zijn verkregen bij de xhigh-effortinstelling van Qwen, de standaardinstelling van de modelkaart.

Die standaardinstelling is een actuele klacht onder professionals, en de modelkaart geeft het half toe. Qwen3.8-27B stelt een reasoning_effort-parameter beschikbaar met drie niveaus — xhigh (de standaard, "voor complexe taken die grondige analyse vereisen"), medium, en low. Communityverslagen tot en met september melden dat xhigh zeer lange denkfasen oplevert en adviseren over te stappen op medium of low en het redeneerbudget te beperken. Alibaba's eigen kaart waarschuwt dat bij meerbeurts agentisch werk het verlagen van de inspanning "niet altijd de totale taakvoltooiingstijd verkort" — wat een openhartige uitspraak is voor een modelkaart en een waarschuwing dat de voor de hand liggende oplossing niet altijd de oplossing is.

Context: 1M vs 262K, en wat er daadwerkelijk in past

Gemini 3.1 Pro beschikt over een contextvenster van 1.000.000 tokens met een maximale uitvoer van 65.536 tokens. Qwen3.8-27B beschikt standaard over 262.144 tokens, uitbreidbaar tot 1.000.000 met YaRN-schaling, met daarbinnen aanbevolen afzonderlijke budgetten: redeneerinhoud tot 262.144 en een uiteindelijke respons tot 131.072.

Twee eerlijke voetnoten. De specificatietabel van Artificial Analysis vermeldt het venster van Qwen als 256.000, terwijl de eigen FAQ-tekst 260K zegt en de modelkaart 262.144 — dat zijn afrondingsverschillen op hetzelfde getal, maar citeer 262.144, want dat is wat de kaart zegt. En de uitbreiding naar 1M is een schaaltechniek, niet hetzelfde als een native venster van een miljoen tokens: long-context recall op 1M bij een met YaRN uitgebreid model is niet wat het AA-LCR-cijfer van 82,0 meet. Niemand heeft een recall-score voor een context van 1M gepubliceerd voor Qwen3.8-27B. Behandel het venster van Gemini als het venster met het gemeten gedrag op volledige lengte en dat van Qwen als het venster dat je zelf moet testen voordat je eromheen ontwerpt — en onthoud dat voorbij 200K invoertokens de prijs van Gemini verdubbelt.

Agentisch werk en het aanroepen van tools

Dit is waar de vergelijking echt onbeslist is, en waar een gefabriceerde winnaar gemakkelijk en verkeerd zou zijn. Qwen3.8-27B heeft gemeten agentische scores die Gemini mist, en omgekeerd.

De zaak van Qwen berust op een sterk onafhankelijk cijfer en een sterk leverancierscijfer. Het onafhankelijke cijfer is τ-Banking op 48,0 tegenover Gemini's 21,4 — meer dan het dubbele, op dezelfde revisie, op een benchmark over meerstaps-toolgebruik binnen een bankomgeving. Het leverancierscijfer is Alibaba's eigen kaart, die OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9, CoWorkBench 70,7, JobBench 33,4 en Agents' Last Exam 20,4 Pass@1 vermeldt. Dat zijn Alibaba's evaluaties, door niemand anders opnieuw uitgevoerd, en ze vallen precies in de categorieën waar de onafhankelijk gemeten GDPval-uitkomst (45,4% genormaliseerd vs 13,8%) dezelfde richting op wijst.

Wat voor Gemini pleit, is dat het de enige hoge absolute agentic-score in de vergelijking heeft — τ²-Bench 95,6 — en Qwen heeft helemaal geen τ²-Bench-score. Het heeft ook IFBench 77,1 voor het opvolgen van instructies, opnieuw een blanco op Qwens zijde. En het heeft een productiegeschiedenis van zeven maanden, die een vijf weken oude open-weights-release niet heeft.

De beslissende factor is geen score; het is je topologie. Qwens agentische voorsprong wordt gemeten aan de hand van benchmarks waarin het model opereert binnen een groot, reeds bestaand softwaresysteem dat het niet zelf heeft ontworpen. Die van Gemini wordt gemeten aan de hand van benchmarks waarin het model langdurig nauwkeurig instructies moet opvolgen. Dat zijn verschillende vaardigheden, en beide zijn reëel.

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

Coderen

Coderen valt op dezelfde manier uiteen, en daarom is er hier geen eenduidig antwoord op de vraag "welke beter is in code". Gemini leidt aan de wetenschappelijk-computationele kant — SciCode 58,7 tegen 46,6 — en zijn AA Coding Index van 68,8 op onze cataloguspagina ligt binnen een afrondingsfout van Qwens 68,1, ruim binnen elk betrouwbaarheidsinterval dat het vermelden waard is. Bij agentisch terminalwerk liggen de twee dicht bij elkaar op de oudere benchmark, Qwen 79,8 tegen Gemini 73,8 op Terminal-Bench 2.1, en zijn ze niet van elkaar te onderscheiden op de nieuwere, waar beide naar eencijferige percentages terugvallen.

De kaart van Alibaba claimt veel meer — SWE-bench Pro 61,7, LiveCodeBench v6 90,3, QwenSWEBench 79,0 — maar die zijn door de leverancier gerapporteerd, en de kaart vermeldt in een voetnoot dat SWE-bench Pro en QwenSWEBench zijn gedraaid in de Claude Code-harness, wat niet de harness is die voor het cijfer van een concurrent zou zijn gebruikt. De veilige bewering is dat op de enige coding-benchmark waarop de modellen van beide labs door een derde partij zijn gemeten, de twee vier punten uit elkaar liggen op Terminal-Bench 2.1 en 1,6 punten op Terminal-Bench 4.0, en dat beide het slecht doen op de moeilijkere.

Open weights versus een preview-endpoint

Dit is de as waarop de twee totaal niet vergelijkbaar zijn, en het is degene met de grootste praktische gevolgen.

Qwen3.8-27B is Apache 2.0, 27B dense parameters, 64 lagen, met een hybride van Gated DeltaNet lineaire attention en volledige attention in ongeveer een 3:1-verhouding — het ontwerp dat een 262K-venster betaalbaar maakt om te serveren. Het draait. Gekwantiseerd naar 4-bit past het in ongeveer 17GB, wat één consumenten-GPU is; er groeide binnen vijf weken een heel compressie-ecosysteem omheen, van Unsloth's Dynamic V3-quants, inclusief een 1-bit-build waarvan Unsloth zegt dat die in 8GB draait bij ongeveer 77% van de oorspronkelijke nauwkeurigheid, tot PrismML's Ternary Bonsai 2 27B medio september. Je kunt het fine-tunen, je kunt het auditen, en je kunt het op een laptop draaien met het netwerk losgekoppeld.

Gemini 3.1 Pro is een gesloten preview-endpoint, zeven maanden oud, zonder GA-datum, met een modelkaart die expliciet waarschuwt dat previews de stabiliteit, beschikbaarheid en ondersteuning van een stabiele release kunnen missen, en — sinds deze week — een developerconsole waaruit het ogenschijnlijk stilletjes is verdwenen. Je kunt het niet downloaden, je kunt geen versie vastzetten, en je kunt niet naar jezelf uitwijken.

Als je het eerlijke routeringsantwoord wilt in plaats van een oordeel: het bestaan van de open checkpoint is wat de Gemini-afhankelijkheid overleefbaar maakt. Zet Qwen3.8-27B achter een lokaal of self-hosted pad als fallback, houd Gemini 3.1 Pro op het primaire pad voor het redeneerintensieve werk waarin het meetbaar beter is, en zet beide achter één endpoint met automatische failover, zodat een stille verdwijning uit de console van iemand anders een incident is dat je routeringslaag absorbeert in plaats van een storing die je gebruikers zien. Dat is geen pitch voor een product — het is de enige configuratie waarin het nieuws van deze week je geen weekend kost.

Kies Gemini 3.1 Pro als

• Je moeilijkste werk is kennisintensief redeneren in plaats van langdurig gebruik van hulpmiddelen — het leidt op GPQA Diamond met 94,1 tegen 90,5, Humanity's Last Exam met 47,0 tegen 33,9, SciCode met 58,7 tegen 46,6 en CritPt met 17,7 tegen 5,4.

• Je hebt echt lange inputs nodig. Een gemeten venster van een miljoen tokens, met recallgedrag dat uitgebreid is getest, verslaat een met techniek uitgebreid venster van 262K — mits je kunt leven met de prijs die voorbij 200K inputtokens verdubbelt.

• De tijd tot een volledig antwoord is belangrijker dan de tijd tot het eerste token, en je wilt 116,5 tokens per seconde in plaats van 41,3.

• Je hebt vandaag brede multimodaliteit nodig: audio-, bestands-, afbeeldings-, tekst- en video-invoer tegenover Qwen's tekst-, afbeeldings- en videomodaliteiten.

• Je bent bereid het risico van een preview te accepteren, en je hebt een terugvaloptie waarover je zelf de controle hebt.

Kies Qwen3.8-27B als

• Uw agents opereren binnen grote bestaande systemen — τ-Banking van 48,0 naar 21,4 en GDPval genormaliseerd van 45,4% naar 13,8 zijn de twee grootste voordelen van één enkel model in deze hele vergelijking.

• Je hebt een antwoord nodig dat eerlijk is in plaats van zelfverzekerd. Een hallucinatiepercentage van 30,3% tegenover 50,9% van Gemini is een ander soort product.

• Licentievoorwaarden of dataresidentie sluiten een gesloten API uit, of je moet op je eigen data fine-tunen.

• Je wilt een factuur per token die een kwart bedraagt van die van Gemini, en je accepteert dat je het verschil uitgeeft aan denk-tokens — het kost hetzelfde om de index op beide te draaien.

• Je bent bereid om reasoning_effort terug te schroeven van zijn xhigh-standaard in plaats van deze ongewijzigd uit te rollen.

Wat we niet konden verifiëren

Voor de goede orde, en omdat een vergelijkingspagina slechts zo goed is als de lege plekken erin: er is geen onafhankelijke evaluatie gepubliceerd voor Qwen3.8-27B bij verminderde redeneerinspanning, dus de afweging tussen snelheid en kwaliteit bij gemiddelde en lage redeneerinspanning is niet gemeten. Er bestaat geen recallscore voor lange contexten voor de met YaRN uitgebreide 1M-configuratie. Gemini 3.1 Pro heeft geen gepubliceerde genormaliseerde GDPval-AA-score, en Qwen3.8-27B heeft die niet voor τ²-Bench, IFBench of ITBench-SRE. En niemand — ook Google niet — heeft gezegd waarom Gemini 3.1 Pro op 18 september uit de AI Studio-selector verdween. We zullen deze pagina bijwerken wanneer een van die dingen verandert.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt