
Perceptron Mk1.5 vs Qwen 3.8: De robot heeft ze beide nodig en geen van beide is een substituut
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 610 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 189 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Perceptron Mk1.5 levert geometrie: op basis van videoframes kan het een punt, een box, een polygoon of een <track>-element met tijdstempel teruggeven, en het contextvenster is 36.864 tokens. Qwen 3.8 — de naam die verwijst naar de open-weights Qwen3.8-2.4T-A95B-kern van de leverancier — is een mixture-of-experts-redeneermodel met 2,4 biljoen parameters en een native 262K-venster dat richting een miljoen gaat, en het is tekst-only, dus het kan helemaal niet naar de frames kijken. Het ene is een perceptielaag die $0,15 en $1,50 per miljoen tokens kost; het andere is een redeneerkern die ongeveer dertien keer zoveel kost voor input en vier keer zoveel voor output, en een onafhankelijke score van 40 heeft op de Artificial Analysis Intelligence Index, terwijl het perceptiemodel nergens een onafhankelijke score heeft.
Naast elkaar gezet als concurrerende producten verliezen ze van elkaar in tegengestelde richtingen en levert de vergelijking niets bruikbaars op. Naast elkaar gezet als de twee helften van één pijplijn verklaren ze vrijwel elke kosten- en betrouwbaarheidsbeslissing in een embodied stack: waar de frames worden geïnterpreteerd, waar het plan wordt gemaakt, en wat er met je rekening gebeurt wanneer de redenerende helft meer tokens schrijft dan de taak nodig heeft.
De splitsing die deze combinatie logisch maakt
Perceptron Mk1.5 werd op 25 september 2026 uitgebracht als de opvolger van Perceptron Mk1, en zijn taak is nauw omschreven. Het accepteert tekst, afbeeldingen, video en audio, en het retourneert tekst plus optionele gestructureerde annotatie — punten, begrenzingsvakken, polygonen, clips en tracks. De <track>-uitvoer bevat zowel een ruimtelijke observatie als de tijdstempel waartoe die behoort, zodat een clip van 60 seconden terugkomt als posities in de tijd in plaats van één gemiddelde schatting. Een asset_idx-veld laat één verzoek meerdere afbeeldingen of video's afzonderlijk aanspreken, wat precies is wat een vergelijking van referentieframe versus live-frame nodig heeft. Beperkte antwoorden komen in twee varianten, JSON Schema en regex, en het hele punt van beide is dat de uitvoer getypeerd is.
Qwen 3.8 is het tegenovergestelde soort instrument. De 2,4T-core is een fijnmazige MoE — 92 lagen, 512 experts per laag met 10 gerouteerde plus één gedeelde, en 69 van die 92 lagen met lineaire aandacht — wat verklaart hoe een architectuur van die omvang zijn lange context bereikt. Waar het sterk in is, is redeneren over veel tekst: complexe meerstapsanalyse, lange afleidingen, agentische planning. Waar het niet toe in staat is, is de invoerkant. De open kern is alleen tekst, en zijn redenering kan niet worden uitgeschakeld: elke reactie begint met een denkblok, of je dat nu wilde of niet.
Dat is geen tekortkoming van een redeneermodel; het is een tekortkoming van een perceptiemodel, en Qwen 3.8 is dat niet. Zet de twee achter elkaar en de vorm is duidelijk — Mk1.5 antwoordt "waar is de heftruck en wanneer is die verplaatst", Qwen 3.8 antwoordt "wat moet de arm met dat gegeven doen". Geen van beide vragen is door het andere model te beantwoorden.

Wat elke helft kost, tegen de tarieven die daadwerkelijk in rekening worden gebracht
• Invoer — Perceptron Mk1.5 $ 0,15 per miljoen tokens. Qwen 3.8 $ 2,00 per miljoen op de gehoste build die de onafhankelijke testomgeving meet, met een cachekorting van 88%, waardoor een cachehit op ongeveer $ 0,24 uitkomt.
• Uitvoer — Mk1.5 $1,50 per miljoen. Qwen 3.8 $6,00 per miljoen.
• Cache — De gecachte input van Mk1.5 kost $0,0375 per miljoen, een vast kwart van zijn standaard inputtarief. De korting van Qwen 3.8 is procentueel, maar groter, namelijk 88%, dus zijn gecachte tarief is in absolute termen het goedkoopste van de twee en zijn niet-gecachte tarief is meer dan tien keer dat van Mk1.5.
• Kosten per afgeronde taak — hier keert de rangschikking zich om. Artificial Analysis stelt de kosten per Intelligence Index-taak van Qwen 3.8 op $2,16; daarmee staat die op de 32e plaats van de 115 in zijn klasse en krijgt die voor kosten vier van de vier eenheden — goedkoop per afgeronde taak ondanks dure tokens, omdat het model 170M outputtokens genereerde tijdens de indexruns, tegenover een veld dat nog verder doorratelt. Voor Mk1.5 heeft niemand een vergelijkbaar cijfer gepubliceerd.
• Context — 36.864 tokens voor Mk1.5 tegenover een native 262K voor de Qwen-core, uitbreidbaar tot een miljoen met de juiste servingconfiguratie.
• Redeneerbeheer — Mk1.5 maakt reasoning_effort beschikbaar in hoog, gemiddeld, laag, minimaal of geen en standaard staat het op hoog. Qwen 3.8 houdt het denken ingeschakeld, dus je betaalt bij elke aanroep voor de denktokens.
Lees die lijst twee keer, want de twee modellen keren qua kosten om. Per token is Mk1.5 dramatisch goedkoper. Per afgeronde taak op een onafhankelijke benchmark wordt Qwen 3.8 als goedkoop gemeten en Mk1.5 als niet-gemeten. Die twee uitspraken zijn alleen tegenstrijdig als je aanneemt dat ze hetzelfde werk doen, en dat doen ze niet.

Het bewijs wijst hier de andere kant op
In de meeste vergelijkingen in deze batch heeft de open-weights-kant een stapel door leveranciers gerapporteerde cijfers, terwijl de gesloten API een pagina van een derde partij heeft. Hier is het omgekeerd, en die omkering is het vermelden waard, juist omdat ze verandert wat je wel en niet kunt verifiëren.
Qwen 3.8 heeft een onafhankelijke meting. De Artificial Analysis Intelligence Index plaatst de 2,4T-kern op 40, gerangschikt als 5e van de 115 modellen in zijn klasse op het moment van schrijven, met een outputsnelheid van 39,6 tokens per seconde — 56e van de 115, wat middenmoot is en de moeite waard om te weten voordat iemand een interactieve lus rond dit model plant. Indexherzieningen bewegen tussen snapshots en de eerlijke manier om al deze cijfers te lezen is als richtinggevend, maar het punt blijft: iemand buiten Alibaba heeft dit model gedraaid en een cijfer gepubliceerd.
Voor Perceptron Mk1.5 bestaat zoiets niet. Er is geen Artificial Analysis-vermelding en geen arena-score voor Mk1.5 of zijn voorganger, dus elk capaciteitscijfer dat bestaat, is door Perceptron geproduceerd en betreft Perceptrons eigen model. Die verzameling is ongewoon specifiek, wat in haar voordeel pleit — 0,9433 op egocentric hand_box tegenover 0,4467 voor Gemini 3.1 Pro in de eigen run van de leverancier; EgoSchema 80,40 tegenover 81,20 voor dezelfde concurrent, een nipte nederlaag op de brede begripsbenchmark naast een geclaimde voorsprong van 12% op de moeilijkere EgoSchema-subset met een score van 63,75; 0,647 centre-F1 en 0,628 point-HOTA op Molmo2-Track — maar specifiek en onafhankelijk geverifieerd zijn verschillende eigenschappen, en alleen de tweede vertelt je wat er met je beeldmateriaal zal gebeuren.
Twee waarschuwingen bij het lezen van de tabel van Perceptron, die beide van toepassing zijn op elke aanhaling ervan. De LiveVQA-W-waarde van 56,0 met ingeschakelde tools komt uit een meerderheidsstemming over vier samples, terwijl de 53,2 waartegen die wordt afgezet voor Gemini 3.8 Flash met Google Search-grounding geen meerderheidsstemming is; de techniek is legitiem en ze doet een score gunstiger uitvallen ten opzichte van één enkele greedy pass. En de tracking-rij vermeldt Qwen3-VL-8B met 0,180 centre-F1, overgenomen uit de paper van dat model, en staat in dezelfde kolom als gemeten getallen voor een andere checkpoint-familie. Een cijfer uit een paper in een kolom met metingen is geen gelijkwaardige rij, en het is precies het soort regel dat wordt geciteerd zonder de herkomst ervan.
De 2.4T-core is niet iets wat je bij ons kunt opvragen — maar de architectuur ervan wel.

Dit is het deel van de vergelijking waar het eerlijke antwoord afwijkt van wat de faam van het model suggereert. Qwen 3.8 wordt als naam breed gebruikt om de open core aan te duiden, en de open core is een download, geen endpoint: 2,4 TB aan BF16-gewichten onder de aangepaste Qwen3.8-Max-licentie van Alibaba, gepubliceerd in augustus 2026. Wij leveren het niet, en er is vandaag geen enkele provider die het aan onze kant van het hek aanbiedt — de catalogusvermelding bestaat als een aangekondigde, nog niet beschikbare trackingpagina in plaats van een live route.
Wat wij wél serveren is de vlaggenschip-API, gebouwd op dezelfde 2,4T-architectuur. Hij is live als qwen/qwen3.8-max voor $2,00 en $6,00 per miljoen tokens, Alibaba's eigen tarief een-op-een doorgegeven, met niets extra per token, met het multimodale venster van 1M tokens — tekst-, beeld- en video-invoer — en hetzelfde hybride attention-ontwerp als de open core. Als je reasoning-helft iets moet kunnen zien, is dat de route, en het is ook de route waar een tariefwijziging van de leverancier dezelfde dag nog aan onze kant landt in plaats van bij je volgende factuurcyclus. Daarnaast serveren we Alibaba's dense broertje qwen/qwen3.8-27b op onze eigen infrastructuur voor $0,33 en $2,40 per miljoen, met een venster van 262.144 tokens en tekst-, beeld- en video-invoer, voor de gevallen waarin een 27B-reasoner volstaat en de index van 40 van de 2,4T meer is dan de taak nodig heeft.
De twee helften aansluiten zonder een tweede contract
De praktische reden waarom deze combinatie meer uitmaakt dan het benchmarkargument, is dat een embodied stack al twee modellen is, en de integratiekosten van een derde zijn precies wat het ontwerp geruisloos om zeep helpt. Mk1.5 staat niet in onze catalogus, dus om er te komen moet je via de eigen API van de leverancier — pip install "perceptron>=0.4.0", sleutel in PERCEPTRON_API_KEY, endpoint api.perceptron.inc. De Qwen-helft is nog maar één sleutel verwijderd.
Waar een gateway zijn plek verdient, is op de naad. Een routeringsregel die elk frame-met-een-vraag naar het perceptiemodel stuurt en elk tekst-only plan naar het reasoningmodel, is een configuratieregel wanneer beide achter één OpenAI-compatibel endpoint zitten, en automatische failover betekent dat een storing bij een provider aan weerszijden degradeert tot een fallback in plaats van een stilstaande robot. Eén API die meer dan 200 modellen dekt, met lijstprijzen doorgegeven tegen 0% opslag, is ook de goedkoopste manier om de vraag te beantwoorden die dit artikel niet kan: of je object-trackingtaak Mk1.5's coördinaten überhaupt nodig heeft, of dat een algemeen visiemodel met een veel groter venster en een onafhankelijke score voldoende zou zijn geweest. Een deel van het echte verkeer tussen kandidaten routeren en meten op je eigen frames kost minder dan welke benchmarkstudie je ook zou kunnen uitbesteden.
Wat moet ik hiermee concreet doen?
Als je perceptie in een fysiek systeem inbouwt, is Perceptron Mk1.5 het enige model in deze combinatie dat in coördinaten antwoordt, en dat is een capaciteit in plaats van een score — test de hand-box-claim op je eigen video, stel reasoning_effort bewust in in plaats van de hoge standaardwaarde te accepteren, en begroot het venster van 36.864 tokens als een harde beperking in plaats van een zachte. Als je de redeneerlaag daarboven bouwt, wordt Qwen 3.8 gemeten waar Mk1.5 dat niet wordt, en de kosten per voltooide taak zijn het cijfer waartegen je moet plannen in plaats van het headline-cijfer van $2.00 — met de kanttekening dat het denken ervan niet kan worden uitgeschakeld, dus een taak die geen gedachteketen nodig heeft, betaalt er toch voor.
De teams die dit verkeerd doen, zijn degenen die proberen één model beide te laten doen. Een perceptiespecialist met 36.864 tokens kan de operationele geschiedenis niet bevatten, en een 2,4T-redeneerder voor alleen tekst zal het frame nooit zien. De koppeling is geen compromis tussen twee producten. Het is de werkelijke taakverdeling, en de nuttige vraag is alleen aan welke kant daarvan elk van je aanroepen thuishoort.
