
Perceptron Mk1.5 vs Qwen 3.8: Roboten behöver båda, och ingen av dem är en ersättare
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 610 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 189 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
En robot som måste plocka upp något behöver två saker från en modell, och ingen enskild modell i detta par ger dig båda. Perceptron Mk1.5 returnerar geometri: utifrån videobildrutor kan den lämna tillbaka en punkt, en box, en polygon eller ett tidsstämplat <track>-element, och dess kontextfönster är 36 864 tokens. Qwen 3.8 — namnet som avser leverantörens Qwen3.8-2.4T-A95B-kärna med öppna vikter — är en mixture-of-experts-resonerare med 2,4 biljoner parametrar och ett inbyggt 262K-fönster som sträcker sig mot en miljon, och den är endast textbaserad, så den kan inte titta på bildrutorna alls. Den ena är ett perceptionslager som kostar 0,15 $ och 1,50 $ per miljon token; den andra är en resonemangskärna som kostar ungefär tretton gånger så mycket för indata och fyra gånger så mycket för utdata, och har en oberoende poäng på 40 på Artificial Analysis Intelligence Index, medan perceptionsmodellen inte har någon oberoende poäng någonstans.
Ställs de sida vid sida som konkurrerande produkter förlorar de mot varandra i motsatta avseenden och jämförelsen ger inget användbart. Ställs de sida vid sida som de två halvorna av en och samma pipeline förklarar de nästan varje beslut om kostnad och tillförlitlighet i en förkroppsligad stack: var frames tolkas, var planen tas fram, och vad som händer med din räkning när resonemangshalvan skriver fler tokens än uppgiften behöver.
Uppdelningen som gör att den här kombinationen är vettig
Perceptron Mk1.5 släpptes den 25 september 2026 som efterträdaren till Perceptron Mk1, och dess uppgift är snävt definierad. Den tar emot text, bilder, video och ljud, och den returnerar text plus valfri strukturerad annotering – punkter, avgränsningsrutor, polygoner, klipp och spår. Utdata från <track> innehåller både en rumslig observation och tidsstämpeln den hör till, så ett 60-sekundersklipp kommer tillbaka som positioner över tid i stället för en enda medelvärdesgissning. Ett asset_idx-fält gör att en enskild begäran kan adressera flera bilder eller videor separat, vilket är precis vad en jämförelse mellan referensbildruta och livebildruta behöver. Begränsade svar finns i två varianter, JSON Schema och regex, och hela poängen med båda är att utdata är typad.
Qwen 3.8 är ett instrument av motsatt slag. 2,4T-kärnan är en finkornig MoE – 92 lager, 512 experter per lager med 10 routade plus en delad, och 69 av dessa 92 lager med linjär attention – vilket är hur en så stor arkitektur når sin långa kontext. Det den är stark på är att resonera över stora mängder text: komplex flerstegsanalys, långa härledningar, agentisk planering. På indatasidan är den däremot oförmögen. Den öppna kärnan är endast text, och dess resonemang kan inte stängas av: varje svar inleds med ett tankeblock, vare sig du ville det eller inte.
Det där är inte en brist hos en resonemangsmodell; det är en brist hos en perceptionsmodell, och Qwen 3.8 är inte en sådan. Sätter man de två i följd blir mönstret uppenbart – Mk1.5 svarar på "var är gaffeltrucken och när rörde den sig", Qwen 3.8 svarar på "givet det, vad bör armen göra". Ingen av frågorna kan besvaras av den andra modellen.

Vad varje halva kostar, enligt de taxor som faktiskt debiteras
• Indata — Perceptron Mk1.5 $0,15 per miljon tokens. Qwen 3.8 $2,00 per miljon på den hostade version som det oberoende testramverket mäter, med 88 % cacherabatt tillämpad, vilket ger en cacheträff på cirka $0,24.
• Utdata — Mk1.5 1,50 USD per miljon. Qwen 3.8 6,00 USD per miljon.
• Cache — Mk1.5:s cachade indata kostar $0,0375 per miljon, en fast fjärdedel av dess ordinarie indatapris. Qwen 3.8:s rabatt är procentbaserad men djupare, på 88 %, så dess cachade pris är det billigare av de två i absoluta tal och dess icke-cachade pris är mer än tio gånger Mk1.5:s.
• Kostnad per slutförd uppgift – det är här rangordningen vänds. Artificial Analysis anger Qwen 3.8:s kostnad per uppgift i Intelligence Index till 2,16 dollar, rankad 32:a av 115 i sin klass och betygsatt fyra av fyra enheter för kostnad – billig per slutförd uppgift trots dyra tokens, eftersom modellen genererade 170 miljoner output-tokens under indexkörningarna mot ett fält som svamlar ännu mer. Mk1.5 har ingen motsvarande siffra publicerad av någon.
• Kontext — 36 864 tokens för Mk1.5 mot en inbyggd 262K för Qwen-kärnan, utbyggbart mot en miljon med rätt serving-konfiguration.
• Resonemangskontroll — Mk1.5 exponerar reasoning_effort med high, medium, low, minimal eller none och standardvärdet är high. Qwen 3.8 har thinking alltid påslaget, så du betalar för thinking-tokens vid varje anrop.
Läs den listan två gånger, för de två modellerna byter plats när det gäller kostnad. Per token är Mk1.5 dramatiskt billigare. Per slutförd uppgift i ett oberoende benchmark mäts Qwen 3.8 som billig och Mk1.5 är ouppmätt. De två påståendena är bara motsägelsefulla om man antar att de utför samma jobb, och det gör de inte.

Bevisen pekar åt andra hållet här
I de flesta av den här batchens jämförelser är det sidan med öppna vikter som har en hög med siffror rapporterade av leverantören, och det slutna API:et den som har en tredjepartssida. Här är det omvänt, och omvändningen är värd att påpeka just för att den förändrar vad du kan och inte kan verifiera.
Qwen 3.8 har oberoende mätning. Artificial Analysis Intelligence Index placerar 2,4T-kärnan på 40, rankad som femma av 115 modeller i sin klass vid skrivandets stund, med en utdatahastighet på 39,6 tokens per sekund — 56:a av 115, vilket är i mittenfältet och värt att känna till innan någon planerar en interaktiv loop kring den. Indexrevideringar ändras mellan ögonblicksbilder och det ärligaste sättet att läsa någon av dessa siffror är som riktgivande, men poängen står fast: någon utanför Alibaba har kört den här modellen och publicerat en siffra.
Perceptron Mk1.5 har inget sådant. Det finns ingen Artificial Analysis-post och ingen arena-poäng för Mk1.5 eller dess föregångare, så varje kapacitetssiffra som existerar producerades av Perceptron om Perceptrons egen modell. Den uppsättningen är ovanligt specifik, vilket är en fördel för den — 0,9433 på egocentric hand_box mot 0,4467 för Gemini 3.1 Pro i leverantörens egen testkörning; EgoSchema 80,40 mot 81,20 för samma konkurrent, en knapp förlust på det breda förståelsebenchmarket jämte en påstådd 12 % fördel på den svårare EgoSchema-deluppsättningen på 63,75; 0,647 centre-F1 och 0,628 point-HOTA på Molmo2-Track — men att vara specifik och att vara oberoende verifierad är två skilda egenskaper, och bara den andra säger dig vad som kommer att hända med ditt videomaterial.
Två varningar vid läsning av Perceptrons tabell, och båda gäller varje citering av den. Siffran 56,0 för LiveVQA-W med verktyg aktiverade kommer från en majoritetsröstning över fyra stickprov, medan 53,2 som den ställs mot för Gemini 3.8 Flash med Google Search-groundning inte är en majoritetsröstning; tekniken är legitim och den förskönar en poäng i förhållande till en enda girig körning. Och tracking-raden listar Qwen3-VL-8B med 0,180 centre-F1 hämtat från den modellens artikel, i samma kolumn som uppmätta siffror för en annan checkpoint-familj. En siffra från en artikel i en uppmätt kolumn är inte en jämförbar rad, och det är precis den typ av rad som citeras utan sitt ursprung.
2.4T-kärnan är inte något du kan anropa från oss — men dess arkitektur är.

Det här är den del av jämförelsen där det ärliga svaret skiljer sig från vad modellens ryktbarhet antyder. Qwen 3.8 som namn används brett för att betyda den öppna kärnan, och den öppna kärnan är en nedladdning, inte en slutpunkt: 2,4 TB BF16-vikter under Alibabas anpassade Qwen3.8-Max-licens, publicerade i augusti 2026. Vi tillhandahåller den inte, och det finns ingen leverantör som tillhandahåller den på vår sida av staketet i dag – katalogposten finns som en aviserad, ännu inte tillgänglig spårningssida snarare än en aktiv rutt.
Det vi erbjuder är det flaggskepps-API som är byggt på samma 2,4T-arkitektur. Det är live som qwen/qwen3.8-max till $2,00 och $6,00 per miljon tokens – Alibabas egen taxa som förs rakt igenom utan något påslag per token – med det multimodala fönstret på 1M tokens (text-, bild- och videoinmatning) och samma hybrida attention-design som den öppna kärnan. Om din resonerande hälft behöver se något är det den vägen, och det är också den väg där en ändrad leverantörstaxa landar på vår sida samma dag i stället för vid din nästa faktureringscykel. Vid sidan av den erbjuder vi Alibabas täta syskonmodell qwen/qwen3.8-27b på vår egen infrastruktur till $0,33 och $2,40 per miljon, med ett fönster på 262 144 tokens och text-, bild- och videoinmatning, för de fall där en 27B-resonerare räcker och 2,4T:ans index på 40 är mer än uppgiften kräver.
Koppla samman de två halvorna utan ett andra kontrakt
Det praktiska skälet till att den här parkopplingen spelar större roll än benchmarkargumentet är att en förkroppsligad stack redan är två modeller, och integrationskostnaden för en tredje är det som tyst dödar designen. Mk1.5 finns inte i vår katalog, så för att nå den krävs leverantörens eget API — pip install "perceptron>=0.4.0", nyckel i PERCEPTRON_API_KEY, endpoint api.perceptron.inc. Qwen-halvan är bara en nyckel bort.
Där en gateway förtjänar sin plats är i skarven. En routingregel som skickar varje bildruta-med-en-fråga till perceptionsmodellen och varje textbaserad plan till resonemangsmodellen är en konfigurationsrad när båda ligger bakom en OpenAI-kompatibel endpoint, och automatisk failover innebär att en leverantörsincident på endera sidan degraderas till en fallback i stället för en robot som står stilla. Ett API som täcker över 200 modeller med listpriser som förs vidare utan påslag är också det billigaste sättet att svara på den fråga som den här artikeln inte kan: huruvida din objektspårningsuppgift överhuvudtaget behöver Mk1.5:s koordinater, eller om en allmän visionsmodell med ett mycket större fönster och en oberoende poäng hade räckt. Att routa en andel av den verkliga trafiken mellan kandidater och mäta på dina egna bildrutor kostar mindre än någon benchmarkstudie du skulle kunna beställa.
Vad ska man göra med det här, konkret?
Om du bygger in perception i ett fysiskt system är Perceptron Mk1.5 den enda modellen i detta par som svarar i koordinater, och det är en förmåga snarare än en poäng — testa hand-box-påståendet på din egen video, ställ in reasoning_effort medvetet i stället för att acceptera den höga standarden, och budgetera för 36 864-tokenfönstret som en hård begränsning snarare än en mjuk. Om du bygger resonemangslagret ovanpå det mäts Qwen 3.8 där Mk1.5 inte mäts, och dess kostnad per slutförd uppgift är siffran att planera efter snarare än rubriksiffran $2.00 — med förbehållet att dess tänkande inte kan stängas av, så en uppgift som inte behöver en tankekedja betalar för en ändå.
De team som gör fel här är de som försöker få en enda modell att göra båda. En perceptionsspecialist med 36 864 tokens kommer inte att rymma den operativa historiken, och en enbart textbaserad 2,4T-resonerare kommer aldrig att se bildrutan. Parkopplingen är inte en kompromiss mellan två produkter. Det är den faktiska arbetsfördelningen, och den användbara frågan är bara vilken sida av den var och en av dina anrop hör hemma på.
