
Perceptron Mk1.5 vs Qwen 3.8: Il robot ha bisogno di entrambi e nessuno dei due è un sostituto
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 610 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 189 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Un robot che deve raccogliere qualcosa ha bisogno di due cose da un modello, e nessun singolo modello in questo abbinamento te le dà entrambe. Perceptron Mk1.5 restituisce geometria: dati i fotogrammi video, può restituire un punto, un riquadro, un poligono o un elemento <track> con timestamp, e la sua finestra di contesto è di 36.864 token. Qwen 3.8 — il nome che corrisponde al nucleo a pesi aperti Qwen3.8-2.4T-A95B del fornitore — è un modello di ragionamento mixture-of-experts da 2,4 trilioni di parametri con una finestra nativa di 262K che si estende verso il milione, ed è solo testo, quindi non può guardare affatto i fotogrammi. Uno è un livello di percezione che costa $0,15 e $1,50 per milione di token; l'altro è un nucleo di ragionamento che costa circa tredici volte tanto in ingresso e quattro volte tanto in uscita, e ha un punteggio indipendente di 40 sull'Artificial Analysis Intelligence Index, mentre il modello di percezione non ha alcun punteggio indipendente da nessuna parte.
Messi fianco a fianco come prodotti concorrenti, si perdono a vicenda in direzioni opposte e il confronto non produce nulla di utilizzabile. Messi fianco a fianco come le due metà di un'unica pipeline, spiegano quasi ogni decisione su costi e affidabilità in uno stack embodied: dove vengono interpretati i frame, dove viene prodotto il piano, e cosa succede alla tua bolletta quando la metà che ragiona scrive più token di quanti ne richieda il compito.
La divisione che rende sensato questo abbinamento
Perceptron Mk1.5 è stato rilasciato il 25 settembre 2026 come successore di Perceptron Mk1, e il suo compito è definito in modo ristretto. Accetta testo, immagini, video e audio, e restituisce testo più un'annotazione strutturata opzionale — punti, bounding box, poligoni, clip e tracce. L'output <track> porta con sé sia un'osservazione spaziale sia il timestamp a cui appartiene, così una clip di 60 secondi viene restituita come posizioni nel tempo anziché come un'unica stima mediata. Un campo asset_idx permette a una singola richiesta di rivolgersi separatamente a più immagini o video, ed è ciò di cui ha bisogno un confronto tra frame di riferimento e frame live. Le risposte vincolate esistono in due varianti, JSON Schema e regex, e il punto centrale di entrambe è che l'output sia tipizzato.
Qwen 3.8 è il tipo opposto di strumento. Il core da 2,4T è un MoE a granularità fine — 92 livelli, 512 esperti per livello con 10 instradati più uno condiviso, e 69 di quei 92 livelli in attenzione lineare — ed è così che un'architettura di quelle dimensioni raggiunge il suo contesto lungo. Il suo punto di forza è il ragionamento su grandi quantità di testo: analisi complesse a più passaggi, lunghe derivazioni, pianificazione agentica. Il suo punto debole è invece il lato dell'input. Il core aperto è esclusivamente testuale, e il suo ragionamento non può essere disattivato: ogni risposta si apre con un blocco di pensiero, che tu lo voglia o no.
Non è una carenza di un modello di ragionamento; è una carenza di un modello di percezione, e Qwen 3.8 non lo è. Metti i due in sequenza e la forma è ovvia — Mk1.5 risponde a "dov'è il carrello elevatore e quando si è mosso", Qwen 3.8 risponde a "dato ciò, cosa dovrebbe fare il braccio". Nessuna delle due domande è rispondibile dall'altro modello.

Quanto costa ciascuna metà, alle tariffe che vengono effettivamente fatturate
Input — Perceptron Mk1.5 $0,15 per milione di token. Qwen 3.8 $2,00 per milione sulla build ospitata che l'harness indipendente misura, con uno sconto cache dell'88% applicato, il che porta un cache hit a circa $0,24.
• Output — Mk1.5 1,50 $ per milione. Qwen 3.8 6,00 $ per milione.
• Cache — L'input in cache di Mk1.5 è di $0,0375 per milione, un quarto esatto della sua tariffa standard di input. Lo sconto di Qwen 3.8 è basato su percentuale ma più profondo, all'88%, quindi la sua tariffa in cache è la più economica delle due in termini assoluti e la sua tariffa non in cache è più di dieci volte quella di Mk1.5.
• Costo per attività completata — è qui che la classifica si inverte. Artificial Analysis stima il costo per attività dell'Intelligence Index di Qwen 3.8 a 2,16 $, al 32º posto su 115 nella sua classe, con una valutazione di quattro unità su quattro per il costo — economico per attività completata nonostante i token costosi, perché il modello ha generato 170M token di output nelle esecuzioni dell'indice contro concorrenti che divagano ancora di più. Mk1.5 non ha una cifra equivalente pubblicata da nessuno.
• Contesto — 36.864 token per Mk1.5 rispetto a 262K nativi per il core Qwen, estensibile fino a un milione con la giusta configurazione di serving.
• Controllo del ragionamento — Mk1.5 espone reasoning_effort con i livelli high, medium, low, minimal o none e il valore predefinito è high. Qwen 3.8 mantiene il thinking sempre attivo, quindi paghi i token di ragionamento a ogni chiamata.
Leggi quella lista due volte, perché i due modelli si scambiano di posto quanto a costi. Per token, Mk1.5 è drasticamente più economico. Per attività completata su un benchmark indipendente, Qwen 3.8 risulta economico e Mk1.5 non è misurato. Queste due affermazioni sono contraddittorie solo se si presume che stiano eseguendo lo stesso lavoro, e non è così.

Qui le prove indicano il contrario.
Nella maggior parte dei confronti di questo batch, il lato open-weights è quello con una pila di numeri dichiarati dal fornitore, mentre l'API chiusa è quella con una pagina di terze parti. Qui è invertito, e vale la pena dirlo con precisione proprio perché cambia ciò che si può verificare e ciò che non si può.
Qwen 3.8 dispone di una misurazione indipendente. L'Artificial Analysis Intelligence Index colloca il core da 2,4T a 40, al 5° posto su 115 modelli della sua classe al momento della stesura, con una velocità di output di 39,6 token al secondo — 56° su 115, cioè a metà classifica, cosa che vale la pena sapere prima che qualcuno pianifichi un ciclo interattivo attorno ad esso. Le revisioni dell'indice cambiano da uno snapshot all'altro e il modo onesto di leggere una qualsiasi di queste cifre è considerarle indicative, ma il punto resta: qualcuno al di fuori di Alibaba ha eseguito questo modello e ha pubblicato un numero.
Perceptron Mk1.5 non ha nulla del genere. Non esiste una voce Artificial Analysis né un punteggio arena per Mk1.5 o il suo predecessore, quindi ogni cifra di capacità esistente è stata prodotta da Perceptron sul proprio modello. Quell'insieme è insolitamente specifico, il che è un punto a suo favore — 0,9433 su egocentric hand_box contro 0,4467 per Gemini 3.1 Pro nella esecuzione dello stesso fornitore; EgoSchema 80,40 contro 81,20 per lo stesso concorrente, una sconfitta di misura sul benchmark di comprensione generale insieme a un presunto vantaggio del 12% sul sottoinsieme EgoSchema più difficile a 63,75; 0,647 centre-F1 e 0,628 point-HOTA su Molmo2-Track — ma specifico e verificato in modo indipendente sono proprietà diverse, e solo la seconda ti dice cosa succederà sul tuo filmato.
Due avvertenze sulla lettura della tabella di Perceptron, entrambe valide per qualsiasi sua citazione. Il valore LiveVQA-W di 56.0 con gli strumenti abilitati proviene da un voto di maggioranza su quattro campioni, mentre il 53.2 a cui viene contrapposto per Gemini 3.8 Flash con grounding di Google Search non è un voto di maggioranza; la tecnica è legittima e favorisce un punteggio rispetto a una singola passata greedy. E la riga del tracking elenca Qwen3-VL-8B a 0.180 centre-F1, preso dal paper di quel modello, nella stessa colonna di numeri misurati per una famiglia di checkpoint diversa. Una cifra da paper in una colonna di valori misurati non è una riga confrontabile alla pari, ed è esattamente il tipo di riga che viene citata senza la sua provenienza.
Il core 2.4T non è qualcosa che puoi chiamare da noi — ma la sua architettura sì

Questa è la parte del confronto in cui la risposta onesta differisce da ciò che suggerisce la fama del modello. Qwen 3.8 come nome è ampiamente usato per indicare l'open core, e l'open core è un download, non un endpoint: 2,4 TB di pesi BF16 sotto la licenza personalizzata Qwen3.8-Max di Alibaba, pubblicati in agosto 2026. Noi non lo serviamo, e oggi non c'è alcun provider che lo serva dalla nostra parte della barricata — la voce di catalogo esiste come pagina di monitoraggio annunciata e non ancora disponibile, anziché come rotta attiva.
Quello che serviamo è l'API di punta costruita sulla stessa architettura 2.4T. È attiva come qwen/qwen3.8-max a $2,00 e $6,00 per milione di token, la tariffa di Alibaba stessa passata direttamente con nulla aggiunto per token, con la finestra multimodale da 1M di token — input testo, immagini e video — e lo stesso design di attenzione ibrida del core aperto. Se la tua metà ragionante ha bisogno di vedere qualcosa, quella è la strada, ed è anche la strada in cui un cambiamento di tariffa del fornitore arriva dalla nostra parte lo stesso giorno invece che al tuo prossimo ciclo di fatturazione. Accanto ad essa serviamo il gemello denso di Alibaba qwen/qwen3.8-27b sulla nostra infrastruttura a $0,33 e $2,40 per milione, con una finestra da 262.144 token e input testo, immagini e video, per i casi in cui un reasoner da 27B è sufficiente e l'indice 40 del 2.4T è più di quanto il compito richieda.
Collegare le due metà senza un secondo contratto
La ragione pratica per cui questo abbinamento conta più dell'argomento del benchmark è che uno stack incarnato è già due modelli, e il costo di integrazione di un terzo è ciò che uccide silenziosamente il design. Mk1.5 non è nel nostro catalogo, quindi raggiungerlo significa usare l'API del fornitore stesso — pip install "perceptron>=0.4.0", chiave in PERCEPTRON_API_KEY, endpoint api.perceptron.inc. La metà Qwen è a una chiave di distanza.
È nel punto di giunzione che un gateway si guadagna il suo posto. Una regola di routing che invia ogni frame-con-una-domanda al modello di percezione e ogni piano puramente testuale al modello di ragionamento è una riga di configurazione quando entrambi stanno dietro un unico endpoint compatibile con OpenAI, e il failover automatico fa sì che un incidente di un provider su uno dei due lati si trasformi in un fallback anziché in un robot bloccato. Una sola API che copre oltre 200 modelli, con i prezzi di listino passati al 0% di markup, è anche il modo più economico per rispondere alla domanda a cui questo articolo non può rispondere: se il vostro task di object tracking abbia davvero bisogno delle coordinate di Mk1.5, o se un modello di visione generale con una finestra molto più ampia e un punteggio indipendente sarebbe stato sufficiente. Instradare una quota di traffico reale tra i candidati e misurarla sui vostri frame costa meno di qualsiasi studio di benchmark potreste commissionare.
Cosa fare con questo, concretamente
Se stai integrando la percezione in un sistema fisico, Perceptron Mk1.5 è l'unico modello di questa coppia che risponde in coordinate, e questa è una capacità più che un punteggio — metti alla prova l'affermazione sulla hand-box sul tuo video, imposta reasoning_effort deliberatamente invece di accettare il valore predefinito alto, e considera la finestra di 36.864 token come un vincolo rigido anziché flessibile. Se stai costruendo il livello di ragionamento al di sopra di esso, Qwen 3.8 viene misurato là dove Mk1.5 non lo è, e il suo costo per attività completata è il dato su cui basare la pianificazione anziché il prezzo di copertina di $2,00 — con l'avvertenza che il suo pensiero non può essere disattivato, quindi un'attività che non richiede una catena di pensiero la paga comunque.
I team che sbagliano su questo sono quelli che cercano di far fare entrambe le cose a un solo modello. Uno specialista della percezione da 36.864 token non conserverà la cronologia operativa, e un motore di ragionamento solo testo da 2,4T non vedrà mai il fotogramma. L'abbinamento non è un compromesso tra due prodotti. È l'effettiva divisione del lavoro, e la domanda utile è solo da quale lato di essa ricada ciascuna delle vostre chiamate.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
