
Perceptron Mk1.5 vs Gemma 4 12B: uno risponde in frasi, l'altro risponde in coordinate
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 610 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 189 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Ecco il numero che dovrebbe fermarti subito: Perceptron Mk1.5 è un modello costruito per video e agenti embodied, e la sua finestra di contesto è di 36.864 token. Gemma 4 12B è un generalista open-weights da 12B con una finestra di 256K. Sull'asse che la maggior parte delle persone usa per confrontare i modelli di visione — quanto filmato posso dargli — il modello più piccolo, chiuso e realizzato per uno scopo specifico perde di un fattore sette rispetto a quello scaricabile. Quell'inversione non è un difetto di nessuno dei due prodotti. Ti dice per cosa ciascuno è stato effettivamente costruito, e i due compiti sono più distanti di quanto suggerisca la voce condivisa "input multimodale" nelle loro schede tecniche.
Perceptron Mk1.5 è il modello di ragionamento incarnato che Perceptron ha rilasciato il 25 settembre 2026, successore di Perceptron Mk1 di maggio, che accetta in input testo, immagini, video e audio e restituisce testo più geometria interpretabile dalla macchina. Gemma 4 12B è il modello multimodale a pesi aperti senza encoder da 11,96 miliardi di parametri di Google DeepMind, rilasciato il 3 giugno 2026 sotto Apache 2.0, che accetta in input testo, immagini, audio e video e restituisce testo. Entrambi sono economici, entrambi leggono il flusso video di una telecamera, e solo uno dei due consegnerà al tuo controller un bounding box senza una seconda fase di parsing. La scelta tra i due è una scelta su ciò che deve tornare indietro.
Ciò che ciascuno è progettato per restituire
Metti i due fianco a fianco e la differenza non è la precisione. È il tipo di output. Chiedi a Gemma 4 12B dov'è il carrello elevatore e ottieni una frase, e nella maggior parte delle applicazioni quella frase è il prodotto — una descrizione, un riassunto, una risposta a una domanda su una foto. Chiedi a Perceptron Mk1.5 e, accanto alla sua prosa, puoi chiedere un punto, un bounding box, un poligono, una clip, o un <track>, elemento che porta con sé un'osservazione spaziale e il timestamp a cui appartiene. Una clip di 60 secondi viene restituita come una sequenza di posizioni nel tempo anziché come un'unica ipotesi mediata sulla scena.
Questo è l'intero argomento a favore dell'esistenza di Mk1.5, e vale la pena essere precisi sul perché sia importante. La descrizione di una scena è un artefatto compiuto. Una coordinata è un input per qualcos'altro: un pianificatore di presa, un controllo dei difetti, una traccia di audit con timestamp. Se il tuo codice a valle deve leggere prosa e inferire la posizione da essa, hai costruito un parser tra due modelli, e quel parser ora è la tua superficie di guasto. La proposta di Mk1.5 è che la geometria arrivi tipizzata.
La controargomentazione di Gemma 4 12B non è che faccia anche questo. È che puoi avere i pesi. Apache 2.0, 11,96 miliardi di parametri, pubblicati in varianti pre-addestrate e ottimizzate per le istruzioni, in esecuzione su hardware che controlli, con una scheda di valutazione pubblicata e un indice di terze parti a supporto. Sono tipi di risorse diversi, e nessuno dei due sostituisce l'altro.
Dove i due si allineano davvero
Meno luoghi di quanto lasci intendere l'etichetta "multimodal 2026", ma il terreno comune è reale e vale la pena affermarlo con precisione, proprio perché è il punto da cui di solito parte la checklist di un acquirente.
• Modalità di input — entrambi sono davvero a quattro modalità. Perceptron Mk1.5 accetta testo, immagini, video e audio (WAV, MP3, FLAC). Gemma 4 12B accetta testo, immagine, audio e video attraverso un unico percorso unificato senza encoder.
• Modalità di output — non genera audio né immagini. In entrambi i casi l'output è testuale. La differenza è che il testo di Mk1.5 può contenere annotazioni spaziali strutturate, mentre quello di Gemma 4 12B no.
• Chiamata di funzioni — entrambi la supportano. Mk1.5 espone la chiamata di funzioni nelle chat completions e accetta risposte vincolate tramite JSON Schema e regex. Gemma 4 12B include la chiamata di funzioni nella sua versione ottimizzata per le istruzioni e con modalità di pensiero configurabile.
• Controllo del ragionamento — Mk1.5 sostituisce il vecchio vision_config.enable_thinking booleano con un reasoning_effort campo che accetta high, medium, low, minimal o none, e il valore predefinito è high. Gemma 4 12B espone varianti con thinking e non-reasoning che ottengono punteggi diversi sullo stesso harness perché svolgono una quantità di lavoro diversa.
• Contesto — 36.864 token per Mk1.5 contro 256K per Gemma 4 12B. Questo è il divario più ampio della lista e la prossima sezione ne parla.
• Pesi e licenza — Mk1.5 è un modello ospitato chiuso con un SDK, non un download. Gemma 4 12B è Apache 2.0, quindi il prezzo dell'hosting è una delle varie opzioni, anziché l'unico modo per eseguirlo.

La finestra di 36K è una scelta progettuale, non una carenza
Un modello embodied con una finestra da 36.864 token sembra un errore, finché non si guarda ciò che Perceptron ha costruito accanto. Mk1.5 accetta un asset_idx, un campo, quindi una singola richiesta può fare riferimento a diverse immagini o video e indirizzarli separatamente. Limita l'audio a 16.384 token per elemento — secondo la documentazione di Perceptron si tratta di circa 21,8 minuti di parlato a circa 750 token al minuto. E il motivo per cui la finestra può restare piccola è che il compito è ristretto: trovare e tracciare elementi specifici nei fotogrammi, rispondere su di essi, fermarsi.
Quella è una forma di lavoro diversa da quella di Gemma 4 12B. Una finestra da 256K serve a contenere un documento, un repository o una lunga conversazione e a ragionare su tutto quanto. La finestra di Mk1.5 è un budget per un singolo compito di percezione con una risposta strutturata, e Perceptron l'ha dimensionata su quel compito anziché su una classifica. Il punto in cui la differenza si fa sentire è il momento in cui il tuo compito è "guarda tutto questo video di ispezione di 40 minuti e dimmi tutto": una finestra da 36K non può tenere insieme la trascrizione, i fotogrammi e la risposta, e la finestra di Gemma 4 12B più il suo punteggio di richiamo su contesto lungo è lo strumento onesto per farlo.
La seconda metà di quel compromesso è la velocità. Perceptron riporta prestazioni end-to-end fino a 4,7× più veloci, da una mediana di tre esecuzioni su una singola H100, con l'avvertenza che 4,7× è il migliore di tre misurazioni e non il caso tipico: le risposte in chat sono passate da 5,2 secondi a 1,1, il QA sulle immagini è passato da 1,7 secondi a 0,51 (circa 3,3×), e un video di 60 secondi con concorrenza a otto vie è passato da 19 secondi a 9,1 (circa 2,1×). Sul carico di lavoro video che un agente incarnato esegue realmente, il moltiplicatore onesto è all'incirca due.
Uno di questi è stato misurato da qualcun altro

Questa è l'asimmetria più netta del confronto e non c'è partita.
Gemma 4 12B dispone di una scheda di valutazione del fornitore e di un indice di terze parti. La scheda riporta cifre dichiarate dal fornitore — MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 senza strumenti 77,5, Tau2 in media su tre esecuzioni 69,0 — e un punto debole dichiarato con onestà in MRCR v2 8-needle a 128k, che si attesta a 43,4 ed è la riga da leggere prima di dare per scontato che una finestra da 256K si comporti come una all'estremità più lontana. A ciò si aggiunge una misurazione indipendente: Artificial Analysis colloca Gemma 4 12B a un Intelligence Index di 14, classificandolo 22º su 142 modelli della sua classe, a 113,7 token di output al secondo — 20º su 142 per velocità — con un prezzo di listino di $0,10 per input e $0,30 per output per milione di token.
Perceptron Mk1.5 non ha nulla del genere. Non esiste alcuna voce nell'indice Artificial Analysis né alcun punteggio di arena per Mk1.5 o per Mk1, quindi ogni dato di capacità che esiste per questo modello è stato prodotto dall'azienda che lo vende. Quel set è specifico anziché vago, e vale la pena leggerlo: 0.9433 su egocentrico hand_box contro 0.4467 di Gemini 3.1 Pro e 0.6179 del miglior Gemini nella stessa esecuzione di Perceptron; EgoSchema 80.40 contro 81.20 dello stesso concorrente, una perdita di 0.80 punti sul benchmark di comprensione ampia, con un presunto vantaggio del 12% sul sottoinsieme EgoSchema-hard a 63.75; 0.647 centre-F1 e 0.628 point-HOTA su Molmo2-Track; DailyOmni 74.67 e AVHBench 80.56 sul fronte audio. Lo schema che emerge da questi numeri — decisivo sulla geometria fine, più o meno in linea o leggermente indietro sulla comprensione video generale — è coerente e corrisponde alla storia del prodotto. Ma il benchmark di un fornitore sul proprio modello è un'affermazione, e i due modelli di cui si parla in questo articolo non vengono descritti con lo stesso tipo di prove.
Una riga in quella tabella merita un avvertimento specifico. Il confronto di tracking di Perceptron elenca Qwen3-VL-8B a 0,180 centre-F1, tratto dal paper di quel modello, accanto a numeri misurati per il proprio modello, e lo abbina a Qwen3.5-27B a 0,530 e 0,476 su checkpoint e configurazioni di valutazione diversi. Una cifra da paper in una colonna di cifre misurate non è una riga confrontabile a parità di condizioni, ed è il tipo di voce che viene citata senza la sua provenienza. La stessa cautela vale, al contrario, per i post 56,0 Mk1.5 su LiveVQA-W con strumenti abilitati — quella cifra proviene da un voto di maggioranza su quattro campioni, mentre il 53,2 con cui viene confrontata per Gemini 3.8 Flash con grounding di ricerca non lo è, e il voto di maggioranza su quattro campioni è una tecnica legittima che gonfia un punteggio rispetto a un singolo passaggio greedy.
Calcolo del costo di un carico di lavoro reale
I listini prezzi sono più vicini di quanto lo siano i prodotti. Perceptron Mk1.5 costa 0,15 $ per milione di token in input e 1,50 $ per milione in output, con l'input in cache a 0,0375 $ — esattamente un quarto della tariffa standard di input, e più economico per token in cache rispetto ai 0,10 $ di input standard di Gemma 4 12B. Gemma 4 12B è listato a 0,10 $ e 0,30 $ sull'harness di terze parti che lo misura, ed è Apache 2.0, quindi l'auto-hosting elimina del tutto il costo marginale se si dispone dell'hardware.
Due cose complicano un confronto diretto e puntano in direzioni opposte. Primo, il valore predefinito di Mk1.5 per reasoning_effort è high, il che significa che ogni chiamata che non configuri acquista il percorso di ragionamento più costoso offerto dal modello; passare a medium o low è una modifica di una riga con un effetto diretto sulla bolletta, ed è l'esperimento più economico della release. Secondo, Gemma 4 12B ti consente di disattivare completamente la fase di pensiero, il che cambia sia la bolletta sia la latenza, e su un compito fisso come la classificazione a livello di frame una passata senza ragionamento è spesso quella corretta.
Fai i calcoli su qualcosa di reale: una pipeline di visione che elabora 40.000 fotogrammi al giorno con circa mille token di input immagine ciascuno. Sono 40 milioni di token di input al giorno. Con la tariffa di input di $0,15 di Mk1.5, con i frame in cache dove la stessa scena si ripresenta, sei a poche unità di dollari al giorno per l'input — economico secondo qualsiasi standard. Gemma 4 12B a $0,10 di input è ancora più economico, e gratuito al margine se lo ospiti tu stesso. Nessuno dei due modelli è costoso. La decisione qui non è una decisione di budget; è una questione di se hai bisogno di coordinate, di una finestra da 256K, o di entrambe.
Chiamarli entrambi senza una seconda integrazione

L'ostacolo pratico all'esecuzione di questo confronto non è il prezzo — è che Perceptron Mk1.5 e Gemma 4 12B non sono nello stesso catalogo. Nessuno dei due è instradato su OrcaRouter oggi: le voci Gemma 4 che serviamo sono le varianti 31B Instruct e 26B-A4B, e Mk1.5 non ha alcuna rotta, quindi la guida onesta è raggiungere Mk1.5 tramite l'API del fornitore stesso su api.perceptron.inc — pip install "perceptron>=0.4.0", chiave in PERCEPTRON_API_KEY — e Gemma 4 12B o tramite un host di terze parti oppure servendo tu stesso i pesi Apache-2.0.
In questa situazione, ciò per cui un livello di routing è realmente pensato è la decisione che non hai ancora preso. Se l'output strutturato di Mk1.5 è ciò di cui ha bisogno la tua applicazione e la finestra di Gemma 4 12B è ciò di cui ha bisogno il tuo altro carico di lavoro, quelle sono due integrazioni e due domini di errore; metterli dietro un endpoint compatibile con OpenAI con failover automatico significa che un intoppo del provider da una parte o dall'altra si degrada in un fallback anziché in un job fallito, e una regola di routing può inviare il lavoro di geometria e il lavoro a contesto lungo a modelli diversi senza che la tua applicazione sappia quale sia quale. Quando un fornitore sposta il suo listino, un router pass-through fattura il prezzo di listino del provider con nulla aggiunto per token, così la modifica arriva lo stesso giorno anziché al tuo prossimo ciclo di fatturazione. Il DSL di routing è anche il modo in cui metteresti a punto un confronto — una quota di traffico reale a ciascun modello, misurata sui tuoi frame, invece di una discussione sui benchmark.
Quale vuoi davvero
Scegli Perceptron Mk1.5 se la risposta deve essere leggibile da una macchina. Se stai guidando qualcosa, o registrando qualcosa in cui posizione e tempo sono il punto, nessuna quantità di finestra di contesto extra può sostituire una coordinata digitata, e Mk1.5 è l'unico modello in questo abbinamento che ne produce una. Vai avanti con gli occhi aperti su tre cose: il budget di 36.864 token, l'impostazione high predefinita per il ragionamento, e il fatto che ogni numero di capacità a esso associato è del fornitore stesso.
Il modo più economico per risolverla è instradare una quota di traffico reale verso ciascuno e misurare sui tuoi frame; entrambi risiedono dietro un unico endpoint compatibile con OpenAI su OrcaRouter, ed è proprio questo che rende un test di confronto diretto una riga di configurazione anziché una seconda integrazione.
Scegli Gemma 4 12B se devi contenere molto materiale, se ti servono i pesi o se devi giustificare la scelta a qualcuno che non si fida ciecamente dei benchmark dei fornitori. Ha un indice indipendente, una scheda di valutazione pubblicata, licenza Apache 2.0 e una finestra sette volte più ampia — e descriverà una scena invece di misurarla. Quest'ultima clausola è l'intera decisione. Uno di questi modelli è un generalista che puoi possedere e verificare; l'altro è uno specialista che noleggi perché restituisce geometria, e il fatto che lo specialista abbia la finestra più piccola e nessun punteggio di terze parti non è una contraddizione. È l'aspetto che ha dall'esterno uno strumento costruito per uno scopo ristretto.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
