Una scheda del titolo generata per il confronto Laya-versus-von, che riporta il sottotitolo di questo articolo e una riga a piè di pagina che indica quali cifre di quale parte sono dichiarate dal fornitore e quali sono di terze parti.
Engineering & Research

Laya vs von: Quando il benchmark del fornitore non si trasferisce

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Un compito di classificazione del tipo di commit con sei possibili etichette, in cui tirare a indovinare ti fa ottenere l'8,3% e von ottiene il 26,7%. Un compito di instradamento dei file in cui lo stesso modello ottiene l'8,8%, appena al di sopra del caso. Un compito binario di ampiezza delle modifiche con un AUC di 0,513, che equivale a lanciare una moneta. Quei numeri provengono da una valutazione di terze parti di von — il modello open source System One di wfzyx, un encoder ModernBERT-Large da 395M rilasciato con licenza Apache 2.0 il 18 settembre 2026, lo stesso giorno di Laya di Convai Innovations. Sul benchmark jabr v2 di von il quadro è l'opposto: 71,5% di accuratezza macro su 49 compiti e 869 casi, instradamento delle scelte all'83,4% e un risultato ViZDoom di 9,38 uccisioni medie a meno di 18 ms contro Jev di TypeSafe AI a 5,62 uccisioni e circa 115 ms. Entrambe le serie di numeri sono reali. La distanza tra loro è la cosa più utile che chiunque abbia pubblicato su questa categoria di modelli, e vale anche per Laya.

Due modelli, due backbone, una modalità di fallimento condivisa

von e Laya sono architettonicamente quasi vicini, ed è per questo che il problema del trasferimento è la lente giusta per confrontarli. Entrambi sono encoder non autoregressivi basati su ModernBERT: von con 395M parametri, il checkpoint inglese di Laya con 421M. Entrambi espongono le stesse tre primitive — scelta da un elenco fornito, punteggio su una rubrica ordinata, noul come probabilità calibrata di sì — ed entrambi implementano il /v1/systemone formato wire, così un client scritto per Jev di TypeSafe può puntare invece a un server locale. Entrambi sono Apache 2.0. Entrambi restituiscono probabilità anziché testo, e nessuno dei due ha un ciclo di decodifica in cui allucinare.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

Le differenze stanno nella storia di addestramento. von è stato preaddestrato su 2 trilioni di token di testo web generico, letteratura tecnica e codice, poi sottoposto a fine-tuning su un corpus bilanciato multi-dominio di circa 290.000 esempi che copre flussi di lavoro operativi e aziendali, sicurezza informatica e DevOps, sicurezza e moderazione delle policy, linguistica, triage e ragionamento avversariale. Il post-addestramento ha utilizzato Reinforcement Learning with Calibration Distribution, minimizzando un composito di entropia incrociata e Brier score con lambda a 0,5, e il temperature scaling è convergito a T=1,1692. Il checkpoint inglese di Laya è ModernBERT-large sottoposto a fine-tuning per la forma di decisione tipizzata, con una finestra di 512 token, insieme a un checkpoint multilingue mmBERT-base da 322M che copre oltre 100 lingue dietro un router, e un p50 pubblicato di 32,8 ms per decisione su una Tesla T4.

La modalità di errore condivisa è che entrambi sono encoder addestrati a produrre un output, non ragionatori. Il README di von è esplicito: è pensato per pipeline sensibili alla latenza, dove i modelli autoregressivi introducono ritardi di 500–2.000 ms ed errori non deterministici di parsing dello schema. Quella impostazione ti dice a cosa serve: classificazione rapida, deterministica e statisticamente calibrata. Non ti dice che funzionerà sulla tua classificazione, e il benchmark indipendente è ciò che accade quando qualcuno verifica.

Leggere onestamente il benchmark di von stesso

I risultati di jabr v2 sono pubblicati dal proprietario e non sono stati verificati in modo indipendente, e la forma del benchmark conta quanto il punteggio. Quarantanove attività e 869 casi rappresentano un'ampiezza ragionevole per una valutazione di un modello decisionale, e una precisione macro del 71,5% è un numero forte per un encoder da 395M. La suddivisione per dominio è dove diventa informativo: triage dei sintomi al 100,0%, servizi domestici al 95,7%, instradamento urbano al 94,7%, instradamento delle scelte complessivamente all'83,4%. Queste sono le attività attorno a cui è stato costruito il corpus di addestramento — il README descrive i dati di fine-tuning come flussi di lavoro operativi e aziendali, sicurezza e DevOps, sicurezza e moderazione delle policy, linguistica, triage e ragionamento adversariale. Un punteggio elevato nel triage dei sintomi è un'affermazione che il modello ha appreso il dominio del triage, non che ha imparato a classificare.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

Il risultato di ViZDoom è quello citato più spesso, e merita un'attenta lettura. Nove virgola tre otto uccisioni di media in "Defend the Center," otto seed, zero-shot da testo strutturato della scena, a una latenza inferiore a 18 ms, contro le 5,62 uccisioni di Jev a circa 115 ms — un miglioramento del +66,9%. È un risultato sorprendente ed è anche un ambiente di gioco guidato da testo strutturato, dove una policy riflessiva e rapida è esattamente la forma giusta. L'inquadramento del paradigma System One da parte del progetto — riflessivo, parallelo, deterministico, statisticamente calibrato — è una descrizione corretta di ciò che quel compito premia.

Poi la valutazione di terze parti ha eseguito von sulla classificazione del tipo di commit, sul routing dei file, sul rilevamento delle funzionalità e sullo scoring dell'ampiezza delle modifiche, e su alcuni di questi ha perso rispetto a baseline a parole chiave e regex. Un AUC di 0,513 sul compito binario è il dato più netto: un lancio di monetina, da un modello la cui calibrazione è stata ottimizzata a T=1,1692 e il cui README dichiara un errore di calibrazione atteso quasi ideale. Entrambe le cose possono essere vere. Un modello può essere ben calibrato sulla distribuzione su cui è stato addestrato e inutile su una distribuzione che non ha mai visto — e anzi, una buona calibrazione sulla distribuzione sbagliata è peggio di una calibrazione palesemente cattiva, perché i numeri di confidenza sembrano affidabili.

Lo stesso test applicato a Laya

Laya è stata sottoposta a una versione di questo trattamento, e i risultati sono coerenti con quelli di von. Sul benchmark typed-decisions di TypeSafe, Laya ottiene 0,362 in zero-shot contro 0,318 per il caso casuale e 0,461 per la baseline della classe maggioritaria — più vicino al caso che alla risposta banale. La sua stessa model card afferma la conclusione: "Laya è una base rapida da specializzare, non un motore decisionale zero-shot." Oltre circa venti opzioni peggiora nettamente, ottenendo 0,425 su Banking77 contro 0,870 di Jev. Su 100 messaggi di urgenza Mars-base in un test di terze parti, Jev ha ottenuto 100/100 e Laya 53/100. In un benchmark per agenti browser ha completato 0 attività su 50, dichiarando prematuramente il completamento in 33 tentativi, 17 dei quali prima di compiere qualsiasi azione — sebbene gli autori del benchmark notino che è stato addestrato per lavori di giudizio come ticket di assistenza e fatture, non per la navigazione, il che è una dichiarazione di ambito più che un verdetto.

Dove Laya differisce da von è in ciò che rivendica per sé. Convai ha pubblicato sulla scheda il poco lusinghiero numero zero-shot e l'errore di calibrazione atteso di 0,466, accanto allo 0,081 prodotto dal riadattamento della temperatura per tipo di domanda. Il README di von pubblica il lusinghiero numero di jabr v2 e la vittoria su ViZDoom. Entrambi i progetti sono onesti riguardo a ciò che hanno fatto; solo uno dei due apre con un benchmark in cui il modello va male. Questa è un'osservazione sulle fonti, non un'accusa — ma se state scegliendo tra i due in base alle prove pubblicate, notate che state confrontando un progetto che vi ha mostrato il suo numero debole con uno il cui numero debole avete dovuto trovare altrove.

Il contrasto tra le specifiche, dimensione per dimensione

• Backbone — Laya: ModernBERT-large 421M inglese, mmBERT-base 322M multilingue. di: ModernBERT-Large 395M.

• Lingue — Laya: oltre 100 tramite il checkpoint multilingue e un router. von: inglese, senza alcun checkpoint multilingue pubblicato.

• Finestra di contesto — Laya: 512 token in inglese, 1.024 multilingue. von: non pubblicato con gli stessi termini; i casi jabr v2 sono decisioni strutturate brevi.

• Latenza — Laya: 32,8 ms p50 su una T4, 7,2 ms per domanda con batch 10. von: dichiarati da sotto i 15 ms a sotto i 25 ms, sotto i 18 ms nell'esecuzione ViZDoom.

• Accuratezza riportata — Laya: 0,362 zero-shot, 0,766 fine-tuned sullo split del benchmark stesso, 0,425 su Banking77. von: 71,5% macro su 49 attività di jabr v2, 83,4% routing delle scelte e 26,7% sul tipo di commit in un test indipendente.

• Calibrazione — Laya: ECE 0,466 al momento del rilascio, 0,081 dopo il ricalibraggio della temperatura per tipo di domanda. von: temperatura scalata a T=1,1692 durante il post-addestramento RLCD, con ECE dichiarato quasi ideale sulla propria distribuzione.

• Servizio — Laya: pip install laya, più port della community per ONNX, Go e Apple MLX. von: SDK Python e TypeScript, un server HTTP tramite von serve, preset preconfigurati per il triage dei ticket, la sicurezza delle email, la moderazione e il triage degli eventi di sicurezza.

• Hardware — Laya: CPU, CUDA e Apple MPS. da: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS e CPU multithread.

• Licenza — Apache 2.0 per entrambi.

La parte di von che è genuinamente distintiva

I pattern componibili di von sono la cosa di cui si discute meno nel suo repository. Il confidence gating, il route dispatch, il composite scoring e il routing a due stadi sono distribuiti come pattern con nome accanto ai preset — ticket triage, email security, moderation, security event triage — e codificano l'architettura di cui un modello decisionale ha davvero bisogno in produzione. Una singola chiamata choice raramente è l'intero sistema; la forma utile è un router economico di primo stadio che smista verso un secondo stadio specializzato, con un confidence gate che manda in escalation i casi incerti. von lo distribuisce come pattern documentato invece di lasciarlo a te.

Questo si mappa in modo lineare su ciò che fa OrcaRouter sul versante generativo, cosa che vale la pena dire apertamente perché le due metà del pattern sono di solito costruite da team diversi. Né von né Laya sono ospitati su OrcaRouter — entrambi sono pesi che scarichi ed esegui — e nulla di quanto segue va inteso come l'affermazione che li serviamo noi. Quello che sta nella nostra lista è l'altra metà: oltre 200 modelli generativi dietro un'unica chiave compatibile con OpenAI al prezzo di listino del provider passato tal quale con 0% di ricarico, così un taglio di prezzo del fornitore arriva sulla tua fattura lo stesso giorno anziché al rinnovo. Se il gate di confidenza di von stabilisce che il 4% delle richieste necessita di un modello frontier, il DSL di routing è ciò che compone quella decisione in un'unica chiamata invece di due contratti e due SDK, e il failover automatico è ciò che impedisce al ramo costoso di diventare un singolo punto di guasto.

Cosa fare con due modelli che falliscono entrambi al di fuori della loro distribuzione di addestramento

La conclusione pratica dalla valutazione di von non è che von sia un cattivo modello. È che l'accuratezza pubblicata di un modello decisionale è un'affermazione sulla sua distribuzione di addestramento, e l'unico modo per sapere se il tuo problema rientra in quella distribuzione è testarlo. La stessa tabella di benchmark del README di von si confronta con GLiNER2, un Qwen3.5 4B fine-tuned, Laya e Jev di TypeSafe su dimensione, accuratezza, latenza e hosting — che è una tabella utile, e anche una tabella in cui ogni voce di accuratezza tranne una proviene dall'harness dell'autore stesso.

Tra i due: scegli von se vuoi un insieme più ampio di domini pubblicati, un footprint leggermente inferiore, pattern di serving predefiniti per il triage e la moderazione, e la prova di ViZDoom che gestisce bene decisioni rapide su testo strutturato. Scegli Laya se hai bisogno di input multilingue — von non ha un checkpoint multilingue e la variante mmBERT da 322M di Laya copre oltre 100 lingue — o se una cifra di 32,8 ms su T4 e una finestra inglese di 512 token si adattano al tuo carico di lavoro. Non scegliere nessuno dei due senza passare un pomeriggio ad etichettare qualche centinaio di esempi dal tuo traffico e a testarli entrambi su di essi. La documentazione stessa di entrambi i progetti ti indirizza verso quell'esperimento, e il risultato di terze parti su von è ciò che accade quando nessuno lo esegue.

L'unica cosa che cambierebbe questo confronto è una valutazione appaiata su input identici con un diagramma di affidabilità per ciascun modello. Non esiste. Finché non esisterà, la classifica onesta si basa sulla qualità delle prove anziché sul punteggio: Laya ha pubblicato il suo numero peggiore, von ha pubblicato il suo migliore, e il test indipendente di von è la cosa più vicina a una verifica esterna che l'uno o l'altro abbia.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."