
Pareto 26.10 Preview vs Pareto: stessa stringa di modello, due modelli diversi
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 221 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Unbiased ha rilasciato Pareto 26.10 Preview il 1° ottobre 2026 e ha lasciato la release precedente, Pareto, elencata accanto. Le due non sono varianti di una famiglia tra cui scegliere con un flag. Sono due release dietro un unico brand, e la stringa del modello del fornitore stesso — pareto — ora rimanda alla più recente, esplicitamente instabile. Quindi la domanda di confronto non è davvero "quale è migliore". È: quale delle due raggiunge effettivamente la tua richiesta, e cosa succede alla risposta quando cambia sotto di te?
L'unico luogo in cui i due vengono descritti insieme è la scheda tecnica pubblica del modello. La model card, la pagina dei prezzi e le FAQ di Unbiased descrivono un unico prodotto aggregato e non menzionano mai la separazione. Questa asimmetria — un diff pubblico dettagliato da un lato, il silenzio dall'altro — è l'onesto punto di partenza per un confronto testa a testa, perché ti dice da dove provengono tutti i numeri che seguono.
Sei dimensioni, entrambi i lati
Tutto ciò che separa le release si trova in queste sei righe. Il lato sinistro è Pareto 26.10 Preview; il lato destro è la release di Pareto del 17 settembre, quella che il testo del catalogo dell'anteprima chiama la scelta stabile.
• Finestra di contesto — 1,048,576 token contro 262,144 token. Quattro volte lo spazio, sulla carta, senza che venga offerto alcun livello più piccolo su nessuno dei due.
• Output massimo — 131,072 token contro 131,072 token. Invariato. La finestra più ampia non è stata accompagnata da una risposta più ampia.
• Prezzo di input, in base al routing — $0.80 per milione contro $2.50 per milione. L'anteprima costa circa un terzo del prezzo indicato in quel listino.
• Prezzo di output, in base al routing — $3.20 per milione contro $7.50 per milione. Meno della metà.
• Input in cache, in base al routing — $0.03 per milione contro $0.25 per milione. Le traiettorie degli agenti più lunghe sono quelle che ne traggono maggior vantaggio.
• Scheda di benchmark pubblicata — quattro punteggi, esplicitamente "preliminari" e "potrebbero cambiare prima della pubblicazione finale" contro nessuna tabella di benchmark pubblicata.
Due di quelle righe sono quelle che decidono il lavoro reale. La finestra di contesto è il dato di punta che il fornitore non dichiarerà sul proprio sito — vive nell'annuncio, non nella scheda del modello — e il prezzo dell'input in cache è quello che cambia la fattura di un agente anziché il suo tetto. Tutto il resto è o un delta di marketing o, nel caso del punteggio di output, un'ammissione: pubblicare i numeri di un'anteprima con l'etichetta "preliminare" è più onesto dell'alternativa, ed è anche un monito.

Il prezzo che vedi dipende da dove guardi
Metti a confronto le due schede tariffarie e non quadrano, ed è la parte di questo confronto che nessuno ha spiegato.
La piattaforma stessa di Unbiased, il giorno in cui 26.10 Preview è diventata la release corrente, elenca ancora $2,50 per milione di input, $0,25 in cache e $7,50 di output. Quelli sono i numeri di settembre, invariati, sia sulla pagina dei prezzi sia sulla scheda del modello. Il set più basso — $0,80, $0,03, $3,20 — compare nell'elenco del catalogo instradato per la stessa preview. Quindi un cliente che chiama pareto direttamente tramite l'API del fornitore paga il vecchio listino per il nuovo modello, mentre l'elenco instradato ne pubblicizza circa un terzo. Entrambi sono attivi. Il fornitore non ha pubblicato alcuna data di fine della promozione né alcuna dichiarazione che li riconcili.
Questa è una questione di canale, e su una release di anteprima è anche una questione di tempistica: qualunque sia il numero su cui modelli i tuoi costi, l'altro è a una release note di distanza dal diventare corretto. Un router che fa passare il prezzo di listino di un provider con un ricarico dello 0% elimina esattamente questo attrito — una variazione di prezzo del fornitore è effettiva lo stesso giorno invece che alla successiva revisione contrattuale — e questo è l'unico elemento strutturale che vale la pena mutuare da OrcaRouter qui. Oggi non disponiamo di nessuna delle due release di Unbiased, quindi la risposta diretta a "dove la chiamo" è l'API di Unbiased stessa, su qualunque dei due set di prezzi che l'annuncio tramite cui acquisti si trovi a riportare. Il motivo per dirlo ad alta voce è che la differenza è di un fattore tre, e un'anteprima non è il posto giusto per scoprire che hai calcolato il prezzo su quello sbagliato.
Cosa ti offre l'anteprima e quanto ti costa
La descrizione di catalogo della preview stessa stabilisce i termini: essa "può cambiare senza preavviso", e chiunque abbia bisogno di un comportamento prevedibile viene rimandato alla versione di settembre. Non è un testo standard — è la definizione del prodotto. Confrontatelo con la forma concreta di una lunga sessione di un agente e il compromesso diventa tangibile.
Un agente che mantiene viva una conversazione accumula contesto, ed è nelle conversazioni lunghe che la cache dei prompt ripaga il suo costo. Un modello cambiato dietro un endpoint invariato è il modo classico di perderla: la cache è indicizzata al modello che ha prodotto i token, quindi un cambio di versione silenzioso a metà traiettoria può invalidare ciò che avevi in cache e riaddebitare lavoro che pensavi fosse già pagato. La documentazione di Unbiased stessa sostiene questo punto nella direzione opposta — posiziona il suo blend come stabile in cache laddove un router che cambia non lo è — quindi questo è un rischio che il fornitore comprende bene e che semplicemente accetta in cambio del rilascio di una preview. Vale la pena menzionarlo perché il fallimento è invisibile in una dashboard: i tuoi token vengono comunque fatturati, le tue risposte vengono comunque restituite, e il numero è semplicemente più grande di quello della settimana scorsa.
Il lato positivo dell'anteprima è reale e rispecchia quello negativo. Contesto quattro volte maggiore, input in cache a un ottavo della tariffa della release stabile sul listino instradato, e persino un foglio di benchmark — la release di settembre non ha mai avuto punteggi pubblicati. Se il tuo carico di lavoro è a contesto lungo e sensibile ai costi, l'anteprima è quella che fa per te, e il modo per adottarla senza puntare tutto sullo stack è fissarla deliberatamente: un endpoint denominato per l'anteprima, un endpoint denominato per la release stabile, e un fallback tra i due configurato una volta. Il DSL di routing esiste esattamente per questo tipo di problema — componi i due come tratte separate, invia una fetta di traffico reale su ciascuna e lascia che il log delle richieste ti dica quanto è costata davvero ciascuna. Un'anteprima dovrebbe essere una decisione che puoi invertire con una riga di configurazione, non una proprietà del tuo endpoint che scopri dalla fattura.

Un quadro prestazionale non abbastanza stabile da risultare attendibile
Ogni cifra sopra riportata proviene dalla scheda pubblica, e il pannello delle prestazioni della scheda stessa è cambiato tra una lettura e l'altra il giorno del lancio. Una lettura della pagina 26.10 Preview riportava una latenza mediana di 5,28 secondi e 35 token al secondo; una vista affiancata pubblicata lo stesso giorno riportava 3,54 secondi e 21 token al secondo per l'anteprima e 1,05 secondi e 45 token al secondo per la versione di settembre. Non si tratta di piccole discrepanze. Un modello nuovissimo servito da un unico provider ha una base di misurazione esigua, e una finestra mobile su alcune ore si sposterà.
La posizione onesta è che nessuna delle due release ha una cifra di throughput o latenza sufficientemente stabile su cui pianificare, e per la preview questo è insito nel prodotto piuttosto che un problema di snapshot. Il rilascio di settembre ha almeno avuto settimane di traffico — la sua scheda mostra una disponibilità su più giorni nella fascia alta dei novanta, con un storico completo del provider alle spalle. La preview ha ore. Se il tuo motivo per scegliere tra i due è la velocità anziché il prezzo o il contesto, le prove su cui scegliere non esistono ancora, e la mossa responsabile è misurare sui tuoi prompt anziché leggere un numero da una delle due pagine.

Quale chiamare, e come smettere di preoccuparsi
Usa la preview se il tuo lavoro è a contesto lungo, sensibile ai costi e valutabile — sessioni di agenti, elaborazione batch, qualsiasi cosa in cui una finestra quadrupla e un terzo del prezzo di input ripaghino il rischio di un cambiamento a metà settimana. Trattala come una prova con una riga di configurazione sotto, e tieni i tuoi numeri, perché quelli del fornitore cambieranno.
Scegli il Pareto stabile se il tuo carico di lavoro è in produzione, sensibile alla latenza o coperto da una revisione di conformità che non vuole un modello descritto come potenzialmente soggetto a cambiamenti senza preavviso. Rinunci alla finestra da 1M, alla cache più economica e ai punteggi pubblicati; ti tieni un endpoint con un track record e un nome che significa la stessa cosa la settimana prossima. Per molte squadre, questo è l'intero requisito.
L'errore è considerarlo un fork permanente. Unbiased ha progettato la separazione perché fosse temporanea — l'anteprima esiste per essere valutata e poi assorbita — e la decisione che conta non è quale delle due scegli, ma se passare dall'una all'altra è una modifica di cinque minuti o un progetto trimestrale. Su un endpoint con una singola stringa di modello, al momento non è nessuna delle due: è un annuncio che devi riuscire a cogliere. Configura invece la scelta come una decisione di routing e la versione che chiami diventa una manopola, che è l'unico atteggiamento che una release di anteprima abbia mai davvero premiato.
