Una card di titolo generata, intitolata «Pareto 26.10 Preview vs Pareto», con il sottotitolo «Stessa stringa di modello, due release diverse», sopra tre card che recitano «Contesto: 1M vs 262K», «Prezzo: $0.80 / $3.20 vs $2.50 / $7.50» e «Stabilità: preview vs stable», con un piè di pagina che recita «Entrambe le release sono servite da Unbiased con la stringa di modello pareto; cifre secondo il listino pubblico».
Guides & Insights

Pareto 26.10 Preview vs Pareto: stessa stringa di modello, due modelli diversi

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Unbiased ha rilasciato Pareto 26.10 Preview il 1° ottobre 2026 e ha lasciato la release precedente, Pareto, elencata accanto. Le due non sono varianti di una famiglia tra cui scegliere con un flag. Sono due release dietro un unico brand, e la stringa del modello del fornitore stesso — pareto — ora rimanda alla più recente, esplicitamente instabile. Quindi la domanda di confronto non è davvero "quale è migliore". È: quale delle due raggiunge effettivamente la tua richiesta, e cosa succede alla risposta quando cambia sotto di te?

L'unico luogo in cui i due vengono descritti insieme è la scheda tecnica pubblica del modello. La model card, la pagina dei prezzi e le FAQ di Unbiased descrivono un unico prodotto aggregato e non menzionano mai la separazione. Questa asimmetria — un diff pubblico dettagliato da un lato, il silenzio dall'altro — è l'onesto punto di partenza per un confronto testa a testa, perché ti dice da dove provengono tutti i numeri che seguono.

Sei dimensioni, entrambi i lati

Tutto ciò che separa le release si trova in queste sei righe. Il lato sinistro è Pareto 26.10 Preview; il lato destro è la release di Pareto del 17 settembre, quella che il testo del catalogo dell'anteprima chiama la scelta stabile.

• Finestra di contesto — 1,048,576 token contro 262,144 token. Quattro volte lo spazio, sulla carta, senza che venga offerto alcun livello più piccolo su nessuno dei due.
• Output massimo — 131,072 token contro 131,072 token. Invariato. La finestra più ampia non è stata accompagnata da una risposta più ampia.
• Prezzo di input, in base al routing — $0.80 per milione contro $2.50 per milione. L'anteprima costa circa un terzo del prezzo indicato in quel listino.
• Prezzo di output, in base al routing — $3.20 per milione contro $7.50 per milione. Meno della metà.
• Input in cache, in base al routing — $0.03 per milione contro $0.25 per milione. Le traiettorie degli agenti più lunghe sono quelle che ne traggono maggior vantaggio.
• Scheda di benchmark pubblicata — quattro punteggi, esplicitamente "preliminari" e "potrebbero cambiare prima della pubblicazione finale" contro nessuna tabella di benchmark pubblicata.

Due di quelle righe sono quelle che decidono il lavoro reale. La finestra di contesto è il dato di punta che il fornitore non dichiarerà sul proprio sito — vive nell'annuncio, non nella scheda del modello — e il prezzo dell'input in cache è quello che cambia la fattura di un agente anziché il suo tetto. Tutto il resto è o un delta di marketing o, nel caso del punteggio di output, un'ammissione: pubblicare i numeri di un'anteprima con l'etichetta "preliminare" è più onesto dell'alternativa, ed è anche un monito.

A generated two-column scoreboard titled "Pareto 26.10 Preview vs Pareto - the scoreboard". The left column, "Pareto 26.10 Preview", reads "Context: 1,048,576 tokens", "Max output: 131,072 tokens", "Input price: $0.80 / 1M", "Output price: $3.20 / 1M", "Cached input: $0.03 / 1M" and "Scores: four, preliminary". The right column, "Pareto", reads "Context: 262,144 tokens", "Max output: 131,072 tokens", "Input price: $2.50 / 1M", "Output price: $7.50 / 1M", "Cached input: $0.25 / 1M" and "Scores: none published". A footer reads "Both columns per the public listing; the vendor's own site lists $2.50 / $7.50 for both releases."

Il prezzo che vedi dipende da dove guardi

Metti a confronto le due schede tariffarie e non quadrano, ed è la parte di questo confronto che nessuno ha spiegato.

La piattaforma stessa di Unbiased, il giorno in cui 26.10 Preview è diventata la release corrente, elenca ancora $2,50 per milione di input, $0,25 in cache e $7,50 di output. Quelli sono i numeri di settembre, invariati, sia sulla pagina dei prezzi sia sulla scheda del modello. Il set più basso — $0,80, $0,03, $3,20 — compare nell'elenco del catalogo instradato per la stessa preview. Quindi un cliente che chiama pareto direttamente tramite l'API del fornitore paga il vecchio listino per il nuovo modello, mentre l'elenco instradato ne pubblicizza circa un terzo. Entrambi sono attivi. Il fornitore non ha pubblicato alcuna data di fine della promozione né alcuna dichiarazione che li riconcili.

Questa è una questione di canale, e su una release di anteprima è anche una questione di tempistica: qualunque sia il numero su cui modelli i tuoi costi, l'altro è a una release note di distanza dal diventare corretto. Un router che fa passare il prezzo di listino di un provider con un ricarico dello 0% elimina esattamente questo attrito — una variazione di prezzo del fornitore è effettiva lo stesso giorno invece che alla successiva revisione contrattuale — e questo è l'unico elemento strutturale che vale la pena mutuare da OrcaRouter qui. Oggi non disponiamo di nessuna delle due release di Unbiased, quindi la risposta diretta a "dove la chiamo" è l'API di Unbiased stessa, su qualunque dei due set di prezzi che l'annuncio tramite cui acquisti si trovi a riportare. Il motivo per dirlo ad alta voce è che la differenza è di un fattore tre, e un'anteprima non è il posto giusto per scoprire che hai calcolato il prezzo su quello sbagliato.

Cosa ti offre l'anteprima e quanto ti costa

La descrizione di catalogo della preview stessa stabilisce i termini: essa "può cambiare senza preavviso", e chiunque abbia bisogno di un comportamento prevedibile viene rimandato alla versione di settembre. Non è un testo standard — è la definizione del prodotto. Confrontatelo con la forma concreta di una lunga sessione di un agente e il compromesso diventa tangibile.

Un agente che mantiene viva una conversazione accumula contesto, ed è nelle conversazioni lunghe che la cache dei prompt ripaga il suo costo. Un modello cambiato dietro un endpoint invariato è il modo classico di perderla: la cache è indicizzata al modello che ha prodotto i token, quindi un cambio di versione silenzioso a metà traiettoria può invalidare ciò che avevi in cache e riaddebitare lavoro che pensavi fosse già pagato. La documentazione di Unbiased stessa sostiene questo punto nella direzione opposta — posiziona il suo blend come stabile in cache laddove un router che cambia non lo è — quindi questo è un rischio che il fornitore comprende bene e che semplicemente accetta in cambio del rilascio di una preview. Vale la pena menzionarlo perché il fallimento è invisibile in una dashboard: i tuoi token vengono comunque fatturati, le tue risposte vengono comunque restituite, e il numero è semplicemente più grande di quello della settimana scorsa.

Il lato positivo dell'anteprima è reale e rispecchia quello negativo. Contesto quattro volte maggiore, input in cache a un ottavo della tariffa della release stabile sul listino instradato, e persino un foglio di benchmark — la release di settembre non ha mai avuto punteggi pubblicati. Se il tuo carico di lavoro è a contesto lungo e sensibile ai costi, l'anteprima è quella che fa per te, e il modo per adottarla senza puntare tutto sullo stack è fissarla deliberatamente: un endpoint denominato per l'anteprima, un endpoint denominato per la release stabile, e un fallback tra i due configurato una volta. Il DSL di routing esiste esattamente per questo tipo di problema — componi i due come tratte separate, invia una fetta di traffico reale su ciascuna e lascia che il log delle richieste ti dica quanto è costata davvero ciascuna. Un'anteprima dovrebbe essere una decisione che puoi invertire con una riga di configurazione, non una proprietà del tuo endpoint che scopri dalla fattura.

A generated three-card graphic titled "Where the version reaches you", with cards reading "Vendor API: model string pareto leads to 26.10 Preview", "Vendor pricing card: $2.50 / $7.50, unchanged" and "Listing: $0.80 / $3.20, may change without notice", and a footer reading "Read Oct 1, 2026; which release pareto points at is set by the release calendar."

Un quadro prestazionale non abbastanza stabile da risultare attendibile

Ogni cifra sopra riportata proviene dalla scheda pubblica, e il pannello delle prestazioni della scheda stessa è cambiato tra una lettura e l'altra il giorno del lancio. Una lettura della pagina 26.10 Preview riportava una latenza mediana di 5,28 secondi e 35 token al secondo; una vista affiancata pubblicata lo stesso giorno riportava 3,54 secondi e 21 token al secondo per l'anteprima e 1,05 secondi e 45 token al secondo per la versione di settembre. Non si tratta di piccole discrepanze. Un modello nuovissimo servito da un unico provider ha una base di misurazione esigua, e una finestra mobile su alcune ore si sposterà.

La posizione onesta è che nessuna delle due release ha una cifra di throughput o latenza sufficientemente stabile su cui pianificare, e per la preview questo è insito nel prodotto piuttosto che un problema di snapshot. Il rilascio di settembre ha almeno avuto settimane di traffico — la sua scheda mostra una disponibilità su più giorni nella fascia alta dei novanta, con un storico completo del provider alle spalle. La preview ha ore. Se il tuo motivo per scegliere tra i due è la velocità anziché il prezzo o il contesto, le prove su cui scegliere non esistono ancora, e la mossa responsabile è misurare sui tuoi prompt anziché leggere un numero da una delle due pagine.

A screenshot of the OrcaRouter models catalogue headed "Models" and subtitled "208 models · 16 providers · one API key, one bill", with input-modality, context-length, input-price, status, series and supported-parameter filter rows, tabs for Models, Leaderboard, Offers and Playground, a "How to call any model" panel showing a POST to an OpenAI-compatible endpoint, and model cards including OpenAI: GPT-6.1 Sol.

Quale chiamare, e come smettere di preoccuparsi

Usa la preview se il tuo lavoro è a contesto lungo, sensibile ai costi e valutabile — sessioni di agenti, elaborazione batch, qualsiasi cosa in cui una finestra quadrupla e un terzo del prezzo di input ripaghino il rischio di un cambiamento a metà settimana. Trattala come una prova con una riga di configurazione sotto, e tieni i tuoi numeri, perché quelli del fornitore cambieranno.

Scegli il Pareto stabile se il tuo carico di lavoro è in produzione, sensibile alla latenza o coperto da una revisione di conformità che non vuole un modello descritto come potenzialmente soggetto a cambiamenti senza preavviso. Rinunci alla finestra da 1M, alla cache più economica e ai punteggi pubblicati; ti tieni un endpoint con un track record e un nome che significa la stessa cosa la settimana prossima. Per molte squadre, questo è l'intero requisito.

L'errore è considerarlo un fork permanente. Unbiased ha progettato la separazione perché fosse temporanea — l'anteprima esiste per essere valutata e poi assorbita — e la decisione che conta non è quale delle due scegli, ma se passare dall'una all'altra è una modifica di cinque minuti o un progetto trimestrale. Su un endpoint con una singola stringa di modello, al momento non è nessuna delle due: è un annuncio che devi riuscire a cogliere. Configura invece la scelta come una decisione di routing e la versione che chiami diventa una manopola, che è l'unico atteggiamento che una release di anteprima abbia mai davvero premiato.