Una card del titolo generata intitolata "Unbiased's Pareto 26.10 Preview" con il sottotitolo "Uno scambio di contesto da 1M dietro la stessa stringa del modello", sopra tre card che recitano "Rilasciato: 1 ottobre 2026", "Contesto: 1.048.576 token" e "Prezzo instradato: $0,80 / $3,20 per 1M", con un piè di pagina che recita "Benchmark preliminari eseguiti dal fornitore; nessun punteggio indipendente pubblicato alla data del 1° ottobre 2026."
Guides & Insights

L'anteprima di Pareto 26.10 di Unbiased: uno scambio di contesto da 1M dietro la stessa stringa del modello

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

L'integrazione non cambia. Il modello che ne sta dietro sì. Il 1° ottobre 2026, Unbiased ha spostato la sua stringa di modello — pareto — su Pareto 26.10 Preview, una nuova release con una finestra di contesto quattro volte più grande, un prezzo più basso sul catalogo instradato e un foglio di benchmark che, per ammissione dello stesso fornitore, è preliminare e non pubblicato in forma definitiva. Se oggi chiami Pareto con il suo nome, stai chiamando 26.10 Preview, e il changelog del fornitore lo dice nel modo più chiaro possibile: "Pareto 26.10 Preview è ora la release attuale di Pareto… La stringa del modello resta pareto."

Quella singola riga è tutta la storia per chiunque abbia Pareto in uno stack. Non è un secondo prodotto lanciato accanto al primo. È il primo prodotto, sostituito sul posto, con un nome che non è cambiato — il che significa che la versione che ottieni è decisa dal calendario di rilascio, non da qualsiasi cosa nella tua richiesta.

Cosa è cambiato realmente il 1° ottobre

Quattro cose si sono mosse, e non puntano tutte nella stessa direzione.

• Finestra di contesto — 262.144 token nella release Pareto di settembre, ora 1.048.576. La documentazione di Unbiased stessa non riporta mai la cifra; il numero proviene dalla scheda tecnica pubblica del modello, dove rappresenta il limite per singola richiesta, senza che venga offerto alcun livello inferiore.
• Prezzo, in base al routing — la coppia di valori comunemente citata per Pareto è stata di 2,50 $ per milione di token in input e 7,50 $ per milione in output, con l'input in cache a 0,25 $. La scheda di 26.10 Preview riporta rispettivamente 0,80 $, 3,20 $ e 0,03 $ — circa un terzo della tariffa di input e poco più del 40% della tariffa di output.
• Punteggi dei benchmark — pubblicati per la prima volta per questa release e, per dichiarazione dello stesso fornitore, preliminari.
• L'opzione stabile — 26.10 Preview è una preview. Il testo di catalogo di Unbiased afferma che "può cambiare senza preavviso" e indirizza invece alla release precedente chiunque abbia bisogno di un comportamento prevedibile.

Tutto il resto è rimasto invariato. L'output massimo è ancora di 131.072 token. L'input è ancora testo e immagine; l'output è ancora solo testo. Non c'è ancora alcun identificatore Hugging Face nella scheda, quindi i pesi restano chiusi. E c'è ancora esattamente un fornitore di servizio — Unbiased stesso — senza un secondo host all'interno della scheda.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

Il prezzo è la parte che vale la pena leggere due volte.

Sulla piattaforma propria di Unbiased, il listino prezzi non si è mosso. La scheda del modello e la pagina dei prezzi riportano ancora entrambe 2,50 $ per milione di input, 0,25 $ in cache, 7,50 $ di output — gli stessi tre numeri del rilascio di settembre — e poiché la stringa del modello è rimasta pareto, un cliente sull'API del fornitore sta pagando quelle tariffe per 26.10 Preview. Gli importi più bassi sono quelli sulla scheda del catalogo instradato, e il divario tra i due è esattamente il genere di cosa che determina una migrazione.

Sono possibili due letture e il fornitore non ha detto quale sia quella vera. O 26.10 Preview viene effettivamente offerto a un prezzo più basso attraverso quella via come spinta introduttiva, oppure l'inserimento rappresenta un accordo commerciale diverso rispetto alla piattaforma diretta. Unbiased non pubblica alcuna data di fine promozione, e un prezzo fissato il giorno del lancio non è un impegno.

Questa è l'unica parte della storia di cui un router cambia la forma. OrcaRouter trasmette direttamente il prezzo di listino del provider con markup dello 0%, quindi un taglio di prezzo del fornitore è attivo dalla nostra parte lo stesso giorno in cui arriva, anziché su un ciclo contrattuale — e il failover automatico significa che una release di anteprima che la settimana prossima si comporta diversamente può essere sostituita senza modifiche al codice. Non abbiamo in catalogo Unbiased's Pareto 26.10 Preview, quindi la versione onesta è questa: se vuoi questo modello specifico, chiamalo tramite l'API di Unbiased. Il punto è solo che su una release di anteprima, sia il prezzo sia la versione sono variabili, e nessuno dei due dovrebbe essere fissato nel codice.

Il foglio di benchmark, con le etichette con cui è arrivato

Unbiased ha pubblicato quattro punteggi per 26.10 Preview, ciascuno abbinato a un costo per attività misurato, e ciascuno con un'avvertenza scritta dal fornitore stesso. Leggili come eseguiti dal fornitore e non riprodotti, perché è ciò che sono:

• DeepSWE v1.1 (programmazione agentica) — 69,9%, a $0,24 per attività
• Terminal-Bench 4.0 (uso agentico del terminale) — 50,8%, a $0,48 per attività
• Humanity's Last Exam, solo testo (ragionamento specialistico) — 49,9%, a $0,008 per attività
• GPQA-Diamond (ragionamento scientifico) — 92,4%, a $0,004 per attività

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

Secondo l'impostazione del fornitore, 26.10 Preview «eguaglia o fissa la frontiera di Pareto su tutti e quattro i benchmark». Il foglio che pubblica insieme a tale affermazione è più specifico, e va a merito di Unbiased il fatto che sia pubblicato affatto: su Terminal-Bench 4.0, GPT 6 Astra è elencato a 58 e Fable 5.1 a 56, entrambi sopra il 50,8 di Pareto, e la stessa sezione del fornitore «dove altri modelli ottengono punteggi più alti» lo dice direttamente. Su DeepSWE v1.1 il rilascio si colloca in un gruppo — GLM-5.3 e Kimi K3 sono entrambi elencati a 69,0 contro il 69,9 di Pareto — il che in pratica è un pareggio e rientra in qualunque margine di errore comporti una singola esecuzione.

I numeri del confronto comportano una seconda avvertenza che conta più della prima: sono trascritti da un confronto del 21 settembre e, secondo le parole del fornitore, «non sono convalidati in modo indipendente», e sono stati prodotti in una valutazione separata di singoli modelli — quindi non dovrebbero essere abbinati ai dati di costo per attività di Pareto come se entrambi provenissero dallo stesso banco di prova. Il fornitore lo afferma nei dettagli della valutazione. Un lettore che salta quella riga sovrainterpreterà il grafico.

Ciò che nulla di tutto questo è: indipendente. Artificial Analysis, la classifica che la maggior parte dei team consulta prima di fidarsi di un nuovo nome su un listino prezzi, non ha alcuna pagina per Pareto. Ogni numero sopra è stato prodotto dall'azienda che vende il modello. L'unica cosa che lo attenua è che l'harness di valutazione è pubblico — il fornitore pubblica una suite riproducibile di confronti testa a testa che chiunque può indirizzare verso un endpoint — il che trasforma "fidati del nostro punteggio" in "riesegui il nostro punteggio". Questa è un'offerta reale e non equivale a un numero verificato. Nessuno ha ancora pubblicato la riesecuzione.

Che cosa significa "preview" nel contratto

La parola qui fa più lavoro di quanto ne facciano le note di rilascio. La documentazione ufficiale di Unbiased descrive l'accesso attuale come accesso di valutazione ai sensi dei suoi termini, e afferma che l'uso commerciale o in produzione richiede un accordo scritto separato. I nuovi account vengono esaminati manualmente prima che venga emessa una chiave API. L'API è compatibile con OpenAI e Anthropic — URL di base, chiave, stringa del modello, nessuna riscrittura — ma la superficie documentata è solo chat completions e messages, con lacune note che il fornitore elenca apertamente: GET /v1/models non è implementato e gli identificatori di modello sconosciuti non vengono rifiutati, quindi chi effettua le chiamate deve inviare pareto esplicitamente invece di scoprire ciò che è disponibile.

Metti insieme l'etichetta di anteprima e il contratto di beta privata e il consiglio operativo si scrive da solo. Questo è un modello da valutare rispetto al proprio carico di lavoro dietro un livello di routing, non uno da mettere davanti al traffico che genera ricavi e dimenticarsene. Il meccanismo per farlo è poco glamour: una catena di fallback configurata una volta sola, così una release che cambia sotto i piedi a metà settimana diventa una modifica di configurazione anziché un incidente. Unbiased ha passato settembre a risolvere esattamente questa classe di problemi dalla propria parte — una voce di changelog del 16 settembre registra che circa il 13% delle richieste lunghe non in streaming incorreva in un timeout di 120 secondi, e il tetto del gateway è stato alzato a 300 secondi. È un fornitore che ammette con franchezza un'asperità. Ed è anche un promemoria del fatto che il profilo operativo di un'anteprima è ancora in fase di scrittura.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

Cosa tenere d'occhio prima di impegnarti

Tre cose specifiche risolverebbero le questioni aperte, e ciascuna è verificabile.

Il primo è un punteggio indipendente. Finché una terza parte non esegue 26.10 Preview su un harness pubblicato, il 92,4 su GPQA-Diamond e il 50,8 su Terminal-Bench sono dichiarazioni del fornitore su lavoro del fornitore — abbastanza buone per decidere se testare, non abbastanza buone per decidere se migrare.

Il secondo è l'effetto che l'anteprima ha sul prezzo. Se l'inserzione instradata resta a $0,80 e $3,20 mentre la piattaforma proprietaria del venditore mantiene $2,50 e $7,50, la differenza è una decisione di canale che vale la pena comprendere prima di costruire un modello di costo su uno dei due numeri.

Il terzo è ciò che "può cambiare senza preavviso" finisce per significare in pratica. Un'anteprima che viene rivista due volte in un mese è uno strumento diverso da una che viene congelata e rinominata alla fine del trimestre, e il changelog è il punto in cui questo si vedrà per primo.

Niente di tutto questo è un argomento contro il provarlo. Un modello multimodale da 1M di token che riporta punteggi vicini alla frontiera a 0,24 $ per task vale un pomeriggio di lavoro serio sui propri prompt, e quella valutazione costa meno della discussione al riguardo. È un argomento contro il dare per scontato che il modello che benchmarki questa settimana sia il modello che avrai la prossima — il che, per un rilascio che il fornitore stesso definisce un'anteprima, è l'unica ipotesi che deve rivelarsi giusta.

Una release di anteprima è esattamente il caso per cui è stato creato il failover automatico: il failover automaticotrasforma un modello che cambia sotto di te a metà settimana in una modifica di configurazione anziché in un'interruzione del servizio.