Ett genererat titelkort med rubriken "Unbiased's Pareto 26.10 Preview" och underrubriken "Ett byte till 1M-kontext bakom samma modellsträng", ovanför tre kort med texten "Släppt: 1 okt. 2026", "Kontext: 1 048 576 tokens" och "Routat pris: 0,80 $ / 3,20 $ per 1M", med en sidfot som lyder "Leverantörskörda, preliminära benchmarks; inga oberoende resultat publicerade per den 1 oktober 2026."
Guides & Insights

Unbiaseds Pareto 26.10-förhandsvisning: Ett 1M-kontextbyte bakom samma sträng

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Integrationen förändras inte. Modellen bakom den gör det. Den 1 oktober 2026 flyttade Unbiased sin modellsträng — pareto — till Pareto 26.10 Preview, en ny utgåva med ett fyra gånger så stort kontextfönster, ett lägre pris i den routade katalogen och ett benchmark-ark som, enligt leverantörens eget medgivande, är preliminärt och inte publicerat i slutlig form. Om du anropar Pareto i dag vid dess namn, anropar du 26.10 Preview, och leverantörens ändringslogg säger det i tydligast möjliga ordalag: "Pareto 26.10 Preview är nu den aktuella Pareto-utgåvan… Modellsträngen förblir pareto."

Den där enda raden är hela historien för alla som har Pareto i en stack. Det här är inte en andra produkt som lanseras vid sidan av den första. Det är den första produkten, ersatt på plats, under ett namn som inte ändrades — vilket innebär att versionen du får avgörs av släppkalendern, inte av något i din förfrågan.

Vad förändrades egentligen den 1 oktober?

Fyra saker rörde sig, och de pekar inte alla åt samma håll.

• Kontextfönster — 262 144 tokens för Pareto-släppet i september, nu 1 048 576. Unbiaseds egen dokumentation anger aldrig siffran; talet kommer från modellens offentliga tekniska specifikation, där det är gränsen per begäran och ingen mindre nivå erbjuds.
• Pris, enligt routning — det par som vanligen anges för Pareto har varit $2,50 per miljon indatatokens och $7,50 per miljon utdatatokens, med cachad input på $0,25. Listningen för 26.10 Preview anger $0,80, $3,20 respektive $0,03 — ungefär en tredjedel av indatapriset och drygt 40 % av utdatapriset.
• Benchmarkpoäng — publicerade för första gången för den här utgåvan, och preliminära enligt leverantörens egen beteckning.
• Det stabila alternativet — 26.10 Preview är en förhandsversion. Unbiaseds katalogtext säger att den "kan ändras utan varsel" och hänvisar i stället alla som behöver förutsägbart beteende till den tidigare utgåvan.

Allt annat förblev oförändrat. Maximal utdata är fortfarande 131 072 token. Indata är fortfarande text och bild; utdata är fortfarande endast text. Det finns fortfarande ingen Hugging Face-identifierare i listningen, så vikterna förblir stängda. Och det finns fortfarande exakt en serving-leverantör – Unbiased självt – utan en andra värd i listningen.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

Priset är den del som är värd att läsa två gånger.

På Unbiaseds egen plattform ändrades inte prislistan. Både modellkortet och prissättningssidan anger fortfarande $2,50 per miljon indata, $0,25 cachad, $7,50 utdata – samma tre siffror som septemberutgåvan innehöll – och eftersom modellsträngen förblev pareto, betalar en kund som använder leverantörens API dessa priser för 26.10 Preview. De lägre siffrorna är de som finns i den routade kataloglistningen, och gapet mellan de två är precis en sådan sak som avgör en migrering.

Två tolkningar är möjliga och leverantören har inte sagt vilken som är sann. Antingen erbjuds 26.10 Preview verkligen billigare via den vägen som en introduktionssatsning, eller så representerar listningen ett annat kommersiellt arrangemang än den direkta plattformen. Unbiased publicerar inget slutdatum för kampanjen, och ett pris som sätts på lanseringsdagen är inte ett åtagande.

Det här är den enda delen av berättelsen som en router ändrar formen på. OrcaRouter för vidare leverantörens listpris direkt med 0 % påslag, så en leverantörsprissänkning är live hos oss samma dag som den landar i stället för på en kontraktscykel — och automatisk failover innebär att en förhandsversion som beter sig annorlunda kan bytas ut utan kodändring. Vi använder Unbiaseds Pareto 26.10 Preview, så den ärliga versionen är denna: om du vill ha just den här modellen, anropa den via Unbiaseds eget API. Poängen är bara att i en förhandsversion är både priset och versionen variabler, och ingen av dem bör låsas fast i kod.

Benchmark-arket, med etiketterna det kom med

Unbiased publicerade fyra poäng för 26.10 Preview, var och en kopplad till en uppmätt kostnad per uppgift, och var och en med ett förbehåll som leverantören själv skrev. Läs dem som körda av leverantören och inte reproducerade, eftersom det är vad de är:

• DeepSWE v1.1 (agentisk kodning) — 69,9 %, för 0,24 $ per uppgift
• Terminal-Bench 4.0 (agentisk terminalanvändning) — 50,8 %, för 0,48 $ per uppgift
• Humanity's Last Exam, endast text (expertresonemang) — 49,9 %, för 0,008 $ per uppgift
• GPQA-Diamond (vetenskapligt resonemang) — 92,4 %, för 0,004 $ per uppgift

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

Leverantörens inramning är att 26.10 Preview "matchar eller sätter Pareto-fronten på alla fyra benchmarks." Arket som publiceras tillsammans med det påståendet är mer specifikt, och det är till Unbiaseds förtjänst att det publiceras överhuvudtaget: på Terminal-Bench 4.0 anges GPT 6 Astra till 58 och Fable 5.1 till 56, båda över Paretos 50,8, och leverantörens eget avsnitt "där andra modeller får högre poäng" säger det rakt ut. På DeepSWE v1.1 ligger releasen i ett kluster – GLM-5.3 och Kimi K3 anges båda till 69,0 mot Paretos 69,9 – vilket i praktiken är oavgjort och ligger inom vilken felmarginal en enskild körning än har.

Jämförelsetalen har ett andra förbehåll som är viktigare än det första: de är transkriberade från en jämförelse den 21 september och är, med leverantörens ord, ”inte oberoende validerade”, och de togs fram i en separat utvärdering av enskilda modeller – så de bör inte paras ihop med Paretos siffror för kostnad per uppgift som om båda kom från samma testbänk. Leverantören säger det i utvärderingsdetaljerna. En läsare som hoppar över den raden kommer att övertolka diagrammet.

Det som inget av detta är: oberoende. Artificial Analysis, resultattavlan som de flesta team kollar innan de litar på ett nytt namn på en prislista, har inte ens någon sida för Pareto. Varje siffra ovan togs fram av företaget som säljer modellen. Det enda som mildrar det är att utvärderingsramverket är offentligt – leverantören publicerar en reproducerbar head-to-head-svit som vem som helst kan rikta mot en slutpunkt – vilket förvandlar ”lita på vår poäng” till ”kör om vår poäng”. Det är ett verkligt erbjudande, och det är inte samma sak som en verifierad siffra. Ingen har publicerat omkörningen ännu.

Vad "preview" betyder i avtalet

Ordet gör mer arbete här än versionsinformationen. Unbiaseds egen dokumentation beskriver nuvarande åtkomst som utvärderingsåtkomst enligt dess villkor och anger att kommersiell användning eller produktionsanvändning kräver ett separat skriftligt avtal. Nya konton granskas manuellt innan en API-nyckel utfärdas. API:et är kompatibelt med OpenAI och Anthropic – bas-URL, nyckel, modellsträng, ingen omskrivning – men den dokumenterade ytan består endast av chattkompletteringar och meddelanden, med kända luckor som leverantören öppet redovisar: GET /v1/models är inte implementerad och okända modellidentifierare avvisas inte, så anropare måste skicka pareto explicit i stället för att upptäcka vad som är tillgängligt.

Lägg ihop förhandsversionsetiketten och private-beta-avtalet, så skriver driftrekommendationerna sig själva. Det här är en modell att utvärdera mot din egen arbetsbelastning bakom ett routinglager, inte en att sätta framför intäktstrafik och glömma bort. Mekanismen för det är oglamorös: en fallback-kedja som konfigureras en gång, så att en release som ändras under dig mitt i veckan blir en konfigurationsändring i stället för en incident. Unbiased ägnade september åt att åtgärda exakt den här typen av problem på sin egen sida – en changelog-post från den 16 september visar att ungefär 13 % av långa icke-strömmande förfrågningar stötte på en timeout på 120 sekunder, och gateway-taket höjdes till 300 sekunder. Det är en leverantör som är uppriktig om en skavande kant. Det är också en påminnelse om att en förhandsversions driftprofil fortfarande skrivs.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

Vad du bör se upp med innan du binder dig

Tre specifika saker skulle avgöra de öppna frågorna, och var och en går att kontrollera.

Den första är en oberoende poäng. Förrän en tredje part har kört 26.10 Preview på en publicerad testrigg är 92,4 på GPQA-Diamond och 50,8 på Terminal-Bench leverantörspåståenden om leverantörens eget arbete — tillräckligt bra för att avgöra om man ska testa, inte tillräckligt bra för att avgöra om man ska migrera.

Den andra är vad förhandsvisningen gör med priset. Om den routade listningen ligger kvar på $0.80 och $3.20 medan leverantörens egen plattform håller $2.50 och $7.50, är skillnaden ett kanalbeslut som är värt att förstå innan du bygger en kostnadsmodell på endera siffran.

Det tredje är vad ”kan ändras utan varsel” visar sig innebära i praktiken. En förhandsversion som revideras två gånger i månaden är ett annat instrument än en som fryses och döps om i slutet av kvartalet, och ändringsloggen är där det kommer att synas först.

Inget av detta talar emot att prova det. En multimodell med 1M tokens som rapporterar resultat nära frontlinjen till en kostnad av 0,24 dollar per uppgift är värd en eftermiddag av riktigt arbete med dina egna prompter, och den utvärderingen kostar mindre än argumentationen om den. Det talar emot att anta att modellen du benchmarkar den här veckan är modellen du får nästa vecka — vilket, för en utgåva som leverantören själv kallar en förhandsversion, är det enda antagandet som behöver vara rätt.

En förhandsversion är precis det fallet som automatisk failover byggdes för: automatisk failoverförvandlar en modell som förändras under fötterna på dig mitt i veckan till en konfigändring i stället för ett avbrott.