Een gegenereerde titelkaart met als kop "Unbiased's Pareto 26.10 Preview" en als ondertitel "Een 1M-contextswap achter dezelfde modelstring", boven drie kaarten met de tekst "Uitgebracht: 1 oktober 2026", "Context: 1.048.576 tokens" en "Gerouteerde prijs: $0,80 / $3,20 per 1M", met een voettekst met de tekst "Door de leverancier uitgevoerde, voorlopige benchmarks; geen onafhankelijke scores gepubliceerd per 1 oktober 2026."
Guides & Insights

Pareto 26.10 Preview van Unbiased: Een 1M-contextwissel achter dezelfde modelstring

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De integratie verandert niet. Het model erachter wel. Op 1 oktober 2026 verplaatste Unbiased zijn modelstring — pareto — naar Pareto 26.10 Preview, een nieuwe release met een vier keer zo groot contextvenster, een lagere prijs op de gerouteerde catalogus, en een benchmarkoverzicht dat, naar eigen zeggen van de leverancier, voorlopig is en niet in definitieve vorm is gepubliceerd. Als je Pareto vandaag bij zijn naam aanroept, roep je 26.10 Preview aan, en de changelog van de leverancier zegt het in de meest duidelijke bewoordingen: "Pareto 26.10 Preview is nu de huidige Pareto-release… De modelstring blijft pareto."

Die ene regel is het hele verhaal voor iedereen met Pareto in een stack. Dit is geen tweede product dat naast het eerste wordt gelanceerd. Het is het eerste product, ter plaatse vervangen, onder een naam die niet is veranderd — wat betekent dat de versie die je krijgt wordt bepaald door de releasekalender, niet door iets in je verzoek.

Wat is er op 1 oktober eigenlijk veranderd?

Vier dingen zijn verschoven, en ze wijzen niet allemaal dezelfde kant op.

• Contextvenster — 262.144 tokens op de september-Pareto-release, nu 1.048.576. De eigen documentatie van Unbiased vermeldt het cijfer nooit; het aantal komt uit de openbare technische specificatielijst van het model, waar het de limiet per verzoek is zonder dat er een kleinere variant wordt geboden.
• Prijs, zoals gerouteerd — het paar dat gewoonlijk voor Pareto wordt genoemd, was $2,50 per miljoen inputtokens en $7,50 per miljoen output, met gecachte input tegen $0,25. De vermelding voor 26.10 Preview bevat respectievelijk $0,80, $3,20 en $0,03 — ongeveer een derde van het inputtarief en iets meer dan 40% van het outputtarief.
• Benchmarkscores — voor het eerst gepubliceerd voor deze release, en voorlopig volgens de eigen aanduiding van de leverancier.
• De stabiele optie — 26.10 Preview is een preview. De catalogustekst van Unbiased zegt dat het "zonder kennisgeving kan veranderen" en verwijst iedereen die voorspelbaar gedrag nodig heeft in plaats daarvan naar de vorige release.

Al het overige bleef ongewijzigd. De maximale uitvoer is nog steeds 131.072 tokens. Invoer is nog steeds tekst en afbeelding; uitvoer is nog steeds alleen tekst. Er staat nog steeds geen Hugging Face-identifier op de vermelding, dus de gewichten blijven gesloten. En er is nog steeds precies één servingprovider — Unbiased zelf — zonder tweede host in de vermelding.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

De prijs is het deel dat de moeite waard is om twee keer te lezen.

Op Unbiaseds eigen platform bleef de tariefkaart ongewijzigd. Zowel de modelkaart als de prijzenpagina vermeldt nog steeds $ 2,50 per miljoen input, $ 0,25 voor cache, $ 7,50 output — dezelfde drie getallen die de release van september bevatte — en omdat de modelstring pareto bleef, betaalt een klant op de API van de leverancier die tarieven voor 26.10 Preview. De lagere bedragen staan op de listing van de gerouteerde catalogus, en het verschil tussen de twee is precies het soort ding dat een migratie bepaalt.

Twee interpretaties zijn mogelijk en de leverancier heeft niet gezegd welke waar is. Ofwel wordt 26.10 Preview daadwerkelijk goedkoper aangeboden via die route als een introductiecampagne, ofwel vertegenwoordigt de vermelding een andere commerciële regeling dan het directe platform. Unbiased publiceert geen einddatum voor de promotie, en een prijs die op de dag van lancering wordt vastgesteld, is geen toezegging.

Dit is het ene deel van het verhaal waarvan een router de vorm verandert. OrcaRouter geeft de lijstprijs van de provider rechtstreeks door met 0% markup, dus een prijsverlaging van een leverancier staat bij ons dezelfde dag live dat die ingaat in plaats van volgens een contractcyclus — en automatische failover betekent dat een preview-release die zich volgende week anders gedraagt, kan worden vervangen zonder codewijziging. We bieden Unbiased's Pareto 26.10 Preview niet aan, dus de eerlijke versie is dit: als je dit specifieke model wilt, roep het dan aan via Unbiased's eigen API. Het punt is alleen dat bij een preview-release zowel de prijs als de versie variabelen zijn, en geen van beide in code vastgezet zou moeten worden.

Het benchmarkblad, met de labels die erbij zaten

Unbiased heeft vier scores voor 26.10 Preview gepubliceerd, elk gekoppeld aan een gemeten kostenpost per taak, en elk met een voorbehoud dat de leverancier zelf heeft geschreven. Lees ze als door de leverancier uitgevoerd en niet gereproduceerd, want dat is wat ze zijn:

• DeepSWE v1.1 (agentisch coderen) — 69,9%, tegen $0,24 per taak
• Terminal-Bench 4.0 (agentisch terminalgebruik) — 50,8%, tegen $0,48 per taak
• Humanity's Last Exam, alleen tekst (expertredenering) — 49,9%, tegen $0,008 per taak
• GPQA-Diamond (wetenschappelijk redeneren) — 92,4%, tegen $0,004 per taak

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

De framing van de leverancier is dat 26.10 Preview "de Pareto-grens op alle vier de benchmarks evenaart of verlegt". De tabel die naast die claim wordt gepubliceerd is specifieker, en het strekt Unbiased tot eer dat die überhaupt wordt gepubliceerd: op Terminal-Bench 4.0 staat GPT 6 Astra vermeld op 58 en Fable 5.1 op 56, beide boven Pareto's 50.8, en de eigen sectie "waar andere modellen hoger scoren" van de leverancier zegt dat ronduit. Op DeepSWE v1.1 zit de release in een cluster — GLM-5.3 en Kimi K3 staan elk vermeld op 69.0 tegenover Pareto's 69.9 — wat in de praktijk een gelijkspel is en binnen welke foutmarge een enkele run ook draagt.

De vergelijkingscijfers bevatten een tweede voorbehoud dat belangrijker is dan het eerste: ze zijn overgenomen uit een vergelijking van 21 september en zijn, in de woorden van de leverancier, "niet onafhankelijk gevalideerd", en ze zijn geproduceerd in een afzonderlijke evaluatie van individuele modellen — dus ze mogen niet met Pareto's kosten-per-taakcijfers worden gecombineerd alsof beide van dezelfde testbank afkomstig zijn. De leverancier zegt dit in de evaluatiedetails. Een lezer die die regel overslaat, zal de grafiek overinterpreteren.

Wat dit allemaal niet is: onafhankelijk. Artificial Analysis, het scorebord dat de meeste teams raadplegen voordat ze een nieuwe naam op een prijslijst vertrouwen, heeft helemaal geen pagina voor Pareto. Elk cijfer hierboven is geproduceerd door het bedrijf dat het model verkoopt. Het enige dat dit verzacht, is dat de eval-harness openbaar is — de leverancier publiceert een reproduceerbare head-to-head-suite die iedereen kan richten op een endpoint — waardoor "vertrouw op onze score" verandert in "draai onze score opnieuw". Dat is een echt aanbod, en het is niet hetzelfde als een geverifieerd cijfer. Niemand heeft die herhaling nog gepubliceerd.

Wat "preview" in het contract betekent

Het woord verricht hier meer werk dan de releaseopmerkingen doen. De eigen documentatie van Unbiased beschrijft de huidige toegang als evaluatietoegang onder zijn voorwaarden, en stelt dat commercieel of productiegebruik een aparte schriftelijke overeenkomst vereist. Nieuwe accounts worden handmatig beoordeeld voordat een API-sleutel wordt uitgegeven. De API is compatibel met OpenAI en Anthropic — basis-URL, sleutel, modelstring, geen herschrijving — maar het gedocumenteerde oppervlak is alleen chat completions en messages, met bekende hiaten die de leverancier openlijk vermeldt: GET /v1/models is niet geïmplementeerd en onbekende model-ID's worden niet afgewezen, dus moeten aanroepers expliciet pareto meesturen in plaats van te ontdekken wat beschikbaar is.

Zet het preview-label en het private-bèta-contract bij elkaar en het operationele advies schrijft zichzelf. Dit is een model om te evalueren tegen je eigen workload achter een routeringslaag, niet een om voor omzetverkeer te zetten en te vergeten. Het mechanisme daarvoor is weinig glamoureus: een fallbackketen die één keer wordt geconfigureerd, zodat een release die midden in de week onder je verandert een configuratiewijziging wordt in plaats van een incident. Unbiased besteedde september aan het oplossen van precies deze klasse van problemen aan zijn eigen kant — een changelog-vermelding van 16 september meldt dat ongeveer 13% van de lange, niet-streamende verzoeken tegen een time-out van 120 seconden aanliep, en het plafond van de gateway werd verhoogd naar 300 seconden. Dat is een leverancier die openhartig is over een ruwe kant. Het is ook een herinnering dat het operationele profiel van een preview nog steeds wordt geschreven.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

Waar je op moet letten voordat je je vastlegt

Drie specifieke dingen zouden de openstaande vragen beslechten, en elk daarvan is controleerbaar.

De eerste is een onafhankelijke score. Totdat een derde partij 26.10 Preview op een gepubliceerde harness uitvoert, zijn de 92,4 op GPQA-Diamond en de 50,8 op Terminal-Bench leveranciersclaims over leverancierswerk — goed genoeg om te beslissen of het getest moet worden, niet goed genoeg om te beslissen of er gemigreerd moet worden.

Het tweede is wat de preview met de prijs doet. Als de doorgestuurde listing op $0,80 en $3,20 blijft staan terwijl het eigen platform van de leverancier $2,50 en $7,50 aanhoudt, dan is dat verschil een kanaalbeslissing die het waard is om te begrijpen voordat je een kostenmodel bouwt op een van beide getallen.

Het derde is wat "kan zonder kennisgeving worden gewijzigd" in de praktijk blijkt te betekenen. Een preview die twee keer in één maand wordt herzien, is een ander instrument dan een die aan het einde van het kwartaal wordt bevroren en hernoemd, en de changelog is waar dat het eerst te zien zal zijn.

Niets hiervan pleit tegen het proberen. Een multimodaal model met 1M tokens dat scores in de buurt van de frontier rapporteert tegen $0,24 per taak, is een middag echt werk aan je eigen prompts waard, en die evaluatie kost minder dan de discussie erover. Het pleit tegen de veronderstelling dat het model dat je deze week benchmarkt, het model is dat je volgende week krijgt — wat, voor een release die de leverancier zelf een preview noemt, de enige veronderstelling is die juist moet zijn.

Een preview-release is precies het geval waarvoor automatische failover is gebouwd: automatische failoververandert een model dat midden in de week onder je vandaan verandert in een configuratiewijziging in plaats van een storing.