Kartu judul yang dihasilkan berjudul "Unbiased's Pareto 26.10 Preview" dengan subjudul "Pertukaran konteks 1M di balik string model yang sama", di atas tiga kartu bertuliskan "Dirilis: 1 Okt 2026", "Konteks: 1.048.576 token" dan "Harga routed: $0,80 / $3,20 per 1 juta", dengan footer bertuliskan "Benchmark awal yang dijalankan vendor; belum ada skor independen yang dipublikasikan per 1 Okt 2026."
Guides & Insights

Pratinjau Pareto 26.10 dari Unbiased: Pertukaran Konteks 1 Juta di Balik String Model yang Sama

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Integrasinya tidak berubah. Model di baliknya yang berubah. Pada 1 Oktober 2026, Unbiased memindahkan string modelnya — pareto — ke Pareto 26.10 Preview, sebuah rilis baru dengan jendela konteks empat kali lebih besar, harga yang lebih rendah pada katalog yang dirutekan, dan lembar benchmark yang, menurut pengakuan vendor sendiri, masih awal dan belum dipublikasikan dalam bentuk final. Jika Anda memanggil Pareto hari ini dengan namanya, Anda memanggil 26.10 Preview, dan catatan perubahan vendor mengatakan demikian dengan istilah yang paling gamblang: "Pareto 26.10 Preview kini menjadi rilis Pareto terkini… String modelnya tetap pareto."

Baris tunggal itu adalah keseluruhan ceritanya bagi siapa pun yang memiliki Pareto dalam sebuah stack. Ini bukan produk kedua yang diluncurkan bersama produk pertama. Ini adalah produk pertama, yang digantikan di tempat, dengan nama yang tidak berubah — yang berarti versi yang Anda dapatkan ditentukan oleh kalender rilis, bukan oleh apa pun dalam permintaan Anda.

Apa yang sebenarnya berubah pada 1 Oktober

Empat hal bergerak, dan tidak semuanya mengarah ke arah yang sama.

• Jendela konteks — 262.144 token pada rilis Pareto September, kini 1.048.576. Dokumentasi Unbiased sendiri tidak pernah menyebutkan angka itu; angka tersebut berasal dari daftar teknis publik model, yang merupakan batas per permintaan tanpa opsi tingkat yang lebih kecil.
• Harga, sesuai perutean — pasangan yang umum dikutip untuk Pareto adalah $2,50 per juta token input dan $7,50 per juta token output, dengan input yang di-cache sebesar $0,25. Daftar 26.10 Preview memuat $0,80, $3,20, dan $0,03 secara berturut-turut — sekitar sepertiga dari tarif input dan sedikit di atas 40% dari tarif output.
• Skor benchmark — diterbitkan untuk pertama kalinya untuk rilis ini, dan bersifat awal menurut label vendor sendiri.
• Opsi stabil — 26.10 Preview adalah versi preview. Teks katalog Unbiased menyatakan bahwa versi ini "dapat berubah tanpa pemberitahuan" dan mengarahkan siapa pun yang membutuhkan perilaku yang dapat diprediksi ke rilis sebelumnya.

Semua hal lainnya tetap berlaku. Keluaran maksimum masih 131,072 token. Input masih berupa teks dan gambar; output masih hanya teks. Masih tidak ada pengenal Hugging Face pada listing, jadi bobotnya tetap tertutup. Dan masih ada tepat satu penyedia layanan — Unbiased sendiri — tanpa host kedua di dalam listing.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

Harganya adalah bagian yang layak dibaca dua kali.

Di platform Unbiased sendiri, daftar tarif tidak berubah. Kartu model dan halaman harga keduanya masih mencantumkan $2.50 per juta input, $0.25 di-cache, $7.50 output — tiga angka yang sama yang tercantum pada rilis September — dan karena string model tetap pareto, pelanggan pada API vendor membayar tarif tersebut untuk 26.10 Preview. Angka yang lebih rendah adalah yang ada di daftar katalog yang dirutekan, dan selisih antara keduanya justru hal yang menentukan sebuah migrasi.

Dua penafsiran mungkin terjadi dan vendor tidak mengatakan mana yang benar. Entah 26.10 Preview memang ditawarkan lebih murah melalui jalur itu sebagai dorongan perkenalan, atau daftar tersebut mewakili pengaturan komersial yang berbeda dari yang langsung. Unbiased tidak menerbitkan tanggal berakhirnya promosi, dan harga yang ditetapkan pada hari peluncuran bukanlah sebuah komitmen.

Ini adalah satu bagian dari cerita yang bentuknya diubah oleh router. OrcaRouter meneruskan harga daftar penyedia langsung dengan markup 0%, sehingga pemotongan harga vendor langsung berlaku di sisi kami pada hari yang sama saat ditetapkan, bukan pada siklus kontrak — dan failover otomatis berarti rilis pratinjau yang berperilaku berbeda minggu depan dapat ditukar tanpa perubahan kode. Kami tidak menyediakan Pareto 26.10 Preview milik Unbiased, jadi versi jujurnya adalah ini: jika Anda menginginkan model spesifik ini, panggil melalui API milik Unbiased sendiri. Intinya hanyalah bahwa pada rilis pratinjau, harga dan versi keduanya merupakan variabel, dan tidak ada yang boleh dipatok dalam kode.

Lembar tolok ukur, dengan label yang disertakan bersamanya.

Unbiased menerbitkan empat skor untuk 26.10 Preview, masing-masing dipasangkan dengan biaya terukur per tugas, dan masing-masing membawa catatan yang ditulis vendor sendiri. Bacalah semuanya sebagai dijalankan vendor dan tidak direproduksi, karena memang itulah kenyataannya:

• DeepSWE v1.1 (pengodean agentik) — 69,9%, dengan biaya $0,24 per tugas
• Terminal-Bench 4.0 (penggunaan terminal agentik) — 50,8%, dengan biaya $0,48 per tugas
• Humanity's Last Exam, hanya teks (penalaran ahli) — 49,9%, dengan biaya $0,008 per tugas
• GPQA-Diamond (penalaran sains) — 92,4%, dengan biaya $0,004 per tugas

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

Cara vendor membingkai klaim ini adalah bahwa 26.10 Preview "menyamai atau menetapkan frontier Pareto pada keempat benchmark." Lembar data yang diterbitkannya bersama klaim tersebut lebih spesifik, dan merupakan suatu kredit bagi Unbiased bahwa lembar itu sampai diterbitkan: pada Terminal-Bench 4.0, GPT 6 Astra tercatat pada 58 dan Fable 5.1 pada 56, keduanya di atas 50,8 milik Pareto, dan bagian "di mana model lain mendapat skor lebih tinggi" milik vendor itu sendiri mengatakan hal itu secara langsung. Pada DeepSWE v1.1, rilis ini berada dalam sebuah klaster — GLM-5.3 dan Kimi K3 masing-masing tercatat pada 69,0 berbanding 69,9 milik Pareto — yang dalam praktiknya merupakan hasil imbang dan berada di dalam batas galat apa pun yang dibawa oleh satu kali run.

Angka-angka perbandingan itu mengandung peringatan kedua yang lebih penting daripada yang pertama: angka-angka tersebut disalin dari perbandingan 21 September dan, dalam kata-kata vendor, "tidak divalidasi secara independen," dan angka-angka itu dihasilkan dalam evaluasi terpisah terhadap masing-masing model — jadi angka-angka itu tidak boleh dipasangkan dengan angka biaya per tugas Pareto seolah-olah keduanya berasal dari pengujian yang sama. Vendor menyatakannya dalam detail evaluasi. Pembaca yang melewatkan baris itu akan membaca grafik secara berlebihan.

Yang tidak dimiliki semua ini: independensi. Artificial Analysis, papan peringkat yang paling banyak dicek tim sebelum mempercayai nama baru di lembar harga, tidak punya halaman untuk Pareto sama sekali. Setiap angka di atas dihasilkan oleh perusahaan yang menjual model tersebut. Satu hal yang meringankannya adalah harness eval-nya bersifat publik — vendor menerbitkan rangkaian uji head-to-head yang dapat direproduksi yang bisa diarahkan siapa pun ke sebuah endpoint — yang mengubah "percayai skor kami" menjadi "jalankan ulang skor kami". Itu tawaran nyata dan tidak sama dengan angka yang terverifikasi. Belum ada yang menerbitkan hasil jalankan ulangnya.

Apa arti "preview" dalam kontrak

Kata itu melakukan lebih banyak pekerjaan di sini daripada yang dilakukan catatan rilis. Dokumentasi Unbiased sendiri menggambarkan akses saat ini sebagai akses evaluasi berdasarkan ketentuannya, dan menyatakan bahwa penggunaan komersial atau produksi memerlukan perjanjian tertulis terpisah. Akun baru ditinjau secara manual sebelum kunci API diterbitkan. API ini kompatibel dengan OpenAI dan Anthropic — base URL, kunci, string model, tanpa penulisan ulang — tetapi permukaan yang didokumentasikan hanya chat completions dan messages, dengan celah yang diketahui yang dicantumkan secara terbuka oleh vendor: GET /v1/models tidak diimplementasikan dan pengenal model yang tidak dikenal tidak ditolak, jadi pemanggil harus mengirim pareto secara eksplisit alih-alih menemukan sendiri apa yang tersedia.

Gabungkan label pratinjau dan kontrak beta privat, dan saran operasionalnya akan tersusun sendiri. Ini adalah model untuk dievaluasi terhadap beban kerja Anda sendiri di balik lapisan perutean, bukan model untuk ditaruh di depan trafik pendapatan lalu dilupakan. Mekanisme untuk itu tidak glamor: rantai fallback yang dikonfigurasi sekali, sehingga rilis yang berubah di bawah Anda di tengah minggu menjadi perubahan konfigurasi, bukan insiden. Unbiased menghabiskan September untuk memperbaiki persis kelas masalah ini di sisinya sendiri — sebuah entri changelog dari 16 September mencatat bahwa sekitar 13% permintaan non-streaming yang panjang terkena timeout 120 detik, dan plafon gateway dinaikkan menjadi 300 detik. Itu adalah vendor yang berterus terang tentang sisi kasar. Itu juga menjadi pengingat bahwa profil operasional sebuah pratinjau masih sedang ditulis.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

Apa yang perlu diperhatikan sebelum Anda berkomitmen

Tiga hal spesifik akan menjawab pertanyaan yang masih terbuka, dan masing-masing dapat diperiksa.

Yang pertama adalah skor independen. Sampai pihak ketiga menjalankan 26.10 Preview pada harness yang dipublikasikan, angka 92,4 pada GPQA-Diamond dan 50,8 pada Terminal-Bench hanyalah klaim vendor tentang pekerjaan vendor — cukup baik untuk memutuskan apakah akan menguji, belum cukup baik untuk memutuskan apakah akan bermigrasi.

Kedua adalah apa yang dilakukan pratinjau terhadap harga. Jika listing yang dirutekan tetap di $0,80 dan $3,20 sementara platform milik vendor sendiri mematok $2,50 dan $7,50, perbedaannya adalah keputusan kanal yang layak dipahami sebelum Anda membangun model biaya berdasarkan salah satu angka tersebut.

Yang ketiga adalah apa yang ternyata dimaksudkan oleh "dapat berubah tanpa pemberitahuan" dalam praktik. Pratinjau yang direvisi dua kali dalam sebulan adalah instrumen yang berbeda dari yang dibekukan dan diganti namanya pada akhir kuartal, dan changelog adalah tempat hal itu akan muncul lebih dulu.

Semua ini tidak menjadi alasan untuk tidak mencobanya. Model multimodal 1 juta token yang melaporkan skor mendekati frontier dengan biaya $0,24 per tugas layak untuk dikerjakan sungguh-sungguh selama satu sore pada prompt Anda sendiri, dan evaluasi itu lebih murah daripada perdebatan tentangnya. Ini menentang anggapan bahwa model yang Anda uji benchmark minggu ini adalah model yang Anda dapatkan minggu depan — yang, untuk rilis yang oleh vendornya sendiri disebut pratinjau, adalah satu-satunya asumsi yang perlu benar.

Rilis pratinjau justru merupakan kasus yang menjadi alasan failover otomatis dibuat: failover otomatis mengubah model yang berubah di bawah Anda pada pertengahan minggu menjadi perubahan konfigurasi alih-alih gangguan.