
Pratinjau Pareto 26.10 dari Unbiased: Pertukaran Konteks 1 Juta di Balik String Model yang Sama
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 221 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Integrasinya tidak berubah. Model di baliknya yang berubah. Pada 1 Oktober 2026, Unbiased memindahkan string modelnya — pareto — ke Pareto 26.10 Preview, sebuah rilis baru dengan jendela konteks empat kali lebih besar, harga yang lebih rendah pada katalog yang dirutekan, dan lembar benchmark yang, menurut pengakuan vendor sendiri, masih awal dan belum dipublikasikan dalam bentuk final. Jika Anda memanggil Pareto hari ini dengan namanya, Anda memanggil 26.10 Preview, dan catatan perubahan vendor mengatakan demikian dengan istilah yang paling gamblang: "Pareto 26.10 Preview kini menjadi rilis Pareto terkini… String modelnya tetap pareto."
Baris tunggal itu adalah keseluruhan ceritanya bagi siapa pun yang memiliki Pareto dalam sebuah stack. Ini bukan produk kedua yang diluncurkan bersama produk pertama. Ini adalah produk pertama, yang digantikan di tempat, dengan nama yang tidak berubah — yang berarti versi yang Anda dapatkan ditentukan oleh kalender rilis, bukan oleh apa pun dalam permintaan Anda.
Apa yang sebenarnya berubah pada 1 Oktober
Empat hal bergerak, dan tidak semuanya mengarah ke arah yang sama.
• Jendela konteks — 262.144 token pada rilis Pareto September, kini 1.048.576. Dokumentasi Unbiased sendiri tidak pernah menyebutkan angka itu; angka tersebut berasal dari daftar teknis publik model, yang merupakan batas per permintaan tanpa opsi tingkat yang lebih kecil.
• Harga, sesuai perutean — pasangan yang umum dikutip untuk Pareto adalah $2,50 per juta token input dan $7,50 per juta token output, dengan input yang di-cache sebesar $0,25. Daftar 26.10 Preview memuat $0,80, $3,20, dan $0,03 secara berturut-turut — sekitar sepertiga dari tarif input dan sedikit di atas 40% dari tarif output.
• Skor benchmark — diterbitkan untuk pertama kalinya untuk rilis ini, dan bersifat awal menurut label vendor sendiri.
• Opsi stabil — 26.10 Preview adalah versi preview. Teks katalog Unbiased menyatakan bahwa versi ini "dapat berubah tanpa pemberitahuan" dan mengarahkan siapa pun yang membutuhkan perilaku yang dapat diprediksi ke rilis sebelumnya.
Semua hal lainnya tetap berlaku. Keluaran maksimum masih 131,072 token. Input masih berupa teks dan gambar; output masih hanya teks. Masih tidak ada pengenal Hugging Face pada listing, jadi bobotnya tetap tertutup. Dan masih ada tepat satu penyedia layanan — Unbiased sendiri — tanpa host kedua di dalam listing.

Harganya adalah bagian yang layak dibaca dua kali.
Di platform Unbiased sendiri, daftar tarif tidak berubah. Kartu model dan halaman harga keduanya masih mencantumkan $2.50 per juta input, $0.25 di-cache, $7.50 output — tiga angka yang sama yang tercantum pada rilis September — dan karena string model tetap pareto, pelanggan pada API vendor membayar tarif tersebut untuk 26.10 Preview. Angka yang lebih rendah adalah yang ada di daftar katalog yang dirutekan, dan selisih antara keduanya justru hal yang menentukan sebuah migrasi.
Dua penafsiran mungkin terjadi dan vendor tidak mengatakan mana yang benar. Entah 26.10 Preview memang ditawarkan lebih murah melalui jalur itu sebagai dorongan perkenalan, atau daftar tersebut mewakili pengaturan komersial yang berbeda dari yang langsung. Unbiased tidak menerbitkan tanggal berakhirnya promosi, dan harga yang ditetapkan pada hari peluncuran bukanlah sebuah komitmen.
Ini adalah satu bagian dari cerita yang bentuknya diubah oleh router. OrcaRouter meneruskan harga daftar penyedia langsung dengan markup 0%, sehingga pemotongan harga vendor langsung berlaku di sisi kami pada hari yang sama saat ditetapkan, bukan pada siklus kontrak — dan failover otomatis berarti rilis pratinjau yang berperilaku berbeda minggu depan dapat ditukar tanpa perubahan kode. Kami tidak menyediakan Pareto 26.10 Preview milik Unbiased, jadi versi jujurnya adalah ini: jika Anda menginginkan model spesifik ini, panggil melalui API milik Unbiased sendiri. Intinya hanyalah bahwa pada rilis pratinjau, harga dan versi keduanya merupakan variabel, dan tidak ada yang boleh dipatok dalam kode.
Lembar tolok ukur, dengan label yang disertakan bersamanya.
Unbiased menerbitkan empat skor untuk 26.10 Preview, masing-masing dipasangkan dengan biaya terukur per tugas, dan masing-masing membawa catatan yang ditulis vendor sendiri. Bacalah semuanya sebagai dijalankan vendor dan tidak direproduksi, karena memang itulah kenyataannya:
• DeepSWE v1.1 (pengodean agentik) — 69,9%, dengan biaya $0,24 per tugas
• Terminal-Bench 4.0 (penggunaan terminal agentik) — 50,8%, dengan biaya $0,48 per tugas
• Humanity's Last Exam, hanya teks (penalaran ahli) — 49,9%, dengan biaya $0,008 per tugas
• GPQA-Diamond (penalaran sains) — 92,4%, dengan biaya $0,004 per tugas

Cara vendor membingkai klaim ini adalah bahwa 26.10 Preview "menyamai atau menetapkan frontier Pareto pada keempat benchmark." Lembar data yang diterbitkannya bersama klaim tersebut lebih spesifik, dan merupakan suatu kredit bagi Unbiased bahwa lembar itu sampai diterbitkan: pada Terminal-Bench 4.0, GPT 6 Astra tercatat pada 58 dan Fable 5.1 pada 56, keduanya di atas 50,8 milik Pareto, dan bagian "di mana model lain mendapat skor lebih tinggi" milik vendor itu sendiri mengatakan hal itu secara langsung. Pada DeepSWE v1.1, rilis ini berada dalam sebuah klaster — GLM-5.3 dan Kimi K3 masing-masing tercatat pada 69,0 berbanding 69,9 milik Pareto — yang dalam praktiknya merupakan hasil imbang dan berada di dalam batas galat apa pun yang dibawa oleh satu kali run.
Angka-angka perbandingan itu mengandung peringatan kedua yang lebih penting daripada yang pertama: angka-angka tersebut disalin dari perbandingan 21 September dan, dalam kata-kata vendor, "tidak divalidasi secara independen," dan angka-angka itu dihasilkan dalam evaluasi terpisah terhadap masing-masing model — jadi angka-angka itu tidak boleh dipasangkan dengan angka biaya per tugas Pareto seolah-olah keduanya berasal dari pengujian yang sama. Vendor menyatakannya dalam detail evaluasi. Pembaca yang melewatkan baris itu akan membaca grafik secara berlebihan.
Yang tidak dimiliki semua ini: independensi. Artificial Analysis, papan peringkat yang paling banyak dicek tim sebelum mempercayai nama baru di lembar harga, tidak punya halaman untuk Pareto sama sekali. Setiap angka di atas dihasilkan oleh perusahaan yang menjual model tersebut. Satu hal yang meringankannya adalah harness eval-nya bersifat publik — vendor menerbitkan rangkaian uji head-to-head yang dapat direproduksi yang bisa diarahkan siapa pun ke sebuah endpoint — yang mengubah "percayai skor kami" menjadi "jalankan ulang skor kami". Itu tawaran nyata dan tidak sama dengan angka yang terverifikasi. Belum ada yang menerbitkan hasil jalankan ulangnya.
Apa arti "preview" dalam kontrak
Kata itu melakukan lebih banyak pekerjaan di sini daripada yang dilakukan catatan rilis. Dokumentasi Unbiased sendiri menggambarkan akses saat ini sebagai akses evaluasi berdasarkan ketentuannya, dan menyatakan bahwa penggunaan komersial atau produksi memerlukan perjanjian tertulis terpisah. Akun baru ditinjau secara manual sebelum kunci API diterbitkan. API ini kompatibel dengan OpenAI dan Anthropic — base URL, kunci, string model, tanpa penulisan ulang — tetapi permukaan yang didokumentasikan hanya chat completions dan messages, dengan celah yang diketahui yang dicantumkan secara terbuka oleh vendor: GET /v1/models tidak diimplementasikan dan pengenal model yang tidak dikenal tidak ditolak, jadi pemanggil harus mengirim pareto secara eksplisit alih-alih menemukan sendiri apa yang tersedia.
Gabungkan label pratinjau dan kontrak beta privat, dan saran operasionalnya akan tersusun sendiri. Ini adalah model untuk dievaluasi terhadap beban kerja Anda sendiri di balik lapisan perutean, bukan model untuk ditaruh di depan trafik pendapatan lalu dilupakan. Mekanisme untuk itu tidak glamor: rantai fallback yang dikonfigurasi sekali, sehingga rilis yang berubah di bawah Anda di tengah minggu menjadi perubahan konfigurasi, bukan insiden. Unbiased menghabiskan September untuk memperbaiki persis kelas masalah ini di sisinya sendiri — sebuah entri changelog dari 16 September mencatat bahwa sekitar 13% permintaan non-streaming yang panjang terkena timeout 120 detik, dan plafon gateway dinaikkan menjadi 300 detik. Itu adalah vendor yang berterus terang tentang sisi kasar. Itu juga menjadi pengingat bahwa profil operasional sebuah pratinjau masih sedang ditulis.

Apa yang perlu diperhatikan sebelum Anda berkomitmen
Tiga hal spesifik akan menjawab pertanyaan yang masih terbuka, dan masing-masing dapat diperiksa.
Yang pertama adalah skor independen. Sampai pihak ketiga menjalankan 26.10 Preview pada harness yang dipublikasikan, angka 92,4 pada GPQA-Diamond dan 50,8 pada Terminal-Bench hanyalah klaim vendor tentang pekerjaan vendor — cukup baik untuk memutuskan apakah akan menguji, belum cukup baik untuk memutuskan apakah akan bermigrasi.
Kedua adalah apa yang dilakukan pratinjau terhadap harga. Jika listing yang dirutekan tetap di $0,80 dan $3,20 sementara platform milik vendor sendiri mematok $2,50 dan $7,50, perbedaannya adalah keputusan kanal yang layak dipahami sebelum Anda membangun model biaya berdasarkan salah satu angka tersebut.
Yang ketiga adalah apa yang ternyata dimaksudkan oleh "dapat berubah tanpa pemberitahuan" dalam praktik. Pratinjau yang direvisi dua kali dalam sebulan adalah instrumen yang berbeda dari yang dibekukan dan diganti namanya pada akhir kuartal, dan changelog adalah tempat hal itu akan muncul lebih dulu.
Semua ini tidak menjadi alasan untuk tidak mencobanya. Model multimodal 1 juta token yang melaporkan skor mendekati frontier dengan biaya $0,24 per tugas layak untuk dikerjakan sungguh-sungguh selama satu sore pada prompt Anda sendiri, dan evaluasi itu lebih murah daripada perdebatan tentangnya. Ini menentang anggapan bahwa model yang Anda uji benchmark minggu ini adalah model yang Anda dapatkan minggu depan — yang, untuk rilis yang oleh vendornya sendiri disebut pratinjau, adalah satu-satunya asumsi yang perlu benar.
Rilis pratinjau justru merupakan kasus yang menjadi alasan failover otomatis dibuat: failover otomatis mengubah model yang berubah di bawah Anda pada pertengahan minggu menjadi perubahan konfigurasi alih-alih gangguan.
