
GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol: Bobot Sama, Tingkat Layanan Berbeda
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 610 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 189 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
GPT-5.6 Sol Ultrafast bukan model baru, dan ini bukan cerita peluncuran. Vendor mengumumkan mode tersebut pada 13 Agustus 2026, dan pada hari yang sama nilai ultrafast muncul dalam skema OpenAPI publik perusahaan, di dalam deskripsi ServiceTierResponses pada spesifikasi — yang dengan kata-katanya sendiri membatasi tier tersebut ke endpoint gpt-5.6-sol dan menandainya sebagai dikontrol akses. Yang membuat halaman ini kembali masuk antrean kami lebih kecil dan lebih spesifik: pada 25 September 2026, commit fe4f7a1 memperluas nilai itu ke dua enumerasi lain, parameter service-tier tingkat permintaan dan bidang kebijakan service-tier agen. Enam minggu setelah pengumuman, tier tersebut masih dalam daftar tunggu, masih belum memiliki harga yang dipublikasikan, dan kini terhubung ke lebih banyak permukaan API daripada yang benar-benar dapat dilayaninya. GPT-5.6 Sol Ultrafast dan GPT-5.6 Sol adalah model yang sama; satu-satunya hal yang dapat diputuskan oleh perbandingan ini adalah siapa yang mengendalikan penunjuknya dan siapa yang telah memberi tahu Anda biayanya.
Jadi, pertarungan di judul ini tidak biasa. GPT-5.6 Sol Ultrafast dan GPT-5.6 Sol adalah model yang sama. Bobot yang sama, checkpoint yang sama, perilaku penalaran yang sama, jendela konteks 1,05 juta token yang sama, output maksimum 128K yang sama, jawaban yang sama. Kerangka OpenAI sendiri adalah "lebih banyak pekerjaan berguna per detik," bukan model yang lebih pintar. Satu-satunya hal yang berbeda antara dua kolom perbandingan ini adalah bagaimana token dihasilkan dan apa nama tier dalam body permintaan Anda — yang menjadikannya eksperimen kontrol paling bersih di jajaran saat ini, dan juga yang paling sulit untuk dibeli, karena salah satu dari dua tier tersebut tidak memiliki harga yang dipublikasikan sama sekali.
Apa yang sebenarnya berubah minggu ini
Bukti untuk perubahan September adalah sebuah commit, bukan posting blog. OpenAI memelihara openai-openapi, repositori yang menerbitkan skema yang dapat dibaca mesin untuk API-nya, dan commit fe4f7a1 — bertanggal 2026-09-25 — menambahkan ultrafast ke dua enumerasi: kebijakan tingkat layanan yang dilampirkan pada agen, dan bidang tingkat permintaan yang dijelaskan spesifikasi sebagai "tingkat layanan yang digunakan untuk permintaan model." Itu adalah perluasan, bukan debut: sebelum commit ini kedua daftar tersebut berbunyi auto, default, flex, priority, fast, dan tingkat tersebut sudah ada dalam skema sejak 13 Agustus. Commit ini layak dicatat karena bidang yang dijangkauinya — bidang kebijakan tempat agen dikonfigurasi, yang merupakan permukaan berbeda dari override per permintaan.
Deskripsi yang penting berasal dari commit 13 Agustus, bukan yang ini, dan itu adalah pernyataan paling spesifik yang pernah diterbitkan OpenAI tentang tier tersebut di mana pun. Di samping nilai baru, spesifikasi tersebut berbunyi: "Jika diatur ke 'ultrafast', maka permintaan akan diproses dengan tier layanan Ultrafast Processing yang dikendalikan akses. Tier ini saat ini tersedia untuk gpt-5.6-sol; respons yang dilayani melaluinya akan menampilkan service_tier=ultrafast."
Baca kalimat itu dua kali, karena kalimat itu menuntaskan dua pertanyaan yang jika tidak, harus dijawab secara mendua oleh halaman perbandingan ini. Tingkat ini hanya mencakup satu model — GPT-5.6 Sol unggulan dan tidak ada yang lain dalam jajaran — dan aksesnya terkendali, bukan terbuka, yang sesuai dengan cara OpenAI menggambarkan pratinjau dengan daftar tunggu. Kalimat itu juga memberi tahu Anda bagaimana Anda akan tahu bahwa Anda mendapatkannya: responsnya menggemakan kembali tingkat mana yang sebenarnya melayani permintaan tersebut, sehingga fallback ke pemrosesan standar terlihat di isi respons, bukan sesuatu yang harus Anda simpulkan dari latensi. Deskripsi yang sama muncul di kedua skema Responses standar dan Beta, dan sudah demikian sejak 13 Agustus.
![A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."](https://cms.orcarouter.ai/api/media/file/2-1341.png)
Sinyal kedua yang lebih lemah muncul keesokan harinya. Laporan tertanggal 26 September menjabarkan pemilih Speed baru — Fast, Standard, dan Ultrafast — yang akan hadir di Responses API Playground, dengan ketersediaan Ultrafast yang lebih luas diperkirakan menyusul setelah konferensi pengembang DevDay OpenAI. Kami sendiri belum melihat pemilih tersebut dan OpenAI belum menerbitkan catatan peluncuran, jadi anggap itu sebagai laporan dari satu sumber, bukan fitur yang sudah dirilis. Bagian yang bisa diverifikasi hari ini adalah dua titik dalam skema publik dan fakta bahwa belum ada daftar tarif yang muncul untuk tier tersebut.
Apa yang tidak berubah sama pentingnya. Masih belum ada harga Ultrafast. Halaman harga OpenAI, yang dibaca pada 27 September, memuat empat tab yang sebelumnya ada — Standard, Batch, Flex, dan Fast — dan string "ultrafast" tidak muncul di mana pun di dalamnya. Akses masih digambarkan sebagai pratinjau terbatas untuk pelanggan terpilih, yang diperluas seiring bertambahnya kapasitas. Tier ini ada di dalam kontrak sekaligus tidak ada di daftar harga, dan itulah kondisi jujurnya.
Dua tingkatan, berdampingan
Karena tidak ada kemampuan yang membedakan keduanya, perbandingannya hampir sepenuhnya mengerucut pada penyajian dan penagihan. Setiap baris di bawah ini memuat kedua sisi dalam satu baris.
• Model — GPT-5.6 Sol Ultrafast menjalankan checkpoint GPT-5.6 Sol yang identik dibandingkan pemrosesan standar GPT-5.6 Sol, checkpoint yang sama, tanpa distilasi, tanpa pengurangan ukuran.
• Throughput keluaran — hingga 750 token keluaran per detik, hingga 14× standar, menurut pengumuman OpenAI pada 13 Agustus, dibandingkan dengan pemrosesan GPT-5.6 Sol standar pada klaster GPU, yang merupakan angka acuan pengukuran 14×.
• Perangkat keras — chip skala wafer Cerebras, bobot tersimpan di SRAM on-chip, produk pertama dari kemitraan komputasi Januari 2026 OpenAI dengan Cerebras yang dilaporkan bernilai sekitar $10 miliar selama tiga tahun vs inferensi GPU konvensional, di mana sebagian besar waktu digunakan untuk memindahkan bobot antara memori dan komputasi.
• Harga — belum dipublikasikan per 27 September 2026 vs $4,00 input / $20,00 output per juta token, tarif promosi OpenAI saat ini, ditambah $0,40 per juta untuk input yang di-cache.
• Ketersediaan — pratinjau terbatas dengan daftar tunggu untuk pelanggan tertentu vs jalur bawaan, yang dapat dipanggil oleh siapa pun yang memiliki kunci API.
• Jawaban yang Anda dapatkan kembali — identik, secara prinsip vs identik, secara prinsip; jika jawaban itu berbeda pada prompt yang sama, itu adalah temuan, bukan fitur.

Klaim kecepatan, dan batas atasnya
Angka utama adalah 14× dan angka itu layak mendapat perhatian yang sama seperti bagian lain halaman ini. OpenAI menyatakan hingga 750 token keluaran per detik dibandingkan pemrosesan standar — sebuah angka throughput untuk keluaran token, bukan klaim bahwa setiap permintaan selesai 14 kali lebih cepat. Waktu end-to-end juga mencakup pemrosesan input dan penalaran model itu sendiri, yang keduanya tidak dipadatkan oleh perangkat keras wafer-scale pada rasio yang sama. Itulah sebabnya perusahaan ini menyebut 14× sebagai angka maksimum, bukan hasil pengukuran.
Perbandingan yang dipublikasikan dilaporkan oleh vendor di kedua sisi tabel, dan salah satunya mencakup stack dua vendor. Sebuah uji Humanity's Last Exam dengan 2.500 pertanyaan dilaporkan selesai dalam 11 jam 11 menit pada Ultrafast versus 78 jam 27 menit untuk Claude Fable 5, dengan akurasi yang sebanding — itu adalah OpenAI dan Cerebras yang memberi tahu kita tentang tolok ukur yang mencakup model pesaing, dan liputan independen atas peluncuran tersebut mengutip perbandingan kecepatan generasi yang lebih sempit, sekitar 11×, pada uji yang sama, sementara angka Cerebras sendiri menyiratkan sekitar 7× untuk total waktu uji. Kesenjangan antara 14×, 11×, dan 7× bukanlah kontradiksi; itulah yang terjadi ketika tiga pihak mengukur bagian yang berbeda dari satu beban kerja. Cerebras secara terpisah melaporkan 5,6× end-to-end pada GDP-Val tanpa kehilangan kualitas yang terukur. Tidak ada satu pun dari semua itu yang telah direproduksi oleh pihak ketiga.
Daftar harga itu ada yang bolong.
Di sinilah kedua tier tidak lagi simetris. GPT-5.6 Sol memiliki empat kartu tarif yang dipublikasikan dan Ultrafast bukan salah satunya.
• Standar GPT-5.6 Sol — $4,00 / $20,00 per juta token, dengan input yang di-cache sebesar $0,40 dan tier konteks panjang sebesar $8,00 / $30,00 setelah input melewati sekitar 272K token.
Fast mode — $8.00 / $40.00, tepat dua kali tarif standar. Ini adalah tier yang diubah namanya dari Priority processing pada 30 Juli 2026, dan API menerima service_tier: "priority" atau service_tier: "fast". Ini memberikan kecepatan output hingga sekitar 2,5×.
• Batch dan Flex — $2,00 / $10,00, diskon tetap 50% dari tarif standar sebagai imbalan atas penjadwalan yang lebih longgar.
• Ultrafast — tanpa daftar tarif. Bukan kekosongan yang kami isi dengan tebakan; kekosongan yang ditinggalkan OpenAI.
Baris Fast-mode itu adalah satu-satunya preseden nyata yang bisa dijadikan acuan siapa pun untuk menentukan harga Ultrafast, dan itu adalah kenyataan yang menyadarkan bagi siapa pun yang merencanakan anggaran: satu-satunya tingkat kecepatan yang benar-benar telah diberi angka oleh OpenAI berbiaya tepat dua kali tarif standar untuk kecepatan dua setengah kali lipat. Ultrafast adalah klaim kecepatan yang lebih besar yang bertumpu pada perangkat keras yang lebih langka — kapasitas wafer Cerebras bukanlah komoditas — jadi arah premi yang pada akhirnya berlaku tidak diragukan. Yang masih menjadi pertanyaan adalah besarnya. Sampai ada daftar tarif, angka "harga GPT-5.6 Sol Ultrafast" yang Anda lihat dikutip di mana pun adalah inferensi seseorang, termasuk inferensi kami.
Bagaimana Anda sebenarnya menyebutnya
Perubahan skema memberi tahu Anda bentuk panggilan yang akan datang. Jika tier mengikuti pola yang lain, ia muncul sebagai bidang tambahan pada permintaan yang sudah Anda buat: Anda tetap menggunakan model gpt-5.6-sol, tetap gunakan prompt Anda, dan tambahkan pemilih tier — sama seperti Fast mode dipilih saat ini dengan menukar priority menjadi fast. Tidak ada yang berubah pada penguraian respons Anda, karena tidak ada yang berubah pada model. Itulah daya tarik utama dari serving tier dibandingkan pertukaran model, dan alasan halaman perbandingan seperti ini memiliki begitu sedikit untuk dibandingkan.
Yang tidak dapat Anda lakukan hari ini adalah memanggilnya. Nilai enumerasi itu ada; kapasitas di baliknya tidak ada, untuk sebagian besar akun. Jadi pertanyaan praktis untuk beberapa minggu ke depan bukanlah dari dua tier itu mana yang harus dipilih — melainkan apa yang harus dijalankan selagi pilihan tersebut belum tersedia.
Itu pertanyaan yang lebih baik dijawab oleh gateway daripada oleh daftar tunggu. Tier standar model ini sudah live di OrcaRouter sekarang sebagai openai/gpt-5.6-sol, dilayani pada tarif milik penyedia sendiri dengan tanpa markup untuk token, melalui endpoint yang kompatibel dengan OpenAI di api.orcarouter.ai/v1 — jadi tarif promosi OpenAI $4 / $20 dan tingkat konteks panjangnya $8 / $30 diteruskan apa adanya, bukan dihargai ulang oleh kami, dan perubahan pada tarif itu sampai ke sisi kami di hari yang sama saat tiba di sisi OpenAI. Kunci yang sama membawa 200+ model, yang di sini lebih penting dari biasanya: karena Anda tidak bisa menyetel service_tier: "ultrafast" lalu langsung mendapat jawaban, cara membeli latensi hari ini adalah dengan merutekan pekerjaan secara berbeda — kirim panggilan interaktif ke model mana pun di katalog yang paling cepat melewati ambang kualitas Anda, dan simpan batch semalam di jalur termurah yang lolos. Saat tier itu benar-benar dibuka, router-lah tempat Anda menyalakan sakelarnya, dan sampai saat itu, itulah bedanya antara daftar tunggu dan sebuah rencana.

Yang mana yang seharusnya ada di produksi?
Abaikan kata "versus" untuk sesaat, karena tidak ada keputusan kualitas yang perlu dibuat di sini. Jika Anda mengoptimalkan biaya per token, GPT-5.6 Sol standar adalah jawabannya, dan jalur Batch diskon 50% adalah jawaban untuk apa pun yang bisa menunggu. Jika Anda mengoptimalkan berapa lama seseorang duduk di depan spinner, Ultrafast adalah jawabannya begitu Anda bisa mendapatkannya — dan beban kerja yang OpenAI sebutkan untuk pratinjau menunjukkan dengan tepat alasannya: respons insiden dengan log dan diff terbuka selama gangguan langsung, pemeriksaan penipuan terhadap data yang terus berubah, percakapan dukungan di mana jeda hening setengah detik terbaca sebagai produk rusak, dan siklus penelitian yang dulunya berjalan semalaman kini dipadatkan ke dalam satu sesi kerja.
Petunjuknya adalah bentuk grafik permintaan Anda, bukan ukuran prompt Anda. Satu generasi panjang tunggal menghasilkan 14× di atas kertas dan lebih sedikit dalam praktiknya, karena pemrosesan input dan penalaran tidak terkompresi pada rasio itu. Empat puluh panggilan alat berurutan di balik satu tindakan yang terlihat oleh pengguna menghasilkan sesuatu yang jauh lebih mendekati pengganda penuh, karena setiap perjalanan bolak-balik itu adalah latensi yang harus ditunggu pengguna. Jika beban kerja Anda terlihat seperti yang kedua, tier ini ditujukan untuk Anda; jika terlihat seperti yang pertama, jalur standar memang akan selalu baik-baik saja.
Dua hal yang perlu diperhatikan, dan tak satu pun merupakan rumor yang bisa kita pastikan dari sini. Pertama, daftar harga: tier premium tanpa harga tidak bisa dianggarkan, dan preseden Fast-mode menunjukkan angkanya tidak akan kecil. Kedua, apakah daftar tunggu benar-benar dibuka sekitar DevDay seperti dilaporkan — karena nilai service_tier yang tidak dapat digunakan oleh sebagian besar akun hanyalah dokumentasi, bukan ketersediaan, dan perbedaan antara keduanya adalah perbedaan antara rencana dan janji.
