
GPT-5.6 Sol Ultrafast: Kecepatan 14×, 750 Tok/s — CS-4 Dilaporkan ~1.300, Belum Ada Harga
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
GPT-5.6 Sol Ultrafast mode adalah tingkatan penyajian yang dipercepat perangkat keras untuk model andalan — model GPT-5.6 Sol lengkap yang sama yang dijalankan pada chip skala wafer Cerebras, bukan kluster GPU, memberikan kecepatan hingga 14× lebih cepat daripada pemrosesan standar dan hingga 750 token keluaran per detik pada tingkatan yang diumumkan OpenAI pada bulan Agustus. Pada 2026-08-18, Cerebras meluncurkan sistem CS-4 generasi berikutnya yang menjadi landasan bagi tingkatan ini, dan sebuah laporan awal yang belum terverifikasi mengklaim bahwa GPT-5.6 Sol pada CS-4 sudah melayani sekitar 1.300 token per detik. Ini bukan model yang lebih kecil dan bukan distilasi: hanya perangkat keras dan penjadwalannya yang berubah, dan kecerdasannya tetap dipertahankan. Yang belum dimilikinya adalah harga — per 2026-08-19, Ultrafast masih berupa pratinjau API terbatas tanpa daftar tarif yang dipublikasikan, jadi angka yang dapat Anda jadikan acuan anggaran saat ini adalah tingkatan standar di halaman model GPT-5.6 Sol yang aktif: $5 per juta token masukan dan $30 per juta token keluaran, diteruskan tanpa markup. Artikel ini membahas apa itu mode ini, seberapa cepat angka-angka tersebut sebenarnya — termasuk perangkat keras CS-4 yang baru dan apa yang masih belum terverifikasi — berapa biayanya (termasuk jawaban jujur "belum ada harga"), dan apa yang harus dilakukan hingga mode ini mencapai ketersediaan umum.
Apa sebenarnya mode Ultrafast itu
Ultrafast adalah tingkatan penyajian, bukan model baru. OpenAI mengumumkannya pada 13 Agustus 2026 sebagai produk pertama dari kemitraan komputasi Januari 2026 dengan pembuat chip Cerebras — sebuah kesepakatan yang dilaporkan bernilai sekitar $10 miliar selama tiga tahun. Sementara inferensi standar {{1}}GPT-5.6 Sol{{/1}} berjalan pada klaster GPU dan menghabiskan banyak waktu untuk memindahkan bobot antara memori dan komputasi, Ultrafast memuat bobot model ke dalam {{2}}44 GB SRAM on-chip{{/2}} pada chip skala-wafer Cerebras; ukuran model Sol membentang beberapa wafer berlapis, sehingga bobot berada di tempat komputasi dilakukan. Hasilnya adalah batas throughput yang ditentukan oleh silikon, bukan oleh bandwidth memori.
Perkembangan hardware berlanjut pada 2026-08-18. Dalam acara Supernova-nya, Cerebras meluncurkan CS-4, sistem skala-rak generasi berikutnya yang dibangun di atas platform Nexus — tiga chip Wafer-Scale Engine per rak, kecepatan pembuatan token hingga 2× lipat dari CS-3 sebelumnya, dan, menurut Cerebras, lebih dari 1.000 token per detik pada model di atas 10 triliun parameter. Itu adalah klaim Cerebras untuk sistem dalam akses awal, belum tersedia secara umum. Sejak peluncuran itu, satu unggahan di X mengklaim CS-4 sudah melayani GPT-5.6 Sol dengan kecepatan sekitar 1.300 token per detik — sejalan dengan angka Cerebras, tetapi sejauh ini belum dikonfirmasi siapa pun. Anggap saja sebagai sinyal awal: masuk akal, belum terverifikasi, dan layak diperiksa ulang sebelum Anda merencanakan kapasitas berdasarkan hal itu.
Bagian yang penting untuk kode Anda: id model, bobot, perilaku penalaran, dan keluarannya identik dengan GPT-5.6 Sol standar. OpenAI menyebut Ultrafast sebagai "pekerjaan berguna yang lebih banyak per detik" alih-alih sebagai tingkatan kualitas, dan pratinjau ini menjalankan model unggulan penuh — kecepatan tidak berasal dari menukar dengan model yang lebih murah. Yang berubah adalah seberapa cepat token keluar.
Jangan bingung membedakan Ultrafast dengan yang sudah ada, mode cepat. Mode cepat adalah tingkatan terpisah yang dapat dibeli pada perangkat keras standar: hingga sekitar 2,5× kecepatan output dengan premi 2× per token ($10 input / $60 output per 1M), tanpa perubahan kualitas. Ultrafast adalah hal yang berbeda — perangkat keras Cerebras, hingga 14×, dan untuk saat ini tanpa harga sama sekali.
Seberapa cepat — angka-angka yang penting

Angka utamanya adalah 14×, dan itu perlu didefinisikan. OpenAI mengatakan Ultrafast menghasilkan hingga 750 token keluaran per detik dibanding pemrosesan standar GPT-5.6 Sol. Itu adalah angka throughput untuk token keluaran, bukan sekadar klaim bahwa "semuanya berjalan 14× lebih cepat" — waktu permintaan end-to-end juga mencakup pemrosesan masukan dan penalaran model itu sendiri, itulah sebabnya 14× diberi label sebagai maksimum.
• Throughput keluaran maksimum — hingga 750 token keluaran per detik, menurut pengumuman OpenAI (2026-08-13).
• Vs pemrosesan standar — hingga 14× lebih cepat, menurut pengumuman yang sama; hasil aktual bervariasi tergantung pada panjang input dan jenis tugas.
• Ujian Terakhir Umat Manusia, 2.500 pertanyaan — OpenAI/Cerebras melaporkan GPT-5.6 Sol Ultrafast selesai dalam 11 jam 11 menit dibandingkan 78 jam 27 menit untuk Claude Fable 5, dengan akurasi yang sebanding. Dilaporkan oleh vendor, dan perbandingan ini mencakup dua tumpukan perangkat keras vendor — anggap saja sebagai indikasi, bukan vonis.
• GDP-Val, ujung ke ujung — Cerebras melaporkan 5,6× lebih cepat secara keseluruhan tanpa penurunan kualitas yang terukur. Juga dilaporkan oleh vendor.
• Dasar mode cepat — tingkat kecepatan yang tersedia untuk dibeli saat ini mencapai maksimum sekitar 2,5× kecepatan output dengan premi harga 2×.
• CS-4, perangkat keras berikutnya — Cerebras mengklaim rak CS-4 menghasilkan lebih dari 1.000 token per detik pada model di atas 10 triliun parameter, hingga 2× generasi token CS-3. Laporan komunitas yang belum terverifikasi menyebut GPT-5.6 Sol pada CS-4 mencapai ~1.300 token per detik — arah yang sama, belum dikonfirmasi oleh OpenAI atau Cerebras.
Satu peringatan sebelum Anda mengutip angka 14×: liputan independen tentang peluncuran tersebut menyebutkan perbandingan kecepatan generasi ~11× terhadap Claude Fable 5, sementara angka-angka Cerebras sendiri menyiratkan ~7× untuk total waktu pengujian pada proses yang sama — perbedaannya adalah bagian mana dari beban kerja yang Anda ukur. Disiplin yang sama berlaku untuk sinyal kecepatan CS-4: angka ~1.300 token/detik itu bermula dari satu unggahan X, dan baik OpenAI maupun Cerebras belum mengonfirmasinya. Semua ini adalah angka vendor atau komunitas yang diumumkan minggu ini, dan belum ada satu pun yang diverifikasi secara independen. Perlakukan itu sebagai klaim, bukan vonis tolok ukur.
Berapa biayanya — dan kesenjangan yang sebenarnya

Berikut adalah keadaan pertanyaan harga per 2026-08-19, dinyatakan dengan jelas: Ultrafast tidak memiliki harga yang dipublikasikan. OpenAI belum mengumumkannya, dan pratinjau tidak muncul di kartu tarif publik mana pun. Laporan bahwa slot akses awal digabungkan atau gratis adalah spekulasi, bukan kebijakan — dan sampai OpenAI memberi harga pada tingkat tersebut, angka "GPT-5.6 Sol Ultrafast cost" apa pun yang Anda temukan di tempat lain hanyalah tebakan.
Apa yang dapat Anda beri harga hari ini adalah sisa lini GPT-5.6 Sol, yang diverifikasi terhadap tarif yang dipublikasikan OpenAI pada 2026-08-18:
• Standard GPT-5.6 Sol — $5.00 input / $30.00 output per 1M token. Baseline yang dapat Anda panggil sekarang juga.
• Mode cepat — $10.00 / $60.00, premium 2× untuk kecepatan output hingga sekitar 2.5×. Hal yang paling mirip dengan tingkatan kecepatan yang benar-benar dapat Anda beli.
• Pembacaan cache prompt — $0.50 per 1M (diskon 90% dari input baru); penulisan cache ditagih $6.25 per 1M.
• Tingkatan konteks panjang — input di atas sekitar 272 ribu token dikenakan biaya $10,00 / $45,00.
• Batch API — $2.50 / $15.00, diskon tetap 50% dengan waktu pengerjaan sekitar 24 jam.
Sebagai konteks soal premium yang diharapkan: mode cepat menetapkan preseden pada 2× tarif standar untuk kecepatan 2.5×. Jika Ultrafast mengikuti kurva serupa, harganya akan jauh di atas standar $5 / $30 — dan komentar seputar pratinjau mengharapkan persis hal itu, karena kapasitas wafer Cerebras langka dan mahal. Tetapi premium yang diharapkan bukanlah harga. Susun rencana berdasarkan Sol standar atau mode cepat sampai kartu tarif tersedia.
Cara menggunakannya — realitas pratinjau
Akses adalah kesenjangan jujur kedua. Ultrafast tersedia melalui OpenAI API untuk sekelompok pelanggan terpilih berdasarkan daftar tunggu, diumumkan pada 2026-08-13, dengan OpenAI mengatakan akses akan diperluas "seiring pertumbuhan kapasitas." Belum ada tanggal ketersediaan umum. Kelompok pratinjau yang diumumkan adalah pengkodean, perdagangan, riset keuangan, dukungan, dan beban kerja interaktif lainnya — tim yang agennya membuat banyak panggilan per permintaan dan di mana latensi respons menjadi hambatan utama. Jane Street, Rogo, dan Podium termasuk di antara penguji awal yang disebutkan.
Pola penggunaan yang dirancang untuknya: respons insiden (membaca log, jejak, dan diff saat gangguan sedang berlangsung), riset keuangan dan deteksi penipuan pada data yang bergerak, dukungan pelanggan dan suara secara real-time (di mana keheningan setengah detik dianggap rusak), checkout e-commerce, serta mengompresi batch riset semalaman menjadi sesi interaktif. Jika beban kerja Anda adalah obrolan satu putaran, faktor 14× jauh kurang penting dibandingkan untuk loop agen dengan 40 panggilan.
Apa yang dapat Anda lakukan hari ini — jawaban yang praktis

Selagi Ultrafast masih dalam pratinjau, GPT-5.6 Sol versi lengkap sudah aktif sekarang — dan di OrcaRouter, tier standar dilayani dengan tarif penyedia dan markup $0 per token, sebagai ID model openai/gpt-5.6-solmelalui endpoint yang kompatibel dengan OpenAI di api.orcarouter.ai/v1. Jika Anda sudah memiliki klien OpenAI, migrasi hanyalah perubahan base-URL dan model-id; tidak ada yang lain. Kunci dan endpoint yang sama mendukung 200+ model, sehingga Sol berada di samping GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5, dan model open-weight yang ingin Anda bandingkan — dan Anda dapat merutekan berdasarkan tingkat kesulitan, bukan mengintegrasikan ulang masing-masing model.
Dua hal spesifik OrcaRouter layak disebut di halaman kecepatan.BYOK: bawa kunci OpenAI milik Anda sendiri dan OpenAI menagih Anda secara langsung dengan tarifnya sendiri — OrcaRouter menambahkan $0 per token dan menjaga batas kecepatan serta kredit penyedia Anda tetap utuh.Guardrails: PII Shield dan kebijakan konten berjalan sebelum penagihan, sehingga permintaan yang diblokir mengembalikan 400 yang bersih dan tidak pernah dikenai biaya, dan Agent Firewall menilai panggilan alat dan MCP sebelum dieksekusi. Saat — dan jika — Ultrafast mencapai ketersediaan umum dengan harga yang dapat dirutekan, menghubungkannya ke endpoint yang sama hanyalah perubahan ID model; pengaturan yang Anda bangun hari ini tetap berlaku.
Batas yang jujur — ketika Ultrafast bukan jawabannya
Empat tempat di mana kisah 14× tidak berlaku, jadi Anda tidak merancang arsitektur atau menyusun anggaran berdasarkan angka yang belum pasti:
14× adalah maksimum, bukan jaminan. Ini adalah batas atas throughput keluaran pada perangkat keras Cerebras; latensi ujung-ke-ujung masih mencakup pemrosesan masukan, waktu penalaran model, dan jaringan Anda sendiri. Prompt yang berat penalaran dapat menghabiskan sebagian besar waktu aktual untuk berpikir, di mana percepatan utama mengecil.
Tidak ada harga dan tidak ada tanggal GA. Per 2026-08-19, Anda tidak dapat membeli Ultrafast — hanya dapat meminta akses pratinjau, dan perangkat keras CS-4 di baliknya masih dalam akses awal, bukan tersedia secara umum. Anggarkan untuk Sol standar ($5 / $30) atau mode cepat ($10 / $60), dan anggap harga Ultrafast apa pun yang Anda lihat daring sebagai belum terverifikasi.
Tolok ukur tersebut dilaporkan oleh vendor. Hasil HLE selama 11 jam dan angka 5,6× GDP-Val adalah angka OpenAI/Cerebras dari pengumuman tersebut; estimasi independen berkisar dari sekitar 7× hingga 11× tergantung pada apa yang diukur. Tambahkan sinyal kecepatan CS-4 ke daftar itu: angka ~1.300 token/detik untuk GPT-5.6 Sol di CS-4 berasal dari satu unggahan X dan tidak memiliki konfirmasi independen. Belum ada satu pun dari angka-angka ini yang terverifikasi secara independen.
Itu tidak akan memperbaiki hambatan yang tidak Anda miliki. Jika agen Anda lambat karena orkestrasi Anda sendiri, latensi alat, atau prompt yang sarat input, jalur keluaran yang lebih cepat hanya sedikit menggeser ekor. Keputusan mencocokkan tier — GPT-5.6 Sol seharga $5 / $30 versus GPT-5.6 Terra seharga $2 / $12 versus GPT-5.6 Luna seharga $0.20 / $1.20 — masih lebih memengaruhi tagihan Anda daripada tingkat kecepatan mana pun.
{{1}}Intinya.{{/1}} {{2}}GPT-5.6 Sol Ultrafast adalah tier layanan tercepat yang pernah dirilis OpenAI untuk model flagship-nya — bobot yang sama pada perangkat keras Cerebras, hingga throughput 14× dan 750 token output per detik pada tier yang diumumkan.{{/2}} {{3}}CS-4 baru dari Cerebras (diluncurkan 2026-08-18) dilaporkan mendorong GPT-5.6 Sol hingga ~1.300 token per detik, tetapi angka itu hanyalah satu unggahan X yang belum terverifikasi.{{/3}} {{4}}Per 2026-08-19, Ultrafast masih berupa pratinjau daftar tunggu tanpa harga publik.{{/4}} {{5}}Jika Anda mencari angka untuk dijadikan acuan anggaran, jawaban jujurnya adalah belum ada.{{/5}} {{6}}GPT-5.6 Sol Standar dengan harga $5 / $30 adalah yang bisa Anda andalkan hari ini, mode cepat dengan $10 / $60 adalah tier kecepatan yang bisa dibeli, dan OrcaRouter meneruskan keduanya tanpa markup $0 pada key Anda sendiri.{{/6}} {{7}}Bangun routingnya sekarang — dan saat Ultrafast mendapat harga dan tanggal, perubahannya hanya satu model-id saja.{{/7}}
Sampai Ultrafast memiliki harga, GPT-5.6 Sol versi lengkap sudah aktif di GPT-5.6 Sol on OrcaRouter dengan harga $5 / $30 per juta token, tanpa markup, siap digunakan dengan kunci Anda sendiri.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
