Kartu judul hero untuk Granite Speech 5.0 470M TurboCTC, menampilkan ikon gelombang suara, lencana bertuliskan 12.600 RTFx pada 1 H200, label bertuliskan 470M parameter, Encoder-only CTC, dan Apache 2.0, subjudul 'ASR Bahasa Inggris Apache-2.0 milik IBM', footer bertuliskan Dirilis 25 Agu 2026, dan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

Granite Speech 5.0 470M TurboCTC: ASR Apache-2.0 milik IBM mengklaim 12,600 RTFx

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Granite Speech 5.0 470M TurboCTC adalah model dalam rilisan wicara terbaru IBM yang benar-benar boleh Anda distribusikan, dan itulah hal pertama yang perlu Anda ketahui tentangnya. IBM menempatkan dua checkpoint pengenalan wicara bahasa Inggris di Hugging Face pada 25 Agustus 2026 — Granite Speech 5.0 470M TurboCTC di bawah Apache 2.0 dan Granite Speech 5.0 470M TurboCTC-NC di bawah lisensi nonkomersial CC-BY-NC-SA-4.0. Arsitektur 470 juta parameter yang sama, data berbeda, lisensi berlawanan. Model Apache adalah yang ditunjuk IBM untuk "kasus penggunaan lain" — yang dalam bahasa vendor berarti produksi komersial — dan juga yang membawa angka utama: IBM melaporkan throughput agregat di atas 12.600 RTFx pada satu NVIDIA H200, yang diterjemahkan IBM sebagai lebih dari tiga setengah jam audio bahasa Inggris yang ditranskripsi per detik dengan inferensi batch.

Angka kecepatan itu adalah klaim vendor yang baru berusia sehari dan belum direproduksi oleh pihak ketiga mana pun, jadi bacalah sebagai angka yang kuat di atas kertas, bukan fakta yang telah diaudit. Alasan angka ini tetap layak Anda perhatikan adalah desain di baliknya: Granite Speech 5.0 TurboCTC membuang decoder model bahasa yang digunakan oleh setiap model Granite Speech sebelumnya, menyisakan encoder Conformer murni yang dilatih dengan connectionist temporal classification (CTC) dan didekode secara non-autoregresif. Tidak adanya loop generasi token-per-token itulah yang memungkinkan model berparameter 470M mengklaim throughput yang mengalahkan model beberapa kali lebih besar darinya — dan itulah mengapa rilis ini penting bagi siapa pun yang membangun speech-to-text, bukan hanya untuk tabel tolok ukur.

Apa yang sebenarnya dirilis

Two checkpoint, sama-sama dirilis pada 25 Agustus 2026 di organisasi ibm-granite Hugging Face, keduanya ASR khusus bahasa Inggris dengan arsitektur encoder-only yang sama:

• {{1}}Granite Speech 5.0 470M TurboCTC{{/1}} {{2}}— Apache 2.0, penggunaan komersial diperbolehkan,{{/2}} {{3}}dilatih pada sekitar 60.000 jam audio bahasa Inggris.{{/3}}

• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, hanya untuk penelitian dan penggunaan non-komersial, dilatih pada sekitar 75.000 jam audio bahasa Inggris.

Artikel ini membahas model Apache — lisensi yang secara hukum dapat diandalkan oleh sebuah produk — dengan varian -NC dirujuk ketika narasi lisensi membutuhkannya. Kedua checkpoint dirilis sebagai safetensors dalam F32 dan BF16, dan keduanya memiliki dukungan native di Hugging Face Transformers melalui AutoModelForCTC dan AutoProcessor. Fitur ini hadir di rilis Transformers berikutnya; sampai saat itu, Anda menginstal Transformers dari sumber, memuat processor dan model, lalu menjalankan greedy decoding. IBM juga menyertakan tautan demo streaming WebGPU berbasis browser, yang merupakan cara tercepat untuk mendengar seberapa rendah latensinya.

Taruhan arsitektur: sebuah encoder, tanpa decoder, 12,5 token per detik

Perubahan desain adalah cerita di balik klaim kecepatan itu. Rilisan Granite Speech sebelumnya memasangkan encoder akustik dengan proyektor dan decoder model bahasa, dan decoder itulah yang dihilangkan. Granite Speech 5.0 470M TurboCTC adalah encoder Conformer 16-lapis yang dilatih dengan CTC, dan inferensinya adalah satu lintasan greedy non-autoregressive. Tidak ada yang perlu disampel, sehingga tidak ada latensi generasi yang harus ditunggu.

Tiga detail konfigurasi membuatnya cepat, bukan sekadar kecil:

Subsampling temporal dengan faktor 8. Front-end berjalan pada 100 frame per detik; model menghasilkan output pada 12,5 token per detik. Menumpuk dan melewatkan frame log-mel, lalu konvolusi berstride dan residual terpooling pada dua blok Conformer pertama, mengurangi laju output dalam tiga tahap 2x.

• Kosakata subword alih-alih karakter. Encoder Granite Speech sebelumnya mengeluarkan 50 karakter per detik; 5.0 mengeluarkan 12,5 token subword per detik dari kosakata BPE 16.384 unit (SentencePiece dalam varian -NC). Lebih sedikit unit keluaran per detik audio berarti decoder CTC memiliki lebih sedikit keputusan untuk dibuat.

• CTC berkondisi mandiri. Lapisan Conformer tengah menyempurnakan representasi antara milik model itu sendiri, yang merupakan trik yang memungkinkan encoder kecil mempertahankan akurasinya sementara decoder dihilangkan.

Semua itu ada di kartu model dan laporan teknis IBM. Kesimpulannya adalah checkpoint yang dibuat untuk laptop, ponsel, dan pipeline streaming, tempat decoder autoregressive yang berat tidak akan cocok — posisi edge-nya sudah eksplisit dalam deskripsi IBM sendiri.

Angka-angka yang diklaim IBM

Semua yang ada di bagian ini dilaporkan oleh IBM, dijalankan melalui harness publik papan peringkat Open ASR pada infrastruktur Hugging Face per 25 Agustus 2026, dan tidak direproduksi secara independen. Anggaplah angka-angka tersebut sebagai angka vendor yang tampak kredibel, bukan sebagai kebenaran yang final:

• Throughput — lebih dari 12.600 RTFx pada satu NVIDIA H200 dengan inferensi batch, yang diterjemahkan IBM sebagai lebih dari 3,5 jam audio per detik. IBM menambahkan bahwa ini adalah lebih dari 20 kali lipat throughput model Granite Speech sebelumnya. Ini adalah angka inferensi batch GPU pusat data, bukan yang akan Anda dapatkan dari laptop.

• Akurasi — tingkat kesalahan kata agregat sebesar 5,00% untuk model Apache pada set pengujian bentuk pendek bahasa Inggris publik dari papan peringkat Open ASR (varian -NC mencetak 4,85% pada set yang sama). Inferensi dijalankan melalui infrastruktur pekerjaan Hugging Face dan dinilai dengan perangkat papan peringkat, sehingga IBM memperkirakan angka-angka ini akan cocok dengan tabel resmi setelah model-model baru diserap ke dalamnya.

• Medan jauh — pada papan peringkat derau-dan-gaung FFASR, model Apache menempati peringkat kesembilan dalam akurasi dan model -NC peringkat kelima, dan keduanya adalah entri tercepat di papan tersebut (throughput diukur pada satu NVIDIA L4).

• Pelatihan — sekitar 60.000 jam audio publik berbahasa Inggris untuk model Apache, dilakukan dalam sepuluh hari pada delapan NVIDIA H100 di klaster Blue Vela milik IBM.

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

Apa yang sebenarnya Anda dapatkan dari Apache 2.0

Lisensi adalah aspek yang membuat rilis ini tidak biasa. Model ucapan open-weight cenderung hadir di bawah lisensi riset atau dengan kewajiban yang membuat departemen hukum tim produksi bergidik; di sini, kembaran yang dapat digunakan secara komersial justru yang nilai akurasinya sedikit lebih rendah menurut IBM. Anda menukar 0,15 poin WER agregat (5,00% vs 4,85%) dengan hak untuk menyebarkan dalam produk, memonetisasi keluaran, melakukan fine-tuning dan menyimpan bobot turunan Anda sendiri, serta menggunakannya di infrastruktur cloud tanpa klausul khusus riset yang menghalangi.

Trade-off itu mudah salah arah jika Anda mengejar papan peringkat. Angka 4,85% dari model -NC berasal dari sekitar 15.000 jam tambahan data pelatihan (GigaSpeech dan SPGI Speech), dan itu adalah versi yang oleh IBM secara harfiah dilabeli "hanya untuk tujuan penelitian dan nonkomersial." Model ini bagus sebagai model tolok ukur, tetapi buruk sebagai ketergantungan produk. Model Apache kehilangan sedikit akurasi dan memperoleh kemampuan untuk menjadi dasar pipa transkripsi komersial, sistem QA pusat panggilan, atau perangkat edge. Jika Anda mengevaluasi keluarga ini, keputusan lisensi harus diambil sebelum keputusan tolok ukur.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

Yang Anda korbankan

Menghapus model bahasa tidaklah gratis, dan kartu model tersebut jujur mengenai pengorbanannya:

• Tanpa terjemahan ucapan. Generasi Granite Speech sebelumnya dapat melalui model bahasa untuk menerjemahkan saat mentranskripsikan; 5.0 hanya transkripsi.

• Tidak ada bias kata kunci. LM juga menangani bias terhadap istilah dan nama domain; tanpa itu, Anda mendapatkan apa pun yang secara alami dihasilkan oleh kosakata subword.

• Hanya bahasa Inggris. Tidak ada checkpoint multibahasa dalam rilis ini, dan tidak ada indikasi bahwa akan segera hadir.

• WER 5,00% adalah angka untuk audio bersih bentuk pendek. Hasil FFASR (peringkat kesembilan, pada ucapan medan jauh yang bising) merupakan indikator yang lebih realistis untuk penggunaan ruang rapat dan hands-free, dan itu adalah peringkat, bukan angka utama.

Untuk pekerjaan transkripsi murni — audio panggilan, rapat, memo suara, subtitle, dikte — tidak satu pun dari hal-hal ini menjadi penghambat. Hal-hal itu menjadi penting jika Anda berharap satu model kecil juga bisa menerjemahkan, atau dapat diandalkan untuk mentranskripsikan kosakata khusus secara langsung.

Cara menjalankannya hari ini

Anda tidak memerlukan API cloud yang belum ada. Model berjalan secara lokal:

• Instal Transformers dari sumber (fitur CTC belum ada di rilis terbaru), kemudian AutoModelForCTC dan AutoProcessor dengan greedy decoding — pipeline standar. Prosesor dapat menghitung fitur log-mel di perangkat model, sehingga menghemat penyalinan dari host ke perangkat.

• Contoh kartu model adalah dua baris melalui pipeline: automatic-speech-recognition dengan model "ibm-granite/granite-speech-5.0-470m-turboctc".

• Demo streaming WebGPU berjalan di tab browser dan merupakan cara tercepat untuk mengukur latensi sebelum Anda mendedikasikan satu sore untuk benchmark harness.

Untuk produksi, pertanyaan praktisnya adalah serving. Model ASR terbuka di kelas ini biasanya dijalankan pada CPU atau GPU kecil dengan sesuatu seperti inferensi streaming berkelompok — angka utama 12.600 RTFx adalah angka batch H200; angka realistis untuk single-stream laptop akan jauh lebih rendah, dan IBM belum mempublikasikan angka time-to-first-token.

Di lapisan serving itulah biaya dan kompleksitas sesungguhnya dari ASR terbuka berada, dan di situlah pula platform routing membuktikan nilainya. Model OrcaRouter adalah satu API untuk 200+ model dengan harga daftar penyedia diteruskan dengan markup 0% — jadi ketika vendor menurunkan harga, penurunan tersebut langsung berlaku di hari yang sama — ditambah failover otomatis antar penyedia dan DSL routing untuk menggabungkan beberapa model menjadi satu panggilan. Semua itu tidak berlaku untuk Granite Speech 5.0 470M TurboCTC secara spesifik, karena varian mana pun belum ada di OrcaRouter: bobotnya baru berumur sehari dan belum ada penyedia komersial yang melayaninya. Ketika model ucapan terbuka seperti ini akhirnya mendapat jalur hosted — atau ketika Anda membandingkannya dengan API ASR hosted yang sudah ada — lapisan routing adalah cara untuk mencobanya dan beralih kembali tanpa menulis ulang integrasi, dan harga pass-through itulah yang menjaga perbandingan tetap jujur.

Apa yang masih belum dikonfirmasi

Model yang baru berumur satu hari memiliki rekam jejak yang singkat, dan perlu dicantumkan secara rinci apa saja yang belum diketahui:

• Tidak ada benchmark pihak ketiga. Angka 12.600 RTFx, WER 5,00%, dan peringkat FFASR semuanya merupakan hasil uji coba IBM sendiri melalui sistem papan peringkat publik. Tidak ada pihak independen yang memublikasikan angka-angka tersebut.

• Tidak ada API yang dihosting IBM. Tidak ada halaman model watsonx, tidak ada endpoint terkelola, tidak ada harga, dan tidak ada tanggal kapan semua itu akan tersedia.

• Tidak ada angka latensi streaming. Dukungan streaming dan demo WebGPU ada; angka waktu-ke-token-pertama dan latensi chunk tidak ada.

• Tidak ada perbandingan dengan harness yang sama terhadap model ASR terbuka cepat lainnya. Perbandingan yang paling penting — melawan Whisper large-v3, NVIDIA Parakeet TDT 0.6B, dan API transkripsi yang dihosting — belum dijalankan pada data yang identik oleh siapa pun.

Tontonan Berikutnya

Sinyal jangka pendeknya adalah reproduksi-reproduksi independen. Papan peringkat Open ASR bersifat publik, harness-nya standar, dan bobotnya ada di Hugging Face, jadi run pihak ketiga seharusnya muncul dalam hitungan hari — perhatikan apakah 5.00% bertahan dan apakah 12,600 RTFx bertahan di satu H200 di luar pengaturan batch IBM sendiri. Hal lain yang perlu diperhatikan adalah apakah IBM mengubah kembaran Apache menjadi layanan terkelola, karena endpoint watsonx akan langsung menjadikan ini ASR terbuka dengan jalur komersial paling kredibel. Granite Speech 5.0 470M TurboCTC, pada hari pertama, adalah ASR bahasa Inggris yang benar-benar cepat, benar-benar permisif, dengan jejak verifikasi yang benar-benar tipis. Dua yang pertama nyata; yang ketiga hanya soal waktu.

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube