
AuK vs AuK-Flash: 32 Langkah Sampling atau 4, dan Mengapa Murid Terkadang Menang
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Kecerdasan49Koding
Kedua checkpoint beratnya tepat 6.122 GB. Keduanya dirilis di bawah lisensi MIT. Keduanya digerakkan oleh encoder instruksi 3 miliar parameter yang sama (diunduh secara terpisah) dan VAE 637 MB yang sama. AuK dan AuK-Flash hampir tidak berbeda dalam hal yang Anda sediakan — dan dalam satu hal yang Anda rasakan pada setiap panggilan: berapa kali sampler dijalankan. AuK, model dasar generasi dan penyuntingan suara open-weight 1.5B yang ditempatkan tim Hunyuan Tencent dan rekan penulis akademis dari Shanghai Jiao Tong dan NTU di Hugging Face pada 9 September, melakukan 32 evaluasi fungsi dengan classifier-free guidance pada 2.0. AuK-Flash, model siswa hasil distilasi, melakukan empat evaluasi, dengan guidance dimatikan sepenuhnya, untuk percepatan wall-clock yang diklaim 4.5×. Interpretasi yang jelas adalah bahwa Flash adalah opsi hemat yang Anda ambil ketika latensi lebih diutamakan daripada kualitas. Bacaan itu salah, dan tabel evaluasi dari vendor sendirilah yang membantahnya: pada baris-baris head-to-head laporan teknis, Flash meraih skor tertinggi pada metrik edit-ratio MMAE-Speech, pada kolom paralinguistik SpeechEditBench, pada instruction-following bahasa Inggris, pada kemiripan speaker untuk acoustic-editing, dan pada keempat baris kualitas perseptual enhancement. Ini bukan penurunan kualitas. Ini adalah pertukaran yang berbeda, dan sisi mana yang Anda inginkan bergantung pada mana dari dua tugas yang sebenarnya Anda jalankan.
Apa yang sebenarnya berbeda di antara mereka
Buanglah pemasaran, dan pilihannya menyusut menjadi sebuah file konfigurasi. Runtime AuK adalah Transformer aliran-terkoreksi hibrida — blok MMDiT aliran-ganda yang memberi makan blok DiT aliran-tunggal terpadu — menjalankan solver Euler bfloat16 pada 24 kHz, latensi 64-dimensi pada 50 Hz. AuK-Flash menjalankan arsitektur yang identik dengan sampler terdistilasi yang dipasang, dihasilkan oleh inisialisasi konsistensi plus Decoupled DMD yang dirutekan berdasarkan tugas. Semua komponen lainnya dibagikan.
• Langkah sampling — AuK: 32 evaluasi fungsi, dapat dikonfigurasi. AuK-Flash: 4, tetap.
• Panduan tanpa pengklasifikasi — AuK: skala 2.0, dapat disetel. AuK-Flash: tidak ada (CFG=0).
• Ukuran checkpoint — AuK: auk_base.safetensors sebesar 6.122 GB. AuK-Flash: auk_flash.safetensors sebesar 6.122 GB. Identik hingga ke megabyte.
• Runtime bersama — VAE 637 MB plus encoder Qwen/Qwen2.5-Omni-3B, diunduh secara terpisah dan digunakan oleh keduanya.
• Kecepatan yang diklaim — AuK-Flash: 4.5× lebih cepat dalam waktu wall-clock dibandingkan dengan guru 32-NFE pada perangkat keras, durasi, dan ukuran batch yang sama.
• Lisensi — MIT untuk keduanya, yang untuk sekali ini benar-benar berarti apa yang dikatakannya.
Ukuran checkpoint yang identik adalah detail yang membingkai ulang seluruh perbandingan. Varian terdistilasi biasanya membeli kecepatan dengan ukuran yang lebih kecil. AuK-Flash tidak lebih kecil. Anda tidak menghemat disk, tidak menghemat waktu transfer, dan — karena encoder dan VAE digunakan bersama dan DiT memiliki lebar yang sama — Anda tidak menghemat VRAM secara signifikan dengan memilih student. Satu-satunya sumber daya yang Flash kembalikan kepada Anda adalah waktu. Perlu menyebutkan satu jebakan anggaran: "1.5B" dalam nama model menggambarkan backbone difusi, dan file di disk adalah 6.122 GB. Sediakan ruang untuk file tersebut.
Di mana AuK-Flash sebenarnya mengungguli model penuh
Inilah bagian di mana naluri "distilled = worse" keliru, dan itu berlaku di beberapa keluarga tugas yang tidak saling terkait dalam tabel-tabel laporan tersebut. Mulai dari persepsi. Pada set peningkatan DNS Challenge, Flash mencatat UTMOS 4.05 berbanding 3.86 milik AuK; pada CHiME-4, 3.91 berbanding 3.72; pada Libri2Mix, 4.03 berbanding 3.87; pada VCTKSR, 4.05 berbanding 3.93. Flash juga memenangkan kolom kesalahan pengenalan pada dua dari empat set tersebut, dengan WER CHiME-4 7.84 versus 7.98 dan WER VCTKSR 2.92 versus 3.06. Kealamian yang dinilai manusia adalah satu-satunya sumbu di mana siswa tersebut secara konsisten unggul, dan laporan tersebut menyatakannya secara eksplisit: model penuh menawarkan akurasi linguistik dan fidelitas suntingan yang lebih kuat, sementara Flash "sering menawarkan kualitas persepsi yang lebih baik."
Kemenangan tidak terbatas pada peningkatan. Pada metrik rasio edit MMAE-Speech — apakah edit mencapai magnitudo yang dimaksud — Flash mencetak 13.85 berbanding 12.44 milik AuK. Pada kolom paralinguistik SpeechEditBench, skornya 39.25 berbanding 38.50. Pada tugas deskripsi-ke-ucapan bahasa Inggris InstructTTSEval, skornya 82.40 melawan 81.60, yang menyamai baseline terbaik pada baris tersebut. Pada penyuntingan akustik dalam rangkaian Ming-Freeform, model ini memegang kemiripan pembicara tertinggi di keluarganya, 0.79 untuk bahasa Mandarin dan 0.75 untuk bahasa Inggris, berbanding 0.78 dan 0.74 untuk model dasar. Dengan kata lain, pelestarian identitas pembicara adalah salah satu hal yang Anda dapatkan dari empat langkah — ringkasan laporan itu sendiri adalah bahwa model lengkap memberikan rata-rata kesalahan pengenalan yang lebih rendah, sementara Flash lebih baik dalam melestarikan identitas pembicara. Jika Anda melakukan konversi suara, sulih suara, atau pekerjaan peningkatan di mana timbre lebih penting daripada kesalahan kata, model siswa adalah model yang lebih baik.

Di mana 32 langkah itu masih layak dipertahankan
Keunggulan model dasar terkonsentrasi tepat di tempat yang Anda harapkan dari model difusi dengan anggaran pengambilan sampel yang lebih besar: apa pun yang keluarannya harus benar secara linguistik.
Pada Seed-TTS-Eval, WER rata-rata AuK adalah 2.65 berbanding 2.85 milik Flash, dengan kemiripan suara 0.795 berbanding 0.790. Penyebaran di dalam rata-rata tersebut lebih informatif daripada rata-rata itu sendiri. Keduanya praktis imbang pada set tes bahasa Inggris — 1.02 dan 1.03 — dan berbeda pada bahasa Mandarin, 1.02 berbanding 1.10, serta pada subset Mandarin yang lebih sulit, 5.91 berbanding 6.43. Bahasa Mandarin adalah tempat langkah ekstra membuahkan hasil.
Pola yang sama terlihat pada kepatuhan terhadap instruksi. Pada tugas deskripsi-ke-ucapan bahasa Mandarin milik InstructTTSEval, kesenjangannya lebar: 83,37 untuk AuK dibanding 78,80 untuk Flash, dan laporan tersebut mencatat bahwa model dasar unggul pada ketiga metrik bahasa Mandarin dari rangkaian pengujian itu, sementara "keunggulan utama Flash adalah hasil DSD bahasa Inggrisnya yang lebih kuat." Bahasa, bukan arsitektur, yang menjadi garis pembedanya.
Kesetiaan penyuntinganlah yang paling tegas membedakan mereka. Akurasi penyuntingan konten SpeechEditBench adalah 91,83 untuk AuK berbanding 87,50 untuk Flash — kesenjangan tunggal terbesar dalam perbandingan tersebut. Penyuntingan akustik hampir sama timpangnya: 37,07 berbanding 30,26. Dalam rangkaian Ming-Freeform, AuK melaporkan WER yang lebih rendah di hampir semua hal yang penting: 3,09 berbanding 3,34 untuk penyuntingan bahasa Mandarin penuh, dan 3,96 berbanding 4,84 yang jauh lebih lebar untuk penyuntingan bahasa Inggris penuh. Jika produk Anda menulis ulang kata-kata dalam rekaman seseorang — penyuntingan lirik, penggantian konten, penyisipan, dan penghapusan — model 32-langkah itulah yang menjaga transkrip tetap akurat, dan perbedaan 8× langkah itu sepadan dengan biayanya.
Kedua model juga, menurut angka-angka dalam laporan tersebut, masih lemah dalam penyuntingan emosional: akurasi emosi SpeechEditBench adalah 9,94 untuk AuK dan 6,29 untuk Flash. Itu bukan artefak distilasi. Ini adalah keluarga tugas yang belum ada yang memecahkannya, dan memilih model siswa tidak akan membuat Anda lebih buruk dalam hal itu daripada yang sudah Anda alami.
Angka 4.5× adalah angka sampel, bukan angka end-to-end.
Inilah aritmetika yang disembunyikan oleh percepatan utama, dan ini adalah hal paling berguna untuk dipahami sebelum Anda mengikatkan arsitektur pada Flash.
AuK-Flash melakukan 4 langkah sampling, sedangkan AuK melakukan 32. Itu berarti 8× lebih sedikit langkah. Vendor melaporkan wall clock 4,5× lebih cepat. Perbedaan antara kedua angka tersebut adalah segala sesuatu di sekitar loop sampling, dan didominasi oleh encoder: model multimodal Qwen2.5-Omni-3B yang dimuat oleh kedua checkpoint dan harus dijalankan oleh keduanya pada setiap permintaan. Encoder itu kira-kira dua kali ukuran backbone difusi, dan biayanya tetap. Flash tidak dapat mempercepatnya, karena Flash bukan bagian darinya.
Jadi versi jujur dari klaim tersebut adalah ini: 4.5× adalah yang Anda dapatkan pada bagian difusi dalam kondisi yang setara, dan keuntungan end-to-end Anda akan sebesar porsi waktu nyata (wall clock) yang benar-benar ditempati oleh loop sampling. Jika Anda menjalankan generasi bentuk panjang di mana 32 langkah pada banyak frame laten mendominasi, Anda akan mendekati angka yang dipublikasikan. Jika beban kerja Anda berupa klip pendek dengan prapemrosesan instruksi yang berat, atau jika Anda memproses banyak permintaan kecil sekaligus (batching), sebagian besar dari setiap panggilan berada di encoder bersama dan percepatan nyata Anda akan jauh lebih kecil dari 4.5×. Ukur campuran beban kerja Anda sendiri sebelum Anda membiarkan anggaran latensi bergantung pada angka tersebut. Belum ada yang memublikasikan angka end-to-end tersebut — termasuk vendornya, yang sama sekali tidak melaporkan angka latensi absolut maupun kebutuhan VRAM.
Berapa biaya distilasi, dalam kata-kata penulis sendiri
Laporan teknis tersebut secara luar biasa jujur tentang di mana siswa itu gagal, dan mode kegagalan itu lebih berguna bagi penerap daripada tabel tolok ukur.
Target panduan guru ternyata menjadi masalahnya. Menggunakan target CFG di cabang konsistensi "dapat mengekspos student dengan beberapa langkah pada prediksi yang terlalu jenuh," yang menurut para penulis menyebabkan overshoot dan clipping yang terdengar. Secara terpisah, jadwal Decoupled DMD yang seragam "menurunkan pemisahan multi-pembicara dan vokal," dengan beberapa keluaran student yang mundur menuju campuran yang belum diproses — distilasi tersebut menghapus pemisahan yang seharusnya dilakukan model. DMD berbasis tugas adalah perbaikan yang dijelaskan, dan itulah sebabnya laporan tersebut berhati-hati untuk membatasi kelemahan khusus itu pada varian seragam. Jika pemisahan ucapan adalah bagian inti dari pipeline Anda, ini adalah paragraf yang harus diuji sebelum Anda mempercayainya.
Dua batasan lagi bersifat operasional, bukan statistik. Prompt Enhancer pada pipeline memetakan diksi sehari-hari tentang kecepatan, kenyaringan, dan nada ke serangkaian nilai yang didukung, dan menolak apa pun yang tidak dapat dipetakan sebelum inferensi akustik berjalan — sehingga permintaan yang tidak didukung gagal lebih awal, bukannya menurun secara elegan. Dan repositori hanya menerima Qwen/Qwen2.5-Omni-3B sebagai jalur encoder; README menyatakan bahwa Qwen3-Omni saat ini tidak didukung, sehingga encoder yang lebih baru bukanlah peningkatan pengganti langsung. Integrasi ComfyUI membawa batas 30 detik pada urutan sumber-plus-target.
Menjalankan keduanya adalah konfigurasi yang dimaksud.
Contoh multi-GPU dari repositori itu sendiri menempatkan AuK pada satu perangkat dan AuK-Flash pada perangkat lain — cuda:0 dan cuda:1 — yang merupakan sinyal yang jelas bahwa Tencent mengharapkan keduanya untuk berdampingan, bukan bersaing. Itu juga jawaban yang tepat untuk sebagian besar tumpukan speech produksi, karena kedua model tersebut kuat pada bidang yang berbeda. Arahkan permintaan yang berat penyuntingan dan berbahasa Tionghoa ke AuK; arahkan peningkatan, pemisahan, pengikut instruksi bahasa Inggris, dan apa pun yang interaktif ke AuK-Flash. Keduanya memuat encoder yang sama dan VAE yang sama, jadi Anda membayar runtime bersama itu sekali dan beralih di antara checkpoint di belakangnya.
Itu adalah keputusan perutean di lapisan model, dan bentuknya sama dengan yang OrcaRouter terapkan di lapisan API untuk model yang dihosting. Titik pertemuan keduanya saat ini adalah sambungan dalam pipeline AuK sendiri: Prompt Enhancer memerlukan endpoint chat yang kompatibel dengan OpenAI untuk mengubah instruksi kasar menjadi kosakata yang didukung model, dan fallback ASR opsional membutuhkan jalur transkripsi. Arahkan salah satunya ke endpoint chat yang kompatibel dengan OpenAI dan Anda akan mendapatkan satu kunci untuk lebih dari 200 model, harga daftar penyedia diteruskan dengan markup 0%, dan failover otomatis jika backend turun — yang penting justru karena ini adalah rilis yang baru berumur dua hari tanpa API yang dihosting dan tanpa reproduksi independen, dan Anda tidak ingin ketergantungan yang belum terbukti berada pada endpoint hardcoded.
Namun, perjelas apa yang tidak tersedia. Baik AuK maupun AuK-Flash tidak dilayani oleh penyedia inferensi terhosting mana pun — kartu Hugging Face menyatakannya secara langsung — dan keduanya juga tidak dapat dirutekan melalui OrcaRouter saat ini. Ini adalah keputusan self-hosting dari awal hingga akhir.

Apa yang masih belum diketahui
Hampir semua hal tentang rilis ini dilaporkan oleh vendor. Percepatan 4.5×, angka WER, kolom SpeechEditBench, dan baris UTMOS semuanya berasal dari laporan teknis tim AuK sendiri, arXiv 2609.08936, yang diajukan pada 8 September — tidak ada reproduksi independen, tidak ada entri papan peringkat pihak ketiga, dan tidak ada hasil harness netral. Sinyal adopsinya sama tipisnya: per 10 September, dua repositori Hugging Face menunjukkan 30 unduhan dalam sebulan terakhir dan masing-masing sekitar dua lusin suka, sementara repositori GitHub menunjukkan 217 bintang, 12 fork, dan tiga kontributor. Itu adalah rilis riset, bukan tren yang diikuti banyak orang.
img src="4.png" alt="Tangkapan layar README repositori GitHub Tencent-Hunyuan AuK yang menampilkan pemberitahuan sumber terbuka 9 September 2026 dan tabel varian AuK dan AuK-Flash"> p>Perilisan itu sendiri berlangsung senyap, dan hal ini perlu dinyatakan secara gamblang karena mudah untuk ditafsirkan berlebihan. Tidak ada pengumuman dari Hunyuan, tidak ada posting blog, tidak ada halaman harga, dan tidak ada acara peluncuran. Satu-satunya pernyataan vendor yang diberi tanggal adalah satu baris di README repositori — [2026/09/09] Kami membuka sumber AuK. Metadata repositori Hugging Face menunjukkan bahwa Spaces tersebut dibuat lebih awal, pada pertengahan Agustus, dan bobot terakhir kali diubah pada 9 dan 10 September, jadi pengemasan terjadi sebelum pengumuman dibuat. Apa yang dapat diketahui dari repositori: bobot berlisensi MIT untuk kedua varian, laporan teknis, instruksi unduh yang berfungsi untuk Hugging Face dan ModelScope, serta daftar tugas yang terdokumentasi. Apa yang belum dikonfirmasi: apakah angka-angka yang dilaporkan bertahan dalam harness independen, apakah akan muncul endpoint yang dihosting, dan apakah checkpoint Flash tetap menjadi default yang direkomendasikan setelah orang lain menjalankannya.

Mana yang harus dipilih
Jika Anda membangun konten atau menyunting lirik, atau menyajikan ucapan berbahasa Tionghoa dalam bentuk apa pun, gunakan AuK dan terima 32 langkah tersebut. Keuntungannya di sana besar, konsisten di dua suite penyuntingan independen, dan persis jenis kegagalan keakuratan — kata yang salah dalam transkrip — yang langsung disadari pengguna.
Jika Anda membangun penyempurnaan, pemisahan, konversi suara, atau apa pun yang outputnya ditunggu manusia, gunakan AuK-Flash. AuK-Flash jauh lebih cepat pada loop sampling, memenangkan baris kualitas perseptual dengan telak, dan menjaga identitas pembicara lebih baik daripada model asalnya. Kesenjangan kualitas yang ada memang terkonsentrasi pada tugas-tugas yang mungkin tidak Anda jalankan.
Jika Anda membangun produk ucapan yang mencakup keduanya, jalankan keduanya. Disk yang sama, encoder yang sama, lisensi yang sama, satu perbedaan konfigurasi — dan pola penerapan yang sudah ditunjukkan repositori. Satu hal yang layak ditunggu adalah pengukuran latensi ujung-ke-ujung Anda sendiri: faktor 4.5× itu nyata, tetapi itu milik sampler, dan hanya campuran beban kerja Anda yang memberi tahu seberapa banyak yang mencapai pengguna Anda.
