
AuK-Flash dan AuK: Tencent Diam-diam Merilis Model Wicara Terbuka yang Menghasilkan, Menyunting, dan Memisahkan Audio
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 juta token
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Tencent merilis dua model wicara terbuka paling berpengaruh pada 2026 minggu ini dan hampir tidak memberi tahu siapa pun. Sekitar 7 September, organisasi Tencent di Hugging Face mempublikasikan AuK — "sebuah model fondasi 1.5B untuk pembangkitan dan penyuntingan wicara," demikian kata-kata kartu modelnya sendiri — serta AuK-Flash, varian empat langkah terdistilasi dari model yang sama, keduanya di bawah lisensi MIT. Tidak ada pos blog Tencent, tidak ada pengumuman di media sosial, dan tidak ada siaran pers yang dilampirkan ke repositori mana pun; di antara keduanya, kedua model tersebut telah diunduh beberapa puluh kali, repositori kode yang dirujuk oleh kartu-kartu itu tidak dapat diakses, dan tidak ada tolok ukur independen yang ada di mana pun di web yang terindeks. Tulisan ini menguraikan apa yang sebenarnya dapat diketahui dari dua repositori, file konfigurasi, dan halaman proyek Tencent sendiri — serta apa yang masih belum terverifikasi.
Klaim ini layak dianggap serius bahkan tanpa angka-angkanya sendiri, karena cakupannya tidak biasa. AuK bukan model kloning suara lain. Melalui satu antarmuka instruksi bahasa alami, AuK menjanjikan text-to-speech zero-shot dan berbasis instruksi, penyuntingan yang menyentuh isi ucapan, cara pengucapannya, serta suara non-verbal di sekitarnya, ditambah peningkatan ucapan, pemisahan ucapan, dan pemisahan musik. Bidang ini selama ini membangun model spesialis yang berbeda untuk setiap tugas tersebut. Taruhan Tencent, dalam satu backbone generatif, adalah bahwa satu model mampu melakukan semuanya—dan AuK-Flash dapat melakukannya cukup cepat untuk penggunaan yang mendekati waktu nyata.
Dua checkpoint, satu rilis
Stempel waktu API Hugging Face menceritakan kisah repositori yang bersifat privat sebelum akhirnya dirilis. Repositori dasar tencent/AuK dibuat pada 18 Agustus 2026 dan tencent/AuK-Flash pada 21 Agustus; keduanya terakhir dimodifikasi pada 8 September, dan kartu model memuat entri berita bertanggal 7 September — "[2026/09/07] AuK kini open-source. Kode dan bobot model tersedia untuk publik." Pembacaan yang wajar adalah bahwa Tencent membangun repositori-repositori tersebut pada pertengahan hingga akhir Agustus, menjadikannya publik sekitar tanggal 7 September, lalu menyentuh kartu itu lagi pada 8 September. Tidak ada apa pun tentang model ini yang muncul di web yang terindeks, dan penghitung unduhan berada di angka puluhan — jadi "rilis senyap" bukanlah pilihan retoris, melainkan situasi yang sebenarnya terjadi.
![A screenshot of the Hugging Face repository page for tencent/AuK-Flash, showing the model name under the Tencent organization with the tags Text-to-Speech, Chinese, English, speech, zero-shot-tts, voice-cloning, speech-generation, speech-editing, speech-enhancement, source-separation, speech-separation, instruction-guided, diffusion, distillation and few-step-inference, License mit; the model card headed 'AuK-Flash: Fast 4-Step Speech Generation and Editing' with a news line dated [2026/09/07] reading 'AuK is now open-source. Code and model weights are publicly available. Try it on the Demo Space or the ModelScope Space'; a Contents list covering News, Introduction, Model Architecture, Supported Tasks, Download the weights, Citation and License; a right rail showing the base model tencent/AuK in the model tree and an Inference Providers panel; and the Introduction opening 'AuK is a 1.5B foundation model for speech generation and editing. Trained on millions of hours of diverse audio data, AuK supports zero-shot and instruction-based TTS.'](https://cms.orcarouter.ai/api/media/file/2-723.png)
Kedua checkpoint tersebut merupakan arsitektur yang sama pada titik-titik yang berbeda dalam siklus hidupnya. {{1}}AuK adalah sang guru: model dasar yang ditujukan untuk generasi berkualitas tinggi.{{/1}} {{2}}AuK-Flash adalah sang murid: hasil distilasi untuk inferensi cepat dalam empat langkah,{{/2}} dan hal inilah yang menjadikannya target penerapan yang lebih menarik sekaligus alasan ia tampil sebagai nama utama pada judul di sini. Di halaman proyek Tencent, keluarga model ini dipaparkan sebagai model dengan sekitar 1,5 miliar parameter yang {{3}}dilatih pada apa yang oleh kartu modelnya hanya disebut sebagai "jutaan jam data audio yang beragam"{{/3}}, dan halaman proyek menyebutkannya sekitar 1,95 juta jam supervisi efektif dari sekitar 3,03 miliar contoh instruksi–audio. Halaman proyek itu juga menyertakan atribusi Shanghai Jiao Tong University dan Tencent Hunyuan, {{4}}menempatkan AuK di dalam lini riset model terbuka Tencent Hunyuan{{/4}} alih-alih di dalam keluarga produk komersial. {{5}}Pelatihan bukanlah satu-satunya hal yang terjadi setelah pra-pelatihan:{{/5}} Tencent menjelaskan tahap pasca-pelatihan yang memadukan {{6}}optimasi preferensi berdasarkan umpan balik manusia untuk penyuntingan terbuka{{/6}} dengan pembelajaran penguatan berbasis imbalan untuk generasi ucapan.
Tabel varian pada kartu model tersebut tidak ambigu dalam membedakan keduanya: AuK adalah "model dasar untuk generasi berkualitas tinggi," sedangkan AuK-Flash adalah "model terdistilasi untuk inferensi cepat 4 langkah." Keduanya dapat diunduh dari Hugging Face dan dari ModelScope di bawah namespace Tencent-Hunyuan, dan keduanya membawa lisensi MIT — salah satu lisensi paling permisif yang dapat dimiliki oleh rilis open-weights, yang penting bagi siapa pun yang ingin membangun produk di atasnya.
Apa yang sebenarnya dilakukan oleh satu model berbasis instruksi?
Antarmuka AuK adalah satu kotak prompt: Anda memberikan instruksi bahasa alami kepada model dan, ketika sebuah tugas membutuhkannya, referensi audio, lalu model mengembalikan audio. Dikelompokkan berdasarkan taksonomi kartu itu sendiri, lima keluarga tugas tersebut adalah:
• Pembangkitan ucapan — zero-shot TTS yang mengkloning suara dari sebuah klip referensi, dan "instruct TTS" yang mensintesis ucapan hanya dari deskripsi suara ("suara perempuan yang hangat, sedikit lebih lambat"), tanpa audio referensi sama sekali.
• Penyuntingan konten — menulis ulang apa yang diucapkan: mengganti, menyisipkan, atau menghapus kata dalam rekaman yang ada, serta penyuntingan lirik yang menulis ulang kata-kata dari klip nyanyian sambil mempertahankan melodi dan suara penyanyinya.
• Penyuntingan akustik — nada dalam seminada, kecepatan bicara, dan volume dalam desibel, masing-masing dapat disesuaikan pada klip yang ada sementara identitas dan kontennya dipertahankan.
• Penyuntingan paralinguistik — emosi, timbre (sesuai deskripsi), de-aksentuasi, menambah atau menghilangkan suara non-verbal seperti napas, tawa, dan batuk, serta mengubah antara ucapan normal dan bisikan.
Peningkatan dan pemisahan — peningkatan ucapan (penghilang derau dan penghilang gaung), pemisahan ucapan berdasarkan urutan berbicara, pemisahan musik yang mengeluarkan suara nyanyian dari campuran, dan ekstraksi pembicara target yang diidentifikasi dari apa yang dikatakan pembicara.
Daftar itulah pembeda yang sesungguhnya. Sistem ucapan terbuka paling mumpuni pada 2026 kuat dalam satu atau dua hal ini — kloning suara dan TTS adalah bidang yang paling ramai — dan lemah atau tidak ada pada sisanya. Taruhan AuK adalah keluasan: bobot yang sama, format instruksi yang sama, di seluruh generasi, penyuntingan, dan pemisahan, yang merupakan cakupan yang biasanya hanya hadir sebagai kumpulan model spesialis hasil fine-tuning.
Bagaimana cara pembangunannya.
Membaca repositori dan halaman proyek secara bersamaan memberikan gambaran arsitektur yang konsisten. AuK bukanlah model bahasa audio autoregresif dari jenis yang membaca teks dan mengeluarkan token. AuK adalah sistem difusi flow-matching dalam pola model gambar, dengan tiga bagian:
• Model bahasa besar multimodal — Qwen/Qwen2.5-Omni-3B, diunduh secara terpisah — membaca instruksi dan audio referensi apa pun serta menghasilkan pengondisian semantik.
• VAE audio yang dilatih bersama pada ucapan, audio umum, dan musik melakukan encode dan decode pada 24 kHz melalui latent akustik 50 Hz; konfigurasi repositori mengidentifikasinya sebagai BigVGANFlowVAE dengan dimensi laten 64 dan penurunan sampel 480 kali lipat, serta menyertakannya sebagai berkas vae.safetensors terpisah.
• Inti generatifnya adalah Transformer hibrida rectified-flow: blok-blok MMDiT dual-stream yang menjaga kondisioning teks dan audio tetap terpisah, diikuti blok-blok DiT single-stream terpadu yang mencampurkannya, dilatih dengan objective flow-matching. Konfigurasi yang dirilis menunjukkan model selebar 1.536 dengan 24 head, 10 lapisan dual-stream, dan 20 lapisan single-stream.
AuK-Flash adalah transformer yang sama setelah distilasi. Tencent memaparkan proses dua tahap — inisialisasi konsistensi tingkat lintasan, lalu objektif DMD dengan "perutean tugas yang terpisah" — yang diakhiri dengan supervisi regresi prediksi bersih. Hasilnya, menurut halaman proyek, adalah kualitas generasi yang mendekati model guru dalam empat langkah sampling tanpa panduan bebas pengklasifikasi saat inferensi, dengan percepatan wall-clock sekitar 4,5× dibandingkan model penuh dalam kondisi yang setara. Itu adalah klaim vendor yang belum direproduksi, tetapi itulah alasan konkret mengapa AuK-Flash adalah varian yang akan dipilih oleh pengembang.
Apa yang diklaim Tencent, dan apa yang dapat diperiksa pembaca.
Halaman proyek membuat klaim kualitatif yang kuat — AuK "terdepan" dalam hal generasi dan penyuntingan serta "kompetitif" dalam tugas restorasi tingkat sinyal seperti peningkatan dan pemisahan — dan mencantumkan rangkaian tolok ukur di baliknya: Seed-TTS-Eval dan InstructTTSEval untuk generasi, MMAE-Speech, SpeechEditBench, dan Ming-Freeform-Audio-Edit untuk penyuntingan, DNSMOS dan UTMOS untuk kualitas persepsi, serta DNS Challenge, CHiME-4, dan Libri2Mix untuk peningkatan dan pemisahan. Tidak ada skor numerik yang dipublikasikan di halaman tersebut, tidak ada makalah yang menyertainya, dan belum ada pihak ketiga yang mereproduksinya. Setiap klaim tersebut dilaporkan oleh vendor dan harus dipahami demikian sampai ada pengujian independen.

Dua klaim lain perlu ditandai karena tidak bertahan dalam pemeriksaan langsung pada 9 September 2026. Pertama, kartu tersebut menyatakan kode tersedia untuk publik dan menautkan github.com/Tencent-Hunyuan/AuK untuk panduan instalasi, Gradio, ComfyUI, dan fine-tuning—tetapi repositori itu mengembalikan HTTP 404 hingga saat penulisan ini, dan repositori tersebut tidak termasuk dalam repositori publik organisasi Tencent-Hunyuan. Kodenya mungkin masih dalam proses diluncurkan; apa pun itu, "kode tersedia" saat ini hanyalah klaim di kartu, bukan sesuatu yang bisa ditindaklanjuti pembaca. Kedua, kartu tersebut menunjuk ke Space demo di Hugging Face dan ModelScope: studio ModelScope merespons, tetapi Space Hugging Face menampilkan dinding otorisasi saat diperiksa, jadi demo-demo tersebut paling banter hanya sebagian yang bersifat publik.
Apa yang ada di sini, apa yang hilang
Melakukan evaluasi pada 9 September 2026 membedakan rilis yang sesungguhnya dari rilis yang lengkap.
• Tersedia — dua set bobot yang dapat diunduh di bawah lisensi MIT: tencent/AuK untuk model dasar dan tencent/AuK-Flash untuk varian distilasi empat langkah, masing-masing sekitar 6,1 GB untuk transformer difusi ditambah VAE yang disertakan, dicerminkan di Hugging Face dan ModelScope.
• Kini — cakupan tugas yang luar biasa luas dalam satu antarmuka instruksi: pembuatan, penyuntingan konten serta aspek akustik dan paralinguistik, peningkatan, dan pemisahan — semuanya dalam satu keluarga model.
• Kami menyajikan kisah 'cepat' yang konkret: AuK-Flash disuling menjadi empat langkah tanpa panduan bebas-pengklasifikasi, dengan percepatan wall-clock 4,5× yang diklaim vendor.
• Yang hilang — sebuah pengumuman. Belum ada postingan blog Tencent, postingan media sosial, siaran pers, maupun postingan kanal Hunyuan yang menunjuk ke salah satu pun dari kedua repositori tersebut.
• Tidak ada — makalah atau laporan teknis. Blok sitasi di halaman proyek hanyalah placeholder tanpa penulis dan tanpa ID arXiv, serta tidak ada angka yang dipublikasikan di balik klaim-klaim benchmark tersebut.
• Hilang — kode yang dapat diakses. Repositori GitHub dan Cookbook yang ditautkan dari kartu tersebut mengembalikan 404 pada saat pemeriksaan status, jadi saat ini satu-satunya artefak yang dapat dijalankan adalah bobot (weights) ditambah apa pun yang dirakit oleh komunitas di sekitarnya.
• Belum ada — serving dan evaluasi independen. Tidak ada penyedia inferensi yang menghosting AuK, tidak ada API yang dihosting, dan dengan unduhan yang hanya berjumlah puluhan, belum ada yang memublikasikan reproduksinya.

Menjalankan AuK-Flash hari ini, atau menunggu?
Jika Anda ingin menjalankan AuK-Flash sendiri, jalur unduhannya sudah eksplisit meskipun kodenya tidak demikian: lakukan pull untuk tencent/AuK-Flash dan tencent/AuK (basisnya opsional kecuali Anda menginginkan model teacher), serta pull Qwen/Qwen2.5-Omni-3B, karena checkpoint hanya berisi bobot diffusion-transformer dan layer-fusion — encoder multimodal dan VAE dimuat dari file terpisah saat runtime, dan kartu model mencatat bahwa kunci text_encoder yang hilang selama pemuatan adalah hal yang diharapkan. Perangkat keras adalah kendala sesungguhnya. Ini adalah diffusion transformer ~1.5B yang checkpoint-nya saja ~6.1 GB, berjalan bersama encoder multimodal ~3B dan VAE, jadi GPU 24 GB adalah titik awal yang masuk akal, bukan model yang cocok untuk laptop; catatan memori pada config, yang menyebutkan bahwa gradient checkpointing menurunkan puncak pelatihan dari kira-kira 91 GB menjadi 75 GB, berkaitan dengan pelatihan dan tidak boleh dibaca sebagai kebutuhan untuk inferensi. Untuk perangkat lunak, config default-nya menggunakan backend flash-attention, tetapi CLI inferensi dapat beralih ke backend torch attention biasa, yang menghilangkan langkah build flash-attn pada percobaan pertama.
Apakah itu layak dilakukan hari ini bergantung pada apa yang sedang Anda bangun. Kondisi yang sebenarnya adalah bahwa ini adalah model untuk diperhatikan dan diuji dalam sandbox, bukan untuk langsung disambungkan ke pipeline produksi — tanpa paper, tanpa kode yang dapat diakses, dan tanpa evaluasi independen, klaim kemampuan ini sepenuhnya bertumpu pada perkataan Tencent. Bagi tim yang menginginkan pembangkitan, penyuntingan, atau pemisahan ucapan melalui API saat ini, model yang benar-benar dilayani adalah pilihan pragmatis — dan justru itulah peran OrcaRouter di antara model-model yang memang memiliki endpoint: satu API untuk 200+ model dengan harga publik penyedia yang diteruskan tanpa markup, sehingga harga vendor adalah harga Anda sejak hari pertama, serta failover otomatis agar pendatang baru yang belum teruji dapat dicoba pada sebagian lalu lintas nyata tanpa mempertaruhkan pipeline. Tidak ada satu pun dari itu yang berlaku untuk AuK atau AuK-Flash saat ini, karena belum ada yang melayaninya. Begitu ada penyedia yang menghosting AuK, ekonomi router menjadi cara murah untuk mengevaluasinya; hingga saat itu tiba, pilihannya adalah menghosting sendiri bobotnya atau menunggu.
Pertanyaan yang Sering Diajukan
Apakah AuK atau AuK-Flash tersedia melalui API?
Tidak. Keduanya adalah rilis khusus bobot (weights-only). Tidak ada penyedia inferensi yang menampungnya dan tidak ada API yang di-hosting, jadi tidak ada yang bisa dipanggil saat ini — satu-satunya cara untuk menggunakannya adalah mengunduh bobot tersebut dan menjalankannya sendiri.
Apa perbedaan antara AuK dan AuK-Flash?
Keluarga model yang sama pada dua tahap. AuK adalah model dasar, ditujukan untuk generasi berkualitas tinggi; AuK-Flash adalah varian sulingannya, disetel untuk inferensi empat langkah yang cepat tanpa panduan bebas-pengklasifikasi, yang menurut Tencent berjalan sekitar 4,5× lebih cepat daripada model dasar dalam kondisi yang sepadan. Angka percepatan itu dilaporkan oleh vendor dan belum diukur secara independen.
Bisakah AuK-Flash digunakan secara komersial?
Bobot dirilis di bawah lisensi MIT, yang mengizinkan penggunaan komersial dengan pemberitahuan lisensi tetap dipertahankan — lisensi bobot terbuka umum yang paling tidak restriktif. Repositori kode terpisah yang ditautkan oleh kartu tersebut tidak dapat diakses per 9 September 2026, jadi jawaban praktis untuk penggunaan ulang kode masih terbuka sampai repositori itu muncul.
Apa yang harus ditonton
• Repositori kode — github.com/Tencent-Hunyuan/AuK adalah satu-satunya artefak paling berharga yang belum tersedia. Ketika artefak ini muncul, templat instruksi Cookbook akan mengubah daftar tugas di atas dari materi pemasaran menjadi sesuatu yang dapat dijalankan.
• Sebuah percobaan independen — reproduksi pihak ketiga pertama akan menentukan apakah klaim 'terdepan' dalam hal generasi dan penyuntingan bertahan ketika dihadapkan pada audio nyata, dan apakah AuK-Flash dengan empat langkah benar-benar mendekati model dasarnya.
• Sebuah makalah — sitasi di halaman proyek masih berupa placeholder, yang biasanya menandakan pengajuan arXiv akan segera hadir; resep pelatihan, angka benchmark, dan detail distilasi semuanya termuat di sana.
• Daftar penyajian — penyedia inferensi pertama yang menghosting AuK mengubahnya dari direktori bobot menjadi model yang dapat dipanggil dengan harga, yang saat itulah model tersebut menjadi dapat diuji coba melalui router, bukan sebagai proyek yang dihosting sendiri.
AuK dan AuK-Flash nyata tetapi belum selesai, seperti halnya rilis terbuka paling menarik biasanya: bobotnya jujur, dan cerita di sekitarnya belum ditulis. Tandai tencent/AuK-Flash, perlakukan setiap klaim kemampuan sebagai laporan vendor sampai sebuah paper atau benchmark independen muncul, dan periksa apakah beberapa hari ke depan menghadirkan kode yang akan mengubah ini dari artefak yang menjanjikan menjadi sesuatu yang dapat dibangun.
