Kartu judul hero yang dihasilkan untuk AuK yang menampilkan wordmark "AuK" di atas baris-baris subjudul "Tencent's open-source 1.5B speech model" dan "One natural-language instruction for every audio task — clone, edit, enhance, separate.", dengan bentuk gelombang biru lembut yang sedang diedit oleh kursor teks tipis dan empat ikon datar berlabel Voice Clone, Edit, Enhance, dan Separate, dengan logo OrcaRouter yang dikompositkan di sudut kanan bawah.
Guides & Insights

AuK: Tencent Diam-diam Membuka Sumber Model Ucapan 1.5B yang Memperlakukan Setiap Tugas Audio sebagai Perintah Teks

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Berikut adalah kalimat yang tidak dapat dilakukan oleh satu alat sintesis suara pun yang dapat Anda unduh saat ini dalam satu kali proses: ambil rekaman ini, ganti kata "house" dengan "home", naikkan nada setengah seminada, buang napas sebelum frasa terakhir, hilangkan derau latar belakang, lalu bacakan ulang hasilnya dengan suara baru yang hanya dideskripsikan sebagai "pria paruh baya yang hangat dengan sedikit aksen Kanton". Jawaban Tencent terhadap kalimat itu adalah AuK, sebuah "model fondasi untuk generasi dan penyuntingan ucapan" dengan 1,5 miliar parameter yang dirilis sebagai sumber terbuka minggu ini tanpa pos peluncuran dan tanpa siaran pers — dan saudara sulingnya yang terdistilasi, AuK-Flash, kini hadir dengan satu hal yang hilang dari cerita ini saat pertama kali kami menulisnya: laporan teknis dengan angka-angka terlampir. "AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing" (arXiv:2609.08936, cs.SD, diajukan 2026-09-08) kini dikutip baik pada kartu model Hugging Face maupun README GitHub, dengan daftar makalah bertanggal 2026-09-08 dan baris berita repositori kode itu sendiri bertanggal 2026/09/09. Yang tidak dilakukan laporan tersebut adalah menjawab pertanyaan yang selama ini penting — setiap angka di dalamnya adalah milik Tencent sendiri, diuji terhadap garis dasar yang dipilih Tencent, dan per 2026-09-10 tidak ada seorang pun di luar perusahaan yang mereproduksi satu pun dari angka-angka itu.

Ini adalah tulisan berisi apa yang kita ketahui sejauh ini, direvisi satu kali. Tencent masih belum mengumumkan AuK di kanal-kanal utamanya yang dapat kami temukan, jadi yang tercatat adalah: kartu model dan repositori Hugging Face untuk AuK dan AuK-Flash, repositori kode di bawah organisasi Tencent-Hunyuan, situs proyek di auk-project.github.io, dan kini makalahnya. Penambahan terakhir itu mengubah apa yang dapat diketahui — arsitektur, resep pelatihan, dan angka evaluasi dijelaskan secara rinci untuk pertama kalinya — tanpa mengubah apa yang telah terverifikasi. Anggaplah semua angka di bawah ini sebagai laporan vendor, karena memang itulah adanya, dan perhatikan bahwa perbandingan dalam laporan tersebut sepenuhnya dilakukan terhadap model-model terbuka lainnya, bukan terhadap platform wicara tertutup yang justru akan menjadi pesaing sesungguhnya bagi AuK.

Apa yang sebenarnya dirilis, dan betapa senyapnya.

Linimasa masih menjadi ringkasan paling jujur dari perilisan ini, dengan satu koreksi dari pemeriksaan pertama kami. Repositori Hugging Face dibuat pada pertengahan Agustus — AuK pada 2026-08-18 — tetapi tidak ada aktivitas hingga minggu ini. Ketika kami membaca kartu model AuK pada 2026-09-09, satu baris beritanya bertanggal 2026-09-07; sehari kemudian baris yang sama terbaca 2026/09/09 dan mengarahkan pembaca ke makalah dan demo Spaces. Repositori GitHub yang berisi kode inferensi dan pelatihan dibuat pada 2026-08-19 dan terakhir di-push pada 2026-09-09. Dengan kata lain: bobot, lalu kode, lalu laporan teknis — tiga rilis bertahap dalam empat hari, dan hingga tulisan ini dibuat masih belum ada pengumuman dari kanal utama Tencent.

• Bobot model berada di Hugging Face di bawah org tencent dan dicerminkan di ModelScope di bawah Tencent-Hunyuan — dua mirror, lisensi MIT yang sama.

• Setiap repositori model menyimpan satu checkpoint safetensors beserta config dan VAE: auk_base.safetensors sebesar 6.12 GB dan vae.safetensors sebesar 0.64 GB untuk AuK; tata letak yang sama untuk AuK-Flash. Kartu model meminta Anda untuk juga mengunduh Qwen/Qwen2.5-Omni-3B, text encoder yang dimuat AuK secara terpisah saat runtime.

Bingkai "tidak ada yang menyadari" sudah kedaluwarsa, dan cepat. Repositori kode itu berada di nol bintang dan nol fork saat kami periksa pada 2026-09-09; pada 2026-09-10 sudah menunjukkan 216 bintang, 12 fork, dan isu terbuka pertamanya. Kartu AuK melaporkan sekitar tiga puluh unduhan dalam sebulan terakhir dengan 26 suka. Yang belum berubah: tab diskusi masih kosong, dan kartu tersebut masih mencatat bahwa checkpoint belum diterapkan oleh penyedia inferensi mana pun.

• Kedua kartu model, README, dan tautan makalah memiliki demo Spaces di Hugging Face dan ModelScope. Space Hugging Face tidak dapat diakses publik tanpa masuk log saat kami periksa, jadi anggap jalur "coba di browser Anda" sebagai belum terkonfirmasi untuk pengguna anonim.

A screenshot of the Hugging Face model page for tencent/AuK, captured September 9, 2026, showing the Tencent org, the model name, the Text-to-Speech pipeline tag, model tags including zero-shot-tts, voice-cloning, speech-editing, instruction-guided and diffusion, the licence "mit", and the model card opening with "AuK: An Open-Source Foundational Model for Speech Generation and Editing", a News entry dated 2026/09/07 reading "AuK is now open-source. Code and model weights are publicly available.", and the start of the Introduction describing AuK as a 1.5B foundation model.

Kartu Hugging Face di atas masih merupakan seluruh permukaan publik dari sebuah rilis yang dapat diinstal: sebuah kartu model, sebuah konfigurasi, dua file safetensors, dan sebuah lisensi. Yang telah ditambahkan sejak itu adalah lapisan dokumentasi di sekitarnya — sebuah makalah, tabel tolok ukur, dan blok kutipan — dan semua itu tidak mengubah fakta bahwa tidak ada changelog, tidak ada utas diskusi, dan tidak ada daftar penyedia inferensi di belakangnya.

Intinya: satu antarmuka instruksi, enam belas tugas ucapan

Klaim AuK bukanlah bahwa ini adalah model text-to-speech terbaik yang pernah dirilis. Melainkan bahwa generasi hanyalah satu dari lima keluarga tugas wicara yang dilatihkan pada model melalui satu antarmuka bahasa alami, di mana sebuah permintaan adalah pesan obrolan yang dapat membawa teks plus file audio referensi opsional. Makalah ini memformalkan secara persis taksonomi yang sudah diiklankan oleh situs proyek:

• Pembuatan ucapan — zero-shot TTS (ucapkan teks ini dengan suara klip referensi) dan instruction TTS (hasilkan ucapan hanya dari deskripsi suara, tanpa audio referensi sama sekali).

• Penyuntingan konten — menulis ulang apa yang diucapkan: mengganti, menyisipkan, atau menghapus kata dalam rekaman yang sudah ada; dan penyuntingan lirik, yang menulis ulang lirik yang dinyanyikan sambil mempertahankan melodi dan suaranya.

• Penyuntingan akustik — nada dalam seminada, penskalaan kecepatan bicara, dan volume dalam desibel.

• Penyuntingan paralinguistik — perubahan emosi, perubahan timbre dari sebuah deskripsi, penghilangan aksen, menambah atau menghilangkan suara non-verbal (napas, tawa, batuk), dan mengonversi antara ucapan normal dan bisikan dengan tetap mempertahankan pembicaranya.

• Peningkatan dan pemisahan — peredaman bising dan dereverberasi ucapan, pemisahan ucapan berdasarkan urutan bicara, pemisahan musik/vokal, dan ekstraksi pembicara target yang diidentifikasi dari apa yang diucapkan pembicara.

Kasus instruction-TTS adalah yang membedakan ini dari perilisan peniruan suara pada umumnya: AuK akan membaca sebuah kalimat dengan suara yang hanya ada sebagai deskripsi teks — contoh dalam dokumentasi itu sendiri menyebutkan seorang wanita berusia dua puluhan berbicara kepada pasangannya yang baru saja pulang ke rumah, dengan nada hangat, penuh perhatian, dan sedikit genit, timbre yang lembut dan manis, serta intonasi akhir kalimat yang sedikit naik, semuanya tanpa klip referensi yang dilampirkan. Hal ini menghilangkan kebutuhan akan rekaman referensi, yang biasanya menjadi biaya utama dalam peniruan suara. Laporan tersebut memberikan angka untuk tugas ini untuk pertama kalinya, dan ini adalah salah satu dari sedikit bidang di mana AuK mengungguli para pesaingnya secara mutlak, bukan hanya menang tipis.

Di dalam "1.5B": angka tersebut mengecilkan runtime.

Jumlah parameter AuK menggambarkan transformer difusi, bukan keseluruhan pipeline, dan paper tersebut kini merinci kedua bagiannya. Backbone-nya adalah Transformer rectified-flow hibrida — tiga puluh lapisan yang terdiri dari sepuluh blok MMDiT dual-stream yang diikuti oleh dua puluh blok DiT single-stream terpadu, ukuran hidden 1536, 24 kepala atensi berdimensi 64, lebar intermediate SwiGLU 3072, yang menjadi sumber angka "sekitar 1,5 miliar parameter". Di sekitarnya terdapat dua komponen yang dimuat secara terpisah: LLM multimodal (Qwen/Qwen2.5-Omni-3B) yang mengubah instruksi dan audio referensi apa pun menjadi pengondisian semantik, serta VAE audio 24 kHz kausal — konfigurasi menamainya BigVGANFlowVAE — yang memproses laten 64 dimensi pada frame rate 50 Hz, dengan lebar kanal encoder hingga 768 dan lebar kanal decoder hingga 1536. Jadi runtime penuhnya adalah backbone ~1,5B ditambah encoder 3B ditambah VAE, dan instruksi pengunduhannya secara eksplisit menyatakan bahwa encoder adalah checkpoint terpisah dengan ketentuannya sendiri.

Pelatihan, menurut laporan itu, berjalan bertahap dan pada skala yang hanya diisyaratkan oleh situs proyek: pemanasan khusus generasi sebanyak 50.000 pembaruan, lalu 600.000 pembaruan gabungan generasi-dan-pengeditan, pada sekitar 3,03 miliar instance instruksi–audio yang mewakili sekitar 1,95 juta jam supervisi efektif, di 256 GPU, dengan tambahan 1,24 juta pembaruan pada VAE. Pasca-pelatihan menggabungkan optimasi preferensi umpan balik manusia dengan pembelajaran penguatan berbasis imbalan, yang dibangun di atas 818 kelompok preferensi informatif dan 9.080 kandidat ternilai, kumpulan prompt RL berisi 10.000 prompt zero-shot dan 5.000 prompt pengikut instruksi, 30.000 sampel penilai gaya, serta model imbalan yang disetel halus dari Qwen2.5-Omni-7B. Itu adalah tumpukan pasca-pelatihan yang serius untuk rilis terbuka 1,5B, dan juga merupakan pengingat bahwa "bobot terbuka" menggambarkan artefaknya, bukan komputasi yang menghasilkannya — sebuah poin yang patut diingat saat menimbang apakah Anda dapat mereproduksinya.

A generated single-column scoreboard for AuK listing Params: 1.5B backbone + 3B Qwen encoder; License: MIT; Open-sourced: 2026-09-07 weights · 2026-09-09 code; Tasks: 16 across 5 speech families; Runtime: 24 kHz · 50 Hz audio latents; AuK-Flash: 4-step, no CFG, 4.5× faster (vendor), with the footer "Specs from Tencent's repos & project site; vendor-reported, not independently reproduced yet." and the OrcaRouter logo composited in the bottom-right corner.

Setiap angka dalam lembar spesifikasi itu dibaca dari repositori dan situs web Tencent sendiri, bukan diukur oleh kami, dan makalah tersebut tidak mengubah hal itu — hanya memindahkan lebih banyak baris tersebut dari "diklaim" menjadi "terdokumentasi". Satu-satunya angka yang benar-benar diuji sejak kami pertama kali menerbitkan adalah aktivitas repositori itu sendiri, yang naik dari nol bintang menjadi beberapa ratus dalam sehari.

A screenshot of the AuK project website at auk-project.github.io, captured September 9, 2026, showing the title "AuK: An Open-Source Foundational Model for Speech Generation and Editing", badge links for GitHub, Hugging Face and ModelScope, the AuK-Flash variant name alongside Tencent Hunyuan co-branding, the tagline "One model for every speech task", and the opening description of AuK as a 1.5B-parameter foundational model with a multimodal language model, a 50 Hz VAE and a hybrid transformer under a flow-matching objective.

Situs proyek tetap menjadi tempat diagram arsitektur dan co-branding akademis berada, dan masih menjadi cara termurah untuk melihat bentuk modelnya: model bahasa multimodal untuk pengondisian semantik, VAE 50 Hz untuk akustik, dan transformer hibrida dengan tujuan flow-matching. Bagian tolok ukurnya, yang saat pertama kali kami lihat hanya mencantumkan perangkat evaluasi tanpa skor, kini telah memiliki makalah yang dapat dijadikan rujukan.

Laporan teknisnya tiba, dan angka-angka tersebut adalah milik Tencent sendiri.

Inilah inti dari pembaruan ini. Makalah ini melaporkan hasil dari tujuh rangkaian evaluasi — daftar yang sama yang selama ini diiklankan situs proyek tanpa angka — dan pada sebagian besar sumbu generasi dan penyuntingan konten, AuK memimpin di kancah terbuka. Bacalah ini sebagai tabel tolok ukur vendor, karena memang itulah adanya: tencent menjalankan setiap perbandingan, memilih setiap baseline, dan belum menerbitkan kode untuk mereproduksi kerangka pengujian tersebut.

• TTS zero-shot pada Seed-TTS-Eval: AuK rata-rata mencapai 2.65 WER dengan kesamaan speaker 0.795, dibandingkan dengan Qwen3-TTS pada 3.07 dan 0.745, Seed-TTS pada 3.65 dan 0.778, serta VoxCPM2 pada 3.65 dan 0.767. AuK-Flash mencapai 2.85 dan 0.790. Hasil split tunggal terbaik adalah 1.02 WER pada set tes bahasa Inggris dan 5.91 pada set sulit bahasa Mandarin.

• TTS dengan kendali instruksi pada InstructTTSEval: AuK mencapai skor 83.37 pada bahasa Mandarin dan 81.60 pada pengikutan deskripsi bahasa Inggris, dibandingkan dengan Qwen3-TTS-VD pada 81.10 dan 82.40 serta MOSS-VoiceGenerator pada 80.00 dan 82.00. AuK-Flash mencapai 78.80 pada bahasa Mandarin tetapi menyamai skor bahasa Inggris terbaik di bidang ini dengan 82.40.

• Pengeditan konten pada SpeechEditBench: akurasi 91.83 berbanding 76.46 milik Ming-UniAudio, dan 71.33 pada prosodi berbanding 26.50 — dua selisih terbesar di seluruh laporan.

• Penyuntingan berpanduan instruksi pada Ming-Freeform-Audio-Edit, pengaturan penuh: tingkat kesalahan kata turun dari 10.46 menjadi 3.09 untuk bahasa Mandarin dan dari 14.28 menjadi 3.96 untuk bahasa Inggris dibandingkan dengan Ming-UniAudio, dengan akurasi penyuntingan meningkat dari 79.62 menjadi 91.47 dan dari 70.98 menjadi 85.25. Pada penyuntingan akustik, perbandingan yang sama menurunkan tingkat kesalahan kata dari 5.01 menjadi 2.02 untuk bahasa Mandarin dan 10.75 menjadi 3.48 untuk bahasa Inggris.

Penyuntingan paralinguistik pada MMAE-Speech: tingkat kepatuhan instruksi 48.23 dan penulisan ulang konten 88.11, dibandingkan dengan Step-Audio-EditX pada 43.52 dan 77.27, serta Ming-UniAudio pada 34.13 dan 76.01. AuK-Flash menunjukkan recall model edit terbaik dalam tabel, dengan nilai 13.85.

• Restorasi, di mana modelnya kompetitif, bukan dominan: DNS Challenge tingkat kesalahan kata desinkronisasi 2.66 dengan kemiripan pembicara 0.99, dibandingkan dengan RE-USE sebesar 3.31; CHiME-4 tingkat kesalahan kata 7.98, dibandingkan dengan RE-USE sebesar 10.71; Libri2Mix tingkat kesalahan kata 9.12, dibandingkan dengan MossFormer2-SS sebesar 9.34; dan VCTKSR tingkat kesalahan kata 3.06 dengan kemiripan 0.97.

{{1}}VAE itu sendiri, jika dievaluasi secara terpisah: AuK-VAE mencapai 4.143 PESQ pada ucapan, 3.833 pada audio umum, dan 3.884 pada musik, dibandingkan dengan MiniMax-H3-AudioVAE yang berada di 3.633, 2.835, dan 2.801 — kemenangan menyeluruh yang lebih penting daripada yang terlihat, karena laten akustik yang lossy membatasi setiap tugas yang dibangun di atasnya.{{/1}}

Pola di antara poin-poin tersebut lebih menarik daripada kemenangan utamanya. AuK unggul jauh pada semua hal yang bermakna "mengubah apa yang dikatakan atau bagaimana bunyinya, dan mempertahankan yang lainnya" — pengeditan konten, prosodi, pengeditan akustik, rekonstruksi. AuK jauh lebih dekat dengan bidang pengeditan emosi dan paralinguistik, di mana akurasi emosi SpeechEditBench sebesar 9,94 nyaris tidak dapat dibedakan dari 3,43 milik Ming-UniAudio pada tolok ukur yang sama-sama lemah bagi keduanya, dan skor akustik keseluruhannya sebesar 37,07 berada pada rentang yang sama dengan para baseline. Jadi "satu model untuk semua tugas bicara" adalah bingkai Tencent; yang sesungguhnya ditunjukkan laporan tersebut adalah satu model yang unggul pada beberapa tugas dan hanya sekadar hadir untuk tugas-tugas lainnya.

Dua checkpoint: AuK dan AuK-Flash

Tencent merilis dua varian di bawah lisensi MIT yang sama. AuK adalah model dasar berkualitas penuh, dan laporan tersebut menetapkan pengaturan pengambilannya pada 32 evaluasi fungsi dengan skala bimbingan bebas-klasifikasi 2,0. AuK-Flash adalah versi terdistilasi: inisialisasi konsistensi dan objektif DMD Terpisah yang dirutekan berdasarkan tugas, menghasilkan dalam empat langkah tetap dengan bimbingan dimatikan sepenuhnya, yang menurut makalah tersebut merupakan percepatan 4,5× pada waktu proses dibandingkan model penuh dalam kondisi yang serasi. Angka-angka dari makalah itu sendiri membuat Flash tetap dekat pada sebagian besar tugas generasi — rata-rata kesalahan kata 2,85 dan kesamaan 0,790 pada Seed-TTS-Eval — yang menjadikan klaim kecepatan tersebut layak diuji daripada diabaikan: difusi empat langkah dengan kualitas mendekati guru adalah yang akan membuat editor ucapan 1,5B terasa interaktif pada satu GPU. Meski demikian, "kondisi yang serasi" adalah frasa Tencent untuk menggambarkan tolok ukur Tencent, dan angka 4,5× yang diukur oleh penulis adalah klaim yang justru membutuhkan pihak ketiga sebelum mengubah keputusan pengadaan.

Apa yang dapat Anda jalankan hari ini

Permukaan praktisnya lebih luas daripada sekadar penurunan bobot yang tenang, karena kode tersebut dirilis bersamanya. Instalasi menargetkan Python 3.10 melalui uv atau Conda, dan README menawarkan opsi instalasi tambahan yang menyertakan Gradio, node ComfyUI, atau tumpukan fine-tuning. Alat baris perintah auk-infer mencakup semua tugas dengan bentuk pesan yang sama: --instruction selalu wajib, dan --audio bersifat opsional tergantung pada tugasnya. Server Gradio (auk-gradio) menampilkan model dengan pemilih, dan ada node kustom ComfyUI dengan alur kerja yang dapat digunakan kembali, meskipun integrasi tersebut didokumentasikan dengan batas urutan sumber-plus-target 30 detik. API Python mencerminkan CLI, dan pipeline fine-tuning ringan melatih JSONL berisi pasangan instruksi-plus-audio menggunakan format pesan yang sama dengan inferensi. README juga menjelaskan Prompt Enhancer yang mengubah permintaan bebas menjadi perintah auk-infer yang siap dijalankan; alat ini mengharapkan endpoint chat yang kompatibel dengan OpenAI dan akan kembali ke model lokal SenseVoiceSmall untuk pengenalan suara ketika tidak ada kredensial cloud ASR yang disetel. Salah satu keterbatasan saat ini didokumentasikan dengan jelas: Qwen3-Omni belum didukung sebagai jalur encoder, sehingga checkpoint Qwen2.5-Omni-3B tetap menjadi yang harus diunduh.

Yang masih tidak diberikan oleh dokumen-dokumen tersebut adalah batas minimum perangkat keras. Tidak ada angka VRAM yang dipublikasikan untuk inferensi. File konfigurasi membawa catatan tentang gradient-checkpointing mengenai puncak sekitar 91 GB yang turun menjadi sekitar 75 GB, yang menggambarkan batas memori saat pelatihan, bukan angka inferensi sekali jalan yang realistis, dan perintah referensi yang memuat AuK dan AuK-Flash bersama-sama menyebar keduanya di dua GPU — sambil mencatat bahwa keduanya dapat berbagi satu. Anggarkan untuk unduhan itu sendiri: kira-kira 6,8 GB per varian ditambah encoder Qwen2.5-Omni-3B, lalu ukur memori pada GPU Anda sendiri.

Apa yang tidak dikonfirmasi

Presisi tentang hal yang belum diketahui masih menjadi inti dari peliputan model sedini ini, dan laporan tersebut menghapus tepat satu item dari daftar ini sementara sisanya tetap utuh:

• Tidak ada run independen yang dapat kami temukan. Tidak ada sampel suara pihak ketiga, tidak ada replikasi tolok ukur, tidak ada kesan dari utas diskusi. Isu terbuka pertama repositori diajukan dan tidak dijawab, dan jumlah unduhan model card masih puluhan, sehingga kesenjangan antara tabel yang dipublikasikan dan tabel yang direplikasi saat ini adalah keseluruhan ceritanya.

• Evaluasi ini dijalankan sendiri dan sempit dalam satu hal yang spesifik. Setiap baseline dalam laporan adalah model open-weight lain — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. Tidak ada platform ucapan terhosting tertutup yang sebenarnya akan dipertimbangkan pembeli saat menimbang AuK yang muncul, jadi "memimpin bidang" di sini berarti "memimpin bidang terbuka yang dipilih Tencent".

• Nama "AuK" masih tidak pernah dijabarkan di mana pun di makalah, kartu, atau kode, dan nama tersebut sangat berbenturan dalam pencarian dengan burung laut, American University of Kuwait, serta repositori yang tidak terkait.

• Tim kini setidaknya terlihat — makalah ini mencantumkan 33 penulis yang dipimpin oleh Ziyang Ma, dengan afiliasi yang mencakup organisasi Tencent Hunyuan, Universitas Jiao Tong Shanghai, Institut Inovasi Shanghai, dan Universitas Teknologi Nanyang — tetapi siapa di dalam Tencent yang memiliki model tersebut sehari-hari, dan apakah ini merupakan lini Hunyuan atau kolaborasi akademik yang terpisah, masih tidak disebutkan.

Cakupan bahasa masih hanya terdokumentasi sebagian: kartu AuK-Flash menyatakan bahasa Mandarin dan Inggris, dan contoh kodenya mencampur keduanya, tetapi model dasar tidak memiliki daftar bahasa formal. Lisensi juga memiliki bentuk yang sama — AuK sendiri adalah MIT, sementara encoder Qwen yang diunduh secara terpisah memiliki ketentuannya sendiri, jadi "model MIT" dan "semua yang Anda butuhkan untuk menjalankannya adalah MIT" bukanlah pernyataan yang sama.

Mengapa model wicara open-weights yang terpadu itu penting

Baca daftar tugas AuK dibandingkan dengan apa yang sebenarnya dilakukan pembangun saat ini, dan taruhannya menjadi lebih jelas daripada sebelum angka-angka itu tiba. Mengerjakan semua tugas tersebut dengan alat yang ada berarti merangkai beberapa model spesialis — satu checkpoint terbuka untuk kloning, yang lain untuk peningkatan, separator terpisah, dan editing manual atau berbantuan model untuk konten — atau menyewa beberapa API hosted tertutup, masing-masing dihargai per tugas dan per menit audio, dan tidak ada satu pun yang dapat diedit seperti yang digambarkan AuK. Satu checkpoint open-weight yang memperlakukan semua itu sebagai satu masalah generasi yang dikondisikan teks adalah objek yang benar-benar berbeda, dan laporan tersebut kini mendukung versi yang lebih tajam dari klaim tersebut daripada yang dilakukan pemasaran: bagian editing itu nyata, bukan sekadar aspirasi. Kloning suara telah terkomoditisasi selama setahun terakhir, tetapi editing konten dan prosodi yang digerakkan oleh instruksi adalah tempat platform hosted tertutup masih memperoleh margin mereka, dan skor 91.83 berbanding 76.46 pada editing konten adalah bukti pertama bahwa model terbuka dapat merebut posisi tersebut.

Catatan jujurnya adalah bahwa ini merupakan model difusi dengan model bahasa 3B yang ditempel untuk pengondisian, dan ia mewarisi biaya dari bentuk tersebut. Kualitas per tugas tidak merata — sangat baik ketika tugasnya adalah "pertahankan semuanya kecuali suntingan", tetapi kurang kuat pada emosi — dan tidak ada endpoint yang di-host, tidak ada dukungan batching, dan tidak ada latensi yang dipublikasikan untuk apa pun kecuali perbandingan internal varian Flash. Untuk komponen-komponen pipeline suara di sekitarnya — LLM yang memutuskan apa yang harus dikatakan, dan endpoint chat Prompt Enhancer yang kompatibel dengan OpenAI — API routing adalah pilihan yang pas, dan OrcaRouter menyediakan akses ke 200+ model dengan harga resmi penyedia tanpa markup, sehingga separuh stack hanya butuh satu kunci dan tanpa kontrak kedua. Bagian audio masih berupa GPU yang Anda kendalikan dan checkpoint yang belum diaudit oleh siapa pun di luar Tencent.

Siapa yang harus melihat sekarang, dan siapa yang harus menunggu

Bagi peneliti wicara, pembuat perkakas, dan siapa pun yang pekerjaannya mengevaluasi model suara baru, alasan untuk mengunduh AuK minggu ini lebih kuat daripada di hari pertama, tetapi tetap dengan peringatan yang sama. Anda kini mendapatkan arsitektur yang terdokumentasi, resep yang tampak dapat direproduksi, dan tabel lengkap target yang harus dikalahkan — itulah yang membuat klaim yang belum direproduksi layak untuk diserang. Biaya menjadi pengguna awal tetap satu akhir pekan penyiapan dan satu GPU. Bagi siapa pun yang memilih tumpukan suara untuk produksi, laporan ini mengubah bentuk keputusan tanpa menyelesaikannya: kini ada angka-angka untuk diperdebatkan, tetapi angka itu milik vendor, tidak mencakup platform tertutup yang sebenarnya akan Anda jadikan tolok ukur, dan masih belum ada API, batas bawah VRAM, maupun rekam jejak. Perhatikan, secara berurutan: replikasi independen atas baris-baris Seed-TTS-Eval dan SpeechEditBench; sampel yang dipublikasikan atau demo Space yang dapat diakses; serta penyedia inferensi atau API terhosting yang mengadopsi AuK — pada titik itu, harga pass-through dari pihak kami adalah harga daftar penyedia, pada hari yang sama, karena itulah arti markup 0%. Pertanyaan yang menarik bukan lagi apakah Tencent merilis model TTS lain — melainkan apakah satu model terbuka benar-benar dapat menangani kelima kelompok tugas tersebut sekaligus, dan setelah Tencent memublikasikan jawabannya sendiri, satu-satunya hal yang tersisa adalah meminta orang lain untuk memverifikasinya.