Kartu judul hero untuk XingChen4 dengan subjudul 'MoE berikutnya dari China Telecom — diungkap oleh draf PR vLLM', menampilkan diagram datar grafik backbone DeepSeek-V2/V3 yang mengalir melalui matriks 'Sinkhorn-Knopp' ke dalam aliran residual mHC paralel, kartu bergaris putus-putus 'BELUM DIRILIS — bobot belum dipublikasikan', chip lencana untuk 'vLLM PR #54051' dan 'MLA + MoE + mHC', tag 'SINYAL AWAL — BELUM TERVERIFIKASI', dan logo OrcaRouter di pojok kanan bawah.
Engineering & Research

Xing4_0 Mencapai SGLang: PR Keenam, dan Ukuran Pertama yang Dinyatakan, untuk MoE Berikutnya Milik China Telecom

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Terpaut dua jam pada 16 September 2026, dua stack serving open-source yang dominan berhenti berselisih soal nama. vLLM mengajukan "[Model] Add Xing4_0 support" pada pagi hari; sgl-project/sglang menyusul dengan "feat: add Xing4_0 model support" pada 10:38 UTC, dan setelah enam minggu tiga nama beredar, kedua framework kini menyebut Xing4_0. Pull request SGLang membawa sesuatu yang tidak dimiliki PR mana pun sebelumnya: sebuah ukuran. PR itu mendeskripsikan model tersebut sebagai Xing4.0-29B-A4B, "MoE 29B-parameter dengan sekitar 4B parameter yang diaktifkan," dan memberikan perintah peluncuran yang menyebutkan jalur checkpoint, konteks 262.144 token, dan decoding spekulatif EAGLE. Ini adalah MoE milik China Telecom yang belum dirilis, MoE yang sama yang terus dikelilingi oleh pull request XingChen4 sejak Agustus, dan model ini tetap belum dirilis: bobotnya tidak publik, jalur checkpoint yang disebut PR tersebut tidak dapat diakses oleh siapa pun di luar proyek, tidak ada vendor yang mengonfirmasi nama maupun angkanya, dan tidak ada apa pun dalam tulisan ini yang diverifikasi secara independen. Fakta yang diambil dari pull request diberi label demikian; sisanya adalah sejarah dan inferensi. Model terdekat yang benar-benar bisa Anda panggil hari ini adalah DeepSeek V4 Flash.

Ini adalah tulisan "sejauh yang kita ketahui", yang dijaga tetap mutakhir alih-alih dimulai dari awal. Tulisan ini mencakup jejak PR enam minggu dan bagaimana pertanyaan penamaan diselesaikan, apa yang sebenarnya ditambahkan oleh dua pull request 16 September, arsitektur yang kini dibocorkan oleh file konfigurasi secara sangat rinci, dan apa yang perlu diperhatikan selanjutnya. Versi satu kalimatnya: MoE berikutnya dari China Telecom cukup nyata untuk telah mengumpulkan enam integrasi serving, satu baris tabel di vLLM yang ditandai TBA, satu entri dokumentasi di SGLang yang ditandai "segera hadir", dan jumlah parameter yang dinyatakan — namun tetap belum cukup nyata untuk dijalankan di mana pun yang bisa Anda jangkau.

Sinyalnya: enam integrasi, tiga nama, enam minggu

Jejaknya dimulai lebih awal daripada versi tulisan ini yang pertama dilaporkan, dan log commit-nya masih menjadi artefak yang paling mengungkap dalam kebocoran itu. PR vLLM pertama adalah #51237, dibuka pada 6 Agustus 2026 dengan judul "[WIP][Model] Add upcoming XingChen4 model support." Ketiga commit-nya sudah bercerita sendiri. Yang pertama berjudul "Add TeleChat4 model support." Yang kedua, hanya sedikit lebih dari satu jam kemudian, adalah "chore: revert premature docs and test entry for telechat4" — dokumentasi dan entri tes registry ditarik kembali karena dianggap prematur. Yang ketiga, pada 27 Agustus, adalah "rename xingchen4." Satu menit kemudian PR itu ditutup tanpa di-merge, dan sebelas menit setelah itu #54051 dibuka dengan judul yang sama, cabang fork yang sama (supported_telechat4) dan satu commit yang di-squash. Label needs-rebase telah ditambahkan di sela-sela waktu itu, jadi ini terbaca sebagai penutupan dan pembukaan kembali setelah pembersihan, bukan perubahan pikiran. Semua itu diajukan dari akun GitHub zyp2014, dengan setiap commit ditulis dan disetujui oleh zhangyp26 <zhangyp26@chinatelecom.com.cn>.

PR kedua itulah yang awalnya menjadi dasar tulisan ini, dan PR itu tidak lagi terbuka. #54051 ditutup oleh penulisnya sendiri pada 7 September 2026, tanpa digabungkan. Deskripsinya tetap layak dikutip, karena itulah kalimat yang bertahan melewati setiap penggantian nama dan setiap pembukaan kembali:

Bobot model belum dipublikasikan di Hugging Face Hub. PR ini dibuka untuk peninjauan kode awal. Setelah bobot dirilis, saya akan menambahkan entri pengujian di tests/models/registry.py, memperbarui docs/models/supported_models.md, dan menandai PR siap untuk ditinjau.

Kalimat itu adalah bentuk dari keseluruhan cerita: kodenya lebih maju daripada bobotnya. Tangkapan layar di bawah ini adalah halaman #54051 sebagaimana adanya pada 27 Agustus 2026, hari halaman itu dibuka — sebuah snapshot bertanggal, disimpan karena pull request yang ditampilkannya telah ditutup sejak saat itu. Bacalah sebagai catatan sinyal pada momen itu, bukan statusnya sekarang.

A screenshot of vLLM pull request #54051 '[WIP][Model] Add upcoming XingChen4 model support' opened August 27, 2026, showing the summary that XingChen4 reuses the DeepSeek-V2/V3 backbone (MLA attention, MoE block, optional DSA indexer) and replaces the residual connection with Manifold-constrained Hyper-Connections via Sinkhorn-Knopp projection, optional FlagOS/FlagGems acceleration with up to 19.87% TTFT and 26.32% TPOT reduction claimed on an H100 benchmark, and the status line that model weights are not yet public on Hugging Face (captured August 27, 2026).

Kemudian, pada 16 September, pola itu terulang — dua kali dalam satu hari. #57135, "[Model] Tambahkan dukungan Xing4_0," dibuka pagi itu dari akun yang sama, zyp2014, dengan satu commit yang sekarang ditulis oleh insinyur China Telecom yang berbeda — xiongji <xiongj9@chinatelecom.cn>. Sebelas file diubah, sekitar 1.300 penyisipan, nama baru di seluruhnya, dan peringatan yang sama di tempat yang sama: "Bobot model belum publik di Hugging Face Hub."

Dua jam dua puluh menit kemudian, stack penyajian lainnya tidak lagi tertinggal satu penggantian nama. sgl-project/sglang #39793, "feat: add Xing4_0 model support," dibuka dari branch bernama support_xing4_0, dan satu commit-nya membawa alamat xiongji yang sama dengan penggantian nama di vLLM. Empat belas file dan sekitar 1.400 penyisipan, yang sedikit lebih dari seribu di antaranya adalah satu file model. Ini adalah integrasi keenam yang diajukan untuk model ini dalam enam minggu, dan yang pertama diajukan sebagai bukan draf: GitHub mencantumkannya sebagai terbuka dan siap ditinjau, dengan sepuluh peninjau diminta — dan ketiga CI run-nya sudah merah.

Sisi SGLang sebelum hari ini berjalan seperti yang dilakukan vLLM. #33982, "feat(model): add TeleChat4 model support," dibuka pada 7 Agustus 2026 oleh kontributor PaddyXj dan ditutup tanpa di-merge pada 31 Agustus — hari yang sama ketika #37228, "feat: add XingChen4 model support," dibuka sebagai gantinya. Yang itu masih terbuka sebagai draf di bawah PaddyXj, di cabang bernama support_xingchen4, sedalam tiga commit dan terakhir disentuh pada 8 September. Daftar periksaannya adalah hal yang paling menarik di kedua framework: model memuat dan menghasilkan "secara lokal, pada bobot internal" sudah dicentang, pemanggilan alat sudah dicentang, penguraian penalaran sudah dicentang — dan CI publik tidak, karena "terblokir oleh rilis bobot." Seseorang memiliki checkpoint. Tidak ada yang mempublikasikannya. Dan tidak seperti vLLM, di mana setiap pengajuan ulang menutup pendahulunya terlebih dahulu, SGLang kini memiliki dua pull request aktif yang terbuka untuk model yang sama, dengan dua nama berbeda.

Yang dihasilkan oleh enam integrasi dalam enam minggu bukanlah versi yang lebih kuat dari sinyal yang sama; melainkan sinyal yang berbeda. Enam integrasi akan konsisten dengan sebuah tim yang melakukan iterasi. Enam integrasi dengan tiga nama — TeleChat4, XingChen4, Xing4_0 — adalah sebuah tim yang melakukan iterasi pada nama yang akan digunakan model tersebut saat dirilis, di depan publik, sementara bobotnya tetap privat. Itu adalah inferensi yang belum terverifikasi, dan itulah hal paling konsekuensial yang kini ditunjukkan oleh jejak PR.

Apa yang sebenarnya ditambahkan oleh kedua PR September itu

Pull request vLLM ini adalah penggantian nama atas pekerjaan Agustus, bukan penulisan ulangnya. File modelnya sekarang adalah vllm/model_executor/models/xing4_0.py, kelasnya adalah Xing4_0ForCausalLM, dan model_type xing4_0 dipetakan ke DeepseekV3Config — konfigurasi Deep​Seek-V3 yang sama yang digunakan versi XingChen4. Yang dibawanya:

• Implementasi model lengkap di vllm/model_executor/models/xing4_0.py — kelas Xing4_0ForCausalLM, dengan forward pass, adaptor mHC, dan implementasi load_weights() paralel tensor. Pesan commit mencatat bahwa varian DSA dan non-DSA didukung, menggunakan kembali operasi mhc_pre / mhc_post bersama.

• Pendaftaran Xing4_0ForCausalLM di vllm/model_executor/models/registry.py, sehingga vLLM mengenali arsitektur tersebut berdasarkan namanya.

• Pengurai penalaran (vllm/reasoning/xing4_0_reasoning_parser.py) "untuk varian yang mampu melakukan penalaran," dan pengurai alat (vllm/tool_parsers/xing4_0_tool_parser.py) untuk pemanggilan alat secara otomatis.

• Registrasi di vllm/config/speculative.py, vllm/transformers_utils/model_arch_config_convertor.py dan vllm/transformers_utils/config.py — dengan pesan commit yang menyatakan bahwa head MTP yang kompatibel dengan Deep​Seek-V3 diaktifkan untuk decoding spekulatif.

• Dua file dokumentasi — bagian yang benar-benar baru, dan pembalikan langsung dari Agustus. Commit aslinya membawa entri dokumentasi dan pengujian yang di-revert satu jam kemudian karena dianggap terlalu dini; PR September memasukkan kembali dokumentasi tersebut dan diberi label documentation, new-model, dan tool-calling.

Entri dokumentasi vLLM adalah tempat pembaca pertama kali mempelajari sesuatu yang konkret. Di docs/models/supported_models.md, baris baru itu berbunyi `Xing4_0ForCausalLM` | Xing4_0 | TBA — kolom checkpoint secara literal mengatakan TBA, yang merupakan "belum" yang sama dalam font berbeda. Dan di docs/features/tool_calling.md, di bawah judul "Xing4_0 Models (xing4_0)", PR mendokumentasikan format tool-call model: panggilan dikeluarkan di dalam blok <tool_call>...</tool_call>, baik sebagai JSON ({"name": ..., "arguments": {...}}) atau bentuk berbasis tag yang menggunakan <param_key>...</param_key> dan <param_value>...</param_value>. Itu adalah tingkat spesifisitas yang tidak dicapai oleh PR-PR sebelumnya — detail implementasi format chat model, yang dituliskan dalam dokumentasi publik sebuah framework besar, untuk checkpoint yang tidak dapat diunduh oleh siapa pun.

PR SGLang lebih menarik, karena ini menyertakan implementasi dan konfigurasi alih-alih entri registri plus dokumentasi. Baris dokumentasinya adalah pertama kalinya sebuah kerangka kerja mencantumkan nama vendor di dokumentasinya sendiri. Di docs/docs/supported-models/generative_models.mdx, baris baru mencantumkan Xing4_0, dengan kolom checkpoint bertuliskan `Xing4_0` (segera hadir) dan deskripsi: "Model MoE China Telecom dengan atensi MLA dan aliran residual mHC (Manifold-constrained Hyper-Connection); mendukung penguraian spekulatif MTP native, pemanggilan alat, dan penalaran." Baris vLLM mengatakan TBA dan tidak menyebut vendor; baris SGLang menyebut China Telecom dan mengatakan segera hadir. Keduanya bukan tanggal rilis, dan baris di dokumentasi kerangka kerja bukanlah produk.

Deskripsi PR ini menambahkan angka yang tidak dimiliki setiap versi sebelumnya dari cerita ini. "PR ini menambahkan dukungan untuk Xing4.0-29B-A4B (MoE dengan 29B parameter dan sekitar 4B parameter aktif)." Deskripsi ini juga memberikan perintah peluncuran — --model-path XingChen-AGI/Xing4.0-29B-A4B --trust-remote-code --tp-size 2 --context-length 262144 --reasoning-parser xing4_0 --tool-call-parser xing4_0 --speculative-algorithm EAGLE — dan menyatakan bahwa konfigurasi tersebut diverifikasi pada paralelisme tensor 2, konteks 262.144 token, dan decoding spekulatif EAGLE MTP, dengan transkrip respons penalaran dan panggilan alat get_weather ditempelkan ke deskripsi sebagai bukti. Bobot di balik verifikasi tersebut adalah milik penulis sendiri: jalur repositori yang disebutkan PR tidak dapat dibaca secara publik, dan organisasi Hugging Face yang ditunjuknya tidak mencantumkan model publik sama sekali. Perlakukan ukuran, panjang konteks, dan transkrip sebagai klaim yang dilaporkan PR yang melekat pada checkpoint privat, bukan sebagai pengukuran yang dapat diulang oleh siapa pun. Semuanya berdasarkan pull request dan tidak direproduksi.

Munculnya parser penalaran dan parser alat di bawah kedua nama itu penting karena alasan yang sama seperti pada Agustus. Parser penalaran ada untuk menghapus penanda berpikir dari keluaran model — rantai pemikiran internal yang dikeluarkan model sebelum jawaban akhirnya. Parser yang dibuat khusus untuk model ini berarti keluarga ini diharapkan memiliki varian yang mampu bernalar, sama seperti TeleChat3 merilis edisi Thinking. Parser alat, ditambah format panggilan yang kini terdokumentasi, berarti pemanggilan fungsi native juga diharapkan. Keduanya bukan jaminan tentang produk akhir; keduanya adalah petunjuk terkuat yang dibawa PR-PR tersebut tentang apa yang dituju China Telecom.

Yang kita ketahui sejauh ini, sekilas pandang

Papan skor di bawah ini adalah yang disusun untuk tulisan ini pada 27 Agustus 2026, dari PR vLLM sebagaimana kondisinya saat itu. Papan skor ini sengaja disimpan di sini sebagai snapshot bertanggal alih-alih digambar ulang, karena setiap barisnya masih benar tiga minggu kemudian — belum dirilis, bobot tidak dipublikasikan, tulang punggung DeepSeek, residual mHC, kedua parser disertakan. Yang berubah bukanlah nilai di kartu itu, melainkan segala hal di sekitarnya: PR vLLM yang dikutipnya ditutup pada 7 September, pekerjaan itu muncul kembali dengan nama baru pada 16 September, SGLang mengikuti penggantian nama itu beberapa jam kemudian dan jumlah parameter pertama yang dinyatakan tiba bersamanya. Tidak ada yang salah di kartu itu. Kartu itu sekadar berumur tiga minggu, dan ceritanya sudah bergerak melewatinya. Angka-angka FlagGems di baris terakhirnya terbawa ke PR vLLM baru tanpa perubahan, masih dilaporkan dalam PR dan masih belum direproduksi.

A single-column scoreboard for XingChen4 listing: Status — unreleased, weights not public; Backbone — DeepSeek-V2/V3 (MLA + MoE); Residual stream — mHC (Sinkhorn-Knopp); Reasoning parser — included, per PR; Tool parser — included, per PR; FlagGems speedup — up to -19.87% TTFT / -26.32% TPOT (PR-reported), with a footer reading 'All figures per vLLM PR #54051 (WIP) — unverified', dated August 27, 2026, and the OrcaRouter logo in the bottom-right corner.

Arsitektur yang dibocorkan oleh PRs

Mengganti nama file tidak mengganti nama arsitektur, dan teks ringkasan dalam PR vLLM September adalah teks Agustus dengan Xing4_0 menggantikan XingChen4 — klausa demi klausa. Dua kalimat membawa sinyalnya:

• "Xing4_0 menggunakan kembali tulang punggung Deep​Seek-V2/V3 (perhatian MLA, blok MoE, pengindeks DSA opsional)."

Metode ini menggantikan koneksi residual standar dengan Hyper-Koneksi Terkendala Manifold (mHC): aliran residual diperluas menjadi num_residual_streams aliran paralel yang dicampur oleh matriks stokastik ganda yang bergantung pada masukan, yang dihasilkan melalui proyeksi Sinkhorn-Knopp.

Setiap klausa mengacu pada sesuatu yang konkret. MLA adalah Multi-head Latent Attention, skema attention terkompresi yang diperkenalkan Deep​Seek di V2 yang memungkinkan KV cache tetap kecil; MoE adalah routing mixture-of-experts, yang mempertahankan jumlah parameter besar dengan jejak aktif yang kecil. Indexer DSA opsional adalah mekanisme Deep​Seek Sparse Attention dari lini V3.2 — modul penilaian ringan yang memilih token top-k untuk diperhatikan, memangkas biaya attention dari kuadratik menjadi kira-kira linear pada panjang konteks. Dan kalimat mHC adalah sorotan utamanya: model ini mengadopsi arsitektur residual yang baru diperkenalkan Deep​Seek sendiri pada generasi ini.

PR SGLang adalah yang pertama mempublikasikan bentuknya alih-alih mendeskripsikannya. Berkas konfigurasinya, python/sglang/srt/configs/xing4_0.py, mendeklarasikan 40 lapisan tersembunyi, ukuran tersembunyi 3.584, dan kosakata 131.072 token; MLA dengan peringkat KV LoRA 512 dan peringkat LoRA kueri 768 pada 32 kepala; serta MoE sparse dengan 64 expert yang dirutekan ditambah satu expert bersama, perutean top-4, penskoran sigmoid, faktor penskalaan routed sebesar 2,0, dan pemilihan expert noaux_tc. Field mHC juga eksplisit: hc_mult 4, dua puluh iterasi Sinkhorn-Knopp, penjepitan h_res pada ±30, dan rope_theta sebesar 10.000 dengan penyematan posisi maksimum 262.144. Ini adalah nilai default dalam integrasi yang belum dirilis, menurut pull request tersebut — berkas konfigurasi adalah pernyataan maksud, bukan kartu model, dan angka 29B-A4B dalam deskripsi PR tidak diturunkan darinya di mana pun secara publik.

Satu field lebih berharga daripada yang lain, karena inilah tempat pertama model ini secara terlihat berhenti menjadi salinan DeepSeek. Konfigurasi SGLang menetapkan hc_contract_for_draft, yang menggabungkan kembali aliran mHC ke ukuran hidden milik model sendiri sebelum norm final dan menyuapkan itu ke kepala draf Eagle sebagai tensor terkontrak. DeepSeek V4 sebaliknya menyuapkan tensor n-kali-hidden_size yang diratakan mHC. Komentar konfigurasi menyatakannya secara eksplisit, dan ini adalah jenis detail yang hanya muncul setelah implementasi dibentuk berdasarkan checkpoint nyata — yang diklaim dimiliki oleh daftar periksa PR SGLang sebelumnya, tanpa menerbitkannya.

Perhitungan mHC adalah titik ketika kedua stack berbeda dalam implementasi dan sepakat dalam asumsi. PR vLLM mencatat bahwa ini "cocok dengan operasi bersama di vllm.model_executor.layers.mhc, jadi tidak ada kernel privat yang diperkenalkan" — modul itu ada karena vLLM sudah mendukung mHC untuk DeepSeek V4, sehingga biaya tambahan untuk menambahkan model ini kecil. SGLang mencapai tempat yang sama lewat jalan yang berbeda: modul mHC-nya menggunakan kernel TileLang terfusi yang didaftarkan sebagai operasi kustom torch, dan PR tersebut memperluas kernel split-K mhc_pre yang ada agar menerima hc_hidden_size 14.336 di samping dua ukuran yang sudah ditanganinya. SGLang juga mematikan jalur tf32_hc_prenorm_gemm milik DeepGEMM untuk arsitektur ini, karena jalur itu adalah ekstensi C mentah yang tidak dapat dilacak oleh torch.compile; mHC malah ditangani oleh kernel TileLang. Keunggulan praktisnya sama di kedua framework: jika Anda melayani DeepSeek V4 di vLLM atau SGLang hari ini, mesin yang akan melayani MoE berikutnya milik China Telecom sudah terpasang.

mHC, trik DeepSeek yang menjadi pusat dari semuanya

Manifold-constrained Hyper-Connections patut dibahas secara mendalam, karena inilah hal yang paling menarik dari model ini — dan ini bukanlah penemuan China Telecom. Ini adalah penemuan Deep​Seek.

Kisahnya dimulai dengan Hyper-Connections, yang diusulkan oleh tim Ki​mi pada 2024. Transformer standar menyimpan satu aliran residual per lapisan: input ditambahkan ke output lapisan, memberi gradien jalur yang bersih dan memungkinkan jaringan mempelajari koreksi residual. Hyper-Connections menggantikan aliran tunggal itu dengan beberapa aliran paralel yang dicampur oleh matriks terpelajar di setiap lapisan, memberi model jalur yang jauh lebih kaya untuk informasi mengalir. Masalahnya adalah stabilitas: matriks pencampuran tanpa batasan merusak sifat pemetaan identitas yang membuat koneksi residual dapat dilatih, dan pada skala triliun parameter, loss pelatihan menjadi tidak stabil.

Kontribusi DeepSeek, yang diterbitkan sebagai makalah mHC pada Desember 2025 dan kemudian digunakan di DeepSeek V4, adalah membatasi matriks pencampuran agar bersifat stokastik ganda — non-negatif, dengan setiap baris dan kolom berjumlah satu — yang ditegakkan melalui proyeksi Sinkhorn-Knopp selama pelatihan. Matriks stokastik ganda memiliki radius spektral tepat satu, sehingga sinyal tidak dapat diperkuat atau dilemahkan secara eksponensial saat melewati ratusan lapisan. Batas itulah yang menjaga pelatihan tetap stabil pada skala besar, dan proyeksinya cukup murah sehingga DeepSeek melaporkan hanya sekitar 6,7% overhead pelatihan pada empat aliran residual. DeepSeek V4, yang dirilis 24 April 2026, merupakan penggunaan unggulannya, dengan laporan peningkatan sekitar 15% pada tugas penalaran matematika dan konteks 1 juta token sebagai tambahan.

Jadi, secara gamblang, yang dikatakan PR-PR ini adalah: model berikutnya dari China Telecom mengambil tulang punggung DeepSeek yang sudah terbukti dan mekanisme residual terbaru DeepSeek, alih-alih menciptakan salah satu pun dari nol. Itu adalah pilihan pragmatis, dan mengandung konfirmasi tersirat — laboratorium besar kedua setelah DeepSeek sendiri yang mengadopsi mHC percaya bahwa trik tersebut siap untuk produksi.

PR-PR ini belum selesai dengan mHC, dan item-item yang masih terbuka jujur soal itu. Di seluruh PR vLLM, penulis mencatat bahwa bias checkpoint (bias_pre, bias_post, bias_res) dan sebuah clamp h_res saat ini digabungkan atau dihilangkan, dan bahwa konfirmasi reviewer tentang kesetaraan formula adalah "pertanyaan utama tentang kebenaran". Ada juga op transpose kustom yang menjaga tensor tetap C-contiguous untuk kernel TileLang — diganti nama bersama semua hal lainnya, dari _xingchen4_transpose_contiguous menjadi _xing4_0_transpose_contiguous — dan batasan keras: paralelisme pipeline tidak didukung dalam mode mHC ketika num_residual_streams lebih besar daripada satu, sedangkan paralelisme tensor didukung. Tidak satu pun dari ini mengejutkan untuk sebuah draf, tetapi ini adalah tepi belum selesai yang sama seperti pada Agustus, yang dengan sendirinya informatif: enam minggu penggantian nama belum menggeser pertanyaan tentang kebenaran, dan tiga run CI merah pada PR SGLang terbaru adalah cerita yang sama dalam warna berbeda. Yang diselesaikan oleh konfigurasi SGLang adalah jumlah stream. Dengan hc_mult diatur ke 4 dan ukuran hidden 3.584, angka 14.336 di patch kernel tepat empat stream — dan komentar kernel mengatakannya secara gamblang. Pembacaan itu adalah inferensi dari angka belaka saat tulisan ini pertama kali terbit; sekarang hal itu sudah tertulis di file konfigurasi.

Sudut akselerasi: FlagGems, lagi

Utas kedua mengaitkan model ini dengan hubungan China Telecom yang sudah ada dengan Beijing Academy of Artificial Intelligence, dan inilah satu-satunya utas yang tetap utuh melewati setiap perubahan nama. PR vLLM ini mengaktifkan akselerasi FlagOS/FlagGems opsional di balik flag lingkungan USE_FLAGOS, dinonaktifkan secara default, dengan menukar kernel hot-path untuk MoE, attention, softmax, dan top-k. Hasil yang diklaim, dari benchmark H100 penulis PR pada beban kerja prompt panjang dengan konkurensi tinggi (token masukan 10K-plus, konkurensi 10): time-to-first-token hingga 19,87% lebih rendah dan time-per-output-token hingga 26,32% lebih rendah, sementara beban kerja lain netral. Angka-angka tersebut dilaporkan oleh PR dan belum direproduksi, dan disertai dengan flag yang dinonaktifkan secara default.

Yang layak dicatat adalah betapa sedikitnya yang disentuh oleh penggantian nama itu. PR vLLM bulan September memuat angka yang sama, catatan cakupan sempit yang sama tentang flag yang hanya berada di dalam file model, dan instruksi yang sama untuk memasang flagtree dan flag-gems. Angka-angkanya tidak berubah karena kodenya tidak berubah; hanya labelnya yang berubah. Pull request SGLang sama sekali tidak memuat utas FlagGems — mereka mengambil jalur TileLang dan DeepGEMM sebagai gantinya — yang menjadikan ini argumen tentang siapa yang memiliki optimisasi lapisan penyajian, bukan tentang modelnya.

Ini adalah kisah kesinambungan. TeleChat3-36B-Thinking, per April 2026, adalah model besar pertama yang di-porting secara independen ke FlagOS, stack perangkat lunak AI open-source milik BAAI. Apa pun wujud rilis model ini, melanjutkan benang merah itu — dengan kernel FlagGems di dalam integrasi vLLM-nya sendiri — menunjukkan bahwa strategi tumpukan domestik lab ini meluas ke lapisan serving, bukan hanya pelatihan.

Pertanyaan penamaan, dan keluarga asal pertanyaan itu

Hingga 16 September, pertanyaan penamaan itu hanyalah catatan pinggir. Kini pertanyaan itu hampir tuntas, dan buktinya masih sepenuhnya ada dalam nama cabang dan string sisa alih-alih pernyataan — tetapi kedua kerangka kerja itu telah bertemu pada jawaban yang sama dari arah yang sama.

• Pesan commit, secara berurutan: "Tambahkan dukungan model TeleChat4," lalu "tugas: kembalikan dokumen dan entri tes telechat4 yang terlalu dini," lalu — tiga minggu kemudian dan satu menit sebelum PR ditutup — "ganti nama xingchen4." Sebuah commit yang seluruh tujuannya adalah penggantian nama tersebut.

• Fork itu bercabang. Dua PR vLLM pertama, #51237 dan #54051, diambil dari zyp2014:supported_telechat4. PR ketiga, #57135, adalah zyp2014:support_xing4_0. Cabang itu diganti namanya dalam langkah yang sama dengan penggantian nama model — dan sisi SGLang kini telah menempuh jalur yang identik dalam tiga langkah, dari support_telechat4 melalui support_xingchen4 hingga support_xing4_0.

• Isi teks #51237, yang menyatakan bahwa akselerasi FlagGems adalah "for TeleChat4" sementara paragraf yang sama menyebut model tersebut XingChen4. Kedua nama itu sudah saling bertabrakan dalam ringkasan penulisnya sendiri pada 6 Agustus.

• Penggantian nama file demi file di kedua sisi. Di vLLM, itu dari xingchen4.py menjadi xing4_0.py dan dari XingChen4ForCausalLM menjadi Xing4_0ForCausalLM; di SGLang, itu dari xingchen4.py menjadi xing4_0.py dan dari XingChen4Config menjadi Xing4_0Config, pada cabang yang namanya ikut berubah. Tidak satu pun PR meninggalkan nama lama di mana pun dalam diff-nya.

Jadi, tiga nama telah digunakan di dua kerangka kerja, dan polanya konsisten dengan satu model yang diganti namanya saat mendekati nama publiknya nanti. "Xing4_0" secara alami terbaca sebagai Xingchen 4.0 — keluarga model ini diberi merek 星辰 (Xingchen) dalam bahasa Tionghoa — tetapi itu masih merupakan inferensi dari string tersebut, bukan sesuatu yang dinyatakan secara gamblang oleh PR mana pun. Bisa juga bahwa TeleChat4 dan XingChen4 adalah saudara dalam generasi yang sama, bukan satu model dengan dua nama, meskipun fork yang sama, paragraf arsitektur yang sama, angka FlagGems yang sama, item terbuka yang sama, dan sekarang penggantian nama yang sama membuat hal itu lebih sulit diperdebatkan. Tidak ada yang mengonfirmasi hubungan tersebut dan China Telecom belum berkomentar. Yang berubah adalah bahwa penggantian nama itu bukan lagi pilihan satu kontributor: dua proyek serving independen, yang dikelola oleh orang berbeda, keduanya telah mengganti label integrasi mereka ke nama ketiga yang sama dalam selang waktu satu hari satu sama lain.

Keluarga itu sendiri layak untuk tetap diperhatikan, karena hal itu menjelaskan pragmatismenya. Rilis publik sejauh ini telah diberi merek TeleChat:

• TeleChat-7B dan TeleChat-12B, dirilis open-source pada Januari 2024 dengan korpus 1 triliun token.

• TeleChat2-115B (September 2024), disebut sebagai model terbuka pertama dengan satu triliun parameter yang sepenuhnya domestik, ditambah varian 35B, 7B, dan 3B.

• TeleChat2-39B-A12B (Maret 2025), MoE pertama dari keluarga ini.

• TeleChat3-105B-A4.7-Thinking (Desember 2025), sebuah MoE berbutir halus dengan total 105B dan 4,7B parameter aktif, dilatih pada 15 triliun token, bersama dengan TeleChat3-36B yang dense dan kemudian TeleChat3-Coder-36B-Thinking.

Jika angka 29B-A4B itu bertahan, model ini akan berada di bawah TeleChat3-105B-A4.7-Thinking baik dalam parameter total maupun aktif — saudara yang lebih kecil dan lebih murah, bukan model andalan pengganti. Itu adalah tafsiran, bukan fakta; tidak ada dalam kedua PR tersebut yang menyatakan kelas mana yang dituju model ini. Merek Xingchen adalah tempat perusahaan mencurahkan upaya AI-nya: Xingchen AGI Lab secara resmi didirikan di Beijing pada Maret 2026, dibangun di atas keluarga model yang sama, dan China Telecom menggambarkan sistem "三全" (modalitas penuh, ukuran penuh, sepenuhnya domestik) miliknya sebagai mencakup model semantik, ucapan, visi, dan multimodal dari 1B hingga 1T+ parameter. Mengganti nama dari TeleChat menjadi Xingchen adalah tepat seperti yang dilakukan sebuah lab ketika ingin keluarga model membawa merek lab tersebut alih-alih merek lini produknya.

Apa yang masih belum kita ketahui

Untuk model yang masih sedini ini, daftar yang jujur masih lebih panjang daripada daftar yang sudah diketahui, meskipun daftar itu telah menyempit di dua tempat minggu ini:

• Tidak ada tanggal rilis. Lima dari enam integrasi adalah draf yang dibuka untuk peninjauan kode awal, tepatnya karena bobotnya tidak dipublikasikan. Integrasi keenam, SGLang #39793, dibuka untuk ditinjau, bukan sebagai draf — tetapi belum digabungkan, ketiga proses CI-nya gagal, dan perlu peninjau untuk menyetujuinya. Tidak ada jadwal yang diumumkan.

• Jumlah parameter, tetapi hanya klaim. Setiap versi sebelumnya dari tulisan ini mencantumkan konfigurasi MoE sebagai tidak diungkapkan. PR SGLang mengubah itu di atas kertas: Xing4.0-29B-A4B, total 29B, sekitar 4B aktif. Angka itu berasal dari pull request, tidak dilampirkan pada checkpoint publik mana pun, tidak dikuatkan oleh file konfigurasi mana pun, dan belum direproduksi oleh siapa pun di luar proyek. Perlakukan itu sebagai niat yang dinyatakan, bukan spesifikasi.

• Tidak ada angka benchmark, baik yang dilaporkan vendor maupun lainnya, dan tidak ada skor independen. Transkrip verifikasi dalam PR SGLang menunjukkan model menjawab prompt penalaran dan menghasilkan panggilan tool yang valid; transkrip itu juga tidak menunjukkan seberapa baik model melakukannya.

• Tidak ada harga, dan tidak ada lisensi yang dikonfirmasi. Setiap rilis TeleChat sebelumnya adalah Apache-2.0, yang cukup menggembirakan, tetapi belum ada lisensi yang dinyatakan untuk yang ini.

Tidak ada bobot publik — dikonfirmasi, bukan diasumsikan. Per 16 September 2026, jalur Hugging Face yang disebutkan oleh PR SGLang tidak dapat dibaca secara publik dan organisasi yang dirujuknya tidak mencantumkan model publik apa pun; entri publik terbaru dalam keluarga ini adalah TeleChat3-Coder-36B-Thinking dari Januari. Tabel model yang didukung vLLM menuliskan TBA di kolom checkpoint, milik SGLang menuliskan "segera hadir," dan kedua PR SGLang memiliki CI publik yang gagal.

• Tidak ada pernyataan resmi dari China Telecom — tidak ada pengumuman, tidak ada bobot, tidak ada konfirmasi mengenai nama atau ukurannya. Perhatikan asimetri ini dengan saksama: baris dokumentasi SGLang mengaitkan model tersebut dengan China Telecom, tetapi itu adalah deskripsi kontributor di dalam pull request, bukan pernyataan perusahaan, dan deskripsi PR terbaru sama sekali menghilangkan nama vendor tersebut. Enam integrasi yang dibangun untuk model ini adalah bukti terkuat sejauh ini bahwa model itu nyata, tetapi integrasi bisa ditutup dan nama sandi bisa berubah; dua sudah demikian. Tidak ada yang terkonfirmasi sampai lab tersebut menyatakannya.

Penafsiran yang tepat atas semua ini bukanlah skeptisisme terhadap model; melainkan gambaran yang akurat tentang sebuah sinyal awal. Yang ada saat ini adalah artefak rekayasa yang nyata — enam di antaranya, di dua kerangka kerja — dengan arsitektur yang nyata dan, untuk pertama kalinya, bentuk yang dinyatakan turut disertakan. Yang belum ada adalah apa pun yang dapat Anda unduh, panggil, atau uji tolok.

Hal terdekat yang dapat Anda jalankan hari ini

Model ini tidak dapat dilayani di mana pun — tidak melalui API, tidak secara lokal, karena bobotnya tidak dipublikasikan. Model terdekat yang benar-benar dapat dipanggil pembaca saat ini yang memiliki DNA arsitektur yang sama adalah DeepSeek V4 Flash, yang menggunakan skema residu mHC yang sama di atas MLA dan MoE, dan itulah implementasi referensi yang menjadi dasar pembuatan modul mHC bersama di kedua kerangka kerja tersebut. Halaman model OrcaRouter untuk deepseek/deepseek-v4-flash mencantumkan konteks 1M token, output maksimum 384K, dan harga daftar $0.15 per juta token input serta $0.29 per juta output — angka yang sama dengan yang diterbitkan DeepSeek sendiri, diteruskan dengan markup 0%, sehingga perubahan harga vendor langsung berlaku di sini pada hari yang sama. Satu kunci API mencakup seluruh katalog, yang menjadikan membandingkannya dengan sisa tier penalaran sebagai aturan perutean alih-alih integrasi baru.

Itu juga jawaban praktis untuk "bagaimana saya mencoba model ini saat dirilis." Checkpoint yang benar-benar baru dan belum teruji adalah tepat di mana failover otomatis membuktikan nilainya: arahkan sebagian kecil trafik ke sana, pertahankan model yang sudah terbukti sebagai fallback, dan biarkan lapisan routing mengambil keputusan alih-alih mempertaruhkan jalur produksi pada perilaku hari pertama. MoE 29B dengan sekitar 4B parameter aktif, jika itulah yang hadir, adalah hal yang murah untuk dirutekan terhadap model frontier justru karena sangat sedikit bagiannya yang aktif per token. Jika namanya berubah lagi antara sekarang dan rilis — dan enam minggu terakhir menunjukkan bahwa itu mungkin — aturan routing-lah yang Anda tulis ulang, bukan integrasinya.

A screenshot of the OrcaRouter model page for DeepSeek V4 Flash showing the model ID deepseek/deepseek-v4-flash, by DeepSeek released 2026-04-24, a 1,048,576-token context window, 384K max output, p50 TTFT 463 ms, and $0.15 per 1M input / $0.29 per 1M output tokens (captured August 27, 2026).

Pertanyaan yang Sering Diajukan

Mengapa PR vLLM ditutup?

Kita bisa melihat penutupannya, bukan alasannya. #54051 ditutup oleh penulisnya sendiri pada 7 September 2026 tanpa di-merge, dan pekerjaan itu muncul kembali sembilan hari kemudian sebagai #57135 dengan nama baru. Sebuah PR vLLM sebelumnya, #51237, ditutup dan diajukan ulang pada hari yang sama dengan judul yang sama, jadi menutup dan mengajukan ulang adalah pola penulis ini, bukan pertanda adanya masalah — tetapi deskripsi PR tidak menyebutkan alasan dan kita tidak akan mengarang alasan.

Kapan Xing4_0 akan dirilis?

Tidak ada tanggal. Lima dari enam integrasi tersebut adalah draf yang dibuka untuk tinjauan kode awal, dan rencana para penulisnya sendiri adalah menambahkan entri pengujian, memperbarui dokumentasi, dan menandai PR sebagai siap hanya setelah bobot dirilis. Daftar periksa SGLang yang lebih lama adalah pernyataan paling jelas tentang posisi saat ini: "Model memuat & menghasilkan (secara lokal, dengan bobot internal)" sudah dicentang, dan CI publik "tertahan menunggu rilis bobot." PR SGLang yang lebih baru diajukan sebagai siap ditinjau, bukan sebagai draf, yang merupakan perubahan sikap, bukan perubahan status — PR itu belum di-merge, CI-nya merah, dan baris dokumentasi yang bertuliskan "segera hadir" bukanlah peluncuran.

Apakah Xing4_0 model yang sama dengan XingChen4?

Hampir pasti ya, dan PR-PR itu membuatnya mudah diperiksa: garis keturunan fork yang sama, paragraf arsitektur yang sama, angka benchmark FlagGems yang sama, item terbuka yang sama, dan penamaan ulang file demi file di kedua framework — xingchen4.py menjadi xing4_0.py, termasuk kelas config, pada branch yang diganti namanya agar cocok. Ini pekerjaan yang sama yang memakai nama baru, dan per 16 September baik vLLM maupun SGLang telah mengadopsi nama itu. Yang tidak dinyatakan oleh PR mana pun adalah nama apa yang akan dibawa oleh checkpoint yang dirilis.

Apakah ini model Deep​Seek?

Bukan. Itu model China Telecom, dari Xingchen AGI Lab. Kaitan DeepSeek bersifat arsitektural: model ini menggunakan kembali backbone DeepSeek-V2/V3 dan skema residual mHC yang diusulkan dan dirilis DeepSeek di V4. Mengadopsi arsitektur milik orang lain tidak sama dengan kedua proyek tersebut saling terkait.

Tontonan Berikutnya

PR-PR itu tetap memberikan daftar periksa yang konkret, dan pasangan 16 September menambahkan dua item ke dalamnya. Pertama, bobotnya: setiap penulis mengatakan karya mereka menunggu di Hugging Face, jadi munculnya repositori publik adalah peristiwa penentunya — dan PR SGLang sekarang memberi Anda jalur persis yang harus dipantau, XingChen-AGI/Xing4.0-29B-A4B, yang saat ini tidak dapat di-resolve oleh siapa pun. Kedua, PR-nya sendiri: milik vLLM membutuhkan formula bias mHC untuk dikonfirmasi, entri tes registry ditambahkan, dan CI-nya hijau; #39793 milik SGLang membutuhkan tiga run merahnya diperbaiki dan sepuluh reviewer yang diminta untuk memberikan persetujuan, sementara #37228 yang lebih lama masih membutuhkan entri tesnya, benchmark MTP-speedup-nya, dan CI yang tidak terblokir. Ketiga, dan baru minggu ini: apakah SGLang menutup #37228 demi #39793 seperti cara vLLM selalu menutup pendahulunya sebelum mengajukan ulang. Dua integrasi aktif untuk satu model yang belum dirilis adalah situasi yang tidak dipertahankan lama oleh siapa pun, dan mana yang bertahan akan menunjukkan sesuatu tentang seberapa dekat ini sebenarnya. Keempat, angka-angkanya: apakah checkpoint yang dirilis cocok dengan bentuk 29B-A4B, MoE 64-expert, dan konteks 262.144 token yang sekarang diklaim oleh konfigurasi dan deskripsi PR. Kelima, apakah PR vLLM ketiga bertahan lebih lama daripada dua pendahulunya, yang masing-masing bertahan 21 dan 11 hari sebelum ditutup tanpa di-merge. Dan perhatikan apakah parser penalaran menggambarkan varian Thinking terpisah seperti yang dilakukan TeleChat3 saat merilis varian tersebut.

Sampai salah satu dari itu terjadi, perlakukan model ini sebagaimana adanya: rencana yang dirumuskan dengan baik dari lab yang serius, tertangkap basah sedang mempersiapkan infrastruktur penyajiannya — kini di kedua stack penyajian open-source utama, dengan nama yang keduanya telah adopsi dan ukuran yang hanya dinyatakan oleh pull request-nya sendiri. Arsitekturnya saja sudah membuatnya layak diikuti: ini adalah adopsi besar kedua mHC setelah DeepSeek sendiri, dari lab yang generasi sebelumnya sudah berupa MoE berbutir halus yang dilatih pada chip domestik. Saat bobotnya dirilis, tidak akan ada pertanyaan apakah ia berjalan di vLLM atau SGLang. Kedua stack telah menulis kodenya tiga kali, dengan tiga nama berbeda.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari