Kartu judul hero untuk artikel 'Spark3 — LAPORAN KEBOCORAN' dengan lencana 'BELUM TERVERIFIKASI', subjudul 'Model kecil Spark3-1.7B dan Spark3-4B dari iFLYTEK sedang diintegrasikan ke vLLM — apa yang dikatakan PR, dan apa yang masih belum diketahui', tiga chip yang bertuliskan 'Sumber: vLLM PR #53373', '22 Agu 2026' dan 'XHToken / iFLYTEK', kartu kiri bertuliskan 'Sinyalnya: PR vLLM terbuka yang menambahkan dukungan Spark3 secara native untuk model tanpa bobot publik', dan kartu kanan bertuliskan 'Ekspektasi: 1.7B dan 4B, konteks native 1M-token, anggaran berpikir 4 tingkat'. Logo OrcaRouter dikompositkan di pojok kanan bawah.
Guides & Insights

Bocoran Spark3: Model Kecil 1.7B dan 4B milik iFLYTEK Sedang Diintegrasikan ke dalam vLLM

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Spark3 tidak memiliki bobot publik, tidak ada kartu model, tidak ada pengumuman — namun sebuah pull request masuk minggu ini di mesin inferensi vLLM yang menjelaskan dua model, Spark3-1.7B dan Spark3-4B, dengan sangat rinci. Pull request #53373 di repositori vLLM, “[Model] Add Spark3 Model,” menambahkan dukungan serving native untuk arsitektur Spark3: sliding-window attention, anggaran berpikir yang dapat dikontrol dengan empat tingkat, konteks native sejuta token pada kedua ukuran, dan ID model yang mengarah ke iFLYTEK. Tidak ada satu pun yang dikonfirmasi oleh vendor, dan belum ada yang dirilis. Ini adalah artikel “apa yang kita ketahui sejauh ini”: pull request tersebut nyata, dan semua yang dikatakan dapat dilakukan model-model itu belum terverifikasi sampai iFLYTEK — atau siapa pun yang merilis Spark3 — benar-benar memublikasikan bobotnya.

Kebocoran: sebuah pull request yang tampak seperti lembar spesifikasi.

Sinyalnya adalah sebuah PR vLLM yang terbuka, diajukan oleh pengguna GitHub bernama KnightYao (seorang kontributor yang berdomisili di Hefei dan mencantumkan University of Science and Technology of China), dan per 23 Agustus 2026 PR tersebut belum digabungkan. Seorang maintainer vLLM meminta perubahan pada 22 Agustus dengan catatan "hold for discussions." PR ini masih awal dan diperdebatkan, yang normal untuk integrasi semacam ini — dan juga sangat mendetail untuk sebuah PR kerangka kerja tentang model yang tidak dapat diunduh siapa pun di luar lab.

Diff ini menyentuh delapan file. Diff ini menambahkan implementasi Spark3ForCausalLM pada model executor vLLM, Spark3Config asli yang terdaftar di registri konfigurasi dan model vLLM, dukungan untuk sliding-window attention dan full attention plus gating output attention per kepala, pemuatan bobot paralel tensor dan pipeline, serta parser alat XML Spark3 sehingga panggilan alat model dapat didekode dengan cara terstruktur. Diff ini juga menambahkan baris pada dokumentasi model yang didukung vLLM yang mencantumkan checkpoint sebagai XHToken/Spark3-1.7B. Deskripsi tersebut bahkan mengklaim bahwa integrasi telah di-benchmark: 500 permintaan bersamaan, 100% sukses, sekitar 106 permintaan per detik dan 13,5K token output per detik pada pengaturan pengujian penulis. Angka-angka tersebut dilaporkan sendiri oleh orang yang menulis PR, bukan benchmark independen, dan harus dibaca persis seperti itu.

Mengapa iFLYTEK adalah induk yang jelas — tetapi belum dikonfirmasi

Tidak ada apa pun dalam PR yang menyebut nama vendor. Namun, ID checkpoint yang didaftarkannya, XHToken/Spark3-1.7B, berada di bawah organisasi XHToken di Hugging Face, dan organisasi itu milik iFLYTEK: halaman organisasi tersebut menampilkannya sebagai perusahaan, menautkan ke opensource.iflytek.com, dan saat ini menunjukkan nol model publik dan nol dataset publik. "XH" adalah singkatan alami untuk 星火 (Xinghuo, "Spark"), keluarga model iFLYTEK. Tambahkan lokasi penulis di Hefei — iFLYTEK berkantor pusat di Hefei — dan inferensi tersebut hampir sekuat yang bisa didapat sebelum vendor mengonfirmasinya.

Hal ini sesuai dengan pola terbaru iFLYTEK. Spark X2 milik perusahaan, yang dirilis pada Februari 2026, secara eksplisit ditujukan untuk kasus penggunaan pendidikan, medis, otomotif, dan agen, serta lini model on-device SparkAuto-EMM-nya hadir dalam ukuran kecil mulai dari 0.5B hingga 7B. Dua hari sebelum PR ini muncul, pada konferensi hasil interimnya pada 21 Agustus, iFLYTEK mengatakan bahwa model flagship serba guna baru yang sepenuhnya dibangun di atas komputasi domestik akan segera hadir, dengan versi bertahap yang dijadwalkan "pada akhir Agustus" dan peluncuran penuh pada 1024 Developer Day di bulan Oktober. Apakah Spark3-1.7B dan Spark3-4B merupakan bagian dari rilis bertahap tersebut, atau jalur terpisah yang berfokus pada edge, adalah pertanyaan terbuka yang tidak dijawab oleh PR tersebut.

A two-column infographic titled 'Spark3 — what we know / what we don't'. Left column 'What we know (from the PR)': 'Open vLLM PR #53373, review requested Aug 22, 2026', 'Two sizes: Spark3-1.7B and Spark3-4B', 'Native 1M-token context on both', 'Thinking budget: none / low / medium / high', '200+ languages; strong Gaokao and K-12 results', 'Model ID under iFLYTEK's XHToken HF org'. Right column 'What we don't': 'Release date — no weights, no announcement', 'Vendor confirmation — iFLYTEK has not commented', 'Independent benchmarks — PR figures are self-reported', 'Pricing and license — undisclosed', 'Whether it is the phased flagship due end of August', 'Whether the 1M context is native or rope-scaled'. Footer: 'All model claims unverified; only the pull request is confirmed.' The OrcaRouter logo is composited in the bottom-right corner.

Apa yang model-model itu dikatakan

Klaim-klaim PR tersebut, semuanya belum terverifikasi:

Dua ukuran. Spark3-1.7B dan Spark3-4B. Keduanya dideskripsikan sebagai desain yang mengutamakan efisiensi, menggunakan sliding-window attention daripada tata letak dense full-attention.

Konteks native 1M-token pada keduanya.Bukan janji mode yang diperpanjang — PR tersebut mengatakan konteksnya native untuk arsitektur, yang akan menempatkan satu juta token pada model yang cukup kecil untuk masuk akal pada satu GPU.

Anggaran berpikir empat tingkat.Penalaran dapat diatur ke tidak ada, rendah, sedang, atau tinggi—desain pemikiran yang dapat dialihkan yang memungkinkan aplikasi menukar kedalaman penalaran dengan latensi dan biaya per panggilan.

200+ bahasa dan keunggulan dalam ujian Tiongkok. Siaran pers tersebut mengklaim kinerja yang kuat dalam menjawab pertanyaan untuk K-12 dan Gaokao — ciri khas iFLYTEK, mengingat bisnis pendidikan perusahaan tersebut — serta cakupan multibahasa di lebih dari 200 bahasa.

Orientasi coding dan agen. Klaim tentang pembuatan kode yang kuat, penggunaan alat, eksekusi multi-langkah, dan penalaran konteks panjang untuk ukurannya, didukung oleh parser alat XML yang disertakan dalam PR yang sama.

Konteks native 1M pada 1.7B adalah bagian yang patut diperhatikan

Panjang konteks adalah tempat model-model kecil selama ini terjebak. Dalam lanskap open-weight saat ini, model 1.7B–4B biasanya hadir dengan jendela native 32K–256K: checkpoint kecil Qwe​n3 memiliki native 32K dengan 131K melalui rope scaling, dan bahkan peningkatan native 256K Qwen3.5 pada varian kecil adalah langkah terbaru. Konteks satu juta token sejauh ini merupakan fitur model besar — checkpoint konteks 1M G​LM memiliki ratusan miliar parameter. Jika Spark3 benar-benar menghadirkan jendela native 1M pada model 4B, itu akan menjadi spesifikasi yang benar-benar tidak biasa, dan arsitektur sliding-window attention justru merupakan cara untuk membuatnya hemat memori. Hal yang perlu dicatat: angka utama native 1M mudah ditulis di PR, tetapi sulit dibuat berguna dalam praktik. Kualitas konteks panjang — apakah model benar-benar dapat menemukan dan menggunakan fakta yang berjarak 700K token ke belakang — adalah pertanyaan terpisah dari seberapa banyak token yang muat di jendela, dan belum ada evaluasi independen.

Anggaran berpikir yang dapat dikendalikan penting karena alasan yang sama. Empat tingkat penalaran (tanpa / rendah / sedang / tinggi) adalah desain berpikir yang dapat dialihkan dalam semangat mode berpikir on/off Qwe​n3, tetapi lebih kaya: alih-alih pilihan biner, aplikasi dapat memilih tingkat per permintaan — tanpa berpikir untuk terjemahan, tinggi untuk giliran agen multi-langkah — dan hanya membayar untuk penalaran yang dibutuhkannya. Untuk beban kerja agen atau batch, itulah tepatnya kenop yang mengubah model kecil yang "mumpuni tetapi mahal" menjadi model dengan biaya terkelola.

Resep pasca-pelatihan ini cocok dengan pola 2026

PR tersebut mengatakan Spark3 dilatih lanjut menggunakan "Scaled Reinforcement Learning dan MOPD." MOPD — Multi-Teacher On-Policy Distillation — adalah teknik yang nyata dan terkini, dijelaskan dalam makalah arXiv (2606.30406): melatih para guru RL spesialis-domain secara paralel, lalu menyulingkannya kembali menjadi satu murid berdasarkan rollout murid itu sendiri, dengan meminimalkan reverse KL per token terhadap guru yang tepat untuk setiap prompt. Itu adalah resep 2026 yang memungkinkan satu model mewarisi keterampilan matematika, coding, dan agen tanpa satu run RL yang saling bertabrakan dengan run lainnya, dan telah secara publik dikreditkan dalam post-training model-model seperti MiMo Flash V2, DeepSeek V4, dan Nemotron 3 Ultra. Dengan mengutip resep yang sama, Spark3 menempatkan dirinya pada generasi itu — model kecil, teknik post-training terdepan. Itu juga berarti "klaim coding dan agen yang kuat" memiliki mekanisme yang masuk akal di baliknya. Masuk akal belum tentu sama dengan terbukti: klaim tersebut tetap berasal dari laporan vendor sampai bobot muncul dan evaluasi independen dijalankan.

Apa yang benar-benar tidak diketahui

Hampir semua yang ada kalendernya:

Tanggal rilis. Tidak ada weights di Hugging Face, tidak ada pengumuman, tidak ada timeline. Org XHToken kosong hari ini.

Konfirmasi vendor. iFLYTEK belum mengatakan apa pun tentang Spark3. Tautan organisasi XHToken adalah bukti kuat, bukan pernyataan resmi.

Entah apakah itu flagship bertahap. Versi bertahap "akhir Agustus" dari flagship baru iFLYTEK bisa jadi ini — atau tidak terkait. Siaran persnya tidak memberikan tanggal sama sekali.

Harga dan lisensi. Tidak ada yang diungkapkan. Keluarga Spark dari iFLYTEK secara historis sebagian besar dilayani melalui API daripada bobot terbuka, jadi apakah Spark3-1.7B dan Spark3-4B adalah checkpoint terbuka atau target penyajian internal masih menjadi pertanyaan terbuka.

Setiap tolok ukur. Angka throughput dalam PR tersebut adalah hasil uji serving milik penulis sendiri, bukan evaluasi independen, dan tidak ada papan peringkat yang menilai model tersebut karena belum ada model yang tersedia untuk publik.

A screenshot of the XHToken Hugging Face organization page (captured August 23, 2026) showing the organization name 'XHToken', listed as a company with a link to opensource.iflytek.com, and the text 'None public yet' with zero public models and zero public datasets — confirming no Spark3 weights have been released.

Apa yang harus ditonton

Organisasi XHToken Hugging Face adalah saluran rilis yang perlu dipantau. Jika modelnya nyata, bobotnya—atau setidaknya kartu model—harus muncul di sana, dan organisasi yang berubah dari nol menjadi satu repositori publik adalah sinyal yang paling penting. Beberapa hal yang perlu diperiksa saat itu terjadi:

Nomor konteks. Apakah 1M native, atau rope-extended dengan trade-off kualitas? PR-nya bilang native; kartu model adalah tempat di mana hal itu ditentukan.

API anggaran pemikiran. Bagaimana keempat tingkat penalaran diekspos — sebagai parameter sampling, bidang template chat, atau varian model terpisah — menentukan seberapa mudah untuk benar-benar digunakan.

Lisensinya. Bobot terbuka akan menjadikan Spark3 model sub-5B pertama dengan konteks 1M asli yang dapat di-host sendiri; peluncuran API saja akan membuatnya menjadi produk yang berbeda.

Kalender pengumuman iFLYTEK. Peluncuran bertahap flagship dijanjikan pada akhir Agustus, dan peluncuran penuh pada 1024 Developer Day di bulan Oktober. Jika Spark3 menjadi bagian dari salah satu dari keduanya, deskripsi resmi akan menjelaskan apa yang dibiarkan terbuka oleh siaran pers.

Apakah PR tersebut digabungkan. Dukungan vLLM penting sebagai sinyal kualitas dan sebagai infrastruktur: runtime pertama dengan dukungan native Spark3 membuat model dapat dijalankan di produksi pada hari weights dirilis.

Apa yang harus dilakukan developer saat ini

Tidak ada apa-apa. Tidak ada model untuk dipanggil, tidak ada bobot untuk diunduh, tidak ada kunci API untuk disediakan — alat apa pun yang mengklaim melayani Spark3 hari ini sedang melayani sesuatu yang lain. Yang dapat Anda lakukan adalah memutuskan bagaimana Anda akan mengevaluasinya pada hari ia muncul, karena ini adalah model dengan janji yang sangat dapat diperiksa: model 1.7B atau 4B yang membaca satu juta token dan bernalar pada empat kedalaman adalah kategori model kecil yang benar-benar baru atau sekadar cerita di atas kertas, dan perbedaannya dapat diukur dalam satu sore pada beban kerja Anda sendiri.

Di situlah juga lapisan routing membuktikan nilainya. Di OrcaRouter, model bukanlah kontrak yang mengikat Anda; ia adalah entri dalam katalog yang Anda panggil melalui satu API, dan harga daftar penyedia diteruskan tanpa markup — jadi ketika model baru muncul di katalog penyedia, harga aslinya langsung tersedia di sisi kami pada hari yang sama, dan mencobanya tidak memerlukan integrasi kedua maupun negosiasi ulang. Untuk model yang belum terbukti seperti Spark3, pola yang masuk akal adalah pola yang sama yang akan Anda gunakan untuk bocoran yang menjanjikan: letakkan di belakang failover otomatis dalam DSL routing, biarkan sebagian traffic mengaksesnya, dan pertahankan model yang terbukti di sisi lain aturan tersebut sehingga evaluasi yang buruk, kejutan lisensi, atau hasil konteks panjang yang mengecewakan menjadi perubahan routing, bukan insiden. Satu kunci, satu endpoint, 200+ model — dan ketika Spark3-1.7B atau Spark3-4B benar-benar dapat dijalankan, penerusan dan failover berlaku untuknya seperti halnya model lainnya.

A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.

Ringkasan yang jujur adalah sebuah kalimat, bukan vonis: sebuah PR kerangka kerja yang ditulis minggu ini mengklaim iFLYTEK memiliki dua model kecil dengan konteks jutaan token asli dan anggaran berpikir empat tingkat, dan tidak ada bobot bukti yang dipublikasikan untuk mendukung semuanya. Perhatikan organisasi XHToken, perhatikan janji akhir Agustus dari iFLYTEK, dan ketika bobotnya nyata, uji mereka melalui aturan perutean dengan failover sebelum mempertaruhkan jalur produksi padanya. Itulah seluruh buku pedoman untuk kebocoran — percayai infrastrukturnya, verifikasi modelnya, dan jaga agar jalan keluar tetap murah.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube