
Spark-X2.5-4B dan Spark-X2.5-1.7B: Model Agen Kompak di Perangkat dengan Konteks Native 1M
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
Spark-X2.5-4B dan Spark-X2.5-1.7B diluncurkan secara publik pada 1 September 2026, ketika SparkLLM — anak perusahaan XHToken (词元星火) milik iFlytek — merilis kedua model kompak tersebut sebagai open-source di bawah lisensi Apache 2.0, dengan bobot, kode, dan dokumen penerapan yang hadir di Hugging Face dan GitHub pada hari yang sama. Spesifikasi utamanya adalah jendela konteks asli 1.000.000 token pada model yang cukup kecil untuk berjalan di perangkat, didukung oleh klaim kosakata 200+ bahasa dan desain atensi hibrida yang menurut vendor dioptimalkan untuk pekerjaan agen. Yang dapat diketahui saat ini dari repositori sudah cukup substansial; yang belum dapat dikonfirmasi adalah segala hal yang hanya dapat diselesaikan oleh benchmarking independen, karena model yang baru dirilis beberapa jam lalu belum memiliki evaluasi netral. Keluarga X2.5 juga memiliki anggota yang lebih besar yang akan hadir — Spark-X2.5-293B, yang diumumkan akan rilis pada 7 September.
Apa yang sebenarnya ditunjukkan oleh repos-repos tersebut.
Koleksi Hugging Face membawa enam repositori: Spark-X2.5-4B dan Spark-X2.5-1.7B yang disetel dengan instruksi, checkpoint dasar mereka, serta konversi GGUF dari keduanya. Kartu 4B menjelaskan arsitektur attention hibrida — satu lapisan full-attention per tiga lapisan sliding-window attention — yang merupakan bentuk yang tepat ketika angka pemasaran adalah 1 juta token, karena full attention pada satu juta token akan menjadi sangat mahal secara kuadratik. Kartu tersebut menyatakan jendela konteks asli hingga 1 juta token, dengan tahap pelatihan konteks panjang yang memperpanjang panjang urutan hingga 1 juta selama pretraining.
• Arsitektur — atensi hibrida, satu lapisan atensi penuh per tiga lapisan jendela geser; safetensors BF16.
• Konteks — native hingga 1.000.000 token; pelatihan konteks panjang menjalankan sekuens hingga 1M.
• Bahasa — lebih dari 200, berdasarkan kartu model (1.7B juga mengklaim hal yang sama).
• Pra-pelatihan — sekitar 20 triliun token dari halaman web, buku, publikasi akademik, kode, dan materi ensiklopedis, dilatih secara end-to-end pada klaster Huawei Ascend.
• Pasca-pelatihan — SFT yang diikuti oleh RL berskala besar dalam penalaran, pengodean, perilaku agentik, dan kepatuhan terhadap instruksi, dengan kebijakan domain yang dikonsolidasikan melalui teknik yang disebut MOPD dalam makalah tersebut.
• Lisensi — Apache 2.0 untuk kedua ukuran, tanpa klausul pendapatan atau wilayah seperti yang beberapa laboratorium Tiongkok lainnya terapkan pada rilis terbuka.

Angka agen — dan seberapa besar kita harus mempercayainya
Kartu model menerbitkan tabel benchmark lengkap untuk agen dan penalaran, dan semuanya berasal dari laporan vendor serta belum direproduksi — beri label demikian, karena pertanyaan yang menarik untuk model 4B yang baru berumur satu hari adalah apakah sebagian darinya tetap bertahan saat bersentuhan dengan evaluasi independen. Pada tabel milik vendor itu sendiri, Spark-X2.5-4B mencetak 65,1 pada BFCL-V4 (pemanggilan fungsi), 75,1 pada τ²-bench (tugas agen jangka panjang), 40,9 pada BrowseComp, 44,4 pada SWE-Bench Pro, 90,7 pada AIME 2026, 81,2 pada HMMT February 2026, 74,2 pada IMO-AnswerBench, dan 67,4 pada GPQA. Model 1.7B mendapat momennya dalam tes rumah pintar: akurasi perintah end-to-end 90,3% dengan latensi rata-rata 0,85 detik pada set Domux. Vendor juga mengklaim bahwa 4B "menyaingi model cloud 2–3× ukurannya" dalam implementasi algoritme, pelengkapan kode, dan pembuatan kode — klaim yang sekaligus merupakan kalimat paling berguna dalam rilis tersebut dan yang paling membutuhkan pemeriksaan netral.

Yang secara struktural lebih menarik daripada angka individual mana pun adalah bahwa rilis ini ditujukan untuk agen sejak awal. Kartu tersebut mencantumkan integrasi dengan kerangka kerja Codex, Claude Code, OpenClaw, dan Hermes, dukungan pemanggilan alat dengan parser khusus di SGLang, dan penalaran yang diaktifkan secara default (sebuah flag runtime, enable_thinking, menonaktifkannya). Dengan kata lain, vendor telah memposisikan sebuah model 4B sebagai model penggunaan alat, bukan chatbot, yang merupakan taruhan nyata: model agen kecil adalah ke mana pasar on-device sebenarnya bergerak.
Ekosistem Day-0, dan kisah vLLM
Spark-X2.5-4B dan Spark-X2.5-1.7B didukung di vLLM sejak awal melalui plugin umum out-of-tree, bukan melalui merge upstream. Integrasinya berada di repositori XHToken/Spark-plugin: Anda mengkloningnya, lalu jalankan uv pip install ., kemudian layani model dengan vllm serve dan --trust-remote-code menggunakan template chat kustom. Jalur SGLang adalah image Docker siap pakai yang diluncurkan dengan --tool-call-parser spark25 dan --context-length 1048576 — jendela satu juta token penuh dalam perintah peluncuran, yang merupakan cara tercepat untuk memeriksa klaim konteks tersebut pada perangkat keras nyata.

Selain vLLM dan SGLang, model ini berjalan pada fork llama.cpp, MLX (Apple silicon dan CPU Linux), Ollama dan LM Studio melalui GGUF, dengan dukungan fine-tuning melalui fork LLaMA-Factory. Dukungan perangkat keras menjadi sorotan lainnya: NVIDIA, Huawei, Hygon, dan HOUMO.AI — plus Apple silicon — yang penting karena jarang ada model dari laboratorium Tiongkok yang dirilis dengan dokumen penerapan Ascend, Hygon, dan chip domestik pada hari pertama, bukan sekadar janji.
Untuk apa model on-device 1M-token?
Panjang konteks adalah fitur utamanya, dan ia mengarah pada pekerjaan spesifik. Satu juta token konteks native pada model 4B berarti seluruh basis kode, atau kumpulan dokumen panjang, dimuat ke dalam model yang berjalan secara lokal — tanpa pipeline RAG, tanpa pemotongan bagian. Demonstrasi vendor itu sendiri, yang dibangun di atas perangkat perkantoran Loomy miliknya, membuat model 4B menulis skrip untuk menggabungkan spreadsheet penjualan, mengekstrak metrik dan tren utama, serta menghasilkan laporan bilingual sekitar 3.000 kata. Sudut robotika adalah separuh lainnya: kedua ukuran diposisikan untuk persepsi-dan-eksekusi di dalam robot dan di edge, mencakup kendali, pelacakan target, dan navigasi, yang merupakan ceruk yang masuk akal untuk model 1.7B yang merespons dalam waktu kurang dari satu detik.
Permainan yang lebih besar: Spark-X2.5-293B
Kedua model kecil adalah langkah pembuka. Pada 7 September, SparkLLM mengumumkan akan merilis Spark-X2.5-293B, model dasar dengan 293 miliar parameter yang, menurut pengumuman tersebut, memiliki kemampuan coding dan agen yang ditingkatkan. Model-model kecil X2.5 secara efektif merupakan separuh perangkat dari cerita dua tingkat; model besarlah yang menentukan batas tertinggi keluarga ini. Menganggap 4B dan 1.7B sebagai keseluruhan rilis akan kehilangan arah perjalanan.
Cara mencobanya, dan apa yang harus diperhatikan.
API-nya sudah live di platform MaaS Xingchen milik iFlytek dan gratis untuk waktu terbatas; bobot modelnya tersedia di Hugging Face, ModelScope, dan pustaka Ollama. Di sisi routing, Spark-X2.5-4B terlalu baru untuk dilayani oleh agregator mana pun saat ini — OrcaRouter belum me-routing-nya hari ini, dan tidak ada apa pun di halaman ini yang boleh dibaca seolah-olah ia memang me-routing-nya. Tetapi begitu penyedia yang ter-routing menambahkannya, ekonominya berubah dengan cara yang dapat diprediksi: OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, jadi berapa pun harga yang ditetapkan vendor, itulah yang Anda bayar, dengan kunci API yang sama yang sudah Anda gunakan, dan failover otomatis sehingga model day-0 tidak pernah harus menjadi taruhan produksi. Itulah bentuk standar bagaimana blog ini memandang model yang benar-benar baru, dan hal itu patut dikatakan secara gamblang.
Empat hal akan menentukan apakah rilis ini menjadi momen atau sekadar catatan kaki. Pertama, apakah evaluasi independen — entri indeks Artificial Analysis, posisi di arena, satu run τ²-bench yang direproduksi — mendekati klaim vendor; skor 90,7 pada AIME dari model 4B adalah angka yang besar, dan angka-angka besar dari kartu perilisan justru yang paling diperiksa. Kedua, apakah konteks 1M token bertahan di atas stack hybrid-attention di bawah beban serving sungguhan, bukan hanya dalam perintah peluncuran. Ketiga, apakah bobot hasil pelatihan Ascend berperilaku baik pada perangkat keras NVIDIA di lapangan. Keempat, apa yang sesungguhnya dihadirkan Spark-X2.5-293B pada 7 September. Sampai saat itu, ringkasan jujur untuk Spark-X2.5-4B dan Spark-X2.5-1.7B adalah: menjanjikan, terbuka, dan sepenuhnya belum terverifikasi — yang, untuk model yang dirilis pagi ini, merupakan status yang tepat.
