Kartu judul hero untuk 'Spark-X2.5-4B and Spark-X2.5-1.7B' dengan subjudul 'Compact On-Device Agent Models With a Native 1M Context'. Sebuah ikon perangkat kecil yang menggabungkan ponsel dan laptop berada di sisi kiri, pil jendela konteks membulat berlabel '1M TOKENS' membentang di tengah, dan sisi kanan mencantumkan '200+ languages', 'Apache 2.0', dan 'Day-0 vLLM'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Spark-X2.5-4B dan Spark-X2.5-1.7B: Model Agen Kompak di Perangkat dengan Konteks Native 1M

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Spark-X2.5-4B dan Spark-X2.5-1.7B diluncurkan secara publik pada 1 September 2026, ketika SparkLLM — anak perusahaan XHToken (词元星火) milik iFlytek — merilis kedua model kompak tersebut sebagai open-source di bawah lisensi Apache 2.0, dengan bobot, kode, dan dokumen penerapan yang hadir di Hugging Face dan GitHub pada hari yang sama. Spesifikasi utamanya adalah jendela konteks asli 1.000.000 token pada model yang cukup kecil untuk berjalan di perangkat, didukung oleh klaim kosakata 200+ bahasa dan desain atensi hibrida yang menurut vendor dioptimalkan untuk pekerjaan agen. Yang dapat diketahui saat ini dari repositori sudah cukup substansial; yang belum dapat dikonfirmasi adalah segala hal yang hanya dapat diselesaikan oleh benchmarking independen, karena model yang baru dirilis beberapa jam lalu belum memiliki evaluasi netral. Keluarga X2.5 juga memiliki anggota yang lebih besar yang akan hadir — Spark-X2.5-293B, yang diumumkan akan rilis pada 7 September.

Apa yang sebenarnya ditunjukkan oleh repos-repos tersebut.

Koleksi Hugging Face membawa enam repositori: Spark-X2.5-4B dan Spark-X2.5-1.7B yang disetel dengan instruksi, checkpoint dasar mereka, serta konversi GGUF dari keduanya. Kartu 4B menjelaskan arsitektur attention hibrida — satu lapisan full-attention per tiga lapisan sliding-window attention — yang merupakan bentuk yang tepat ketika angka pemasaran adalah 1 juta token, karena full attention pada satu juta token akan menjadi sangat mahal secara kuadratik. Kartu tersebut menyatakan jendela konteks asli hingga 1 juta token, dengan tahap pelatihan konteks panjang yang memperpanjang panjang urutan hingga 1 juta selama pretraining.

Arsitektur — atensi hibrida, satu lapisan atensi penuh per tiga lapisan jendela geser; safetensors BF16.

Konteks — native hingga 1.000.000 token; pelatihan konteks panjang menjalankan sekuens hingga 1M.

Bahasa — lebih dari 200, berdasarkan kartu model (1.7B juga mengklaim hal yang sama).

Pra-pelatihan — sekitar 20 triliun token dari halaman web, buku, publikasi akademik, kode, dan materi ensiklopedis, dilatih secara end-to-end pada klaster Huawei Ascend.

Pasca-pelatihan — SFT yang diikuti oleh RL berskala besar dalam penalaran, pengodean, perilaku agentik, dan kepatuhan terhadap instruksi, dengan kebijakan domain yang dikonsolidasikan melalui teknik yang disebut MOPD dalam makalah tersebut.

Lisensi — Apache 2.0 untuk kedua ukuran, tanpa klausul pendapatan atau wilayah seperti yang beberapa laboratorium Tiongkok lainnya terapkan pada rilis terbuka.

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

Angka agen — dan seberapa besar kita harus mempercayainya

Kartu model menerbitkan tabel benchmark lengkap untuk agen dan penalaran, dan semuanya berasal dari laporan vendor serta belum direproduksi — beri label demikian, karena pertanyaan yang menarik untuk model 4B yang baru berumur satu hari adalah apakah sebagian darinya tetap bertahan saat bersentuhan dengan evaluasi independen. Pada tabel milik vendor itu sendiri, Spark-X2.5-4B mencetak 65,1 pada BFCL-V4 (pemanggilan fungsi), 75,1 pada τ²-bench (tugas agen jangka panjang), 40,9 pada BrowseComp, 44,4 pada SWE-Bench Pro, 90,7 pada AIME 2026, 81,2 pada HMMT February 2026, 74,2 pada IMO-AnswerBench, dan 67,4 pada GPQA. Model 1.7B mendapat momennya dalam tes rumah pintar: akurasi perintah end-to-end 90,3% dengan latensi rata-rata 0,85 detik pada set Domux. Vendor juga mengklaim bahwa 4B "menyaingi model cloud 2–3× ukurannya" dalam implementasi algoritme, pelengkapan kode, dan pembuatan kode — klaim yang sekaligus merupakan kalimat paling berguna dalam rilis tersebut dan yang paling membutuhkan pemeriksaan netral.

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

Yang secara struktural lebih menarik daripada angka individual mana pun adalah bahwa rilis ini ditujukan untuk agen sejak awal. Kartu tersebut mencantumkan integrasi dengan kerangka kerja Codex, Claude Code, OpenClaw, dan Hermes, dukungan pemanggilan alat dengan parser khusus di SGLang, dan penalaran yang diaktifkan secara default (sebuah flag runtime, enable_thinking, menonaktifkannya). Dengan kata lain, vendor telah memposisikan sebuah model 4B sebagai model penggunaan alat, bukan chatbot, yang merupakan taruhan nyata: model agen kecil adalah ke mana pasar on-device sebenarnya bergerak.

Ekosistem Day-0, dan kisah vLLM

Spark-X2.5-4B dan Spark-X2.5-1.7B didukung di vLLM sejak awal melalui plugin umum out-of-tree, bukan melalui merge upstream. Integrasinya berada di repositori XHToken/Spark-plugin: Anda mengkloningnya, lalu jalankan uv pip install ., kemudian layani model dengan vllm serve dan --trust-remote-code menggunakan template chat kustom. Jalur SGLang adalah image Docker siap pakai yang diluncurkan dengan --tool-call-parser spark25 dan --context-length 1048576 — jendela satu juta token penuh dalam perintah peluncuran, yang merupakan cara tercepat untuk memeriksa klaim konteks tersebut pada perangkat keras nyata.

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

Selain vLLM dan SGLang, model ini berjalan pada fork llama.cpp, MLX (Apple silicon dan CPU Linux), Ollama dan LM Studio melalui GGUF, dengan dukungan fine-tuning melalui fork LLaMA-Factory. Dukungan perangkat keras menjadi sorotan lainnya: NVIDIA, Huawei, Hygon, dan HOUMO.AI — plus Apple silicon — yang penting karena jarang ada model dari laboratorium Tiongkok yang dirilis dengan dokumen penerapan Ascend, Hygon, dan chip domestik pada hari pertama, bukan sekadar janji.

Untuk apa model on-device 1M-token?

Panjang konteks adalah fitur utamanya, dan ia mengarah pada pekerjaan spesifik. Satu juta token konteks native pada model 4B berarti seluruh basis kode, atau kumpulan dokumen panjang, dimuat ke dalam model yang berjalan secara lokal — tanpa pipeline RAG, tanpa pemotongan bagian. Demonstrasi vendor itu sendiri, yang dibangun di atas perangkat perkantoran Loomy miliknya, membuat model 4B menulis skrip untuk menggabungkan spreadsheet penjualan, mengekstrak metrik dan tren utama, serta menghasilkan laporan bilingual sekitar 3.000 kata. Sudut robotika adalah separuh lainnya: kedua ukuran diposisikan untuk persepsi-dan-eksekusi di dalam robot dan di edge, mencakup kendali, pelacakan target, dan navigasi, yang merupakan ceruk yang masuk akal untuk model 1.7B yang merespons dalam waktu kurang dari satu detik.

Permainan yang lebih besar: Spark-X2.5-293B

Kedua model kecil adalah langkah pembuka. Pada 7 September, SparkLLM mengumumkan akan merilis Spark-X2.5-293B, model dasar dengan 293 miliar parameter yang, menurut pengumuman tersebut, memiliki kemampuan coding dan agen yang ditingkatkan. Model-model kecil X2.5 secara efektif merupakan separuh perangkat dari cerita dua tingkat; model besarlah yang menentukan batas tertinggi keluarga ini. Menganggap 4B dan 1.7B sebagai keseluruhan rilis akan kehilangan arah perjalanan.

Cara mencobanya, dan apa yang harus diperhatikan.

API-nya sudah live di platform MaaS Xingchen milik iFlytek dan gratis untuk waktu terbatas; bobot modelnya tersedia di Hugging Face, ModelScope, dan pustaka Ollama. Di sisi routing, Spark-X2.5-4B terlalu baru untuk dilayani oleh agregator mana pun saat ini — OrcaRouter belum me-routing-nya hari ini, dan tidak ada apa pun di halaman ini yang boleh dibaca seolah-olah ia memang me-routing-nya. Tetapi begitu penyedia yang ter-routing menambahkannya, ekonominya berubah dengan cara yang dapat diprediksi: OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, jadi berapa pun harga yang ditetapkan vendor, itulah yang Anda bayar, dengan kunci API yang sama yang sudah Anda gunakan, dan failover otomatis sehingga model day-0 tidak pernah harus menjadi taruhan produksi. Itulah bentuk standar bagaimana blog ini memandang model yang benar-benar baru, dan hal itu patut dikatakan secara gamblang.

Empat hal akan menentukan apakah rilis ini menjadi momen atau sekadar catatan kaki. Pertama, apakah evaluasi independen — entri indeks Artificial Analysis, posisi di arena, satu run τ²-bench yang direproduksi — mendekati klaim vendor; skor 90,7 pada AIME dari model 4B adalah angka yang besar, dan angka-angka besar dari kartu perilisan justru yang paling diperiksa. Kedua, apakah konteks 1M token bertahan di atas stack hybrid-attention di bawah beban serving sungguhan, bukan hanya dalam perintah peluncuran. Ketiga, apakah bobot hasil pelatihan Ascend berperilaku baik pada perangkat keras NVIDIA di lapangan. Keempat, apa yang sesungguhnya dihadirkan Spark-X2.5-293B pada 7 September. Sampai saat itu, ringkasan jujur untuk Spark-X2.5-4B dan Spark-X2.5-1.7B adalah: menjanjikan, terbuka, dan sepenuhnya belum terverifikasi — yang, untuk model yang dirilis pagi ini, merupakan status yang tepat.