การ์ดไตเติลฮีโร่สำหรับ 'Spark-X2.5-4B และ Spark-X2.5-1.7B' พร้อมคำบรรยาย 'โมเดลเอเจนต์บนอุปกรณ์ขนาดกะทัดรัดพร้อมบริบทเนทีฟ 1M' ด้านซ้ายมีไอคอนอุปกรณ์ขนาดเล็กที่ผสมระหว่างโทรศัพท์และแล็ปท็อป ตรงกลางมีป้ายแคปซูลมนของหน้าต่างบริบทเขียนว่า '1M โทเคน' และด้านขวาแสดงรายการ '200+ ภาษา', 'Apache 2.0' และ 'Day-0 vLLM' ส่วนโลโก้ OrcaRouter ถูกวางซ้อนไว้ที่มุมขวาล่าง
Guides & Insights

Spark-X2.5-4B และ Spark-X2.5-1.7B: โมเดลเอเจนต์ขนาดกะทัดรัดสำหรับการทำงานบนอุปกรณ์พร้อมบริบทเนทีฟ 1M

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Spark-X2.5-4B และ Spark-X2.5-1.7B เปิดตัวต่อสาธารณะเมื่อวันที่ 1 กันยายน 2026 โดย SparkLLM ซึ่งเป็นบริษัทลูก XHToken (词元星火) ของ iFlytek ได้เปิดซอร์สโมเดลขนาดกะทัดรัดทั้งสองตัวภายใต้ Apache 2.0 พร้อมกับค่าน้ำหนัก โค้ด และเอกสารการปรับใช้ที่เผยแพร่บน Hugging Face และ GitHub ในวันเดียวกัน สเปกที่โดดเด่นคือหน้าต่างบริบทขนาด 1,000,000 โทเคนแบบเนทีฟบนโมเดลที่เล็กพอจะรันบนอุปกรณ์ได้ โดยมีคลังคำศัพท์มากกว่า 200 ภาษาตามที่กล่าวอ้าง และการออกแบบแบบไฮบริดแอตเทนชันที่ผู้ขายบอกว่าปรับแต่งมาสำหรับงานแบบเอเจนต์ สิ่งที่รู้ได้แล้วในวันนี้จากที่เก็บโค้ดมีมากมาย แต่สิ่งที่ยังไม่ได้รับการยืนยันคือทุกอย่างที่ต้องอาศัยการวัดผลแบบอิสระเท่านั้น เพราะโมเดลที่เพิ่งถูกปล่อยออกมาเมื่อไม่กี่ชั่วโมงก่อนยังไม่มีการประเมินที่เป็นกลาง ตระกูล X2.5 ยังมีสมาชิกขนาดใหญ่กว่าตามมา นั่นคือ Spark-X2.5-293B ซึ่งประกาศสำหรับวันที่ 7 กันยายน

สิ่งที่รีโพเหล่านี้แสดงให้เห็นจริงๆ

คอลเลกชัน Hugging Face ประกอบด้วยรีพอสิทอรีหกแห่ง ได้แก่ Spark-X2.5-4B และ Spark-X2.5-1.7B ที่ปรับจูนด้วยคำสั่ง, เช็คพอยต์ฐานของทั้งสอง, และเวอร์ชันแปลง GGUF ของทั้งคู่ การ์ดข้อมูลของรุ่น 4B อธิบายสถาปัตยกรรมแบบไฮบริดแอตเทนชัน — ชั้น full-attention หนึ่งชั้นต่อชั้น sliding-window attention สามชั้น — ซึ่งเป็นรูปแบบที่ใช่เมื่อตัวเลขทางการตลาดคือ 1M โทเคน เพราะถ้าใช้ full attention กับล้านโทเคนจะมีความซับซ้อนแบบกำลังสอง การ์ดระบุว่าหน้าต่างบริบทดั้งเดิมรองรับได้ถึง 1M โทเคน พร้อมขั้นตอนการฝึกสำหรับบริบทยาวที่ขยายความยาวลำดับเป็น 1M ในระหว่างการ pretraining

สถาปัตยกรรม — แอตเทนชันแบบผสม: เลเยอร์ full-attention หนึ่งเลเยอร์ต่อทุกสามเลเยอร์แบบ sliding-window; BF16 safetensors.

บริบท — รองรับบริบทดั้งเดิมสูงสุด 1,000,000 โทเค็น; การฝึกด้วยบริบทยาวใช้ลำดับข้อมูลยาวถึง 1M.

ภาษา — มากกว่า 200 ภาษา ตามที่ระบุใน model card (รุ่น 1.7B ก็อ้างเช่นเดียวกัน).

การฝึกก่อน — ประมาณ 20 ล้านล้านโทเคนจากหน้าเว็บ หนังสือ ผลงานวิชาการ โค้ด และเนื้อหาสารานุกรม ซึ่งถูกฝึกแบบครบวงจรบนคลัสเตอร์ Huawei Ascend

การฝึกหลัง — SFT ตามด้วย RL ขนาดใหญ่ในด้านการให้เหตุผล การเขียนโค้ด พฤติกรรมแบบเอเจนต์ และการทำตามคำสั่ง โดยรวมนโยบายเฉพาะด้านเข้าด้วยกันผ่านเทคนิคที่บทความเรียกว่า MOPD.

ใบอนุญาต — Apache 2.0 สำหรับทั้งสองขนาด โดยไม่มีเงื่อนไขด้านรายได้หรือภูมิภาคแบบที่ห้องแล็บจีนอื่นๆ หลายแห่งแนบมากับการเผยแพร่แบบเปิด

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

ตัวเลขของเอเจนต์ — และควรเชื่อถือได้มากแค่ไหน

โมเดลการ์ดเผยแพร่ตารางเกณฑ์มาตรฐานเอเจนต์และการให้เหตุผลแบบเต็มรูปแบบ และตัวเลขทั้งหมดเป็นข้อมูลที่รายงานโดยผู้จำหน่ายเองโดยไม่ผ่านการตรวจสอบซ้ำ — ควรติดป้ายกำกับเช่นนั้นไว้ เพราะคำถามที่น่าสนใจสำหรับโมเดล 4B ที่เพิ่งออกมาได้หนึ่งวันก็คือ ตัวเลขเหล่านี้จะรอดจากการประเมินโดยอิสระหรือไม่ ในตารางของผู้จำหน่ายเอง Spark-X2.5-4B ได้ 65.1 ใน BFCL-V4 (การเรียกใช้ฟังก์ชัน), 75.1 ใน τ²-bench (งานเอเจนต์ระยะยาว), 40.9 ใน BrowseComp, 44.4 ใน SWE-Bench Pro, 90.7 ใน AIME 2026, 81.2 ใน HMMT February 2026, 74.2 ใน IMO-AnswerBench และ 67.4 ใน GPQA โมเดล 1.7B ได้ช่วงเวลาของตัวเองในการทดสอบสมาร์ทโฮม: ความแม่นยำของคำสั่งแบบ end-to-end 90.3% ที่เวลาแฝงเฉลี่ย 0.85 วินาทีบนชุดข้อมูล Domux ผู้จำหน่ายยังอ้างอีกว่าโมเดล 4B “เทียบชั้นโมเดลคลาวด์ที่มีขนาดใหญ่กว่า 2–3 เท่า” ในด้านการเขียนโค้ดตามอัลกอริทึม การเติมโค้ดให้สมบูรณ์ และการสร้างโค้ด — ซึ่งเป็นประโยคที่มีประโยชน์ที่สุดในการเผยแพร่ครั้งนี้ และในเวลาเดียวกันก็เป็นประโยคที่ต้องการการตรวจสอบอย่างเป็นกลางมากที่สุด

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

สิ่งที่น่าสนใจเชิงโครงสร้างมากกว่าตัวเลขเพียงตัวเดียวก็คือ การเปิดตัวครั้งนี้มุ่งเป้าไปที่เอเจนต์ตั้งแต่แรก การ์ดระบุการผสานรวมกับแฮร์เนสอย่าง Codex, Claude Code, OpenClaw และ Hermes การรองรับการเรียกใช้เครื่องมือพร้อมพาร์เซอร์เฉพาะใน SGLang และการเปิดใช้การให้เหตุผลตามค่าเริ่มต้น (runtime flag ตัวหนึ่งคือ enable_thinking ซึ่งใช้ปิดการให้เหตุผลนั้น) กล่าวอีกนัยหนึ่ง ผู้พัฒนาวางตำแหน่งโมเดล 4B ให้เป็นโมเดลสำหรับใช้เครื่องมือ ไม่ใช่แชตบอต ซึ่งถือเป็นการเดิมพันจริง ๆ: โมเดลเอเจนต์ขนาดเล็กคือทิศทางที่ตลาดบนอุปกรณ์กำลังมุ่งไปจริง ๆ

ระบบนิเวศ Day-0 และเรื่องราวของ vLLM

Spark-X2.5-4B และ Spark-X2.5-1.7B รองรับใน vLLM ตั้งแต่แรกเริ่มผ่านปลั๊กอินทั่วไปแบบนอกทรี (out-of-tree) แทนที่จะเป็นการผสานเข้ากับอัปสตรีม โดยส่วนการผสานรวมอยู่ในรีโพซิทอรี XHToken/Spark-plugin: คุณโคลนมันแล้ว uv pip install . จากนั้นจึงเสิร์ฟโมเดลด้วย vllm serve และ --trust-remote-code กับเทมเพลตแชตแบบกำหนดเอง ส่วนเส้นทางของ SGLang คืออิมเมจ Docker ที่สร้างไว้ล่วงหน้าซึ่งเปิดใช้ด้วย --tool-call-parser spark25 และ --context-length 1048576 — หน้าต่างโทเคนเต็มหนึ่งล้านในคำสั่งเปิดใช้ ซึ่งเป็นวิธีที่เร็วที่สุดในการตรวจสอบข้ออ้างเรื่องบริบทบนฮาร์ดแวร์จริง

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

นอกเหนือจาก vLLM และ SGLang แล้ว โมเดลยังทำงานบน fork ของ llama.cpp, MLX (Apple silicon และ Linux CPU), Ollama และ LM Studio ผ่าน GGUF โดยรองรับการปรับแต่งละเอียดผ่าน fork ของ LLaMA-Factory การรองรับฮาร์ดแวร์เป็นอีกหนึ่งไฮไลต์: NVIDIA, Huawei, Hygon และ HOUMO.AI — รวมถึง Apple silicon — ซึ่งมีความสำคัญเพราะเป็นเรื่องยากที่โมเดลจากห้องแล็บจีนจะเปิดตัวพร้อมเอกสารการปรับใช้สำหรับ Ascend, Hygon และชิปในประเทศตั้งแต่วันแรก ไม่ใช่เพียงแค่คำสัญญา

โมเดลบนอุปกรณ์ที่รองรับ 1M โทเคนนั้นมีไว้เพื่ออะไร

ความยาวบริบทคือคุณสมบัติเด่น และมันชี้ไปที่งานเฉพาะด้าน หนึ่งล้านโทเคนของบริบทดั้งเดิมบนโมเดล 4B หมายถึงโค้ดเบสทั้งหมด หรือชุดเอกสารยาวๆ ที่โหลดเข้าสู่โมเดลซึ่งรันบนเครื่องท้องถิ่นได้ — ไม่ต้องใช้ไปป์ไลน์ RAG ไม่ต้องแบ่งชิ้นส่วน การสาธิตของเวนเดอร์เอง ซึ่งสร้างบนชุดเครื่องมือสำนักงาน Loomy ให้โมเดล 4B เขียนสคริปต์เพื่อรวมสเปรดชีตยอดขาย ดึงเมตริกหลักและแนวโน้มออกมา แล้วสร้างรายงานสองภาษาที่ยาวประมาณ 3,000 คำ อีกครึ่งหนึ่งคือมุมด้านหุ่นยนต์: ทั้งสองขนาดถูกวางตำแหน่งสำหรับการรับรู้และปฏิบัติการบนหุ่นยนต์และบนเอดจ์ ครอบคลุมการควบคุม การติดตามเป้าหมาย และการนำทาง ซึ่งเป็นช่องทางที่เป็นไปได้สำหรับโมเดล 1.7B ที่ตอบสนองในเวลาไม่ถึงวินาที

เกมที่ใหญ่กว่า: Spark-X2.5-293B

โมเดลเล็กสองตัวนั้นเป็นเพียงหมากเปิดฉาก วันที่ 7 กันยายน SparkLLM ประกาศว่าจะเปิดตัว Spark-X2.5-293B ซึ่งเป็นโมเดลพื้นฐานที่มีพารามิเตอร์ 293 พันล้านตัว โดยตามประกาศระบุว่ามีความสามารถด้านการเขียนโค้ดและเอเจนต์ที่อัปเกรดขึ้น โมเดลเล็กตระกูล X2.5 นั้นแท้จริงแล้วเป็นครึ่งหนึ่งของเรื่องราวแบบสองชั้นที่ทำงานบนอุปกรณ์ ขณะที่โมเดลใหญ่คือตัวกำหนดเพดานสูงสุดของตระกูล การมองว่า 4B และ 1.7B คือการเปิดตัวทั้งหมดก็จะพลาดทิศทางที่กำลังไป

วิธีลองใช้ และสิ่งที่ควรสังเกต

API เปิดให้บริการแล้วบนแพลตฟอร์ม Xingchen MaaS ของ iFlytek และให้ใช้ฟรีในช่วงเวลาจำกัด ส่วนค่าน้ำหนักโมเดลอยู่บน Hugging Face, ModelScope และไลบรารี Ollama ทางด้านการจัดเส้นทาง Spark-X2.5-4B ยังใหม่อยู่เกินกว่าที่ผู้รวมบริการรายใดจะรองรับได้ — ตอนนี้ OrcaRouter ยังไม่จัดเส้นทางให้ และไม่มีเนื้อหาใดในหน้านี้ที่ควรตีความว่ารองรับแล้ว แต่วันที่ผู้ให้บริการในระบบจัดเส้นทางเพิ่มโมเดลนี้เข้ามา เรื่องค่าใช้จ่ายจะเปลี่ยนไปในแบบที่คาดเดาได้: OrcaRouter ส่งผ่านราคาที่ผู้ให้บริการกำหนดโดยคิดมาร์กอัป 0% ดังนั้นผู้จำหน่ายตั้งราคาเท่าใด คุณก็จ่ายเท่านั้น ด้วยคีย์ API ตัวเดิมที่คุณใช้อยู่แล้ว และการเฟลโอเวอร์อัตโนมัติก็ทำให้โมเดลที่เพิ่งเปิดตัววันแรกไม่จำเป็นต้องเป็นการเดิมพันในระบบผลิตจริง นี่คือมุมมองมาตรฐานที่บล็อกนี้ใช้มองโมเดลใหม่เอี่ยม และสมควรพูดกันตรงไปตรงมา

สี่สิ่งจะตัดสินว่าการเปิดตัวครั้งนี้จะกลายเป็นช่วงเวลาสำคัญหรือเป็นเพียงเชิงอรรถ ประการแรก การประเมินโดยอิสระ — รายการในดัชนี Artificial Analysis, การได้อันดับใน arena, การรัน τ²-bench ที่ทำซ้ำได้ — จะใกล้เคียงกับตัวเลขที่ผู้พัฒนาอ้างไว้หรือไม่; โมเดล 4B ที่ทำคะแนน 90.7 บน AIME เป็นตัวเลขก้อนใหญ่ และตัวเลขก้อนใหญ่จากการ์ดในวันเปิดตัวคือสิ่งที่ถูกตรวจสอบมากที่สุดแน่นอน ประการที่สอง บริบท 1M โทเคนจะคงความเสถียรบนสแตก hybrid-attention ภายใต้โหลดการ serve จริงหรือไม่ ไม่ใช่แค่ในคำสั่งเปิดตัวเท่านั้น ประการที่สาม น้ำหนักโมเดลที่ฝึกด้วย Ascend จะทำงานปกติบนฮาร์ดแวร์ NVIDIA ในภาคสนามหรือไม่ ประการที่สี่ Spark-X2.5-293B จะส่งมอบอะไรจริง ๆ ในวันที่ 7 กันยายน จนกว่าจะถึงตอนนั้น บทสรุปที่ตรงไปตรงมาของ Spark-X2.5-4B และ Spark-X2.5-1.7B คือ: มีแนวโน้มดี, เปิดกว้าง, และยังไม่ได้รับการยืนยันโดยสิ้นเชิง — ซึ่งสำหรับโมเดลที่ปล่อยออกมาเมื่อเช้านี้ ถือเป็นสถานะที่ถูกต้องแล้ว

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube