
Spark-X2.5-4B และ Spark-X2.5-1.7B: โมเดลเอเจนต์ขนาดกะทัดรัดสำหรับการทำงานบนอุปกรณ์พร้อมบริบทเนทีฟ 1M
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
Spark-X2.5-4B และ Spark-X2.5-1.7B เปิดตัวต่อสาธารณะเมื่อวันที่ 1 กันยายน 2026 โดย SparkLLM ซึ่งเป็นบริษัทลูก XHToken (词元星火) ของ iFlytek ได้เปิดซอร์สโมเดลขนาดกะทัดรัดทั้งสองตัวภายใต้ Apache 2.0 พร้อมกับค่าน้ำหนัก โค้ด และเอกสารการปรับใช้ที่เผยแพร่บน Hugging Face และ GitHub ในวันเดียวกัน สเปกที่โดดเด่นคือหน้าต่างบริบทขนาด 1,000,000 โทเคนแบบเนทีฟบนโมเดลที่เล็กพอจะรันบนอุปกรณ์ได้ โดยมีคลังคำศัพท์มากกว่า 200 ภาษาตามที่กล่าวอ้าง และการออกแบบแบบไฮบริดแอตเทนชันที่ผู้ขายบอกว่าปรับแต่งมาสำหรับงานแบบเอเจนต์ สิ่งที่รู้ได้แล้วในวันนี้จากที่เก็บโค้ดมีมากมาย แต่สิ่งที่ยังไม่ได้รับการยืนยันคือทุกอย่างที่ต้องอาศัยการวัดผลแบบอิสระเท่านั้น เพราะโมเดลที่เพิ่งถูกปล่อยออกมาเมื่อไม่กี่ชั่วโมงก่อนยังไม่มีการประเมินที่เป็นกลาง ตระกูล X2.5 ยังมีสมาชิกขนาดใหญ่กว่าตามมา นั่นคือ Spark-X2.5-293B ซึ่งประกาศสำหรับวันที่ 7 กันยายน
สิ่งที่รีโพเหล่านี้แสดงให้เห็นจริงๆ
คอลเลกชัน Hugging Face ประกอบด้วยรีพอสิทอรีหกแห่ง ได้แก่ Spark-X2.5-4B และ Spark-X2.5-1.7B ที่ปรับจูนด้วยคำสั่ง, เช็คพอยต์ฐานของทั้งสอง, และเวอร์ชันแปลง GGUF ของทั้งคู่ การ์ดข้อมูลของรุ่น 4B อธิบายสถาปัตยกรรมแบบไฮบริดแอตเทนชัน — ชั้น full-attention หนึ่งชั้นต่อชั้น sliding-window attention สามชั้น — ซึ่งเป็นรูปแบบที่ใช่เมื่อตัวเลขทางการตลาดคือ 1M โทเคน เพราะถ้าใช้ full attention กับล้านโทเคนจะมีความซับซ้อนแบบกำลังสอง การ์ดระบุว่าหน้าต่างบริบทดั้งเดิมรองรับได้ถึง 1M โทเคน พร้อมขั้นตอนการฝึกสำหรับบริบทยาวที่ขยายความยาวลำดับเป็น 1M ในระหว่างการ pretraining
• สถาปัตยกรรม — แอตเทนชันแบบผสม: เลเยอร์ full-attention หนึ่งเลเยอร์ต่อทุกสามเลเยอร์แบบ sliding-window; BF16 safetensors.
• บริบท — รองรับบริบทดั้งเดิมสูงสุด 1,000,000 โทเค็น; การฝึกด้วยบริบทยาวใช้ลำดับข้อมูลยาวถึง 1M.
• ภาษา — มากกว่า 200 ภาษา ตามที่ระบุใน model card (รุ่น 1.7B ก็อ้างเช่นเดียวกัน).
• การฝึกก่อน — ประมาณ 20 ล้านล้านโทเคนจากหน้าเว็บ หนังสือ ผลงานวิชาการ โค้ด และเนื้อหาสารานุกรม ซึ่งถูกฝึกแบบครบวงจรบนคลัสเตอร์ Huawei Ascend
• การฝึกหลัง — SFT ตามด้วย RL ขนาดใหญ่ในด้านการให้เหตุผล การเขียนโค้ด พฤติกรรมแบบเอเจนต์ และการทำตามคำสั่ง โดยรวมนโยบายเฉพาะด้านเข้าด้วยกันผ่านเทคนิคที่บทความเรียกว่า MOPD.
• ใบอนุญาต — Apache 2.0 สำหรับทั้งสองขนาด โดยไม่มีเงื่อนไขด้านรายได้หรือภูมิภาคแบบที่ห้องแล็บจีนอื่นๆ หลายแห่งแนบมากับการเผยแพร่แบบเปิด

ตัวเลขของเอเจนต์ — และควรเชื่อถือได้มากแค่ไหน
โมเดลการ์ดเผยแพร่ตารางเกณฑ์มาตรฐานเอเจนต์และการให้เหตุผลแบบเต็มรูปแบบ และตัวเลขทั้งหมดเป็นข้อมูลที่รายงานโดยผู้จำหน่ายเองโดยไม่ผ่านการตรวจสอบซ้ำ — ควรติดป้ายกำกับเช่นนั้นไว้ เพราะคำถามที่น่าสนใจสำหรับโมเดล 4B ที่เพิ่งออกมาได้หนึ่งวันก็คือ ตัวเลขเหล่านี้จะรอดจากการประเมินโดยอิสระหรือไม่ ในตารางของผู้จำหน่ายเอง Spark-X2.5-4B ได้ 65.1 ใน BFCL-V4 (การเรียกใช้ฟังก์ชัน), 75.1 ใน τ²-bench (งานเอเจนต์ระยะยาว), 40.9 ใน BrowseComp, 44.4 ใน SWE-Bench Pro, 90.7 ใน AIME 2026, 81.2 ใน HMMT February 2026, 74.2 ใน IMO-AnswerBench และ 67.4 ใน GPQA โมเดล 1.7B ได้ช่วงเวลาของตัวเองในการทดสอบสมาร์ทโฮม: ความแม่นยำของคำสั่งแบบ end-to-end 90.3% ที่เวลาแฝงเฉลี่ย 0.85 วินาทีบนชุดข้อมูล Domux ผู้จำหน่ายยังอ้างอีกว่าโมเดล 4B “เทียบชั้นโมเดลคลาวด์ที่มีขนาดใหญ่กว่า 2–3 เท่า” ในด้านการเขียนโค้ดตามอัลกอริทึม การเติมโค้ดให้สมบูรณ์ และการสร้างโค้ด — ซึ่งเป็นประโยคที่มีประโยชน์ที่สุดในการเผยแพร่ครั้งนี้ และในเวลาเดียวกันก็เป็นประโยคที่ต้องการการตรวจสอบอย่างเป็นกลางมากที่สุด

สิ่งที่น่าสนใจเชิงโครงสร้างมากกว่าตัวเลขเพียงตัวเดียวก็คือ การเปิดตัวครั้งนี้มุ่งเป้าไปที่เอเจนต์ตั้งแต่แรก การ์ดระบุการผสานรวมกับแฮร์เนสอย่าง Codex, Claude Code, OpenClaw และ Hermes การรองรับการเรียกใช้เครื่องมือพร้อมพาร์เซอร์เฉพาะใน SGLang และการเปิดใช้การให้เหตุผลตามค่าเริ่มต้น (runtime flag ตัวหนึ่งคือ enable_thinking ซึ่งใช้ปิดการให้เหตุผลนั้น) กล่าวอีกนัยหนึ่ง ผู้พัฒนาวางตำแหน่งโมเดล 4B ให้เป็นโมเดลสำหรับใช้เครื่องมือ ไม่ใช่แชตบอต ซึ่งถือเป็นการเดิมพันจริง ๆ: โมเดลเอเจนต์ขนาดเล็กคือทิศทางที่ตลาดบนอุปกรณ์กำลังมุ่งไปจริง ๆ
ระบบนิเวศ Day-0 และเรื่องราวของ vLLM
Spark-X2.5-4B และ Spark-X2.5-1.7B รองรับใน vLLM ตั้งแต่แรกเริ่มผ่านปลั๊กอินทั่วไปแบบนอกทรี (out-of-tree) แทนที่จะเป็นการผสานเข้ากับอัปสตรีม โดยส่วนการผสานรวมอยู่ในรีโพซิทอรี XHToken/Spark-plugin: คุณโคลนมันแล้ว uv pip install . จากนั้นจึงเสิร์ฟโมเดลด้วย vllm serve และ --trust-remote-code กับเทมเพลตแชตแบบกำหนดเอง ส่วนเส้นทางของ SGLang คืออิมเมจ Docker ที่สร้างไว้ล่วงหน้าซึ่งเปิดใช้ด้วย --tool-call-parser spark25 และ --context-length 1048576 — หน้าต่างโทเคนเต็มหนึ่งล้านในคำสั่งเปิดใช้ ซึ่งเป็นวิธีที่เร็วที่สุดในการตรวจสอบข้ออ้างเรื่องบริบทบนฮาร์ดแวร์จริง

นอกเหนือจาก vLLM และ SGLang แล้ว โมเดลยังทำงานบน fork ของ llama.cpp, MLX (Apple silicon และ Linux CPU), Ollama และ LM Studio ผ่าน GGUF โดยรองรับการปรับแต่งละเอียดผ่าน fork ของ LLaMA-Factory การรองรับฮาร์ดแวร์เป็นอีกหนึ่งไฮไลต์: NVIDIA, Huawei, Hygon และ HOUMO.AI — รวมถึง Apple silicon — ซึ่งมีความสำคัญเพราะเป็นเรื่องยากที่โมเดลจากห้องแล็บจีนจะเปิดตัวพร้อมเอกสารการปรับใช้สำหรับ Ascend, Hygon และชิปในประเทศตั้งแต่วันแรก ไม่ใช่เพียงแค่คำสัญญา
โมเดลบนอุปกรณ์ที่รองรับ 1M โทเคนนั้นมีไว้เพื่ออะไร
ความยาวบริบทคือคุณสมบัติเด่น และมันชี้ไปที่งานเฉพาะด้าน หนึ่งล้านโทเคนของบริบทดั้งเดิมบนโมเดล 4B หมายถึงโค้ดเบสทั้งหมด หรือชุดเอกสารยาวๆ ที่โหลดเข้าสู่โมเดลซึ่งรันบนเครื่องท้องถิ่นได้ — ไม่ต้องใช้ไปป์ไลน์ RAG ไม่ต้องแบ่งชิ้นส่วน การสาธิตของเวนเดอร์เอง ซึ่งสร้างบนชุดเครื่องมือสำนักงาน Loomy ให้โมเดล 4B เขียนสคริปต์เพื่อรวมสเปรดชีตยอดขาย ดึงเมตริกหลักและแนวโน้มออกมา แล้วสร้างรายงานสองภาษาที่ยาวประมาณ 3,000 คำ อีกครึ่งหนึ่งคือมุมด้านหุ่นยนต์: ทั้งสองขนาดถูกวางตำแหน่งสำหรับการรับรู้และปฏิบัติการบนหุ่นยนต์และบนเอดจ์ ครอบคลุมการควบคุม การติดตามเป้าหมาย และการนำทาง ซึ่งเป็นช่องทางที่เป็นไปได้สำหรับโมเดล 1.7B ที่ตอบสนองในเวลาไม่ถึงวินาที
เกมที่ใหญ่กว่า: Spark-X2.5-293B
โมเดลเล็กสองตัวนั้นเป็นเพียงหมากเปิดฉาก วันที่ 7 กันยายน SparkLLM ประกาศว่าจะเปิดตัว Spark-X2.5-293B ซึ่งเป็นโมเดลพื้นฐานที่มีพารามิเตอร์ 293 พันล้านตัว โดยตามประกาศระบุว่ามีความสามารถด้านการเขียนโค้ดและเอเจนต์ที่อัปเกรดขึ้น โมเดลเล็กตระกูล X2.5 นั้นแท้จริงแล้วเป็นครึ่งหนึ่งของเรื่องราวแบบสองชั้นที่ทำงานบนอุปกรณ์ ขณะที่โมเดลใหญ่คือตัวกำหนดเพดานสูงสุดของตระกูล การมองว่า 4B และ 1.7B คือการเปิดตัวทั้งหมดก็จะพลาดทิศทางที่กำลังไป
วิธีลองใช้ และสิ่งที่ควรสังเกต
API เปิดให้บริการแล้วบนแพลตฟอร์ม Xingchen MaaS ของ iFlytek และให้ใช้ฟรีในช่วงเวลาจำกัด ส่วนค่าน้ำหนักโมเดลอยู่บน Hugging Face, ModelScope และไลบรารี Ollama ทางด้านการจัดเส้นทาง Spark-X2.5-4B ยังใหม่อยู่เกินกว่าที่ผู้รวมบริการรายใดจะรองรับได้ — ตอนนี้ OrcaRouter ยังไม่จัดเส้นทางให้ และไม่มีเนื้อหาใดในหน้านี้ที่ควรตีความว่ารองรับแล้ว แต่วันที่ผู้ให้บริการในระบบจัดเส้นทางเพิ่มโมเดลนี้เข้ามา เรื่องค่าใช้จ่ายจะเปลี่ยนไปในแบบที่คาดเดาได้: OrcaRouter ส่งผ่านราคาที่ผู้ให้บริการกำหนดโดยคิดมาร์กอัป 0% ดังนั้นผู้จำหน่ายตั้งราคาเท่าใด คุณก็จ่ายเท่านั้น ด้วยคีย์ API ตัวเดิมที่คุณใช้อยู่แล้ว และการเฟลโอเวอร์อัตโนมัติก็ทำให้โมเดลที่เพิ่งเปิดตัววันแรกไม่จำเป็นต้องเป็นการเดิมพันในระบบผลิตจริง นี่คือมุมมองมาตรฐานที่บล็อกนี้ใช้มองโมเดลใหม่เอี่ยม และสมควรพูดกันตรงไปตรงมา
สี่สิ่งจะตัดสินว่าการเปิดตัวครั้งนี้จะกลายเป็นช่วงเวลาสำคัญหรือเป็นเพียงเชิงอรรถ ประการแรก การประเมินโดยอิสระ — รายการในดัชนี Artificial Analysis, การได้อันดับใน arena, การรัน τ²-bench ที่ทำซ้ำได้ — จะใกล้เคียงกับตัวเลขที่ผู้พัฒนาอ้างไว้หรือไม่; โมเดล 4B ที่ทำคะแนน 90.7 บน AIME เป็นตัวเลขก้อนใหญ่ และตัวเลขก้อนใหญ่จากการ์ดในวันเปิดตัวคือสิ่งที่ถูกตรวจสอบมากที่สุดแน่นอน ประการที่สอง บริบท 1M โทเคนจะคงความเสถียรบนสแตก hybrid-attention ภายใต้โหลดการ serve จริงหรือไม่ ไม่ใช่แค่ในคำสั่งเปิดตัวเท่านั้น ประการที่สาม น้ำหนักโมเดลที่ฝึกด้วย Ascend จะทำงานปกติบนฮาร์ดแวร์ NVIDIA ในภาคสนามหรือไม่ ประการที่สี่ Spark-X2.5-293B จะส่งมอบอะไรจริง ๆ ในวันที่ 7 กันยายน จนกว่าจะถึงตอนนั้น บทสรุปที่ตรงไปตรงมาของ Spark-X2.5-4B และ Spark-X2.5-1.7B คือ: มีแนวโน้มดี, เปิดกว้าง, และยังไม่ได้รับการยืนยันโดยสิ้นเชิง — ซึ่งสำหรับโมเดลที่ปล่อยออกมาเมื่อเช้านี้ ถือเป็นสถานะที่ถูกต้องแล้ว
