'Spark-X2.5-4B 및 Spark-X2.5-1.7B'용 히어로 타이틀 카드로, 부제는 '네이티브 1M 컨텍스트를 갖춘 컴팩트한 온디바이스 에이전트 모델'입니다. 왼쪽에는 휴대폰과 노트북을 결합한 작은 기기 아이콘이 있고, 중앙에는 '1M 토큰'이라고 적힌 둥근 컨텍스트 창 알약(pill) 요소가 있으며, 오른쪽에는 '200개 이상의 언어', 'Apache 2.0', 'Day-0 vLLM'이 나열되어 있습니다. OrcaRouter 로고는 오른쪽 하단 모서리에 합성되어 있습니다.
Guides & Insights

Spark-X2.5-4B 및 Spark-X2.5-1.7B: 네이티브 1M 컨텍스트를 갖춘 컴팩트 온디바이스 에이전트 모델

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Spark-X2.5-4B와 Spark-X2.5-1.7B는 2026년 9월 1일 공개됐다. iFlytek의 XHToken(词元星火) 자회사인 SparkLLM은 이날 두 소형 모델을 Apache 2.0 라이선스로 오픈소스화했으며, 가중치와 코드, 배포 문서도 같은 날 Hugging Face와 GitHub에 게시됐다. 핵심 사양은 온디바이스 실행이 가능할 만큼 작은 모델에서 기본 지원되는 100만 토큰 컨텍스트 윈도우다. 벤더 측은 200개 이상 언어 어휘와 에이전트형 작업에 최적화된 하이브리드 어텐션 설계를 갖췄다고 주장한다. 지금 저장소에서 확인할 수 있는 것은 상당하지만, 아직 검증되지 않은 것은 독립적인 벤치마킹만이 판가름할 수 있는 모든 것이다. 몇 시간 전에 공개된 모델에는 아직 중립적인 평가가 없기 때문이다. X2.5 제품군에는 더 큰 모델도 곧 합류한다 — 9월 7일 공개가 예고된 Spark-X2.5-293B다.

리포지토리가 실제로 보여주는 것

Hugging Face 컬렉션에는 instruction 튜닝된 Spark-X2.5-4B와 Spark-X2.5-1.7B, 각각의 기본 체크포인트, 그리고 두 모델의 GGUF 변환본 등 여섯 개의 저장소가 포함되어 있습니다. 4B 카드에는 하이브리드 어텐션 아키텍처, 즉 슬라이딩 윈도우 어텐션 레이어 세 개마다 전체(full) 어텐션 레이어 하나가 배치되는 구조가 설명되어 있습니다. 이는 마케팅 수치가 1M(100만) 토큰일 때 정확히 원하는 형태인데, 백만 토큰 전체에 풀 어텐션을 적용하면 비용이 제곱으로 증가하기 때문입니다. 카드에는 기본 컨텍스트 윈도우가 최대 1M 토큰이라고 명시되어 있으며, 사전학습 중 시퀀스 길이를 1M까지 확장한 장문맥 학습 단계를 거쳤다고 설명합니다.

아키텍처 — 하이브리드 어텐션, 슬라이딩 윈도우 레이어 3개마다 풀 어텐션 레이어 1개; BF16 safetensors.

컨텍스트 — 기본적으로 최대 1,000,000 토큰까지 지원하며, 긴 컨텍스트 훈련은 시퀀스를 1M까지 실행했습니다.

언어 — 모델 카드에 따르면 200개 이상(1.7B도 동일하게 명시).

사전 학습 — 웹 페이지, 서적, 학술 간행물, 코드 및 백과사전 자료 등 약 20조 개의 토큰으로 구성되며, Huawei Ascend 클러스터에서 종단 간(end-to-end)으로 학습되었습니다.

사후 훈련 — 추론, 코딩, 에이전트 행동 및 지시 수행에 걸친 대규모 RL이 뒤따르는 SFT와 함께, 논문에서 MOPD라고 부르는 기법을 통해 도메인 정책이 통합됩니다.

라이선스 — 두 크기 모두 Apache 2.0이며, 다른 여러 중국 연구소가 오픈 릴리스에 첨부하는 수익 또는 지역 조항이 없습니다.

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

에이전트 수치 — 그리고 그것을 얼마나 신뢰해야 하는가

모델 카드는 에이전트 및 추론 벤치마크 전체 표를 게시하며, 그 수치는 모두 공급업체가 보고한 것으로 독립적으로 재현되지 않았다. 표에 그렇게 라벨을 붙여야 한다. 출시된 지 하루 된 4B 모델에게 흥미로운 질문은 그 수치 중 어떤 것이라도 독립적 평가와 맞닥뜨린 뒤 살아남을 수 있느냐는 것이기 때문이다. 공급업체 자체 표에 따르면 Spark-X2.5-4B는 BFCL-V4(함수 호출) 65.1, τ²-bench(장기 에이전트 작업) 75.1, BrowseComp 40.9, SWE-Bench Pro 44.4, AIME 2026 90.7, HMMT February 2026 81.2, IMO-AnswerBench 74.2, GPQA 67.4를 기록했다. 1.7B 모델은 스마트홈 테스트에서 빛을 발한다. Domux 세트에서 평균 지연 시간 0.85초로 종단 간 명령 정확도 90.3%를 달성했다. 공급업체는 또한 4B가 알고리즘 구현, 코드 완성 및 생성에서 "자신보다 2~3배 큰 클라우드 모델과 견줄 만하다"고 주장한다. 이 주장은 이번 릴리스에서 가장 유용한 문장인 동시에 가장 중립적인 검증이 필요한 문장이기도 하다.

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

단일 숫자 하나보다 구조적으로 더 흥미로운 점은 이번 릴리스가 처음부터 에이전트를 겨냥하고 있다는 것이다. 카드에는 Codex, Claude Code, OpenClaw, Hermes 하네스와의 통합, SGLang의 전용 파서를 통한 도구 호출 지원, 그리고 기본적으로 활성화되는 추론(이 기능을 끄는 런타임 플래그는 enable_thinking이다)이 포함된다. 다시 말해, 이 공급업체는 4B를 챗봇이 아닌 도구 사용 모델로 포지셔닝했다. 이는 진짜 승부수인데, 소형 에이전트 모델은 온디바이스 시장이 실제로 움직이는 방향이기 때문이다.

Day-0 에코시스템, 그리고 vLLM 스토리

Spark-X2.5-4B 및 Spark-X2.5-1.7B는 업스트림 병합이 아닌 out-of-tree 범용 플러그인을 통해 vLLM에서 첫날부터 지원됩니다. 통합은 XHToken/Spark-plugin 저장소에 있으며, 해당 저장소를 클론한 다음 uv pip install . 명령을 실행한 뒤, 다음으로 vllm serve--trust-remote-code를 사용하여 커스텀 채팅 템플릿으로 모델을 서빙합니다. SGLang 경로는 --tool-call-parser spark25--context-length 1048576로 실행되는 사전 빌드 Docker 이미지입니다. — 실행 명령에 포함된 전체 백만 토큰 창으로, 실제 하드웨어에서 컨텍스트 지원 주장을 확인하는 가장 빠른 방법입니다.

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

vLLM 및 SGLang 외에도, 이 모델은 llama.cpp 포크, MLX(Apple silicon 및 Linux CPU), Ollama 및 LM Studio에서 GGUF를 통해 실행되며, LLaMA-Factory 포크를 통해 파인튜닝을 지원합니다. 하드웨어 지원이 또 다른 핵심 포인트입니다: NVIDIA, Huawei, Hygon, HOUMO.AI — 그리고 Apple silicon — 이는 중국 연구소 모델이 Ascend, Hygon 및 국산 칩 배포 문서를 약속이 아닌 출시 당일부터 제공하는 사례가 드물기 때문에 중요합니다.

1M-토큰 온디바이스 모델이 무엇을 위한 것인가

컨텍스트 길이가 핵심 기능이며, 이는 특정 작업을 겨냥한다. 4B 모델에 네이티브 컨텍스트 100만 토큰을 탑재하면 전체 코드베이스나 방대한 문서 세트를 로컬에서 실행되는 모델에 로드할 수 있다는 뜻이다. RAG 파이프라인도, 청크 분할도 필요 없다. 공급업체가 자체 Loomy 오피스 도구를 기반으로 시연한 데모에서 4B 모델은 영업 스프레드시트를 집계하고 주요 지표와 추세를 추출한 다음 약 3,000단어 분량의 이중 언어 보고서를 생성하는 스크립트를 작성한다. 로봇 공학 측면이 나머지 절반이다. 두 크기 모두 로봇 탑재 및 엣지 인식·실행용으로 포지셔닝되어 제어, 대상 추적, 내비게이션을 다루는데, 이는 1초 안에 응답하는 1.7B 모델에게 그럴듯한 틈새 시장이다.

더 큰 전략: Spark-X2.5-293B

두 개의 소형 모델은 시작에 불과하다. SparkLLM은 9월 7일, 2,930억 개의 파라미터를 가진 베이스 모델인 Spark-X2.5-293B를 출시할 예정이라고 발표했다. 발표에 따르면 이 모델은 업그레이드된 코딩 및 에이전트 기능을 갖췄다. X2.5 소형 모델들은 사실상 2계층 구조에서 온디바이스(디바이스 내장) 부분을 담당하며, 대형 모델이 이 제품군의 성능 상한선을 결정한다. 4B와 1.7B만을 이번 출시의 전부로 보는 것은 나아갈 방향을 놓치는 것이다.

사용해 보는 방법과 주의할 점

API는 iFlytek의 Xingchen MaaS 플랫폼에서 공개되어 있으며, 제한된 기간 동안 무료입니다. 가중치는 Hugging Face, ModelScope 및 Ollama 라이브러리에 있습니다. 라우팅 측면에서 Spark-X2.5-4B는 너무 새로운 모델이라 아직 어떤 애그리게이터도 이를 서비스하지 않습니다. OrcaRouter는 현재 이 모델을 라우팅하지 않으며, 이 페이지의 어떤 내용도 OrcaRouter가 이 모델을 라우팅한다는 뜻으로 읽혀서는 안 됩니다. 그러나 라우팅 대상 제공업체가 이 모델을 추가하는 날, 그 경제성은 예측 가능한 방식으로 바뀝니다. OrcaRouter는 제공업체의 공시 가격을 0% 마크업으로 그대로 전달하므로 공급업체가 책정한 가격이 곧 지불 금액이며, 기존 API 키를 그대로 사용하면 됩니다. 그리고 자동 장애 조치 덕분에 출시 당일의 모델도 결코 프로덕션에 거는 도박이 될 필요가 없습니다. 이것이 이 블로그가 완전히 새로운 모델을 바라보는 기본적인 방식이며, 이 점을 분명히 말해 둘 가치가 있습니다.

네 가지가 이번 릴리스가 기억에 남을 순간이 될지, 아니면 그저 하나의 각주에 불과할지를 결정한다. 첫째, 독립 평가(Artificial Analysis 지수 등재, 아레나 순위, 재현된 τ²-bench 실행)가 공급업체가 제시한 표의 수치에 조금이라도 근접하는지이다. AIME에서 90.7점을 기록한 4B 모델은 큰 숫자이고, 출시일에 공개된 카드의 큰 숫자일수록 정확히 검증받게 된다. 둘째, 1M-토큰 컨텍스트가 출시용 실행 명령에서만이 아니라 실제 서빙 부하에서 하이브리드 어텐션 스택 위에서도 견디는지이다. 셋째, Ascend에서 훈련된 가중치가 현장의 NVIDIA 하드웨어에서 제대로 동작하는지이다. 넷째, Spark-X2.5-293B가 9월 7일에 실제로 무엇을 보여 주는지이다. 그때까지 Spark-X2.5-4B와 Spark-X2.5-1.7B에 대한 정직한 요약은 이러하다: 유망하고, 개방적이며, 전적으로 검증되지 않았다. 오늘 아침에 출시된 모델로서는 그 상태가 올바른 것이다.