
Spark-X2.5-4B и Spark-X2.5-1.7B: компактные агентные модели для устройств с нативным контекстом 1M
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
Spark-X2.5-4B и Spark-X2.5-1.7B стали общедоступными 1 сентября 2026 года, когда SparkLLM — дочерняя компания XHToken (词元星火) в составе iFlytek — открыла исходный код обеих компактных моделей под лицензией Apache 2.0: веса, код и документация по развёртыванию появились на Hugging Face и GitHub в тот же день. Ключевая заявленная характеристика — нативное окно контекста на 1 000 000 токенов у моделей, достаточно компактных для запуска на устройстве; её подкрепляют заявленная поддержка более 200 языков и гибридный механизм внимания, который, по словам разработчика, рассчитан на агентные сценарии. Из репозиториев уже сегодня можно почерпнуть немало; что пока не подтверждено — всё то, что установить под силу только независимому тестированию: у модели, вышедшей несколько часов назад, ещё нет непредвзятых оценок. В семействе X2.5 ожидается и более крупный представитель — Spark-X2.5-293B, выход которого анонсирован на 7 сентября.
Что на самом деле показывают репозитории
Коллекция Hugging Face включает шесть репозиториев: дообученные на инструкциях Spark-X2.5-4B и Spark-X2.5-1.7B, их базовые чекпоинты и GGUF-конверсии обеих моделей. В карточке модели 4B описывается гибридная архитектура внимания — один слой полного внимания на каждые три слоя внимания со скользящим окном, — что как раз и нужно, когда маркетинговое число составляет 1M токенов, поскольку иначе полное внимание на миллионе токенов было бы квадратично дорогим. В карточке указано нативное окно контекста до 1M токенов, а также этап обучения на длинном контексте, который увеличил длину последовательности до 1M во время предварительного обучения.
• Архитектура — гибридное внимание, один слой полного внимания на каждые три слоя со скользящим окном; BF16 safetensors.
• Контекст — нативная поддержка до 1 000 000 токенов; обучение на длинном контексте проводилось на последовательностях длиной до 1 млн.
• Языки — более 200, согласно карточке модели (версия 1.7B заявляет то же самое).
• Предобучение — это примерно 20 триллионов токенов веб-страниц, книг, академических публикаций, кода и энциклопедических материалов; обучение выполнялось сквозным образом на кластерах Huawei Ascend.
• Пост-обучение — SFT, за которым следует крупномасштабное RL для рассуждений, программирования, агентного поведения и следования инструкциям, при этом доменные политики консолидируются с помощью метода, который в статье называется MOPD.
• Лицензия — Apache 2.0 для обеих версий, без ограничений по выручке или региону, которые несколько других китайских лабораторий добавляют к своим открытым релизам.

Числа агентов — и насколько им можно доверять
Модельная карточка публикует полную таблицу бенчмарков для агентов и рассуждений, и она целиком основана на данных вендора и никем не воспроизведена — пометьте её соответствующим образом, потому что для четырёхмиллиардной модели, вышедшей день назад, интересный вопрос состоит в том, переживёт ли хоть что-то из этих результатов контакт с независимыми оценками. В собственной таблице вендора Spark-X2.5-4B набирает 65,1 на BFCL-V4 (вызов функций), 75,1 на τ²-bench (долгосрочные агентные задачи), 40,9 на BrowseComp, 44,4 на SWE-Bench Pro, 90,7 на AIME 2026, 81,2 на HMMT February 2026, 74,2 на IMO-AnswerBench и 67,4 на GPQA. Версия 1.7B получает свой момент на тесте для умного дома: 90,3% сквозной точности выполнения команд при средней задержке 0,85 секунды на наборе Domux. Вендор также утверждает, что 4B «соперничает с облачными моделями в 2–3 раза большего размера» в реализации алгоритмов, завершении и генерации кода — это утверждение одновременно является самым полезным предложением в релизе и тем, которое больше всего нуждается в нейтральной проверке.

Что структурно интереснее любого отдельного числа, так это то, что релиз с самого начала нацелен на агентов. В карточке модели перечислены следующие возможности: интеграция с харнессами Codex, Claude Code, OpenClaw и Hermes, поддержка вызова инструментов с выделенным парсером в SGLang, а также рассуждения, включённые по умолчанию (рантайм-флаг, enable_thinking, отключает их). Иными словами, вендор позиционирует 4B как модель, использующую инструменты, а не как чат-бота; это настоящая ставка: маленькие агентные модели — вот куда на самом деле движется on-device-рынок.
Экосистема Day-0 и история vLLM
Spark-X2.5-4B и Spark-X2.5-1.7B поддерживаются в vLLM с первого дня через внешний универсальный плагин, а не через слияние с апстримом. Интеграция находится в репозитории XHToken/Spark-plugin: вы клонируете его и выполняете uv pip install ., затем запускаете модель с помощью vllm serve и --trust-remote-code с пользовательским шаблоном чата. Вариант SGLang — это готовый Docker-образ, запускаемый с параметрами --tool-call-parser spark25 и --context-length 1048576 — это полноценное контекстное окно на миллион токенов в команде запуска, что является самым быстрым способом проверить заявленную поддержку контекста на реальном оборудовании.

Помимо vLLM и SGLang, модель работает на форке llama.cpp, MLX (Apple silicon и Linux CPU), Ollama и LM Studio через GGUF, а тонкая настройка поддерживается через форк LLaMA-Factory. Аппаратная поддержка — другая главная новость: NVIDIA, Huawei, Hygon и HOUMO.AI — плюс Apple silicon, — что важно, поскольку редкая модель из китайской лаборатории поставляется с документацией по развёртыванию на Ascend, Hygon и отечественных чипах с первого дня, а не как обещание.
Для чего предназначена модель на устройстве с 1M-токеновым контекстом
Длина контекста — это и есть ключевая особенность, и она указывает на конкретные задачи. Миллион токенов нативного контекста на модели с 4B параметрами означает, что целая кодовая база или большой набор документов загружаются в модель, которая работает локально, — без RAG-пайплайна и без разбиения на чанки. Демонстрация самого вендора, построенная на его офисном инструментарии Loomy, показывает, как модель с 4B пишет скрипт для агрегации таблицы продаж, извлекает ключевые метрики и тренды и генерирует двуязычный отчёт объёмом около 3000 слов. Робототехнический аспект — это вторая половина: обе версии позиционируются для применения непосредственно на роботах и в периферийном восприятии и исполнении, покрывая управление, отслеживание целей и навигацию, — что является реалистичной нишей для модели с 1.7B, которая отвечает менее чем за секунду.
Более крупный ход: Spark-X2.5-293B
Две маленькие модели — это лишь первый ход. 7 сентября SparkLLM объявит о выпуске Spark-X2.5-293B — базовой модели с 293 миллиардами параметров, которая, согласно анонсу, получила улучшенные возможности по написанию кода и работе с агентами. Малые модели X2.5 — это, по сути, локальная часть двухуровневой истории; именно большая модель задаёт потолок семейства. Воспринимать 4B и 1.7B как весь релиз — значит упускать направление движения.
Как это попробовать и на что обратить внимание
API уже работает на платформе Xingchen MaaS от iFlytek и в течение ограниченного времени бесплатен; веса модели размещены на Hugging Face, ModelScope и в библиотеке Ollama. Что касается маршрутизации, модель Spark-X2.5-4B слишком новая, чтобы какой-либо агрегатор уже начал её обслуживать: OrcaRouter сегодня её не маршрутизирует, и ничто на этой странице не следует понимать так, будто OrcaRouter это делает. Но как только маршрутизируемый провайдер добавит её, экономика изменится предсказуемым образом: OrcaRouter передаёт цену провайдера без наценки, так что вы платите ровно столько, сколько назначит вендор, используя тот же API-ключ, что уже используете; при этом автоматическое переключение гарантирует, что только что вышедшая модель никогда не станет ставкой в продакшене. Именно так этот блог обычно смотрит на совершенно новую модель, и это стоит сказать прямо.
Четыре вещи определят, станет ли этот релиз событием или примечанием в сноске. Первое — насколько независимые оценки — запись в индексе Artificial Analysis, место в арене, воспроизведённый прогон τ²-bench — приблизятся к цифрам вендора; 4B с результатом 90.7 на AIME — это большое число, а большие числа из карточки дня релиза проверяют в первую очередь. Второе — выдержит ли контекст на 1M токенов в стеке с гибридным вниманием при реальных нагрузках, а не только в командной строке запуска. Третье — будут ли веса, обученные на Ascend, корректно работать на оборудовании NVIDIA в полевых условиях. Четвёртое — что Spark-X2.5-293B реально покажет 7 сентября. До этого момента честное резюме по Spark-X2.5-4B и Spark-X2.5-1.7B таково: многообещающе, открыто и совершенно непроверенно — что для модели, выпущенной сегодня утром, является корректным статусом.
