
Утечка Spark3: малые модели iFLYTEK на 1.7B и 4B параметров интегрируются в vLLM
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
У Spark3 нет публичных весов, нет model card, нет анонса — и тем не менее на этой неделе в инференс-движок vLLM попал pull request, в котором две модели, Spark3-1.7B и Spark3-4B, описаны с поразительной детализацией. Pull request #53373 в репозитории vLLM, «[Model] Add Spark3 Model», добавляет нативную поддержку архитектуры Spark3: внимание со скользящим окном, управляемый бюджет на размышления с четырьмя уровнями, нативный контекст на миллион токенов для обоих размеров и идентификатор модели, указывающий на iFLYTEK. Ничто из этого не подтверждено вендором, и ничего не выпущено. Это материал в формате «что мы знаем на данный момент»: pull request реален, но всё, что приписывают этим моделям, остаётся непроверенным, пока iFLYTEK — или кто бы ни выпускал Spark3 — действительно не опубликует веса.
Утечка: pull request, который читается как спецификация
Сигнал — это открытый PR в vLLM, поданный пользователем GitHub по имени KnightYao (контрибьютор из Хэфэя, который указывает Университет науки и технологий Китая), и по состоянию на 23 августа 2026 года он не был объединён. Мейнтейнер vLLM запросил изменения 22 августа с пометкой «hold for discussions». PR ранний и оспариваемый, что нормально для такого рода интеграции — и он также необычно детализирован для PR в фреймворке о модели, которую никто за пределами лаборатории не может скачать.
Дифф затрагивает восемь файлов. Он добавляет реализацию Spark3ForCausalLM в исполнитель моделей vLLM, нативный Spark3Config, зарегистрированный в реестрах конфигураций и моделей vLLM, поддержку внимания со скользящим окном и полного внимания, а также гейтирование выходов внимания по головам, загрузку весов при параллелизме по тензорам и конвейеру и XML-парсер инструментов Spark3, позволяющий структурированно декодировать вызовы инструментов модели. Также добавляется строка в документацию vLLM по поддерживаемым моделям, указывающая контрольную точку как XHToken/Spark3-1.7B. В описании даже утверждается, что интеграция была протестирована: 500 одновременных запросов, 100% успешных, примерно 106 запросов в секунду и 13,5 тыс. выходных токенов в секунду на тестовом стенде автора. Эти цифры сообщены самим человеком, написавшим PR, и не являются независимым бенчмарком; их следует воспринимать именно так.
Почему iFLYTEK — очевидный, но неподтверждённый родитель
Пресс-релиз не называет вендора. Но идентификатор контрольной точки, который он регистрирует, XHToken/Spark3-1.7B, находится в организации XHToken на Hugging Face, и эта организация принадлежит iFLYTEK: на странице организации указано, что это компания, есть ссылка на opensource.iflytek.com, а сейчас там ноль публичных моделей и ноль публичных датасетов. «XH» — естественное сокращение от 星火 (Xinghuo, "Spark"), семейства моделей iFLYTEK. Добавьте местонахождение автора — Хэфэй, где находится штаб-квартира iFLYTEK, — и вывод будет настолько сильным, насколько это вообще возможно до подтверждения вендором.
Это соответствует недавней практике iFLYTEK. Выпущенная в феврале 2026 года модель Spark X2 была явно нацелена на образовательные, медицинские, автомобильные сценарии и сценарии использования агентов, а линейка встраиваемых моделей SparkAuto-EMM поставляется в компактных размерах от 0,5B до 7B. За два дня до появления этого пресс-релиза, на конференции по промежуточным результатам 21 августа, iFLYTEK заявила, что готовится новая флагманская модель общего назначения, полностью построенная на отечественных вычислительных мощностях, с поэтапной версией, запланированной на «конец августа», и полным запуском на Дне разработчика 1024 в октябре. Являются ли Spark3-1.7B и Spark3-4B частью этого поэтапного выпуска или отдельным направлением, ориентированным на периферийные вычисления, — открытый вопрос, на который пресс-релиз не отвечает.

Что, как говорят, представляют собой модели
Заявления PR, все непроверенные:
• Два размера. Spark3-1.7B и Spark3-4B. Обе модели описываются как решения с приоритетом эффективности: они используют скользящее оконное внимание, а не плотную полновнимательную архитектуру.
• Встроенный контекст на 1M токенов в обеих моделях. Это не обещание расширенного режима — в PR говорится, что контекст является родным для архитектуры, что позволило бы разместить миллион токенов на модели, достаточно компактной, чтобы работать на одном GPU.
• Четырёхуровневый бюджет рассуждений. Рассуждения можно задать как none, low, medium или high — это переключаемый режим мышления, позволяющий приложению находить баланс между глубиной рассуждений, задержкой и стоимостью вызова.
• 200+ языков и сила в китайских экзаменах.В пресс-релизе заявляется о высоких результатах при ответах на вопросы K-12 и Гаокао — фирменная черта iFLYTEK, учитывая образовательный бизнес компании, — и о многоязычном охвате 200+ языков.
• Ориентация на код и агентов. Заявлены сильная генерация кода, использование инструментов, многошаговое выполнение и рассуждения в длинном контексте для своего размера; это подкреплено XML-парсером инструментов, включённым в тот же PR.
Нативный контекст в 1M токенов на модели с 1.7B параметров — вот что стоит отметить.
Малые модели застряли именно на длине контекста. В текущем ландшафте моделей с открытыми весами модель 1.7B–4B обычно поставляется с нативным окном 32K–256K: небольшие чекпоинты Qwen3 имеют нативные 32K, расширяемые до 131K за счёт rope scaling, а даже улучшенное нативное окно 256K у малых вариантов Qwen3.5 — это лишь недавний шаг. Контекст в миллион токенов до сих пор был фичей больших моделей — чекпоинты GLM с контекстом 1M насчитывают сотни миллиардов параметров. Если Spark3 действительно выдаст нативное окно 1M на модели 4B, это будет по-настоящему необычная спецификация, и именно архитектура внимания со скользящим окном позволяет сделать это дёшево по памяти. Но рядом с этим должна стоять оговорка: громкую цифру нативных 1M легко написать в пресс-релизе, но трудно сделать полезной на практике. Качество работы с длинным контекстом — может ли модель на самом деле найти и использовать факт на 700K токенов назад — это отдельный вопрос от того, сколько токенов помещается в окно, и независимой оценки пока не существует.
Управляемый бюджет мышления важен по той же причине. Четыре уровня рассуждений (нет / низкий / средний / высокий) представляют собой конструкцию с переключаемым мышлением в духе режима мышления вкл/выкл Qwen3, но более богатую: вместо бинарного выбора приложение может выбирать уровень для каждого запроса — без мышления для перевода, высокий для многошагового хода агента — и платить только за те рассуждения, которые ему нужны. Для агентной или пакетной нагрузки это именно тот регулятор, который превращает «способную, но дорогую» небольшую модель в модель с управляемыми затратами.
Рецепт пост-обучения соответствует паттерну 2026 года.
В пресс-релизе говорится, что Spark3 был пост-тренирован с использованием «Scaled Reinforcement Learning and MOPD». MOPD — Multi-Teacher On-Policy Distillation — это реальный и актуальный метод, описанный в статье на arXiv (2606.30406): обучаются параллельные доменно-специализированные RL-учителя, затем они дистиллируются обратно в одного студента на собственных роллаутах студента, минимизируя обратный KL на уровне токенов относительно подходящего учителя для каждого промпта. Это рецепт 2026 года, который позволяет одной модели унаследовать математические, кодовые и агентные навыки без конфликта между разными RL-запусками, и он публично упоминался в пост-тренировке таких моделей, как MiMo Flash V2, DeepSeek V4 и Nemotron 3 Ultra. То, что Spark3 ссылается на тот же рецепт, помещает его в это поколение — небольшие модели, передовые методы пост-тренировки. Это также означает, что у «сильных заявлений о кодинге и агентных способностях» есть правдоподобный механизм. Правдоподобие — не то же самое, что доказанность: заявления остаются заявленными вендором, пока не появятся веса и не будут проведены независимые оценки.
Что действительно неизвестно
Почти всё, на чём есть календарь:
• Дата выпуска. Никаких весов на Hugging Face, никаких анонсов, никаких сроков. Организация XHToken сегодня пуста.
• Подтверждение вендора. iFLYTEK ничего не сообщал о Spark3. Ссылка на организацию XHToken — веское доказательство, но не официальное заявление.
• Является ли это поэтапным флагманом. Поэтапная версия нового флагмана iFLYTEK «конец августа» может быть именно этим — или не иметь к нему отношения. В пресс-релизе нет никаких дат.
• Цены и лицензия. Ничего не раскрывается. Семейство Spark от iFLYTEK исторически в основном предоставлялось через API, а не в виде открытых весов, поэтому вопрос о том, являются ли Spark3-1.7B и Spark3-4B открытыми контрольными точками или внутренней целью для обслуживания, остаётся открытым.
• Каждый бенчмарк.Показатели пропускной способности в PR — это авторский тест обслуживания, а не независимая оценка, и ни один лидерборд не оценивал модель, поскольку публично никакой модели не существует.

Что посмотреть
Организация XHToken Hugging Face — это канал релизов, за которым стоит следить. Если модель реальна, её веса — или хотя бы карточка модели — должны появиться там, и переход организации от нуля до одного публичного репозитория — это самый важный сигнал. Несколько вещей, которые стоит проверить, как только это произойдёт:
• Номер контекста.1M — это нативный контекст или rope-расширение с компромиссом по качеству? В PR сказано, что нативный; в карточках моделей это и решается.
• API бюджета на размышления. То, как четыре уровня рассуждений предоставлены — как параметр сэмплинга, поле шаблона чата или отдельный вариант модели — определяет, насколько легко им на самом деле пользоваться.
• Лицензия. Открытые веса сделали бы Spark3 первой суб-5B моделью с нативным контекстом в 1M, доступной для самостоятельного хостинга; запуск только через API сделал бы её другим продуктом.
• Календарь анонсов iFLYTEK. Поэтапный флагман обещан к концу августа, а полный запуск — на октябрьском Дне разработчика 1024. Если Spark3 будет частью любого из этих событий, официальное описание раскроет то, что пресс-релиз оставляет открытым.
• Будет ли PR объединён. Поддержка vLLM важна как сигнал качества и как инфраструктура: первая среда выполнения с нативной поддержкой Spark3 позволяет запустить модель в продакшене в день выхода весов.
Что разработчику следует делать прямо сейчас
Ничего. Нет модели, к которой можно обратиться, нет весов для скачивания, нет API-ключа для предоставления — любой инструмент, который сегодня заявляет, что обслуживает Spark3, обслуживает что-то другое. Что вы можете сделать, так это решить, как вы будете оценивать её в тот день, когда она появится, потому что это модель с очень проверяемым обещанием: модель на 1,7B или 4B, которая читает миллион токенов и рассуждает на четырёх уровнях глубины, — это либо действительно новая категория малых моделей, либо история на бумаге, и разницу можно измерить за один день на вашей собственной рабочей нагрузке.
Именно здесь маршрутизирующий уровень и оправдывает себя. В OrcaRouter модель — это не контракт, на который вы подписываетесь; это запись в каталоге, доступная через единый API, а цены по прейскуранту провайдера передаются без наценки — поэтому, когда в каталоге провайдера появляется новая модель, её реальная цена публикуется у нас в тот же день, и её опробование не требует ни второй интеграции, ни пересмотра условий. Для такой непроверенной модели, как Spark3, разумный подход — тот же, что и для любой многообещающей утечки: поместить её за автоматическим переключением на резерв в DSL маршрутизации, пропустить на неё долю трафика, а проверенную модель держать по другую сторону правила, чтобы плохой результат оценки, неожиданность с лицензией или разочаровывающий результат на длинном контексте были изменением маршрута, а не инцидентом. Один ключ, одна конечная точка, более 200 моделей — и когда Spark3-1.7B или Spark3-4B станут действительно запускаемыми, сквозная передача и автоматическое переключение будут применяться к ним так же, как к любой другой модели.
![A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.](https://cms.orcarouter.ai/api/media/file/4-438.png)
Честный вывод — это одно предложение, а не вердикт: пулл-реквест во фреймворке, написанный на этой неделе, утверждает, что у iFLYTEK есть две небольшие модели с нативным контекстом в миллион токенов и четырёхуровневым бюджетом мышления, и никаких весомых доказательств в поддержку этого не опубликовано. Следите за организацией XHToken, следите за обещанием iFLYTEK к концу августа, и когда веса станут реальными, прогоните их через правило маршрутизации с фейловером, прежде чем ставить на них продакшн-путь. Это весь сценарий действий при утечке — верь инфраструктуре, проверяй модель и держи выход дешёвым.
