Главная карточка заголовка статьи 'Spark3 — LEAK REPORT' со значком 'UNVERIFIED', подзаголовок: 'Малые модели iFLYTEK Spark3-1.7B и Spark3-4B подключаются к vLLM — что говорится в PR и что остаётся неизвестным', три чипа с надписями 'Источник: vLLM PR #53373', '22 августа 2026' и 'XHToken / iFLYTEK', левая карточка с текстом 'Сигнал: открытый PR в vLLM, добавляющий нативную поддержку Spark3 для модели без публичных весов', и правая карточка с текстом 'Ожидается: 1.7B и 4B, нативный контекст на 1M токенов, 4-уровневый бюджет мышления'. Логотип OrcaRouter размещён в правом нижнем углу.
Guides & Insights

Утечка Spark3: малые модели iFLYTEK на 1.7B и 4B параметров интегрируются в vLLM

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

У Spark3 нет публичных весов, нет model card, нет анонса — и тем не менее на этой неделе в инференс-движок vLLM попал pull request, в котором две модели, Spark3-1.7B и Spark3-4B, описаны с поразительной детализацией. Pull request #53373 в репозитории vLLM, «[Model] Add Spark3 Model», добавляет нативную поддержку архитектуры Spark3: внимание со скользящим окном, управляемый бюджет на размышления с четырьмя уровнями, нативный контекст на миллион токенов для обоих размеров и идентификатор модели, указывающий на iFLYTEK. Ничто из этого не подтверждено вендором, и ничего не выпущено. Это материал в формате «что мы знаем на данный момент»: pull request реален, но всё, что приписывают этим моделям, остаётся непроверенным, пока iFLYTEK — или кто бы ни выпускал Spark3 — действительно не опубликует веса.

Утечка: pull request, который читается как спецификация

Сигнал — это открытый PR в vLLM, поданный пользователем GitHub по имени KnightYao (контрибьютор из Хэфэя, который указывает Университет науки и технологий Китая), и по состоянию на 23 августа 2026 года он не был объединён. Мейнтейнер vLLM запросил изменения 22 августа с пометкой «hold for discussions». PR ранний и оспариваемый, что нормально для такого рода интеграции — и он также необычно детализирован для PR в фреймворке о модели, которую никто за пределами лаборатории не может скачать.

Дифф затрагивает восемь файлов. Он добавляет реализацию Spark3ForCausalLM в исполнитель моделей vLLM, нативный Spark3Config, зарегистрированный в реестрах конфигураций и моделей vLLM, поддержку внимания со скользящим окном и полного внимания, а также гейтирование выходов внимания по головам, загрузку весов при параллелизме по тензорам и конвейеру и XML-парсер инструментов Spark3, позволяющий структурированно декодировать вызовы инструментов модели. Также добавляется строка в документацию vLLM по поддерживаемым моделям, указывающая контрольную точку как XHToken/Spark3-1.7B. В описании даже утверждается, что интеграция была протестирована: 500 одновременных запросов, 100% успешных, примерно 106 запросов в секунду и 13,5 тыс. выходных токенов в секунду на тестовом стенде автора. Эти цифры сообщены самим человеком, написавшим PR, и не являются независимым бенчмарком; их следует воспринимать именно так.

Почему iFLYTEK — очевидный, но неподтверждённый родитель

Пресс-релиз не называет вендора. Но идентификатор контрольной точки, который он регистрирует, XHToken/Spark3-1.7B, находится в организации XHToken на Hugging Face, и эта организация принадлежит iFLYTEK: на странице организации указано, что это компания, есть ссылка на opensource.iflytek.com, а сейчас там ноль публичных моделей и ноль публичных датасетов. «XH» — естественное сокращение от 星火 (Xinghuo, "Spark"), семейства моделей iFLYTEK. Добавьте местонахождение автора — Хэфэй, где находится штаб-квартира iFLYTEK, — и вывод будет настолько сильным, насколько это вообще возможно до подтверждения вендором.

Это соответствует недавней практике iFLYTEK. Выпущенная в феврале 2026 года модель Spark X2 была явно нацелена на образовательные, медицинские, автомобильные сценарии и сценарии использования агентов, а линейка встраиваемых моделей SparkAuto-EMM поставляется в компактных размерах от 0,5B до 7B. За два дня до появления этого пресс-релиза, на конференции по промежуточным результатам 21 августа, iFLYTEK заявила, что готовится новая флагманская модель общего назначения, полностью построенная на отечественных вычислительных мощностях, с поэтапной версией, запланированной на «конец августа», и полным запуском на Дне разработчика 1024 в октябре. Являются ли Spark3-1.7B и Spark3-4B частью этого поэтапного выпуска или отдельным направлением, ориентированным на периферийные вычисления, — открытый вопрос, на который пресс-релиз не отвечает.

A two-column infographic titled 'Spark3 — what we know / what we don't'. Left column 'What we know (from the PR)': 'Open vLLM PR #53373, review requested Aug 22, 2026', 'Two sizes: Spark3-1.7B and Spark3-4B', 'Native 1M-token context on both', 'Thinking budget: none / low / medium / high', '200+ languages; strong Gaokao and K-12 results', 'Model ID under iFLYTEK's XHToken HF org'. Right column 'What we don't': 'Release date — no weights, no announcement', 'Vendor confirmation — iFLYTEK has not commented', 'Independent benchmarks — PR figures are self-reported', 'Pricing and license — undisclosed', 'Whether it is the phased flagship due end of August', 'Whether the 1M context is native or rope-scaled'. Footer: 'All model claims unverified; only the pull request is confirmed.' The OrcaRouter logo is composited in the bottom-right corner.

Что, как говорят, представляют собой модели

Заявления PR, все непроверенные:

Два размера. Spark3-1.7B и Spark3-4B. Обе модели описываются как решения с приоритетом эффективности: они используют скользящее оконное внимание, а не плотную полновнимательную архитектуру.

Встроенный контекст на 1M токенов в обеих моделях. Это не обещание расширенного режима — в PR говорится, что контекст является родным для архитектуры, что позволило бы разместить миллион токенов на модели, достаточно компактной, чтобы работать на одном GPU.

Четырёхуровневый бюджет рассуждений. Рассуждения можно задать как none, low, medium или high — это переключаемый режим мышления, позволяющий приложению находить баланс между глубиной рассуждений, задержкой и стоимостью вызова.

200+ языков и сила в китайских экзаменах.В пресс-релизе заявляется о высоких результатах при ответах на вопросы K-12 и Гаокао — фирменная черта iFLYTEK, учитывая образовательный бизнес компании, — и о многоязычном охвате 200+ языков.

Ориентация на код и агентов. Заявлены сильная генерация кода, использование инструментов, многошаговое выполнение и рассуждения в длинном контексте для своего размера; это подкреплено XML-парсером инструментов, включённым в тот же PR.

Нативный контекст в 1M токенов на модели с 1.7B параметров — вот что стоит отметить.

Малые модели застряли именно на длине контекста. В текущем ландшафте моделей с открытыми весами модель 1.7B–4B обычно поставляется с нативным окном 32K–256K: небольшие чекпоинты Qwe​n3 имеют нативные 32K, расширяемые до 131K за счёт rope scaling, а даже улучшенное нативное окно 256K у малых вариантов Qwen3.5 — это лишь недавний шаг. Контекст в миллион токенов до сих пор был фичей больших моделей — чекпоинты G​LM с контекстом 1M насчитывают сотни миллиардов параметров. Если Spark3 действительно выдаст нативное окно 1M на модели 4B, это будет по-настоящему необычная спецификация, и именно архитектура внимания со скользящим окном позволяет сделать это дёшево по памяти. Но рядом с этим должна стоять оговорка: громкую цифру нативных 1M легко написать в пресс-релизе, но трудно сделать полезной на практике. Качество работы с длинным контекстом — может ли модель на самом деле найти и использовать факт на 700K токенов назад — это отдельный вопрос от того, сколько токенов помещается в окно, и независимой оценки пока не существует.

Управляемый бюджет мышления важен по той же причине. Четыре уровня рассуждений (нет / низкий / средний / высокий) представляют собой конструкцию с переключаемым мышлением в духе режима мышления вкл/выкл Qwe​n3, но более богатую: вместо бинарного выбора приложение может выбирать уровень для каждого запроса — без мышления для перевода, высокий для многошагового хода агента — и платить только за те рассуждения, которые ему нужны. Для агентной или пакетной нагрузки это именно тот регулятор, который превращает «способную, но дорогую» небольшую модель в модель с управляемыми затратами.

Рецепт пост-обучения соответствует паттерну 2026 года.

В пресс-релизе говорится, что Spark3 был пост-тренирован с использованием «Scaled Reinforcement Learning and MOPD». MOPD — Multi-Teacher On-Policy Distillation — это реальный и актуальный метод, описанный в статье на arXiv (2606.30406): обучаются параллельные доменно-специализированные RL-учителя, затем они дистиллируются обратно в одного студента на собственных роллаутах студента, минимизируя обратный KL на уровне токенов относительно подходящего учителя для каждого промпта. Это рецепт 2026 года, который позволяет одной модели унаследовать математические, кодовые и агентные навыки без конфликта между разными RL-запусками, и он публично упоминался в пост-тренировке таких моделей, как MiMo Flash V2, DeepSeek V4 и Nemotron 3 Ultra. То, что Spark3 ссылается на тот же рецепт, помещает его в это поколение — небольшие модели, передовые методы пост-тренировки. Это также означает, что у «сильных заявлений о кодинге и агентных способностях» есть правдоподобный механизм. Правдоподобие — не то же самое, что доказанность: заявления остаются заявленными вендором, пока не появятся веса и не будут проведены независимые оценки.

Что действительно неизвестно

Почти всё, на чём есть календарь:

Дата выпуска. Никаких весов на Hugging Face, никаких анонсов, никаких сроков. Организация XHToken сегодня пуста.

Подтверждение вендора. iFLYTEK ничего не сообщал о Spark3. Ссылка на организацию XHToken — веское доказательство, но не официальное заявление.

Является ли это поэтапным флагманом. Поэтапная версия нового флагмана iFLYTEK «конец августа» может быть именно этим — или не иметь к нему отношения. В пресс-релизе нет никаких дат.

Цены и лицензия. Ничего не раскрывается. Семейство Spark от iFLYTEK исторически в основном предоставлялось через API, а не в виде открытых весов, поэтому вопрос о том, являются ли Spark3-1.7B и Spark3-4B открытыми контрольными точками или внутренней целью для обслуживания, остаётся открытым.

Каждый бенчмарк.Показатели пропускной способности в PR — это авторский тест обслуживания, а не независимая оценка, и ни один лидерборд не оценивал модель, поскольку публично никакой модели не существует.

A screenshot of the XHToken Hugging Face organization page (captured August 23, 2026) showing the organization name 'XHToken', listed as a company with a link to opensource.iflytek.com, and the text 'None public yet' with zero public models and zero public datasets — confirming no Spark3 weights have been released.

Что посмотреть

Организация XHToken Hugging Face — это канал релизов, за которым стоит следить. Если модель реальна, её веса — или хотя бы карточка модели — должны появиться там, и переход организации от нуля до одного публичного репозитория — это самый важный сигнал. Несколько вещей, которые стоит проверить, как только это произойдёт:

Номер контекста.1M — это нативный контекст или rope-расширение с компромиссом по качеству? В PR сказано, что нативный; в карточках моделей это и решается.

API бюджета на размышления. То, как четыре уровня рассуждений предоставлены — как параметр сэмплинга, поле шаблона чата или отдельный вариант модели — определяет, насколько легко им на самом деле пользоваться.

Лицензия. Открытые веса сделали бы Spark3 первой суб-5B моделью с нативным контекстом в 1M, доступной для самостоятельного хостинга; запуск только через API сделал бы её другим продуктом.

Календарь анонсов iFLYTEK. Поэтапный флагман обещан к концу августа, а полный запуск — на октябрьском Дне разработчика 1024. Если Spark3 будет частью любого из этих событий, официальное описание раскроет то, что пресс-релиз оставляет открытым.

Будет ли PR объединён. Поддержка vLLM важна как сигнал качества и как инфраструктура: первая среда выполнения с нативной поддержкой Spark3 позволяет запустить модель в продакшене в день выхода весов.

Что разработчику следует делать прямо сейчас

Ничего. Нет модели, к которой можно обратиться, нет весов для скачивания, нет API-ключа для предоставления — любой инструмент, который сегодня заявляет, что обслуживает Spark3, обслуживает что-то другое. Что вы можете сделать, так это решить, как вы будете оценивать её в тот день, когда она появится, потому что это модель с очень проверяемым обещанием: модель на 1,7B или 4B, которая читает миллион токенов и рассуждает на четырёх уровнях глубины, — это либо действительно новая категория малых моделей, либо история на бумаге, и разницу можно измерить за один день на вашей собственной рабочей нагрузке.

Именно здесь маршрутизирующий уровень и оправдывает себя. В OrcaRouter модель — это не контракт, на который вы подписываетесь; это запись в каталоге, доступная через единый API, а цены по прейскуранту провайдера передаются без наценки — поэтому, когда в каталоге провайдера появляется новая модель, её реальная цена публикуется у нас в тот же день, и её опробование не требует ни второй интеграции, ни пересмотра условий. Для такой непроверенной модели, как Spark3, разумный подход — тот же, что и для любой многообещающей утечки: поместить её за автоматическим переключением на резерв в DSL маршрутизации, пропустить на неё долю трафика, а проверенную модель держать по другую сторону правила, чтобы плохой результат оценки, неожиданность с лицензией или разочаровывающий результат на длинном контексте были изменением маршрута, а не инцидентом. Один ключ, одна конечная точка, более 200 моделей — и когда Spark3-1.7B или Spark3-4B станут действительно запускаемыми, сквозная передача и автоматическое переключение будут применяться к ним так же, как к любой другой модели.

A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.

Честный вывод — это одно предложение, а не вердикт: пулл-реквест во фреймворке, написанный на этой неделе, утверждает, что у iFLYTEK есть две небольшие модели с нативным контекстом в миллион токенов и четырёхуровневым бюджетом мышления, и никаких весомых доказательств в поддержку этого не опубликовано. Следите за организацией XHToken, следите за обещанием iFLYTEK к концу августа, и когда веса станут реальными, прогоните их через правило маршрутизации с фейловером, прежде чем ставить на них продакшн-путь. Это весь сценарий действий при утечке — верь инфраструктуре, проверяй модель и держи выход дешёвым.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube