
RWKV-7 (Goose): Внутри пул-реквеста, который наконец загрузит его в Transformers
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
Самой скачиваемой моделью RWKV на Hugging Face в прошлом месяце была не RWKV-7 (Goose) — архитектура, которую проект выпускает с марта 2025 года, — и не RWKV7-G1, серия моделей для рассуждений, обученная на её основе. Это была RWKV/rwkv-4-169m-pile: чекпойнт RWKV-4 со 169 миллионами параметров от мая 2023 года, с 8 824 загрузками за 30 дней до 5 августа 2026 года, против 215 у релиза RWKV-7 Goose World-3 на 1.5B и 316 у версии на 2.9B. Модель 2023 года не лучше. Просто она загружается обычным вызовом from_pretrained без установки чего-либо ещё.
4 августа 2026 года участник по имени Hakureirm открыл pull request #47780 в huggingface/transformers под названием «Add RWKV-7 (Goose)». По состоянию на 5 августа он открыт, не рецензирован и не слит; это вторая попытка — более раннее предложение #46984 было отклонено. Ничего не влито, и эту статью не следует читать как анонс релиза. Но дифф доступен публично, и он касается самой скучной и в то же время самой значимой вещи, которая стоит между самой долгоживущей линейкой LLM без механизма внимания и стеками, которые большинство команд действительно используют: загрузчика.
Далее разделяются три вида утверждений, потому что освещение RWKV обычно смешивает их вместе. Есть то, что достоверно присутствует в pull request и на Hub, — и вы можете проверить это сами. Есть то, что проект RWKV сообщает о своих моделях по собственным оценкам. И есть большой набор вопросов, на которые никто публично не ответил, — именно там сосредоточена большая часть интересных рисков.
Что на самом деле в пул-реквесте?

Механические факты, прочитанные со страницы PR и GitHub API 5 августа 2026 года:
• Объём — три коммита, изменено 12 файлов, добавлено 4 423 строки и удалено ноль, из ветки add-rwkv7-upstream в huggingface:main. Помечено как «New model». Нет исполнителя, нет вехи.
• Что добавляет — RWKV-7 в виде двух публичных классов, Rwkv7Model и Rwkv7ForCausalLM, вместе с Rwkv7Cache, построенным на LinearAttentionLayer библиотеки. Тип данных состояния WKV можно настраивать независимо от типа данных модели, что важно, поскольку рекуррентное состояние — это то место, где в этом семействе накапливается числовой дрейф.
• Как это работает — портативный PyTorch без зависимостей от сторонних сред выполнения. Префилл использует блочно-параллельную форму рекуррентности; декодирование выполняется последовательно, по одному токену за раз. Имена параметров следуют эталонной реализации RWKV из апстрима, а не переименованы, чтобы выглядеть по-трансформерному.
• Тестовый подход — помимо стандартных миксинов модели, интеграционный тест, совпадающий с собственным рантаймом BlinkDL токен-в-токен, плюс эталонная реализация на NumPy, не имеющая общего кода с файлом моделирования. Бот сводки CI репозитория сообщает, что последний запуск прошёл успешно: 16 заданий, 179 151 тест, ноль отказов, 16 часов 9 минут вычислений.
• Положение дел — ревью было запрошено у ArthurZucker и Rocketknight1; на странице указано, что для слияния требуется как минимум одно одобряющее ревью, и такого ревью пока нет. На момент чтения API GitHub по-прежнему описывал состояние слияния как «unstable», а бот для мейнтейнеров попросил прогнать медленные наборы тестов (auto и rwkv7) перед слиянием. Иными словами: зелёный на быстром CI, но ещё не одобрен человеком.
Самая интересная часть описания — это признание. Предыдущая попытка, #46984, была отклонена, потому что опубликованные чекпойнты RWKV-7 не соответствовали соглашениям Transformers, и сам автор формулирует это так: «это возражение было верным». Проблема, изложенная в PR, заключается в том, что веса RWKV-7 на Hub представлены в двух формах, непригодных для использования библиотекой:
• Репозитории PTH — это сырые .pth-файлы, без safetensors. Библиотечная реализация не может их загрузить, а pickle-файлы PyTorch — это именно то, что отклонит проверка безопасности в крупной компании.
• Репозитории HF — они действительно содержат model.safetensors, но в каждом также есть modeling_rwkv7.py и auto_map, поэтому загрузка любого из них требует trust_remote_code. Это удалённое выполнение кода как условие инференса, и именно поэтому многие корпоративные чек-листы на этом останавливаются.
Итак, PR выполняет две задачи одновременно. Он добавляет файл модели и указывает на новый набор конвертаций, выполненных непосредственно из канонических релизов BlinkDL .pth, которые следуют стандартной структуре — только safetensors, без pickle, без удалённого кода, обычный config.json с архитектурами и model_type — от 0.1B до 7.2B. Наименьшая модель, Hakureirm/rwkv7-168m-pile-hf, имеет все 399 тензоров, проверенных как побитово идентичные исходному .pth, а не выборочно. Этот чекпоинт является моделью Pile, поэтому его токенизатор — обычный быстрый токенизатор GPT-NeoX-20B, а не словарь RWKV World — по той же причине, по которой существующая страница RWKV в библиотеке также описывает чекпоинт Pile.
Почему чекпоинт 2023 года скачивается чаще, чем текущая архитектура

Transformers находится на версии 5.14.1, выпущенной 16 июля 2026 года. Поиск в документации по запросу RWKV даёт ровно одну страницу модели, описывающую «модель RWKV (версия 4)», добавленную годы назад, с примером RWKV/rwkv-4-169m-pile и словарём по умолчанию в 50 277 токенов. Страниц для RWKV-5, RWKV-6 или RWKV-7 нет. С момента написания поддержки RWKV в библиотеке вышло три поколения архитектур, и ни одно из них в ней не представлено.
Цифры загрузок показывают, что сделала экосистема: она обошла библиотеку стороной. Если отсортировать по загрузкам за последние 30 дней, топ-репозитории RWKV-7 — это сырые .pth-релизы BlinkDL (rwkv7-g1 с 8 288, rwkv-7-world с 4 489) и плотный слой сообщественных GGUF-квантизаций модели 13.3B G1 — несколько разных загрузчиков, каждый из которых приносит от одной до трёх тысяч загрузок в месяц. Официальные зеркала в формате transformers находятся на два порядка ниже сырых весов. Зеркало flash-linear-attention для 2.9B G1 набирает 1 843.
У этой закономерности есть простое объяснение. llama.cpp вмержил поддержку RWKV v7 17 марта 2025 года — ядро GGML_OP_RWKV_WKV7 с бэкендами CPU, CUDA, SYCL, Vulkan и Metal — примерно через день после публикации статьи. Если вы хотели запустить RWKV-7 на своей машине, быстрый путь лежал через GGUF, и так продолжалось шестнадцать месяцев. Пути, которого не существовало, — это тот, на который рассчитывают каждый скрипт дообучения, каждый адаптер PEFT, каждая оценочная обвязка и каждая внутренняя обёртка для сервинга: AutoModelForCausalLM.from_pretrained, без флагов.
Что такое RWKV-7 (Goose) на самом деле
RWKV-7 — это рекуррентная нейронная сеть, а не трансформер с более дешёвым ядром внимания, и это название постоянно сбивает людей с толку. Она переносит состояние фиксированного размера по последовательности, а не растущий кэш прошлых ключей и значений. Конкретно, по сравнению со стандартной моделью внимания:
• Память по мере роста контекста — KV-кэш трансформера растёт линейно с числом обрабатываемых токенов; RWKV-7 сохраняет состояние, размер которого задаётся архитектурой, а не диалогом. В этом и заключается весь аргумент об эффективности.
• Стоимость за токен — внимание стоит дороже за токен по мере удлинения контекста; стоимость инференса RWKV-7 за токен постоянна, поэтому она постоянно фигурирует в предложениях для периферийных вычислений и постоянно работающих потоков.
• Форма обучения — в отличие от классической RNN, рекуррентные вычисления распараллеливаются в пределах чанка, поэтому предобучение не вырождается в последовательный проход. Именно это реализует чанк-параллельный путь prefill в PR.
• Потолок контекста — кэша нет, переполнять нечего, поэтому проект заявляет о практически безграничном контексте. Но фиксированное состояние не способно удерживать безграничную детализацию, и это реальное ограничение, а не сноска.
Архитектурное утверждение в статье, опубликованной 18 марта 2025 года Бо Пэном, Юем Чжаном, Сонлинем Яном и Жуйчуном Чжаном в рамках проекта RWKV при фонде LF AI & Data Foundation, заключается в обобщённом правиле дельты с векторнозначным гейтингом, скоростями обучения в контексте и ослабленным правилом замены значений, а также в упрощённом MLP (матрица гейтинга удалена, скрытая размерность расширена для компенсации). Теоретический результат, связанный с этим, — более провокационная половина: RWKV-7 способен выполнять отслеживание состояния и распознавать все регулярные языки, оставаясь при этом параллелизуемым при обучении, что, по утверждению авторов, превосходит возможности трансформеров при стандартных гипотезах сложности.
Всё распространяется по лицензии Apache 2.0. {{1}}Семейство, которое можно скачать, выпускается в вариантах{{/1}} 0.1B (12 слоёв, ширина 768), 0.4B (24 / 1024), 1.5B (24 / 2048), 2.9B (32 / 2560), 7.2B (32 / 4096) и 13.3B (61 слой, ширина 4096), {{2}}все со словарём World на 65 536 токенов и размером головы 64{{/2}}. {{3}}Базовая серия World обучалась на многоязычном корпусе из 3,1 триллиона токенов{{/3}}; серия G1 «GooseOne» {{4}}продолжает это обучение на World v3.5 — расширенной смеси из 5,16 триллиона токенов с большим объёмом художественной литературы, веб-текстов, математики, кода и данных для рассуждений{{/4}}. {{5}}Чекпойнты G1 добавляют режим рассуждений с think-тегами, JSON-вызовы функций и fill-in-the-middle начиная с G1c{{/5}}. {{6}}Названия действительно неуклюжие{{/6}}: {{7}}G0 означает меньше одной эпохи{{/7}}, {{8}}G1 означает больше одной{{/8}}, а {{9}}буквенные суффиксы обозначают версии данных{{/9}}, {{10}}причём более поздние буквы соответствуют более качественным данным{{/10}}.
Числа и то, кому они принадлежат
Вот честное состояние доказательной базы. Главное заявление о бенчмарках — что модель 2.9B установила новый уровень качества (state of the art) среди моделей 3B на многоязычных задачах и сравнялась с англоязычным state of the art среди 3B при значительно меньшем количестве обучающих токенов — принадлежит самой статье, опубликованной в марте 2025 года и оценённой на моделях 3B того периода. Она прошла рецензирование на OpenReview, что является более строгой проверкой, чем получает корпоративный блог-пост, и тем не менее это по-прежнему самостоятельно заявленный результат на пятнадцатимесячном наборе для сравнения.
Другой публичный показатель проекта, UncheatableEval, интереснее, чем строка в лидерборде, и почти не получает освещения. Вместо оценки тестов с множественным выбором, которые просачиваются в обучающие наборы, он измеряет степень сжатия на данных, которых не существовало при обучении модели: новые статьи arXiv, свежие репозитории GitHub, недавние новости. Такая схема сильно затрудняет загрязнение данных, и RWKV сообщает о конкурентоспособности с трансформерами того же размера на этом тесте. Тем не менее это по-прежнему оценка, которую проект проводит сам для себя.
Чего, насколько нам удалось найти, не существует — так это независимой сторонней индексной оценки для любого чекпойнта RWKV-7: ни один нейтральный агрегатор не прогонял 7.2B или 13.3B через тот харнесс, который он применяет к фронтирным моделям. Поэтому сравнения, которые вы можете видеть, с моделями вроде DeepSeek V4 Flash или Qwen3.8-Max — это категориальные ошибки сразу в двух смыслах: никто не запускал RWKV-7 на той же оценочной процедуре, и плотная RNN на 13.3B не конкурирует за ту же работу, что и фронтирная система. Защитимое утверждение уже и полезнее: от 1.5B до 13.3B, при постоянной памяти, примерно на двенадцати языках, с пермиссивными весами.
Запуск RWKV-7 сегодня: чем это вам обойдётся

Страница модели RWKV/RWKV7-Goose-World3-1.5B-HF на Hub — наглядный пример текущих сложностей. Это модель с 1,52 млрд параметров в формате BF16, с токенизатором RWKV World, под лицензией Apache 2.0, помеченная тегом custom_code и поддерживающая английский, китайский, японский, корейский, французский, арабский, испанский и португальский языки. В её инструкциях сказано установить flash-linear-attention и свежую версию transformers перед загрузкой. А на боковой панели, где для размещённой модели показывались бы провайдеры, прямо написано: эта модель не развёрнута ни одним из инференс-провайдеров.
Итак, сегодня все ваши варианты — самообслуживание:
• flash-linear-attention плюс trust_remote_code — ближе всего к обычному использованию Hub, но вы выполняете код из репозитория и подтягиваете ядра Triton, что ограничивает вас в плане оборудования и всего, что проходит проверку безопасности.
• GGUF via llama.cpp — наиболее поддерживаемый на практике путь, в том числе для 13.3B, и тот, который, судя по цифрам загрузок, люди на самом деле выбирают. Отлично подходит для локального инференса, но не для обучения или тонкой настройки.
• Собственный рантайм проекта — это pip-пакет rwkv и эталонный репозиторий, наиболее близкие к каноническому варианту и наиболее далёкие от инструментов, которые уже есть у вашей команды.
Ни одна из них не является API, который можно вызвать, и стоит прямо сказать о последствиях: RWKV-7 нет на OrcaRouter, потому что мы не можем найти размещенный эндпоинт этой модели нигде. Если вам нужен RWKV-7, вы запускаете RWKV-7. Что мы можем честно сказать, так это то, что это означает для остального стека. Оценка непроверенной архитектуры дешева только тогда, когда ваш путь к продакшену не зависит от результата, а самый дешевый способ сохранить это — не иметь интеграции под каждого вендора ни для чего другого: один OpenAI-совместимый ключ для более чем 200 моделей, цена провайдера по прайс-листу передается напрямую с нулевой наценкой, и автоматический фейловер при деградации провайдера. Тогда эксперимент с самостоятельно размещенным RWKV-7 на двух рабочих нагрузках, где постоянная память действительно окупается — длительный стрим, ассистент на устройстве, непрерывно работающий суммаризатор, — это эксперимент, а не миграция. Такова форма, которую большинство команд должно хотеть здесь: маршрутизированный дефолт и модель на основе состояния, которая зарабатывает себе место на конкретной задаче.
Что ещё может помешать этой посадке?
Отнеситесь к прецеденту серьёзно: предложение добавить именно эту архитектуру уже отклонялось один раз по причинам, которые автор признаёт обоснованными. Новое предложение лучше аргументировано и лучше протестировано, но это всё ещё PR от сообщества в репозиторий, который намеренно консервативен в отношении принятия архитектур, которые ему затем придётся поддерживать вечно.
Конкретные открытые вопросы, на которые мы хотели бы получить ответы, прежде чем считать эту работу завершённой:
• Ревью, а не CI — автоматические наборы тестов зелёные; запросили ревью у двух мейнтейнеров, и ни один не одобрил. Для Transformers требуется одно одобряющее ревью, а медленные тесты не были запущены.
• Скорость пути без зависимостей — чистый PyTorch с последовательным декодированием по одному токену переносим, и переносимость — это весь смысл, но в PR не публикуются показатели пропускной способности в сравнении с ядрами Triton из flash-linear-attention. Если нативное декодирование существенно медленнее, библиотека становится путём совместимости, а серьёзное обслуживание остаётся в другом месте.
• Какие чекпоинты доступны — конвертации, соответствующие стандарту, охватывают диапазон от 0.1B до 7.2B. Модель 13.3B G1, которую люди на самом деле хотят, в этот набор не входит, а документированный пример — это модель Pile с токенизатором GPT-NeoX, а не чат-модель со словарём World. Объединённый загрузчик, за которым нет флагманского чекпоинта, меняет меньше, чем кажется.
• Движущаяся цель — проект не стоит на месте. Репозиторий G1 от BlinkDL был обновлён в ту же неделю, когда открыли этот PR; сообщество уже перешло на более поздние ревизии данных, чем G1c, в своих квантованиях; а RWKV-8 «Heron» был публично анонсирован с механизмом суффиксного автомата под названием ROSA. Heron ещё не выпущен и не протестирован; мы упоминаем его лишь потому, что интеграция в библиотеку, появляющаяся в конце жизненного цикла поколения, недолго остаётся актуальной.
Четыре вопроса, на которые спецификация не даёт ответа
Могу ли я использовать RWKV-7 в Transformers прямо сейчас, или нет?
Как ни досадно, оба, и различие между ними — в этом вся суть. Вы можете загрузить контрольную точку RWKV-7 через API transformers уже сегодня, если установите flash-linear-attention и передадите trust_remote_code, чтобы выполнялся собственный файл моделирования из репозитория. Чего вы не можете сделать — так это загрузить её из самой библиотеки; именно это обеспечивает её работу по умолчанию в инструментах, построенных на основе библиотеки, — скриптах обучения и выравнивания, адаптерах, оценочных стендах, путях экспорта — и именно это позволяет соответствовать политике, запрещающей удалённый код. Именно для этого второго и предназначен #47780.
Делает ли объединение модель лучше?
Ни на единый пункт ни в одном бенчмарке. Это меняет распространение, а не качество — и для архитектуры, чья проблема никогда не была в качестве, сдерживающим ограничением является именно распространение. Сравнение то же, что и в начале этого материала: модель на 169M параметров 2023 года скачивается в сорок раз чаще, чем веса текущего поколения, полностью за счёт загрузки без флагов.
Если нет KV-кэша, получаю ли я безлимитный контекст бесплатно?
Вы получаете неограниченную длину контекста без взрывного роста памяти — но это не то же самое, что неограниченное воспроизведение. Состояние фиксированного размера имеет фиксированную информационную ёмкость: скормите ему миллион токенов — и оно не сможет удержать столько извлекаемых деталей, сколько вмещает миллион токенов. А вот внимание с полным кэшем — может, но ценой, которая растёт на протяжении всего пути. Относитесь к истории RWKV-7 о длинном контексте как к «вечно работает дёшево, сжимает по ходу» и проверяйте конкретное извлечение, которое вам нужно, а не доверяйте слову «бесконечный».
Стоит ли обращать внимание на 13.3B, когда передовые модели — это сотни миллиардов?
Это полностью зависит от того, имеет ли для вас ценность постоянный объём памяти. Если вы вызываете размещённый API и платите за токен, то почти наверняка нет — передовые модели далеко впереди по возможностям, и вы не платите за KV-кэш напрямую. Если вы развёртываете инференс на оборудовании, которым не управляете, или запускаете постоянный поток, где растущий кэш — это то, что в конечном счёте убивает процесс, архитектура, чей объём памяти не меняется, — это ответ другого рода на другой вопрос. Именно такие рабочие нагрузки — это то, где 2.9B RWKV-7 тихо показывал себя конкурентоспособным, и именно на них нативный загрузчик имел бы наибольшее значение.
Что бы мы посмотрели дальше
Четыре конкретных сигнала, примерно в порядке того, насколько сильно они изменили бы нашу оценку. {{1}}Одобрительное ревью от ArthurZucker или Rocketknight1, которое превращает это из многообещающего диффа в запланированную функцию.{{/1}} {{2}}Конвертация 13.3B G1 с токенизатором World, соответствующая конвенциям, — именно она делает загрузчик по-настоящему полезным.{{/2}} {{3}}Опубликованные показатели пропускной способности для пути декодирования без зависимостей в сравнении с ядрами Triton, которые определяют, будет ли нативная поддержка вариантом для сервинга или заглушкой совместимости.{{/3}} {{4}}И любой признак RWKV-8, который подскажет, появляется ли эта интеграция в начале поколения или в его конце.{{/4}}
По крайней мере до первого из них правильный итог будет неприглядным: RWKV-7 (Goose) реален, распространяется по разрешительной лицензии, доступен для загрузки вплоть до 13.3B и всё ещё не загружается нативно в библиотеке, на которой построена большая часть экосистемы. Пул-реквест, открытый 4 августа 2026 года, предлагает это исправить. Он не был смёржен, а пул-реквесты на добавление архитектур в transformers действительно закрывают.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
