
RWKV-7 (Goose):ついにTransformersでの読み込みを可能にするプルリクエストの内側
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
先月Hugging Faceで最もダウンロードされたRWKVモデルは、2025年3月からプロジェクトが提供しているアーキテクチャであるRWKV-7(Goose)でもなければ、その上で訓練された推論シリーズのRWKV7-G1でもなかった。それはRWKV/rwkv-4-169m-pile、すなわち2023年5月の1億6900万パラメータのRWKV-4チェックポイントであり、2026年8月5日までの30日間で8,824回のダウンロードを記録した。一方、1.5BのRWKV-7 Goose World-3リリースは215回、2.9Bは316回だった。2023年のモデルが優れているわけではない。それは、何も追加でインストールせずに、素のfrom_pretrained呼び出しだけで読み込めるモデルなのだ。
2026年8月4日、Hakureirmというコントリビューターがhuggingface/transformersに対してプルリクエスト#47780を開きました。タイトルは「Add RWKV-7 (Goose)」です。8月5日時点で、このPRはオープンのままで、レビューもマージもされておらず、これは2回目の試みです。以前の提案#46984は却下されました。まだ何も取り込まれておらず、この記事はリリースアナウンスとして読むべきではありません。しかし、そのdiffは公開されており、最も長く続くアテンションフリーのLLM系譜と、ほとんどのチームが実際に使っているスタックの間に立ちはだかる、最も地味でありながら最も重要な問題に対処しています。すなわち、ローダーです。
以下では、RWKVに関する情報が通常まとめて扱われてしまうため、主張を3種類に区別する。第一に、プルリクエストとHub上で検証可能なもの——自分で確認できるものだ。第二に、RWKVプロジェクトが独自の評価に基づいて自社モデルについて報告しているもの。そして第三に、誰も公に回答していない大量の疑問点——最も興味深いリスクはほとんどここに潜んでいる。
プルリクエストには実際に何が含まれていますか?

2026年8月5日にPRページとGitHub APIから読み取った機械的な事実:
• スコープ — コミット3件、変更ファイル12件、追加4,423行・削除0行。add-rwkv7-upstreamブランチからhuggingface:mainへのマージ。ラベルは「New model」。担当者なし、マイルストーンなし。
• 追加される内容 — RWKV-7 を2つの公開クラス(Rwkv7Model と Rwkv7ForCausalLM)として提供し、さらにライブラリの LinearAttentionLayer 上に構築された Rwkv7Cache も提供します。WKV 状態の dtype はモデルの dtype とは独立に設定可能です。これは、このファミリーでは数値ドリフトがリカレント状態に蓄積されるため、重要です。
• 動作の仕組み — サードパーティ製ランタイムに依存しないポータブルなPyTorch実装です。プリフィルではリカレンスのチャンク並列形式を使用し、デコードでは逐次的な単一トークンパスを実行します。パラメータ名は、トランスフォーマー風に改名されるのではなく、アップストリームのRWKVリファレンス実装に従っています。
• テスト体制 — 標準的なモデルミックスインを超え、BlinkDL自身のランタイムとトークン単位で一致する統合テストに加え、モデリングファイルとコードを共有しないNumPy参照実装を含みます。リポジトリのCI要約ボットは、最新の実行結果を成功として報告しています:ジョブ16件、テスト179,151件、失敗ゼロ、計算時間16時間9分。
• 現状 — ArthurZucker氏とRocketknight1氏にレビューが依頼されています。ページにはマージには少なくとも1件の承認レビューが必要と記載されていますが、まだどちらからも承認レビューは得られていません。私たちが確認した時点でも、GitHubのAPIはマージ状態を「unstable」と説明していました。また、メンテナー向けボットが、マージ前にスローテストスイート(autoおよびrwkv7)を実行するよう求めています。言い換えれば、高速CIではグリーン(成功)だが、まだ人間による承認は得られていない、ということです。
説明で最も興味深い部分は、譲歩の点だ。以前の試みである#46984は、公開されたRWKV-7チェックポイントがTransformersの規約に従っていなかったために却下され、著者自身の捉え方としても「その異議は正しかった」とされている。PRで述べられている問題は、Hub上のRWKV-7の重みが、ライブラリでは使用できない2つの形式で提供されているということだ:
• PTHリポジトリ — 生の.pthファイルであり、safetensorsではありません。ライブラリ実装ではこれらを読み込めず、PyTorchのpickleファイルは、大企業のセキュリティレビューでまさに拒否されるものです。
• HFリポジトリ — これらにはmodel.safetensorsが同梱されていますが、それぞれにmodeling_rwkv7.pyとauto_mapも同梱されているため、読み込むにはtrust_remote_codeが必要です。これは推論の条件としてリモートコード実行を行うことであり、そのため多くのエンタープライズ向けチェックリストはそこで止まってしまうのです。
つまり、このPRは一度に2つの役割を果たします。モデリングファイルを追加しつつ、標準的なレイアウトに従う正規のBlinkDL .pthリリースから直接作成された新しい変換セットを指し示します。これらはsafetensorsのみで、pickleもリモートコードも含まず、architecturesとmodel_typeを備えた通常のconfig.jsonを持ち、0.1Bから7.2Bまでをカバーします。最小のHakureirm/rwkv7-168m-pile-hfは、全399個のテンソルがスポットチェックではなくソースの.pthとビット単位で同一であることが検証されています。このチェックポイントはPileモデルのため、そのトークナイザーはRWKV World語彙ではなく通常のGPT-NeoX-20B高速トークナイザーです。これは、ライブラリの既存のRWKVページがPileチェックポイントも記載しているのと同じ理由です。
2023年のチェックポイントが現在のアーキテクチャより多くダウンロードされる理由

Transformers はバージョン 5.14.1 で、2026年7月16日にリリースされました。そのドキュメントで RWKV を検索すると、モデルページがちょうど1件だけ見つかります。そこには {{1}}「RWKV モデル(バージョン4)」{{/1}} が説明されており、これは何年も前に提供されたもので、例として RWKV/rwkv-4-169m-pile が使用され、デフォルトの語彙は 50,277 トークンです。RWKV-5、RWKV-6、RWKV-7 のページはありません。ライブラリの RWKV サポートが作成されてから、3世代のアーキテクチャがリリースされていますが、そのいずれも含まれていません。
ダウンロード数は、エコシステムがそれに対して何をしたかを示している。つまり、ライブラリを迂回したのだ。過去30日間のダウンロード数でソートすると、上位のRWKV-7リポジトリは、BlinkDLの生の.pthリリース(rwkv7-g1が8,288、rwkv-7-worldが4,489)と、13.3B G1のコミュニティによるGGUF量子化の厚い層(複数の別々のアップローダーがそれぞれ月に1,000〜3,000ダウンロードを獲得している)である。公式のtransformersフォーマットのミラーは、生の重みより2桁下に位置している。2.9B G1のflash-linear-attentionミラーは1,843を達成している。
そのパターンには単純な説明がある。llama.cpp は2025年3月17日にRWKV v7サポートを統合した — CPU、CUDA、SYCL、Vulkan、Metalバックエンドを持つGGML_OP_RWKV_WKV7カーネル — 論文が公開された約1日後のことだ。自分のマシンでRWKV-7を実行したいなら、高速な経路はGGUFであり、それは16か月間ずっとそうだ。存在しなかった経路とは、すべてのファインチューニングスクリプト、すべてのPEFTアダプター、すべての評価ハーネス、そしてすべての内部サービングラッパーが前提とするものである:AutoModelForCausalLM.from_pretrained、フラグなし。
RWKV-7 (Goose) とは実際には何か
RWKV-7はリカレントニューラルネットワークであり、より低コストなアテンションカーネルを備えたトランスフォーマーではありません。そして、その命名は人々を常に混乱させます。これは、過去のキーとバリューのキャッシュを増大させるのではなく、固定サイズの状態をシーケンスに沿って前方に伝播させます。具体的には、標準的なアテンションモデルに対して:
• コンテキストの成長に伴うメモリ増大 — TransformerのKVキャッシュは処理中のトークン数に比例して増加します。RWKV-7は、サイズが会話ではなくアーキテクチャによって決定される状態を保持します。これが効率性の論点のすべてです。
• トークンあたりのコスト — コンテキストが長くなるにつれて、アテンションのトークンあたりのコストは増加します。RWKV-7のトークンあたりの推論コストは一定であるため、エッジや常時オンのストリーム提案で頻繁に登場するのです。
• トレーニング形状 — 従来のRNNとは異なり、再帰処理はチャンク単位で並列化できるため、事前学習が逐次的な処理に退化することはありません。これがPRのチャンク並列プリフィルパスが実装する内容です。
• コンテキスト上限 — 吹き飛ばすキャッシュが存在しないため、このプロジェクトは事実上無制限のコンテキストを謳っている。固定状態ができないのは、無制限の詳細を保持することであり、これは脚注ではなく実際の制限である。
この論文(2025年3月18日、LF AI & Data Foundation配下のRWKV ProjectとしてBo Peng、Yu Zhang、Songlin Yang、Ruichong Zhangにより発表)におけるアーキテクチャ上の主張は、ベクトル値ゲーティング、インコンテキスト学習率、緩和された値置換規則を備えた一般化デルタ規則と、簡素化されたMLP(ゲーティング行列を除去し、隠れ次元を拡大して補償)である。それに付随する理論的成果の方が、より挑発的な側面だ。RWKV-7は、訓練時の並列化可能性を維持したまま、状態追跡を実行し、すべての正則言語を認識できる。著者らは、これは標準的な複雑性予想の下でトランスフォーマーが達成できる範囲を超えると主張している。
すべてApache 2.0です。ダウンロードできるファミリーは、{{1}}0.1B(12層、幅768)、0.4B(24/1024)、1.5B(24/2048)、2.9B(32/2560)、7.2B(32/4096)、13.3B(61層、幅4096){{/1}}で構成され、すべて{{2}}65,536トークンのWorldボキャブラリーとヘッドサイズ64{{/2}}を備えています。ベースのWorldシリーズは、{{3}}3.1兆トークンの多言語コーパス{{/3}}でトレーニングされました。G1「GooseOne」シリーズは、World v3.5、つまり小説、ウェブテキスト、数学、コード、推論データをさらに追加した拡張版{{4}}5.16兆トークンのミックス{{/4}}でそのトレーニングを継続します。G1チェックポイントは、{{5}}thinkタグ推論モード、JSON関数呼び出し、およびG1c以降のfill-in-the-middle{{/5}}を追加します。ネーミングは確かに紛らわしいです。G0は{{6}}1エポック未満{{/6}}を意味し、G1は{{7}}1エポック超{{/7}}を意味します。また、接尾辞の文字はデータの改訂版を示しており、後の文字ほど優れたデータを保持しています。
その数字、そしてそれらが誰の数字であるか
これが証拠に関する正直な現状です。主要なベンチマーク主張——2.9Bモデルが多言語タスクで3B規模の最新技術(SOTA)を更新し、はるかに少ないトレーニングトークンで英語の3B規模のSOTAに匹敵したというもの——は、2025年3月に発表され、当時の3Bモデル群と比較評価された論文自身の主張です。これはOpenReviewの審査を通過しており、ベンダーのブログ記事が受けるよりも厳しい審査ですが、それでもなお15か月前の比較セットに基づく自己申告の結果です。
このプロジェクトのもう一つの公開測定指標であるUncheatableEvalは、リーダーボードの1行よりも興味深いものでありながら、ほとんど取り上げられていません。トレーニングセットに漏れ込む多肢選択ベンチマークをスコアリングする代わりに、モデルのトレーニング時には存在しなかったデータ(新しいarXiv論文、新しいGitHubリポジトリ、最近のニュース)に対する圧縮率を測定します。この設計により、汚染ははるかに困難になり、RWKVは同じサイズのTransformerと競合する結果を報告しています。それでも、これはプロジェクトが自ら実施する評価です。
私たちが確認できる限り、存在しないものは、RWKV-7のチェックポイントに対する独立した第三者による指標スコアです。中立のアグリゲーターは、フロンティアモデルで稼働するハーネスに7.2Bや13.3Bを通したことがありません。したがって、DeepSeek V4 FlashやQwen3.8-Maxなどのモデルと比較する場合、それは二重のカテゴリー錯誤です。誰もRWKV-7を同じ評価で実行しておらず、13.3Bの高密度RNNはフロンティアシステムと同じ仕事を競っているわけではないからです。擁護可能な主張は、より狭く、より有用です。すなわち、1.5Bから13.3Bの規模で、一定のメモリ使用量、約12言語、寛容なライセンスの重み、ということです。
Today、RWKV-7を実行すること、そしてそのコスト

RWKV/RWKV7-Goose-World3-1.5B-HF の Hub ページは、現在の摩擦をよく示している。これは 1.52B パラメータの BF16 モデルで、RWKV World トークナイザーを採用し、Apache 2.0 ライセンス、custom_code タグ付きで、英語、中国語、日本語、韓国語、フランス語、アラビア語、スペイン語、ポルトガル語に対応している。その説明には、読み込む前に flash-linear-attention と新しい transformers をインストールするよう書かれている。そしてサイドバーには、ホストされているモデルならプロバイダーが表示される場所に、こう率直に書かれている:このモデルはどの推論プロバイダーによってもデプロイされていない。
つまり、今日の選択肢はすべてセルフサービスです:
• flash-linear-attention プラス trust_remote_code — 通常のHub使用法に最も近いが、リポジトリのコードを実行してTritonカーネルを取り込むことになるため、ハードウェアとセキュリティレビューの対象となるものに制約が生じる。
• GGUF via llama.cpp — 実際に最もサポートが充実している経路であり、13.3Bモデルにも対応しています。ダウンロード数を見ても、人々が実際に選んでいるのはこの経路です。ローカル推論には最適ですが、トレーニングやファインチューニングの用途ではありません。
• プロジェクト自身のランタイム — rwkv pip パッケージとリファレンスリポジトリで、正規実装に最も近く、あなたのチームがすでに持っているツール群からは最も遠いものです。
それらのどれも、呼び出せるAPIではありません。その含意について率直に述べる価値はあります。すなわち、RWKV-7はOrcaRouterにはありません。私たちが見つけられる限り、ホストされたエンドポイントがどこにも存在しないからです。RWKV-7が必要なら、RWKV-7を自分で実行するしかありません。正直に言えるのは、それがスタックの残りの部分をどのような状況に置くかということです。実証されていないアーキテクチャの評価が安上がりなのは、本番環境への道筋がその結果に依存していない場合だけです。そして、その状態を保つ最も安い方法は、他の何であれベンダーごとの統合を持たないことです——200以上のモデルにわたる1つのOpenAI互換キー、プロバイダーの定価を0%マークアップでそのまま通すこと、プロバイダーが劣化したときの自動フェイルオーバー。そうすれば、一定メモリが実際に効果を発揮する2つのワークロード(長時間実行されるストリーム、オンデバイスアシスタント、止まることのない要約器)における自己ホスト型RWKV-7の実験は、移行ではなく実験になります。それが、ほとんどのチームがここで望むべき形です:ルーティングされたデフォルト、そして特定のジョブでその価値を証明して採用される状態ベースのモデル。
この着陸をまだ妨げる可能性があるものは何か
先例を真剣に受け止めてください。このまさにそのアーキテクチャを追加する提案は、著者が妥当だと認める根拠により、既に一度却下されています。新しい提案は、よりよく論じられ、よりよくテストされています。それでもなお、これは、採用したアーキテクチャをその後ずっと保守することになるリポジトリに対して、意図的に保守的な態度をとるコミュニティPRなのです。
これを完了とする前に回答が必要な具体的な未解決の質問は、以下のとおりです。
• レビュー、CIではない — 自動テストスイートはすべて成功しています。2人のメンテナーに依頼しましたが、どちらも承認していません。Transformersは1件の承認レビューを必要としますが、遅いテストはまだ実行されていません。
• 依存関係のないパスの速度 — 純粋なPyTorchによる逐次的な単一トークンデコードは移植性が高く、移植性こそが重要な点ですが、このPRではflash-linear-attentionのTritonカーネルに対するスループットを公表していません。ネイティブなデコードが大幅に遅い場合、ライブラリは互換性のためのパスとなり、本格的な推論は他の場所に留まることになります。
• どのチェックポイントが届くのか規約準拠の変換は0.1Bから7.2Bまでをカバーする。人々が実際に欲しがっている13.3B G1はそのセットに含まれておらず、文書化された例も、World語彙のチャットモデルではなく、GPT-NeoXトークナイザーを備えたPileモデルである。背後に主力チェックポイントのないマージ済みローダーは、見た目ほどには変化しない。
• 動く標的 — プロジェクトは静止していません。BlinkDLのG1リポジトリはこのPRが開かれた同じ週に更新され、コミュニティによる量子化はG1cより後のデータリビジョンへと進んでいます。また、RWKV-8「Heron」はROSAと呼ばれる接尾辞オートマトン機構を備えて公開プレビューされました。Heronは未リリースであり、ベンチマークも未実施です。これに言及するのは、世代の終盤に登場するライブラリ統合は寿命が短いからにすぎません。
仕様書が答えない4つの質問
今すぐTransformersでRWKV-7を使うことはできますか、それともまだできませんか?
両方とも。しかも腹立たしいことに、その違いこそがすべてなのです。今日、transformers API 経由で RWKV-7 チェックポイントを読み込むことはできます。ただし、flash-linear-attention をインストールし、trust_remote_code を渡して、リポジトリ自身のモデリングファイルが実行されるようにする必要があります。できないのは、ライブラリ自体から読み込むことです。それが、ライブラリ上に構築されたツール群(トレーニングおよびアライメントスクリプト、アダプター、評価ハーネス、エクスポートパス)でデフォルトで動作するようにし、またリモートコードを禁止するポリシーを通過させるようにするものです。その二つ目のことこそ、#47780 が存在する理由です。
マージによってモデルは良くなりますか?
どのベンチマークでも一点の差もない。それは分布を変えるのであって、品質を変えるのではない——そして、品質が問題になったことのないアーキテクチャにとって、分布こそが制約条件である。比較対象はこの記事の冒頭のものだ:2023年の169Mモデルが、現行世代の重みを40対1の比率でダウンロード数を上回っている。そのすべては、フラグなしでロードできるという強みによるものだ。
KVキャッシュがなければ、無制限のコンテキストが無料で手に入るのでしょうか?
メモリを爆発させることなく無制限のコンテキスト長を得られるが、それは無制限の想起とは同じではない。固定サイズの状態には固定の情報容量しかなく、100万トークンを入力しても、100万トークン分の取り出し可能な詳細を保持することはできない。フルキャッシュによるアテンションなら、コストが全体にわたって増大するものの、それが可能だ。RWKV-7の長いコンテキストの話は「永遠に安価にストリームし、進みながら圧縮する」と捉え、「無限」という言葉を信じるのではなく、必要な特定の検索をテストしてください。
フロンティアモデルが数百億規模なのに、13.3Bに注目する価値はあるのか?
それは、一定のメモリ使用量があなたにとって何らかの価値を有するかどうかに完全に依存します。ホスト型APIを呼び出してトークン単位で支払っている場合、ほぼ間違いなく価値はありません。最先端モデルは能力ではるかに先行しており、KVキャッシュに対して直接費用を支払っているわけではないからです。自分が制御できないハードウェアに推論を展開している場合、あるいは増え続けるキャッシュが最終的にプロセスを停止させる原因となる永続ストリームを実行している場合、メモリ使用量が変動しないアーキテクチャは、異なる問いに対する異なる種類の答えとなります。それらのワークロードこそ、2.9B RWKV-7が静かに競争力を持ってきた分野であり、ネイティブローダーが最も重要となる分野なのです。
私たちが次に観るもの
我々の見立てをどれほど変えるかのおおよその順に、4つの具体的なシグナルがある。{{1}}ArthurZuckerまたはRocketknight1からの承認レビュー。これがあれば、これは有望なdiffから実装予定の機能へと変わる。{{/1}}{{2}}Worldトークナイザーを使った13.3B G1の規約準拠の変換。これこそがローダーを価値あるものにする。{{/2}}{{3}}依存関係なしのデコードパスについて、Tritonカーネルと比較した公開済みスループット数値。これが、ネイティブサポートがサービス提供の選択肢となるのか、それとも互換性シムに過ぎないのかを決定する。{{/3}}{{4}}そしてRWKV-8の何らかの兆候。それがあれば、この統合が世代の始まりに実現するのか、終わりに実現するのかが分かるだろう。{{/4}}
少なくともそれらの最初のものが実現するまでは、正しい要約はこうした地味なものとなる。すなわち、RWKV-7 (Goose) は実在し、寛容なライセンスで提供され、最大13.3Bまでダウンロード可能だが、エコシステムの大部分が基盤としているライブラリでは今だにネイティブに読み込めない。2026年8月4日に開かれたプルリクエストがこれを修正しようと提案しているが、まだマージされておらず、transformersにアーキテクチャを追加するプルリクエストが却下されることもある。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
