
RWKV-7 (Goose): Dentro la Pull Request che Finalmente lo Caricherebbe in Transformers
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Il modello RWKV più scaricato su Hugging Face il mese scorso non era RWKV-7 (Goose), l'architettura che il progetto distribuisce da marzo 2025, e non era RWKV7-G1, la serie reasoning addestrata su di essa. Era RWKV/rwkv-4-169m-pile: un checkpoint RWKV-4 da 169 milioni di parametri del maggio 2023, con 8.824 download nei 30 giorni fino al 5 agosto 2026, contro 215 per la versione 1.5B RWKV-7 Goose World-3 e 316 per la 2.9B. Il modello del 2023 non è migliore. È quello che si carica con una semplice chiamata from_pretrained e nessun'altra installazione.
Il 4 agosto 2026 una contributrice di nome Hakureirm ha aperto la pull request #47780 sul repository huggingface/transformers, intitolata "Add RWKV-7 (Goose)". Al 5 agosto risulta ancora aperta, non revisionata e non unita al ramo principale; si tratta del secondo tentativo — una proposta precedente, la #46984, era stata rifiutata. Non è stato amalgamato nulla, e questo articolo non va letto come un annuncio di rilascio. Tuttavia il diff è pubblico e affronta la questione più banale e allo stesso tempo più consequenziale che separa la più longeva stirpe di LLM senza meccanismo di attenzione dagli stack che la maggior parte dei team usa davvero: un caricatore.
Quello che segue distingue tre tipi di affermazioni, perché di solito la copertura di RWKV le confonde. C'è ciò che è verificabilmente nella pull request e sull'Hub, che puoi controllare tu stesso. C'è ciò che il progetto RWKV riporta sui propri modelli, nelle proprie valutazioni. E c'è il grande insieme di domande a cui nessuno ha risposto pubblicamente, ed è lì che risiede la maggior parte del rischio interessante.
Cosa c'è effettivamente nella pull request

I fatti oggettivi, letti dalla pagina della PR e dall'API di GitHub il 5 agosto 2026:
• Ambito — tre commit, 12 file modificati, 4.423 righe aggiunte e zero eliminate, dal branch add-rwkv7-upstream verso huggingface:main. Etichettata "Nuovo modello". Nessun assegnatario, nessuna milestone.
• Cosa aggiunge — RWKV-7 come due classi pubbliche, Rwkv7Model e Rwkv7ForCausalLM, insieme a una Rwkv7Cache basata sul LinearAttentionLayer della libreria. Il dtype dello stato WKV è configurabile indipendentemente dal dtype del modello, il che è importante perché lo stato ricorrente è il punto in cui la deriva numerica si accumula in questa famiglia.
• Come funziona — PyTorch portabile senza dipendenze runtime di terze parti. Il prefill utilizza una forma parallela a chunk della ricorrenza; il decode esegue un percorso sequenziale a token singolo. I nomi dei parametri seguono l'implementazione di riferimento RWKV upstream invece di essere rinominati per sembrare simili a un transformer.
• Strategia di test — oltre ai mixin di modello standard, un test di integrazione che corrisponde al runtime di BlinkDL token-per-token, più un'implementazione di riferimento in NumPy che non condivide codice con il file di modellazione. Il bot di riepilogo CI del repository riporta l'ultima esecuzione come riuscita: 16 job, 179.151 test, zero errori, 16 ore e 9 minuti di calcolo.
• Dove siamo — la revisione è stata richiesta ad ArthurZucker e Rocketknight1; la pagina afferma che è necessaria almeno una revisione approvata per il merge, e nessuna delle due è stata data. L'API di GitHub descriveva ancora lo stato del merge come "instabile" quando l'abbiamo letta, e un bot rivolto ai maintainer ha chiesto di eseguire le suite di test lenti (auto e rwkv7) prima del merge. In altre parole: verde sulla CI rapida, non ancora benedetto da un umano.
La parte più interessante della descrizione è l'ammissione. Il tentativo precedente, #46984, è stato rifiutato perché i checkpoint RWKV-7 pubblicati non seguivano le convenzioni di Transformers, e l'autore stesso afferma che "quell'obiezione era corretta." Il problema, esposto nella PR, è che i pesi RWKV-7 sull'Hub si presentano in due forme inutilizzabili dalla libreria:
• I repository PTH — file .pth grezzi, niente safetensors. Un'implementazione di libreria non può caricarli, e i file pickle di PyTorch sono esattamente ciò che una revisione di sicurezza in una grande azienda rifiuterà.
• I repository HF — questi includono sì model.safetensors, ma ognuno include anche un modeling_rwkv7.py e un auto_map, quindi caricarli richiede trust_remote_code. Questo è esecuzione di codice remoto come condizione per l'inferenza, ed è per questo che molte checklist aziendali si fermano qui.
Quindi la PR fa due cose contemporaneamente. Aggiunge un file di modellazione e punta a una nuova serie di conversioni effettuate direttamente dalle release canoniche .pth di BlinkDL, che seguono il layout standard — solo safetensors, niente pickle, nessun codice remoto, un normale config.json con architectures e model_type — coprendo da 0.1B a 7.2B. Il più piccolo, Hakureirm/rwkv7-168m-pile-hf, ha tutti i suoi 399 tensori verificati bit-identici rispetto al .pth di origine, invece di un controllo a campione. Quel checkpoint è un modello Pile, quindi il suo tokenizer è il normale fast tokenizer GPT-NeoX-20B, non il vocabolario RWKV World — per lo stesso motivo per cui la pagina RWKV esistente della libreria documenta anch'essa un checkpoint Pile.
Perché un checkpoint del 2023 supera in download l'architettura attuale

Transformers è alla versione 5.14.1, rilasciata il 16 luglio 2026. Cercando RWKV nella sua documentazione si ottiene esattamente una pagina di modello, che descrive "il modello RWKV (versione 4)", contribuita anni fa, con RWKV/rwkv-4-169m-pile come esempio e un vocabolario predefinito di 50.277 token. Non ci sono pagine per RWKV-5, RWKV-6 o RWKV-7. Tre generazioni di architetture sono state rilasciate da quando è stato scritto il supporto a RWKV della libreria, e nessuna di esse è inclusa.
I numeri dei download mostrano cosa ha fatto l'ecosistema al riguardo: ha aggirato la libreria. Ordinando per download negli ultimi 30 giorni, i principali repository RWKV-7 sono le release .pth grezze di BlinkDL (rwkv7-g1 a 8.288, rwkv-7-world a 4.489) e uno spesso strato di quantizzazioni GGUF della community del G1 da 13,3B — diversi uploader separati che muovono ciascuno da uno a tremila download al mese. I mirror ufficiali in formato transformers si collocano due ordini di grandezza al di sotto dei pesi grezzi. Il mirror flash-linear-attention del G1 da 2,9B arriva a 1.843 download.
Quel pattern ha una spiegazione semplice. llama.cpp ha integrato il supporto a RWKV v7 il 17 marzo 2025 — un kernel GGML_OP_RWKV_WKV7 con backend CPU, CUDA, SYCL, Vulkan e Metal — circa un giorno dopo la pubblicazione dell'articolo. Se volevi eseguire RWKV-7 sulla tua macchina, il percorso rapido era GGUF, e lo è stato per sedici mesi. Il percorso che non esisteva era quello che ogni script di fine-tuning, ogni adapter PEFT, ogni harness di valutazione e ogni wrapper interno di serving dà per scontato: AutoModelForCausalLM.from_pretrained, senza flag.
Cosa è realmente RWKV-7 (Goose)
RWKV-7 è una rete neurale ricorrente, non un trasformatore con un kernel di attenzione più economico, e il nome confonde costantemente le persone. Porta avanti lungo la sequenza uno stato di dimensione fissa, invece di una cache in crescita di chiavi e valori passati. Concretamente, rispetto a un modello di attenzione standard:
• La memoria al crescere del contesto — la cache KV di un trasformatore cresce linearmente con il numero di token in elaborazione; RWKV-7 mantiene uno stato la cui dimensione è determinata dall'architettura, non dalla conversazione. Questo è l'intero argomento dell'efficienza.
• Costo per token — l'attenzione costa di più per token man mano che il contesto si allunga; il costo di inferenza per token di RWKV-7 è costante, motivo per cui continua a comparire nelle proposte edge e di streaming sempre attivo.
• Forma di training — a differenza di una RNN classica, la ricorrenza è parallelizzabile su un blocco, quindi il pretraining non degenera in una scansione sequenziale. Questo è ciò che implementa il percorso di prefill parallelo a blocchi della PR.
• Tetto del contesto — non c'è una cache da far saltare, quindi il progetto vanta un contesto effettivamente illimitato. Ciò che uno stato fisso non può fare è mantenere dettagli illimitati, il che è una vera limitazione piuttosto che una nota.
L'affermazione architetturale contenuta nell'articolo, pubblicato il 18 marzo 2025 da Bo Peng, Yu Zhang, Songlin Yang e Ruichong Zhang nell'ambito del RWKV Project presso la LF AI & Data Foundation, è una regola delta generalizzata con gating a valori vettoriali, tassi di apprendimento in contesto e una regola di sostituzione del valore rilassata, oltre a un MLP semplificato (matrice di gating rimossa, dimensione nascosta ampliata per compensare). Il risultato teorico ad essa associato è la metà più provocatoria: RWKV-7 può eseguire il tracciamento dello stato e riconoscere tutti i linguaggi regolari pur rimanendo parallelizzabile in fase di addestramento, cosa che gli autori sostengono superi ciò che i transformer possono fare nell'ambito delle congetture di complessità standard.
Tutto è Apache 2.0. La famiglia che puoi scaricare include modelli da 0,1B (12 layer, larghezza 768), 0,4B (24 / 1024), 1,5B (24 / 2048), 2,9B (32 / 2560), 7,2B (32 / 4096) e 13,3B (61 layer, larghezza 4096), tutti con un vocabolario World da 65.536 token e dimensione della testa 64. La serie base World è stata addestrata su un corpus multilingue da 3,1 trilioni di token; la serie G1 "GooseOne" prosegue l'addestramento su World v3.5, un mix ampliato da 5,16 trilioni di token con più romanzi, testi web, matematica, codice e dati di ragionamento. I checkpoint G1 aggiungono una modalità di ragionamento con tag think, chiamate di funzioni JSON e fill-in-the-middle a partire da G1c. La nomenclatura è davvero scomoda: G0 significa meno di un'epoca, G1 più di una, e le lettere di suffisso indicano le revisioni dei dati, con le lettere successive che portano dati migliori.
I numeri, e di chi sono i numeri
Ecco lo stato onesto delle prove. L'affermazione principale del benchmark — secondo cui il modello da 2.9B ha stabilito un nuovo stato dell'arte per la categoria 3B su compiti multilingue e ha eguagliato lo stato dell'arte di lingua inglese per la categoria 3B con un numero drammaticamente inferiore di token di addestramento — è dell'articolo stesso, pubblicato a marzo 2025 e valutato rispetto ai modelli 3B di quel periodo. È passato attraverso OpenReview, che è un controllo più approfondito di quanto ne riceva un post sul blog di un venditore, e resta comunque un risultato auto-dichiarato su un insieme di confronto vecchio di quindici mesi.
L'altra misurazione pubblica del progetto, UncheatableEval, è più interessante di una riga di classifica e riceve quasi nessuna copertura. Invece di valutare benchmark a scelta multipla che trapelano nei set di addestramento, misura il tasso di compressione su dati che non esistevano quando il modello è stato addestrato: nuovi articoli arXiv, repository GitHub freschi, notizie recenti. Questo design rende la contaminazione molto più difficile, e RWKV riporta di essere competitivo con transformer della stessa dimensione su questo. È comunque una valutazione che il progetto esegue su se stesso.
Quello che non esiste, per quanto possiamo constatare, è un punteggio di indice indipendente di terze parti per qualsiasi checkpoint RWKV-7 — nessun aggregatore neutrale ha sottoposto il 7.2B o il 13.3B all'harness usata sui modelli frontier. Quindi i confronti che potresti vedere contro modelli come DeepSeek V4 Flash o Qwen3.8-Max sono errori di categoria due volte: nessuno ha sottoposto RWKV-7 alla stessa valutazione, e una RNN densa da 13.3B non compete per lo stesso lavoro di un sistema frontier. L'affermazione difendibile è più ristretta e più utile: da 1.5B a 13.3B, con memoria costante, in una dozzina di lingue circa, con pesi permissivi.
Eseguire RWKV-7 oggi, e cosa ti costa

La pagina Hub per RWKV/RWKV7-Goose-World3-1.5B-HF è un buon esempio dell'attuale attrito. È un modello BF16 da 1,52 miliardi di parametri con il tokenizer RWKV World, licenza Apache 2.0, taggato custom_code, che elenca inglese, cinese, giapponese, coreano, francese, arabo, spagnolo e portoghese. Le sue istruzioni dicono di installare flash-linear-attention e una versione recente di transformers prima del caricamento. E nella barra laterale, dove un modello ospitato mostrerebbe i provider, dice chiaramente: questo modello non è distribuito da alcun Inference Provider.
Quindi le tue opzioni oggi sono tutte self-service:
• flash-linear-attention plus trust_remote_code — la più vicina all'uso normale dell'Hub, ma stai eseguendo codice del repository e includendo kernel Triton, il che ti vincola sull'hardware e su qualsiasi cosa soggetta a revisione di sicurezza.
• GGUF via llama.cpp — la via meglio supportata nella pratica, anche per la 13.3B, e quella che i numeri dei download dicono che le persone scelgono davvero. Ottima per l'inferenza locale, non un percorso di addestramento o fine-tuning.
• Il runtime del progetto stesso — il pacchetto pip rwkv e il repository di riferimento, il più vicino al canonico, il più lontano dagli strumenti che il tuo team già possiede.
Nessuna di queste è un'API che puoi chiamare, e vale la pena essere diretti sull'implicazione: RWKV-7 non è su OrcaRouter, perché non è un endpoint ospitato da nessuna parte che possiamo trovare. Se vuoi RWKV-7, esegui RWKV-7. Quello che possiamo dire onestamente è dove questo lascia il resto dello stack. Valutare un'architettura non provata è economico solo se il tuo percorso di produzione non dipende dall'esito, e il modo più economico per mantenerlo vero è non avere un'integrazione per-vendor per nient'altro — una chiave compatibile con OpenAI su più di 200 modelli, prezzo di listino del fornitore passato direttamente con margine 0%, e failover automatico quando un fornitore degrada. Poi un esperimento self-hosted di RWKV-7 sui due carichi di lavoro dove la memoria costante paga davvero — uno stream di lunga durata, un assistente on-device, un riassuntore che non si ferma mai — è un esperimento, non una migrazione. Questa è la forma che la maggior parte dei team dovrebbe volere qui: un default instradato, e un modello basato su stato che si guadagna l'ingresso su un lavoro specifico.
Cosa potrebbe ancora fermare questo atterraggio?
Prendete sul serio il precedente: una proposta per aggiungere questa stessa architettura era già stata rifiutata una volta, per ragioni che l'autore riconosce essere valide. La nuova è meglio argomentata e meglio testata, ed è comunque una PR della community a un repository che è deliberatamente conservativo nell'accettare architetture che poi dovrà mantenere per sempre.
Le specifiche domande aperte a cui vorremmo una risposta prima di considerare questo concluso:
• Review, non CI — le suite automatizzate sono verdi; due maintainer sono stati interpellati e nessuno dei due ha approvato. Transformers richiede una review approvata, e i test lenti non sono stati eseguiti.
• La velocità del percorso senza dipendenze — PyTorch puro con decodifica sequenziale a token singolo è portabile, e la portabilità è il punto centrale, ma la PR non pubblica il throughput rispetto ai kernel Triton in flash-linear-attention. Se la decodifica nativa è materialmente più lenta, la libreria diventa il percorso di compatibilità mentre il serving serio rimane altrove.
• Quali checkpoint arrivano — le conversioni conformi alla convenzione coprono da 0.1B a 7.2B. Il G1 da 13.3B, che è quello che le persone vogliono davvero, non è in questo set, e l'esempio documentato è un modello Pile con un tokenizer GPT-NeoX piuttosto che un modello chat con vocabolario World. Un loader unificato senza un checkpoint di punta alle spalle cambia meno di quanto sembri.
• Il bersaglio in movimento — il progetto non è fermo. Il repository G1 di BlinkDL è stato aggiornato la stessa settimana in cui è stata aperta questa PR, le quantizzazioni della community sono passate a revisioni dei dati successive a G1c, e RWKV-8 "Heron" è stato presentato in anteprima pubblica con un meccanismo basato su un automa dei suffissi chiamato ROSA. Heron non è stato rilasciato né sottoposto a benchmark; lo menzioniamo solo perché un'integrazione di libreria che arriva tardi nella vita di una generazione ha una breve durata.
Quattro domande a cui la scheda tecnica non risponde
Posso usare RWKV-7 in Transformers adesso, o no?
Entrambe, fastidiosamente, e la distinzione è l'intera questione. Oggi puoi caricare un checkpoint RWKV-7 tramite l'API transformers, se installi flash-linear-attention e passi trust_remote_code affinché venga eseguito il file di modellazione del repository stesso. Quello che non puoi fare è caricarlo dalla libreria stessa, il che è ciò che lo fa funzionare per impostazione predefinita negli strumenti costruiti sulla libreria — script di training e allineamento, adapter, harness di valutazione, percorsi di esportazione — e ciò che gli consente di superare una policy che vieta il codice remoto. Quella seconda cosa è ciò a cui serve #47780.
La fusione rende il modello migliore?
Non per un singolo punto su alcun benchmark. Cambia la distribuzione, non la qualità — e per un'architettura il cui problema non è mai stato la qualità, la distribuzione è il vincolo stringente. Il confronto è quello in cima a questo pezzo: un modello da 169M del 2023 che supera in download i pesi dell'attuale generazione di quaranta a uno, interamente in virtù del caricamento senza flag.
Se non c'è cache KV, ottengo contesto illimitato gratuitamente?
Ottieni una lunghezza del contesto illimitata senza l'esplosione della memoria, il che non equivale a un recupero illimitato. Uno stato di dimensioni fisse ha una capacità informativa fissa; forniscigli un milione di token e non potrà contenere un milione di token di dettagli recuperabili. L'attention con una cache completa può farlo, a un costo che cresce lungo tutto il percorso. Tratta la storia del long-context di RWKV-7 come «scorre per sempre a basso costo, comprimendo mentre avanza», e verifica il recupero specifico di cui hai bisogno piuttosto che fidarti della parola 'infinito'.
Vale la pena preoccuparsene a 13.3B quando i modelli di frontiera sono centinaia di miliardi?
Dipende interamente da quanto la memoria costante valga per te. Se stai chiamando un'API hosted e paghi per token, quasi sicuramente no — la frontiera è molto più avanti in termini di capacità e non stai pagando direttamente per la cache KV. Se stai distribuendo l'inferenza su hardware che non controlli, o gestendo uno stream persistente in cui una cache in crescita è ciò che alla fine uccide il processo, un'architettura la cui impronta di memoria non si muove è un tipo diverso di risposta a una domanda diversa. Sono questi i carichi di lavoro in cui un RWKV-7 da 2.9B è stato silenziosamente competitivo, e sono quelli in cui un loader nativo avrebbe la massima importanza.
Cosa guarderemmo dopo
Quattro segnali concreti, in ordine approssimativo di quanto cambierebbero la nostra lettura. Una recensione favorevole di ArthurZucker o Rocketknight1, che trasformerebbe questo da un diff promettente in una funzionalità programmata. Una conversione conforme alle convenzioni del G1 13.3B con il tokenizer World, che è ciò che rende il loader degno di essere tenuto. Numeri di throughput pubblicati per il percorso di decode senza dipendenze rispetto ai kernel Triton, che determinano se il supporto nativo sia un'opzione di serving o uno shim di compatibilità. E qualsiasi segno di RWKV-8, che ti direbbe se questa integrazione arriva all'inizio di una generazione o alla fine di una.
Fino ad almeno la prima di queste, il riepilogo corretto è quello poco edificante: RWKV-7 (Goose) è reale, con licenza permissiva, scaricabile fino a 13.3B, e ancora non caricabile nativamente nella libreria su cui è costruita la maggior parte dell'ecosistema. Una pull request aperta il 4 agosto 2026 propone di risolvere il problema. Non è stata ancora unita, e le pull request per aggiungere architetture a transformers vengono chiuse.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
