RWKV-7 Goose-1
Engineering & Research

RWKV-7 (Goose): Inuti pull requesten som äntligen skulle ladda in den i Transformers

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den mest nedladdade RWKV-modellen på Hugging Face förra månaden var inte RWKV-7 (Goose), arkitekturen som projektet har släppt sedan mars 2025, och det var inte RWKV7-G1, resonemangsserien som tränats ovanpå den. Det var RWKV/rwkv-4-169m-pile: en RWKV-4-checkpoint med 169 miljoner parametrar från maj 2023, med 8 824 nedladdningar under de 30 dagarna fram till 5 augusti 2026, jämfört med 215 för 1,5B RWKV-7 Goose World-3-släppet och 316 för 2,9B. 2023-modellen är inte bättre. Det är den som laddas med ett vanligt from_pretrained-anrop och inget annat installerat.

Den 4 augusti 2026 öppnade en bidragsgivare vid namn Hakureirm pull request #47780 mot huggingface/transformers, med titeln "Add RWKV-7 (Goose)". Per den 5 augusti är den öppen, ogranskad och inte sammanfogad, och det är det andra försöket – ett tidigare förslag, #46984, avvisades. Inget har landat, och den här texten ska inte läsas som ett lanseringsmeddelande. Men diffen är offentlig, och den tar itu med den enskilt mest tråkiga och mest avgörande saken som står mellan den längst pågående uppmärksamhetsfria LLM-släktlinjen och de stackar som de flesta team faktiskt använder: en loader.

Följande text åtskiljer tre typer av påståenden, eftersom bevakningen av RWKV vanligtvis blandar ihop dem. Det finns det som är verifierbart i pull requesten och på Hub, vilket du kan kontrollera själv. Det finns det som RWKV-projektet rapporterar om sina egna modeller, i sina egna utvärderingar. Och det finns den stora mängden frågor som ingen har besvarat offentligt, och det är där det mesta av den intressanta risken ligger.

Vad finns egentligen i pull requesten?

RWKV-7 Goose-2

De mekaniska fakta, avlästa från PR-sidan och GitHub API:t den 5 augusti 2026:

Omfattning — tre commits, 12 filer ändrade, 4 423 rader tillagda och noll borttagna, från grenen add-rwkv7-upstream till huggingface:main. Märkt ”Ny modell”. Ingen tilldelad, ingen milstolpe.

Vad det tillför — RWKV-7 som två publika klasser, Rwkv7Model och Rwkv7ForCausalLM, tillsammans med en Rwkv7Cache byggd på bibliotekets LinearAttentionLayer. WKV-tillståndets dtype kan konfigureras oberoende av modellens dtype, vilket är viktigt eftersom det återkommande tillståndet är där numerisk drift ackumuleras i denna familj.

Hur det körs — portabel PyTorch utan tredjeparts runtime-beroende. Prefill använder en chunk-parallell form av rekursionen; avkodningen kör en sekventiell bana med en token i taget. Parameternamn följer uppströms RWKV-referensimplementering snarare än att döpas om för att se transformer-liknande ut.

Testhållning — utöver de vanliga modellmixinerna, ett integrationstest som matchar BlinkDL:s egen runtime token-för-token, plus en NumPy-referensimplementering som inte delar någon kod med modelleringsfilen. Repots CI-recap-bot rapporterar den senaste körningen som lyckad: 16 jobb, 179 151 tester, noll fel, 16 timmar och 9 minuters beräkningstid.

Var det står — granskning har begärts från ArthurZucker och Rocketknight1; sidan anger att minst en godkänd granskning krävs för att slå samman, och ingen av dem har getts. GitHubs API beskrev fortfarande sammanslagningsstatusen som "instabil" när vi läste den, och en bot för underhållare har bett att de långsamma testsviterna (auto och rwkv7) ska köras innan sammanslagningen. Med andra ord: grönt på den snabba CI:n, ännu inte välsignad av en människa.

Det mest intressanta i beskrivningen är medgivandet. Det tidigare försöket, #46984, avvisades eftersom de publicerade RWKV-7-checkpoints inte följde Transformers konventioner, och författarens egen beskrivning är att ”den invändningen var korrekt.” Problemet, som beskrivs i PR:n, är att RWKV-7-vikterna på Hub finns i två former som inte kan användas av biblioteket:

PTH-repositoryerna — råa .pth-filer, inga safetensors. En biblioteksimplementation kan inte läsa in dem, och PyTorch-picklefiler är precis vad en säkerhetsgranskning på ett stort företag kommer att avvisa.

HF-repositories — dessa innehåller model.safetensors, men varje innehåller också en modeling_rwkv7.py och en auto_map, så att ladda en kräver trust_remote_code. Det är fjärrkörning av kod som ett villkor för inferens, vilket är anledningen till att så många företagschecklistor stannar där.

Så PR:en gör två saker samtidigt. Den lägger till en modelleringsfil och pekar på en ny uppsättning konverteringar som gjorts direkt från de kanoniska BlinkDL .pth-utgåvorna som följer standardlayouten — endast safetensors, ingen pickle, ingen fjärrkod, en normal config.json som bär architectures och model_type — allt från 0,1B till 7,2B. Den minsta, Hakureirm/rwkv7-168m-pile-hf, har alla sina 399 tensorer verifierade som bitidentiska mot källans .pth i stället för stickprovskontrollerade. Den checkpointen är en Pile-modell, så dess tokenizer är den vanliga GPT-NeoX-20B-snabbtokenizern snarare än RWKV World-vokabuläret — av samma anledning som bibliotekets befintliga RWKV-sida också dokumenterar en Pile-checkpoint.

Varför en checkpoint från 2023 laddas ner mer än den nuvarande arkitekturen

RWKV-7 Goose-3

Transformers är i version 5.14.1, släppt 16 juli 2026. Sök efter RWKV i dess dokumentation så får du exakt en modellsida, som beskriver "RWKV-modellen (version 4)", som lades till för flera år sedan, med RWKV/rwkv-4-169m-pile som exempel och ett standardvokabulär på 50 277 tokens. Det finns inga sidor för RWKV-5, RWKV-6 eller RWKV-7. Tre arkitekturgenerationer har släppts sedan bibliotekets RWKV-stöd skrevs, och ingen av dem finns i det.

Nedladdningssiffrorna visar vad ekosystemet gjorde åt det: det kringgick biblioteket. Sorterat efter nedladdningar de senaste 30 dagarna är de främsta RWKV-7-repon BlinkDL:s råa .pth-utgåvor (rwkv7-g1 med 8 288, rwkv-7-world med 4 489) och ett tjockt lager av communityns GGUF-kvantiseringar av 13.3B G1 – flera separata uppladdare som var och en står för mellan ett och tre tusen nedladdningar i månaden. De officiella transformers-format-speglarna ligger två storleksordningar under de råa vikterna. Flash-linear-attention-spegeln av 2.9B G1 når 1 843.

Det mönstret har en enkel förklaring. llama.cpp lade till RWKV v7-stöd den 17 mars 2025 — en GGML_OP_RWKV_WKV7-kärna med CPU-, CUDA-, SYCL-, Vulkan- och Metal-backend — ungefär en dag efter att papperet lades upp. Om du ville köra RWKV-7 på din egen maskin, var den snabba vägen GGUF, och det har den varit i sexton månader. Den väg som inte fanns var den som vartenda finjusteringsskript, varje PEFT-adapter, varje utvärderingsramverk och varje internt serveringswrapper förutsätter: AutoModelForCausalLM.from_pretrained, utan flaggor.

Vad RWKV-7 (Goose) egentligen är

RWKV-7 är ett rekurrent neuralt nätverk, inte en transformer med en billigare uppmärksamhetskärna, och namngivningen förvirrar ständigt folk. Den bär ett tillstånd av fast storlek framåt genom sekvensen i stället för en växande cache av tidigare nycklar och värden. Konkret, jämfört med en standarduppmärksamhetsmodell:

Minne i takt med att kontexten växer — en transformers KV-cache växer linjärt med antalet tokens som behandlas; RWKV-7 behåller ett tillstånd vars storlek bestäms av arkitekturen, inte av konversationen. Det är hela effektivitetsargumentet.

Kostnad per token — attention kostar mer per token när kontexten blir längre; RWKV-7:s inferenskostnad per token är konstant, vilket är anledningen till att den ständigt dyker upp i edge- och always-on-stream-förslag.

Träningsform — till skillnad från en klassisk RNN är rekursionen parallelliserbar över ett block, så förträning degenererar inte till en sekventiell krypning. Det är vad PR:ns block-parallella förfyllningssökväg implementerar.

Kontexttak — det finns ingen cache att spränga, så projektet marknadsför i praktiken obegränsad kontext. Vad ett fast tillstånd inte kan göra är att innehålla obegränsad detaljrikedom, vilket är en verklig begränsning snarare än en fotnot.

Det arkitektoniska påståendet i uppsatsen, publicerad den 18 mars 2025 av Bo Peng, Yu Zhang, Songlin Yang och Ruichong Zhang under RWKV-projektet vid LF AI & Data Foundation, är en generaliserad deltaregel med vektorvärd portning, inlärningshastigheter i kontexten och en avslappnad värdeersättningsregel, plus en förenklad MLP (portmatrisen borttagen, den dolda dimensionen breddad för att kompensera). Det teoretiska resultatet som kopplas till detta är den mer provocerande hälften: RWKV-7 kan utföra tillståndsspårning och känna igen alla reguljära språk samtidigt som den förblir parallelliserbar i träningen, vilket författarna hävdar överträffar vad transformatorer kan göra under standardmässiga komplexitetsförmodanden.

Allt är Apache 2.0. Familjen du kan ladda ner omfattar 0,1B (12 lager, bredd 768), 0,4B (24 / 1024), 1,5B (24 / 2048), 2,9B (32 / 2560), 7,2B (32 / 4096) och 13,3B (61 lager, bredd 4096), alla med ett World-ordförråd på 65 536 token och huvudstorlek 64. Bas-World-serien tränades på en flerspråkig korpus på 3,1 biljoner token; G1-serien ”GooseOne” fortsätter den träningen på World v3.5, en utökad blandning på 5,16 biljoner token med fler romaner, mer webbtext, matematik, kod och resonemangsdata. G1-kontrollpunkter lägger till ett think-tag-resonemangsläge, JSON-funktionsanrop och ifyllnad-i-mitten från och med G1c. Namngivningen är verkligen besvärlig: G0 innebär mindre än en epok, G1 innebär mer än en, och suffixbokstäverna markerar datarevisioner, där senare bokstäver bär med sig bättre data.

Siffrorna, och vems siffror de är.

Här är det ärliga läget vad gäller bevisen. Det huvudsakliga benchmark-påståendet — att 2.9B-modellen satte en ny 3B-state-of-the-art på flerspråkiga uppgifter och matchade den engelskspråkiga 3B-state-of-the-art med dramatiskt färre träningstoken — är papperets eget, publicerat i mars 2025 och utvärderat mot den periodens 3B-modeller. Det gick igenom OpenReview, vilket är mer granskning än vad en leverantörs blogginlägg får, och det är fortfarande ett självrapporterat resultat på en femton månader gammal jämförelseuppsättning.

Projektets andra offentliga mätning, UncheatableEval, är mer intressant än en rad i en ledartavla och får nästan ingen uppmärksamhet. Istället för att poängsätta multiple choice-benchmarks som läcker in i träningsdata, mäter den kompressionsgrad på data som inte existerade när modellen tränades: nya arXiv-artiklar, färska GitHub-repositories, senaste nyheter. Den designen gör kontaminering mycket svårare, och RWKV rapporterar att de är konkurrenskraftiga med transformatorer av samma storlek på den. Det är fortfarande en utvärdering som projektet kör på sig själv.

Det som inte existerar, såvitt vi kan se, är ett oberoende tredjepartsindexvärde för någon RWKV-7-checkpoint — ingen neutral aggregator har kört 7.2B eller 13.3B genom den testmiljö som används på frontmodeller. Så jämförelser du kan se mot modeller som DeepSeek V4 Flash eller Qwen3.8-Max är kategorifel två gånger om: ingen har kört RWKV-7 på samma utvärdering, och en 13.3B dense RNN tävlar inte om samma arbete som ett frontsystem. Det försvarbara påståendet är snävare och mer användbart: från 1.5B till 13.3B, med konstant minne, på runt tolv språk, med permissiva vikter.

Att köra RWKV-7 idag, och vad det kostar dig

RWKV-7 Goose-4

Hubbsidan för RWKV/RWKV7-Goose-World3-1.5B-HF är ett bra exempel på den nuvarande friktionen. Det är en BF16-modell med 1,52 miljarder parametrar och RWKV World-tokenizern, Apache 2.0, taggad custom_code, som listar engelska, kinesiska, japanska, koreanska, franska, arabiska, spanska och portugisiska. Instruktionerna säger att du ska installera flash-linear-attention och en nyare version av transformers innan du laddar modellen. Och i sidofältet, där en värdmodell skulle visa leverantörer, står det rakt av: den här modellen är inte distribuerad av någon Inference Provider.

Så dina alternativ idag är alla självbetjäning:

flash-linear-attention plus trust_remote_code — närmast normal Hub-användning, men du kör repo-kod och drar in Triton-kärnor, vilket begränsar dig när det gäller hårdvara och allt som genomgår säkerhetsgranskning.

GGUF via llama.cpp — den bäst understödda vägen i praktiken, inklusive för 13.3B, och den som nedladdningssiffrorna visar att folk faktiskt använder. Utmärkt för lokal inferens, inte en väg för träning eller finjustering.

Projektets egen runtime — pip-paketet rwkv och referensarkivet, närmast kanon, längst från de verktyg som ditt team redan har.

Ingen av dessa är ett API du kan anropa, och det är värt att vara rak med vad det innebär: RWKV-7 finns inte på OrcaRouter, eftersom den inte är en hostad slutpunkt någonstans som vi kan hitta. Vill du ha RWKV-7, så kör du RWKV-7. Vad vi ärligt talat kan säga är var det lämnar resten av stacken. Att utvärdera en obeprövad arkitektur är bara billigt om din väg till produktion inte beror på resultatet, och det billigaste sättet att se till att det förblir sant är att inte ha en integration per leverantör för något annat — en OpenAI-kompatibel nyckel för över 200 modeller, leverantörens listpris som skickas vidare rakt igenom med 0 % påslag, och automatisk failover när en leverantör försämras. Då är ett självhostat RWKV-7-experiment på de två arbetsbelastningarna där konstant minne faktiskt lönar sig — en långvarig ström, en assistent på enheten, en sammanfattare som aldrig stannar — ett experiment, inte en migrering. Det är den form de flesta team borde vilja ha här: en routad standard, och en tillståndsbaserad modell som förtjänar sin plats på ett specifikt jobb.

Vad kan fortfarande stoppa denna landning?

Ta prejudikatet på allvar: ett förslag om att lägga till exakt denna arkitektur avslogs redan en gång, på grunder som författaren medger var giltiga. Det nya förslaget är bättre argumenterat och bättre testat, och det är fortfarande en community-PR mot ett repository som medvetet är konservativt när det gäller att anta arkitekturer som det sedan måste underhålla för alltid.

De specifika öppna frågor vi skulle vilja ha svar på innan vi anser detta klart:

Granskning, inte CI — de automatiska testsviterna är gröna; två underhållare har tillfrågats och ingen har godkänt. Transformers kräver en godkänd granskning, och de långsamma testerna har inte körts.

Den beroendefria vägens hastighet — ren PyTorch med sekventiell avkodning av en token i taget är portabel, och portabilitet är hela poängen, men PR:en publicerar inte genomströmning jämfört med Triton-kärnorna i flash-linear-attention. Om den inbyggda avkodningen är väsentligt långsammare, blir biblioteket kompatibilitetsvägen medan seriös serving förblir på annat håll.

Vilka checkpoints som kommer — de konventionsenliga konverteringarna täcker 0.1B till 7.2B. 13.3B G1, som är den som folk faktiskt vill ha, ingår inte i den uppsättningen, och det dokumenterade exemplet är en Pile-modell med en GPT-NeoX-tokenizer snarare än en chatmodell med World-vokabulär. En sammanslagen loader utan någon flaggskepps-checkpoint bakom sig förändrar mindre än vad det ser ut att göra.

Det rörliga målet — projektet står inte stilla. BlinkDL:s G1-repository uppdaterades samma vecka som denna PR öppnades, community-kvantiseringar har gått vidare till senare datarevisioner än G1c, och RWKV-8 "Heron" har förhandsvisats offentligt med en suffixautomatmekanism som kallas ROSA. Heron är inte släppt och inte benchmarkad; vi nämner det endast för att en biblioteksintegration som kommer sent i en generations livslängd har en kort hållbarhetstid.

Fyra frågor som specifikationsbladet inte besvarar

Kan jag använda RWKV-7 i Transformers just nu, eller inte?

Båda, irriterande nog, och skillnaden är hela historien. Du kan ladda en RWKV-7-checkpoint genom transformers API idag, om du installerar flash-linear-attention och skickar med trust_remote_code så att repositoryts egen modellfil körs. Vad du inte kan göra är att ladda den från själva biblioteket, vilket är det som får det att fungera som standard i verktygen som bygger på biblioteket – tränings- och anpassningsskript, adaptrar, utvärderingsramverk, exportsökvägar – och det som gör att det klarar en policy som förbjuder fjärrkod. Den andra saken är vad #47780 är till för.

Gör sammanslagning modellen bättre?

Inte på en enda punkt på något riktmärke. Det förändrar distributionen, inte kvaliteten – och för en arkitektur vars problem aldrig har varit kvalitet, är distributionen den bindande begränsningen. Jämförelsen är den som står överst i denna text: en 169M-modell från 2023 som har fyrtio gånger fler nedladdningar än nuvarande generations vikter, helt tack vare att den kan laddas utan flaggor.

Om det inte finns någon KV-cache, får jag då obegränsad kontext gratis?

Du får obegränsad kontextlängd utan minnesexplosion, vilket inte är samma sak som obegränsad återkallelse. Ett tillstånd med fast storlek har en fast informationskapacitet; mata det med en miljon tokens så kan det inte rymma en miljon tokens värt av hämtningsbara detaljer. Attention med en full cache kan, till en kostnad som växer hela vägen. Betrakta RWKV-7:s långkontextberättelse som "strömmar för evigt billigt, komprimerar allt eftersom," och testa den specifika hämtning du behöver snarare än att lita på ordet oändlig.

Är det värt att bry sig om vid 13,3B när frontmodellerna är hundratals miljarder?

Det beror helt på om konstant minne är värt något för dig. Om du anropar ett hostat API och betalar per token, så är det nästan säkert inte — frontlinjen ligger långt före kapacitetsmässigt och du betalar inte direkt för KV-cachen. Om du däremot distribuerar inferens till hårdvara du inte kontrollerar, eller kör en kontinuerlig ström där en växande cache är det som till slut fäller processen, är en arkitektur vars minnesfotavtryck inte rör sig ett annat slags svar på en annan fråga. Det är de arbetsbelastningarna där en 2,9B RWKV-7 har varit tyst konkurrenskraftig, och det är de där en inbyggd inläsare skulle spela störst roll.

Vad vi skulle titta på härnäst

Fyra konkreta signaler, i ungefärlig ordning efter hur mycket de skulle förändra vår bedömning. En godkännande recension från ArthurZucker eller Rocketknight1, som förvandlar detta från en hoppfull diff till en planerad funktion. En konventionsenlig konvertering av 13.3B G1 med World-tokenizern, vilket är det som gör loadern värd att ha. Publicerade genomströmningssiffror för den beroendefria avkodningsvägen jämfört med Triton-kärnorna, vilket avgör om native-stöd är ett serveringsalternativ eller en kompatibilitetsshim. Och vilket tecken som helst på RWKV-8, som skulle berätta för dig om denna integration anländer i början av en generation eller i slutet av en.

Åtminstone fram till det första av dessa är den korrekta sammanfattningen den oglamorösa: RWKV-7 (Goose) är verklig, har en tillåtande licens, är nedladdningsbar upp till 13,3B, och är fortfarande inte inbyggt laddningsbar i det bibliotek som större delen av ekosystemet bygger på. En pull request som öppnades den 4 augusti 2026 föreslår en åtgärd. Den har inte slagits samman, och pull requests för att lägga till arkitekturer i transformers kan stängas.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube