
RWKV-7 (Goose): Wewnątrz pull requesta, który w końcu załaduje go w Transformers
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
Najczęściej pobieranym modelem RWKV na Hugging Face w zeszłym miesiącu nie był RWKV-7 (Goose), architektura, którą projekt udostępnia od marca 2025, ani też RWKV7-G1, seria rozumująca wytrenowana na jej bazie. Był to RWKV/rwkv-4-169m-pile: punkt kontrolny RWKV-4 ze 169 milionami parametrów z maja 2023, z 8 824 pobraniami w ciągu 30 dni do 5 sierpnia 2026, wobec 215 dla wydania 1.5B RWKV-7 Goose World-3 i 316 dla 2.9B. Model z 2023 roku nie jest lepszy. To ten, który ładuje się zwykłym wywołaniem from_pretrained i bez instalowania czegokolwiek innego.
4 sierpnia 2026 roku współtwórca o pseudonimie Hakureirm otworzył pull request #47780 w huggingface/transformers, zatytułowany „Add RWKV-7 (Goose)”. Na dzień 5 sierpnia pozostaje on otwarty, niezrecenzowany i niezmergowany, a to już druga próba — wcześniejsza propozycja, #46984, została odrzucona. Nic nie trafiło do repozytorium i nie należy czytać tego tekstu jako zapowiedzi wydania. Diff jest jednak publiczny i dotyczy tej jednej, najbardziej nudnej, a zarazem najbardziej brzemiennej w skutki rzeczy, która dzieli najdłużej działającą linię modeli LLM bez mechanizmu uwagi od stosów technologicznych, z których faktycznie korzysta większość zespołów: loadera.
Poniższe rozróżnia trzy rodzaje twierdzeń, ponieważ relacje na temat RWKV zwykle je ze sobą mieszają. Jest to, co weryfikowalnie znajduje się w pull requeście i na Hubie, co możesz sprawdzić sam. Jest to, co projekt RWKV raportuje o własnych modelach, we własnych ewaluacjach. Oraz jest to duży zbiór pytań, na które nikt publicznie nie odpowiedział, i to tam mieszka większość interesującego ryzyka.
Co właściwie znajduje się w pull requeście?

Suche fakty, odczytane ze strony PR i API GitHuba 5 sierpnia 2026:
• Zakres — trzy commity, 12 zmienionych plików, 4 423 linie dodane i zero usuniętych, z gałęzi add-rwkv7-upstream do huggingface:main. Oznaczono etykietą „New model”. Brak przypisanego użytkownika, brak kamienia milowego.
• Co dodaje — RWKV-7 jako dwie publiczne klasy, Rwkv7Model i Rwkv7ForCausalLM, wraz z Rwkv7Cache zbudowanym na LinearAttentionLayer z tej biblioteki. Dtype stanu WKV można konfigurować niezależnie od dtype modelu, co ma znaczenie, ponieważ to w stanie rekurencyjnym w tej rodzinie modeli kumuluje się dryf numeryczny.
• Jak to działa — przenośny PyTorch bez zależności od zewnętrznego środowiska uruchomieniowego. Prefill wykorzystuje rekurencję przetwarzaną równolegle w blokach; dekodowanie działa sekwencyjnie, token po tokenie. Nazwy parametrów są zgodne z implementacją referencyjną RWKV z upstreamu, zamiast zostać przemianowane, aby przypominały transformery.
• Podejście do testów — poza standardowymi miksinami modeli, test integracyjny zgodny token po tokenie z własnym środowiskiem uruchomieniowym BlinkDL oraz referencyjna implementacja w NumPy, która nie dzieli żadnego kodu z plikiem modelowania. Bot podsumowujący CI w repozytorium raportuje, że najnowsze uruchomienie zakończyło się sukcesem: 16 zadań, 179 151 testów, zero niepowodzeń, 16 godzin i 9 minut obliczeń.
• Stan sprawy — poproszono o przegląd od ArthurZucker i Rocketknight1; strona podaje, że do scalenia wymagany jest co najmniej jeden zatwierdzający przegląd, i żaden nie został jeszcze udzielony. API GitHuba, gdy go czytaliśmy, nadal opisywało stan scalenia jako „unstable”, a bot skierowany do opiekunów poprosił o uruchomienie zestawów testów wolnych (auto i rwkv7) przed scaleniem. Innymi słowy: zielono na szybkim CI, ale jeszcze nie zatwierdzony przez człowieka.
Najbardziej interesującą częścią opisu jest przyznanie racji. Wcześniejsza próba, #46984, została odrzucona, ponieważ opublikowane punkty kontrolne RWKV-7 nie były zgodne z konwencjami Transformers, a sam autor ujmuje to tak, że „ten zarzut był słuszny”. Problem opisany w PR polega na tym, że wagi RWKV-7 w Hubie występują w dwóch kształtach, których biblioteka nie może użyć:
• Repozytoria PTH — surowe pliki .pth, bez safetensors. Implementacja biblioteczna nie może ich wczytać, a pliki pickle PyTorch są dokładnie tym, co odrzuci przegląd bezpieczeństwa w dużej firmie.
• Repozytoria HF — dostarczają one plik model.safetensors, ale każde zawiera także plik modeling_rwkv7.py i auto_map, więc wczytanie takiego repozytorium wymaga trust_remote_code. To zdalne wykonywanie kodu jako warunek wnioskowania, dlatego tak wiele korporacyjnych list kontrolnych na tym poprzestaje.
Więc ten PR robi dwie rzeczy naraz. Dodaje plik modelowania i wskazuje na świeży zestaw konwersji wykonanych bezpośrednio z kanonicznych wydań .pth BlinkDL, które są zgodne ze standardowym układem — wyłącznie safetensors, bez pickle, bez zdalnego kodu, normalny config.json zawierający architectures i model_type — obejmujący zakres od 0,1B do 7,2B. Najmniejszy, Hakureirm/rwkv7-168m-pile-hf, ma wszystkie 399 swoich tensorów zweryfikowanych jako bitowo identyczne ze źródłowym .pth, a nie tylko sprawdzonych wyrywkowo. Ten checkpoint jest modelem Pile, więc jego tokenizator to zwykły szybki tokenizator GPT-NeoX-20B, a nie słownik RWKV World — z tego samego powodu, dla którego istniejąca strona RWKV w bibliotece dokumentuje również checkpoint Pile.
Dlaczego checkpoint z 2023 roku ma więcej pobrań niż obecna architektura

Transformers jest w wersji 5.14.1, wydanej 16 lipca 2026 r. Wyszukując w jego dokumentacji RWKV, otrzymasz dokładnie jedną stronę modelu, opisującą „model RWKV (wersja 4)", dodaną lata temu, z RWKV/rwkv-4-169m-pile jako przykładem i domyślnym słownikiem liczącym 50 277 tokenów. Nie ma stron dla RWKV-5, RWKV-6 ani RWKV-7. Od czasu napisania obsługi RWKV w bibliotece ukazały się trzy generacje architektury i żadna z nich się w niej nie znalazła.
Liczby pobrań pokazują, co zrobił z tym ekosystem: ominął bibliotekę. Sortując według liczby pobrań z ostatnich 30 dni, czołowymi repozytoriami RWKV-7 są surowe wydania .pth BlinkDL (rwkv7-g1 — 8288, rwkv-7-world — 4489) oraz gruba warstwa społecznościowych kwantyzacji GGUF modelu 13.3B G1 — kilku niezależnych uploaderów, z których każdy notuje od jednego do trzech tysięcy pobrań miesięcznie. Oficjalne lustra w formacie transformers znajdują się o dwa rzędy wielkości poniżej surowych wag. Lustro flash-linear-attention modelu 2.9B G1 osiąga 1843 pobrania.
Ten wzorzec ma proste wytłumaczenie. {{1}}llama.cpp dodało obsługę RWKV v7 17 marca 2025{{/1}} — {{2}}jądro GGML_OP_RWKV_WKV7 z backendami CPU, CUDA, SYCL, Vulkan i Metal{{/2}} — {{3}}około dzień po opublikowaniu artykułu.{{/3}} {{4}}Jeśli chciałeś uruchomić RWKV-7 na własnej maszynie, szybka ścieżka to GGUF — i tak jest od szesnastu miesięcy.{{/4}} {{5}}Ścieżka, która nie istniała, to ta, którą zakłada każdy skrypt do fine-tuningu, każdy adapter PEFT, każdy harness ewaluacyjny i każda wewnętrzna nakładka serwująca:{{/5}} {{6}}AutoModelForCausalLM.from_pretrained, bez żadnych flag.{{/6}}
Czym RWKV-7 (Goose) naprawdę jest
RWKV-7 jest rekurencyjną siecią neuronową, a nie transformerem z tańszym jądrem uwagi, a nazewnictwo nieustannie myli ludzi. Przenosi stan o stałym rozmiarze wzdłuż sekwencji zamiast rosnącej pamięci podręcznej poprzednich kluczy i wartości. Konkretnie, w porównaniu do standardowego modelu uwagi:
• Pamięć wraz ze wzrostem kontekstu — pamięć podręczna KV transformera rośnie liniowo wraz z liczbą przetwarzanych tokenów; RWKV-7 utrzymuje stan, którego rozmiar jest wyznaczany przez architekturę, a nie przez rozmowę. To jest cały argument dotyczący wydajności.
• Koszt za token — uwaga kosztuje więcej na token, gdy kontekst się wydłuża; koszt inferencji na token w RWKV-7 jest stały, dlatego nieustannie pojawia się w propozycjach dotyczących przetwarzania brzegowego i strumieniowania w trybie ciągłym.
• Kształt trenowania — w przeciwieństwie do klasycznego RNN, rekurencja jest równoległa w obrębie chunku, więc pretrenowanie nie degeneruje się do sekwencyjnego pełzania. To właśnie implementuje ścieżka prefill z równoległością w obrębie chunku w PR.
• Limit kontekstu — nie ma pamięci podręcznej, którą można by przeciążyć, więc projekt reklamuje praktycznie nieograniczony kontekst. To, czego stały stan nie może zrobić, to pomieścić nieograniczone szczegóły, co jest realnym ograniczeniem, a nie przypisem.
Opublikowane 18 marca 2025 roku twierdzenie architektoniczne w artykule autorstwa Bo Penga, Yu Zhanga, Songlina Yanga i Ruichonga Zhanga, powstałym w ramach projektu RWKV przy fundacji LF AI & Data Foundation, dotyczy uogólnionej reguły delta z bramkowaniem wektorowym, współczynnikami uczenia w kontekście i złagodzoną regułą zastępowania wartości, a także uproszczonego MLP (usunięto macierz bramkowania, zwiększając szerokość ukrytą, aby to zrekompensować). Wynik teoretyczny powiązany z tym twierdzeniem jest bardziej prowokacyjną połową: RWKV-7 potrafi śledzić stan i rozpoznawać wszystkie języki regularne, pozostając równoległym w treningu, co – zdaniem autorów – wykracza poza możliwości transformerów przy standardowych hipotezach złożonościowych.
Wszystko jest na licencji Apache 2.0. Rodzina, którą można pobrać, obejmuje modele 0.1B (12 warstw, szerokość 768), 0.4B (24 / 1024), 1.5B (24 / 2048), 2.9B (32 / 2560), 7.2B (32 / 4096) i 13.3B (61 warstw, szerokość 4096), wszystkie ze słownikiem World liczącym 65 536 tokenów i rozmiarem głowy 64. Podstawowa seria World została wytrenowana na wielojęzycznym korpusie liczącym 3,1 biliona tokenów; seria G1 „GooseOne” kontynuuje trenowanie na World v3.5, rozszerzonej mieszance 5,16 biliona tokenów z większą ilością powieści, tekstów internetowych, matematyki, kodu i danych dotyczących rozumowania. Punkty kontrolne G1 dodają tryb rozumowania ze znacznikiem think, wywoływanie funkcji JSON oraz fill-in-the-middle od wersji G1c wzwyż. Nazewnictwo jest naprawdę niezręczne: G0 oznacza mniej niż jedną epokę, G1 więcej niż jedną, a litery przyrostka oznaczają rewizje danych, przy czym późniejsze litery niosą lepsze dane.
Liczby i czyje to liczby
Oto uczciwy stan dowodów. Sztandarowe twierdzenie benchmarkowe — że model 2.9B ustanowił nowy stan sztuki w klasie 3B w zadaniach wielojęzycznych i dorównał anglojęzycznemu stanowi sztuki w klasie 3B przy dramatycznie mniejszej liczbie tokenów treningowych — pochodzi z samego artykułu, opublikowanego w marcu 2025 roku i ocenianego względem ówczesnych modeli 3B. Przeszedł przez OpenReview, co jest większą kontrolą, niż dostaje wpis na blogu dostawcy, a mimo to nadal jest to wynik samodzielnie zgłoszony na zestawie porównawczym sprzed piętnastu miesięcy.
Inny publiczny pomiar projektu, UncheatableEval, jest bardziej interesujący niż pozycja w rankingu i praktycznie nie jest opisywany. Zamiast punktować testy wielokrotnego wyboru, które wyciekają do zbiorów treningowych, mierzy współczynnik kompresji na danych, które nie istniały podczas trenowania modelu: nowych artykułach z arXiv, świeżych repozytoriach GitHub, najnowszych wiadomościach. Taka konstrukcja znacznie utrudnia kontaminację, a RWKV podaje, że na tym tle wypada konkurencyjnie względem transformerów o tej samej wielkości. Wciąż jest to jednak ewaluacja, którą projekt przeprowadza sam na sobie.
Nie istnieje, o ile możemy stwierdzić, żaden niezależny zewnętrzny wynik indeksowy dla jakiegokolwiek punktu kontrolnego RWKV-7 — żaden neutralny agregator nie przepuścił wersji 7.2B ani 13.3B przez zestaw testów, na którym uruchamia najnowocześniejsze modele. Zatem porównania, które możesz widzieć z modelami takimi jak DeepSeek V4 Flash czy Qwen3.8-Max, są podwójnym błędem kategorialnym: nikt nie uruchomił RWKV-7 na tej samej ewaluacji, a gęsty RNN o 13.3B parametrów nie rywalizuje o tę samą pracę co najnowocześniejszy system. Uzasadnione twierdzenie jest węższe i bardziej użyteczne: od 1.5B do 13.3B parametrów, przy stałej pamięci, w około dwunastu językach, z wagami na liberalnej licencji.
Uruchamianie RWKV-7 dzisiaj i ile cię to kosztuje

Strona Hub dla RWKV/RWKV7-Goose-World3-1.5B-HF dobrze obrazuje obecne trudności. To model o 1,52 mld parametrów w formacie BF16 z tokenizerem RWKV World, na licencji Apache 2.0, oznaczony jako custom_code, z listą języków: angielski, chiński, japoński, koreański, francuski, arabski, hiszpański i portugalski. W instrukcjach czytamy, że przed załadowaniem należy zainstalować flash-linear-attention i aktualną wersję transformers. Natomiast na pasku bocznym, gdzie w przypadku hostowanego modelu wyświetliliby się dostawcy, widnieje wprost: ten model nie jest wdrożony przez żadnego dostawcę wnioskowania.
Więc wszystkie Twoje dzisiejsze opcje są samoobsługowe:
• flash-linear-attention plus trust_remote_code — najbliżej normalnego korzystania z Huba, ale wykonujesz kod z repozytorium i dołączasz jądra Triton, co ogranicza Cię pod względem sprzętu i wszystkiego, co podlega przeglądowi bezpieczeństwa.
• GGUF przez llama.cpp — najlepiej wspierana ścieżka w praktyce, w tym dla 13.3B, i ta, którą — jak pokazują liczby pobrań — ludzie faktycznie wybierają. Świetna do lokalnej inferencji, nie do trenowania ani dostrajania modeli.
• Własne środowisko uruchomieniowe projektu — pakiet rwkv pip i repozytorium referencyjne, najbliższe kanonowi, najdalsze od narzędzi, które twój zespół już ma.
Żaden z tych nie jest API, które można wywołać, i warto wprost powiedzieć, co to oznacza: RWKV-7 nie ma na OrcaRouter, bo nie jest hostowanym punktem końcowym nigdzie, gdzie moglibyśmy go znaleźć. Jeśli chcesz RWKV-7, uruchamiasz RWKV-7. Co możemy uczciwie powiedzieć, to gdzie to pozostawia resztę stosu. Ocenianie niezweryfikowanej architektury jest tanie tylko wtedy, gdy Twoja ścieżka produkcyjna nie zależy od wyniku, a najtańszym sposobem, aby tak pozostało, jest brak integracji z poszczególnymi dostawcami dla czegokolwiek innego — jeden klucz zgodny z OpenAI dla ponad 200 modeli, cena katalogowa dostawcy przekazywana dalej wprost z 0% marży i automatyczne przełączanie awaryjne, gdy dostawca ulega degradacji. Wtedy samodzielnie hostowany eksperyment z RWKV-7 na dwóch obciążeniach, w których stała pamięć naprawdę się opłaca — długo działający strumień, asystent na urządzeniu, sumaryzator, który nigdy się nie zatrzymuje — jest eksperymentem, a nie migracją. Taki właśnie kształt powinna chcieć tu większość zespołów: domyślny routing i model oparty na stanie, który zapracowuje sobie na miejsce w konkretnym zadaniu.
Co mogłoby jeszcze zatrzymać to lądowanie?
Potraktujcie ten precedens poważnie: propozycja dodania dokładnie tej architektury została już raz odrzucona, z powodów, które autor uznaje za słuszne. Nowa wersja jest lepiej uzasadniona i lepiej przetestowana, a mimo to pozostaje społecznościowym PR-em do repozytorium, które celowo jest konserwatywne w przyjmowaniu architektur, które będzie potem utrzymywać w nieskończoność.
Konkretne otwarte pytania, na które chcielibyśmy uzyskać odpowiedzi, zanim uznamy to za zakończone:
• Przegląd, nie CI — automatyczne zestawy testów są zielone; poproszono dwóch opiekunów i żaden nie zaakceptował. Transformers wymaga jednego zatwierdzającego przeglądu, a wolne testy nie zostały uruchomione.
• Szybkość ścieżki bez zależności — czysty PyTorch z sekwencyjnym dekodowaniem pojedynczego tokena jest przenośny, a przenośność jest całym sednem, ale PR nie publikuje przepustowości w porównaniu z jądrami Triton w flash-linear-attention. Jeśli natywne dekodowanie jest znacznie wolniejsze, biblioteka staje się ścieżką zgodności, podczas gdy poważne serwowanie pozostaje gdzie indziej.
• Które checkpointy są dostępne — konwersje zgodne z konwencją obejmują zakres od 0,1B do 7,2B. G1 13,3B, czyli ten, którego ludzie naprawdę chcą, nie znajduje się w tym zestawie, a udokumentowany przykład to model Pile z tokenizatorem GPT-NeoX, a nie model czatu ze słownictwem World. Połączony loader bez flagowego checkpointu w tle zmienia mniej, niż mogłoby się wydawać.
• Ruchomy cel — projekt nie stoi w miejscu. Repozytorium G1 BlinkDL-a zostało zaktualizowane w tym samym tygodniu, w którym otwarto ten PR, kwantyzacje społeczności przeszły na późniejsze rewizje danych niż G1c, a RWKV-8 „Heron” został publicznie zaprezentowany z mechanizmem automatu sufiksowego zwanym ROSA. Heron nie został wydany i nie ma dla niego benchmarków; wspominamy o nim tylko dlatego, że integracja biblioteczna, która pojawia się późno w cyklu życia generacji, ma krótką żywotność.
Cztery pytania, na które specyfikacja nie odpowiada
Czy mogę teraz używać RWKV-7 w Transformers, czy nie?
Obie te rzeczy, co irytujące, i właśnie ta różnica stanowi całą historię. Możesz dziś załadować checkpoint RWKV-7 przez API transformers, jeśli zainstalujesz flash-linear-attention i przekażesz trust_remote_code, aby uruchomił się własny plik modelu z repozytorium. Czego nie możesz zrobić, to załadować go bezpośrednio z samej biblioteki — a to właśnie sprawia, że działa on domyślnie w narzędziach zbudowanych na jej bazie: skryptach do trenowania i dopasowywania, adapterach, zestawach ewaluacyjnych, ścieżkach eksportu — oraz że przechodzi politykę zabraniającą zdalnego kodu. Ta druga rzecz to właśnie to, do czego służy #47780.
Czy scalanie sprawia, że model jest lepszy?
Ani o jeden punkt w żadnym benchmarku. Zmienia rozkład, nie jakość — a dla architektury, której problemem nigdy nie była jakość, rozkład jest wiążącym ograniczeniem. Porównanie, o którym mowa, to to na początku tego artykułu: model 169M z 2023 roku pobierany czterdzieści razy częściej niż wagi obecnej generacji, wyłącznie dzięki temu, że ładuje się bez flag.
Jeśli nie ma pamięci podręcznej KV, czy dostaję nieograniczony kontekst za darmo?
Zyskujesz nieograniczoną długość kontekstu bez eksplozji pamięci, co nie jest tym samym, co nieograniczone odzyskiwanie informacji. Stan o stałym rozmiarze ma stałą pojemność informacyjną; podaj mu milion tokenów, a nie pomieści tylu szczegółów nadających się do odzyskania, ile odpowiada milionowi tokenów. Uwaga z pełną pamięcią podręczną może to zrobić, ale kosztem, który rośnie przez cały czas. Traktuj historię długiego kontekstu RWKV-7 jako „strumieniuje wiecznie tanio, kompresując po drodze” i przetestuj konkretne odzyskiwanie, którego potrzebujesz, zamiast ufać słowu „nieskończony”.
Czy warto się tym przejmować przy 13,3 mld, skoro czołowe modele mają setki miliardów?
To zależy wyłącznie od tego, czy stała pamięć jest dla ciebie cokolwiek warta. Jeśli wywołujesz hostowane API i płacisz za token, prawie na pewno nie — czołówka jest daleko z przodu pod względem możliwości, a za pamięć podręczną KV nie płacisz bezpośrednio. Jeśli wdrażasz inferencję na sprzęcie, którego nie kontrolujesz, albo prowadzisz ciągły strumień, w którym rosnąca pamięć podręczna jest tym, co ostatecznie zabija proces, architektura o stałym śladzie pamięciowym jest innym rodzajem odpowiedzi na inne pytanie. To są obciążenia, w których 2.9B RWKV-7 po cichu pozostawał konkurencyjny, i to te, w których natywny loader miałby największe znaczenie.
Co obejrzelibyśmy dalej
{{1}}Cztery konkretne sygnały, w przybliżonej kolejności tego, jak bardzo zmieniłyby naszą ocenę.{{/1}} {{2}}Przychylna recenzja od ArthurZucker lub Rocketknight1, która zmienia ten obiecujący diff w zaplanowaną funkcję.{{/2}} {{3}}Zgodna z konwencją konwersja modelu 13.3B G1 z tokenizerem World, która sprawia, że loader jest wart posiadania.{{/3}} {{4}}Opublikowane liczby przepustowości dla ścieżki dekodowania bez zależności w porównaniu z jądrami Triton, które decydują, czy natywne wsparcie jest opcją serwowania, czy warstwą zgodności.{{/4}} {{5}}I jakikolwiek ślad RWKV-8, który powiedziałby ci, czy ta integracja pojawia się na początku generacji, czy na jej końcu.{{/5}}
Do czasu co najmniej pierwszego z nich właściwe podsumowanie jest nieefektowne: RWKV-7 (Goose) jest realny, dostępny na permisywnej licencji, do pobrania do 13,3B, i nadal nie można go natywnie załadować w bibliotece, na której opiera się większość ekosystemu. Pull request otwarty 4 sierpnia 2026 r. proponuje to naprawić. Nie został scalony, a pull requesty dodające architektury do transformers bywają zamykane.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
