RWKV-7 Goose-1
Engineering & Research

RWKV-7 (Goose): Bên trong Pull Request cuối cùng sẽ nạp nó vào Transformers

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mô hình RWKV được tải về nhiều nhất trên Hugging Face tháng trước không phải là RWKV-7 (Goose) — kiến trúc mà dự án đã phát hành từ tháng 3 năm 2025 — và cũng không phải RWKV7-G1, dòng mô hình suy luận được huấn luyện dựa trên nó. Đó là RWKV/rwkv-4-169m-pile: một checkpoint RWKV-4 với 169 triệu tham số từ tháng 5 năm 2023, với 8.824 lượt tải trong 30 ngày tính đến ngày 5 tháng 8 năm 2026, so với 215 lượt cho bản phát hành RWKV-7 Goose World-3 1.5B và 316 lượt cho bản 2.9B. Mô hình năm 2023 không tốt hơn. Nó là mô hình có thể tải bằng một lệnh gọi from_pretrained đơn giản, không cần cài đặt thêm bất cứ thứ gì.

Ngày 4 tháng 8 năm 2026, một nhà đóng góp tên là Hakureirm đã mở pull request #47780 cho huggingface/transformers, với tiêu đề "Add RWKV-7 (Goose)". Tính đến ngày 5 tháng 8, nó vẫn đang mở, chưa được đánh giá và chưa được hợp nhất, và đây là lần thử thứ hai — một đề xuất trước đó, #46984, đã bị từ chối. Chưa có gì được đưa vào, và bài viết này không nên được đọc như một thông báo phát hành. Nhưng bản diff là công khai, và nó giải quyết điều nhàm chán nhất nhưng cũng hệ trọng nhất đang đứng giữa dòng dõi LLM không cần attention hoạt động lâu nhất và bộ công cụ mà hầu hết các đội ngũ thực sự dùng: một bộ nạp.

Những gì sau đây phân tách ba loại tuyên bố, vì các bài viết về RWKV thường gộp chúng lại với nhau. Có những gì có thể xác minh trong pull request và trên Hub, mà bạn có thể tự kiểm tra. Có những gì dự án RWKV báo cáo về chính các mô hình của họ, dựa trên các đánh giá của riêng họ. Và có một tập hợp lớn các câu hỏi chưa ai trả lời công khai, và đó chính là nơi tập trung phần lớn rủi ro đáng chú ý.

Thực sự có gì trong pull request?

RWKV-7 Goose-2

Các dữ kiện kỹ thuật, đọc từ trang PR và API GitHub vào ngày 5 tháng 8 năm 2026:

Phạm vi — ba commit, 12 file đã thay đổi, 4.423 dòng được thêm và 0 dòng bị xóa, từ nhánh add-rwkv7-upstream vào huggingface:main. Được gắn nhãn "Mô hình mới". Không có người được phân công, không có milestone.

Những gì nó bổ sung — RWKV-7 dưới dạng hai lớp công khai, Rwkv7Model và Rwkv7ForCausalLM, cùng với Rwkv7Cache được xây dựng trên LinearAttentionLayer của thư viện. Dtype của trạng thái WKV có thể được cấu hình độc lập với dtype của mô hình, điều này quan trọng vì trạng thái truy hồi chính là nơi tích lũy sai số số học trong họ mô hình này.

Cách nó chạyPyTorch di động, không phụ thuộc runtime bên thứ ba. Prefill sử dụng dạng truy hồi song song theo khối; decode chạy theo đường dẫn tuần tự từng token. Tên tham số tuân theo bản triển khai tham chiếu upstream của RWKV thay vì được đổi tên để trông giống kiểu transformer.

Tư thế kiểm thử — ngoài các model mixin tiêu chuẩn, một bài kiểm thử tích hợp khớp từng token với runtime của chính BlinkDL, cùng với bản triển khai tham chiếu NumPy không chia sẻ mã nguồn với tệp mô hình hóa. Bot tóm tắt CI của repo báo cáo lần chạy mới nhất là thành công: 16 tác vụ, 179.151 bài kiểm thử, không có lỗi nào, 16 giờ 9 phút tính toán.

Tình trạng hiện tại — đã yêu cầu đánh giá từ ArthurZucker và Rocketknight1; trang nêu rằng cần ít nhất một đánh giá phê duyệt để hợp nhất, và chưa có đánh giá nào được đưa ra. Khi chúng tôi đọc, API của GitHub vẫn mô tả trạng thái hợp nhất là "không ổn định", và một bot dành cho người bảo trì đã yêu cầu chạy các bộ kiểm thử chậm (auto và rwkv7) trước khi hợp nhất. Nói cách khác: CI nhanh đã xanh, nhưng chưa được con người phê duyệt.

Phần thú vị nhất trong mô tả là sự nhượng bộ. Nỗ lực trước đó, #46984, đã bị từ chối vì các checkpoint RWKV-7 được công bố không tuân theo các quy ước của Transformers, và chính tác giả cũng cho rằng "lời phản đối đó là đúng". Vấn đề, được nêu ra trong PR, là các trọng số RWKV-7 trên Hub có hai dạng mà thư viện không thể sử dụng được:

Các kho lưu trữ PTH — các tệp .pth thô, không có safetensors. Một triển khai thư viện không thể tải chúng, và các tệp pickle PyTorch chính là thứ mà một cuộc đánh giá bảo mật tại một công ty lớn sẽ từ chối.

Các kho lưu trữ HF — các kho này có cung cấp model.safetensors, nhưng mỗi kho cũng đi kèm một modeling_rwkv7.py và một auto_map, nên việc tải một trong số chúng yêu cầu trust_remote_code. Đó là thực thi mã từ xa như một điều kiện để suy luận, và đó là lý do vì sao rất nhiều danh sách kiểm tra doanh nghiệp dừng lại ở đó.

Vậy là PR này làm hai việc cùng lúc. Nó thêm một file mô hình, và nó trỏ đến một bộ conversions mới được tạo trực tiếp từ các bản phát hành .pth chuẩn của BlinkDL tuân theo bố cục tiêu chuẩn — chỉ safetensors, không pickle, không remote code, một config.json bình thường mang architectures và model_type — trải dài từ 0.1B đến 7.2B. Mô hình nhỏ nhất, Hakureirm/rwkv7-168m-pile-hf, có toàn bộ 399 tensor được xác minh bit-identical so với file .pth nguồn thay vì chỉ kiểm tra ngẫu nhiên. Checkpoint đó là một mô hình Pile, nên tokenizer của nó là tokenizer nhanh GPT-NeoX-20B thông thường chứ không phải bộ từ vựng RWKV World — cũng vì lý do tương tự mà trang RWKV hiện có của thư viện cũng ghi tài liệu về một checkpoint Pile.

Tại sao một checkpoint từ năm 2023 được tải nhiều hơn kiến trúc hiện tại

RWKV-7 Goose-3

Transformers đang ở phiên bản 5.14.1, được phát hành vào ngày 16 tháng 7 năm 2026. Khi tìm kiếm RWKV trong tài liệu của nó, bạn sẽ thấy đúng một trang mô hình, mô tả "mô hình RWKV (phiên bản 4)", được đóng góp từ nhiều năm trước, với RWKV/rwkv-4-169m-pile làm ví dụ và một bộ từ vựng mặc định gồm 50.277 token. Không có trang nào cho RWKV-5, RWKV-6 hay RWKV-7. Ba thế hệ kiến trúc đã ra mắt kể từ khi phần hỗ trợ RWKV của thư viện được viết, nhưng không có thế hệ nào trong số đó có mặt trong thư viện.

Các con số tải xuống cho thấy hệ sinh thái đã làm gì về điều đó: nó đã đi vòng qua thư viện. Sắp xếp theo số lượt tải xuống trong 30 ngày qua, các kho lưu trữ RWKV-7 hàng đầu là các bản phát hành .pth thô của BlinkDL (rwkv7-g1 với 8,288, rwkv-7-world với 4,489) và một lớp dày đặc các bản lượng tử hóa GGUF từ cộng đồng của mô hình G1 13.3B — một số người tải lên riêng biệt, mỗi người đạt từ một đến ba nghìn lượt tải mỗi tháng. Các bản sao định dạng transformers chính thức nằm ở mức thấp hơn hai bậc độ lớn so với các trọng số thô. Bản sao flash-linear-attention của mô hình G1 2.9B đạt 1,843.

Kiểu mẫu đó có một lời giải thích đơn giản. llama.cpp đã hợp nhất hỗ trợ RWKV v7 vào ngày 17 tháng 3 năm 2025 — một kernel GGML_OP_RWKV_WKV7 với các backend CPU, CUDA, SYCL, Vulkan và Metal — khoảng một ngày sau khi bài báo được đăng tải. Nếu bạn muốn chạy RWKV-7 trên máy của mình, con đường nhanh nhất là GGUF, và điều đó đã đúng suốt mười sáu tháng qua. Con đường không tồn tại là con đường mà mọi tập lệnh fine-tuning, mọi adapter PEFT, mọi bộ đánh giá và mọi trình bao bọc serving nội bộ đều giả định: AutoModelForCausalLM.from_pretrained, không cần cờ.

RWKV-7 (Goose) thực sự là gì

RWKV-7 là một mạng nơ-ron hồi quy, không phải transformer với kernel attention rẻ hơn, và cái tên này khiến mọi người luôn bị nhầm lẫn. Nó mang một trạng thái có kích thước cố định truyền qua chuỗi thay vì bộ đệm các khóa và giá trị trong quá khứ ngày càng lớn dần. Cụ thể, so với mô hình attention thông thường:

Bộ nhớ tăng theo ngữ cảnh — bộ đệm KV của transformer tăng tuyến tính theo số token đang xử lý; RWKV-7 duy trì một trạng thái có kích thước do kiến trúc quyết định, không phải do cuộc hội thoại. Đó chính là toàn bộ luận điểm về hiệu quả.

Chi phí mỗi token — chi phí attention cho mỗi token tăng lên khi ngữ cảnh dài hơn; chi phí suy luận trên mỗi token của RWKV-7 là hằng số, đó là lý do vì sao nó liên tục xuất hiện trong các đề xuất về edge và always-on-stream.

Dạng huấn luyện — không giống như RNN cổ điển, phép truy hồi có thể được song song hóa trên một khối, do đó quá trình tiền huấn luyện không bị thoái hóa thành một tiến trình tuần tự chậm chạp. Đó chính là điều mà đường dẫn prefill song song theo khối của PR thực hiện.

Trần ngữ cảnh — không có bộ nhớ đệm nào có thể bị tràn, nên dự án quảng bá ngữ cảnh về thực chất là không giới hạn. Điều trạng thái cố định không làm được là lưu giữ chi tiết không giới hạn — đó là hạn chế thực sự, chứ không phải là chuyện nhỏ.

Tuyên bố về kiến trúc trong bài báo, được xuất bản ngày 18 tháng 3 năm 2025 bởi Bo Peng, Yu Zhang, Songlin Yang và Ruichong Zhang thuộc Dự án RWKV tại LF AI & Data Foundation, là một quy tắc delta tổng quát hóa với cổng hóa trị vector, tỷ lệ học trong ngữ cảnh và quy tắc thay thế giá trị nới lỏng, cùng với một MLP đơn giản hóa (ma trận cổng được loại bỏ, chiều ẩn được mở rộng để bù đắp). Kết quả lý thuyết đi kèm mới là phần gây tranh cãi hơn: RWKV-7 có thể thực hiện theo dõi trạng thái và nhận dạng mọi ngôn ngữ chính quy trong khi vẫn song song hóa được trong huấn luyện, điều mà các tác giả lập luận là vượt quá những gì transformer có thể làm dưới các giả thuyết độ phức tạp chuẩn.

Mọi thứ đều theo Apache 2.0. Dòng mô hình bạn có thể tải xuống gồm các phiên bản 0.1B (12 lớp, độ rộng 768), 0.4B (24 / 1024), 1.5B (24 / 2048), 2.9B (32 / 2560), 7.2B (32 / 4096) và 13.3B (61 lớp, độ rộng 4096), tất cả đều có từ vựng World 65.536 token và kích thước head 64. Dòng World cơ bản được huấn luyện trên kho ngữ liệu đa ngôn ngữ 3,1 nghìn tỷ token; dòng G1 "GooseOne" tiếp tục quá trình huấn luyện đó trên World v3.5, một hỗn hợp mở rộng 5,16 nghìn tỷ token với nhiều tiểu thuyết, văn bản web, toán học, mã nguồn và dữ liệu suy luận hơn. Các checkpoint G1 bổ sung chế độ suy luận think-tag, gọi hàm JSON và điền vào giữa (fill-in-the-middle) từ G1c trở đi. Cách đặt tên thực sự khó hiểu: G0 nghĩa là ít hơn một epoch, G1 nghĩa là nhiều hơn một, còn các chữ cái hậu tố đánh dấu các lần chỉnh sửa dữ liệu, với chữ cái sau mang dữ liệu tốt hơn.

Những con số, và chúng là số của ai

Đây là bức tranh trung thực về các bằng chứng hiện có. Tuyên bố chuẩn mực nổi bật — rằng mô hình 2.9B đã thiết lập một chuẩn mực tiên tiến mới ở hạng 3B cho các tác vụ đa ngôn ngữ và ngang bằng với chuẩn mực tiên tiến nhất của mô hình 3B tiếng Anh trong khi sử dụng ít token huấn luyện hơn đáng kể — là tuyên bố của chính bài báo, được xuất bản vào tháng 3 năm 2025 và được đánh giá so với các mô hình 3B của thời kỳ đó. Bài báo đã trải qua OpenReview, vốn là một mức độ xem xét kỹ lưỡng hơn nhiều so với một bài đăng blog của nhà cung cấp, và kết quả này vẫn là một kết quả tự báo cáo trên một bộ so sánh đã mười lăm tháng tuổi.

Phép đo công khai khác của dự án, {{1}}UncheatableEval{{/1}}, thú vị hơn một vị trí trên bảng xếp hạng và gần như không được nhắc đến. Thay vì chấm điểm các bài kiểm tra trắc nghiệm bị rò rỉ vào bộ dữ liệu huấn luyện, nó đo tỷ lệ nén trên dữ liệu chưa tồn tại khi mô hình được huấn luyện: các bài báo {{2}}arXiv{{/2}} mới, kho lưu trữ {{3}}GitHub{{/3}} mới, tin tức gần đây. Thiết kế đó khiến việc nhiễm dữ liệu trở nên khó khăn hơn nhiều, và {{4}}RWKV{{/4}} báo cáo rằng nó có tính cạnh tranh với các mô hình transformer cùng kích thước trên phép đo này. Đây vẫn là một đánh giá mà dự án tự chạy trên chính nó.

Thứ không tồn tại, theo những gì chúng tôi có thể tìm thấy, là một chỉ số đánh giá độc lập từ bên thứ ba cho bất kỳ checkpoint RWKV-7 nào — không có đơn vị tổng hợp trung lập nào đưa 7.2B hoặc 13.3B vào bộ đánh giá mà họ chạy trên các mô hình tiên phong. Vì vậy, những so sánh bạn có thể thấy với các mô hình như DeepSeek V4 Flash hay Qwen3.8-Max là sai lầm phân loại theo hai cách: chưa ai chạy RWKV-7 trên cùng một bài đánh giá, và một RNN dense 13.3B không cạnh tranh cho cùng một khối lượng công việc như một hệ thống tiên phong. Phát biểu có thể bảo vệ được thì hẹp hơn và hữu ích hơn: từ 1.5B đến 13.3B, với mức bộ nhớ không đổi, ở khoảng mười hai ngôn ngữ, với trọng số được cấp phép mở.

Chạy RWKV-7 ngay hôm nay, và cái giá bạn phải trả

RWKV-7 Goose-4

Trang Hub của RWKV/RWKV7-Goose-World3-1.5B-HF là một minh họa rõ nét cho những trở ngại hiện tại. Đây là mô hình BF16 với 1,52 tỷ tham số, sử dụng tokenizer RWKV World, giấy phép Apache 2.0, gắn thẻ custom_code, liệt kê các ngôn ngữ: tiếng Anh, tiếng Trung, tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Ả Rập, tiếng Tây Ban Nha và tiếng Bồ Đào Nha. Hướng dẫn của nó yêu cầu cài đặt flash-linear-attention và phiên bản transformers gần đây trước khi tải mô hình. Và trong thanh bên, nơi các nhà cung cấp sẽ được hiển thị nếu mô hình được lưu trữ, nó ghi thẳng: mô hình này không được triển khai bởi bất kỳ nhà cung cấp suy luận nào.

Vậy nên các lựa chọn của bạn hôm nay đều là tự phục vụ:

flash-linear-attention với trust_remote_code — gần nhất với cách sử dụng Hub thông thường, nhưng bạn đang thực thi mã từ kho lưu trữ và kéo theo các kernel Triton, điều này hạn chế bạn về phần cứng và về bất kỳ thứ gì có rà soát bảo mật.

GGUF thông qua llama.cpp — con đường được hỗ trợ tốt nhất trên thực tế, kể cả cho bản 13.3B, cũng là lựa chọn mà số liệu tải xuống cho thấy mọi người thực sự dùng. Rất tốt cho suy luận cục bộ, nhưng không phải là hướng dành cho việc huấn luyện hay tinh chỉnh.

Runtime riêng của dự án — gói pip rwkv và kho lưu trữ tham chiếu, gần nhất với chuẩn chính thức, xa nhất so với bộ công cụ mà nhóm của bạn đã có sẵn.

Không cái nào trong số đó là một API bạn có thể gọi, và cần phải nói thẳng về hàm ý: RWKV-7 không nằm trên OrcaRouter, vì nó không phải là một endpoint được lưu trữ ở bất cứ đâu chúng tôi có thể tìm thấy. Nếu muốn RWKV-7, bạn tự chạy RWKV-7. Điều chúng tôi có thể thành thật nói là điều đó sẽ đưa phần còn lại của stack về đâu. Việc đánh giá một kiến trúc chưa được kiểm chứng chỉ rẻ nếu lộ trình sản xuất của bạn không phụ thuộc vào kết quả, và cách rẻ nhất để giữ điều đó đúng là không có tích hợp riêng theo từng nhà cung cấp cho bất kỳ thứ gì khác — một khóa tương thích OpenAI dùng chung cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển thẳng qua với mức phụ phí 0%, và tự động chuyển dự phòng khi nhà cung cấp suy giảm. Khi đó, một thử nghiệm tự lưu trữ RWKV-7 trên hai loại khối lượng công việc mà bộ nhớ hằng số thực sự đáng giá — một luồng chạy liên tục, một trợ lý trên thiết bị, một trình tóm tắt không bao giờ dừng — là một thử nghiệm, không phải một cuộc di dời. Đó là hình thái mà hầu hết các đội ngũ nên muốn ở đây: một mặc định được định tuyến, và một mô hình dựa trên trạng thái tự khẳng định vị trí của mình trong một công việc cụ thể.

Điều gì vẫn có thể ngăn cản cú hạ cánh này

Hãy coi trọng tiền lệ: một đề xuất thêm chính xác kiến trúc này đã từng bị từ chối một lần, với những lý do mà tác giả thừa nhận là xác đáng. Đề xuất mới được lập luận chặt chẽ hơn và được kiểm thử kỹ hơn, nhưng nó vẫn chỉ là một PR từ cộng đồng gửi tới một kho lưu trữ vốn cố tình bảo thủ trong việc chấp nhận các kiến trúc mà sau này nó sẽ phải duy trì mãi mãi.

Các câu hỏi mở cụ thể mà chúng ta muốn được giải đáp trước khi có thể coi việc này là hoàn tất:

Review, không phải CI — các bộ kiểm thử tự động đều xanh; hai người bảo trì đã được hỏi và cả hai đều chưa duyệt. Transformers yêu cầu một bài review đồng ý, và các bài kiểm thử chậm chưa được chạy.

Tốc độ của đường dẫn không phụ thuộc thư viện — thuần PyTorch với giải mã tuần tự từng token một là khả chuyển, và khả chuyển chính là điểm mấu chốt, nhưng PR không công bố thông lượng so với các nhân Triton trong flash-linear-attention. Nếu giải mã gốc chậm hơn đáng kể, thư viện sẽ trở thành đường dẫn tương thích trong khi việc phục vụ thực thụ vẫn nằm ở nơi khác.

Những checkpoint nào có mặt — các bản chuyển đổi tuân thủ quy ước bao phủ từ 0.1B đến 7.2B. Bản G1 13.3B, thứ mà mọi người thực sự muốn, không nằm trong tập đó, và ví dụ được ghi lại là một mô hình Pile với bộ tokenizer GPT-NeoX thay vì một mô hình chat với từ vựng World. Một bộ nạp hợp nhất không có checkpoint chủ lực phía sau sẽ tạo ra ít thay đổi hơn so với vẻ ngoài của nó.

Mục tiêu đang chuyển động — dự án không hề đứng yên. Kho lưu trữ G1 của BlinkDL đã được cập nhật ngay trong tuần PR này được mở, các bản lượng tử hóa từ cộng đồng đã tiến tới các bản sửa đổi dữ liệu mới hơn G1c, và RWKV-8 "Heron" đã được giới thiệu công khai với cơ chế automaton hậu tố mang tên ROSA. Heron chưa được phát hành và chưa được benchmark; chúng tôi chỉ đề cập đến nó vì một tích hợp thư viện đến muộn trong vòng đời của một thế hệ sẽ có tuổi thọ ngắn.

Bốn câu hỏi mà bảng thông số kỹ thuật không trả lời được.

Liệu tôi có thể sử dụng RWKV-7 trong Transformers ngay bây giờ hay không?

Cả hai, thật bực bội, và sự khác biệt ấy chính là toàn bộ câu chuyện. Bạn có thể tải một checkpoint RWKV-7 thông qua API transformers ngay hôm nay, nếu bạn cài đặt flash-linear-attention và truyền trust_remote_code để file modeling của chính repository đó chạy được. Điều bạn không thể làm là tải nó từ chính thư viện, vốn là điều khiến nó hoạt động mặc định trong các công cụ được xây dựng dựa trên thư viện — các script huấn luyện và căn chỉnh, adapter, khung đánh giá, đường dẫn xuất — và là điều khiến nó vượt qua được chính sách cấm mã từ xa. Điều thứ hai đó chính là mục đích của #47780.

Việc hợp nhất có làm cho mô hình tốt hơn không?

Không phải vì hơn một điểm trên bất kỳ chuẩn đánh giá nào. Nó thay đổi cách phân phối, chứ không phải chất lượng — và với một kiến trúc mà vấn đề chưa bao giờ là chất lượng, thì phân phối chính là ràng buộc mang tính quyết định. Phép so sánh chính là phép so sánh ở đầu bài viết này: một mô hình 169M từ năm 2023 được tải về nhiều gấp bốn mươi lần so với các bộ trọng số thế hệ hiện tại, hoàn toàn nhờ việc tải mà không cần cờ.

Nếu không có KV cache, liệu tôi có được ngữ cảnh không giới hạn miễn phí không?

Bạn có được độ dài ngữ cảnh không giới hạn mà không gây bùng nổ bộ nhớ, nhưng điều này không giống với khả năng truy hồi không giới hạn. Trạng thái có kích thước cố định có dung lượng thông tin cố định; nạp vào một triệu token thì nó không thể lưu giữ được lượng chi tiết truy hồi tương đương một triệu token. Attention với bộ đệm đầy đủ thì có thể làm được, nhưng chi phí tăng dần theo suốt chặng đường. Hãy xem câu chuyện ngữ cảnh dài của RWKV-7 như "truyền phát mãi mãi với chi phí rẻ, nén dữ liệu khi xử lý", và kiểm tra khả năng truy hồi cụ thể bạn cần thay vì tin vào từ "vô hạn".

Có đáng để quan tâm ở mức 13.3B khi các mô hình tiên tiến có hàng trăm tỷ tham số không?

Điều đó hoàn toàn phụ thuộc vào việc bộ nhớ cố định có đáng giá với bạn hay không. Nếu bạn đang gọi một API được lưu trữ và trả phí theo từng token, gần như chắc chắn là không — các mô hình tiên phong dẫn trước rất xa về năng lực và bạn không trả tiền trực tiếp cho KV cache. Nếu bạn triển khai inference lên phần cứng bạn không kiểm soát, hoặc chạy một luồng xử lý liên tục, nơi một bộ nhớ đệm ngày càng tăng chính là thứ cuối cùng giết chết tiến trình, thì một kiến trúc có mức chiếm dụng bộ nhớ không đổi sẽ là một dạng câu trả lời khác cho một câu hỏi khác. Đó là những tác vụ mà mô hình RWKV-7 2.9B đã âm thầm thể hiện sức cạnh tranh, và cũng chính là những tác vụ mà một trình nạp native sẽ đóng vai trò quan trọng nhất.

Những gì chúng tôi sẽ xem tiếp theo

Bốn tín hiệu cụ thể, theo thứ tự gần đúng về mức độ chúng sẽ thay đổi đánh giá của chúng tôi. Một bài đánh giá tán thành từ ArthurZucker hoặc Rocketknight1, giúp biến điều này từ một bản diff đầy hứa hẹn thành một tính năng được lên lịch. Một chuyển đổi tuân thủ quy ước của G1 13.3B với tokenizer World, đây chính là điều khiến bộ tải trở nên đáng giá. Các số liệu thông lượng được công bố cho đường dẫn giải mã không phụ thuộc thư viện so với các kernel Triton, giúp quyết định liệu hỗ trợ gốc là một lựa chọn phục vụ hay chỉ là một mảnh ghép tương thích. Và bất kỳ dấu hiệu nào của RWKV-8, giúp bạn biết liệu tích hợp này đến vào thời điểm khởi đầu của một thế hệ hay cuối của một thế hệ.

Cho đến ít nhất là điều đầu tiên trong số đó, bản tóm tắt đúng đắn là bản không mấy hào nhoáng: RWKV-7 (Goose) là có thật, được cấp phép cởi mở, có thể tải xuống lên đến 13.3B, và vẫn chưa thể nạp trực tiếp trong thư viện mà phần lớn hệ sinh thái được xây dựng trên đó. Một pull request mở vào ngày 4 tháng 8 năm 2026 đề xuất khắc phục điều đó. Nó chưa được merge, và các pull request để thêm kiến trúc vào transformers thường bị đóng.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube