
RWKV-7 (Goose): เบื้องหลัง Pull Request ที่จะโหลดมันลงใน Transformers ได้ในที่สุด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
โมเดล RWKV ที่ถูกดาวน์โหลดมากที่สุดบน Hugging Face เมื่อเดือนที่แล้วไม่ใช่ RWKV-7 (Goose) สถาปัตยกรรมที่โปรเจกต์เผยแพร่ตั้งแต่มีนาคม 2025 และไม่ใช่ RWKV7-G1 ชุดโมเดล reasoning ที่เทรนบนสถาปัตยกรรมดังกล่าว แต่เป็น RWKV/rwkv-4-169m-pile: checkpoint RWKV-4 ขนาด 169 ล้านพารามิเตอร์จากพฤษภาคม 2023 มียอดดาวน์โหลด 8,824 ครั้งใน 30 วันจนถึง 5 สิงหาคม 2026 เทียบกับ 215 ครั้งสำหรับ RWKV-7 Goose World-3 ขนาด 1.5B และ 316 ครั้งสำหรับขนาด 2.9B โมเดลปี 2023 ไม่ได้ดีกว่า แต่เป็นโมเดลที่โหลดได้ด้วยการเรียก from_pretrained แบบธรรมดา โดยไม่ต้องติดตั้งอะไรเพิ่มเติม
เมื่อวันที่ 4 สิงหาคม 2026 ผู้มีส่วนร่วมชื่อ Hakureirm ได้เปิด pull request #47780 ไปยัง huggingface/transformers ในชื่อ "Add RWKV-7 (Goose)" ณ วันที่ 5 สิงหาคม PR นี้ยังเปิดอยู่ ยังไม่ได้รับการรีวิวและยังไม่ถูก merge และนี่คือความพยายามครั้งที่สอง — ข้อเสนอแรกคือ #46984 ถูกปฏิเสธไปแล้ว ยังไม่มีอะไรถูก merge และบทความนี้ไม่ควรถูกอ่านว่าเป็นการประกาศปล่อยเวอร์ชัน แต่ diff นั้นเปิดเผยต่อสาธารณะ และมันจัดการกับสิ่งที่ทั้งน่าเบื่อที่สุดและสำคัญที่สุดที่ขวางกั้นระหว่างสายเลือด LLM ที่ไม่ใช้ attention ซึ่งอยู่มานานที่สุด กับสแตกที่ทีมส่วนใหญ่ใช้จริง: ตัวโหลด (loader)
สิ่งที่ตามมานี้เป็นการแยกข้อกล่าวอ้างออกเป็นสามประเภท เนื่องจากการรายงานข่าวเกี่ยวกับ RWKV โดยปกติมักจะปะปนข้อกล่าวอ้างเหล่านี้เข้าด้วยกัน มีสิ่งที่ตรวจสอบได้จริงในพูลรีเควสต์และบน Hub ซึ่งคุณสามารถตรวจสอบได้ด้วยตนเอง มีสิ่งที่โครงการ RWKV รายงานเกี่ยวกับโมเดลของตัวเอง จากการประเมินของพวกเขาเอง และมีชุดคำถามขนาดใหญ่ที่ยังไม่มีใครตอบต่อสาธารณะ ซึ่งเป็นที่ที่ความเสี่ยงที่น่าสนใจส่วนใหญ่อาศัยอยู่
จริงๆ แล้วใน pull request มีอะไร

ข้อเท็จจริงเชิงกลไก อ่านจากหน้า PR และ GitHub API เมื่อวันที่ 5 สิงหาคม 2026:
• ขอบเขต — สามคอมมิต ไฟล์ที่เปลี่ยนแปลง 12 ไฟล์ เพิ่ม 4,423 บรรทัดและลบ 0 บรรทัด จากแบรนช์ add-rwkv7-upstream ไปยัง huggingface:main ติดป้าย "โมเดลใหม่" ไม่มีผู้รับผิดชอบ ไม่มีไมล์สโตน
• สิ่งที่เพิ่ม — RWKV-7 ในรูปแบบคลาสสาธารณะสองคลาสคือ Rwkv7Model และ Rwkv7ForCausalLM พร้อมกับ Rwkv7Cache ที่สร้างขึ้นบน LinearAttentionLayer ของไลบรารี dtype ของสถานะ WKV สามารถกำหนดค่าได้อย่างอิสระจาก dtype ของโมเดล ซึ่งมีความสำคัญเนื่องจากสถานะแบบ recurrent เป็นจุดที่ข้อผิดพลาดเชิงตัวเลขสะสมในตระกูลนี้
• วิธีการทำงาน — PyTorch แบบพกพา ไม่ต้องพึ่งพา runtime จากบุคคลที่สาม Prefill ใช้การเกิดซ้ำในรูปแบบขนานแบบชิ้นส่วน ส่วน decode ทำงานในเส้นทางตามลำดับทีละโทเคน ชื่อพารามิเตอร์เป็นไปตาม reference implementation ต้นทางของ RWKV แทนที่จะถูกเปลี่ยนชื่อให้ดูเหมือน transformer
• ท่าทีการทดสอบ — นอกเหนือจากมิกซินโมเดลมาตรฐานแล้ว การทดสอบเชิงบูรณาการที่ตรงกับรันไทม์ของ BlinkDL เองแบบโทเคนต่อโทเคน พร้อมทั้งอิมพลีเมนเทชันอ้างอิง NumPy ที่ไม่มีโค้ดร่วมกับไฟล์โมเดล บอทสรุป CI ของรีโพสรายงานการรันล่าสุดว่าสำเร็จ: 16 จ็อบ, 179,151 การทดสอบ, ศูนย์ความล้มเหลว, เวลาประมวลผล 16 ชั่วโมง 9 นาที
• สถานะปัจจุบัน — ขอให้ ArthurZucker และ Rocketknight1 เป็นผู้ตรวจสอบแล้ว หน้าระบุว่าต้องมีรีวิวที่เห็นชอบอย่างน้อยหนึ่งรายการจึงจะ merge ได้ และยังไม่มีใครให้รีวิวเลย GitHub API ยังคงระบุสถานะการ merge ว่า "ไม่เสถียร" ตอนที่เราอ่าน และบอทสำหรับผู้ดูแลได้ขอให้รันชุดทดสอบแบบช้า (auto และ rwkv7) ก่อน merge กล่าวคือ: ผ่านการทดสอบ CI แบบเร็ว แต่ยังไม่ได้รับอนุมัติจากมนุษย์
ส่วนที่น่าสนใจที่สุดของคำอธิบายคือการยอมรับ ความพยายามก่อนหน้านี้ #46984 ถูกปฏิเสธเพราะเช็คพอยต์ RWKV-7 ที่เผยแพร่นั้นไม่เป็นไปตามธรรมเนียมของ Transformers และการวางกรอบของผู้เขียนเองก็คือ "การคัดค้านนั้นถูกต้อง" ปัญหาที่ระบุไว้ใน PR คือน้ำหนักของ RWKV-7 บน Hub มาในสองรูปแบบที่ไลบรารีไม่สามารถใช้งานได้:
• พื้นที่เก็บข้อมูล PTH — ไฟล์ .pth ดิบ ไม่มี safetensors การใช้งานไลบรารีไม่สามารถโหลดไฟล์เหล่านี้ได้ และไฟล์ pickle ของ PyTorch คือสิ่งที่การตรวจสอบความปลอดภัยในบริษัทขนาดใหญ่จะปฏิเสธอย่างแน่นอน
• พื้นที่เก็บข้อมูล HF — สิ่งเหล่านี้มาพร้อมกับ model.safetensors แต่แต่ละแห่งก็มี modeling_rwkv7.py และ auto_map มาด้วยเช่นกัน ดังนั้นการโหลดหนึ่งในนั้นจึงต้องใช้ trust_remote_code ซึ่งก็คือการเรียกใช้โค้ดจากระยะไกลอันเป็นเงื่อนไขของการอนุมาน และนี่คือเหตุผลที่เช็กลิสต์ระดับองค์กรจำนวนมากหยุดอยู่แค่นั้น
ดังนั้น PR นี้จึงทำงานสองอย่างพร้อมกัน มันเพิ่มไฟล์โมเดล และชี้ไปยังชุดการแปลงใหม่ที่สร้างขึ้นโดยตรงจากรุ่น .pth มาตรฐานของ BlinkDL ซึ่งเป็นไปตามโครงสร้างมาตรฐาน — ใช้เฉพาะ safetensors ไม่มี pickle ไม่มีโค้ดระยะไกล มี config.json ปกติที่บรรจุ architectures และ model_type — ครอบคลุมตั้งแต่ 0.1B ถึง 7.2B โมเดลที่เล็กที่สุดคือ Hakureirm/rwkv7-168m-pile-hf มีเทนเซอร์ทั้งหมด 399 ตัวที่ผ่านการตรวจสอบว่าตรงกันแบบบิตต่อบิตกับไฟล์ .pth ต้นทาง แทนที่จะตรวจสอบแบบสุ่มจุด เช็คพอยต์นั้นเป็นโมเดล Pile ดังนั้นโทเคไนเซอร์จึงเป็น GPT-NeoX-20B fast tokenizer ทั่วไป แทนที่จะเป็นคำศัพท์ RWKV World — ด้วยเหตุผลเดียวกันกับที่หน้า RWKV ที่มีอยู่ของไลบรารีบันทึกเช็คพอยต์ Pile เอาไว้เช่นกัน
ทำไมเช็คพอยต์จากปี 2023 ถึงมียอดดาวน์โหลดมากกว่าสถาปัตยกรรมปัจจุบัน

Transformers อยู่ในเวอร์ชัน 5.14.1 เผยแพร่เมื่อวันที่ 16 กรกฎาคม 2026 ค้นหาเอกสารสำหรับ RWKV จะพบหน้ารุ่นเพียงหน้าเดียว ซึ่งอธิบาย “โมเดล RWKV (เวอร์ชัน 4)” ที่ถูกสนับสนุนเมื่อหลายปีก่อน โดยใช้ RWKV/rwkv-4-169m-pile เป็นตัวอย่าง และมีคำศัพท์เริ่มต้น 50,277 โทเคน ไม่มีหน้าสำหรับ RWKV-5, RWKV-6 หรือ RWKV-7 สถาปัตยกรรมสามรุ่นได้ถูกเผยแพร่ออกไปนับตั้งแต่การสนับสนุน RWKV ของไลบรารีถูกเขียนขึ้น และไม่มีรุ่นใดอยู่ในนั้นเลย
ตัวเลขดาวน์โหลดแสดงให้เห็นว่าระบบนิเวศจัดการกับเรื่องนั้นอย่างไร: มันเลี่ยงไลบรารีนั้นไป เรียงตามจำนวนดาวน์โหลดใน 30 วันที่ผ่านมา รีโพซิทอรี RWKV-7 ที่ติดอันดับสูงสุดได้แก่ ไฟล์ .pth ดิบของ BlinkDL (rwkv7-g1 ที่ 8,288 และ rwkv-7-world ที่ 4,489) และเวอร์ชัน GGUF ควอนไทซ์จากชุมชนจำนวนมากของ G1 13.3B — โดยมีผู้อัปโหลดหลายรายแยกกัน แต่ละรายมียอดดาวน์โหลดเดือนละหนึ่งถึงสามพันครั้ง มิเรอร์รูปแบบ transformers อย่างเป็นทางการมีจำนวนดาวน์โหลดต่ำกว่าน้ำหนักดิบถึงสองลำดับขนาด มิเรอร์ flash-linear-attention ของ G1 2.9B ทำยอดได้ 1,843 ครั้ง
รูปแบบนั้นมีคำอธิบายง่ายๆ llama.cpp รวมการรองรับ RWKV v7 เมื่อวันที่ 17 มีนาคม 2025 — เคอร์เนล GGML_OP_RWKV_WKV7 ที่มีแบ็กเอนด์ CPU, CUDA, SYCL, Vulkan และ Metal — ประมาณหนึ่งวันหลังจากที่บทความวิจัยเผยแพร่ หากคุณต้องการรัน RWKV-7 บนเครื่องของคุณเอง เส้นทางที่เร็วคือ GGUF และเป็นเช่นนั้นมาเป็นเวลาสิบหกเดือนแล้ว เส้นทางที่ไม่มีอยู่คือเส้นทางที่สคริปต์ fine-tuning ทุกตัว อะแดปเตอร์ PEFT ทุกตัว กรอบการประเมินผลทุกชุด และ wrapper การให้บริการภายในทุกตัวคาดหวัง: AutoModelForCausalLM.from_pretrained โดยไม่มีแฟล็กใดๆ
RWKV-7 (Goose) จริงๆ แล้วคืออะไร
RWKV-7 เป็นโครงข่ายประสาทแบบรีเคอร์เรนต์ ไม่ใช่ทรานส์ฟอร์เมอร์ที่มีเคอร์เนลแอตเทนชันที่ประหยัดกว่า และการตั้งชื่อนี้ทำให้ผู้คนสับสนอยู่เสมอ มันส่งต่อสถานะขนาดคงที่ไปตามลำดับ แทนที่จะใช้แคชที่เพิ่มขึ้นของคีย์และค่าในอดีต อย่างเป็นรูปธรรม เมื่อเทียบกับโมเดลแอตเทนชันมาตรฐาน:
• หน่วยความจำเติบโตตามบริบท — แคช KV ของ transformer เติบโตแบบเส้นตรงตามจำนวนโทเค็นที่กำลังประมวลผล; RWKV-7 เก็บสถานะที่มีขนาดกำหนดโดยสถาปัตยกรรม ไม่ใช่โดยบทสนทนา นั่นคือข้อโต้แย้งด้านประสิทธิภาพทั้งหมด
• ต้นทุนต่อโทเคน — attention มีต้นทุนต่อโทเคนสูงขึ้นเมื่อบริบทยาวขึ้น ในขณะที่ต้นทุนการอนุมานต่อโทเคนของ RWKV-7 นั้นคงที่ ซึ่งเป็นเหตุผลว่าทำไมมันจึงถูกหยิบยกขึ้นมาอยู่เสมอในข้อเสนอสำหรับการประมวลผลแบบ edge และการสตรีมแบบตลอดเวลา (always-on-stream)
• รูปแบบการฝึก — ต่างจาก RNN แบบคลาสสิก การเกิดซ้ำสามารถทำแบบขนานได้ในแต่ละ chunk ดังนั้นการพรีเทรนจึงไม่เสื่อมลงเป็นการประมวลผลแบบลำดับที่เชื่องช้า นี่คือสิ่งที่เส้นทาง prefill แบบ chunk-parallel ของ PR นำไปใช้
• เพดานบริบท — ไม่มีแคชให้ระเบิด ดังนั้นโปรเจกต์จึงนำเสนอบริบทที่แทบไร้ขีดจำกัด สิ่งที่สถานะคงที่ทำไม่ได้คือการเก็บรายละเอียดอันไร้ขีดจำกัดไว้ได้ ซึ่งเป็นข้อจำกัดจริง ไม่ใช่เพียงเชิงอรรถ.
ข้อกล่าวอ้างทางสถาปัตยกรรมในบทความ ซึ่งเผยแพร่เมื่อวันที่ 18 มีนาคม 2025 โดย Bo Peng, Yu Zhang, Songlin Yang และ Ruichong Zhang ภายใต้โครงการ RWKV ที่ LF AI & Data Foundation คือกฎเดลตาทั่วไป (generalized delta rule) ที่มีการเกตแบบเวกเตอร์ (vector-valued gating) อัตราการเรียนรู้ภายในบริบท (in-context learning rates) และกฎการแทนค่าแบบผ่อนคลาย (relaxed value-replacement rule) พร้อมด้วย MLP ที่ถูกทำให้เรียบง่ายขึ้น (ตัดเมทริกซ์เกตออก และขยายความกว้างของเลเยอร์ซ่อนเพื่อชดเชย) ผลเชิงทฤษฎีที่ผูกกับข้อกล่าวอ้างนี้คือครึ่งที่ provoking กว่า: RWKV-7 สามารถติดตามสถานะ (state tracking) และรู้จำภาษาปกติ (regular languages) ทั้งหมดได้ ในขณะที่ยังคงสามารถทำขนานในการฝึกได้ (parallelizable in training) ซึ่งผู้เขียนโต้แย้งว่ามีศักยภาพเหนือกว่าที่ทรานส์ฟอร์เมอร์จะทำได้ภายใต้ข้อสันนิษฐานเชิงความซับซ้อนมาตรฐาน
ทุกอย่างเป็น Apache 2.0 ตระกูลที่คุณดาวน์โหลดได้ทำงานด้วยขนาด 0.1B (12 เลเยอร์ ความกว้าง 768), 0.4B (24 / 1024), 1.5B (24 / 2048), 2.9B (32 / 2560), 7.2B (32 / 4096) และ 13.3B (61 เลเยอร์ ความกว้าง 4096) ทั้งหมดมีคำศัพท์ World จำนวน 65,536 โทเค็น และ head size 64 ชุดฐาน World ถูกฝึกบนคลังข้อความหลายภาษาขนาด 3.1 ล้านล้านโทเค็น; ชุด G1 "GooseOne" ฝึกต่อจากชุดนั้นบน World v3.5 ซึ่งเป็นส่วนผสมที่ขยายเป็น 5.16 ล้านล้านโทเค็น โดยมีนวนิยาย ข้อความเว็บ คณิตศาสตร์ โค้ด และข้อมูลการให้เหตุผลมากขึ้น เช็คพอยต์ G1 เพิ่มโหมดการให้เหตุผลแบบ think-tag, การเรียกใช้ฟังก์ชัน JSON และ fill-in-the-middle ตั้งแต่ G1c เป็นต้นไป การตั้งชื่อค่อนข้างงงจริงๆ: G0 หมายถึงน้อยกว่าหนึ่ง epoch, G1 หมายถึงมากกว่าหนึ่ง และตัวอักษรต่อท้ายบ่งบอกถึงการปรับปรุงข้อมูล โดยตัวอักษรที่หลังกว่าจะมีข้อมูลที่ดีกว่า
ตัวเลข และว่าตัวเลขเหล่านั้นเป็นของใคร
นี่คือข้อเท็จจริงของหลักฐานอย่างตรงไปตรงมา ข้ออ้างหลักในเกณฑ์ชี้วัด — ที่ว่าโมเดล 2.9B สร้างสถิติใหม่ระดับ 3B สำหรับงานหลายภาษา และเทียบเท่าสถิติระดับ 3B ด้านภาษาอังกฤษโดยใช้โทเค็นฝึกฝนน้อยกว่าอย่างมีนัยสำคัญ — เป็นข้ออ้างของตัวบทความเอง ซึ่งตีพิมพ์ในเดือนมีนาคม 2025 และถูกประเมินเทียบกับโมเดลระดับ 3B ในช่วงเวลานั้น บทความผ่าน OpenReview ซึ่งมีการตรวจสอบเข้มงวดกว่าโพสต์บล็อกของผู้จำหน่าย แต่ก็ยังเป็นผลลัพธ์ที่รายงานโดยตนเองบนชุดเปรียบเทียบที่มีอายุสิบห้าเดือน
การวัดผลสาธารณะอีกอย่างหนึ่งของโปรเจกต์คือ UncheatableEval ซึ่งน่าสนใจกว่าแถวในลีดเดอร์บอร์ด แต่แทบไม่ได้รับการกล่าวถึงเลย แทนที่จะให้คะแนนกับแบบทดสอบแบบเลือกตอบที่รั่วไหลเข้าสู่ชุดฝึก โปรเจกต์นี้วัดอัตราการบีบอัดบนข้อมูลที่ไม่มีอยู่ตอนที่โมเดลถูกฝึก: เอกสาร arXiv ใหม่, คลัง GitHub ที่เพิ่งสร้าง, ข่าวล่าสุด การออกแบบเช่นนี้ทำให้การปนเปื้อนยากขึ้นมาก และ RWKV รายงานว่าสามารถแข่งขันได้กับทรานส์ฟอร์มเมอร์ขนาดเดียวกันในการวัดนี้ ยังไงก็ตาม นี่ก็ยังคงเป็นการประเมินที่โปรเจกต์ดำเนินการกับตัวเอง
สิ่งที่ไม่มีอยู่ เท่าที่เราค้นพบได้ คือคะแนนดัชนีจากบุคคลที่สามที่เป็นอิสระสำหรับเช็คพอยต์ RWKV-7 ใดๆ — ไม่มีผู้รวบรวมที่เป็นกลางได้นำ 7.2B หรือ 13.3B ผ่านเครื่องมือทดสอบที่ใช้กับโมเดลระดับแนวหน้า ดังนั้น การเปรียบเทียบที่คุณอาจเห็นกับโมเดลอย่าง DeepSeek V4 Flash หรือ Qwen3.8-Max จึงเป็นความผิดพลาดเชิงหมวดหมู่ซ้ำสอง: ไม่มีใครรัน RWKV-7 ในการประเมินเดียวกัน และ RNN แบบหนาแน่นขนาด 13.3B ไม่ได้แข่งขันกับระบบระดับแนวหน้าในงานเดียวกัน ข้ออ้างที่สมเหตุสมผลนั้นแคบกว่าและมีประโยชน์มากกว่า: ตั้งแต่ 1.5B ถึง 13.3B บนหน่วยความจำคงที่ ในประมาณสิบสองภาษา ด้วยน้ำหนักที่เปิดกว้าง
การใช้งาน RWKV-7 ในปัจจุบัน และต้นทุนที่คุณต้องจ่าย

หน้า Hub สำหรับ RWKV/RWKV7-Goose-World3-1.5B-HF เป็นภาพสะท้อนที่ดีของอุปสรรคในปัจจุบัน เป็นโมเดล BF16 ที่มีพารามิเตอร์ 1.52 พันล้านตัว ใช้ RWKV World tokenizer อยู่ภายใต้สัญญาอนุญาต Apache 2.0 ถูกแท็กเป็น custom_code รองรับภาษาอังกฤษ จีน ญี่ปุ่น เกาหลี ฝรั่งเศส อาหรับ สเปน และโปรตุเกส คำแนะนำบอกให้ติดตั้ง flash-linear-attention และ transformers เวอร์ชันใหม่ก่อนทำการโหลด และในแถบด้านข้าง ซึ่งปกติจะแสดงผู้ให้บริการของโมเดลที่โฮสต์ไว้ กลับระบุอย่างตรงไปตรงมาว่า: โมเดลนี้ไม่ได้ถูกปรับใช้โดย Inference Provider ใด ๆ
ดังนั้น ตัวเลือกของคุณในวันนี้จึงเป็นแบบบริการตนเองทั้งหมด:
• flash-linear-attention plus trust_remote_code — ใกล้เคียงกับการใช้งาน Hub แบบปกติมากที่สุด แต่คุณกำลังเรียกใช้โค้ดจาก repository และดึง Triton kernels เข้ามา ซึ่งจำกัดคุณในเรื่องฮาร์ดแวร์และอะไรก็ตามที่ต้องผ่านการตรวจสอบความปลอดภัย
• GGUF ผ่าน llama.cpp — เส้นทางที่รองรับดีที่สุดในทางปฏิบัติ รวมถึงสำหรับรุ่น 13.3B และเป็นเส้นทางที่คนใช้จริงตามยอดดาวน์โหลด เหมาะสำหรับการอนุมานในเครื่องท้องถิ่น ไม่ใช่สำหรับการเทรนหรือปรับแต่งโมเดล
• รันไทม์ของโปรเจกต์เอง — แพ็กเกจ rwkv pip และคลังอ้างอิง ซึ่งใกล้เคียงเวอร์ชันมาตรฐานที่สุด แต่ห่างไกลจากเครื่องมือที่ทีมของคุณมีอยู่แล้วมากที่สุด
ไม่มีสิ่งใดในนั้นที่เป็น API ที่คุณเรียกใช้ได้ และควรพูดตรง ๆ ถึงนัยสำคัญ: RWKV-7 ไม่ได้อยู่บน OrcaRouter เพราะมันไม่ใช่เอนด์พอยต์ที่โฮสต์ไว้ที่ใดที่เราหาได้ หากคุณต้องการ RWKV-7 คุณก็รัน RWKV-7 เอง สิ่งที่เราพูดได้อย่างตรงไปตรงมาคือผลกระทบต่อส่วนที่เหลือของสแตก การประเมินสถาปัตยกรรมที่ยังไม่ผ่านการพิสูจน์จะคุ้มค่าก็ต่อเมื่อเส้นทางการผลิตของคุณไม่ได้ขึ้นอยู่กับผลลัพธ์นั้น และวิธีที่ถูกที่สุดที่จะรักษาเงื่อนไขนี้ไว้คือการไม่ต้องมีการผสานรวมเฉพาะผู้จำหน่ายสำหรับสิ่งอื่นใด — คีย์เดียวที่เข้ากันได้กับ OpenAI ครอบคลุมโมเดลกว่า 200 รายการ ส่งผ่านราคาที่ผู้ให้บริการกำหนดตรง ๆ โดยไม่บวกกำไร 0% และเฟลโอเวอร์อัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลง การทดลอง RWKV-7 แบบโฮสต์ด้วยตนเองบนเวิร์กโหลดสองประเภทที่หน่วยความจำคงที่ให้ผลตอบแทนจริง — สตรีมที่ทำงานต่อเนื่องยาวนาน ผู้ช่วยบนอุปกรณ์ เครื่องสรุปความที่ไม่เคยหยุด — จึงเป็นการทดลอง ไม่ใช่การย้ายระบบ นั่นคือรูปแบบที่ทีมส่วนใหญ่ควรต้องการ: ค่าเริ่มต้นแบบมีเส้นทาง (routed default) และโมเดลเชิงสถานะที่พิสูจน์คุณค่าของมันในงานเฉพาะนั้น
อะไรจะยังหยุดการลงจอดนี้ได้
จงนำแบบอย่างนี้มาพิจารณาอย่างจริงจัง: ข้อเสนอที่จะเพิ่มสถาปัตยกรรมแบบเดียวกันนี้เคยถูกปฏิเสธมาแล้วครั้งหนึ่ง ด้วยเหตุผลที่ผู้เขียนยอมรับว่าถูกต้อง ข้อเสนอใหม่นี้มีการโต้แย้งที่ดีกว่าและผ่านการทดสอบที่ดีกว่า และยังคงเป็น PR จากชุมชนที่ยื่นต่อ repository ที่จงใจอนุรักษ์นิยมในการรับสถาปัตยกรรมที่มันจะต้องดูแลรักษาตลอดไป
คำถามเฉพาะที่ยังค้างอยู่ซึ่งเราอยากให้มีคำตอบก่อนจะถือว่างานนี้เสร็จสมบูรณ์:
• รีวิว ไม่ใช่ CI — ชุดทดสอบอัตโนมัติผ่านทั้งหมดแล้ว มีการขอให้ผู้ดูแลสองคนตรวจสอบ แต่ยังไม่มีใครอนุมัติ Transformers ต้องมีรีวิวที่อนุมัติหนึ่งครั้ง และยังไม่ได้รันการทดสอบที่ช้า
• ความเร็วของเส้นทางที่ไร้ dependencies — PyTorch ล้วนที่มีการถอดรหัสแบบโทเคนเดียวตามลำดับนั้นพกพาได้ และการพกพาได้คือจุดสำคัญทั้งหมด แต่ PR ไม่ได้เผยแพร่ throughput เทียบกับ Triton kernels ใน flash-linear-attention หากการถอดรหัสแบบ native ช้าลงอย่างมีนัยสำคัญ ไลบรารีก็จะกลายเป็นเส้นทางสำหรับความเข้ากันได้ ในขณะที่การให้บริการในระดับจริงจังยังอยู่ที่อื่น
• เช็คพอยต์ใดบ้างที่มาถึง — การแปลงที่สอดคล้องกับธรรมเนียมปฏิบัติครอบคลุมตั้งแต่ 0.1B ถึง 7.2B ส่วน G1 ขนาด 13.3B ซึ่งเป็นรุ่นที่ผู้คนต้องการจริงๆ ไม่ได้อยู่ในชุดนั้น และตัวอย่างที่บันทึกไว้คือโมเดล Pile ที่ใช้โทเคนไนเซอร์ GPT-NeoX แทนที่จะเป็นโมเดลแชทที่มีคลังคำศัพท์แบบ World ตัวโหลดแบบรวมที่ไม่มีเช็คพอยต์เรือธงหนุนหลังอยู่นั้น เปลี่ยนแปลงน้อยกว่าที่เห็นภายนอก
• เป้าหมายที่เคลื่อนที่โปรเจกต์ไม่ได้หยุดนิ่ง คลังเก็บ G1 ของ BlinkDL ได้รับการอัปเดตในสัปดาห์เดียวกับที่ PR นี้เปิดขึ้น การควอนไทซ์ของชุมชนได้ขยับไปใช้ข้อมูลรีวิชันที่ใหม่กว่า G1c แล้ว และ RWKV-8 "Heron" ถูกเปิดตัวต่อสาธารณะพร้อมกลไก suffix-automaton ที่เรียกว่า ROSA Heron ยังไม่เผยแพร่และยังไม่ได้ผ่านการ benchmark เรากล่าวถึงมันเพียงเพราะการผสานรวมไลบรารีที่มาช้าในช่วงท้ายของเจเนอเรชันนั้นมีอายุการใช้งานสั้น
สี่คำถามที่สเปกชีตไม่มีคำตอบ
ตอนนี้ใช้ RWKV-7 ใน Transformers ได้หรือยัง
ทั้งสองอย่าง น่าหงุดหงิด และความแตกต่างคือเรื่องทั้งหมด คุณสามารถโหลด checkpoint ของ RWKV-7 ผ่าน API ของ transformers ได้ในวันนี้ หากคุณติดตั้ง flash-linear-attention และส่ง trust_remote_code เพื่อให้ไฟล์ modeling ของ repository นั้นทำงานเอง สิ่งที่คุณทำไม่ได้คือโหลดจากตัวไลบรารีโดยตรง ซึ่งเป็นสิ่งที่ทำให้มันทำงานเป็นค่าเริ่มต้นในเครื่องมือที่สร้างบนไลบรารี — สคริปต์ฝึกและปรับแต่ง, adapters, ชุดประเมินผล, เส้นทางการส่งออก — และเป็นสิ่งที่ทำให้มันผ่านนโยบายที่ห้ามใช้ remote code สิ่งที่สองนั้นคือสิ่งที่ #47780 มีไว้
การรวมกันทำให้โมเดลดีขึ้นหรือไม่?
ไม่ใช่ด้วยคะแนนเดียวบนเกณฑ์มาตรฐานใดๆ มันเปลี่ยนการกระจาย ไม่ใช่คุณภาพ — และสำหรับสถาปัตยกรรมที่ปัญหาของมันไม่เคยเป็นเรื่องคุณภาพ การกระจายคือข้อจำกัดที่ผูกมัด การเปรียบเทียบคืออันที่อยู่ตอนบนของบทความนี้: โมเดล 169M จากปี 2023 ถูกดาวน์โหลดมากกว่าน้ำหนักของรุ่นปัจจุบันในอัตราส่วนสี่สิบต่อหนึ่ง โดยอาศัยความแข็งแกร่งของการโหลดโดยไม่ใช้แฟล็กทั้งหมด
ถ้าไม่มี KV cache ฉันจะได้บริบทไม่จำกัดฟรีหรือไม่?
คุณได้รับความยาวบริบทไม่จำกัดโดยไม่ทำให้หน่วยความจำพองตัว ซึ่งไม่เหมือนกับการเรียกคืนข้อมูลที่ไม่จำกัด สเตตขนาดคงที่มีความจุข้อมูลคงที่ ป้อนโทเคนหนึ่งล้านตัวเข้าไป มันก็ไม่สามารถเก็บรายละเอียดที่เรียกคืนได้เทียบเท่าหนึ่งล้านโทเคน แอตเทนชันที่มีแคชเต็มทำได้ แต่ด้วยต้นทุนที่เพิ่มขึ้นตลอดทาง จงมองเรื่องราวบริบทยาวของ RWKV-7 ว่า "สตรีมได้ตลอดไปในราคาถูก บีบอัดไปเรื่อยๆ" และทดสอบการเรียกคืนเฉพาะที่คุณต้องการ แทนที่จะเชื่อคำว่า "ไม่จำกัด"
มันคุ้มค่าที่จะสนใจที่ 13.3B หรือไม่ ในเมื่อโมเดลระดับแนวหน้ามีขนาดเป็นหลายแสนล้าน?
ขึ้นอยู่กับว่าหน่วยความจำคงที่มีค่ากับคุณมากแค่ไหน หากคุณเรียกใช้ API ที่โฮสต์ไว้และจ่ายเงินต่อโทเค็น เกือบจะแน่นอนว่าไม่คุ้ม — โมเดลระดับแนวหน้านำหน้าไปไกลในด้านความสามารถ และคุณไม่ได้จ่ายค่า KV cache โดยตรง หากคุณส่ง inference ไปทำงานบนฮาร์ดแวร์ที่คุณไม่ได้ควบคุม หรือรันสตรีมต่อเนื่องที่แคชที่โตขึ้นเรื่อย ๆ เป็นสิ่งที่จะทำให้โปรเซสตายในที่สุด สถาปัตยกรรมที่ขนาดหน่วยความจำไม่เปลี่ยนแปลงคือคำตอบคนละแบบสำหรับคำถามคนละข้อ นี่คือเวิร์กโหลดที่ RWKV-7 ขนาด 2.9B แข่งขันได้อย่างเงียบ ๆ และเป็นจุดที่ native loader จะสำคัญที่สุด
สิ่งที่เราจะดูต่อไป
สัญญาณที่เป็นรูปธรรมสี่ประการ ตามลำดับคร่าวๆ ว่ามันจะเปลี่ยนการประเมินของเราไปมากแค่ไหน บทวิจารณ์ที่ให้การอนุมัติจาก ArthurZucker หรือ Rocketknight1 ซึ่งเปลี่ยนสิ่งนี้จาก diff ที่มีความหวังให้กลายเป็นฟีเจอร์ที่ถูกกำหนดไว้ในตารางงาน การแปลง 13.3B G1 ที่สอดคล้องตามหลักปฏิบัติด้วย World tokenizer ซึ่งเป็นสิ่งที่ทำให้ loader คุ้มค่าที่จะใช้งาน ตัวเลข throughput ที่เผยแพร่สำหรับเส้นทาง decode ที่ไม่พึ่งพาไลบรารีเทียบกับ Triton kernels ซึ่งเป็นตัวชี้ขาดว่าการรองรับแบบเนทีฟเป็นตัวเลือกสำหรับการให้บริการหรือเป็นเพียงตัวเชื่อมเพื่อความเข้ากันได้ และสัญญาณใดๆ ของ RWKV-8 ซึ่งจะบอกว่าการผสานรวมนี้มาถึงที่จุดเริ่มต้นของเจเนอเรชันหนึ่งหรือจุดสิ้นสุดของเจเนอเรชัน
อย่างน้อยก็จนกว่าสิ่งแรกในบรรดาสิ่งเหล่านั้นจะเกิดขึ้น บทสรุปที่ถูกต้องก็คือบทสรุปที่ดูไม่สวยงาม: RWKV-7 (Goose) มีอยู่จริง ได้รับอนุญาตแบบเปิดกว้าง (permissive license) ดาวน์โหลดได้จนถึงขนาด 13.3B แต่ยังคงไม่สามารถโหลดได้โดยตรงในไลบรารีที่ระบบนิเวศส่วนใหญ่สร้างอยู่บนมัน pull request ที่เปิดเมื่อวันที่ 4 สิงหาคม 2026 เสนอให้แก้ไขปัญหานั้น แต่ยังไม่ถูกผสาน และ pull requests ที่จะเพิ่มสถาปัตยกรรมต่าง ๆ เข้าไปใน transformers ก็มักจะถูกปิดได้เช่นกัน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
