RWKV-7 Goose-1
Engineering & Research

RWKV-7 (Goose): เบื้องหลัง Pull Request ที่จะโหลดมันลงใน Transformers ได้ในที่สุด

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โมเดล RWKV ที่ถูกดาวน์โหลดมากที่สุดบน Hugging Face เมื่อเดือนที่แล้วไม่ใช่ RWKV-7 (Goose) สถาปัตยกรรมที่โปรเจกต์เผยแพร่ตั้งแต่มีนาคม 2025 และไม่ใช่ RWKV7-G1 ชุดโมเดล reasoning ที่เทรนบนสถาปัตยกรรมดังกล่าว แต่เป็น RWKV/rwkv-4-169m-pile: checkpoint RWKV-4 ขนาด 169 ล้านพารามิเตอร์จากพฤษภาคม 2023 มียอดดาวน์โหลด 8,824 ครั้งใน 30 วันจนถึง 5 สิงหาคม 2026 เทียบกับ 215 ครั้งสำหรับ RWKV-7 Goose World-3 ขนาด 1.5B และ 316 ครั้งสำหรับขนาด 2.9B โมเดลปี 2023 ไม่ได้ดีกว่า แต่เป็นโมเดลที่โหลดได้ด้วยการเรียก from_pretrained แบบธรรมดา โดยไม่ต้องติดตั้งอะไรเพิ่มเติม

เมื่อวันที่ 4 สิงหาคม 2026 ผู้มีส่วนร่วมชื่อ Hakureirm ได้เปิด pull request #47780 ไปยัง huggingface/transformers ในชื่อ "Add RWKV-7 (Goose)" ณ วันที่ 5 สิงหาคม PR นี้ยังเปิดอยู่ ยังไม่ได้รับการรีวิวและยังไม่ถูก merge และนี่คือความพยายามครั้งที่สอง — ข้อเสนอแรกคือ #46984 ถูกปฏิเสธไปแล้ว ยังไม่มีอะไรถูก merge และบทความนี้ไม่ควรถูกอ่านว่าเป็นการประกาศปล่อยเวอร์ชัน แต่ diff นั้นเปิดเผยต่อสาธารณะ และมันจัดการกับสิ่งที่ทั้งน่าเบื่อที่สุดและสำคัญที่สุดที่ขวางกั้นระหว่างสายเลือด LLM ที่ไม่ใช้ attention ซึ่งอยู่มานานที่สุด กับสแตกที่ทีมส่วนใหญ่ใช้จริง: ตัวโหลด (loader)

สิ่งที่ตามมานี้เป็นการแยกข้อกล่าวอ้างออกเป็นสามประเภท เนื่องจากการรายงานข่าวเกี่ยวกับ RWKV โดยปกติมักจะปะปนข้อกล่าวอ้างเหล่านี้เข้าด้วยกัน มีสิ่งที่ตรวจสอบได้จริงในพูลรีเควสต์และบน Hub ซึ่งคุณสามารถตรวจสอบได้ด้วยตนเอง มีสิ่งที่โครงการ RWKV รายงานเกี่ยวกับโมเดลของตัวเอง จากการประเมินของพวกเขาเอง และมีชุดคำถามขนาดใหญ่ที่ยังไม่มีใครตอบต่อสาธารณะ ซึ่งเป็นที่ที่ความเสี่ยงที่น่าสนใจส่วนใหญ่อาศัยอยู่

จริงๆ แล้วใน pull request มีอะไร

RWKV-7 Goose-2

ข้อเท็จจริงเชิงกลไก อ่านจากหน้า PR และ GitHub API เมื่อวันที่ 5 สิงหาคม 2026:

ขอบเขต — สามคอมมิต ไฟล์ที่เปลี่ยนแปลง 12 ไฟล์ เพิ่ม 4,423 บรรทัดและลบ 0 บรรทัด จากแบรนช์ add-rwkv7-upstream ไปยัง huggingface:main ติดป้าย "โมเดลใหม่" ไม่มีผู้รับผิดชอบ ไม่มีไมล์สโตน

สิ่งที่เพิ่ม — RWKV-7 ในรูปแบบคลาสสาธารณะสองคลาสคือ Rwkv7Model และ Rwkv7ForCausalLM พร้อมกับ Rwkv7Cache ที่สร้างขึ้นบน LinearAttentionLayer ของไลบรารี dtype ของสถานะ WKV สามารถกำหนดค่าได้อย่างอิสระจาก dtype ของโมเดล ซึ่งมีความสำคัญเนื่องจากสถานะแบบ recurrent เป็นจุดที่ข้อผิดพลาดเชิงตัวเลขสะสมในตระกูลนี้

วิธีการทำงาน — PyTorch แบบพกพา ไม่ต้องพึ่งพา runtime จากบุคคลที่สาม Prefill ใช้การเกิดซ้ำในรูปแบบขนานแบบชิ้นส่วน ส่วน decode ทำงานในเส้นทางตามลำดับทีละโทเคน ชื่อพารามิเตอร์เป็นไปตาม reference implementation ต้นทางของ RWKV แทนที่จะถูกเปลี่ยนชื่อให้ดูเหมือน transformer

ท่าทีการทดสอบ — นอกเหนือจากมิกซินโมเดลมาตรฐานแล้ว การทดสอบเชิงบูรณาการที่ตรงกับรันไทม์ของ BlinkDL เองแบบโทเคนต่อโทเคน พร้อมทั้งอิมพลีเมนเทชันอ้างอิง NumPy ที่ไม่มีโค้ดร่วมกับไฟล์โมเดล บอทสรุป CI ของรีโพสรายงานการรันล่าสุดว่าสำเร็จ: 16 จ็อบ, 179,151 การทดสอบ, ศูนย์ความล้มเหลว, เวลาประมวลผล 16 ชั่วโมง 9 นาที

สถานะปัจจุบัน — ขอให้ ArthurZucker และ Rocketknight1 เป็นผู้ตรวจสอบแล้ว หน้าระบุว่าต้องมีรีวิวที่เห็นชอบอย่างน้อยหนึ่งรายการจึงจะ merge ได้ และยังไม่มีใครให้รีวิวเลย GitHub API ยังคงระบุสถานะการ merge ว่า "ไม่เสถียร" ตอนที่เราอ่าน และบอทสำหรับผู้ดูแลได้ขอให้รันชุดทดสอบแบบช้า (auto และ rwkv7) ก่อน merge กล่าวคือ: ผ่านการทดสอบ CI แบบเร็ว แต่ยังไม่ได้รับอนุมัติจากมนุษย์

ส่วนที่น่าสนใจที่สุดของคำอธิบายคือการยอมรับ ความพยายามก่อนหน้านี้ #46984 ถูกปฏิเสธเพราะเช็คพอยต์ RWKV-7 ที่เผยแพร่นั้นไม่เป็นไปตามธรรมเนียมของ Transformers และการวางกรอบของผู้เขียนเองก็คือ "การคัดค้านนั้นถูกต้อง" ปัญหาที่ระบุไว้ใน PR คือน้ำหนักของ RWKV-7 บน Hub มาในสองรูปแบบที่ไลบรารีไม่สามารถใช้งานได้:

พื้นที่เก็บข้อมูล PTH — ไฟล์ .pth ดิบ ไม่มี safetensors การใช้งานไลบรารีไม่สามารถโหลดไฟล์เหล่านี้ได้ และไฟล์ pickle ของ PyTorch คือสิ่งที่การตรวจสอบความปลอดภัยในบริษัทขนาดใหญ่จะปฏิเสธอย่างแน่นอน

พื้นที่เก็บข้อมูล HF — สิ่งเหล่านี้มาพร้อมกับ model.safetensors แต่แต่ละแห่งก็มี modeling_rwkv7.py และ auto_map มาด้วยเช่นกัน ดังนั้นการโหลดหนึ่งในนั้นจึงต้องใช้ trust_remote_code ซึ่งก็คือการเรียกใช้โค้ดจากระยะไกลอันเป็นเงื่อนไขของการอนุมาน และนี่คือเหตุผลที่เช็กลิสต์ระดับองค์กรจำนวนมากหยุดอยู่แค่นั้น

ดังนั้น PR นี้จึงทำงานสองอย่างพร้อมกัน มันเพิ่มไฟล์โมเดล และชี้ไปยังชุดการแปลงใหม่ที่สร้างขึ้นโดยตรงจากรุ่น .pth มาตรฐานของ BlinkDL ซึ่งเป็นไปตามโครงสร้างมาตรฐาน — ใช้เฉพาะ safetensors ไม่มี pickle ไม่มีโค้ดระยะไกล มี config.json ปกติที่บรรจุ architectures และ model_type — ครอบคลุมตั้งแต่ 0.1B ถึง 7.2B โมเดลที่เล็กที่สุดคือ Hakureirm/rwkv7-168m-pile-hf มีเทนเซอร์ทั้งหมด 399 ตัวที่ผ่านการตรวจสอบว่าตรงกันแบบบิตต่อบิตกับไฟล์ .pth ต้นทาง แทนที่จะตรวจสอบแบบสุ่มจุด เช็คพอยต์นั้นเป็นโมเดล Pile ดังนั้นโทเคไนเซอร์จึงเป็น GPT-NeoX-20B fast tokenizer ทั่วไป แทนที่จะเป็นคำศัพท์ RWKV World — ด้วยเหตุผลเดียวกันกับที่หน้า RWKV ที่มีอยู่ของไลบรารีบันทึกเช็คพอยต์ Pile เอาไว้เช่นกัน

ทำไมเช็คพอยต์จากปี 2023 ถึงมียอดดาวน์โหลดมากกว่าสถาปัตยกรรมปัจจุบัน

RWKV-7 Goose-3

Transformers อยู่ในเวอร์ชัน 5.14.1 เผยแพร่เมื่อวันที่ 16 กรกฎาคม 2026 ค้นหาเอกสารสำหรับ RWKV จะพบหน้ารุ่นเพียงหน้าเดียว ซึ่งอธิบาย “โมเดล RWKV (เวอร์ชัน 4)” ที่ถูกสนับสนุนเมื่อหลายปีก่อน โดยใช้ RWKV/rwkv-4-169m-pile เป็นตัวอย่าง และมีคำศัพท์เริ่มต้น 50,277 โทเคน ไม่มีหน้าสำหรับ RWKV-5, RWKV-6 หรือ RWKV-7 สถาปัตยกรรมสามรุ่นได้ถูกเผยแพร่ออกไปนับตั้งแต่การสนับสนุน RWKV ของไลบรารีถูกเขียนขึ้น และไม่มีรุ่นใดอยู่ในนั้นเลย

ตัวเลขดาวน์โหลดแสดงให้เห็นว่าระบบนิเวศจัดการกับเรื่องนั้นอย่างไร: มันเลี่ยงไลบรารีนั้นไป เรียงตามจำนวนดาวน์โหลดใน 30 วันที่ผ่านมา รีโพซิทอรี RWKV-7 ที่ติดอันดับสูงสุดได้แก่ ไฟล์ .pth ดิบของ BlinkDL (rwkv7-g1 ที่ 8,288 และ rwkv-7-world ที่ 4,489) และเวอร์ชัน GGUF ควอนไทซ์จากชุมชนจำนวนมากของ G1 13.3B — โดยมีผู้อัปโหลดหลายรายแยกกัน แต่ละรายมียอดดาวน์โหลดเดือนละหนึ่งถึงสามพันครั้ง มิเรอร์รูปแบบ transformers อย่างเป็นทางการมีจำนวนดาวน์โหลดต่ำกว่าน้ำหนักดิบถึงสองลำดับขนาด มิเรอร์ flash-linear-attention ของ G1 2.9B ทำยอดได้ 1,843 ครั้ง

รูปแบบนั้นมีคำอธิบายง่ายๆ llama.cpp รวมการรองรับ RWKV v7 เมื่อวันที่ 17 มีนาคม 2025 — เคอร์เนล GGML_OP_RWKV_WKV7 ที่มีแบ็กเอนด์ CPU, CUDA, SYCL, Vulkan และ Metal — ประมาณหนึ่งวันหลังจากที่บทความวิจัยเผยแพร่ หากคุณต้องการรัน RWKV-7 บนเครื่องของคุณเอง เส้นทางที่เร็วคือ GGUF และเป็นเช่นนั้นมาเป็นเวลาสิบหกเดือนแล้ว เส้นทางที่ไม่มีอยู่คือเส้นทางที่สคริปต์ fine-tuning ทุกตัว อะแดปเตอร์ PEFT ทุกตัว กรอบการประเมินผลทุกชุด และ wrapper การให้บริการภายในทุกตัวคาดหวัง: AutoModelForCausalLM.from_pretrained โดยไม่มีแฟล็กใดๆ

RWKV-7 (Goose) จริงๆ แล้วคืออะไร

RWKV-7 เป็นโครงข่ายประสาทแบบรีเคอร์เรนต์ ไม่ใช่ทรานส์ฟอร์เมอร์ที่มีเคอร์เนลแอตเทนชันที่ประหยัดกว่า และการตั้งชื่อนี้ทำให้ผู้คนสับสนอยู่เสมอ มันส่งต่อสถานะขนาดคงที่ไปตามลำดับ แทนที่จะใช้แคชที่เพิ่มขึ้นของคีย์และค่าในอดีต อย่างเป็นรูปธรรม เมื่อเทียบกับโมเดลแอตเทนชันมาตรฐาน:

หน่วยความจำเติบโตตามบริบท — แคช KV ของ transformer เติบโตแบบเส้นตรงตามจำนวนโทเค็นที่กำลังประมวลผล; RWKV-7 เก็บสถานะที่มีขนาดกำหนดโดยสถาปัตยกรรม ไม่ใช่โดยบทสนทนา นั่นคือข้อโต้แย้งด้านประสิทธิภาพทั้งหมด

ต้นทุนต่อโทเคน — attention มีต้นทุนต่อโทเคนสูงขึ้นเมื่อบริบทยาวขึ้น ในขณะที่ต้นทุนการอนุมานต่อโทเคนของ RWKV-7 นั้นคงที่ ซึ่งเป็นเหตุผลว่าทำไมมันจึงถูกหยิบยกขึ้นมาอยู่เสมอในข้อเสนอสำหรับการประมวลผลแบบ edge และการสตรีมแบบตลอดเวลา (always-on-stream)

รูปแบบการฝึก — ต่างจาก RNN แบบคลาสสิก การเกิดซ้ำสามารถทำแบบขนานได้ในแต่ละ chunk ดังนั้นการพรีเทรนจึงไม่เสื่อมลงเป็นการประมวลผลแบบลำดับที่เชื่องช้า นี่คือสิ่งที่เส้นทาง prefill แบบ chunk-parallel ของ PR นำไปใช้

เพดานบริบท — ไม่มีแคชให้ระเบิด ดังนั้นโปรเจกต์จึงนำเสนอบริบทที่แทบไร้ขีดจำกัด สิ่งที่สถานะคงที่ทำไม่ได้คือการเก็บรายละเอียดอันไร้ขีดจำกัดไว้ได้ ซึ่งเป็นข้อจำกัดจริง ไม่ใช่เพียงเชิงอรรถ.

ข้อกล่าวอ้างทางสถาปัตยกรรมในบทความ ซึ่งเผยแพร่เมื่อวันที่ 18 มีนาคม 2025 โดย Bo Peng, Yu Zhang, Songlin Yang และ Ruichong Zhang ภายใต้โครงการ RWKV ที่ LF AI & Data Foundation คือกฎเดลตาทั่วไป (generalized delta rule) ที่มีการเกตแบบเวกเตอร์ (vector-valued gating) อัตราการเรียนรู้ภายในบริบท (in-context learning rates) และกฎการแทนค่าแบบผ่อนคลาย (relaxed value-replacement rule) พร้อมด้วย MLP ที่ถูกทำให้เรียบง่ายขึ้น (ตัดเมทริกซ์เกตออก และขยายความกว้างของเลเยอร์ซ่อนเพื่อชดเชย) ผลเชิงทฤษฎีที่ผูกกับข้อกล่าวอ้างนี้คือครึ่งที่ provoking กว่า: RWKV-7 สามารถติดตามสถานะ (state tracking) และรู้จำภาษาปกติ (regular languages) ทั้งหมดได้ ในขณะที่ยังคงสามารถทำขนานในการฝึกได้ (parallelizable in training) ซึ่งผู้เขียนโต้แย้งว่ามีศักยภาพเหนือกว่าที่ทรานส์ฟอร์เมอร์จะทำได้ภายใต้ข้อสันนิษฐานเชิงความซับซ้อนมาตรฐาน

ทุกอย่างเป็น Apache 2.0 ตระกูลที่คุณดาวน์โหลดได้ทำงานด้วยขนาด 0.1B (12 เลเยอร์ ความกว้าง 768), 0.4B (24 / 1024), 1.5B (24 / 2048), 2.9B (32 / 2560), 7.2B (32 / 4096) และ 13.3B (61 เลเยอร์ ความกว้าง 4096) ทั้งหมดมีคำศัพท์ World จำนวน 65,536 โทเค็น และ head size 64 ชุดฐาน World ถูกฝึกบนคลังข้อความหลายภาษาขนาด 3.1 ล้านล้านโทเค็น; ชุด G1 "GooseOne" ฝึกต่อจากชุดนั้นบน World v3.5 ซึ่งเป็นส่วนผสมที่ขยายเป็น 5.16 ล้านล้านโทเค็น โดยมีนวนิยาย ข้อความเว็บ คณิตศาสตร์ โค้ด และข้อมูลการให้เหตุผลมากขึ้น เช็คพอยต์ G1 เพิ่มโหมดการให้เหตุผลแบบ think-tag, การเรียกใช้ฟังก์ชัน JSON และ fill-in-the-middle ตั้งแต่ G1c เป็นต้นไป การตั้งชื่อค่อนข้างงงจริงๆ: G0 หมายถึงน้อยกว่าหนึ่ง epoch, G1 หมายถึงมากกว่าหนึ่ง และตัวอักษรต่อท้ายบ่งบอกถึงการปรับปรุงข้อมูล โดยตัวอักษรที่หลังกว่าจะมีข้อมูลที่ดีกว่า

ตัวเลข และว่าตัวเลขเหล่านั้นเป็นของใคร

นี่คือข้อเท็จจริงของหลักฐานอย่างตรงไปตรงมา ข้ออ้างหลักในเกณฑ์ชี้วัด — ที่ว่าโมเดล 2.9B สร้างสถิติใหม่ระดับ 3B สำหรับงานหลายภาษา และเทียบเท่าสถิติระดับ 3B ด้านภาษาอังกฤษโดยใช้โทเค็นฝึกฝนน้อยกว่าอย่างมีนัยสำคัญ — เป็นข้ออ้างของตัวบทความเอง ซึ่งตีพิมพ์ในเดือนมีนาคม 2025 และถูกประเมินเทียบกับโมเดลระดับ 3B ในช่วงเวลานั้น บทความผ่าน OpenReview ซึ่งมีการตรวจสอบเข้มงวดกว่าโพสต์บล็อกของผู้จำหน่าย แต่ก็ยังเป็นผลลัพธ์ที่รายงานโดยตนเองบนชุดเปรียบเทียบที่มีอายุสิบห้าเดือน

การวัดผลสาธารณะอีกอย่างหนึ่งของโปรเจกต์คือ UncheatableEval ซึ่งน่าสนใจกว่าแถวในลีดเดอร์บอร์ด แต่แทบไม่ได้รับการกล่าวถึงเลย แทนที่จะให้คะแนนกับแบบทดสอบแบบเลือกตอบที่รั่วไหลเข้าสู่ชุดฝึก โปรเจกต์นี้วัดอัตราการบีบอัดบนข้อมูลที่ไม่มีอยู่ตอนที่โมเดลถูกฝึก: เอกสาร arXiv ใหม่, คลัง GitHub ที่เพิ่งสร้าง, ข่าวล่าสุด การออกแบบเช่นนี้ทำให้การปนเปื้อนยากขึ้นมาก และ RWKV รายงานว่าสามารถแข่งขันได้กับทรานส์ฟอร์มเมอร์ขนาดเดียวกันในการวัดนี้ ยังไงก็ตาม นี่ก็ยังคงเป็นการประเมินที่โปรเจกต์ดำเนินการกับตัวเอง

สิ่งที่ไม่มีอยู่ เท่าที่เราค้นพบได้ คือคะแนนดัชนีจากบุคคลที่สามที่เป็นอิสระสำหรับเช็คพอยต์ RWKV-7 ใดๆ — ไม่มีผู้รวบรวมที่เป็นกลางได้นำ 7.2B หรือ 13.3B ผ่านเครื่องมือทดสอบที่ใช้กับโมเดลระดับแนวหน้า ดังนั้น การเปรียบเทียบที่คุณอาจเห็นกับโมเดลอย่าง DeepSeek V4 Flash หรือ Qwen3.8-Max จึงเป็นความผิดพลาดเชิงหมวดหมู่ซ้ำสอง: ไม่มีใครรัน RWKV-7 ในการประเมินเดียวกัน และ RNN แบบหนาแน่นขนาด 13.3B ไม่ได้แข่งขันกับระบบระดับแนวหน้าในงานเดียวกัน ข้ออ้างที่สมเหตุสมผลนั้นแคบกว่าและมีประโยชน์มากกว่า: ตั้งแต่ 1.5B ถึง 13.3B บนหน่วยความจำคงที่ ในประมาณสิบสองภาษา ด้วยน้ำหนักที่เปิดกว้าง

การใช้งาน RWKV-7 ในปัจจุบัน และต้นทุนที่คุณต้องจ่าย

RWKV-7 Goose-4

หน้า Hub สำหรับ RWKV/RWKV7-Goose-World3-1.5B-HF เป็นภาพสะท้อนที่ดีของอุปสรรคในปัจจุบัน เป็นโมเดล BF16 ที่มีพารามิเตอร์ 1.52 พันล้านตัว ใช้ RWKV World tokenizer อยู่ภายใต้สัญญาอนุญาต Apache 2.0 ถูกแท็กเป็น custom_code รองรับภาษาอังกฤษ จีน ญี่ปุ่น เกาหลี ฝรั่งเศส อาหรับ สเปน และโปรตุเกส คำแนะนำบอกให้ติดตั้ง flash-linear-attention และ transformers เวอร์ชันใหม่ก่อนทำการโหลด และในแถบด้านข้าง ซึ่งปกติจะแสดงผู้ให้บริการของโมเดลที่โฮสต์ไว้ กลับระบุอย่างตรงไปตรงมาว่า: โมเดลนี้ไม่ได้ถูกปรับใช้โดย Inference Provider ใด ๆ

ดังนั้น ตัวเลือกของคุณในวันนี้จึงเป็นแบบบริการตนเองทั้งหมด:

flash-linear-attention plus trust_remote_code — ใกล้เคียงกับการใช้งาน Hub แบบปกติมากที่สุด แต่คุณกำลังเรียกใช้โค้ดจาก repository และดึง Triton kernels เข้ามา ซึ่งจำกัดคุณในเรื่องฮาร์ดแวร์และอะไรก็ตามที่ต้องผ่านการตรวจสอบความปลอดภัย

GGUF ผ่าน llama.cpp — เส้นทางที่รองรับดีที่สุดในทางปฏิบัติ รวมถึงสำหรับรุ่น 13.3B และเป็นเส้นทางที่คนใช้จริงตามยอดดาวน์โหลด เหมาะสำหรับการอนุมานในเครื่องท้องถิ่น ไม่ใช่สำหรับการเทรนหรือปรับแต่งโมเดล

รันไทม์ของโปรเจกต์เอง — แพ็กเกจ rwkv pip และคลังอ้างอิง ซึ่งใกล้เคียงเวอร์ชันมาตรฐานที่สุด แต่ห่างไกลจากเครื่องมือที่ทีมของคุณมีอยู่แล้วมากที่สุด

ไม่มีสิ่งใดในนั้นที่เป็น API ที่คุณเรียกใช้ได้ และควรพูดตรง ๆ ถึงนัยสำคัญ: RWKV-7 ไม่ได้อยู่บน OrcaRouter เพราะมันไม่ใช่เอนด์พอยต์ที่โฮสต์ไว้ที่ใดที่เราหาได้ หากคุณต้องการ RWKV-7 คุณก็รัน RWKV-7 เอง สิ่งที่เราพูดได้อย่างตรงไปตรงมาคือผลกระทบต่อส่วนที่เหลือของสแตก การประเมินสถาปัตยกรรมที่ยังไม่ผ่านการพิสูจน์จะคุ้มค่าก็ต่อเมื่อเส้นทางการผลิตของคุณไม่ได้ขึ้นอยู่กับผลลัพธ์นั้น และวิธีที่ถูกที่สุดที่จะรักษาเงื่อนไขนี้ไว้คือการไม่ต้องมีการผสานรวมเฉพาะผู้จำหน่ายสำหรับสิ่งอื่นใด — คีย์เดียวที่เข้ากันได้กับ OpenAI ครอบคลุมโมเดลกว่า 200 รายการ ส่งผ่านราคาที่ผู้ให้บริการกำหนดตรง ๆ โดยไม่บวกกำไร 0% และเฟลโอเวอร์อัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลง การทดลอง RWKV-7 แบบโฮสต์ด้วยตนเองบนเวิร์กโหลดสองประเภทที่หน่วยความจำคงที่ให้ผลตอบแทนจริง — สตรีมที่ทำงานต่อเนื่องยาวนาน ผู้ช่วยบนอุปกรณ์ เครื่องสรุปความที่ไม่เคยหยุด — จึงเป็นการทดลอง ไม่ใช่การย้ายระบบ นั่นคือรูปแบบที่ทีมส่วนใหญ่ควรต้องการ: ค่าเริ่มต้นแบบมีเส้นทาง (routed default) และโมเดลเชิงสถานะที่พิสูจน์คุณค่าของมันในงานเฉพาะนั้น

อะไรจะยังหยุดการลงจอดนี้ได้

จงนำแบบอย่างนี้มาพิจารณาอย่างจริงจัง: ข้อเสนอที่จะเพิ่มสถาปัตยกรรมแบบเดียวกันนี้เคยถูกปฏิเสธมาแล้วครั้งหนึ่ง ด้วยเหตุผลที่ผู้เขียนยอมรับว่าถูกต้อง ข้อเสนอใหม่นี้มีการโต้แย้งที่ดีกว่าและผ่านการทดสอบที่ดีกว่า และยังคงเป็น PR จากชุมชนที่ยื่นต่อ repository ที่จงใจอนุรักษ์นิยมในการรับสถาปัตยกรรมที่มันจะต้องดูแลรักษาตลอดไป

คำถามเฉพาะที่ยังค้างอยู่ซึ่งเราอยากให้มีคำตอบก่อนจะถือว่างานนี้เสร็จสมบูรณ์:

รีวิว ไม่ใช่ CI — ชุดทดสอบอัตโนมัติผ่านทั้งหมดแล้ว มีการขอให้ผู้ดูแลสองคนตรวจสอบ แต่ยังไม่มีใครอนุมัติ Transformers ต้องมีรีวิวที่อนุมัติหนึ่งครั้ง และยังไม่ได้รันการทดสอบที่ช้า

ความเร็วของเส้นทางที่ไร้ dependencies — PyTorch ล้วนที่มีการถอดรหัสแบบโทเคนเดียวตามลำดับนั้นพกพาได้ และการพกพาได้คือจุดสำคัญทั้งหมด แต่ PR ไม่ได้เผยแพร่ throughput เทียบกับ Triton kernels ใน flash-linear-attention หากการถอดรหัสแบบ native ช้าลงอย่างมีนัยสำคัญ ไลบรารีก็จะกลายเป็นเส้นทางสำหรับความเข้ากันได้ ในขณะที่การให้บริการในระดับจริงจังยังอยู่ที่อื่น

เช็คพอยต์ใดบ้างที่มาถึง — การแปลงที่สอดคล้องกับธรรมเนียมปฏิบัติครอบคลุมตั้งแต่ 0.1B ถึง 7.2B ส่วน G1 ขนาด 13.3B ซึ่งเป็นรุ่นที่ผู้คนต้องการจริงๆ ไม่ได้อยู่ในชุดนั้น และตัวอย่างที่บันทึกไว้คือโมเดล Pile ที่ใช้โทเคนไนเซอร์ GPT-NeoX แทนที่จะเป็นโมเดลแชทที่มีคลังคำศัพท์แบบ World ตัวโหลดแบบรวมที่ไม่มีเช็คพอยต์เรือธงหนุนหลังอยู่นั้น เปลี่ยนแปลงน้อยกว่าที่เห็นภายนอก

เป้าหมายที่เคลื่อนที่โปรเจกต์ไม่ได้หยุดนิ่ง คลังเก็บ G1 ของ BlinkDL ได้รับการอัปเดตในสัปดาห์เดียวกับที่ PR นี้เปิดขึ้น การควอนไทซ์ของชุมชนได้ขยับไปใช้ข้อมูลรีวิชันที่ใหม่กว่า G1c แล้ว และ RWKV-8 "Heron" ถูกเปิดตัวต่อสาธารณะพร้อมกลไก suffix-automaton ที่เรียกว่า ROSA Heron ยังไม่เผยแพร่และยังไม่ได้ผ่านการ benchmark เรากล่าวถึงมันเพียงเพราะการผสานรวมไลบรารีที่มาช้าในช่วงท้ายของเจเนอเรชันนั้นมีอายุการใช้งานสั้น

สี่คำถามที่สเปกชีตไม่มีคำตอบ

ตอนนี้ใช้ RWKV-7 ใน Transformers ได้หรือยัง

ทั้งสองอย่าง น่าหงุดหงิด และความแตกต่างคือเรื่องทั้งหมด คุณสามารถโหลด checkpoint ของ RWKV-7 ผ่าน API ของ transformers ได้ในวันนี้ หากคุณติดตั้ง flash-linear-attention และส่ง trust_remote_code เพื่อให้ไฟล์ modeling ของ repository นั้นทำงานเอง สิ่งที่คุณทำไม่ได้คือโหลดจากตัวไลบรารีโดยตรง ซึ่งเป็นสิ่งที่ทำให้มันทำงานเป็นค่าเริ่มต้นในเครื่องมือที่สร้างบนไลบรารี — สคริปต์ฝึกและปรับแต่ง, adapters, ชุดประเมินผล, เส้นทางการส่งออก — และเป็นสิ่งที่ทำให้มันผ่านนโยบายที่ห้ามใช้ remote code สิ่งที่สองนั้นคือสิ่งที่ #47780 มีไว้

การรวมกันทำให้โมเดลดีขึ้นหรือไม่?

ไม่ใช่ด้วยคะแนนเดียวบนเกณฑ์มาตรฐานใดๆ มันเปลี่ยนการกระจาย ไม่ใช่คุณภาพ — และสำหรับสถาปัตยกรรมที่ปัญหาของมันไม่เคยเป็นเรื่องคุณภาพ การกระจายคือข้อจำกัดที่ผูกมัด การเปรียบเทียบคืออันที่อยู่ตอนบนของบทความนี้: โมเดล 169M จากปี 2023 ถูกดาวน์โหลดมากกว่าน้ำหนักของรุ่นปัจจุบันในอัตราส่วนสี่สิบต่อหนึ่ง โดยอาศัยความแข็งแกร่งของการโหลดโดยไม่ใช้แฟล็กทั้งหมด

ถ้าไม่มี KV cache ฉันจะได้บริบทไม่จำกัดฟรีหรือไม่?

คุณได้รับความยาวบริบทไม่จำกัดโดยไม่ทำให้หน่วยความจำพองตัว ซึ่งไม่เหมือนกับการเรียกคืนข้อมูลที่ไม่จำกัด สเตตขนาดคงที่มีความจุข้อมูลคงที่ ป้อนโทเคนหนึ่งล้านตัวเข้าไป มันก็ไม่สามารถเก็บรายละเอียดที่เรียกคืนได้เทียบเท่าหนึ่งล้านโทเคน แอตเทนชันที่มีแคชเต็มทำได้ แต่ด้วยต้นทุนที่เพิ่มขึ้นตลอดทาง จงมองเรื่องราวบริบทยาวของ RWKV-7 ว่า "สตรีมได้ตลอดไปในราคาถูก บีบอัดไปเรื่อยๆ" และทดสอบการเรียกคืนเฉพาะที่คุณต้องการ แทนที่จะเชื่อคำว่า "ไม่จำกัด"

มันคุ้มค่าที่จะสนใจที่ 13.3B หรือไม่ ในเมื่อโมเดลระดับแนวหน้ามีขนาดเป็นหลายแสนล้าน?

ขึ้นอยู่กับว่าหน่วยความจำคงที่มีค่ากับคุณมากแค่ไหน หากคุณเรียกใช้ API ที่โฮสต์ไว้และจ่ายเงินต่อโทเค็น เกือบจะแน่นอนว่าไม่คุ้ม — โมเดลระดับแนวหน้านำหน้าไปไกลในด้านความสามารถ และคุณไม่ได้จ่ายค่า KV cache โดยตรง หากคุณส่ง inference ไปทำงานบนฮาร์ดแวร์ที่คุณไม่ได้ควบคุม หรือรันสตรีมต่อเนื่องที่แคชที่โตขึ้นเรื่อย ๆ เป็นสิ่งที่จะทำให้โปรเซสตายในที่สุด สถาปัตยกรรมที่ขนาดหน่วยความจำไม่เปลี่ยนแปลงคือคำตอบคนละแบบสำหรับคำถามคนละข้อ นี่คือเวิร์กโหลดที่ RWKV-7 ขนาด 2.9B แข่งขันได้อย่างเงียบ ๆ และเป็นจุดที่ native loader จะสำคัญที่สุด

สิ่งที่เราจะดูต่อไป

สัญญาณที่เป็นรูปธรรมสี่ประการ ตามลำดับคร่าวๆ ว่ามันจะเปลี่ยนการประเมินของเราไปมากแค่ไหน บทวิจารณ์ที่ให้การอนุมัติจาก ArthurZucker หรือ Rocketknight1 ซึ่งเปลี่ยนสิ่งนี้จาก diff ที่มีความหวังให้กลายเป็นฟีเจอร์ที่ถูกกำหนดไว้ในตารางงาน การแปลง 13.3B G1 ที่สอดคล้องตามหลักปฏิบัติด้วย World tokenizer ซึ่งเป็นสิ่งที่ทำให้ loader คุ้มค่าที่จะใช้งาน ตัวเลข throughput ที่เผยแพร่สำหรับเส้นทาง decode ที่ไม่พึ่งพาไลบรารีเทียบกับ Triton kernels ซึ่งเป็นตัวชี้ขาดว่าการรองรับแบบเนทีฟเป็นตัวเลือกสำหรับการให้บริการหรือเป็นเพียงตัวเชื่อมเพื่อความเข้ากันได้ และสัญญาณใดๆ ของ RWKV-8 ซึ่งจะบอกว่าการผสานรวมนี้มาถึงที่จุดเริ่มต้นของเจเนอเรชันหนึ่งหรือจุดสิ้นสุดของเจเนอเรชัน

อย่างน้อยก็จนกว่าสิ่งแรกในบรรดาสิ่งเหล่านั้นจะเกิดขึ้น บทสรุปที่ถูกต้องก็คือบทสรุปที่ดูไม่สวยงาม: RWKV-7 (Goose) มีอยู่จริง ได้รับอนุญาตแบบเปิดกว้าง (permissive license) ดาวน์โหลดได้จนถึงขนาด 13.3B แต่ยังคงไม่สามารถโหลดได้โดยตรงในไลบรารีที่ระบบนิเวศส่วนใหญ่สร้างอยู่บนมัน pull request ที่เปิดเมื่อวันที่ 4 สิงหาคม 2026 เสนอให้แก้ไขปัญหานั้น แต่ยังไม่ถูกผสาน และ pull requests ที่จะเพิ่มสถาปัตยกรรมต่าง ๆ เข้าไปใน transformers ก็มักจะถูกปิดได้เช่นกัน

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube