
RWKV-7 (Goose): הצצה אל ה-Pull Request שיטעין אותו סוף סוף ב-Transformers
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
מודל ה-RWKV שהורד הכי הרבה ב-Hugging Face בחודש שעבר לא היה RWKV-7 (Goose), הארכיטקטורה שהפרויקט משחרר מאז מרץ 2025, ולא היה RWKV7-G1, סדרת ההיגיון שאומנה על גביו. זה היה RWKV/rwkv-4-169m-pile: checkpoint של RWKV-4 עם 169 מיליון פרמטרים ממאי 2023, עם 8,824 הורדות ב-30 הימים עד 5 באוגוסט 2026, לעומת 215 למהדורת 1.5B של RWKV-7 Goose World-3 ו-316 ל-2.9B. מודל 2023 אינו טוב יותר. הוא זה שנטען עם קריאה פשוטה של from_pretrained ובלי שום דבר אחר מותקן.
ב-4 באוגוסט 2026, תורם בשם Hakureirm פתח בקשת משיכה #47780 נגד huggingface/transformers, שכותרתה "Add RWKV-7 (Goose)". נכון ל-5 באוגוסט היא פתוחה, ללא ביקורת וללא מיזוג, וזהו הניסיון השני — הצעה קודמת, #46984, נדחתה. שום דבר לא מוזג, ואין לקרוא את הקטע הזה כהכרזת שחרור. אבל ה-diff ציבורי, והוא נוגע לדבר המשעמם ביותר והמהותי ביותר שעומד בין השושלת הוותיקה ביותר של LLM ללא מנגנון קשב לבין הערימות שרוב הצוותים בפועל משתמשים בהן: טוען (loader).
מה שבא אחר כך מפריד בין שלושה סוגי טענות, כי {{1}}הסיקור של RWKV בדרך כלל מערב אותם יחד{{/1}}. יש את מה שאפשר לאמת בפועל בתוך בקשת המשיכה וב-Hub, {{2}}שאתה יכול לבדוק בעצמך{{/2}}. יש את מה שפרויקט RWKV מדווח על המודלים שלו, {{3}}בהערכות שלו עצמו{{/3}}. ויש את מערך השאלות הגדול שאיש לא ענה עליו בפומבי, {{4}}שם נמצא עיקר הסיכון המעניין{{/4}}.
מה בעצם יש בבקשת המשיכה?

העובדות המכניות, כפי שנקראו מדף ה-PR ומממשק ה-API של GitHub ב-5 באוגוסט 2026:
• היקף — שלושה commits, 12 קבצים שונו, 4,423 שורות נוספו ואפס נמחקו, מהענף add-rwkv7-upstream אל huggingface:main. מתויג כ"דגם חדש". אין ממונה, אין אבן דרך.
• מה זה מוסיף — RWKV-7 כשתי מחלקות ציבוריות, Rwkv7Model ו-Rwkv7ForCausalLM, לצד Rwkv7Cache הבנויה על LinearAttentionLayer של הספרייה. סוג הנתונים (dtype) של מצב ה-WKV ניתן להגדרה בנפרד מסוג הנתונים של המודל, וזה חשוב משום שהמצב הרקורסיבי הוא המקום שבו מצטברת סחיפה נומרית במשפחה זו.
• איך זה רץ — PyTorch נייד ללא תלות בריצה של צד שלישי. שלב ה-prefill משתמש בצורה מקבילה ברמת נתחים של הרקורסיה; שלב ה-decode רץ במסלול רציף של אסימון בודד. שמות הפרמטרים עוקבים אחרי מימוש הייחוס של RWKV במעלה הזרם, במקום לשנותם כך שייראו כמו טרנספורמר.
• גישת בדיקה — מעבר למיקסינים הסטנדרטיים של המודל, בדיקת אינטגרציה שתואמת ל-runtime של BlinkDL טוקן אחר טוקן, בתוספת מימוש ייחוס ב-NumPy שאינו חולק קוד עם קובץ המודל. בוט סיכום ה-CI של המאגר מדווח שהריצה האחרונה הצליחה: 16 משימות, 179,151 בדיקות, אפס כשלים, 16 שעות ו-9 דקות של חישוב.
• מצב נוכחי — בוקשה סקירה מ-ArthurZucker ו-Rocketknight1; הדף מציין שנדרשת לפחות סקירה מאשרת אחת כדי למזג, ואף אחת לא ניתנה. ה-API של GitHub עדיין תיאר את מצב המיזוג כ"לא יציב" כשקראנו אותו, ובוט המיועד למתחזקים ביקש להריץ את ערכות הבדיקות האיטיות (auto ו-rwkv7) לפני המיזוג. במילים אחרות: ירוק ב-CI המהיר, אך עדיין לא אושר בידי אדם.
החלק המעניין ביותר בתיאור הוא ההודאה. הניסיון הקודם, #46984, נדחה משום שהצ'ק-פוינטים שפורסמו של RWKV-7 לא עקבו אחר המוסכמות של Transformers, והמסגור של המחבר עצמו הוא ש"ההתנגדות הזו הייתה נכונה". הבעיה, כפי שמפורט ב-PR, היא שהמשקלים של RWKV-7 ב-Hub מגיעים בשתי צורות שאינן שמישות על ידי הספרייה:
• מאגרי ה-PTH — קבצי .pth גולמיים, ללא safetensors. מימוש ספרייה אינו יכול לטעון אותם, וקבצי pickle של PyTorch הם בדיוק מה שסקירת אבטחה בחברה גדולה תסרב לקבל.
• מאגרי ה־HF — אלה אכן כוללים model.safetensors, אבל כל אחד מהם כולל גם modeling_rwkv7.py ו־auto_map, כך שטעינה של אחד דורשת trust_remote_code. זהו ביצוע קוד מרחוק כתנאי להסקה, וזו הסיבה שכל כך הרבה רשימות בדיקה ארגוניות עוצרות שם.
אז ה-PR עושה שתי עבודות בבת אחת: הוא מוסיף קובץ מידול, ומפנה לקבוצה חדשה של המרות שנעשו ישירות מהגרסאות הקנוניות של BlinkDL בפורמט .pth, שעוקבות אחרי המבנה התקני — רק safetensors, בלי pickle, בלי קוד מרוחק, config.json רגיל הנושא architectures ו-model_type — וטווח הגדלים הוא מ-0.1B עד 7.2B. במודל הקטן ביותר, Hakureirm/rwkv7-168m-pile-hf, כל 399 הטנסורים אומתו כזהים ביט-לביט מול קובץ ה-.pth המקורי, ולא בבדיקה מדגמית. נקודת השמירה הזו היא מודל Pile, ולכן הטוקנייזר שלו הוא הטוקנייזר המהיר הרגיל של GPT-NeoX-20B, ולא אוצר המילים של RWKV World — מאותה סיבה שגם העמוד הקיים של RWKV בספרייה מתעד נקודת שמירה של Pile.
למה נקודת ביקורת מ-2023 עוקפת בהורדות את הארכיטקטורה הנוכחית

Transformers נמצא בגרסה 5.14.1, שפורסמה ב-16 ביולי 2026. חפש בתיעוד שלה את RWKV ותקבל בדיוק עמוד מודל אחד, המתאר את "מודל RWKV (גרסה 4)", שתרם לפני שנים, עם RWKV/rwkv-4-169m-pile כדוגמה ואוצר מילים ברירת מחדל של 50,277 אסימונים. אין עמודים עבור RWKV-5, RWKV-6 או RWKV-7. שלושה דורות ארכיטקטורה שוחררו מאז שנכתבה תמיכת הספרייה ב-RWKV, ואף אחד מהם לא נמצא בה.
מספרי ההורדות מראים מה עשה האקוסיסטם בנידון: הוא עקף את הספרייה. כשממיינים לפי הורדות ב-30 הימים האחרונים, המאגרים המובילים של RWKV-7 הם שחרורי ה-.pth הגולמיים של BlinkDL (rwkv7-g1 עם 8,288, rwkv-7-world עם 4,489) ושכבה עבה של קוונטיזציות GGUF קהילתיות של ה-G1 בגודל 13.3B — כמה מעלים נפרדים, שכל אחד מהם מזיז בין אלף לשלושת אלפים הורדות בחודש. המראות הרשמיות בפורמט transformers יושבות בשני סדרי גודל מתחת למשקלים הגולמיים. המראה של flash-linear-attention של ה-G1 בגודל 2.9B עומדת על 1,843.
לדפוס הזה יש הסבר פשוט. llama.cpp מיזגה תמיכה ב-RWKV v7 ב-17 במרץ 2025 — קרנל GGML_OP_RWKV_WKV7 עם בק־אנדים של CPU, CUDA, SYCL, Vulkan ו־Metal — בערך יום אחרי שהמאמר פורסם. אם רצית להריץ RWKV-7 על המחשב שלך, הנתיב המהיר היה GGUF, וכך זה כבר שישה עשר חודשים. הנתיב שלא היה קיים הוא זה שכל סקריפט כיוונון עדין, כל מתאם PEFT, כל מערכת הערכה וכל מעטפת שרת פנימית מניחים: AutoModelForCausalLM.from_pretrained, בלי דגלים.
מה זה בעצם RWKV-7 (Goose)
RWKV-7 הוא רשת עצבית רקורסיבית, {{1}}לא טרנספורמר עם קרנל אטנשן זול יותר{{/1}}, והשם מבלבל אנשים כל הזמן. הוא נושא מצב בגודל קבוע קדימה לאורך הרצף {{2}}במקום מטמון גדל של מפתחות וערכים מהעבר{{/2}}. באופן קונקרטי, לעומת מודל אטנשן סטנדרטי:
• הזיכרון ככל שההקשר גדל — מטמון ה-KV של טרנספורמר גדל באופן ליניארי עם מספר הטוקנים שבתהליך; RWKV-7 שומר על מצב שגודלו נקבע על ידי הארכיטקטורה, לא על ידי השיחה. זהו כל טיעון היעילות.
• עלות לכל טוקן — מנגנון הקשב עולה יותר לכל טוקן ככל שההקשר מתארך; עלות ההסקה של RWKV-7 לכל טוקן קבועה, ולכן הוא ממשיך להופיע בהצעות למחשוב קצה וסטרימינג תמידי.
• צורת האימון — בניגוד ל-RNN קלאסי, ניתן להקביל את הרקורסיה על פני נתח, כך שהאימון המקדים אינו מתדרדר לזחילה סדרתית. זה מה שנתיב ה-prefill המקביל-לנתחים של ה-PR מיישם.
• תקרת הקשר — אין מטמון לפוצץ, כך שהפרויקט משווק הקשר בלתי-מוגבל למעשה. מה שמצב קבוע לא יכול לעשות הוא להחזיק פירוט בלתי-מוגבל, שהיא מגבלה אמיתית ולא הערת שוליים.
הטענה הארכיטקטונית במאמר, שפורסם ב-18 במרץ 2025 על ידי בו פנג, יו ג'אנג, סונגלין יאנג ורואיצ'ונג ג'אנג במסגרת פרויקט RWKV ב-LF AI & Data Foundation, היא כלל דלתא מוכלל עם גייטינג וקטורי, קצבי למידה בתוך ההקשר וכלל מרוכך להחלפת ערכים, בתוספת MLP מפושט (מטריצת הגייטינג הוסרה והממד החבוי הורחב כדי לפצות). התוצאה התאורטית הנלווית היא החצי הפרובוקטיבי יותר: RWKV-7 מסוגל לבצע מעקב מצבים ולזהות את כל השפות הרגולריות, תוך שהוא נשאר ניתן למקבול באימון — מה שלטענת המחברים עולה על מה שטרנספורמרים יכולים לעשות תחת השערות סיבוכיות סטנדרטיות.
הכול תחת רישיון Apache 2.0. {{1}}במשפחה שתוכלו להוריד יש דגמים בגודל 0.1B (12 שכבות, רוחב 768), 0.4B (24 / 1024), 1.5B (24 / 2048), 2.9B (32 / 2560), 7.2B (32 / 4096) ו-13.3B (61 שכבות, רוחב 4096), וכולם עם אוצר מילים World של 65,536 טוקנים וגודל ראש 64.{{/1}} {{2}}סדרת World הבסיסית אומנה על קורפוס רב-לשוני של 3.1 טריליון טוקנים; סדרת G1 "GooseOne" ממשיכה את האימון הזה על World v3.5, תערובת מורחבת של 5.16 טריליון טוקנים עם יותר רומנים, טקסטים מהאינטרנט, מתמטיקה, קוד ונתוני חשיבה.{{/2}} {{3}}נקודות הביקורת (checkpoints) של G1 מוסיפות מצב חשיבה עם תגית think, קריאות פונקציות ב-JSON, והשלמת אמצע (fill-in-the-middle) החל מ-G1c. השמות אכן מבלבלים: G0 פירושו פחות מאפוקה אחת, G1 פירושו יותר מאחת, ואותיות הסיומת מסמנות גרסאות נתונים, כשהאותיות המאוחרות יותר נושאות נתונים טובים יותר.{{/3}}
המספרים, ושל מי הם המספרים
הנה המצב הכנה של הראיות. טענת אמת המידה המרכזית — שהמודל בעל 2.9B פרמטרים קבע שיא חדש בקטגוריית 3B במשימות רב־לשוניות והשתווה לשיא הקטגוריה האנגלית של 3B תוך שימוש במספר קטן בהרבה של טוקני אימון — היא טענה של המאמר עצמו, שפורסם במרץ 2025 והוערך מול מודלי ה־3B של אותה תקופה. זה עבר ביקורת OpenReview, שהיא יותר בדיקה מאשר פוסט בבלוג של ספק, ובכל זאת זו עדיין תוצאה שדווחה עצמית על סט השוואה בן חמישה־עשר חודשים.
המדידה הציבורית הנוספת של הפרויקט, UncheatableEval, מעניינת יותר משורה בטבלת דירוג וזוכה כמעט ללא סיקור. במקום לדרג מבחני רב-ברירה שדולפים למערכי האימון, היא מודדת את יחס הדחיסה על נתונים שלא היו קיימים בעת אימון המודל: מאמרי arXiv חדשים, מאגרי GitHub טריים, חדשות אחרונות. העיצוב הזה מקשה הרבה יותר על זיהום נתונים, ו-RWKV מדווח על תחרותיות עם טרנספורמרים באותו גודל במדד זה. זו עדיין הערכה שהפרויקט מבצע על עצמו.
מה שלא קיים, ככל שמצאנו, הוא ציון במדד עצמאי של צד שלישי עבור כל checkpoint של {{KEEP}}RWKV-7{{/KEEP}} — {{1}}שום אגרגטור ניטרלי לא העביר את 7.2B או 13.3B דרך ה-harness שהוא מריץ על מודלים מתקדמים{{/1}}. אז השוואות שאולי תראה מול מודלים כמו {{KEEP}}DeepSeek V4 Flash{{/KEEP}} או {{KEEP}}Qwen3.8-Max{{/KEEP}} הן שגיאות קטגוריות כפולות: {{2}}אף אחד לא הריץ את {{KEEP}}RWKV-7{{/KEEP}} על אותה הערכה{{/2}}, ו-{{3}}RNN צפוף בגודל 13.3B אינו מתחרה על אותה עבודה כמו מערכת מתקדמת{{/3}}. הטענה הניתנת להגנה היא צרה ושימושית יותר: {{4}}בין 1.5B ל-13.3B, בזיכרון קבוע, בערך שתים-עשרה שפות, עם משקלים מתירניים{{/4}}.
להריץ את RWKV-7 היום, ומה זה עולה לך

דף ה-Hub עבור RWKV/RWKV7-Goose-World3-1.5B-HF הוא תמונת מצב טובה של החיכוך הנוכחי. מדובר במודל בעל 1.52 מיליארד פרמטרים מסוג BF16 עם טוקנייזר RWKV World, רישיון Apache 2.0, מתויג כ-custom_code, ומפרט את השפות אנגלית, סינית, יפנית, קוריאנית, צרפתית, ערבית, ספרדית ופורטוגזית. ההוראות שלו אומרות להתקין את flash-linear-attention וגרסה עדכנית של transformers לפני הטעינה. ובסרגל הצד, במקום שבו מודל מתארח היה מציג ספקים, כתוב במפורש: מודל זה אינו פרוס על ידי אף ספק שירות.
אז כל האפשרויות שלך היום הן בשירות עצמי:
• flash-linear-attention פלוס trust_remote_code — הקרוב ביותר לשימוש הרגיל ב־Hub, אבל אתה מריץ קוד מהמאגר ומושך פנימה ליבות Triton, מה שמגביל אותך בחומרה ובכל דבר שעובר סקירת אבטחה.
• GGUF באמצעות llama.cpp — המסלול הנתמך ביותר בפועל, כולל עבור ה-13.3B, וזה שמספרי ההורדות מראים שאנשים באמת בוחרים בו. מצוין להסקה מקומית, לא דרך לאימון או כיוונון עדין.
• זמן הריצה של הפרויקט עצמו — חבילת rwkv pip ומאגר הייחוס, הקרובים ביותר למקור הקנוני, והרחוקים ביותר מהכלים שכבר יש לצוות שלכם.
אף אחד מאלה אינו API שאפשר לקרוא אליו, וכדאי להיות ישירים לגבי ההשלכה: RWKV-7 אינו זמין ב-OrcaRouter, משום שאינו נקודת קצה מתארחת בשום מקום שנוכל למצוא. אם רוצים RWKV-7, מריצים RWKV-7. מה שאנחנו יכולים לומר בכנות הוא איפה זה משאיר את שאר הסטאק. הערכת ארכיטקטורה לא מוכחת היא זולה רק אם מסלול הייצור שלכם אינו תלוי בתוצאה, והדרך הזולה ביותר לשמר את המצב הזה היא שלא תהיה אינטגרציה נפרדת לכל ספק עבור שום דבר אחר — מפתח אחד תואם-OpenAI ליותר מ-200 מודלים, מחיר המחירון של הספק המועבר ישירות ב-0% תוספת, ומעבר אוטומטי (failover) כשספק מתדרדר בביצועים. אז ניסוי RWKV-7 באירוח עצמי על שני עומסי העבודה שבהם זיכרון קבוע משתלם בפועל — סטרימינג ארוך-טווח, עוזר על-המכשיר, מנוע סיכום שלא מפסיק לעולם — הוא ניסוי, לא מיגרציה. זו הצורה שרוב הצוותים צריכים לרצות כאן: ברירת מחדל מנותבת, ומודל מבוסס-מצב שמרוויח את מקומו במשימה ספציפית.
מה עוד יכול לעצור את הנחיתה הזו?
קחו את התקדים ברצינות: הצעה להוסיף את הארכיטקטורה המדויקת הזו כבר נדחתה פעם אחת, מנימוקים שהמחבר מסכים שהיו תקפים. החדשה מנומקת טוב יותר ונבדקה טוב יותר, והיא עדיין בקשת משיכה (PR) קהילתית נגד מאגר קוד שמרני במתכוון לגבי קבלת ארכיטקטורות שהוא יצטרך לתחזק לנצח.
השאלות הפתוחות הספציפיות שנרצה לקבל עליהן תשובה לפני שנחשיב זאת כמושלם:
• ביקורת, לא CI — מערכי הבדיקות האוטומטיים ירוקים; שני מתחזקים התבקשו ואף אחד מהם לא אישר. Transformers דורש ביקורת מאשרת אחת, והבדיקות האיטיות לא בוצעו.
• המהירות של הנתיב נטול התלויות — PyTorch טהור עם פענוח רציף של טוקן יחיד הוא נייד, והניידות היא כל העניין, אך ה-PR אינו מפרסם תפוקה מול קרנלי Triton ב-flash-linear-attention. אם הפענוח הטבעי איטי באופן מהותי, הספרייה הופכת לנתיב התאימות בעוד שהשירות הרציני נשאר במקום אחר.
• אילו checkpoints מגיעים — ההמרות שעומדות בקונבנציה מכסות טווח של 0.1B עד 7.2B. ה-13.3B G1, שהוא הדגם שאנשים באמת רוצים, אינו בקבוצה הזו, והדוגמה המתועדת היא מודל Pile עם טוקנייזר GPT-NeoX, במקום מודל צ'אט בעל אוצר מילים עולמי. loader מאוחד ללא checkpoint דגל מאחוריו משנה פחות ממה שנדמה.
• המטרה הנעה — הפרויקט אינו עומד מלכת. מאגר G1 של BlinkDL עודכן באותו שבוע שבו נפתח ה-PR הזה, הקוונטיזציות הקהילתיות התקדמו לגרסאות נתונים מאוחרות יותר מ-G1c, ו-RWKV-8 "Heron" הוצג בפומבי עם מנגנון אוטומטון-סיומות בשם ROSA. Heron טרם שוחרר וטרם נמדד; אנו מזכירים אותו רק משום שלאינטגרציית ספרייה שמגיעה באיחור לחייו של דור יש חיי מדף קצרים.
ארבע שאלות שגיליון המפרט לא עונה עליהן
האם אני יכול להשתמש ב-RWKV-7 ב-Transformers עכשיו, או לא?
שניהם, למרבה הצער, וההבחנה ביניהם היא כל הסיפור. אתה יכול לטעון checkpoint של RWKV-7 דרך ה-API של transformers היום, אם תתקין את flash-linear-attention ותעביר trust_remote_code כך שקובץ המודל של המאגר עצמו ירוץ. מה שאינך יכול לעשות הוא לטעון אותו מהספרייה עצמה, וזה מה שגורם לו לעבוד כברירת מחדל בכלים הבנויים על גבי הספרייה — סקריפטים של אימון ויישור, מתאמים, רתמות הערכה, נתיבי ייצוא — ומה שגורם לו לעמוד במדיניות שאוסרת קוד מרוחק. הדבר השני הזה הוא מה ש-#47780 נועד עבורו.
האם מיזוג הופך את המודל לטוב יותר?
לא בנקודה אחת באף מדד. זה משנה את ההפצה, לא את האיכות — ובשביל ארכיטקטורה שהבעיה שלה מעולם לא הייתה איכות, ההפצה היא האילוץ המחייב. ההשוואה היא זו שבראש הכתבה הזאת: מודל של 169M מ-2023 שמורידים אותו פי ארבעים יותר מהמשקולות של הדור הנוכחי, אך ורק בזכות טעינה ללא דגלים.
אם אין מטמון KV, האם אני מקבל הקשר בלתי מוגבל בחינם?
אתה מקבל אורך הקשר בלתי מוגבל ללא התפוצצות הזיכרון, וזה לא אותו דבר כמו שליפה בלתי מוגבלת. למצב בגודל קבוע יש קיבולת מידע קבועה; הזינו לו מיליון טוקנים והוא לא יכול להחזיק פרטים ניתנים לשליפה בשווי מיליון טוקנים. קשב עם מטמון מלא יכול, במחיר שגדל לאורך כל הדרך. התייחסו לסיפור ההקשר הארוך של RWKV-7 כאל "זורם לנצח בעלות נמוכה, דוחס תוך כדי," ובדקו את השליפה הספציפית שאתם צריכים במקום לסמוך על המילה אינסופי.
האם זה שווה תשומת לב ב-13.3B כשמודלים פורצי דרך הם מאות מיליארדים?
זה תלוי לחלוטין בשאלה אם זיכרון קבוע הוא בעל ערך עבורך. אם אתה קורא ל-API מתארח ומשלם לפי טוקן, כמעט בוודאות שלא — המודלים המתקדמים נמצאים הרחק קדימה מבחינת יכולות, ואתה לא משלם ישירות על מטמון ה-KV. אם אתה פורס הסקה על חומרה שאינך שולט בה, או מריץ זרם מתמשך שבו מטמון שגדל הוא מה שבסופו של דבר הורג את התהליך, ארכיטקטורה שטביעת הזיכרון שלה אינה משתנה היא סוג אחר של תשובה לשאלה אחרת. אלה עומסי העבודה שבהם RWKV-7 בגודל 2.9B היה תחרותי בשקט, והם אלה שבהם מטעין מקורי היה משמעותי ביותר.
מה שהיינו צופים בו הלאה
ארבעה אותות קונקרטיים, בסדר גס של כמה הם ישנו את הקריאה שלנו. ביקורת מאשרת מאת ArthurZucker או Rocketknight1, שהופכת את זה מדיף מבטיח לתכונה מתוזמנת. המרה תואמת-מוסכמה של ה-13.3B G1 עם הטוקנייזר World, שזה מה שהופך את הטוען לכדאי. מספרי תפוקה שפורסמו עבור נתיב הפענוח נטול-התלות מול גרעיני ה-Triton, מה שקובע אם תמיכה מקומית היא אפשרות שרת או שכבת תאימות. וכל סימן ל-RWKV-8, שיגיד לך אם האינטגרציה הזו מגיעה בתחילת דור או בסופו.
עד לפחות הראשונה מבין אלה, הסיכום הנכון הוא זה הלא־זוהר: RWKV-7 (Goose) אמיתי, ברישיון מתיר, ניתן להורדה עד 13.3B, ועדיין לא ניתן לטעינה טבעית בספרייה שרוב המערכת האקולוגית בנויה עליה. בקשת pull request שנפתחה ב־4 באוגוסט 2026 מציעה לתקן זאת. היא לא מוזגה, ובקשות pull request להוספת ארכיטקטורות ל־transformers אכן נסגרות.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
