כרטיס כותרת עבור 'dots-note-3.0: מודל ה-IMO 42/42 בדיוק דלף על ידי PR של vLLM': כותרת ראשית גדולה 'dots-note-3.0', כותרת משנה 'מה שידוע עד כה', ושני כרטיסי אייקון שטוחים — 'IMO 2026 · 42/42' עם אייקון גביע בקו ותגית 'דירוג רשמי', ו-'vLLM PR #51255' עם אייקון קובץ קוד בקו ותגית 'ארכיטקטורה דלפה'. לוגו OrcaRouter ממוקם בפינה הימנית התחתונה.
Guides & Insights

dots-note-3.0: מודל ה-IMO 42/42 שהודלף על ידי PR של vLLM זמין כעת בקוד פתוח

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-14 באוגוסט 2026, dots-note-3.0 הפסיק להיות הדלפה. מעבדת Dots Model Lab של Xiaohongshu שחררה לקוד פתוח את המודל הציבורי הראשון במשפחת dots3, בשם dots3-note preview — 280 מיליארד פרמטרים (16 מיליארד פעילים), חלון הקשר של 512K, ברישיון Apache-2.0 — שמונה ימים אחרי שבקשת pull request ב-vLLM הדליפה את הארכיטקטורה של המודל טרם ההשקה. המשקלים נמצאים ב-Hugging Face, הקוד ב-GitHub, והצ'קפוינט שזכה רשמית לציון 42/42 באולימפיאדת המתמטיקה הבינלאומית 2026, ניתן לראשונה להרצה על ידי כל אחד.

השחרור הזה עונה על כל שאלה פתוחה שהפוסט על ההדלפה מ-6 באוגוסט בבלוג הזה השאיר תלויה באוויר — גודל, אורך הקשר, רישיון, נתיב ל-Hugging Face, תאריך שחרור — והוא הופך סיפור של "מה אנחנו יודעים עד כה" לסיפור שאפשר לבדוק. להלן העדכון: מה שוחרר, מה התצורה ששוחררה מאשרת על הארכיטקטורה שה-PR חשף לראשונה, מה עכשיו ניתן לאימות עצמאי, ומה עדיין טענה של הספק עצמו.

מטיוטת PR לצ'קפוינט ציבורי

ההדלפה, בקיצור: ב-6 באוגוסט 2026, תורם המוכר בשם KurodaKanbei — דוקטורנט ב-ETH ציריך כהגדרתו העצמית, לא עובד של Xiaohongshu — פתח את ה-pull request #51255 בפרויקט vllm-project/vllm, שהוסיף תמיכה במודל שפה בשם "Dots3 NOTE". דגל הטיוטה הוסר ב-7 באוגוסט בשעה 13:55 UTC, והערות האימות של ה-PR עצמו היו הסימן המגלה: המחבר הריץ שירות DP8/EP8 על 8 GPUs "עם צ'קפוינט FP8 של Dots3 NOTE." אי אפשר לאמת צ'קפוינט FP8 שאין ברשותך — מי שכתב את ה-PR הזה החזיק במודל בפועל. השינוי נגע ב-14 קבצים, כולל מודול חדש בשם vllm/models/dots3_note, ונשא את התוויות new-model ו-verified.

כל אחד מ{{1}}ארבעת הסימנים שרשמנו ב-8 באוגוסט{{/1}} כבר התממש, מלבד זה החשוב מכולם. {{2}}מאגר ה-Hugging Face הופיע — dots-studio/dots3-note-prev, ברישיון Apache-2.0.{{/2}} {{3}}ההכרזה הרשמית נחתה — שחרור הקוד הפתוח עצמו, היום.{{/3}} {{4}}מחסנית ההסקה הפסיקה להיות טיוטה: תמיכת vLLM מובנית ב-main, וגם transformers וגם SGLang כוללות תמיכה ב-dots3-note.{{/4}} {{5}}הסימן הרביעי, אימות בלתי-תלוי של תוצאת 42/42 במתמטיקה, הוא זה שטרם הושלם — וכעת הוא אפשרי בדרך שלא הייתה אפשרית מעולם, משום שהמשקלים פומביים.{{/5}}

Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).

מה שנשלח בפועל

כרטיס המודל שפורסם הופך את המסקנות של ה-PR למפרט טכני — והמספרים מגיעים מהקונפיגורציה של הצ'קפוינט עצמו, לא מסיכום של צד שלישי. dots3-note preview הוא מודל תערובת מומחים:

• 280B סה"כ / 16B פרמטרים פעילים — 256 מומחים מנותבים בתוספת מומחה משותף אחד, ניתוב top-8, על 1 שכבה דחוסה + 45 שכבות MoE עם גודל חבוי של 5,120.

• חלון הקשר של 512K אסימונים, אוצר מילים של 152K, דיוק BF16 ו-FP8.

• מודול חיזוי רב-טוקנים (MTP) — שכבה משותפת אחת של 1.13B פרמטרים שחוזה עד שלושה טוקנים נוספים במקביל, וזה מה שמפעיל פענוח ספקולטיבי ללא מודל טיוטה נפרד.

• קלט מולטימודלי — טקסט, תמונה, וידאו ואודיו — המפיק פלט טקסטואלי. מקודד הראייה הוא MoE ViT (7B סך הכול / 1.2B פעילים) ומקודד האודיו הוא 800M צפוף.

בהערת ההיקף של ה-PR נאמר שעבודת ה-vLLM כיסתה "רק את ה-LLM," כשהרכיבים המולטימודליים מחוץ להיקף. זה התייחס לתיקון ההסקה, לא למודל: נקודת ה-checkpoint ששוחררה כוללת את מקודדי הראייה והשמע לצד ליבת השפה. אם אתה רוצה את הגרסה המולטימודלית, אתה מסתכל על אותו מאגר (repo), המוגש דרך המסלולים של transformers ו-SGLang, במקום המסלול של vLLM שנועד ל-LLM בלבד ושדלף ראשון.

זמינות, באופן קונקרטי: המשקולות נמצאות ב-dots-studio/dots3-note-prev ב-Hugging Face תחת רישיון Apache-2.0; הקוד ומתכוני ההגשה נמצאים במאגר studio-dots-ai/dots3-note-prev ב-GitHub; וגישה מתארחת מתאפשרת דרך פורטל ה-API של הספק עצמו, וכן דרך כמה פלטפורמות צד-שלישי. זהו שחרור המשקולות הפתוח הראשון של משפחת dots3 — הביטוי "פתיחת קוד בקרוב" (近期将开源) שבו השתמשה Xiaohongshu במשך שבועיים, לפי הצהרותיה בסינית, התגשם.

הארכיטקטורה שההדלפה קלעה בה

ה-PR תיאר את dots-note-3.0 כ"קשור מבחינה מבנית ל-DeepSeek-V3.2", אבל עם תערובת של שתי גאומטריות קשב בערימה אחת. הקונפיגורציה שפורסמה מאשרת זאת. כרטיס המודל מפרק את 46 שכבות הקשב ל-13 שכבות קשב דליל בסגנון DeepSeek (DSA) — עם אינדוקס top-2048 — ו-33 שכבות קשב עם חלון נע (SWA), בערך שכבה דלילה אחת על כל שלוש שכבות צפופות. זהו המבנה של "קפיצה בין גלובלי דליל ולוקלי צפוף" ששם הענף note-hopper רמז עליו, ועכשיו הוא כתוב בצ'קפוינט עצמו.

מבחינה מכנית, זהו אותו רעיון שדיפ-סיק הציגה עם V3.2: חצי ה-DSA הוא אינדקסר קל משקל שמדרג כל מפתח שמור מול השאילתה, שומר רשימה קצרה של top-k, ומחשב אטנציה על פניה במקום על פני ההקשר המלא — חותך את העלות הריבועית של רצפים ארוכים לכמעט ליניארית. החצי של החלון הנע הוא המשקל הנגדי: טווח מוגבל של אטנציה מקומית צפופה שמבטיח שהטוקנים העדכניים ביותר יזכו תמיד לאטנציה מלאה, בלי קשר למה שמחליט האינדקסר הדליל. גלובלי דליל פלוס מקומי צפוף, באותו מודל, היה החלק החריג באמת של ההדלפה — וזה עכשיו החלק המאושר.

שאר התוכנית היא מנגנון מוכר ממשפחת DeepSeek, כפי שנאמר ב-PR: נתב MoE לא מקובץ, MoE מקבילי ברצף, מילוי מקדמי במקטעים להקשר ארוך שאומת עד לחלון המלא של 512K, ושכבת MTP שברירת המחדל שלה היא קשב מסוג חלון נע לפענוח ספקולטיבי.

שיא 42/42 — ומה שכעת ניתן לבדיקה

תוצאת ה-IMO עצמה לא משתנה, וגם לא התיוג. ב-25 ביולי 2026, שיאוהונגשו (Xiaohongshu) הודיעה שהמודל קיבל ציון מושלם של 42/42 בניקוד הרשמי של האולימפיאדה המתמטית הבינלאומית ה-67 בשנחאי, שם רק 7 מתוך 666 מתחרים אנושיים השיגו תוצאה זהה, וחתך הזהב היה 29 — 13 נקודות מעל הזהב ו-7 נקודות מעל הציון 35/42 של Gemini Deep Think, שהיה התוצאה הטובה ביותר לבינה מלאכותית בניקוד רשמי של IMO. זהו עדיין התיאור של החברה לתחרות בניקוד רשמי: הציון אמיתי ומאומת על ידי הוועדה, אך הטענות הנלוות — כיצד ניגשו לבעיות, כיצד נשלטו הדגימה והניקוד — מעולם לא נבדקו באופן בלתי תלוי, משום שאיש מחוץ למעבדה לא יכול היה להריץ את המודל.

זה החלק שהגרסה משנה. עם פרסום המשקלים, 42/42 כבר אינו מספר שיש לקבל באמונה או על סמך דברי pull request; מדובר בתוצאה שצד שלישי יכול לנסות לשחזר, וזה הדבר בעל הערך הגבוה ביותר שניתן לבדוק בגרסה הזאת. העניין נותר שנוי במחלוקת בשוליים באותן דרכים כמו לפני שבועיים: כלי תקשורת סיניים דיווחו שגם Celia של Huawei קיבלה 42/42 באותו מדד, כך ש-dots-note-3.0 הוא אחד הראשונים ולא הראשון; וטענת X של שותף ב-Menlo Ventures ש-OpenAI, Anthropic, Axiom Math ו-Kimi K3 של Moonshot גם הן הגיעו ל-42/42 השנה היא עדיין פוסט חברתי לא מאומת ללא תיעוד מדידה מאחוריו.

החברה פרסמה גם טענות בנצ'מרק חדשות לצד ההשקה, כולן מדווחות על ידי הספק ועדיין לא שוכפלו. במבחן ARC-AGI 3, Dots טוענת שהתצוגה המקדימה של dots3-note משיגה ציון של כ-0.35 בעלות זמן בדיקה מדווחת של מתחת ל-$500. בסוויטות החשיבה והסוכנים הכוללות את WebShop, HotpotQA ו-ALFWorld, היא טוענת שהמודל משתווה או עולה על מודלים הגדולים פי כמה במספר הפרמטרים הפעילים שלהם, עם יכולות ראייה שבולטות ביחס לגודלו. אלה המספרים של Dots על המודל של עצמה — התייחסו אליהם בהתאם עד שמעבדה ניטרלית תריץ אותם מחדש.

{{1}}דוטס גם שחררה את שני רתמות ההערכה שבנתה עבור סוג משימה זה, וקוד פתוח שלהן מועיל כמעט כמו המודל עצמו.{{/1}} {{2}}VibeLifeBench מריצה 200 משימות על פני 22 שירותים מדומים ו-288 ממשקי כלים, ובודקת 1,247 תנאים אטומיים של האם סוכן נשאר עקבי כשהסביבה משתנה באמצע המשימה; לפי תוצאותיה של דוטס, המודל החזק ביותר שנבדק עד כה משיג רק 32.5 ב-avg@3, ורוב המודלים הסגורים המובילים נכשלים כליל.{{/2}} {{3}}VibeSearchBench צר יותר — 20 תחומים, 200 משימות, ובוחן האם סוכן מבקש הבהרה כשבקשה אינה חד-משמעית.{{/3}} {{4}}שתיהן נושאות את אותו תווית מדווחת-ספק כמו נתון ARC-AGI, אך הרתמות ציבוריות, מה שהופך את ה-32.5 לנתון שניתן להפרכה ולא לרטורי.{{/4}}

למה זה מודל סוכן, לא מודל מתמטי

לא הדליפה ולא ציון ה-IMO אמורים להטעות אתכם בנוגע למטרת המודל הזה. מיצוב ההשקה אינו מתמטיקה — הוא משימות ארוכות-טווח ופתוחות: תכנון נסיעות מותאם אישית, תהליכי עבודה להכנת חתונה, הפעלת חנות קטנה, שיפוץ בית. משימות שאין להן תשובה נכונה אחת, מטרות שמשתנות תוך כדי משימה, וטווחי זמן של שעות או ימים. זו ערכת מדדים שונה במכוון מלוחות ההובלה של מתמטיקה וקוד, ושם הבחירות העיצוביות של dots3-note — הקונטקסט של 512K, קובץ הזיכרון, לולאת הביקורת העצמית — משתלמות בפועל.

שלוש טכניקות בולטות בחומר שפורסם. ראשית, המודל מתחזק קובץ זיכרון (memory.md) כסיכום סביבה שוטף, וזו הדרך שבה הוא נושא מצב לאורך סשן ארוך ופתוח. שנית, הוא משתמש במנגנון 'ביקורת עצמית' — אותה סקירה עצמית רקורסיבית שפתרון ה-IMO תואר כמשתמש בה — כדי לסמן ולתקן את צעדי הביניים שלו. שלישית, מתכון האימון נקרא TEMPO (הערכת ערך בקנה-מידה בזמן בדיקה עם אופטימיזציית מדיניות בשלבי מאקרו): המודל מפצל מסלולים ארוכים לשלבי מאקרו ומתחלף בין תפקידי שחקן ומבקר כדי לייצר אות אימון משלו, וזו הסיבה המדווחת לכך שניתן לבצע עליו אופטימיזציה במשימות שאין להן תשובת אמת בסיסית.

ההדגמות המעשיות של הספק הן טעם הטענה: משחקים ב-Slay the Spire II (בונה החפיסות) עד לקומה 33, פותרים את כל שש רמות ה-ARC-AGI 3 ב-320 צעדים, עוברים על בעיית חשיבה מרחבית של שיפוץ בית, ובונים אפליקציית visionOS מקצה לקצה (12 קבצי Swift, 1,876 שורות, "BUILD SUCCEEDED"). התייחסו אליהן כהדגמות, לא כמדדים — אבל הן הדגמות של דבר ספציפי: מודל ששומר על מטרה אחת בראש ומבצע שלבים רבים בלי לאבד את החוט, וזוהי היכולת שהכי חסרה כיום בשוק הסוכנים.

עלות, אירוח עצמי, ואיך לנסות את זה

המשקלים הפתוחים הם חינמיים; העלות של תצוגת ה-preview של dots3-note היא היכן שמגישים אותה. המתכון הייחוס של vLLM עבור צ'קפוינט FP8 רץ על שמונה NVIDIA H100 עם מקביליות טנזור 8 ומקביליות מומחים 8 — קו תקציב אמיתי, לא מודל למחשב נייד. צוותים עם חומרה מהסוג הזה מקבלים את כל המחסנית, כולל פענוח ספקולטיבי MTP עם 3 טוקנים ואת מפענח קריאות הכלים dots שהראנטיימז כוללים. כל השאר יקראו לזה hosted: פורטל ה-API של הספק פעיל, ונקודות קצה מתארחות של preview עלו לאוויר בפלטפורמות צד שלישי באותו היום שבו המשקלים שוחררו — 14 באוגוסט. שכבת ה-preview מופיעה במחיר של $0 לכל טוקן בפלטפורמות שמגישות אותה, לפי הרישומים של אותן פלטפורמות ולא לפי דף התמחור של הספק, כך שעלות הכניסה לניסיון של dots3-note preview בייצור כיום היא למעשה אפסית כל עוד תג ה-preview תקף.

למי שבונה, הוויכוח בן השבועיים על הימור זול במודל לא מוכח נקרא עכשיו כוויכוח על הערכת מודל שרק נשלח — התבנית זהה. כוונו נתח תעבורה אל המודל החדש, מאחורי failover אוטומטי, כך שמצב כשל מפתיע יפיל נתיב בדיקה במקום נתיב ייצור. לזה נועד ראוטר, וזו הגרסה הכנה של ההצעה: התצוגה המקדימה של dots3-note לא מתארחת על OrcaRouter נכון לכתיבת שורות אלה, ואף אחד לא צריך להעמיד פנים אחרת. אבל עמדת הניתוב שכתבנו עליה במאמר על ההדלפה חלה ביום שבו זה יקרה — API אחד שיכול להגיע למודל חדש ברגע שספק מארח אותו, עם מחירי הרשימה של הספק מועברים ב-0% תוספת ו-failover המוגדר לכל בקשה. בינתיים, המודלים ממשפחת DeepSeek שהמודל הזה קשור אליהם מבחינה מבנית כבר ניתנים לקריאה כך: DeepSeek V4 Flash ו-DeepSeek V4 Pro שניהם פעילים תחת מפתח אחד, עם אותו תמחור מעבר ו-failover לכל בקשה — נקודת ייחוס סבירה לשפוט איך מודל סוכן עם 16B פרמטרים פעילים, כמו התצוגה המקדימה של dots3-note, מתנהג בפועל בייצור.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash (www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731), the released DeepSeek-generation model whose MLA + sparse-attention family dots-note-3.0 is structurally related to.

מה לצפות בהמשך

ארבעה דברים, בערך בסדר שבו הם עשויים לשנות את התמונה:

• שחזור עצמאי של 42/42. המשקלים כבר בחוץ; הריצה החוזרת הרצינית הראשונה של צד שלישי לתוצאת ה-IMO — או חבילת הערכה נייטרלית שסותרת אותה — היא נקודת הנתונים בעלת הערך הגבוה ביותר שהשחרור הזה יכול להפיק. עד אז, ה-42/42 נשאר ציון שנבחן רשמית ודווח על ידי החברה.

האחים הגדולים יותר, jazz ו-aria. dots3-note preview הוא השחרור הפומבי הראשון, ולפי החברה, החבר הקל ביותר במשפחת dots3. אם 280B סה"כ / 16B פעיל הוא הדגם הקטן, שני הדגמים הגדולים יותר הם המקום שבו הטענות על קו החזית ייבחנו בפועל.

• מגבלות אירוח ותנאי תצוגה מקדימה. המחיר כעת פומבי — שכבת התצוגה המקדימה היא בחינם לכל טוקן בפלטפורמות שמשרתות אותה — אבל מגבלות הקצב והשאלה אם תג התצוגה המקדימה נושא תנאים מיוחדים עדיין יכריעו מי מארח בעצמו לעומת מי שקורא לו.

• היכן הוא מדורג בלוחות תוצאות עצמאיים. הטענות המדווחות על-ידי הספק בנוגע ל-ARC-AGI ולחבילות הסוכנים דורשות מדידה ניטרלית כדי להפוך לעובדות שמישות — זהו אותו תהליך שהפריד בין ההייפ למציאות בכל שחרור פתוח השנה.

כשסיקרנו את ההדלפה באוגוסט, הסיכום הכנה היה קצר: ארכיטקטורה אמיתית, תיעוד אמיתי, אין משקלים, אין תאריך. שלושה מתוך ארבעת התנאים האלה כבר נעלמו. הארכיטקטורה פומבית, התיעוד צמוד לנקודת checkpoint הניתנת להורדה, והתאריך הגיע. מה שנשאר הוא האימות — ועכשיו, כשאפשר להריץ את dots3-note preview במקום לקרוא עליו, התשובה לשאלה האם Xiaohongshu בנתה את מודל הסוכן שהיא טוענת לו תגיע מכל מי שיש לו שמונה H100s ומערכת benchmark, לא מ-pull request.