כרטיס כותרת שעליו כתוב "Clef מול Qwen3.8-27B — עמוד שדרה אחד, שני חוזי פלט", ומתחתיו שני כרטיסים: Clef, מודל החלטות 27B, לוגיט אחד לכל אפשרות; ו-Qwen3.8-27B, VLM צפוף 27B, טוקנים וקריאות לכלים.
Guides & Insights

Clef מול Qwen3.8-27B: עמוד שדרה אחד, שני חוזי פלט

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Clef לא מסוגל לכתוב משפט, והוא בנוי ממודל שכן מסוגל. Cloudflare/clef הוא מודל החלטות מולטימודלי בעל 27 מיליארד פרמטרים: אתה מוסר לו מצב וסכמה של שאלות עם טיפוסים, והוא מחזיר הסתברות לכל אפשרות מורשית בלי להפיק טוקן אחד של פרוזה. עמוד השדרה שמתחתיו הוא Qwen3.8-27B, מודל ראייה-שפה צפוף עם משקולות פתוחות, קפוא במקומו כשראש קטן נוסף מחובר אליו. זה הופך את זה לאחד העמודים הבודדים של מודל מול מודל שבהם שני הצדדים כלל אינם יריבים — הם צ'קפוינט והנגזרת שלו, חולקים 55 גיגה-בייט של משקולות וחלוקים בשאלה אם התשובה היא משהו שאתה קורא או משהו שאתה מחשב איתו.

המשקלים של שניהם נחשפו לציבור לפני שהמילים עצמן פורסמו. Cloudflare יצרה את מאגר Cloudflare/clef ב-Hugging Face בשעה 21:15 UTC ב-30 בספטמבר 2026, תחת רישיון Apache-2.0, ופרסמה את פוסט ההכרזה — "מציגים את Clef: מודלי ההחלטות בקוד פתוח שלנו, ופלטפורמה חדשה לכוונון עדין ב-RL" — בשעות אחר הצהריים של היום שלמחרת. במשך כשמונה-עשרה שעות היה מודל בגודל 55 גיגה-בייט זמין להורדה ורץ על ה-GPU-ים בקצה של Cloudflare עצמה, לפני שהספק שלו אמר על כך דבר. בתוך שלושה ימים כבר היה לו עמוד ספרייה ב-Ollama מאחורי Ollama 0.35.1, ושם הכתבה הזו מצאה אותו, וכן בילדים מסוג NVFP4, FP8, EXL3, INT8, Q4 ו-Q8 מתריסר מעלים שונים.

מה שניתן לדעת מהמאגר הוא שלם באופן יוצא דופן, וכדאי להפריד את זה ממה שלא. ניתן לדעת: הארכיטקטורה, נקודת הביקורת הבסיסית, הרישיון, מימוש ייחוס שרץ, ומטריצת הערכה מלאה. לא ניתן לדעת: האם אחד מהמספרים האלה ישרדו הרצה חוזרת על ידי מישהו שאינו Cloudflare. כל ציון המיוחס ל-Clef בהמשך מגיע מהרצה של הספק עצמו של סוויטה שהספק מארח. חוסר הסימטריה הזה מול מודל שיש מאחוריו חודש של שימוש עצמאי הוא עמוד השדרה הכנה של ההשוואה הזו, ושאר הקטע עוסק במקום שבו זה באמת נושך.

שני המאגרים, זה לצד זה

התחילו בהורדה, כי הדמיון הוא העיקר. ה-safetensors של Clef מסתכמים ל-54.97 GB בשנים-עשר שברים. אלה של ההורה מסתכמים ל-55.56 GB בשמונה-עשר. Clef שומר על מקודד הראייה של Qwen3.8-27B — המעבד, מגדל הראייה, כל החזית המולטימודלית — שום דבר לא הוסר כדי להקטין אותו. מה ש-Cloudflare הוסיפה הוא ראש סכמה משותף בגודל 256 MB: ארבע שכבות, ברוחב 1,000, שישה-עשר ראשים, רשת הזנה-קדימה ברוחב 4,096, שתי שכבות ניתוב שקוראות את המצבים החבויים הסופיים של עמוד השדרה. מתכון האימון הוא עמוד שדרה קפוא, אותו ראש, ואדפטרים בדירוג 256, עם אנטרופיה צולבת עם החלקת תוויות עבור תשובות סכמה תקפות, שמוצמדת מול אובדן Brier כדי לחדד את הכיול.

ואז הפער, שנמצא כולו במה שמותר למודל לפלוט.

• פרמטרים — Clef 27B, שעבר אימון-המשך מ־Qwen/Qwen3.8-27B. Qwen3.8-27B 27B צפוף, 64 שכבות, 5,120 חבויים, אוצר מילים של 248,320 טוקנים, 16 × (3 × Gated DeltaNet → FFN) משולבים לסירוגין עם Gated Attention.

• פלט — Clef: לוגיט אחד לכל אפשרות מותרת, עם softmax לכל שאלה, בלי נתיב יצירה כלל. Qwen3.8-27B: טוקנים, קריאות לכלים, ובלוק חשיבה שפעיל כברירת מחדל.

• צורות שאלות — ‏Clef מקבל 1 עד 64 שאלות בעלות טיפוס בכל בקשה, בשלוש צורות: noul (הסתברות להיות אמת), choice (2 עד 255 אפשרויות בעלות שם), score (2 עד 10 רמות מסודרות, המחזירות ערך משוקלל לפי הסתברות שיכול לנחות ביניהן). ל-Qwen3.8-27B אין חוזה כזה; אתה מקבל טקסט חופשי ואתה כותב את המפרסר.

• רישיון — Apache-2.0 בשניהם, וזו הסיבה שהקוונטיזציה של צד שלישי התרחשה במהלך סוף שבוע.

• העלות של החצי הקפוא — הראש של Clef הוא 256 MB לעומת 54.97 GB של עמוד השדרה. כמעט כל ההורדה היא ההורה. אם כבר יש לך את Qwen3.8-27B בדיסק, אתה מוריד אותו בפעם השנייה כדי לקבל חוות דעת שונה לגבי איך לענות.

A two-column scoreboard for Clef and Qwen3.8-27B across six dimensions: output, parameters, GPQA Diamond (48.0 vs 90.5), hosted context (65,536 vs 262,144 tokens), median latency (209.3 ms vs 1,929 ms) and list price ($0.24 per M in vs $0.33/$2.40 per M). A footer notes Clef's figures are vendor-reported and unreproduced, Qwen's GPQA is per Artificial Analysis, and latency was measured by each side on its own hardware.

מה עולה כותרת מחדש, בשני מספרים

ההערכה של Cloudflare היא חבילת Decision Index 0.2.1, המופעלת באופן פנימי, והיא טבלה העוסקת במודלים של קבלת החלטות — שישה עמודות: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B ו-Laya. ל-Qwen3.8-27B אין שורה בה, ול-Clef אין שורה ב-Artificial Analysis Intelligence Index. לכן אין לוח תוצאות משותף והקטע הזה לא ימציא אחד.

עם זאת, יש מדד אחד ששני הצדדים עברו דרכו, והפער גדול מספיק כדי להיות המספר הרלוונטי ביותר להחלטה בהשקה. ב-GPQA Diamond — שאלות מדע ברמת תואר שני, בחירה מרובה — Cloudflare מודדת את Clef ב-48.0. מודל האב ניצב ב-90.5 במערך הבדיקות של Artificial Analysis וב-89.2 בכרטיס המודל של הספק עצמו. זהו צוק של ארבעים נקודות בידע כללי, וזה לא בגדר תעלומה: Clef עונה על ידי ניקוד של קבוצה קבועה של אפשרויות שהועברה לו, ובחירה מרובה בידע כללי היא בערך הדבר הרחוק ביותר מ"לנתב את הפנייה הזו" שאליו ניתן לכוון את אותם משקלים. יש להתייחס להשוואה כאינדיקטיבית ולא כמבוקרת — שני מערכי בדיקות, שתי מעבדות, לא של הספק ולא של העוקב. אך הכיוון אינו מוטל בספק, וזהו מחיר החוזה.

אותה תבנית מופיעה בשאר התאים למטרות כלליות של Clef. MMLU-Pro 65.9, BBH 73.7, CLINC150 עם טיפול מחוץ לתחום 97.4 עבור ה-27B לעומת 89.3 של Jev — האחרון הוא התא הנדיר שבו הנגזרת גוברת על מודל ההחלטה הישן באופן מוחלט, וזה חשוב כי סירוב לסווג הוא החצי הקשה של הניתוב. היכן ש-Clef חזקה היא חזקה בדיוק במקום שבו מסווג שאומן בבית אמור להיות: BANKING77 macro-F1 של כוונות ב-94.2, BFCL case-exact ב-98.5, API-Bank ב-91.9. היכן שהיא חלשה, מודל החלטה טקסטואלי בלבד ממעבדה מתחרה — Jev של TypeSafe — מנצח אותה בשלושים נקודות ב-GPQA Diamond תוך חיוב $0.042 למיליון טוקני קלט בקטלוג שלנו, שזו תזכורת מועילה ש"27B" אינו בעצמו טיעון.

מה שהמודל האב שומר הוא כל מה ש-{{Decision Index}} לא שואל עליו. בכרטיס שלו עצמו ובשורות שמקורן ב-AA שהקטלוג שלנו כולל: Terminal-Bench 2.1 בציון 73.0, SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3, DeepSWE 1.1 בציון 42.2, AA Coding 68.1 בדירוג 35 מתוך 138 מודלים שנדגמו. לאף אחד מאלה אין שורה של Clef, מפני ש-Clef לא יכול לנסות אותם. אין לו נתיב לקריאה לכלים, אין תכנון ארוך-טווח, ואין דרך לפלוט את הטלאי.

מה המחיר של החלטה אחת, ולמה שורת הפלט היא הטיעון כולו

עמוד המודל של Workers AI מפרט מחיר יחידה אחד בדיוק עבור Clef: $0.24 למיליון טוקני קלט. אין שורת פלט, והסיבה נמצאת בתשובות. הדוגמה המתועדת של Ollama עצמה — פנייה לתמיכה שמנותבת דרך שלוש שאלות — חוזרת עם "usage": {"input_tokens": 1204, "output_tokens": 3}. שלושה טוקני פלט עבור שלוש שאלות. אם Cloudflare מחייבת על שלושת הטוקנים האלה, זה כמעט חסר חשיבות: עלות הפלט של החלטה אינה תעריף — היא ספירת שאלות.

השווה זאת למחירון של ההורה בקטלוג שלנו, שהוא 0.33 דולר למיליון טוקני קלט ו-2.40 דולר למיליון פלט עם חלון של 262,144 טוקנים. אותו מצב של 1,204 טוקנים, אותה החלטת ניתוב אחת:

• Clef — 1,204 טוקני קלט במחיר $0.24 למיליון הם בערך $0.00029 להחלטה, ובערך $289 למיליון החלטות. המספר בקושי זז כשהתשובה נעשית קשה יותר, רק כשהמצב נעשה ארוך יותר.

• Qwen3.8-27B עם חשיבה מושבתת — אותו מצב עולה כ-$0.00040 בקלט, בתוספת כעשרה טוקנים בפלט ב-$2.40 למיליון. אפשר לקרוא לזה $0.00042, או $421 למיליון. Clef זול בכ-1.5×, וזה לא הסיפור שאף אחד מספר.

• Qwen3.8-27B עם חשיבה דלוקה — וזו ברירת המחדל בצ'קפוינט הזה. אם הוא מוציא 400 טוקנים על חשיבה לאיזה מבין ארבעה סלים שייך דוא"ל לאיפוס סיסמה, זה עוד $0.00096 וההחלטה נוחתת קרוב ל-$0.0014, או $1,357 למיליון. 400 הטוקנים האלה הם הנחה, לא מדידה, והמכפיל נע באופן ליניארי יחד איתה.

אז הגרסה הכנה של טיעון התמחור צרה יותר מכפי שהיא נראית במבט ראשון. מול מודל כללי שפועל כשהחשיבה כבויה, Clef מנצח בדולרים בפקטור של בערך אחד וחצי — אמיתי, אבל לא טרנספורמטיבי. מול אותו מודל בתצורת ברירת המחדל שלו, הפער הוא פונקציה של מילוליות, ומילוליות היא בדיוק מה שיש למודל שפה, ומה שלעיצוב של מדרגים־מעל־אפשרויות אין בכלל. זו הטענה המבנית: העלות של Clef חסומה באורך המצב, וזו של האב חסומה בכמה שהאב מחליט לומר.

Cloudflare's Workers AI model page for clef, showing a 65,536-token context window, vision support, and unit pricing of $0.24 per million input tokens with no output line.

המספר האחד שאינו קרוב

Cloudflare מדווחת על חציון השהיית בקשות של 209.3 ms עבור Clef ועל p95 של 238.6 ms, כפי שנמדד על פני 43 מבחני הביצועים בהרצה שלה, על מעבדי GPU בקצה שלה. אף אחד מחוץ ל-Cloudflare לא שחזר זאת, והתשתית של הספק היא הסיבה לכך שהמספר נמוך כפי שהוא — המודל הזה מיועד להימצא באותה רשת כמו הקורא.

לגבי ההורה, אנחנו יכולים לעשות טוב יותר מאשר מספר של ספק, מכיוון שזה אחד מהנתיבים שלנו. במהלך חלון שבעת הימים המסתיים ב-2 באוקטובר 2026, סביבת הבדיקות הייעודית של OrcaRouter מדדה את Qwen3.8-27B ב-p50 של 1,929 מ״ש ו-235.8 אסימוני פלט לשנייה, על 136.3 מיליון אסימונים של תעבורה בחלון הזה. הסדרה היומית היא החלק המעניין: p95 עומד בדיוק על 10,000 מ״ש בשישה משבעת הימים, מה שמשתמע כתקרה ולא כמדידה, וה-p50 נע בין 1,751 מ״ש ל-4,296 מ״ש בהתאם ליום. התייחסו לחציון כבערך פי תשעה מהנתון של Clef, והתייחסו לזנב כלא אינפורמטיבי עד שמישהו יפרסם התפלגות אמיתית.

הפער הזה אינו הבדל של כיוונון, והוא לא ייסגר. מעבר prefill בלבד בתוספת ראש ניקוד מקביל מסתיים בסבב אחד; מודל אוטורגרסיבי מסתיים כשנגמר לו מה לומר. הנתונים המוחלטים של הספק עבור Clef ראויים להנחה הרגילה, אבל סדר הדירוג הוא תכונה של הארכיטקטורה, לא של החומרה של Cloudflare.

ההקשר מצוטט בשלוש דרכים עבור אחד מהם

שני המודלים מקבלים טקסט, JSON, תמונות ווידאו. חלונות ההקשר אינם זהים, ואחד מהם מצוין באופן לא עקבי, בהתאם למקום שבו קוראים.

• Clef, באירוח — 65,536 טוקנים, לפי עמוד המודל של Workers AI ופוסט ההכרזה. זהו המספר שמגביל קורא API, והניסוח של Cloudflare עצמה הוא השוואתי: כפול מהמצב שחלון ה-32K של Jev מחזיק.

• Clef, על הדיסק — ה־config.json המשוחרר מצהיר על max_position_embeddings של 262,144, מכיוון שעמוד השדרה הקפוא הוא של ההורה ועדיין נושא את תקרת המיקום של ההורה. עוזר ה-encode_record המצורף כברירת מחדל הוא max_length=16,384, כאשר max_state_tokens זמין לתחום את המצב בנפרד. אף אחד משלושת המספרים האלה אינו שגוי; הם עונים על שאלות שונות, ורישום בזמן ריצה שמפרסם 256K קורא את הקונפיגורציה, לא את נקודת הקצה.

• Qwen3.8-27B — 262,144 באופן מובנה, ניתן להרחבה ל-1,000,000 עם תצורת הגשה מתאימה, לפי כרטיס הספק ושורת הקטלוג שלנו. לפחות פי ארבעה מחלון Clef המתארח.

ההשלכה המעשית קטנה מכפי שהיחס מרמז. Clef צורך מצב — כרטיס, חשבונית, צילום מסך — ולא שיחה, ואחד מהיתרונות השיווקיים שלו הוא שאפשר למסור לו מטען גדול ומשוטח ולשאול עליו שישים וארבע שאלות בלי לשלם שוב על המטען עבור כל שאלה. ההורה זקוק לחלון מפני שהוא צריך להכיל את ההיסטוריה, את תוצאות הכלים ואת החשיבה שלו עצמו. דרישות שונות, תקרות שונות.

שניהם רואים את אותם הפיקסלים

מקודד הראייה עובר בירושה, כך שאין זה מקרה שבו מודל אחד הוא רב-מודלי והאחר לא. Clef מקבל עד ארבע תמונות לבקשה, PNG, JPEG או WebP בקידוד base64, המשותפות לכל שאלה במטען, וניתן להוסיף פריימים של וידאו כמערכי פריימים — דוגמת הקבלה בכרטיס שואלת שאלת כן/לא אם הסכום הכולל קריא, וזה העיצוב בזעיר אנפין. Qwen3.8-27B הוא מודל חזותי-לשוני ילידי עם OmniDocBench 1.5 בציון 91.1, RealWorldQA בציון 85.9 ו-CharXiv בציון 78.8 בכרטיס של הספק.

השוני הוא במה שאתה מקבל בחזרה. Clef נותן לך החלטה שדה אחר שדה עם הסתברות מצורפת, שהיא תשובה עם טיפוס לגבי מסמך. ההורה נותן לך תיאור של המסמך, שאותו אתה מפרסר לאחר מכן. עבור קטגוריה רחבה של עבודות מסמכים — לבדוק את הטופס הזה, לאתר את הסעיף הזה, האם הסכום הכולל הזה מעל הסף — התשובה עם הטיפוס היא העבודה כולה, והתיאור הוא תקורה שאתה משלם עליה ואז זורק אותה.

היכן שהקו למעשה עובר

• בחר ב-Clef — התשובות ניתנות למנייה מראש ואתה מעדיף שלא לכתוב מפרסר. ניתוב, מיון, שער, בדיקות מדיניות, חילוץ שדות ממסמכים. קבוצות סגורות, 2 עד 255 אפשרויות לשאלה, עד 64 שאלות שמקבלות ניקוד יחד.

• קח את Clef — ההחלטה נמצאת בנתיב חם, ו-209 ms לעומת 1,929 ms משנה את מה שהפייפליין יכול לעשות. זו הסיבה היחידה והחזקה ביותר למעבר, והיא סיבת השהיה, לא סיבת דיוק.

• קח את Clef — אתה רוצה דטרמיניזם. אפשרות שלא הצהרת עליה לא יכולה לחזור, כי אין שלב ייצור שיוכל להפיק אותה.

• השאר את Qwen3.8-27B — התשובה אינה בחירה מתוך רשימה: סיכום, ניסוח, חשיבה דרך בעיה חדשה, כתיבת קוד, הפעלת כלים לאורך טווח ארוך. Clef לא מסוגל לעשות דבר מכל אלה, והוא גם לא יגיד לך זאת.

• השאר את Qwen3.8-27B — אתה צריך שהמודל יאמר "אף אחד מאלה". מודל החלטה מדרג את האפשרויות שניתנו לו. תן לו סכימת חיוב/טכני/מכירות ובקשת פרטיות, והוא יחזיר את הפחות גרוע מבין השלושה במקום סירוב. מודל האב מעלה את השאלה שלא חשבת לשאול.

• שמור את Qwen3.8-27B — לעבודה עם הקשר או מסמכים ארוכים. פי ארבעה מחלון האירוח, לפני הרחבת מיליון הטוקנים.

קראו את הרשימה הזו כצינור עיבוד ולא כהכרעה, כי זה מה שהיא. הארכיטקטורה הופכת את הקשר הזה למילולי: Clef הוא שלב ה-prefill של ההורה, עם מנגנון תשובה שונה בסופו. עיצוב הגיוני מציב את Clef בחזית — להחליט על המסלול, על העדיפות, על דגל ההסלמה — ומשאיר את Qwen3.8-27B מאחוריו כדי לפעול על פי ההחלטה. השניים משלימים זה את זה, במקרה שהם חולקים אותה הורדה.

היכן להריץ כל אחד מהם

Clef מתארח ב-Workers AI של Cloudflare לפי הנתון של $0.24 למיליון טוקני קלט שלמעלה, ומשקולות ה-Apache-2.0 עומדות לרשותך להרצה מקומית. הרשומה בספריית Ollama היא המשטח החדש ביותר: ollama pull clef דורש Ollama 0.35.1 ואילך, מכיוון שהמודל מדבר דרך נקודת הקצה /v1/systemone ש-Ollama הוסיפה עבור מודלים של החלטות. שימו לב לתגיות, ולא לכותרת — תג ברירת המחדל ותג clef:27b הם 18 GB, שזהו מבנה של ארבע סיביות של מודל בנפח 55 ג'יגה-בייט; clef:27b-q8_0 הוא 30 GB, clef:27b-nvfp4 הוא 18 GB, clef:27b-mxfp8 הוא 31 GB, ו-clef:27b-mlx-bf16 הוא 55 GB המלא עבור Apple silicon. ה-SDK של Python מבית TypeSafe עצמו ידבר איתו אם תפנה אותו ל-Ollama מקומי ותספק כל מפתח API, שה-runtime מתעלם ממנו. הסתייגות אחת שתכיש בייצור: confidence מודד עד כמה ההסתברויות מרוכזות, ולא את הסיכוי שהתשובה נכונה, ותיקו נפתר לפי סדר האפשרויות שהצהרת.

המודל האב הוא הקל יותר להצבה מאחורי API כיום. Qwen3.8-27B ניתן לנתב ב-OrcaRouter בתעריפים של $0.33 ו-$2.40 למיליון ששימשו לעיל, עם חלון של 262,144 טוקנים, והוא אחד מיותר מ-200 מודלים הנגישים דרך מפתח יחיד תואם OpenAI. מכיוון שמחיר המחירון של הספק מועבר הלאה בתוספת של 0%, הורדת מחיר מצד ספק באחד משני צדי השוואה זו נכנסת לתוקף בנתיבים שלנו באותו יום שבו היא נוחתת.

Clef עצמו אינו אחד מהמסלולים שלנו — הקטלוג הציבורי שלנו לא מחזיר עבורו דבר, ואין לקרוא בדברים כאן כהצהרת זמינות מצדנו. מה שכן יש בידינו הוא המודל שהופך את דפוס קבלת ההחלטה לנגיש בלי חשבון Cloudflare: Jev 1.13 של TypeSafe הוא מסלול רשום ב-$0.042 למיליון טוקני קלט עם חלון הקשר של 65,536 טוקנים, נמדד ב-p50 של 148 מ״ש באותו חלון של שבעה ימים, והוא מדבר באותה צורת בקשה זהה בדיוק של POST /v1/systemone. מכיוון ש-Clef תואם API ל-Jev במכוון, צינור עיבוד שנבנה מול אחד מהם נמצא במרחק שינוי קונפיגורציה מהאחר — וזה בדיוק המקרה ששכבת ניתוב קיימת כדי לעשות בחינם. השאירו את שניהם נגישים, מדדו לפי התוויות שלכם, ותנו למנצח להיות נקודת נתונים ולא התחייבות ארכיטקטונית. אם מודל החלטה משמש בסופו של דבר כשער לסוכן, המודל שפועל על ההחלטה עדיין חייב להיות נגיש, והחצי הזה כבר נמצא מאחורי אותו מפתח.

OrcaRouter's own model page for qwen/qwen3.8-27b, showing a 262,144-token context window and pricing of $0.33 per million input tokens and $2.40 per million output tokens.

מה ישנה את הקריאה הזו?

שלושה דברים, בסדר עולה של המידה שבה הם היו מזיזים את זה.

צד שלישי צריך להריץ מחדש את Decision Index. החבילה ציבורית ו-Cloudflare מתארת את ההערכות כניתנות לשחזור, כך שזה בר-השגה — והתא מחוץ לתחום של CLINC150 הוא זה שכדאי לעקוב אחריו, מפני ש-97.4 עבור ה-27B הוא או יתרון אמיתי על פני ה-89.3 של Jev בחצי הקשה ביותר של הניתוב, או ארטיפקט של הרנס שנבנה בבית. אף אחד מחוץ ל-Cloudflare עדיין לא יודע.

מישהו צריך לתת ציון ל-Clef ול-Qwen3.8-27B באותה משימת סיווג עם אותן תוויות. זו ההשוואה היחידה שתוכל להכריע אם החלפת הראש היא פשרה באיכות או שדרוג באיכות עבור החלטות בקבוצה סגורה, ולאף אחד מהספקים אין תמריץ להריץ אותה. עד אז, פער GPQA של ארבעים נקודות ניצב כראיה הזמינה הטובה ביותר לגבי מה שהוסר, והיא ראיה על המשימה הלא נכונה.

והלטנטיות של Clef צריכה p95 בתנאי מקביליות. החציון של 209 מילישניות נמדד על ידי הספק, על חומרה שהספק שולט בה, עבור מודל שכל המסר המכירתי שלו הוא שהוא יושב במסלול חם. הסדר היחסי מול מודל אב אוטורגרסיבי הוא ארכיטקטוני והוא ישרוד. המילישניות המוחלטות הן המספר שאסור לסמוך עליו, והן המספר שכל ההצדקה העסקית נשענת עליו.

Qwen3.8-27B הוא אחד מיותר מ-200 מודלים הנגישים דרך מפתח יחיד תואם OpenAI — Qwen3.8-27B.