
Clef מעתיק בכוונה את ה-API של ג'ב — וזה החלק המעניין
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Clef הוא מודל מולטימודלי בעל 27 מיליארד פרמטרים מ-Cloudflare שעונה על שאלות מוקלדות ולא על שום דבר אחר. אתם מוסרים לו מצב — טקסט, JSON, תמונה, פריים וידאו — יחד עם סכימה של עד 64 שאלות בעלות שם, והוא מחזיר הסתברות לכל אפשרות מותרת במעבר קדימה אחד. אין טקסט מיוצר, אין פרסר, אין לולאת פענוח. מה שהופך את Cloudflare/clef לראוי לקריאה אינו התכנון הזה, שאותו הוא שאל, אלא פורמט החיבור שהוא בחר: Cloudflare בנתה את Clef כך שתדבר בשפת גוף הבקשה והתגובה של Jev System One, מודל ההחלטות ש-TypeSafe השיקה ראשונה, המוגש באותו נתיב POST /v1/systemone. יכולת הפעולה ההדדית כאן היא כל הטיעון המסחרי. אם הצינור שלכם כבר שואל מודל החלטות שאלות בצורה הזו, Clef הוא שינוי כתובת URL ומחרוזת מודל, לא מיגרציה.
זה דבר יוצא דופן שפוסט שחרור יטמין, ו-Cloudflare לא מטמינה אותו — כרטיס המודל מצהיר באופן חד-משמעי שה-API "תואם לחלוטין עם Jev ו-SystemOne", והבלוג נפתח בזיכוי TypeSafe בהעלאת הקטגוריה על המפה, לפני שהוא מציב את Clef כגרסת הדור השני של ניסוי פנימי. אז הקריאה הכנה של השחרור הזה מורכבת משלושה חלקים: מה מקנה לך החלטת התאימות, מה אומרים המספרים של Cloudflare עצמה על היכן ש-Clef מנצח ומפסיד, ומה נותר לא מאומת מפני שכל נתון בטבלה ההיא הופק על ידי הספק שמפיץ את המודל.
הקטגוריה הגיעה ממקום אחר
הפוסט של Cloudflare גלוי לב לגבי השושלת. הרעיון של מודל שמחזיר פלטים מובנים וחסומים במקום פרוזה מיוחס ל-Jev System One של TypeSafe. הדרך של Cloudflare עצמה פנימה הייתה הדגמה מוקדמת יותר שאילצה מודל דיפוזיה להפיק הסתברויות דטרמיניסטיות על ידי חשיפת logprobs, בתוספת עבודת קהילה של Matt Mastracci על גרימת מנוע ההסקה לטפל בתבנית הזו. Clef בונה על הקונספט הזה עם עמוד שדרה שונה, ראש ניקוד שנבנה במיוחד, ו—החלק שחשוב מבחינה מסחרית—גוף בקשה שתואם לזה של המוביל.
כאשר ספק גם מעתיק את פורמט התקשורת של מתחרה וגם מבצע בנצ'מרק מול האינדקס של המתחרה, התאימות אינה הערת שוליים למודל — היא אסטרטגיית המוצר. החלפת מודל קבלת החלטות מאחורי נקודת קצה קיימת היא הדרך הזולה ביותר עבור שחקן חדש להיבחן, והניסוי הזול ביותר עבור צוות שכבר יש לו אחת כזו מחוברת.
מה שיצא בפועל, ומה זה עולה
• פרמטרים — 27B, נבנה על ידי הקפאת Qwen3.8-27B עם מקודד הראייה שלו ואימון ראש סכמה משותף בתוספת מתאמי דירוג-נמוך בדרגה 256 מעליו.
• אח/אחות — Clef-Flash, אותו מתכון ב-9B מ-Qwen3.5-9B. מאמר נפרד, פשרות נפרדות.
• הקשר — 65,536 אסימונים, לפי עמוד המודל של Workers AI ופוסט הבלוג. עוזר הקידוד המצורף מוגדר כברירת מחדל ל-max_length=16,384, ברירת מחדל ולא תקרה, אבל ברירת המחדל שמתקבלת אם משתמשים בטוען כפי שהוא מגיע.
• סוגי שאלות — noul (אמת/שקר, מחזיר את ההסתברות לאמת), choice (2 עד 26 אפשרויות בעלות שם), score (2 עד 26 רמות מסודרות). בין 1 ל-64 שאלות בכל בקשה.
• מחיר — $0.24 למיליון אסימוני קלט ב-Workers AI של Cloudflare, או באירוח עצמי ממשקלים של Apache-2.0 שגודלם כ-55 GB על פני שנים עשר פלחים.
• רישיון — Apache 2.0, בהתאם לנקודת ביקורת הבסיס של Qwen3.8-27B.

איפה זה מנצח, ואיפה זה לא
הרצת Decision Index של Cloudflare היא המקור לכל מה שמופיע בסעיף זה, ולוח הדירוג שמארח אותה הוא של Cloudflare. דבר ממה שלהלן לא שוחזר באופן עצמאי. קראו אותו כמקרה הטוב ביותר של ספק, ושימו לב עד כמה הוא לא אחיד.
הניצחונות מתקבצים במקום שבו מסווג שאומן פנימית אמור לנצח. Clef משיגה macro-F1 של כוונות ב-BANKING77 של 94.2 לעומת 79.7 של Jev, וב-CLINC150 עם טיפול מחוץ לתחום 97.4 לעומת 89.3 — פער של שלושים נקודות שהוא התא הרלוונטי ביותר להחלטה בטבלה, כי סירוב לסווג הוא החצי הקשה של הניתוב. היא גם משיגה CRUXEval ב-86.7, CLadder ב-94.0, ואת סימולטור מכשירי החשמל הביתיים ב-83.0.
ההפסדים ממשיים באותה מידה ושייכים לאותה פסקה. בידע כללי ובהסקה קשה, Jev הוותיק מנצח באופן מוחלט: GPQA Diamond 78.3 לעומת 48.0, MMLU-Pro 82.7 לעומת 65.9, BBH 92.9 לעומת 73.7. אלה שלושת הפערים הגדולים ביותר בטבלה, וכולם מצביעים לאותו כיוון. Clef גם אינו המודל הטוב ביותר בהשוואה שלו עצמו במערך PhishNChips בתחום האבטחה, שבו הוא מגיע ל-79.6 ומועמד מתחרה מקבל ציון גבוה יותר.
בארבע הערכות תהליכי העבודה מקצה לקצה, שנלקחו ממערך ההערכה הציבורי של TypeSafe עצמה והוערכו מול תוויות קונצנזוס, השניים קרובים מספיק כדי שזה ייחשב להטלת מטבע. Clef מנצחת בעיבוד חשבוניות בפעולות מדויקות ב-64.7 מול 61.8, ובמערך אירועי האבטחה ב-62.9 מול 61.7; Jev מנצחת בנצפות עקבות סוכנים ב-71.6 מול 68.5; שירות לקוחות הוא תיקו של 76.3 מול 76.0 שלא אומר דבר במרווח כזה.
השהיה היא המקום שבו הפער הוא מבני ולא שולי. Cloudflare מדווחת על חציון של 209.3 ms ועל p95 של 238.6 ms עבור Clef, לעומת 524.1 ו־536.0 עבור Jev. הסדר הזה נובע מהעיצוב הלא-אוטורגרסיבי ולא מן המוזרויות של מדד ביצועים, ולכן זהו המספר שסביר ביותר לשרוד מפגש עם פריסה אמיתית. המילישניות המוחלטות נמדדו על החומרה של Cloudflare עצמה ואומרות מעט כשלעצמן.
נקודת הנתונים המשכנעת ביותר בפרסום אינה שורת בנצ'מרק. Cloudflare אומרת שצוות מודיעין האיומים שלה העביר דומיין ל-Clef לצד שירות רינדור הדפדפן שלה וקיבל הכרעת קטגוריה תוך 2.2 שניות, לעומת 4.7 שניות עבור ה-LLM הכללי המהיר ביותר שלה באותו תהליך עבודה, עם יותר סיווגים שהוחזרו. אנקדוטה פנימית, לא מחקר — אבל זה מסוג הסיפורים שמסבירים מדוע מישהו יבנה את זה במקום להזין פרומפט למודל כללי.

שני דברים שתיעוד ה-API מספר לך, ואחד שהוא לא
המלכודות המתועדות קטנות וכדאי לקרוא אותן לפני שאתם מעבירים משהו. שדה הביטחון מודד עד כמה ההסתברויות מרוכזות, ולא את ההסתברות שהתשובה נכונה — מודל מכויל היטב יכול להחזיר תשובה נכונה בביטחון נמוך ותשובה שגויה בביטחון גבוה. וכששתי אפשרויות משתוות, התשובה הולכת לפי סדר האפשרויות של המודל, לכן שימו את האפשרות המועדפת עליכם ראשונה. כל מי שמעביר מסווג מבוסס פרומפט בלי לקרוא את שני המשפטים האלה יקרא לא נכון את הלוגים של עצמו.
המגבלה הגדולה יותר אינה מתועדת בשום מקום מפני שהיא מבנית. ל-Clef אין כלל נתיב ליצירת טקסט, כלומר הוא אינו יכול לנסח תגובה, לסכם שרשור, לקרוא לכלי או לנהל שיחה, והוא לא ימציא קטגוריה שלא הצהרת עליה. כל התכנון מניח שאפשר למנות מראש את התשובות המותרות. זה מחריג בשקט מחלקה גדולה של בעיות, ושום רמת ביצועים במדד לא משנה זאת.
מה שווה טיעון התאימות
כאן המקום שבו השחרור מפסיק להיות סקירת מודל והופך לשאלה ארכיטקטונית. אם Clef תומך במבנה הבקשה של Jev, אז המודל שמאחורי נקודת הקצה שלך לקבלת החלטות הוא ערך תצורה, והדרך ההגיונית לאמץ אותו היא זה לצד זה ולא כהחלפה — הרץ את שניהם מול התעבורה שלך, שמור את זה שממדד טוב יותר על הנתונים שלך, ותן למתג להישאר זול.
Clef עצמה אינה ברשימת הנתיבים שלנו; הקטלוג של OrcaRouter מחזיר עבורה 404, ואין לקרוא דבר כאן כהצהרת זמינות מטעמנו. מה שכן יש לנו הוא המוצר הקיים שהיא נועדה להחליף. Jev 1.13 של TypeSafe הוא נתיב רשום במחיר של $0.042 למיליון אסימוני קלט על פני הקשר של 65,536 אסימונים, המוגש דרך אותו POST /v1/systemone גוף, כך שמבחן A/B בין השניים הוא מחרוזת מודל ולא שכתוב. העובדה ששניהם מאחורי מפתח אחד — יותר מ-200 מודלים, מחיר מחירון של ספק מועבר הלאה ללא תוספת תשלום לכל אסימון, מעבר אוטומטי בין ספקים — היא מה שמשאיר את המבחן הזה פעיל אחרי השבוע שבו מישהו מחליט שאכפת לו, במקום שידעך להערה מיושנת בקובץ תצורה. המודל הכללי שאתה מחזיק כדי לפעול לפי מה שמודל ההחלטה מסיק נגיש מאותו מפתח ולא בחוזה שני.

מה ישנה את הקריאה הזו?
מישהו מחוץ ל-Cloudflare צריך להריץ מחדש את Decision Index. החבילה ציבורית וההערכות מתוארות כניתנות לשחזור, כך שהרצה של צד שלישי היא ההבדל בין טבלה של ספק לבין עובדה — והתאים שהכי חשובים הם אלה שמצביעים בכיוונים מנוגדים. ציון 97.4 בזיהוי כוונות מחוץ לתחום לצד 48.0 ב-GPQA Diamond אינו עקומת יכולת חלקה; הוא מתאר מודל שטוב מאוד בצורות הסיווג שבהתפלגות האימון שלו והרבה יותר חלש בהסקה שלא ראה. אם זה מחזיק תחת בדיקה עצמאית, זו העובדה התפעולית החשובה ביותר בנוגע ל-Clef והיא לא נמצאת בנקודות הבולטות.
גם תעבורת הייצור צריכה להיראות כמו טבלת ההשהיה. חציון של 209 מילישניות שנמדד על H200 אחד לא אומר דבר על p95 תחת מקביליות, וכל נקודת המכירה של התכנון היא שהוא נמצא בנתיב חם.
ופלטפורמת הכוונון העדין צריכה להניב משהו. הפוסט של Cloudflare מתאר לולאת RL — AI Gateway כדי ללכוד מערך נתונים מהתעבורה שלך, Workers AI כדי לייצר רולאאוטים, Containers בתור ארגז החול לניקוד, Trainer כדי לעדכן משקלים, ואז לפרוס מחדש אל Workers AI — באותו פוסט שמכריז על המודלים, בלי תוצאת לקוח מצורפת. Clef שעבר כוונון עדין ומנצח את מודל הבסיס במשימה שמודל הבסיס מעולם לא אומן עבורה יהיה עדות חזקה בהרבה לקטגוריה מכל שורה בטבלה.
עד אז, הסיכום ההוגן הוא זה: Cloudflare שחררה מודל החלטות אמיתי, ברישיון מתירני ומהיר באמת, ואפשרה להחליף אותו בקלות יתרה בזה שבא ראשון. זהו סיפור טוב יותר ממה שרוב ההשחרורים הפתוחים מציעים, והוא עדיין, עד כה, כולו התיאור שהספק עצמו נותן לעצמו.
