
Clef מול Gemma 4 12B: מכשיר לקבלת החלטות עם 64K טוקנים לעומת גנרליסט עם 256K טוקנים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
המספר השימושי ביותר בהשוואה בין Clef לGemma 4 12B אינו ציון בנצ'מרק. הוא 65,536 מול 256,000 — חלונות ההקשר. Cloudflare/clef הוא מודל החלטה מולטימודלי בעל 27 מיליארד פרמטרים, שעבר אימון-המשך מ-Qwen3.8-27B, שקורא מצב וסכמה של שאלות עם טיפוסים ומחזיר הסתברות לכל תשובה מותרת במעבר יחיד שאינו אוטורגרסיבי. Gemma 4 12B — נקודת הביקורת המאוחדת, google/gemma-4-12B-it — הוא המודל נטול-המקודד מסוג any-to-any של הספק, בעל 11.95 מיליארד פרמטרים, שיצא בקיץ 2026, ומייצר טקסט על פני חלון של 256,000 טוקנים ביותר מ-140 שפות. הציבו תיקייה של חוזים מול שניהם, ומודל ההחלטה יגמר לו המקום פי ארבעה מוקדם יותר, כי התקרה שלו היא 65,536 טוקנים מתועדים בעוד שזו של המודל הכללי היא 256,000. אי-הסימטריה הזו אינה הערת שוליים. עבור סוג שלם של עבודות ניתוב — מסמכים ארוכים, שרשורים מודבקים, טפסים רב-עמודיים — היא מכריעה את הבחירה עוד לפני שהדיוק בכלל נדון.
אז זה לא עמוד על איזה מודל טוב יותר. זה עמוד על שני הצירים שבהם הם באמת נבדלים: כמה מצב כל אחד יכול להחזיק, ואיזו צורה של תשובה כל אחד מסוגל פיזית להפיק. כל השאר הוא או נתון ספק שאיש לא הצליח לשחזר, או השוואה שמשמעותה אינה כפי שהיא נראית.
מה כל אחד מהם, פסקה אחת לכל אחד
Clef הוא מודל ההחלטות 27B של Cloudflare, שמפורסם תחת Apache-2.0 עם המשקלים ב-Hugging Face ונקודת קצה מתארחת ב-Workers AI. Cloudflare הקפיאה את עמוד השדרה Qwen3.8-27B כולל מקודד הראייה שלו, חיברה ראש סכימה משותף יחד עם מתאמי דרגה נמוכה בדרגה 256, ואימנה אותו עם אנטרופיה צולבת מוחלקת בתוויות לתשובות סכימה חוקיות לצד אובדן Brier כדי לחדד את הכיול. אתה מספק מצב — טקסט, JSON, תמונות או פריימים של וידאו — ומ-1 עד 64 שאלות בעלות שם, כל אחת מהסוג noul (אמת/שקר, מחזיר את ההסתברות לאמת), choice (2 עד 26 אפשרויות בעלות שם) או score (2 עד 26 רמות מסודרות). מה שמוחזר הוא התפלגות לכל שאלה ולא דבר אחר. אין בכלל מסלול של יצירת טקסט.
Gemma 4 12B הוא מודל כללי שמייצר טקסט. הוא נטול מקודד (encoder-free): במקום מגדלי ראייה או שמע נפרדים, טלאי תמונה גולמיים וצורות גל מוקרנים ישירות למרחב ההטמעה של מודל השפה באמצעות שכבות ליניאריות קלות, וזה מה שמאפשר לו לקלוט טקסט, תמונה, וידאו ושמע ללא צינור עיבוד נפרד לכל מודאליות. יש לו מצבי חשיבה ניתנים להגדרה, קריאה לפונקציות מובנית, אוצר מילים של 262K וסכמת קשב היברידית שמשזרת קשב בחלון מחליק של 1,024 טוקנים עם קשב גלובלי מלא. הוא ברישיון Apache-2.0 עם תנאי השימוש של הספק עצמו לצידו, והוא הצ'קפוינט שהרוב מתכוונים אליו כשהם אומרים "להריץ את הגודל הזה באופן מקומי".
דבר אחד שיש לומר בבירור לפני שממשיכים: אף אחד מהמודלים אינו נתיב ב-OrcaRouter. הקטלוג שלנו מחזיר 404 עבור cloudflare/clef ועבור צ'ק-פוינט 12B באותה משפחה, ושום דבר בכתוב הזה לא צריך להיקרא כהצהרת זמינות מצדנו. מה שכן יש לנו ממשפחת Gemma הם שני הגדלים הגדולים יותר, והמחירים שלהם מופיעים בהמשך.

רשימת האפשרויות היא ממשק, ויש לה מצב כשל.
ההבדל המבני בין שני אלה הוא מה שקורה לקלט שאינו מתאים.
• פלט — Clef מחזיר הסתברות לכל אפשרות מוצהרת, ורק לאותן אפשרויות. Gemma 4 12B מחזיר טקסט שנוצר.
• סירוב — ל-Clef אין "אף אחד מהאפשרויות לעיל" אלא אם כן תכתוב אחת כזו לתוך הקריטריונים בעצמך. Gemma 4 12B יכולה לתאר מקרה שלא מתאים לשום דבר ששאלת עליו.
• מצב כשל — השגיאה של Clef שקטה: בחירה בטוחה בתוך הסכמה שלך, בלי חריגה שנזרקת, בלי הפעלה של ענף גיבוי. השגיאה של הג'נרליסט לרוב רועשת: פרוזה שאינה ניתנת לפרסור.
• יכולת בדיקה — סט אפשרויות קבוע הופך את הרכיב לניתן לשחזור וזול לביקורת. טקסט חופשי הופך אותו לגמיש ויקר לאימות.
המספרים של Clef עצמה עבור בעיית הסירוב ההיא הם הנתונים החלשים ביותר שהיא מפרסמת. ב-CLINC150 עם טיפול מחוץ-לתחום — זיהוי כוונות שבו תשובה תקפה אחת היא "זה לא שייך לשום קטגוריה" — ה-27B משיג 97.4 macro-F1, שזה הציון הטוב ביותר בטבלה של Cloudflare והסיבה להעדיף את ה-27B על אחיו ה-9B, שמשיג 66.8 באותו מבחן. פער של שלושים נקודות בין שני מודלים שנבנו מאותו מתכון אומר שהתנהגות מחוץ-לתחום היא מה שקנה המידה של הפוסט-אימון מקנה, וזה הדבר שרוב צינורות הניתוב תלויים בו בשקט. ההקלה ש-Cloudflare מתעדת היא שאלה שנייה בסכימה — להוסיף שדה noul ששואל אם המצב מתאים בכלל, ואז להחיל עליו סף — מה שעובד, ומה שזו העבודה שלך ולא של המודל.
מאיפה המספרים מגיעים חשוב יותר ממה שהם אומרים
כל נתון של Clef במאמר הזה מגיע מ-Cloudflare: כרטיס המודל שלה, פוסט ההשקה שלה, או הרצת ה-Decision Index שלה. החבילה עצמה היא של Cloudflare, ולוח התוצאות שמארח את הציונים הוא של Cloudflare. זהו ספק שמודד את המוצר שלו על חומרה שהוא שולט בה מול מתחרה ש-Cloudflare משקפת את ה-API שלו בכוונה. אף צד שלישי לא שחזר דבר מזה, והמאמר הזה לא מתכוון להעמיד פנים אחרת.
העמודה של Gemma 4 12B היא סוג אחר של ראיות. הכרטיס של הספק עצמו מפרסם MMLU Pro 77.2%, GPQA Diamond 78.8%, AIME 2026 ללא כלים ב-77.5% ו-LiveCodeBench v6 ב-72.0%. Artificial Analysis, כלי מעקב בלתי תלוי, מדרג את תצורת ההסקה בציון Intelligence Index של 14.18 עם תעריף רשום של $0.10 / $0.30 למיליון טוקנים ומהירות פלט חציונית מדודה של כ-113 טוקנים לשנייה — והדף שלה עצמו מציין שהנתונים הללו תלויים בעומס העבודה ובחומרה.
הקריאה הישרה היא ששתי העמודות אינן ברות השוואה כלל. האחת היא חבילת איכות-החלטות של ספק, המופעלת על ידי הספק; האחרת היא שילוב של בנצ'מרקים של ספקים והערכה בלתי תלויה של מודל כללי. לצטט 97.4 לצד 77.2 כאילו היו עמודות באותה טבלה יהיה הדבר המטעה ביותר שהעמוד הזה יכול לעשות.
השהיה היא המקום היחיד שבו אפשר לפחות לדון בשניים באותן יחידות, וגם שם ההסתייגויות מצטברות. Cloudflare מדווחת על Clef בחציון של 209.3 ms וב-p95 של 238.6 ms, כפי שנמדד בתשתית שלה. Artificial Analysis מודדת את הזמן של ה-12B עד לצ'אנק הראשון בכ-2.4 שניות בתצורת reasoning שכוללת תקציב חשיבה שאין למודל ההחלטה. מעבר לא-אוטורגרסיבי של 209 ms לעומת תחילת יצירה של 2.4 שניות הוא הבדל ארכיטקטוני אמיתי — מעבר קדימה אחד לעומת לולאת פענוח — וזה הטיעון החזק ביותר שיש ל-Clef בעד נתיב חם. כמו כן, בגודל 27B, זהו מודל שזקוק לחומרה בדרגת H200 כדי להגיע לנתון הזה, ו-Cloudflare גובה $0.24 לכל מיליון טוקני קלט כדי להריץ אותו עבורך.

מה 64K של קונטקסט באמת נותן לך
ההקשר הוא המקום שבו ההשוואה הופכת למעשית, ושם הגנרליסט מנצח על הנייר בפער ניכר.
• Clef — 65,536 אסימונים, לפי עמוד המודל של Workers AI ופוסט ההשקה; עוזר הקידוד המצורף מוגדר כברירת מחדל ל-max_length=16,384, שזו ברירת מחדל ולא תקרה, אך זו ברירת המחדל שתקבלו אם תשתמשו בטוען כפי שהוא מסופק.
• Gemma 4 12B — 256,000 אסימונים, לפי כרטיס הספק, עם קשב בחלון מחליק של 1,024 אסימונים כדי לשמור על עלות ההקשר הארוך נמוכה.
• תמונות — Clef מנקדת תמונות ופריימים של וידאו במשותף עם מצב הטקסט דרך מקודד הראייה המורש. Gemma 4 12B קולט טקסט, תמונה, וידאו ואודיו דרך הנתיב נטול-המקודד שלו.
• שפות — הכרטיס של Clef אינו טוען ליכולת רב-לשונית; Gemma 4 12B מתועדת ביותר מ-140 שפות.
עבור פנייה, חשבונית או צילום מסך מרונדר, 64K הוא נדיב וההבדל הוא עיוני. עבור חוזה בן 200 עמודים שאתה רוצה לסווג שדה אחר שדה, זה כל הטיעון: המודל הכללי יכול להחזיק את המסמך, ומודל ההחלטות לא. התשובה של Clef לכך היא פיצול למקטעים (chunking), ופיצול מסמך לפני שאתה מחליט לגביו משמעו שכבר קיבלת החלטה שהמודל היה אמור לקבל. זו מגבלה אמיתית, וראוי להציג אותה ככזו.
מה שהיית משלם בפועל, ואיפה
אף אחד מהדגמים אינו בקטלוג שלנו, ולכן שאלת המחיר מתפצלת לשלושה כיוונים.
• Clef — 0.24 דולר למיליון טוקני קלט ב-Workers AI של Cloudflare, או באירוח עצמי ממשקולות Apache-2.0; זמן התגובה שפרסמה Cloudflare נמדד על H200 בודד עם torch 2.11 ו-transformers 5.10.2, והכימותים הקהילתיים שהופיעו בתוך יומיים מרמזים שניתן לדחוס אותו עוד יותר, במחיר של פגיעה בדיוק שאיש לא מדד.
• Gemma 4 12B — אין כאן מסלול מתארח בכלל. אתה מוריד כ-24 GB של משקולות BF16 ומגיש אותן בעצמך, או פונה לפלטפורמה של צד שלישי. לא קיים מחיר לכל טוקן שנוכל להציג.
• התחליף המנותב — Gemma 4 26B A4B, תערובת מומחים עם 25.2B פרמטרים בסך הכול ו-3.8B פרמטרים פעילים, מוצע ב-OrcaRouter במחיר $0.06 למיליון אסימוני קלט ו-$0.33 למיליון אסימוני פלט, עם חלון הקשר של 262,144 אסימונים. Gemma 4 31B, האח הדחוס הרב-מודאלי עם חשיבה ניתנת להגדרה וקריאה ילידית לפונקציות, מוצע ב-$0.13 וב-$0.38. שניהם על מפתח אחד עם מחיר מחירון של הספק מועבר כפי שהוא ללא תוספת מחיר לכל אסימון ומעבר אוטומטי בין ספקים בעת כשל.
השורה האחרונה היא הגרסה הכנה של המעורבות שלנו בהשוואה הזו. אם מה שאתם צריכים הוא מודל כללי שקורא מסמך ארוך וכותב משפט, הנתיב הזול להשגת אחד כזה הוא גודל של Gemma 4 שאנחנו באמת מגישים, והוא עולה פחות למיליון טוקנים מאשר אירוח עצמי של מודל 12B על GPUs שכורים. אם מה שאתם צריכים הוא החלטה תחומה בנתיב החם, החציון של 209 מ״ש של Clef הוא תכונה ארכיטקטונית אמיתית, והדבר הקרוב ביותר אליו בקטלוג שלנו הוא Jev 1.13 של TypeSafe — המודל ש-Cloudflare בחנה מולו והעתיקה ממנו את פורמט החוטים — במחיר של $0.042 למיליון טוקני קלט על פני הקשר של 65,536 טוקנים, מוגש דרך אותו POST /v1/systemone מבנה. מכיוון ששניהם תואמי API מאחורי מתאם דק, לנסות את Clef מול הפתרון הקיים הוא ניסוי ולא מיגרציה, והניסוי נשאר זול כששני הצדדים נגישים דרך נקודת קצה אחת.

ההחלטה, כפי שהוצהרה כהחלטה
בחר ב-Clef כאשר התשובות ניתנות למנייה, המצב נכנס ל-64K, ההחלטה נמצאת בנתיב רגיש להשהיה, ואתה מוכן לקחת בעלות על המחלקה השיורית בעצמך. ה-97.4 של ה-27B בזיהוי כוונות מחוץ לתחום הוא הסיבה שתשלם עבורו על פני ה-9B האח, וצורת הפלט הקבועה שלו היא מה שהופך את הרכיב לניתן לביקורת ללא מנתח.
בחר את Gemma 4 12B כאשר הקלט ארוך, כאשר המודאליות היא אודיו או וידאו, כאשר התשובה צריכה להיות בפרוזה, או כאשר הקטגוריות עדיין לא ידועות — כי "מיין את הערימה הזו לקבוצות הגיוניות כלשהן" היא בקשה שמודל קבלת החלטות לא יכול לקבל, לא בקשה שהוא מטפל בה רע. הוא ג'נרליסט עם הערכה עצמאית מאחוריו, ולעבודה פתוחה זה שווה יותר מטבלת ספק.
והיו סקפטיים לגבי שני מערכי המספרים גם יחד, מהסיבה שהמאמר הזה חוזר עליה שוב ושוב: Cloudflare לא שוחזרה באופן עצמאי על שום דבר, והכרטיס הזה הוא טבלת הבנצ'מרק של הספק עצמו. המספר האחד שבאמת מעניין מבין השניים — האם ראש סכימה של 27B אכן מחזיק בציון 97.4 מחוץ לתחום על נתונים שהוא לא אומן כנגדם — הוא בדיוק המספר שאף אחד מהספקים לא יכול להכריע בו, וצד שלישי יכול.
