כרטיס כותרת שנוצר שכותרתו "Unbiased's Pareto 26.10 Preview" עם כותרת המשנה "החלפת הקשר של 1M מאחורי אותה מחרוזת מודל", מעל שלושה כרטיסים שעליהם כתוב "שוחרר: 1 באוקטובר 2026", "הקשר: 1,048,576 אסימונים" ו"מחיר מנותב: $0.80 / $3.20 ל-1M", עם כותרת תחתונה שעליה כתוב "בנצ'מרקים ראשוניים בהרצת הספק; לא פורסמו ציונים עצמאיים נכון ל-1 באוקטובר 2026."
Guides & Insights

התצוגה המקדימה של Pareto 26.10 מבית Unbiased: החלפת חלון הקשר של 1M מאחורי אותה מחרוזת מודל

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

האינטגרציה לא משתנה. המודל שמאחוריה כן. ב-1 באוקטובר 2026, Unbiased העבירה את מחרוזת המודל שלה — pareto — אל Pareto 26.10 Preview, מהדורה חדשה עם חלון הקשר גדול פי ארבעה, מחיר נמוך יותר בקטלוג המנותב, וגיליון בנצ'מרק שלפי הודאת הספק עצמו הוא ראשוני וטרם פורסם בצורתו הסופית. אם אתם קוראים ל-Pareto היום בשמו, אתם קוראים ל-26.10 Preview, ויומן השינויים של הספק אומר זאת במילים הפשוטות ביותר: "Pareto 26.10 Preview הוא כעת מהדורת Pareto הנוכחית… מחרוזת המודל נשארת pareto."

השורה הבודדת הזו היא כל הסיפור עבור כל מי שיש לו Pareto בסטאק. זה לא מוצר שני שהושק לצד הראשון. זה המוצר הראשון, שהוחלף במקומו, תחת שם שלא השתנה — מה שאומר שהגרסה שתקבלו נקבעת לפי לוח השחרורים, ולא לפי שום דבר בבקשה שלכם.

מה בעצם השתנה ב-1 באוקטובר

ארבעה דברים זזו, והם לא כולם מצביעים לאותו כיוון.

• חלון הקשר — 262,144 טוקנים במהדורת Pareto מספטמבר, כעת 1,048,576. התיעוד של Unbiased עצמו אינו מציין את הנתון; המספר מגיע מהמפרט הטכני הפומבי של המודל, שבו הוא המגבלה לכל בקשה, בלי שמוצעת מדרגה קטנה יותר.
• מחיר, לפי הניתוב — הצמד הנפוץ בציטוטים עבור Pareto הוא 2.50 דולר למיליון טוקני קלט ו-7.50 דולר למיליון טוקני פלט, עם קלט במטמון ב-0.25 דולר. הרשומה של 26.10 Preview מציגה 0.80, 3.20 ו-0.03 דולר בהתאמה — בערך שליש מתעריף הקלט ומעט יותר מ-40% מתעריף הפלט.
• ציוני בנצ'מרק — מפורסמים לראשונה עבור מהדורה זו, ומסומנים כמקדמיים לפי התווית של הספק עצמו.
• האפשרות היציבה — 26.10 Preview הוא גרסת תצוגה מקדימה. טקסט הקטלוג של Unbiased אומר שהוא "עשוי להשתנות ללא הודעה מוקדמת" ומפנה את מי שזקוק להתנהגות צפויה אל המהדורה הקודמת במקום.

כל השאר נשאר כשהיה. הפלט המקסימלי הוא עדיין 131,072 טוקנים. הקלט הוא עדיין טקסט ותמונה; הפלט הוא עדיין טקסט בלבד. עדיין אין מזהה Hugging Face ברשומה, כך שהמשקולות נשארות סגורות. ויש עדיין בדיוק ספק שירות אחד — Unbiased עצמו — ללא מארח שני בתוך הרשומה.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

המחיר הוא החלק ששווה לקרוא פעמיים

בפלטפורמה של Unbiased עצמה, לוח התעריפים לא זז. גם כרטיס המודל וגם עמוד התמחור עדיין מציגים $2.50 למיליון קלט, $0.25 במטמון, $7.50 פלט — אותם שלושה מספרים שנשאה מהדורת ספטמבר — ומכיוון שמחרוזת המודל נשארה pareto, לקוח ב-API של הספק משלם את התעריפים האלה עבור 26.10 Preview. המספרים הנמוכים יותר הם אלה שברשומת הקטלוג המנותב, והפער בין השניים הוא בדיוק מהסוג שמכריע הגירה.

שתי פרשנויות אפשריות, והספק לא אמר איזו מהן נכונה. או ש-26.10 Preview מוצע במחיר זול יותר דרך אותו נתיב כמהלך היכרות, או שהרשומה מייצגת הסדר מסחרי שונה מזה של הפלטפורמה הישירה. Unbiased אינה מפרסמת תאריך סיום למבצע, ומחיר שנקבע ביום ההשקה אינו התחייבות.

זה החלק היחיד בסיפור שנתב משנה את צורתו. OrcaRouter מעביר את מחיר המחירון של הספק ישירות הלאה עם 0% תוספת, כך שהורדת מחיר מצד ספק נכנסת לתוקף אצלנו באותו יום שבו היא נוחתת, ולא לפי מחזור של חוזה — ומעבר אוטומטי לגיבוי פירושו שאפשר להחליף גרסת תצוגה מקדימה שמתנהגת אחרת בשבוע הבא בלי שינוי בקוד. אנחנו לא מציעים את Pareto 26.10 Preview של Unbiased, אז הגרסה הכנה היא זו: אם אתם רוצים את הדגם הספציפי הזה, קראו לו דרך ה-API של Unbiased עצמה. הנקודה היא רק שבגרסת תצוגה מקדימה, גם המחיר וגם הגרסה הם משתנים, ואף אחד מהם לא צריך להיות מקובע בקוד.

גיליון הבנצ'מרק, עם התוויות שהוא הגיע איתן

Unbiased פרסמה ארבעה ציונים עבור 26.10 Preview, כל אחד מהם מלווה בעלות מדודה לכל משימה, וכל אחד מהם נושא הסתייגות שהספק עצמו כתב. יש לקרוא אותם ככאלה שנערכו על ידי הספק ולא שוחזרו, כי זה מה שהם:

• DeepSWE v1.1 (קידוד סוכני) — 69.9%, במחיר $0.24 למשימה
• Terminal-Bench 4.0 (שימוש סוכני במסוף) — 50.8%, במחיר $0.48 למשימה
• Humanity's Last Exam, טקסט בלבד (הסקה מומחית) — 49.9%, במחיר $0.008 למשימה
• GPQA-Diamond (הסקה מדעית) — 92.4%, במחיר $0.004 למשימה

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

המסגור של הספק הוא ש-26.10 Preview "משתווה לחזית פארטו או קובע אותה בכל ארבעת הבנצ'מרקים". הגיליון שהיא מפרסמת לצד הטענה הזו מפורט יותר, ולזכותה של Unbiased ייאמר שהוא מתפרסם בכלל: ב-Terminal-Bench 4.0, ‏GPT 6 Astra רשום ב-58 ו-Fable 5.1 ב-56, שניהם מעל 50.8 של פארטו, והקטע של הספק עצמו, "היכן שמודלים אחרים משיגים ציון גבוה יותר", אומר זאת במפורש. ב-DeepSWE v1.1 הגרסה יושבת באשכול — ‏GLM-5.3 ו-Kimi K3 רשומים כל אחד ב-69.0 לעומת 69.9 של פארטו — שזה תיקו למעשה, ובתוך שולי השגיאה שכל ריצה בודדת נושאת, יהיו אשר יהיו.

מספרי ההשוואה טומנים בחובם הסתייגות שנייה שחשובה יותר מהראשונה: הם הועתקו מהשוואה מ-21 בספטמבר, ובלשון הספק, הם "לא אומתו באופן עצמאי", והם הופקו בהערכה נפרדת של מודלים בודדים — ולכן אין לצמד אותם לנתוני העלות למשימה של Pareto כאילו שניהם באו מאותו מבחן. הספק אומר זאת בפרטי ההערכה. קורא שידלג על השורה הזו יפריז במשמעות התרשים.

מה שכל זה אינו: עצמאי. ל-Artificial Analysis, הלוח שרוב הצוותים בודקים לפני שהם נותנים אמון בשם חדש במחירון, אין בכלל עמוד עבור Pareto. כל מספר לעיל הופק על ידי החברה שמוכרת את המודל. הדבר היחיד שמרכך זאת הוא שמערכת ההערכה פתוחה לציבור — הספק מפרסם חבילת השוואה ראש בראש ניתנת לשחזור שכל אחד יכול להפנות לנקודת קצה — מה שהופך את "סמכו על הציון שלנו" ל"הריצו מחדש את הציון שלנו". זו הצעה אמיתית וזה לא אותו דבר כמו מספר מאומת. איש עדיין לא פרסם את ההרצה החוזרת.

מה המשמעות של "preview" בחוזה?

המילה הזו עושה כאן יותר עבודה מאשר הערות השחרור. התיעוד של Unbiased עצמו מתאר את הגישה הנוכחית כגישת הערכה לפי התנאים שלו, וקובע ששימוש מסחרי או בייצור מחייב הסכם כתוב נפרד. חשבונות חדשים נבדקים ידנית לפני שמנפיקים מפתח API. ה-API תואם ל-OpenAI ול-Anthropic — כתובת בסיס, מפתח, מחרוזת מודל, ללא שכתוב — אבל המשטח המתועד הוא chat completions ו-messages בלבד, עם פערים ידועים שהספק מפרט בגלוי: GET /v1/models אינו מיושם, ומזהי מודלים לא מוכרים אינם נדחים, ולכן הקוראים חייבים לשלוח pareto במפורש במקום לגלות מה זמין.

שימו את תווית ה-preview ואת חוזה הבטא הפרטית יחד, ועצת התפעול נכתבת מעצמה. זהו מודל שיש להעריך מול עומס העבודה שלכם מאחורי שכבת ניתוב, ולא כזה שמעמידים מול תעבורת הכנסות ושוכחים ממנו. המנגנון לכך אינו זוהר: שרשרת fallback שמוגדרת פעם אחת, כך שגרסה שמשתנה לכם מתחת לרגליים באמצע השבוע הופכת לשינוי קונפיגורציה ולא לתקרית. Unbiased הקדישה את ספטמבר לתיקון בדיוק של סוג הבעיה הזה בצד שלה — רשומת יומן שינויים מ-16 בספטמבר מתעדת שכ-13% מהבקשות הארוכות שאינן סטרימינג נתקלו ב-timeout של 120 שניות, ותקרת ה-gateway הועלתה ל-300 שניות. זהו ספק שמדבר בכנות על קצה מחוספס. זו גם תזכורת שהפרופיל התפעולי של preview עדיין נכתב.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

למה לשים לב לפני שמתחייבים

שלושה דברים ספציפיים יכריעו את השאלות הפתוחות, וכל אחד מהם בר-בדיקה.

הראשון הוא ציון עצמאי. עד שצד שלישי יריץ את 26.10 Preview על הרנס שפורסם, ה-92.4 ב-GPQA-Diamond וה-50.8 ב-Terminal-Bench הם טענות ספק על עבודת ספק — טובות מספיק כדי להחליט אם לבדוק, לא טובות מספיק כדי להחליט אם לבצע מיגרציה.

השני הוא מה שהתצוגה המקדימה עושה למחיר. אם הרשומה המנותבת נשארת על $0.80 ו-$3.20 בעוד שהפלטפורמה של המוכר עצמו מחזיקה ב-$2.50 ו-$7.50, ההבדל הוא החלטת ערוץ שכדאי להבין לפני שאתם בונים מודל עלויות על אחד מהמספרים.

השלישי הוא מה שמסתבר ש"עשוי להשתנות ללא הודעה מוקדמת" אומר בפועל. תצוגה מקדימה שמתוקנת פעמיים בחודש היא כלי שונה מתצוגה שמוקפאת ומקבלת שם חדש בסוף הרבעון, ויומן השינויים הוא המקום שבו זה יופיע לראשונה.

שום דבר מזה אינו טיעון נגד לנסות אותו. מודל מולטימודלי בן מיליון טוקנים שמדווח על ציונים בסמוך לחזית ב־0.24 דולר למשימה שווה אחר צהריים של עבודה אמיתית על הפרומפטים שלך, וההערכה הזו עולה פחות מהוויכוח עליה. הוא מהווה טיעון נגד ההנחה שהמודל שאתה מריץ עליו בנצ'מרק השבוע הוא המודל שיהיה לך בשבוע הבא — וזו, עבור גרסה שהספק עצמו מכנה תצוגה מקדימה, היא ההנחה היחידה שצריכה להיות נכונה.

גרסת תצוגה מקדימה היא בדיוק המקרה שעבורו נבנה failover אוטומטי: failover אוטומטיהופך מודל שמשתנה לכם מתחת לרגליים באמצע השבוע לשינוי בקונפיגורציה במקום להשבתה.