Moonshot Kimi K2 (0905 baseline) — 1T-param MoE מודל צ'אט עם 32B פעילים במעבר, 256k קונטקסט, ביצועים מאוזנים.
Kimi K2.5 הוא מודל שפה מולטימודאלי שנוצר על ידי הספק Kimi. הוא מקבל קלטי טקסט ותמונה כאחד ומיועד לטפל במשימות ארוכות-הקשר עם חלון הקשר של 262,144 טוקנים. המודל יכול לייצר עד 32,768 טוקנים בתגובה אחת.…
Kimi K2.5 מצטיין בהבנת הקשר ארוך עם חלון של 262K טוקנים. הוא יכול לעבד מסמכים שלמים במעבר אחד, מה שמאפשר משימות כמו סיכום, מענה על שאלות וחילוץ מידע מטקסטים ארוכים. יכולת קלט התמונה מאפשרת חשיבה רב-מודאלית – למשל, תיאור תרשים, קריאת טקסט מתמונה או שילוב נתונים חזותיים וטקסטואליים כדי לענות על שאלות מורכבות. הציון הגבוה ב-τ²-Bench (95.9) מצביע על ביצועים חזקים במשימות שימוש בכלים והיגיון רב-שלבי, כגון קריאה ל-API, ביצוע חישובים או גלישה בנתונים.
עליך לבחור ב-Kimi K2.5 כאשר המשימה שלך דורשת חלון הקשר גדול (מעל 32K טוקנים) או כאשר עליך לעבד תמונות. אם המשימה שלך מבוססת טקסט בלבד ומתאימה לחלון של 4K עד 32K טוקנים, ייתכן שמודל קטן יותר יהיה חסכוני יותר. החוזק של Kimi K2.5 בהיגיון של שימוש בכלים (כפי שמעיד ציון ה-τ²-Bench שלו) הופך אותו למתאים היטב לעבודות סוכן שבהן המודל חייב לקרוא לכלים חיצוניים, לטפל באינטראקציות מרובות-סיבובים, או לעקוב אחר הוראות מורכבות. עבור יצירת טקסט פשוטה או סיווג, מודל זול יותר עשוי להספיק.
המשימות שמרוויחות ביותר כוללות: ניתוח מסמכים ארוכים (למשל, סקירת חוזים, סיכום מאמרים אקדמיים), חשיבה רב-מודאלית (למשל, כתיבת כיתובים לתמונות, מענה חזותי לשאלות), זרימות עבודה אוטונומיות (למשל, אוטומציית אינטרנט, יצירת קוד עם מספר צעדים), ומשימות הדורשות הקשר עקבי לאורך הרבה תורים (למשל, צ'אטבוטים לתמיכת לקוחות המטפלים בהיסטוריות נרחבות). השילוב של הקשר גדול וקלט תמונה הופך אותה לשימושית במיוחד בתחומים כמו בריאות (ניתוח דוחות ותמונות), משפטים (סקירת מסמכים), ומחקר (עיבוד תרשימים ופרסומים).
מגבלות ספציפיות אינן מסופקות, אך כמודל גדול, ייתכן שיש לו זמן השהייה גבוה יותר בהשוואה למודלים קטנים יותר. התמחור לכל טוקן גבוה יותר מכמה חלופות קומפקטיות, כך שהוא עשוי לא להיות חסכוני עבור הנחיות קצרות מאוד. עיבוד קלט תמונה עשוי לצרוך טוקנים רבים, ולהעלות את העלות. הביצועים של המודל במשימות שאינן מכוסות על ידי מדד ה-τ²-Bench אינם מאומתים. על המשתמשים לבדוק על נתונים משלהם כדי לאשר התאמה. הגישה למודל היא דרך OrcaRouter, המוסיף שכבת API סטנדרטית אך ללא תוספת מחיר על תמחור הספק.
τ²-Bench הוא מדד שנועד להעריך סוכני בינה מלאכותית במשימות חשיבה מעשיות הכרוכות בשימוש בכלים. הוא בודק את יכולת המודל להבין הוראות, לתכנן צעדים, להשתמש בכלים חיצוניים (למשל, מחשבונים, מנועי חיפוש) ולהפיק תוצאות נכונות. ציון של 95.9 מצביע על כך ש-Kimi K2.5 מבצעת בצורה חזקה מאוד במשימות חשיבה מעשיות אלו. עם זאת, מספר יחיד זה אינו לוכד ביצועים בממדים אחרים כמו יצירתיות, דיוק עובדתי או תמיכה רב-לשונית. המדד מספק התייחסות שימושית להשוואת מודלים המותאמים לתהליכי עבודה של סוכנים.
הנתון היחיד שפורסם באופן ציבורי עבור Kimi K2.5 הוא ציון τ²-Bench של 95.9. אין נתוני מדדי ביצועים נוספים (כגון MMLU, HumanEval) בעובדות המקור. לפיכך, לא ניתן לבצע השוואות ישירות באמצעות נתונים אלה בלבד. באופן כללי, ציון גבוה ב‑τ²-Bench מרמז כי Kimi K2.5 תחרותי מול מודלים אחרים המיועדים לשימוש בכלים ומשימות היסק רב‑שלבי. על המשתמשים לבצע הערכות משלהם על מקרי שימוש ספציפיים כדי לקבוע אם המודל עומד בדרישות הביצועים שלהם. OrcaRouter מספקת גישה למודל זה ללא תוספת מחיר.
לא מסופקים נתוני השהייה או אסימונים לשנייה ספציפיים עבור Kimi K2.5. כמודל גדול עם חלון הקשר של 262K אסימונים, זמן ההסקה יהיה בדרך כלל ארוך יותר מאשר עבור מודלים קטנים יותר, במיוחד עבור הנחיות ארוכות או ספירות תפוקה גבוהות של אסימונים. ההשהייה תלויה גם בחומרה שבה משתמש הספק (Kimi) ובעומס הנוכחי על ה-API של OrcaRouter. עבור יישומים בזמן אמת, משתמשים צריכים לבדוק את המודל עם גדלי ההנחיות האופייניים להם כדי לקבוע זמני תגובה מקובלים. התמחור הוא לפי אסימון, לא לפי בקשה, כך שלא חלות חיובים נוספים על מהירות.
Kimi K2.5 מתומחר ב-$0.60 לכל 1 מיליון אסימוני קלט ו-$3.00 לכל 1 מיליון אסימוני פלט. תעריפים אלה מחויבים לפי תעריף הספק ללא תוספת מחיר, כלומר OrcaRouter מעביר את העלות המדויקת מ-Kimi. אין עמלות נוספות או תמחור מדורג. אסימוני קלט כוללים גם אסימוני טקסט וגם אסימוני תמונה. אסימוני פלט הם התגובה שנוצרה. התמחור הוא לכל אסימון, כך שהעלות הכוללת תלויה באורך ההנחיה והתגובה. אין חיוב נפרד לעיבוד תמונה מעבר לספירת האסימונים.
העובדות שסופקו אינן מזכירות מנגנוני אחסון במטמון או הנחות תמחור מיוחדות עבור Kimi K2.5. ה-API הסטנדרטי של OrcaRouter אינו כולל אחסון אוטומטי של הנחיות במטמון בשלב זה. משתמשים יכולים לייעל עלויות על ידי ניהול קפדני של אורך ההנחיה והפחתת אסימונים מיותרים. עבור משימות חוזרות, צירוף שאילתות מרובות לבקשה אחת עשוי להפחית את סך השימוש באסימונים. מכיוון שאין תוספת מחיר על תמחור הספק, עלות המודל קשורה ישירות לצריכת אסימונים. שקלו להשתמש במודל קטן יותר עבור משימות המתאימות להקשר קצר יותר כדי לחסוך כסף.
האיזון העיקרי הוא בין ביצועים לעלות. מחיר התגמול לפלט של Kimi K2.5 (3.00$/1M) גבוה מזה של דגמים קטנים רבים. עבור משימות הדורשות פלטים ארוכים (למשל, יצירת מסמכים מלאים), עלויות יכולות להצטבר במהירות. עם זאת, חלון ההקשר הגדול עשוי להפחית את הצורך בקריאות API מרובות לטיפול בקלטים ארוכים, ובכך לחסוך בהוצאות הכוללות. יכולת קלט התמונות מוסיפה צריכת אסימונים אך עשויה לבטל את הצורך בצינורות עיבוד תמונה נפרדים. על המשתמשים להעריך את נפחי האסימונים הצפויים ולהשוות עם חלופות באמצעות OrcaRouter כדי למצוא את ההתאמה הטובה ביותר.
ניתן לגשת ל-Kimi K2.5 דרך ה-API התואם ל-OpenAI של OrcaRouter. כתובת ה-URL הבסיסית היא https://api.orcarouter.ai/v1. עליך להשתמש במזהה המודל 'kimi/kimi-k2.5' בבקשותיך. האימות מתבצע באמצעות מפתח API שהתקבל מ-OrcaRouter. ה-API תומך באותם endpoints כמו ה-API של Chat Completions של OpenAI, כולל chat completions וסטרימינג. דוגמה: שלח POST ל-/chat/completions עם model: 'kimi/kimi-k2.5', מערך messages (תוכן יכול לכלול טקסט וכתובות URL של תמונות), ופרמטרים אופציונליים כמו temperature, max_tokens (עד 32768), ו-stream.
המודל תומך בפרמטרים הסטנדרטיים מ-OpenAI Chat API: 'model', 'messages' (מערך עם role ו-content), 'max_tokens' (ברירת מחדל משתנה, מקסימום 32768), 'temperature' (ברירת מחדל 0.7), 'top_p', 'stop', 'stream' (בוליאני), ו-'frequency_penalty' ו-'presence_penalty'. קלט תמונה מטופל באמצעות חלקי תוכן מסוג 'image_url' בהודעת המשתמש. המודל מכבד את מגבלת ההקשר של 262144 טוקנים, ולכן prompt+max_tokens לא יעלה על זה. כל פרמטרי OpenAI האחרים עשויים להתקבל אך השפעתם תלויה במודל Kimi הבסיסי.
ההגירה היא פשוטה מכיוון שה-API של OrcaRouter תואם ל-OpenAI. פשוט שנה את כתובת ה-URL הבסיסית ל-https://api.orcarouter.ai/v1, את מפתח ה-API שלך למפתח OrcaRouter, ועדכן את שם המודל ל-'kimi/kimi-k2.5'. אם הקוד הקיים שלך משתמש בספריית openai של Python, תוכל להגדיר openai.api_base ו-openai.api_key. עבור השלמות צ'אט, פורמט ההודעה נשאר זהה; אם השתמשת בעבר בקלטי תמונה עם GPT-4V, פורמט החלק 'image_url' זהה. כוונן את max_tokens אם הוא חורג מ-32768. אין צורך בשינויים אחרים עבור פונקציונליות בסיסית.
בהתבסס על העובדות שסופקו, Kimi K2.5 מציעה חלון הקשר של 262,144 טוקנים, הגדול יותר ממודלים טיפוסיים כמו GPT-4 (32K) אך דומה למודלים אחרים עם הקשר ארוך כמו Gemini 1.5 Pro (מגבלה של 1M) או Claude 3.5 Sonnet (200K). התמחור שלה ב-$0.60/$3.00 לכל 1M טוקנים הוא תחרותי, וה-zero markup מ-OrcaRouter שומר על עלויות צפויות. ציון τ²-Bench של 95.9 מצביע על חשיבה חזקה בשימוש בכלים, אך ללא מדדי ביצועים נוספים, השוואת ביצועים מלאה אינה אפשרית. על המשתמשים להעריך על המשימות שלהם.
מודלים קטנים יותר ב-OrcaRouter (לדוגמה, gpt-4o-mini או מודלים קומפקטיים אחרים) בדרך כלל בעלי עלות נמוכה יותר לטוקן, זמן השהיה מהיר יותר, וחלונות הקשר קצרים יותר. הם מתאימים למשימות פשוטות, סיווג, או שאילתות קצרות. Kimi K2.5, עם הקשר של 262K ותמיכה בתמונות, טוב יותר עבור הנמקה מורכבת, מסמכים ארוכים, וקלטים רב-מודליים. הפשרה היא עלות גבוהה יותר לטוקן וזמני תגובה איטיים יותר פוטנציאליים. אם המשימה שלך אינה דורשת הקשר גדול או יכולות רב-מודליות, מודל זול יותר יהיה יעיל יותר. OrcaRouter מקל על מעבר בין מודלים עבור מקרי שימוש שונים.
Kimi K2.5 מתאים לייצור אם היכולות שלו תואמות את הדרישות שלך. המודל נגיש דרך OrcaRouter, המספק תשתית API אמינה ותאימות סטנדרטית ל-OpenAI. התמחור במחיר הספק ללא תוספת סימון הוא שקוף. עם זאת, כמו בכל מודל של צד שלישי, כדאי לבדוק עקביות, חביון וטיפול בשגיאות תחת עומס. ציון τ²-Bench מצביע על ביצועים חזקים בתרחישי שימוש בכלים, אך מוכנות לייצור תלויה גם בגורמים כמו זמינות, מגבלות קצב ותמיכה מ-OrcaRouter. צור קשר עם OrcaRouter לקבלת פרטי SLA וזמינות ספציפיים.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k2.5",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_completion_tokensmax_tokensnpresence_penaltyprompt_cache_keyreasoningresponse_formatsafety_identifierstopstreamstream_optionstemperaturethinkingtoolstop_p| קלט / 1M טוקנים | $0.600 |
| פלט / 1M tokens | $3.00 |
| קריאת מטמון / 1M | $0.100 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
על מה מפתחים מדברים השבוע
@misc{orcarouter_kimi_k2_5,
title = {kimi/kimi-k2.5 API},
author = {kimi},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k2.5}
}kimi. (n.d.). kimi/kimi-k2.5 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k2.5