של OpenAI gpt-3.5-turbo-1106 דרך OrcaRouter: 16K קונטקסט, 46.2 MMLU-Pro, $1/$2 ל-1M טוקנים, תמחור ללא תוספת.
gpt-3.5-turbo-1106 הוא תמונת מצב ספציפית של מודל GPT-3.5 Turbo של OpenAI, שהופץ בנובמבר 2023. זהו מודל טקסט בלבד, כלומר הוא מקבל ומייצר רק טקסטים כקלט ופלט, ולא תמונות או אודיו. יש לו חלון הקשר של…
המודל הזה מצטיין במשימות יצירת טקסט לשימוש כללי: מענה על שאלות, ניהול דיאלוג, סיכום מסמכים, תרגום טקסט, יצירת כתיבה יצירתית ומתן הסברים. הוא תומך בקריאה לפונקציות, מה שמאפשר לו להפיק נתונים מובנים ולתקשר עם כלים חיצוניים או APIs על בסיס סכמות פונקציות שסופקו. הוא יכול גם להתמודד עם שיחות מרובות-סיבובים עם חלון הקשר של עד 16K טוקנים. לגבי משימות הדורשות דיוק גבוה בשאלות עובדתיות, יצירת קוד או חשיבה מובנית, הוא מבצע היטב אך לעיתים עשוי להפיק פלטים פחות מדויקים ממודלים גדולים יותר.
קריאה לפונקציות ב-gpt-3.5-turbo-1106 מאפשרת למודל ליצור פלטי JSON מובנים בהתבסס על הגדרות פונקציות שאתה מספק בבקשה. כאשר אתה כולל רשימה של פונקציות עם שמות, תיאורים וסכימות פרמטרים, המודל יכול להחליט לקרוא לפונקציה אחת או יותר על ידי החזרת אובייקט function_call. זה שימושי לבניית סוכנים שצריכים לשאול מסדי נתונים, לקרוא ל-APIs, או לבצע פעולות. התכונה שופרה בגרסת ה-1106 בהשוואה לגרסאות קודמות, מה שהופכת אותה לאמינה יותר ומפחית שימוש מיותר בכלים. OrcaRouter תומך בכל הפרמטרים של קריאה לפונקציות התואמים ל-OpenAI.
אם מקרה השימוש שלך כולל משימות פשוטות מאוד עם נפח גבוה מאוד, אולי תשקול מודל זול עוד יותר כמו gpt-3.5-turbo-0125 (אותו מחיר אבל חדש יותר) או מודלים קטנים בקוד פתוח המוצעים דרך OrcaRouter. מצד שני, אם אתה צריך יכולות חשיבה טובות משמעותית, עובדתיות, קלט רב-מודלי (תמונות, אודיו), או חלון הקשר גדול יותר (128K טוקנים), שקול לשדרג ל-gpt-4o או gpt-4-turbo. gpt-3.5-turbo-1106 היא בחירה מאוזנת עבור רוב היישומים מבוססי טקסט שבהם עלות לטוקן היא דאגה עיקרית.
MMLU-Pro היא גרסה של מדד ההבנה הלשונית הרב-משימתית (Massive Multitask Language Understanding) הכוללת 57 נושאים עם סדרת שאלות מאתגרות יותר. ציון של 46.2 מציין שהמודל ענה נכון על 46.2% משאלות המבחן. זהו ציון בינוני, המשקף את הידע הכללי של המודל בתחומים מגוונים. לשם השוואה, מודלים גדולים יותר כמו GPT-4 משיגים בדרך כלל ציון מעל 80 במבחנים דומים. ציון זה מסייע לקבוע ציפיות: gpt-3.5-turbo-1106 מסוגל אך אינו ברמה הגבוהה ביותר עבור חשיבה מעמיקה או ידע מיוחד.
אין ציוני בנצ'מרק נוספים עבור דגם זה, אך מידע זמין לציבור מראה כי gpt-3.5-turbo-1106 מבצע בצורה חזקה במבחני MMLU, HumanEval (יצירת קוד) ומשימות תמצות יחסית לגודלו. הוא נחשב בדרך כלל לאחד הדגמים הפתוחים בעלי הביצועים הטובים ביותר ביחס לעלותו. משתמשים יכולים לצפות לביצועים טובים במשימות NLP נפוצות, אך יש להכיר בכך שהוא עלול לפגר אחרי GPT-4 בהיגיון מורכב, מתמטיקה והוראות מרובות-שלבים. לעקביות עובדתית, הדגם עלול לייצר תשובות סבירות אך שגויות, ולכן מומלץ לאמת עבור יישומים קריטיים.
ערכי השהיה ספציפיים אינם מסופקים. עם זאת, כמודל מבוסס טקסט בעל מספר פרמטרים נמוך יחסית (בהשוואה ל-GPT-4), gpt-3.5-turbo-1106 מציע בדרך כלל פלט השהיה נמוכה, ולעיתים קרובות משלים תגובות קצרות תוך פחות משנייה בעומס בינוני. התפוקה יכולה להיות גבוהה, מה שהופך אותו למתאים ליישומים בזמן אמת בשילוב עם סטרימינג. התשתית של OrcaRouter מבטיחה חיבור אמין לקצוות של OpenAI. לקבלת ציפיות השהיה מדויקות ביותר, על המשתמשים לבצע בדיקות ביצועים בתרחישי השימוש שלהם באמצעות ממשק ה-API של OrcaRouter.
המגבלות המרכזיות כוללות: מקסימום פלט של 4,096 טוקנים, המגביל את אורך היצירה; ללא יכולות מולטי-מודליות (אינו יכול לעבד תמונות או אודיו); נטייה להזות על עובדות לא ברורות; ועומק ניתוח מוגבל לבעיות מורכבות. חלון ההקשר של המודל בגודל 16K, למרות שהוא נדיב, קטן יותר מכמה חלופות (למשל, 128K). יש לו גם תאריך חיתוך ידע נמוך יותר מגרסאות מאוחרות יותר (ינואר 2023). בהנחיות עוינות או מעורפלות, הוא עלול לייצר פלט מוטה או לא בטוח. מפתחים צריכים ליישם מחסומי הגנה מתאימים ופיקוח אנושי לשימוש בייצור.
תמחור עבור openai/gpt-3.5-turbo-1106 דרך OrcaRouter מחויב בתעריף הספק ללא תוספת מחיר. באופן ספציפי, אסימוני קלט עולים $1.00 למיליון אסימונים, ואסימוני פלט עולים $2.00 למיליון אסימונים. זה חל על כל הבקשות, כולל הזרמה. אין עמלות פלטפורמה נוספות. החיובים מחושבים לפי מספר האסימונים בהנחיה (קלט) ובתגובה שנוצרה (פלט). בקשות במטמון ובקשות ללא מטמון מחויבות באותו תעריף. ניתן לעקוב אחר השימוש דרך לוח המחוונים של OrcaRouter.
ליישומים הדורשים אינטראקציות קצרות רבות (למשל, שיחות צ'אטבוט), העלות לכל הודעה נמוכה מכיוון שכל בקשה צורכת מעט טוקנים. עבור משימות הכוללות הנחיות ארוכות או שמייצרות תגובות ארוכות, העלות עולה ליניארית עם מספר הטוקנים. בהשוואה ל-GPT-4 (שיכול להיות יקר פי 10-30), gpt-3.5-turbo-1106 חסכוני לשימוש בהיקפים גדולים. עם זאת, אם ניתן לפתור משימה עם פחות טוקנים באמצעות מודל זול יותר, ייתכן שזה יהיה אף משתלם יותר. תמחור אפס תוספת של OrcaRouter מבטיח שאתה משלם רק מה ש-OpenAI גובה.
לא מוזכרות תוכניות שמירת מטמון (caching) או הנחות ספציפיות לדגם זה ב-OrcaRouter. כל הבקשות מחויבות בתעריף הספק הסטנדרטי. פלטפורמות מסוימות מציעות שמירת הנחיות (prompt caching) במטמון להפחתת עלויות עבור תשומות חוזרות, אך התיעוד של OrcaRouter אינו מציין תכונה כזו עבור דגם זה. על המשתמשים לתכנן את השימוש באסימונים (tokens) בהתאם. עבור נפח גבוה מאוד, ייתכן שכדאי לפנות ישירות ל-OrcaRouter כדי לברר על הנחות כמות, אף על פי שאף אחת מהן אינה מפורסמת. תמחור ללא תוספת (zero-markup pricing) כשלעצמו מספק בסיס עלות שקוף.
לביצוע בקשה, שלח בקשת POST לכתובת https://api.orcarouter.ai/v1/chat/completions עם גוף JSON המכיל את השדה model המוגדר כ-'openai/gpt-3.5-turbo-1106', ומערך messages (עם role ו-content). כלול את מפתח ה-API של OrcaRouter בכותרת Authorization (Bearer <key>). פרמטרים אופציונליים כוללים temperature, max_tokens, top_p, frequency_penalty, presence_penalty, stop, stream ו-functions. התשובה עוקבת אחר הפורמט של chat completion של OpenAI. דוגמה באמצעות ספריית openai ב-Python: client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key').
מודל זה תומך באותם פרמטרים כמו הגרסה gpt-3.5-turbo-1106 של OpenAI. הפרמטרים המרכזיים כוללים: messages (מערך נדרש של אובייקטים עם role, content, ואופציונלית name), max_tokens (ברירת מחדל אינסופית אך מוגבל ל-4096), temperature (0-2, ברירת מחדל 1), top_p (0-1, ברירת מחדל 1), n (מספר האפשרויות, ברירת מחדל 1), stream (בוליאני), stop (מחרוזת או מערך של עד 4 מחרוזות), presence_penalty (2- עד 2), frequency_penalty (2- עד 2), logit_bias (מפה של מזהי טוקן להטיה), user (מחרוזת לזיהוי משתמש קצה), functions (מערך של אובייקטי פונקציה), function_call (auto/none/פונקציה ספציפית). כולם נתמכים דרך OrcaRouter.
המעבר דורש רק שני שינויים בקוד הקיים שלך המבוסס על OpenAI. ראשית, שנה את כתובת ה-URL הבסיסית מ-https://api.openai.com/v1 ל-https://api.orcarouter.ai/v1. שנית, החלף את מפתח ה-API של OpenAI במפתח API של OrcaRouter. הפורמטים של הבקשה והתגובה זהים, כך שאין צורך בשינויים במבנה ה-payload. לאחר עדכון שתי ההגדרות הללו, כל הלוגיקה הקיימת להשלמות צ'אט, קריאות לפונקציות וסטרימינג תמשיך לעבוד. ניתן גם להשתמש באותן ספריות לקוח של OpenAI (למשל, Python openai, Node.js openai) על ידי העברת ה-base_url וה-api_key החדשים.
OrcaRouter מחזיר קודי מצב HTTP סטנדרטיים והודעות שגיאה התואמות ל-API של OpenAI. שגיאות נפוצות: 401 (לא מורשה), 429 (חריגה ממגבלת קצב), 500 (שגיאת שרת). מגבלות קצב נאכפות על ידי OrcaRouter לפי התוכנית שלך; לפרטים, עיין בתיעוד של OrcaRouter. מאחר שהמודל הבסיסי מתארח על ידי OpenAI, שגיאות מהספק מועברות באופן שקוף (למשל, 400 עבור פרמטרים לא תקינים, 503 עבור עומס יתר). מומלץ ליישם backoff אקספוננציאלי עבור 429 ושגיאות 5xx. שגיאות בזרימה מסומנות על ידי זרם קטוע; האזן ל-finish_reason בחלק האחרון.
תמונת המצב 0125 היא גרסה חדשה יותר של GPT-3.5 Turbo, ששוחררה בינואר 2025. היא מציעה את אותה תמחור ואופני טקסט בלבד, אך כוללת חתך ידע עדכני יותר ואולי גם עקביות משופרת ודיוק עובדתי טוב יותר. לשני הדגמים אותו חלון הקשר של 16K ומגבלת פלט של 4K. gpt-3.5-turbo-0125 מומלץ בדרך כלל על פני גרסת 1106 לפרויקטים חדשים בשל הרעננות שלו, אך תמונת המצב 1106 נותרת זמינה מסיבות תאימות. לא מסופקים ציוני אמת מידה לאף אחד מהדגמים מעבר ל-46.2 MMLU-Pro עבור 1106; משתמשים יכולים לבדוק את שניהם למקרה השימוש הספציפי שלהם.
gpt-4o הוא המודל המתקדם יותר של OpenAI שתומך בקלט טקסט, תמונה ואודיו, ובעל חלון הקשר של 128K ותפוקה מקסימלית של 16K טוקנים. הוא משיג ציונים גבוהים משמעותית במדדי חשיבה לוגית ואמין יותר למשימות מורכבות. עם זאת, הוא יקר משמעותית: בערך פי 10-15 מהעלות לטוקן של gpt-3.5-turbo-1106. ליישומים שבהם דיוק גבוה ורב-מודליות אינם נדרשים, gpt-3.5-turbo-1106 מציע יעילות עלות טובה יותר. אם אתה זקוק ליכולות המתקדמות, השדרוג ל-gpt-4o דרך OrcaRouter הוא פשוט על ידי שינוי מזהה המודל ל-'openai/gpt-4o'.
דגמים דומים מספקים אחרים כוללים את Claude 3 Haiku של Anthropic (טקסט בלבד, מהירות ועלות דומות) ואת Gemini 1.5 Flash של Google. לכל אחד מהם פורמט API שונה אך ניתן לגשת אליהם דרך OrcaRouter. gpt-3.5-turbo-1106 מאומץ נרחב ומשולב בכלים רבים. תמיכת הקריאה לפונקציות שלו בוגרת. עם זאת, דגמים כמו Claude 3 Haiku עשויים להציע חלונות הקשר גדולים יותר (200K) במחירים דומים, בעוד Gemini 1.5 Flash מספק יכולות רב-מודליות. הבחירה תלויה בתאימות למערכת האקולוגית, בביצועי מדד ספציפיים ובדרישות השהייה. OrcaRouter מאפשר לך לנסות דגמים שונים תחת אותו פורמט API.
בחר ב-gpt-3.5-turbo-1106 כאשר אתה זקוק למודל טקסט אמין וחסכוני התואם באופן נרחב לכלים קיימים ותומך בקריאות פונקציות. הוא אידיאלי עבור יישומים בעלי נפח גבוה שבהם כל בקשה היא קצרה יחסית ואינה דורשת היגיון מעמיק. הימנע ממנו אם אתה זקוק לקלטים מולטי-מודליים, לחלון הקשר רחב יותר, או לדיוק עובדתי גבוה יותר בנושאים מורכבים. אם אתה זקוק לחתך הידע העדכני ביותר, העדף את gpt-3.5-turbo-0125. לביצועים אולטימטיביים, בחר ב-gpt-4o. קטלוג המודלים של OrcaRouter מאפשר מעבר קל בין אפשרויות אלה ללא שינויים בקוד.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-1106",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_p| קלט / 1M טוקנים | $1.00 |
| פלט / 1M tokens | $2.00 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
GET /api/public/models/openai/gpt-3.5-turbo-1106פתיחה @misc{orcarouter_gpt_3_5_turbo_1106,
title = {openai/gpt-3.5-turbo-1106 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-1106}
}openai. (n.d.). openai/gpt-3.5-turbo-1106 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-1106