מודל טקסט חסכוני של OpenAI עם ציון 46.2 ב-MMLU-Pro, נגיש דרך OrcaRouter API.
openai/gpt-3.5-turbo-0125 הוא מודל ליצירת טקסט שפותח על ידי OpenAI וזמין דרך ה-API של OrcaRouter. הוא חלק ממשפחת GPT-3.5-Turbo, המותאם למשימות שיחה ולתפוקות טקסט מובנות. המודל מקבל רק קלט טקסט ומייצר…
GPT-3.5-Turbo-0125 מצטיינת במגוון רחב של משימות מבוססות טקסט, כולל צ'אט, תמצות, תרגום, מענה על שאלות ויצירת תוכן. היא מטפלת היטב בהוראות ומסוגלת להפיק תגובות קוהרנטיות ומתאימות מבחינה הקשרית לתמיכת לקוחות, סיעור מוחות ותיוג נתונים. נתוני האימון שלה מכסים תחומים מגוונים עד אפריל 2023, מה שמאפשר ביצועים סבירים בידע נפוץ ובסגנונות כתיבה. עבור פלט מובנה, היא יכולה לעצב JSON או לעקוב אחר סכמות מותאמות אישית כשנותנים לה הנחיה ברורה.
אם היישום שלך כולל נפח גבוה מאוד של משימות פשוטות וחוזרות על עצמן, כגון סיווג ישר או יצירת משפט בודד, ייתכן שתרצה לשקול שימוש במודלים קטנים יותר כמו GPT-3.5-Turbo-Instruct או אפילו חלופות קוד פתוח המתארחות ב-OrcaRouter. ניתן לחסוך בעלויות משמעותיות כאשר כמויות האסימונים (tokens) נמוכות ודרישות הדיוק מינימליות. עם זאת, GPT-3.5-Turbo-0125 נותר בחירה חסכונית עבור רוב השימושים הכלליים, במיוחד לאור ציון הביצועים הגבוה שלו של 46.2 ב-MMLU-Pro.
כן, המודל אומן על טקסט רב־לשוני, אף שהביצועים החזקים ביותר שלו הם באנגלית. הוא יכול להבין וליצור טקסט בשפות רבות, כולל ספרדית, צרפתית, סינית, ערבית ועוד. הדיוק עלול להיפגע עבור שפות המיוצגות במידה מוגבלת בנתוני האימון או עבור ביטויים אידיומטיים מאוד. למשימות הדורשות שטף רב־לשוני מדויק, כדאי לשקול השלמה באמצעות כיוונון עדין ספציפי לשפה או שימוש במודל ילידי. הקלט והפלט הם תמיד טקסט, כך שתווים שאינם באנגלית נתמכים.
מכיוון שחלון ההקשר הכולל הוא 16,385 טוקנים (מפרט ציבורי ידוע), המודל יכול לעבד מסמכים באורך בינוני במעבר יחיד. עם זאת, הפלט מוגבל ל-4096 טוקנים לבקשה. עבור פלטים ארוכים יותר, עליך ליישם גישת מיפוי-צמצום או חלון הזזה. מנגנון הקשב של המודל יכול לשמור על קוהרנטיות על פני כל ההקשר, אך הביצועים עלולים להתדרדר עבור משימות הדורשות התייחסות לתחילתו של פרומפט ארוך. מומלץ להשתמש באסטרטגיות של חלוקה לגושים ותקצור עבור טקסטים ארוכים מאוד.
MMLU-Pro היא גרסה משופרת של מבחן ההערכה Massive Multitask Language Understanding, המודדת את יכולת המודל לענות על שאלות ב-57 תחומים, כולל מדע, משפט ומדעי הרוח. ציון של 46.2 מציין ש-GPT-3.5-Turbo-0125 עונה נכון על כ-46.2% מהשאלות, דבר תחרותי בקרב מודלים קטנים יותר. ציון זה משקף ידע כללי חזק, אך גם מראה מקום לשיפור בהשוואה למודלים גדולים יותר כמו GPT-4. למשימות הדורשות מומחיות עמוקה, שקלו להעריך את המודל על מבחני אמת מידה ספציפיים לתחום.
השהייה המדויקת תלויה בגודל הבקשה, בתנאי הרשת ובעומס הנוכחי על תשתית OpenAI. בשימוש טיפוסי, GPT-3.5-Turbo-0125 מגיב תוך שניות ספורות להנחיות קצרות, לרוב מהר יותר ממודלים גדולים יותר. OrcaRouter אינו מוסיף עומס משמעותי מעבר לזמן התגובה של הספק. עבור יישומים בזמן אמת, בצעו בדיקות עם עומס העבודה שלכם. המהירות והעלות של המודל הופכות אותו לבחירה פופולרית לצ'אטבוטים אינטראקטיביים וצינורות ייצור שבהם השהייה לפי בקשה היא קריטית.
GPT-3.5-Turbo-0125 נמצא בשימוש נרחב בזכות האמינות שלו, העיצוב העקבי ויכולות המעקב המצוינות אחר הוראות. לעיתים רחוקות הוא נכשל בהפקת תגובה קוהרנטית, והוא מתמודד היטב עם שגיאות הקלדה או ניסוח מעורפל. כיסוי נתוני האימון שלו עד אפריל 2023 מאפשר לו לענות על אירועים אקטואליים מאותה תקופה בדיוק. המודל תומך גם בהודעות מערכת לקביעת התנהגות, מה שמקל על התאמה אישית ליישומים שונים כגון משחקי תפקידים או יצירה מוגבלת.
דגם זה עשוי להתקשות בהיגיון מורכב, בחשבון רב-שלבי ובהוראות עדינות מאוד. לעיתים הוא עלול להפיק תשובות שנשמעות סבירות אך אינן נכונות (הזיות), וייתכן שלא יאכוף באופן עקבי חוקי עיצוב נוקשים. אורך הפלט שלו מוגבל ל-4096 טוקנים, מה שעלול להיות בלתי מספק ליצירת תוכן ארוך. בנוסף, אין לו גישה לאינטרנט כברירת מחדל, והוא אינו יכול לאחזר מידע בזמן אמת או לבצע פעולות מחוץ לממשק הצ'אט. עבור היגיון מתקדם או נתונים עדכניים, שקול שימוש בדור מוגבר בשליפה (RAG) או בדגם בעל יכולות גבוהות יותר.
OrcaRouter מעביר את התמחור המדויק של OpenAI ללא תוספת מחיר: 0.50$ למיליון טוקנים בקלט ו-1.50$ למיליון טוקנים בפלט. אין דמי פלטפורמה נוספים, עלות מנוי או חיוב לפי בקשה מעבר לתעריפי הטוקנים הללו. טוקני קלט כוללים את ההנחיה, הודעת המערכת והיסטוריית השיחה; טוקני פלט הם התגובה שנוצרה. החיוב מבוסס על מספר הטוקנים שעובדו, הנמדדים על ידי מנתח הטוקנים tiktoken עבור GPT-3.5.
בעוד ש-GPT-3.5-Turbo-0125 הוא כבר אחד מהמודלים החסכוניים ביותר של OpenAI, ניתן לשפר עוד יותר על ידי שליחת פרומפטים קצרים יותר, קיצוץ בהיסטוריית השיחות ככל האפשר, ושימוש בערך max_tokens קטן יותר אם המקרה שלך מאפשר זאת. הימנע מהודעות מערכת ארוכות מדי אם אין בהן צורך. עבור נפח גבוה במיוחד, שקול אם מודל חינמי או קוד פתוח ב-OrcaRouter יכול לעמוד בדרישות הדיוק שלך. המחיר הוא שמודלים זולים יותר עשויים לדרוש הנדסת פרומפט או כוונון עדין מחמירים יותר.
אורקה-ראוטר (OrcaRouter) אינו מציע כרגע מנגנון שמירה במטמון מובנה עבור הנחיות (prompts) או תגובות (responses). כל קריאת API מחויבת לפי מספר הטוקנים שנשלחו והתקבלו באותה בקשה. אם אתה עושה שימוש חוזר באותה הנחיה במספר קריאות (למשל, הודעות מערכת זהות), תחויב על הטוקנים האלה בכל פעם. כדי להפחית עלויות, שקול לשמור בקשות זהות במטמון ברמת היישום (application level) או לאגד מספר שאילתות להנחיה אחת עם מספר הודעות משתמש.
השתמש בנקודת הקצה הסטנדרטית של OpenAI Chat Completions עם כתובת ה-URL הבסיסית https://api.orcarouter.ai/v1. הגדר את פרמטר המודל ל-'openai/gpt-3.5-turbo-0125'. כלול את מפתח ה-API שלך של OrcaRouter בכותרת Authorization. דוגמה באמצעות cURL: curl https://api.orcarouter.ai/v1/chat/completions -H 'Authorization: Bearer YOUR_API_KEY' -H 'Content-Type: application/json' -d '{"model":"openai/gpt-3.5-turbo-0125","messages":[{"role":"user","content":"Hello"}]}'. פורמט התגובה תואם למפרט של OpenAI.
כל פרמטרי ה-API הסטנדרטיים של OpenAI chat completions זמינים, כולל: 'messages', 'max_tokens' (עד 4096), 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop', ו-'stream'. כמו כן, 'n' (מספר ההשלמות) נתמך. אין תמיכה ב-'logprobs' או 'logit_bias' עבור מודל זה בשער OrcaRouter. שים לב שהפרמטר 'max_tokens' מוגבל ל-4096 כדי להתאים למגבלת הפלט של המודל. עבור סטרימינג, הגדר 'stream': true כדי לקבל עדכונים מצטברים.
אם אתה משתמש כיום ישירות ב-OpenAI, ההעברה ל-OrcaRouter היא פשוטה: שנה את כתובת הבסיס מ-https://api.openai.com/v1 ל-https://api.orcarouter.ai/v1, עדכן את מזהה המודל ל-'openai/gpt-3.5-turbo-0125' אם השתמשת בכינוי גנרי, והחלף את מפתח ה-API שלך במפתח מ-OrcaRouter. אין צורך בשינויים בקוד של פורמט ההודעה או הפרמטרים. אם השתמשת בספק אחר, ודא שספריית הלקוח שלך תומכת בסכימה התואמת ל-OpenAI. OrcaRouter מספקת תחליף ישיר.
GPT-4 בדרך כלל עולה על GPT-3.5-Turbo-0125 בהיגיון מורכב, דיוק עובדתי, ועמידה בהנחיות ניואנסיות, כפי שבא לידי ביטוי בציוני מדד גבוהים יותר ב-MMLU ובמבחנים אחרים. עם זאת, GPT-4 הוא יקר משמעותית (בדרך כלל פי 10 מהעלות לטוקן) ועשוי להיות בעל זמן השהייה גבוה יותר. GPT-3.5-Turbo-0125 מציע נקודת איזון מחיר-ביצועים אטרקטיבית למשימות שאינן דורשות את העומק של GPT-4. בחרו במודל הגדול יותר לניתוח מתקדם או כאשר מרווח הטעות צר.
Claude 3 Haiku של Anthropic הוא מודל מתחרה בעלות נמוכה עם הסקה מהירה ותכונות בטיחות חזקות. שני המודלים הם טקסט-בלבד ומיועדים ליישומים בעלי נפח גבוה. בעוד שהשוואות בנצ'מרק ספציפיות משתנות, GPT-3.5-Turbo-0125 מאומץ באופן נרחב ונהנה מתיעוד ומערכת אקולוגית נרחבת. ל-Claude 3 Haiku עשויים להיות חוזקות שונות בכתיבה יצירתית ובהתנהגות סירוב. הבחירה תלויה בהעדפת המפתח ובדרישות האינטגרציה. OrcaRouter תומך בשני המודלים, כך שתוכל להשוות ישירות.
מודלים בקוד פתוח (למשל, Llama 3, Mistral) ניתנים להרצה על החומרה שלך או דרך OrcaRouter לקבלת עלויות נמוכות יותר לאסימון, במיוחד בקנה מידה גדול. עם זאת, הם דורשים לעתים קרובות יותר התקנה, הנדסת פרומפט, ועשויים להיות בעלי יכולת נמוכה יותר לעקוב אחר הוראות. GPT-3.5-Turbo-0125 מציעה אמינות מוכנה מראש, איכות עקבית, וללא ניהול תשתית. עבור צוותים ללא מומחיות ב-ML, ה-API המנוהל הוא לעתים קרובות העדיף. הרץ מבחני מדד על עומס העבודה הספציפי שלך כדי להחליט.
OpenAI עשויה לשחרר גרסאות חדשות של GPT-3.5-Turbo או להפסיק את התמיכה בתמונת המצב הספציפית הזו. OrcaRouter תעדכן את המודלים הזמינים בהתאם. אם היישום שלך מסתמך על התנהגות עקבית, ייתכן שתרצה לנעול גרסת מודל ספציפית על ידי שימוש במזהה המודל המדויק. OrcaRouter מספקת הודעה מוקדמת על הפסקות תמיכה. עבור מערכות ייצור רגישות, שקול לבדוק גרסאות חדשות בסביבת staging לפני המעבר.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-0125",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_pparallel_tool_calls| קלט / 1M טוקנים | $0.500 |
| פלט / 1M tokens | $1.50 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
GET /api/public/models/openai/gpt-3.5-turbo-0125פתיחה @misc{orcarouter_gpt_3_5_turbo_0125,
title = {openai/gpt-3.5-turbo-0125 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125}
}openai. (n.d.). openai/gpt-3.5-turbo-0125 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125