הדגם האחרון GPT-4 Turbo עם יכולות ראייה. בקשות ראייה יכולות כעת להשתמש במצב JSON וקריאת פונקציות. נתוני אימון: עד דצמבר 2023.
GPT-4 Turbo הוא מודל שפה גדול ששוחרר על ידי OpenAI, המעבד גם קלט טקסט וגם קלט תמונה. הוא מבוסס על הארכיטקטורה של GPT-4 אך מרחיב את חלון ההקשר ל-128,000 טוקנים — בערך 300 עמודי טקסט — תוך שמירה על פלט…
GPT-4 Turbo מפגין יכולות חשיבה חזקות, במיוחד במתמטיקה (ציון 73.7 ב-MATH-500), יצירת קוד ופתרון בעיות רב-שלבי. הוא יכול לעקוב אחר הוראות מורכבות לאורך שיחות ארוכות, לשמור על עקביות לאורך אלפי טוקנים ולייצר הסברים טכניים קוהרנטיים. המודל מסוגל גם לנתח תמונות – כגון צילומי מסך, דיאגרמות וטקסט מודפס – כאשר הקלט כולל נתוני תמונה. עם זאת, הוא אינו מתמחה בכל תחום; עבור משימות סיווג או חילוץ פשוטות, ייתכן שמודל קטן יותר כמו GPT-3.5 Turbo יספיק ויהיה חסכוני יותר.
חלון הקשר של 128,000 טוקנים מאפשר לך להזין מסמכים גדולים — ספרים שלמים, חוזים משפטיים ארוכים, מאגרי קוד מלאים, או שיחות ארוכות — מבלי צורך לפצל את התוכן לחלקים. לדוגמה, תוכל להדביק מאמר מחקר שלם ולשאול שאלות על כל חלק מבלי לאבד את החלקים הקודמים. זה שימושי במיוחד למשימות כמו תמצות מסמכים, ניתוח חקיקה, או איתור באגים במאגר קוד גדול, שבהן המודל צריך לראות את המבנה המלא. ב-OrcaRouter, הקשר זה מחויב כטוקני קלט, כך שהזנת מסמך של 100K טוקנים תעלה בערך $1.00 לשאילתה (100K * $10/1M).
GPT-4 Turbo מקבל תמונות כחלק מהקלט, ומאפשר לו להבין תוכן חזותי כמו תצלומים, דיאגרמות, איורים וצילומי מסך. המודל יכול לתאר מה יש בתמונה, לענות על שאלות לגבי תוכנה, ואף לבצע הסקת מסקנות מתרשימים (למשל, פירוש תרשים זרימה או גרף). תמונות מסופקות בדרך כלל ככתובות URL או כנתונים מקודדים ב-base64 בפורמט השלמת הצ'אט של OpenAI. העלות לעיבוד תמונה כלולה בספירת אסימוני הקלט, המחושבת לפי רזולוציית התמונה ורמת הפירוט על פי נוסחת התמחור של OpenAI.
אם מקרה השימוש שלך כרוך במשימות רבות-נפח ובעלות מורכבות נמוכה — כגון סיווג טקסט פשוט, שאלות-תשובות בסיסיות על הקשרים קצרים, או מיצוי חוזר — ייתכן שמודל קטן יותר כמו GPT-3.5 Turbo או מודל מכוונן ייעודי יניב תוצאות סבירות בשבריר מהעלות. התמחור של GPT-4 Turbo גבוה בערך פי 20 מ- GPT-3.5 Turbo לכל טוקן קלט ופי 30 לכל טוקן פלט. עבור יישומים שבהם השיהוי חשוב, GPT-3.5 Turbo גם מגיב מהר יותר. שקלו את האיזון בין דיוק לעלות; עבור צינורות ייצור רבים, גישה היברידית המשתמשת במודל זול לסינון ו- GPT-4 Turbo למקרים מורכבים יכולה לייעל את ההוצאה.
GPT-4 Turbo השיג ציון של 73.7 במדד MATH-500, אשר מעריך את יכולת המודל לפתור בעיות מתמטיות מרמת בית ספר יסודי עד תיכון, בנושאים כמו אלגברה, גאומטריה וחשבון דיפרנציאלי ואינטגרלי. ציון זה מעיד על יכולת חשיבה מתמטית חזקה אך אינו הטוב ביותר; כמה מודלים ייעודיים או אנסמבלים גדולים יותר יכולים לעלות על 80. המדד שימושי להשוואת מודלים על בסיס פתרון בעיות שיטתי ולא יצירת שפה גולמית. ב-OrcaRouter, אתה יכול לבדוק זאת בעצמך על ידי הגשת סט של בעיות מתמטיות דרך ה-API והשוואת תוצאות.
בין החוזקות: חשיבה מעמיקה, טיפול בהקשרים ארוכים, ויכולת טובה ליצור ולהסביר קוד. כמו כן, היא מציגה ביצועים טובים במשימות המשלבות טקסט וראייה, כמו פירוש דיאגרמות. המגבלות כוללות תפוקה צנועה יחסית של 4,096 טוקנים, מה שאומר שיצירה ארוכה (למשל, כתיבת פרק שלם) דורשת קריאות מרובות. המודל עלול לעיתים להפיק תשובות לא נכונות במקרים קצה – הוא אינו חף מטעויות. בנוסף, ייתכן שהוא לא הבחירה הטובה ביותר ליישומים בזמן אמת בשל עיכוב גבוה יותר בהשוואה למודלים קטנים יותר. לא מסופקים מדדי מהירות, אך דיווחים אנקדוטליים מצביעים על כך שהוא מעט איטי מ-GPT-3.5 Turbo.
נתוני השהיה מדויקים עבור GPT-4 Turbo ב-OrcaRouter אינם מפורסמים; הביצועים תלויים בתשתית הספק ובעומס הבקשות. בפועל, זמן ההסקה של המודל ארוך יותר ממודלים קטנים יותר בשל מספר הפרמטרים הגדול יותר ועיבוד ההקשר. עבור תשומות קצרות, זמני התגובה הם בדרך כלל כמה שניות, בעוד שהקשרים גדולים מאוד (למשל, 100K טוקנים) יכולים להגדיל משמעותית את ההשהיה מכיוון שהמודל חייב לעבד את כל הטוקנים לפני הפקת הפלט. OrcaRouter אינה מפרסמת האצה ספציפית כלשהי. משתמשים הזקוקים להשהיה נמוכה יותר עבור יישומים אינטראקטיביים עשויים להעדיף מודל מהיר יותר, בעוד שעיבוד אצווה של משימות מורכבות נותר בר ביצוע.
התמחור הוא לפי טוקן: 10.00$ למיליון טוקני קלט ו-30.00$ למיליון טוקני פלט. זה תואם את התעריף הישיר של OpenAI, ללא תוספת תשלום מ-OrcaRouter. טוקני קלט כוללים את הודעת המערכת, הודעות משתמש, טוקני תמונה וכל היסטוריית השיחה. טוקני פלט הם התגובה שנוצרה על ידי המודל. העלות הכוללת של בקשה מחושבת כ- (input_tokens * $0.00001) + (output_tokens * $0.00003). אין דמי מינימום או התחייבויות חודשיות; אתה משלם רק על הטוקנים שבהם אתה משתמש.
GPT-4 Turbo יקר משמעותית מדגמים קטנים יותר כמו GPT-3.5 Turbo ($0.50/$1.50 לכל מיליון טוקנים) אך מציע יכולת חשיבה וטיפול בהקשרים מעולים. עבור משימות הדורשות רק יכולות בסיסיות, שימוש ב-GPT-4 Turbo עלול להוביל לעלויות מיותרות. מצד שני, בהשוואה ל-GPT-4 המקורי ($30/$60 לכל מיליון טוקנים), GPT-4 Turbo זול ב-33% בקלט ו-50% בפלט, מה שהופך אותו לאופציה משתלמת יותר עבור דרישות ביצועים גבוהים. התמחור ללא תוספת של OrcaRouter מבטיח שתשלם את אותו תעריף כמו בשימוש ישיר ב-OpenAI.
OrcaRouter אינו מציע הנחות ספציפיות, תמחור לפי נפח, או שמירה במטמון של תגובות עבור GPT-4 Turbo מעבר לתעריפים המוצהרים לפי אסימון. התמחור הוא פשוט: אתה משלם בדיוק מה ש-OpenAI גובה, ללא עמלות נוספות. אין הנחת התחייבות, רכישה מראש של אסימונים, או תמחור מדורג. שמירה במטמון של בקשות או תגובות אינה מפורסמת, כך שכל בקשה מחויבת בתעריף הסטנדרטי. אם אתה צופה נפחים גבוהים מאוד, ייתכן שתרצה ליצור קשר עם OrcaRouter או לשקול שימוש בנקודת קצה API ייעודית עם שכבת מטמון משלך כדי להפחית עלויות חוזרות עבור קלטים זהים.
עלות טוקני הפלט גבוהה פי שלושה מעלות טוקני הקלט ($30 לעומת $10 למיליון טוקנים). לכן, יצירות ארוכות יכולות להעלות את החשבון במהירות. לדוגמה, יצירת תגובה של 2,000 טוקנים תעלה $0.06, בעוד שתגובה של 4,000 טוקנים עולה $0.12. כדי לשלוט בעלויות, שקלו לקבוע פרמטר max_tokens נמוך יותר, להשתמש בהנחיות קצרות יותר, או להשתמש בשיפור איטרטיבי שבו המודל מייצר פלטים קצרים יותר ואז מרחיב אותם בקריאה נפרדת רק כאשר יש צורך. עבור משימות כמו סיכום, מודל עם עלות טוקן פלט נמוכה יותר עשוי להיות עדיף אם ההקשר אינו קריטי.
ניתן לקרוא ל-GPT-4 Turbo דרך ה-API התואם ל-OpenAI של OrcaRouter. ראשית, יש להשיג מפתח API מ-OrcaRouter. לאחר מכן, יש להגדיר את כתובת ה-base URL כ-https://api.orcarouter.ai/v1 ולהשתמש במזהה המודל "openai/gpt-4-turbo" בבקשות ה-chat completion שלכם. לדוגמה, עם ה-OpenAI Python SDK, תיצרו client עם base_url שמצביע ל-OrcaRouter ו-model="openai/gpt-4-turbo". הפורמטים של הבקשה והתגובה זהים לאלה של ה-API המקורי של OpenAI, כך שנדרשים שינויים מינימליים בקוד כדי לעבור משימוש ישיר ב-OpenAI.
ה-API תומך בפרמטרי השלמת צ'אט סטנדרטיים של OpenAI: messages (מערך עם role ו-content), temperature (0-2), top_p, n, stream, stop, max_tokens (מוגבל ל-4096), presence_penalty, frequency_penalty, logit_bias, user, ו-function calling/tools. עבור קלטי תמונה, ניתן לכלול חלק תוכן עם type "image_url" ו-url. המודל אינו תומך בפרמטרים נוספים מעבר למפרט של OpenAI. כל הפרמטרים פועלים בדיוק כמתועד עבור GPT-4 Turbo של OpenAI. שימו לב שפרמטר max_tokens לא יכול לעלות על 4096, שהוא מגבלת הפלט של המודל.
ההעברה פשוטה: החליפו את כתובת ה-URL הבסיסית של OpenAI בנקודת הקצה של OrcaRouter בכתובת https://api.orcarouter.ai/v1 ושנו את שם המודל ל-"openai/gpt-4-turbo". השתמשו במפתח ה-API של OrcaRouter במקום במפתח ה-API של OpenAI. שאר הקוד שלכם — עיצוב הודעות, הזרמה, טיפול בשגיאות — יישאר ללא שינוי משום שה-API תואם לחלוטין. אם השתמשתם בספריית Python של OpenAI, תוכלו פשוט להגדיר את openai.api_base (או המקבילה בגרסאות חדשות יותר) לכתובת ה-URL של OrcaRouter. כך תוכלו לבדוק את GPT-4 Turbo דרך OrcaRouter מבלי לשכתב שום לוגיקה.
GPT-4 Turbo הוא אבולוציה של GPT-4 עם חלון הקשר גדול יותר (128K לעומת עד 32K בגרסאות GPT-4 הקודמות) ותמחור זול יותר לאסימון: $10/$30 לכל מיליון אסימונים לעומת $30/$60 לכל מיליון אסימונים עבור GPT-4. שני המודלים תומכים בראייה, אבל GPT-4 Turbo משפר גם את היעילות ואת איכות ההיגיון המינורית. במבחני ביצועים כמו MATH-500, GPT-4 Turbo קיבל ציון 73.7, בעוד ש-GPT-4 המקורי (עם הקשר 8K) קיבל כ-52.9 בקבוצת מבחנים קטנה יותר של MATH — המספרים אינם ניתנים להשוואה ישירה בשל גרסאות מבחן שונות, אך השיפור מעיד. ב-OrcaRouter, מודלי GPT-4 הישנים יותר זמינים גם כן בתמחור המתאים להם.
GPT-3.5 Turbo זול משמעותית ($0.50/$1.50 לכל מיליון טוקנים) ומהיר יותר, מה שהופך אותו למתאים ליישומים בעלי נפח גבוה וזמן השהייה נמוך. עם זאת, יש לו חלון הקשר קטן יותר (16K או 4K תלוי בגרסה) ויכולות חשיבה, יצירת קוד וראייה חלשות משמעותית. עבור משימות הדורשות חשיבה רב-שלבית או הקשר נרחב, GPT-4 Turbo עולה בביצועיו באופן ברור. בהשוואה ישירה בחשיבה מתמטית, GPT-3.5 Turbo בדרך כלל מקבל ציון מתחת ל-30 ב-MATH-500, בעוד ש-GPT-4 Turbo משיג 73.7. בחרו ב-GPT-3.5 Turbo למשימות פשוטות ולחסכון בעלויות, אך הסתמכו על GPT-4 Turbo כאשר דיוק או אורך הקשר הם קריטיים.
השוואה ישירה ראש-בראש אינה מסופקת, אך ידע ציבורי כללי מראה כי Anthropic Claude 3 ו-Google Gemini 1.5 מציעות יכולות דומות. ל-Claude 3 Opus חלון הקשר של 200K ויכולות חשיבה דומות, בעוד ש-Gemini 1.5 Pro יכול להתמודד עם עד 1M טוקנים. עם זאת, לכל מודל יש תמחור ומאפייני ביצועים שונים. ב-OrcaRouter, ניתן גם לגשת למודלים של ספקים אחרים לשם השוואה. GPT-4 Turbo נותר תחרותי בזכות האיזון בין מחיר, איכות חשיבה ומערכת המפתחים (OpenAI SDK). עבור משימות ראייה, גם Claude וגם Gemini תומכים בקלט תמונה.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4-turbo",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_p| קלט / 1M טוקנים | $10.00 |
| פלט / 1M tokens | $30.00 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
על מה מפתחים מדברים השבוע
GET /api/public/models/openai/gpt-4-turboפתיחה @misc{orcarouter_gpt_4_turbo,
title = {GPT-4 Turbo API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4-turbo}
}OpenAI. (2024). GPT-4 Turbo API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4-turbo