GPT-4o mini הוא הדגם החדש ביותר של OpenAI לאחר [GPT-4 Omni](/models/openai/gpt-4o), התומך הן בקלט טקסט והן בקלט תמונה עם פלטי טקסט. בתור הדגם הקטן המתקדם ביותר שלהם, הוא זול פי כמה...
GPT-4o-mini היא גרסה קטנה ומהירה יותר של מודל GPT-4o של OpenAI, המותאמת לעלות חישובית נמוכה תוך שמירה על יכולות רב-מודליות. היא יכולה לעבד טקסט, תמונות וקבצים שהועלו כקלטים, ולהפיק פלטי טקסט. המודל…
GPT-4o-mini מצטיין במגוון רחב של משימות שפה, כולל סיכום, תרגום, סיווג ומענה על שאלות. הוא תומך בפלט JSON מובנה, קריאה לפונקציות ושימוש בכלים, המאפשרים אינטגרציה עם ממשקי API חיצוניים ומסדי נתונים. חלון ההקשר של 128K מאפשר לו לקלוט מסמכים גדולים או היסטוריות שיחות לצורך ניתוח קוהרנטי. הוא מבצע היטב במבחני אמת מידה נפוצים (ציון MATH-500 של 78.9) ומתאים לבעיות מתמטיקה חינוכיות, הסבר קוד וחילוץ נתונים. למשימות פשוטות יותר, GPT-4o-mini לעתים קרובות משתווה למודלים גדולים יותר בעלות נמוכה בהרבה. עם זאת, משימות הדורשות מומחיות תחום עמוקה או תפוקות יצירתיות ביותר עשויות לראות איכות מופחתת לעומת GPT-4o.
תמונות ניתן לספק כ-URLs או כנתונים מקודדים ב-base64 בתוך בקשת ה-API. המודל מפרש תמונות, מבין תוכן חזותי כגון עצמים, טקסט בתמונות ויחסים מרחביים. זה מאפשר מקרי שימוש כמו שאלות ותשובות חזותיות, פירוש דיאגרמות וזיהוי ספרות בכתב יד. הטוקנים של התמונה נספרים כנגד מגבלת ההקשר, כך שתמונות ברזולוציה גבוהה או גדולות צורכות יותר מתקציב 128K הטוקנים. המודל אינו יוצר תמונות; הוא רק מעבד אותן. עבור משימות הדורשות פרטים חזותיים עדינים (למשל, דימות רפואי), מודל ראייה ייעודי עשוי להיות מדויק יותר, אך GPT-4o-mini מציע פתרון לשימוש כללי בעלות סבירה.
GPT-4o-mini מקבל גם קבצים שהועלו בנוסף לטקסט ותמונות. סוגי קבצים נפוצים כוללים PDF, .docx, .txt, .csv ו-.json. המודל מחלץ טקסט ואלמנטים חזותיים רלוונטיים (אם הקובץ מכיל תמונות מוטמעות) ומעבד אותם כחלק מהקונטקסט. זה שימושי לניתוח מאמרי מחקר, חוזים משפטיים או גיליונות נתונים ללא העתקה ידנית. שים לב שתוכן הקבצים תורם לשימוש בטוקנים; לדוגמה, קובץ PDF בן 50 עמודים עשוי לצרוך כמה אלפי טוקנים. OrcaRouter גובה תשלום לפי סך טוקני הקלט, כולל אלו מהקבצים. אין דמי עיבוד קבצים נוספים מעבר לצריכת הטוקנים.
אם עומס העבודה שלך כולל רק טקסט ללא תמונות או קבצים, וההקשר הנדרש קטן מ-16K טוקנים, דגם קטן יותר (כמו GPT-3.5-turbo) עשוי להציע עלות נמוכה יותר לטוקן. באופן דומה, עבור משימות בעלות תפוקה גבוהה מאוד כמו סיווג פשוט או שאלה ותשובה טריוויאליים, דגם מכוון ייעודי עשוי להיות חסכוני יותר. GPT-4o-mini יעיל בעלויות עבור מקרי שימוש מולטי-מודליים או בעלי הקשר ארוך, אך כוחו טמון באיזון בין ביצועים למחיר. אם היישום שלך יכול לסבול תגובות איטיות יותר או עלות גבוהה יותר תמורת דיוק מרבי, GPT-4o מהווה חלופה. בצע בדיקת מידה (benchmark) על המשימה הספציפית שלך כדי לאשר איזה דגם עומד בספי האיכות והתקציב שלך.
MATH-500 הוא תת-קבוצה של מבחן MATH, המורכבת מ-500 בעיות מתמטיות ברמת תחרות המכסות אלגברה, גאומטריה, תורת המספרים והסתברות. ציון של 78.9 מציין ש-GPT-4o-mini ענה נכון על כ-78.9% מהבעיות הללו. זוהי תוצאה חזקה עבור מודל קטן יותר, המשקפת את יכולת החשיבה המתמטית שלו. הוא עולה על מודלים קודמים רבים בגודל דומה. עם זאת, הביצועים עשויים להשתנות בתחומי בעיות ספציפיים. המבחן מתבצע בתנאי zero-shot, כלומר לא מסופקות דוגמאות קודמות. לצורך הוראה מתמטית בעולם האמיתי, המודל עשוי להזדקק להנחיה זהירה כדי להתמודד עם פתרונות רב-שלביים בצורה נכונה.
למרות שהמדד היחיד שסופק הוא MATH-500, מידע ציבורי ידוע מצביע על כך ש-GPT-4o-mini גם מציג ביצועים תחרותיים ב-MMLU (הבנת שפה רב-משימתית רחבת היקף), HellaSwag ו-GSM8K. בדרך כלל הוא מדורג מתחת ל-GPT-4o אך מעל GPT-3.5-turbo במדדים אלו. במדדי היגיון, הוא מפגין ביצועים חזקים ביחס למספר הפרמטרים שלו. בכתיבה יוצרת או יצירה פתוחה, הפלטים שלו קוהרנטיים אך עשויים להיעדר את העדינות של דגמים גדולים יותר. העיכוב (latency) בדרך כלל נמוך מזה של GPT-4o, מה שהופך אותו למתאים ליישומים בזמן אמת. לציון מדויק, עיין בתיעוד של OpenAI. OrcaRouter מספק גישה ללא תוספות תמחור.
השהייה תלויה במורכבות הבקשה, מספר הטוקנים ועומס ה-API. GPT-4o-mini מתוכנן להיות מהיר - בדרך כלל מחזיר את הטוקן הראשון תוך פחות משנייה עבור הנחיות באורך בינוני. עבור מסמכים ארוכים (למשל, 50K טוקנים), ההשהייה תגדל ככל שהמודל מעבד את כל ההקשר. OrcaRouter אינו משנה את המהירות; אתה חווה את אותם זמני תגובה כמו קריאות ישירות ל-API של OpenAI. זרימה (Streaming) נתמכת כדי להפחית את ההשהייה הנתפסת. עבור יישומים רגישים להשהייה, שקול לשמור על אורך הנחיות קצר ולהשתמש בזרימה. ניתן למדוד את הזמן המדויק עד לטוקן הראשון על ידי ניטור זמן התגובה; לא מסופק SLA ספציפי.
בעוד ש-GPT-4o-mini מסוגל, יש לו מגבלות בשל גודלו הקטן יותר. הוא עשוי לספק תשובות פחות מדויקות במשימות של הסקה רב-שלבית מורכבת בהשוואה ל-GPT-4o. לעיתים הוא עלול לפרש לא נכון הוראות מורכבות או להיכשל בשמירה על קוהרנטיות מושלמת לאורך תפוקות ארוכות מאוד. ההבנה הרב-מודאלית שלו טובה אך אינה מושלמת; הוא עלול להחמיץ פרטים קטנים בתמונות או לטעות בספירת רכיבים. המודל עלול להציג הטיות הקיימות בנתוני האימון שלו. הוא אינו תומך בחיפוש באינטרנט או בגישה לנתונים בזמן אמת אלא אם כוונן במפורש לשימוש בכלים. עבור משימות הדורשות דיוק גבוה (למשל, ייעוץ משפטי, אבחון רפואי), נדרשת בדיקה אנושית. ציוני מדדי ביצוע משקפים סביבות מבוקרות; ביצועים בעולם האמיתי עשויים להשתנות.
OrcaRouter מעביר את התמחור המדויק של OpenAI ללא תוספת: $0.15 למיליון טוקני קלט ו-$0.60 למיליון טוקני פלט. טוקני קלט כוללים את כל הטקסט, טוקני תמונה ותוכן קבצים. טוקני פלט סופרים טקסט שנוצר. אין דמי חודש או חיובים נסתרים. זוהי אחת העלויות הנמוכות ביותר לטוקן עבור מודל רב-מודאלי עם חלון הקשר של 128K. לשם השוואה, GPT-4o עולה $2.50 למיליון קלט ו-$10 למיליון פלט, מה שהופך את GPT-4o-mini לזול ב-94% בקלט וב-94% בפלט. יתרון העלות משמעותי עבור יישומים בעלי נפח גבוה.
בעוד ש-GPT-4o-mini זול לכל טוקן, הגודל הקטן שלו עשוי לדרוש יותר ניסיונות או פרומפטים מפורטים יותר כדי להגיע לדיוק הרצוי, מה שעלול להגדיל את צריכת הטוקנים הכוללת. עבור משימות שבהן GPT-4o מגיע לתשובה הנכונה בניסיון אחד אך GPT-4o-mini זקוק לשלושה, העלות הכוללת עשויה להיות דומה או אף גבוהה יותר. בנוסף, אם אתה צריך לשלוח בקשות קטנות רבות, תקורת קריאות ה-API עשויה להוסיף השהייה אך לא עלות ישירה. אין הפעלת מטמון; כל בקשה מעובדת באופן חדש. הערך את מקרה השימוש שלך עם שני המודלים כדי לקבוע את איזון העלות-ביצועים הטוב ביותר. OrcaRouter מספקת תמחור עקבי ללא הנחות על נפח.
OrcaRouter אינו מיישם שמירה במטמון של פרומפטים. כל בקשה ל-GPT-4o-mini נשלחת לשרתי OpenAI ומחויבת לפי אסימון (token). אין תעריף מוזל עבור פרומפטים חוזרים. אם עומס העבודה שלך חוזר לעיתים קרובות על אותה הודעת מערכת או הקשר ארוך, ייתכן שתרצה לשמור את התגובה אצלך כדי להימנע משליחת פרומפטים זהים שוב ושוב. חלק מהספקים מציעים הנחות על שמירה במטמון של פרומפטים, אך דרך OrcaRouter אתה משלם את התעריף הסטנדרטי של הספק. זה שקוף וצפוי. היעדר שמירה במטמון מפשט את התמחור אך משמעו שעליך לתכנן את השאילתות שלך כך שימזערו שימוש חוזר מיותר באסימונים.
(הערה: אין גרסה אחרת של GPT-4o-mini שסופקה. בהנחה שהשאלה עוסקת בהשוואה למודלים מיני אחרים כמו Claude 3 Haiku או Gemini Flash, אך סופקו רק עובדות. במקום זאת, אנו משווים ל-GPT-4o.) בהשוואה ל-GPT-4o, GPT-4o-mini זול באופן דרמטי: $0.15 לעומת $2.50 למיליון טוקני קלט (זול ב-94%) ו-$0.60 לעומת $10 למיליון טוקני פלט (זול ב-94%). משתמשים רבים מוצאים ש-GPT-4o-mini מספק עבור 80-90% מהמשימות, מה שמאפשר חיסכון עצום. עם זאת, עבור משימות הדורשות דיוק מרבי (למשל, יצירת קוד מורכב, נימוק משפטי דק), ייתכן שהחיסכון בעלויות לא יצדיק את ירידת האיכות. OrcaRouter מאפשרת לעבור בין מודלים בקלות דרך אותו נקודת קצה API על ידי שינוי מזהה המודל.
השתמש בספריית הלקוח של OpenAI או בכל לקוח HTTP, תוך הפניית כתובת הבסיס ל- `https://api.orcarouter.ai/v1`. הגדר את פרמטר המודל ל- `"openai/gpt-4o-mini"`. האימות דורש מפתח API של OrcaRouter. דוגמת Python מינימלית: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) כל פרמטרי ה-API של OpenAI נתמכים, כולל temperature, max_tokens, stream ו- tools. OrcaRouter ממסר בקשות ל-OpenAI ומחזיר תגובות ללא שינוי.
פרמטרים סטנדרטיים של OpenAI Chat Completions: model (חובה: "openai/gpt-4o-mini"), messages (מערך של אובייקטי הודעה), temperature (0-2, ברירת מחדל 1), top_p (0-1, ברירת מחדל 1), n (מספר תגובות, ברירת מחדל 1), stream (בוליאני), stop (מחרוזת/מערך), max_tokens (עד 16384), presence_penalty, frequency_penalty, logit_bias, user (אופציונלי), ו-tools להפעלת פונקציות. לחזון (vision), כלול תוכן תמונה בהודעות (type "image_url" או "image_url" עם detail). קלטי קבצים יכולים להיות מקודדים base64. OrcaRouter מעביר את כל הפרמטרים ל-OpenAI. הערה: פורמט תגובה (מצב JSON) נתמך; הגדר response_format={ "type": "json_object" } כשמתאים.
ההעברה פשוטה: שנה את כתובת ה-URL הבסיסית בלקוח שלך מ-"https://api.openai.com/v1" ל-"https://api.orcarouter.ai/v1" והחלף את מפתח ה-API שלך במפתח OrcaRouter. עדכן את שם המודל ל-"openai/gpt-4o-mini" (או השאר אותו כ-"gpt-4o-mini"? העובדה אומרת מזהה המודל "openai/gpt-4o-mini", אז השתמש בזה). כל שאר הקוד נשאר ללא שינוי מכיוון שה-API תואם לחלוטין ל-OpenAI. אתה יכול גם לשמור מספר מחרוזות מודל ולנתב על סמך עלות או יכולת. OrcaRouter אינו משנה את תבנית התגובה. בדוק עם מספר שאילתות כדי לוודא שכותרות וסטרימינג פועלים כמצופה.
כן, GPT-4o-mini תומך בסטרימינג דרך server-sent events (SSE). יש להגדיר stream=true בבקשה. התגובה תהיה סדרה של chunks המכילים delta content. זה מקטין את ה-time-to-first-token עבור משתמשים ומאפשר תצוגה בזמן אמת. OrcaRouter מעביר תגובות סטרימינג ללא שינוי. שימו לב שספירת האסימונים (tokens) המחויב נשארת זהה. סטרימינג תואם לכל אופני הקלט (טקסט, תמונה, קובץ). ניתן גם לשלב סטרימינג עם function calls; המודל ישדר tool call chunk כאשר הדבר מתאים. הפרמטר max_tokens חל על כל התגובה.
GPT-4o-mini הוא האח הקטן והזול יותר של GPT-4o. הוא עולה כ-94% פחות הן על טוקנים של קלט והן על טוקנים של פלט. יש לו אותו חלון הקשר של 128K ומקסימום פלט של 16K. הוא תומך באותם תשומות מולטי-מודאליות אך בדרך כלל מדויק מעט פחות במשימות חשיבה מורכבות ומשימות יצירתיות. ב-MATH-500, GPT-4o-mini משיג ציון 78.9 בעוד GPT-4o משיג 92+ (בקירוב). עבור משימות יומיומיות רבות כמו תמיכת לקוחות, סיכום וראייה פשוטה, GPT-4o-mini מספיק. בחר ב-GPT-4o כאשר אתה זקוק לביצועים מהשורה הראשונה ויכול לקבל זמן השהייה ועלות גבוהים יותר.
השוואה למודלים כמו Claude 3 Haiku או Gemini 1.5 Flash: GPT-4o-mini מציע חלון הקשר של 128K, בעוד Haiku מאפשר 200K ו-Flash 1M. התמחור דומה (Haiku $0.25/$1.25 לכל 1M טוקנים; Flash $0.35/$1.05). ציון MATH-500 של GPT-4o-mini, 78.9, הוא תחרותי; Haiku מקבל בסביבות 73 ו-Flash בסביבות 78 במדדים מתמטיים דומים. עבור קלטים מולטימודליים, כל השלושה מקבלים תמונות. GPT-4o-mini עשויה להיות בעלת איכות חשיבה טובה יותר ביחס למחיר שלה, אך חלון ההקשר קטן יותר מכמה מתחרים. הבחירה הטובה ביותר תלויה בדרישות הספציפיות שלך לגבי זמן השהייה, עלות ואיכות. OrcaRouter גם מספק גישה ל-Haiku ו-Flash, ומאפשר השוואה זה לצד זה.
GPT-3.5-turbo הוא ישן יותר, יש לו חלון הקשר של 16K, והוא עולה קצת פחות (0.50$ למיליון קלט לעומת 0.15$ עבור GPT-4o-mini? למעשה GPT-3.5-turbo-0125 עולה 0.50$/1.50$ אבל עם הקשר קטן יותר. בהתבסס על התמחור שניתן, GPT-4o-mini זול יותר לטוקן ומציע הקשר גדול יותר וקלט מולטי־מודאלי. אז עבור רוב המשימות, GPT-4o-mini עדיף. עם זאת, יישומים מדור קודם שכבר משתמשים ב-GPT-3.5-turbo עשויים לדרוש שינויים מינימליים. GPT-4o-mini גם מבצע ביצועים טובים יותר במבחני חשיבה. אלא אם זמן ההשהיה קריטי ביותר או שכיוונת מודל GPT-3.5, GPT-4o-mini הוא שדרוג ההחלפה המומלץ.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| קלט / 1M טוקנים | $0.150 |
| פלט / 1M tokens | $0.600 |
| קריאת מטמון / 1M | $0.075 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
GET /api/public/models/openai/gpt-4o-miniפתיחה @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini