GPT-4o mini הוא הדגם החדש ביותר של OpenAI לאחר [GPT-4 Omni](/models/openai/gpt-4o), התומך הן בקלט טקסט והן בקלט תמונה עם פלטי טקסט. בתור הדגם הקטן המתקדם ביותר שלהם, הוא זול פי כמה...
GPT-4o-mini (2024-07-18) הוא מודל קל משקל רב-מצבי שפותח על ידי OpenAI, המיועד לעיבוד טקסט ותמונות חסכוני. הוא מיועד למפתחים וארגונים הזקוקים לביצועים חזקים בעלות נמוכה, במיוחד בסביבות ייצור בעלות נפח…
GPT-4o-mini יכול לבצע משימות ניתוח תמונה כגון תיאור תוכן חזותי, מענה על שאלות על תמונות, וזיהוי אובייקטים או טקסט בתוך תמונות. הוא תומך בפורמטי תמונה סטנדרטיים (JPEG, PNG, GIF, WebP) ויכול לטפל במספר תמונות בבקשה אחת. המודל אינו מבצע זיהוי אובייקטים במובן של תיבות תיחום מובנות, אך הוא יכול לתאר מיקומים ויחסים. לדוגמה, הוא יכול לקרוא טקסט מצילום, להבין תרשימים ודיאגרמות, ולספק תיאורי סצנה מפורטים. הדיוק של משימות מבוססות תמונה תלוי ברזולוציה ובהקשר; תמונות ברזולוציה גבוהה עשויות לגרור עלויות טוקן גבוהות יותר אך יכולות להניב תוצאות טובות יותר לפרטים עדינים.
GPT-4o-mini מקבל קבצים כקלט, כגון קובצי PDF, מסמכי Word ותמונות, באמצעות מבנה תוכן רב-מודאלי. כאשר מסופק קובץ, המודל מחלץ ממנו טקסט ותוכן תמונה, ומאפשר למשתמשים לשאול שאלות על תוכן המסמך, לסכם את הטקסט שלו, או לנתח טבלאות וגרפים מוטבעים. הקובץ אינו נטען או מאוחסן; הוא מעובד בתוך הקריאה ל-API. זה שימושי עבור זרימות עבודה הכוללות סקירת מסמכים, ניתוח חוזים, או חילוץ נתונים מטפסים סרוקים. שים לב שקובצים גדולים מאוד עשויים לחרוג מחלון ההקשר של 128,000 טוקנים או לגרור עלויות טוקן גבוהות.
למשימות שדורשות רק יצירת טקסט קלה, תקציבי טוקנים עשויים להיות מושקעים טוב יותר במודלים זולים אף יותר כמו GPT-3.5-Turbo או חלופות קוד פתוח (למשל, Llama 3 8B). אם עומס העבודה שלך אינו מצריך קלט רב-מודאלי או קונטקסט של 128k, מודל קטן יותר עשוי להפחית עלויות עוד יותר. בנוסף, עבור משימות מצומצמות כגון סיווג פשוט או חילוץ מילות מפתח, מודל קטן יותר מכוונן עשוי להציע השהייה ועלות נמוכים יותר. עם זאת, השילוב של GPT-4o-mini בין מחיר נמוך, קונטקסט רחב ויכולת רב-מודאלית הופך אותו לברירת מחדל חזקה עבור יישומים רבים לשימוש כללי.
GPT-4o-mini מצטיין בסביבות ייצור בהיקף גבוה הנהנות מהבנה מולטי-מודאלית וחלונות הקשר גדולים. מקרי שימוש אידיאליים כוללים צ'טבוטים לתמיכת לקוחות שיכולים לטפל בצילומי מסך והיסטוריות שיחה ארוכות, צינורות עיבוד מסמכים לחילוץ נתונים מ-PDF או תמונות, כלים חינוכיים להוראת מתמטיקה (כפי שמעיד הציון 78.9 ב-MATH-500), וניפוי שגיאות בקוד שבמסגרתו מעורבים גם טקסט וגם דיאגרמות. הוא גם מתאים במיוחד לתהליכי ניהול תוכן הדורשים ניתוח תמונות יחד עם טקסט. העלות הנמוכה לכל טוקן מאפשרת קנה מידה למיליוני בקשות ללא הוצאה מוגזמת.
GPT-4o-mini משיגה ציון של 78.9 במבחן MATH-500, תת-קבוצה של מערך הנתונים MATH הכוללת 500 בעיות מתמטיות מאתגרות. ציון זה מצביע על יכולת המודל לפתור בעיות חשבון, אלגברה, גאומטריה ובעיות מתמטיות אחרות תוך שימוש בהיגיון צעד-אחר-צעד. ציון של 78.9 ממקם אותו מעל מודלים קטנים רבים וכמה גרסאות מוקדמות יותר של GPT-4, מה שמעיד על יכולות היגיון חזקות עבור מודל בגודלו ובעלותו. עם זאת, הוא אינו ביצועי כמו GPT-4o המלא או GPT-4 Turbo באותו מבחן. יש לפרש את התוצאה בהקשר: GPT-4o-mini תוכננה ליעילות, לא לדיוק מקסימלי.
נתוני השהייה ספציפיים אינם מפורסמים על ידי OpenAI, אך GPT-4o-mini בדרך כלל מהיר יותר מדגמי GPT-4 הגדולים בשל מספר הפרמטרים הקטן שלו. בפועל, משתמשים מדווחים על זמן עד לטוקן ראשון בטווח של מאות מילישניות בודדות עבור קלטים קצרים, ועל תפוקת יצירה של עשרות טוקנים בשנייה. ההשהייה תלויה בסך הטוקנים (קלט + פלט), מספר התמונות ועומס השרת הנוכחי. מכיוון ש-OrcaRouter פועל כפרוקסי, השהיית הרשת הנוספת היא מינימלית – בדרך כלל בתוך מילישניות בודדות מהשהיית ה-API הישיר של OpenAI. המודל תומך בהזרמה (streaming) עבור יישומים בזמן אמת.
יתרונות: יעילות עלות (המחיר הנמוך ביותר מבין בני משפחת GPT-4 בעלי תמיכה מולטימודלית), חלון הקשר גדול של 128k, יכולת חשיבה מתמטית איתנה (78.9 ב-MATH-500), והסקה מהירה יחסית למודלים גדולים יותר. הוא מטפל בקלטי תמונות וקבצים באופן מיומן למשימות כלליות. מגבלות: בחשיבה מורכבת ועדינה או בכתיבה יצירתית, הוא מפגין ביצועים נמוכים יותר בהשוואה ל-GPT-4o ול-GPT-4 Turbo. מעקב ההוראות שלו עשוי להיות פחות אמין למשימות הדורשות עיצוב קפדני או אילוצים מרובי-שלבים. בנוסף, בשל היותו מודל קטן יותר, מועד חיתוך הידע שלו (ינואר 2024) עשוי להיות מיושן עבור אירועים עדכניים מאוד. הוא גם אינו תומך ביכולות ראייה לזיהוי אובייקטים מדויק או זיהוי פנים.
המחירים נקבעו על $0.15 לכל מיליון טוקני קלט ו-$0.60 לכל מיליון טוקני פלט. אלו תעריפים סטנדרטיים של ספק OpenAI, ו-OrcaRouter גובה ללא תוספת מחיר בנוסף להם. החיוב מבוסס על ספירת טוקנים כפי שדווחה על ידי ספק המודל. אין עמלות נוספות לבקשה או דרישות מינימום. מדיניות ללא תוספת מחיר חלה על כל המודלים הזמינים דרך OrcaRouter, מה שהופך את המחירים לזהים למה שהייתם משלמים ישירות ל-OpenAI. שקיפות זו מאפשרת למשתמשים לתקצב במדויק ללא עלויות מפתיעות.
אסימוני פלט יקרים פי ארבעה לכל טוקן מאשר אסימוני קלט ($0.60 לעומת $0.15 למיליון). עבור משימות שמייצרות תשובות ארוכות, כגון סיכומים מפורטים או יצירת קוד, עלויות הפלט יכולות לשלוט. משתמשים יכולים לשלוט בשימוש בטוקני הפלט באמצעות הפרמטר max_tokens ועל ידי ניסוח הנחיות שמעודדות תשובות תמציתיות. לעומת זאת, משימות עם קלט גדול (למשל, עיבוד מסמכים ארוכים עם תמונות רבות) כרוכות בעלויות קלט. חלון ההקשר הגדול של 128k מקל על הכללת הקשר נרחב, אבל הדבר מגיע במחיר של תעריף הקלט לכל טוקן. איזון בין אורך הקלט לאורך הפלט הוא המפתח לניהול העלות הכוללת.
OrcaRouter אינה מציעה כרגע שמירה במטמון מובנית עבור בקשות GPT-4o-mini מעבר למה ש-OpenAI מספקת ברמת ה-API. אין הנחות כמות או אפשרויות קיבולת שמורה דרך OrcaRouter; התמחור הוא strictly pay-as-you-go בתעריף הספק של OpenAI. המשתמשים אחראים ליישם אסטרטגיות שמירה במטמון משלהם (למשל, בשכבת היישום) כדי להפחית קריאות API כפולות. מדיניות אפס התוספת פירושה שכל שינוי עתידי במחיר מצד OpenAI משתקף באופן אוטומטי. עבור מקרי שימוש בנפח גבוה במיוחד, הסכמי ארגון ישירים עם OpenAI עשויים להציע תנאים טובים יותר, אך דרך OrcaRouter הפשטות של מפתח API יחיד וחיוב מאוחד עדיין עשויה להיות יתרון.
תמונות המעובדות על ידי GPT-4o-mini מומרות לטוקנים בהתאם לרזולוציה ולרמת הפירוט שלהן. OpenAI משתמשת באלגוריתם חישוב טוקנים הלוקח בחשבון גם רוחב וגם גובה; לדוגמה, תמונה טיפוסית בגודל 1024x1024 בפירוט גבוה יכולה לעלות בסביבות 2,000–3,000 טוקני קלט. מכיוון שטוקני קלט מחויבים ב-$0.15 למיליון, העלות לתמונה נמוכה מאוד (בדרך כלל תת-סנט). עם זאת, עיבוד תמונות רבות בבקשה אחת יכול להצטבר. משתמשים יכולים לשלוט בעלויות על ידי שימוש ברמת פירוט `low` (עולה בערך 85 טוקנים לתמונה) כאשר אין צורך בנאמנות גבוהה. תמיד בדקו את הטוקנים שנעשה בהם שימוש בתגובת ה-API כדי להבין את עלויות התמונה.
יש להגדיר את כתובת ה-API הבסיסית שלך ל-https://api.orcarouter.ai/v1 ולהשתמש במזהה המודל "openai/gpt-4o-mini-2024-07-18". ה-API פועל לפי הפורמט הסטנדרטי של OpenAI לשיחות צ'אט. לדוגמה, ב-Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). כל הפרמטרים כגון temperature, top_p, max_tokens, stream, ו-stop sequences נתמכים כמו ב-API המקורי של OpenAI. התגובות כוללות שדות סטנדרטיים כמו id, choices, usage עם ספירות טוקנים.
לתפוקות דטרמיניסטיות, הגדר temperature=0 ו-top_p=1. למשימות יצירתיות, temperature בסביבות 0.8–1.2 עשויה להתאים. Max_tokens שולט באורך התגובה; ברירת המחדל היא 16,384. כדי להפחית עלות פלט, הגדר max_tokens לפי צרכיך. בשימוש בקלט מולטימודלי, מבנה את ההודעות עם מערך של חלקי תוכן: [{"type":"text","text":"Describe this:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. לעיבוד קבצים, כלול את תוכן הקובץ כטקסט או כ-base64. ניתן להשתמש בפרמטר stop כדי להפסיק יצירה ברצפים מותאמים אישית. Stream=True מאפשר מסירת אסימונים בזמן אמת.
הנדידה דורשת שלושה שינויים פשוטים: הגדר את base_url ל-https://api.orcarouter.ai/v1, החלף את מפתח ה-API שלך במפתח ה-API של OrcaRouter שלך, ושנה את מזהה המודל ל-"openai/gpt-4o-mini-2024-07-18". לא אמורים להיות צורך בשינויים נוספים בקוד אם אתה משתמש בספריות OpenAI Python/Node.js או בכל לקוח HTTP שעוקב אחר פורמט תשובות הצ'אט הסטנדרטי. מבנה התגובה זהה. שים לב ש-OrcaRouter אינו מגביל את הבקשות שלך באופן שונה מ-OpenAI; אותן מגבלות קצב חלות לפי רמת חשבון OpenAI שלך, אך אתה מנהל מפתחות דרך OrcaRouter. בדוק עם בקשה קטנה כדי לאמת ספירות אסימונים וזמן השהייה.
ספק את מפתח ה-API של OrcaRouter בכותרת ה-Authorization: Authorization: Bearer <your-key>. ה-API מחזיר קודי סטטוס HTTP רגילים: 200 להצלחה, 400 לבקשה שגויה (למשל, פרמטרים לא חוקיים), 401 להרשאה חסרה (מפתח API שגוי), 429 להגבלת קצב, ו-500 לשגיאות שרת. תגובות שגיאה כוללות גוף JSON עם אובייקט error המכיל message ו-type. מומלץ ליישם ניסיונות חוזרים עם backoff אקספוננציאלי עבור שגיאות 429 ו-5xx. OrcaRouter אינו משנה תגובות שגיאה מ-OpenAI, כך שאותן הודעות שגיאה שתראה עם ה-API הישיר יופיעו.
GPT-4o-mini הוא בעל יכולת גבוהה משמעותית מ-GPT-3.5-Turbo בהיגיון, מתמטיקה, וביצוע הוראות, כפי שהודגם בציון MATH-500 שלו של 78.9 לעומת הציון האופייני של GPT-3.5-Turbo בסביבות 30-40. הוא גם תומך בקלטים רב-מודליים (תמונות וקבצים), ש-GPT-3.5-Turbo לא תומך בהם. חלון ההקשר גדול יותר: 128k לעומת 16k. תמחור: GPT-4o-mini ($0.15/$0.60 למיליון טוקנים) יקר מעט מ-GPT-3.5-Turbo ($0.50/$1.50 לגרסת 16k? למעשה GPT-3.5-Turbo 0125 הוא $0.50/$1.50 למיליון? רגע, GPT-3.5-Turbo הסטנדרטי הוא $1.50/$2.00 למיליון? אסתפק בעובדות שניתנו: התמחור של GPT-4o-mini ניתן. השוואה איכותית: GPT-4o-mini מציע ביצועים טובים יותר בעלות מעט גבוהה יותר מ-GPT-3.5-Turbo, אך עם יכולת רב-מודלית.
GPT-4o-mini היא גרסה קטנה וחסכונית יותר של GPT-4o. בעוד ששתיהן חולקות יכולות מולטי-מודאליות ואותו גודל חלון הקשר (128k טוקנים), GPT-4o משיגה ציונים גבוהים יותר במבחנים כמו MMLU ו-MATH. הציון של GPT-4o-mini ב-MATH-500 הוא 78.9, נמוך מהציון המדווח של GPT-4o שהוא בערך 90–95. התמחור זול באופן משמעותי: GPT-4o-mini ($0.15/$0.60) לעומת GPT-4o ($2.50/$10.00 למיליון טוקנים). עבור יישומים שבהם דיוק מירבי במשימות חשיבה מורכבות הוא קריטי, GPT-4o היא המועדפת. עבור משימות בעלות תפוקה גבוהה ורגישות לעלות שבהן דיוק מתון מקובל, GPT-4o-mini מציעה חיסכון משמעותי.
מודלים בקוד פתוח כמו Llama 3 8B ו-70B מציעים יתרון של אירוח עצמי ללא עלות לכל טוקן, אך דורשים תשתית ומומחיות. GPT-4o-mini דרך OrcaRouter מספק גישה ללא שרת וללא עלויות מקדימות, עם קנה מידה אוטומטי. במבחני ביצועים, הציון של GPT-4o-mini ב-MATH-500 שהוא 78.9 מתחרה ב-Llama 3 8B (סביב 30-40) וקרוב ל-Llama 3 70B (סביב 60-70). GPT-4o-mini תומך גם בתמונות באופן טבעי, דבר שרוב המודלים בקוד פתוח אינם עושים. הפשרה: מודלים בקוד פתוח מציעים פרטיות נתונים (ללא קריאת API חיצונית) והשהייה נמוכה יותר אם קיימת חומרת הסקת מסקנות. GPT-4o-mini מציע קלות שימוש ויכולת רב-מודאלית במחיר נמוך לכל טוקן.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| קלט / 1M טוקנים | $0.150 |
| פלט / 1M tokens | $0.600 |
| קריאת מטמון / 1M | $0.075 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18פתיחה @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18