כרטיס כותרת ראשי שעליו כתוב 'GPT-Live-1 לעומת Gemini 3.5 Live Translate', עם כתובית המשנה 'גנרליסט שהושק מול מומחה בתצוגה מקדימה' והשורה 'GA ב-$0.05 לדקה לעומת preview בכ-$0.037 לדקה', מעל שני פאנלים: השמאלי מציג צורת גל אודיו בדופלקס מלא עם חצים המתעקלים בשני הכיוונים ותג 'GA' מלא, והימני מציג גלובוס עם שתי בועות דיבור ותג 'PREVIEW' במתאר, עם לוגו OrcaRouter משולב בפינה.
Guides & Insights

GPT-Live-1 לעומת Gemini 3.5 Live Translate: גנרליסט שהושק מול מומחה בתצוגה מקדימה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני המודלים האלה מושווים זה לזה כי שניהם מכניסים דיבור בזמן אמת לתוך API, וההשוואה מתפרקת ברגע שקוראים את כרטיסי המודל. GPT-Live-1 הוא מודל קולי דו-כיווני לשימוש כללי שאופרה‏נאיי העבירה ל-API למפתחים ב-10 בספטמבר 2026, שלושה חודשים אחרי שהוא הושק בתוך ChatGPT ב-8 ביולי. ג'מיני 3.5 Live Translate הוא מודל תרגום אודיו-לאודיו ייעודי יחיד שגוגל דיפ-מיינד השיקה ב-9 ביוני 2026, ומזהה המודל שלו עדיין נושא את המילה preview. את אחד מהם אפשר להציב היום מול לקוחות משלמים לפי תעריף מפורסם. את האחר גוגל יכולה לשנות מתחת לרגליים שלך בלי הודעת הפסקה. הא-סימטריה הזאת, ולא טבלת הבנצ'מרקים, היא מה שצריך להכריע את הבחירה.

שתי מכונות שונות הנושאות את אותה תווית

כדאי להיות בוטים לגבי עד כמה מעט הם חופפים. Gemini 3.5 Live Translate מבצע תרגום. הוא קולט אודיו בזרימה בשפה אחת ומחזיר אודיו בזרימה בשפה אחרת, תוך שמירה על קולו וטונו של הדובר, ביותר מ־70 שפות ויותר מ־2,000 זוגות שפות, עם זיהוי שפה אוטומטי ותפעול דו־כיווני. הוא לא מנהל שיחה, לא קורא לפונקציה ולא עונה על שאלה. זהו מנוע תרגום סימולטני.

GPT-Live-1 הוא הצורה ההפוכה. זהו מודל שיחתי: הוא מקשיב ומדבר בו-זמנית, מחליט פעמים רבות בשנייה אם להמשיך להקשיב, לעצור, להפריע או לקרוא לכלי, ומעביר עבודה כבדה — חיפוש באינטרנט, חשיבה מעמיקה יותר, משימות סוכניות — למודל חשיבה נפרד דרך Responses API בזמן שהשיחה נמשכת. הדוגמה המפורסמת של Ope​nAI עצמה ל-WebRTC מחברת את ההאצלה הזו ל-GPT-5.6 Terra. תרגום הוא אחד הדברים שהוא יכול לעשות; זהו לא מאפיין שלדגם של Goo​gle יש לו מקבילה בכיוון ההפוך.

אז השאלה המעשית צרה יותר ממה שהעימות הכותרות מרמז: אם מה שאתה בונה הוא מערכת פרשנות, המודל של Google בנוי למטרה זו וזה של OpenAI הוא כללי. אם מה שאתה בונה הוא סוכן קולי שמתרגם מדי פעם, GPT-Live-1 הוא היחיד מבין השניים שהוא אפילו בקטגוריית המוצר הנכונה.

מה העלות של כל אחד לדקת אודיו

כאן המומחה מצדיק את שכרו, והחשבון באמת לא נוח עבור OpenAI.

• GPT-Live-1 — 0.05$ לדקת קול, בחיוב לפי שנייה ולא בעיגול כלפי מעלה לדקה שלמה הבאה. חשיבה וקריאות לכלים שמבצע ה-backend המואצל מחויבות בנפרד בתעריפים הרגילים של אותו מודל.

• Gem​ini 3.5 Live Translate — $3.50 למיליון אסימוני קלט אודיו ו-$21.00 למיליון אסימוני פלט אודיו, כאשר החיוב מחושב לפי 25 אסימונים לשנייה של אודיו. בשילוב, זה מסתכם בכ-$0.037 בערך לדקה של אודיו מתורגם.

בחישוב דקות תרגום בלבד, Goo​gle זול בכרבע בערך. זה אינו הבדל של עיגול בקנה מידה גדול: 10,000 דקות פרשנות בחודש עולות כ-500 דולר בשכבת הקול של GPT-Live-1 לעומת כ-368 דולר ב-Gem​ini 3.5 Live Translate. והפער אמיתי ולא תוצר של שינוי שיטת המדידה, מפני ששני המודלים גובים לפי יחידות שונות לחלוטין.

יש מלכוד בכיוון ההפוך. המחיר המוצהר של $0.05 עבור GPT-Live-1 הוא מחירה של שכבת הקול בלבד. אם הסוכן שלך מתרגם וגם מחפש משהו, או מעביר משפט קשה למודל הסקה, אתה משלם על ההעברה הזו בנוסף — והמודל שאליו הועבר מתומחר לפי טוקן כמו כל מודל חוד חנית אחר. עומס תרגום בלבד לעולם לא מפעיל זאת. עומס של תרגום פלוס כל דבר אחר כן מפעיל זאת, והמנצח בהשוואה לפי דקה מפסיק להיות ברור מאליו.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

תווית התצוגה המקדימה היא הסיכון שאיש אינו מתמחר.

מזהה המודל של Gemini 3.5 Live Translate הוא gemini-3.5-live-translate-preview. הוא שוחרר אל Gemini Live API ואל Google AI Studio בתצוגה מקדימה ציבורית, ובמקביל נכנס אל אפליקציית Google Translate ב-Android וב-iOS ובתצוגה מקדימה פרטית ב-Google Meet עבור לקוחות Workspace נבחרים. תצוגה מקדימה משמעה מה שהיא תמיד משמעה ב-Google: אין הבטחת יציבות, אין חלון הפסקה (deprecation) מפורסם, ואין התחייבות שהתעריף שאתם משלמים ישרוד את המהדורה הבאה.

עבור אפליקציה לצרכנים זה בסדר. עבור עומסי העבודה שהמודל הזה מיועד להם בפועל — תרגום חי במוקד טלפוני, מוצר לפגישות, מוצר לנסיעות — זהו סיכון האינטגרציה הגדול ביותר בסטאק. אתם בונים תלות פרודקשן במודל ש-Goo​gle לא התחייבה לו במפורש.

ל-GPT-Live-1 יש הבעיה ההפוכה, והיא קטנה יותר אך אינה אפס. הוא זמין באופן כללי, בתעריף מפורסם, עם נקודת קצה מתועדת, והוא לא עומד להיעלם. אך משטח ה-API שלו צר באופן שמפתיע צוותים שמניחים שהוא משתלב ישירות באינטגרציית Ope​nAI קיימת: יש בדיוק מזהה מודל אחד, נקודת קצה אחת, ואין נתיב דרך Chat Completions, Responses, Realtime, Batch, Assistants או כוונון עדין. הדרך היחידה פנימה היא נקודת הקצה Live Sessions בכתובת v1/live/sessions מעל WebRTC, עם טיפול באירועים בערוץ נתונים. זו אינטגרציה חדשה, לא שינוי פרמטר.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

שפות, והיכן שהגנרליסט באמת חלש יותר

המספר של Google הוא יותר מ-70 שפות עם שימור קול וטון. התיעוד של OpenAI עצמה פחות בטוח באופן ניכר לגבי הכיסוי שלה: חומר ההשקה מציין שבשפות מסוימות המודל עשוי לדבר במבטא לא ילידי או להראות פערים בשטף, והיא אינה מפרסמת מספר שפות שמתחרה בזה של Google.

זה לא ספק שמתחמק — כך נראה מודל שיחה כללי לצד מומחה שאומן על הבעיה. אם הצעת הערך של המוצר שלך היא "אנחנו מפרשים 40 שפות היטב", המומחה הוא הבחירה הכנה והכללי יביך אותך בזנב הארוך. אם המוצר שלך הוא סוכן קולי לשוק דובר אנגלית עם תכונת תרגום שהודבקה לו, הפערים הלשוניים של הכללי לעולם לא יעלו.

שני המודלים מטביעים סימן מים באודיו שנוצר באמצעות SynthID, וזה חשוב אם אתם נמצאים בתחום שיפוט או בחוזה לקוח שמחייב הוכחת מקור לדיבור סינתטי. בנקודה הזו אין יתרון לאף אחד.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

היכן שארכיטקטורת ההאצלה משנה את הבנייה

ההבדל המבני בין השניים הוא ש-GPT-Live-1 הוא למעשה שני מודלים עם תפר באמצע. שכבת הקול משמרת את השיחה; מודל הסקה נפרד עושה את החשיבה. התפר הזה הוא המקום שאליו הולך המאמץ ההנדסי שלך, והוא גם המקום שבו מודל העלויות נעשה מורכב.

כדאי לדעת שהחצי המואצל הוא מודל טקסט רגיל שאפשר לנתב כמו כל מודל אחר. GPT-5.6 Terra, ה-backend בדוגמה של OpenAI עצמה, מוגש דרך OrcaRouter ב-$2.00 למיליון טוקני קלט ו-$12.00 למיליון טוקני פלט, עם חלון הקשר של מיליון טוקנים, כאשר גם /v1/chat/completions וגם /v1/responses חשופים. אם רוצים להחליף את מוח ההסקה שמאחורי סוכן קולי — במודל זול יותר בשיחות פשוטות, או בחזק יותר במקרי הסלמה — לחצי הזה של הסטאק יש אפשרויות, כי זו קריאת API רגילה שיושבת לצד בערך 190 מודלים אחרים במפתח אחד.

החלק הקולי לא עושה זאת. GPT-Live-1 אינו זמין ב-OrcaRouter, וגם לא Gem​ini 3.5 Live Translate; שניהם זמינים רק מהספק שיצר אותם. היכן שנתב מרוויח את מקומו בארכיטקטורה כמו זו הוא בכל מה שבמורד הזרם מהאודיו: מודלי הטקסט שמבצעים את האחזור, הסיכום, הכתיבה החוזרת ל-CRM וההסלמה, שזה החצי של החשבון שאתה יכול למעשה לאחד למפתח אחד ולחשבונית אחת.

מה באמת לבחור

• בחרו ב-Gemini 3.5 Live Translate אם התרגום הוא המוצר, המחיר לדקה חשוב יותר מיציבות החוזה, ואתם יכולים לספוג מודל בתצוגה מקדימה שמשתנה מתחתיכם. תקצבו בערך $0.037 לדקה ושמרו שכבת הפשטה מעל הקריאה כך שמודל GA יוכל להחליף אותו בלי שכתוב.

• בחרו ב-GPT-Live-1 אם אתם זקוקים לסוכן שיחתי שבמקרה גם מתרגם, אם אתם זקוקים לקריאה לפונקציות ולשימוש בכלים בתוך לולאת הקול, או אם צוות רכש ישאל מה יקרה כשהמודל ייצא משימוש ואתם זקוקים לתשובה טובה יותר מ"כלום, כנראה".

• אל תבחרו באחד מהם רק מפני שהוא זכה בבנצ'מרק. הבנצ'מרקים של שני הצדדים אינם ברי־השוואה — המספרים של full-duplex של Ope​nAI הם של Ope​nAI בלבד, ולא שוחזרו על ידי שום צד שלישי, והטענות הלשוניות של Goo​gle לא נבחנו מול מודל כללי על אותו סט אודיו.

הערה צופה פני עתיד: שני המשטחים מתכנסים ולא מתנגשים. מודל התרגום של Google כבר חי בתוך Gemini Live, ושכבת הקול של GPT-Live-1 תוכננה במפורש כך שמודלים חדשים מהחזית יוזרקו מאחוריה. הציפייה הסבירה היא שבתוך כמה מחזורי שחרור התרגום של הגנרליסט ישתפר, וסיפור האינטגרציה של המומחה יפסיק להיות הימור כה גדול. אם אתם בונים היום וההחלטה צמודה, זהו טיעון לטובת האפשרות הזולה והניתנת להחלפה יותר, ולטובת שמירה על נתיב האודיו מבודד מאחורי ממשק כך או כך.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית