כרטיס כותרת גיבור שנוצר, שעליו כתוב: בריף אחד, שני מודלים, סרטון אחד עם קריינות, מחולק לשתי עמודות. בעמודה השמאלית, שכותרתה Claude Opus 5.5, כתוב: כותב את התסריט; שוחרר ב-22 בספטמבר 2026; 4.00 דולר בקלט ו-20.00 דולר בפלט למיליון טוקנים. בעמודה הימנית, שכותרתה Gemini 3.8 Flash TTS, כתוב: מקריא אותו בקול; זמין באופן כללי ב-22 בספטמבר 2026; 9.00 דולר למיליון טוקני אודיו. בשורת כותרת תחתונה כתוב: רנדור של 5 דקות ו-51 שניות הוא כ-8,775 טוקני אודיו, בערך 8 סנט של קריינות.
Guides & Insights

קלוד אופוס 5.5 וג'מיני 3 פלאש TTS הפיקו סרטון חדשות בקריינות: התקציר, שני כרטיסי התעריפים, וכמה עולה הקול

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני מודלים, שני ספקים, סרטון מוגמר אחד, ופרומפט קצר מספיק כדי להדביק אותו בתיבת צ'אט. ב-2 באוקטובר 2026, הכותב בשפה הסינית בתחום ה-AI 宝玉 (X/@dotey) פרסם שני רנדרים של אותו סיכום רכילות — אחד באנגלית ואחד בסינית — ואמר ששניהם נבנו מקצה לקצה על ידי Claude Opus 5.5, שמצא את החומר בעצמו וכתב את הקריינות בעצמו, כשאת הקול סיפק Gemini 3.8 Flash TTS באמצעות מפתח API שסיפק המחבר. אף אחד מהמודלים אינו חדש: Anthropic הוציאה את Claude Opus 5.5 ב-22 בספטמבר 2026, והערות השחרור של Google מתארכות את מודלי הטקסט-לדיבור של Gemini 3.8 לאותו יום. מה שרק בן ימים ספורים הוא האריזה — בריף המפיק עצמו, וסדרה של מאגרי קוד שנוצרו בין 30 בספטמבר ל-3 באוקטובר, שהופכים את הבריף הזה לסקיל של Claude Code שאפשר להתקין. זהו מאמר על זרימת העבודה, לא על השקה.

מה שהבריף למעשה מפרט

התבנית היא משפט אחד עם שלוש משבצות. בתרגום לאנגלית מהמקור בסינית, היא מנוסחת כך: צור לי סרטון רכילות על {נושא} (חומר משלים: {קישורים/צילומי מסך, אופציונלי}; גרסה ללא זיהוי: הסר {שם האדם}, אופציונלי). כל מה שמעניין בפורמט חבוי בשלוש המשבצות האלה, מפני שתדריך כל כך קצר ניתן להאצלה רק אם הנמען יכול לעשות שלושה דברים בלי שיגידו לו: למצוא את חומר המקור של עצמו, להחליט מהו הסיפור, ולהחזיר תוצר מוגמר ולא תוכנית.

הנושא הוא מחרוזת טקסט חופשי, כך שהמודל מבצע בחירה עריכתית — מה נחשב לסיפור, אילו נקודות עלילה לכלול, באיזה סדר הן מופיעות. זו עבודה שונה מתמצות, וזה החלק בצינור העיבוד שעליו יש למפעיל את השליטה המועטה ביותר. החומר המשלים האופציונלי הוא פתח המילוט: הדבק קישור או צילום מסך והמודל עובד ממקור קבוע במקום לחפש, וזה ההבדל בין רינדור שניתן לשחזר לבין סרטון שונה בכל פעם שמריצים אותו. המשבצת השלישית, הסרת מידע רגיש, היא זו שכדאי להתעכב עליה, ונחזור אליה.

קרא את הבריף כמפרט, והוא אומר לך מה הוא מניח לגבי ההארנס. הוא מניח שהמודל יכול להגיע אל העולם החיצון — שלב הגילוי מואצל, לא מתואר — ומה שהמודל יכול להגיע אליו הוא תכונה של הכלים שהמפעיל מרכיב, לא של Claude Opus 5.5 עצמו. הוא מניח סטאק תמונות או רינדור, מכיוון שהתוצר הנמסר הוא וידאו ו-Claude Opus 5.5 אינו מפיק וידאו. והוא מניח קול.

חלוקת העבודה היא הסיפור

ההנחה האחרונה היא העובדה המבנית של תהליך העבודה הזה. הרשומה שלנו בקטלוג עבור anthropic/claude-opus-5.5 מפרטת את מודאליות הקלט שלו כטקסט, תמונה וקובץ, ואת מודאליות הפלט שלו כטקסט — רק מודאליות אחת ביציאה. המודל אינו יכול לסנתז דיבור, והוא אינו יכול לשמוע רצועה ברגע שהיא קיימת. לכן כל סרטון מסופר שנבנה בדרך זו תלוי בלפחות שני מודלים, עם שני מחירונים, שני ספקים ושני אישורים, והשני חייב להיות מסופק על ידי אדם. Opus 5.5 יכול לכתוב את התסריט ולחווט את הרינדור; הוא אינו יכול לפתוח חשבון Google או להקצות מפתח. מחבר הפוסט מ-2 באוקטובר אומר בדיוק את זה: מפתח Gemini היה שלו.

לאילוץ הזה יש קצה שני שקל להחמיץ עד שמשחררים אותו לאוויר. מכיוון ש-Claude Opus 5.5 לא קולט אודיו, המודל שכתב את הקריינות לא יכול לבדוק את הקריינות. שמות שנהגים באופן שגוי, הדגשה מוזרה, משפט שהסינתיסייזר מקריא שטוח — שום דבר מזה לא מגיע למודל שחיבר אותה. בקרת האיכות על הקול היא אדם שמקשיב לפלט, בכל פעם מחדש, וזה השלב שמונע מכך להיות צינור עבודה ללא השגחה, לא משנה כמה התסריט טוב. כשהיצירה של המודל עצמו היא תוכנית, הביקורת היא האזנה, לא דיף.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

מה שהקול עולה — וזה לא החלק היקר

דף התמחור של Google מפרסם את יחס ההמרה שהופך את החשבון הזה לחלק: טוקני אודיו תואמים ל-25 טוקנים לשנייה של פלט. שני הרנדורים בפוסט מ-2 באוקטובר נמשכים 351 שניות ו-332 שניות, כפי שנקרא מהמטא-נתונים של המדיה של הציוץ עצמו — בערך חמש דקות וחמישים ואחת שניות וחמש דקות ושלושים ושתיים שניות. בקצב של 25 טוקנים לשנייה אלה 8,775 ו-8,300 טוקני אודיו, ובתעריף האודיו הנוכחי של Flash TTS העומד על $9.00 למיליון טוקנים, זה בערך שמונה סנטים של קריינות לכל סרטון ובערך חמישה עשר סנטים עבור שתי גרסאות השפה יחד.

הציבו את זה לצד החלק החשיבתי של אותה עבודה. מחיר המחירון של Claude Opus 5.5 הוא $4 למיליון אסימוני קלט ו-$20 למיליון אסימוני פלט, כאשר אסימוני חשיבה מחויבים כפלט, וקריאות מטמון ב-$0.20 למיליון. קריינות של סרטון בן שש דקות היא שגיאת עיגול לעומת האסימונים שהמודל מוציא על ההחלטה מהו הסיפור, על קריאת מקורות ועל כתיבת התסריט שהקול מקריא. המסקנה המעשית אינה "TTS הוא זול" — אלא שבפייפליין הזה הקול הוא סעיף ההוצאה היחיד שאין צורך לייעל, והמאמץ שייך לחלק שעולה בדולרים.

שני פרטים בכרטיס התעריפים ישנו את החישוב הזה, לכן היערכו בהתאם להם כבר עכשיו:

• חלון המבצע נסגר — Flash TTS standard הוא $0.50 למיליון אסימוני טקסט בקלט ו-$9.00 למיליון אסימוני אודיו בפלט עד 31 בדצמבר 2026, ואז $1.00 ו-$18.00. הקריינות של אותו סרטון עולה כ-16 סנט בינואר, בדיוק כפול.

• קיים מסלול זול יותר עם פשרה אמיתית — Gemini 3.8 Flash-Lite TTS מחייבת $0.50 ו-$6.00 לפי אותו לוח זמנים, ועולה ל-$1.00 ו-$12.00, ומכסה 101 שפות לעומת 130 של Flash TTS. עבור סרטון הסבר עם קריין יחיד באנגלית, התעריף של Lite הוא שני שלישים מתעריף האודיו, ותקרת השפות אינה רלוונטית; עבור הרינדור הדו-לשוני בפוסט מ-2 באוקטובר, לא ברור מאליו שהיא אינה רלוונטית, וזו ההחלטה שפיצול המסלולים מבקש ממך לקבל.

השכבה Batch ו-Flex של גוגל היא $0.25 בקלט ו-$4.50 בפלט, ו-Priority הוא $0.90 ו-$16.20 — כדאי לדעת אם הרינדורים שלך נמצאים בתור ולא אינטראקטיביים, כי שום דבר בסיכום רכילות לא מצריך תשובה בזמן אמת.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

השבוע הבריף הפך למיומנות

פרומפט בציוץ הוא הדגמה; מאגר הוא דבר שאפשר להתקין. המאגרים שהופיעו סביב הפורמט הזה הם החלק שבאמת נמצא בשבעת הימים האחרונים, וכדאי לקרוא אותם בנפרד ולא כקבוצה, מפני שכל אחד מהם מהמר הימור שונה לגבי כמה מהפייפליין צריך להיות מקובע בקוד.

• hoangduong92/idea-to-film-skill — נוצר ב-30 בספטמבר 2026, ברישיון MIT, וההתאמה הקרובה ביותר לפוסט מ-2 באוקטובר: מיומנות של Claude Code שלוקחת רעיון לסרט קצר מדובב ב-MP4 עם אנימציה מצוירת בקוד, מוזיקה, אפקטי קול, קול Gemini TTS וכתוביות. הקול מוזכר בשמו בתיאור, וזו הדרך הישרה לשחרר את זה: הספק השני הוא תלות מוצהרת, לא נסתרת.

• samuelstroschein/opus-video-generator — נוצר ב-2 באוקטובר, ברישיון MIT, והוא הנחרץ ביותר בכל הנוגע לאישורים: הוא יוצר סרטוני השקה בדפדפן שלך במנוי Claude שלך, ופועל דרך npx. זו תשובה שונה לבעיה המרכזית שלעיל — להשאיר את הזכאות הקיימת של האדם במעגל במקום להנפיק מפתח API חדש לסוכן.

• makevoid/motion-graphics-music-video-skill-noimage — נוצר ב-2 באוקטובר, ברישיון MIT, וזה עם משמעת ששווה להעתיק: הוא מציין בתיאור שלו שהוא לא משתמש במודל תמונות ולא במודל וידאו, ומייצר מושן גרפיקס מרצועת מוזיקה ופרומפט. כשהשלב הגנרטיבי היחיד הוא קוד, הפלט ניתן לשחזור, וכל רישיון נכס ביצירה המוגמרת הוא שלך לשקול.

• RohanRatwani/explainer-video-opus-5.5 — נוצר ב-2 באוקטובר, ברישיון MIT, וממוקד בסרטון ההסבר בפורמט 16:9 ובפורמט Shorts ולא בסיכום הרכילות, והוא מציין במפורש את בעיית התזמון: כל אנימציה מתוזמנת לקריינות. סדר זה חשוב, מפני שהוא אומר שהאודיו מעובד לפני שהאלמנטים החזותיים ממוקמים.

• zhuyansen/awesome-opus-5.5-video — נוצר ב-27 בספטמבר, ללא רישיון מוצהר, והבולט בהרבה מכל השאר בקבוצה עם 67 כוכבים, בעוד האחרים בספרות בודדות או באפס. זהו אינדקס ולא כלי, באנגלית ובסינית, ועצם קיומו הוא אות מועיל לגבי צורת העניין: מה שאנשים רוצים קודם כול הוא קטלוג של מה שאחרים טוענים שיצרו, והכלים מגיעים אחר כך.

אף אחד מאלה אינו תלות יציבה. הם בני ימים ספורים בלבד, יש להם מחבר יחיד, ותנאי הרישיון שלהם הם הדבר היחיד שעומד בינך לבין קטע צילום שאינך יכול להשתמש בו. אבל הכיוון הוא העיקר: הפרומפט בציוץ הוא אב-הטיפוס, והמיומנות במאגר היא מה שצוות היה מאמץ בפועל.

שתי גרסאות לשוניות, סיפור אחד

הפוסט מ-2 באוקטובר הוא דו-לשוני במכוון — גרסה באנגלית וגרסה בסינית של אותו נושא. זה יוצא דופן להדגמה, וזה חושף משהו אמיתי درباره הפורמט הזה: שרכילות לא עוברת דרך תרגום. הפעימות שנושאות סיפור בשוק אחד (מי אמר מה למי, איזו הכחשה נמסרה, איך נראה ציר הזמן) אינן הפעימות שנושאות אותו בשוק אחר, כך שהגרסה השנייה היא שכתוב עם שיקול דעת עריכתי שונה, ולא מעבר תרגום. מה שכן עובר הוא השלד: אותו מבנה סיפור, אותה מחסנית רינדור, אותו קול.

לתוצאה העלויותית יש היקף קטן, אך בכיוון הנכון. לפי החשבון שלעיל, הוספת השפה השנייה עולה כתשעה סנטים של אודיו נוסף, לעומת סיפור שהמודל כבר חקר פעם אחת. כשהחלק היקר בצינור העבודה הוא החשיבה והחלק הזול הוא הפלט, הפקת גרסה שנייה בשפה אחרת היא כמעט בחינם — וזהו טיעון לכך שיש להתייחס ללוקליזציה כתוצר מרכזי של זרימת העבודה ולא כפרויקט נפרד.

דה-אידנטיפיקציה היא עריכה, לא מחיקה

המשבצת השלישית בבריף היא זו שאמורה להאט אותך. 去敏 — דה-סנסיטיזציה, גרסה נטולת-זיהוי שמסירה אדם נקוב בשם — מוצעת כפרמטר אופציונלי, כאילו מחיקת שם היא פילטר שמפעילים. זה לא כך. מקבץ רכילות על אירוע שניתן לזהותו, לאחר הסרת השם, עדיין עוסק בדרך כלל באותו אדם: הקורא מספק את השם מההקשר, והכול, מהכותרת ועד לתמונה הממוזערת, יכול לשאת את המזהה. הסרת המחרוזת משנה את מה שהסרטון מצהיר שהוא עוסק בו בלי לשנות במי הוא עוסק, ואם הסיבה שלך להסרת השם היא משפטית או תדמיתית, המחרוזת אינה החלק שיצר את החשיפה.

שני דברים נובעים מכך עבור כל מי שמפיץ את הפורמט הזה. ראשית, חובת המקור אינה עוברת ממך רק משום שהמגיש סינתטי: סקירה מיוצרת ששואבת מדיווחים של אחרים יורשת את החובה לומר מהיכן הגיע הדיווח, והבריף בפוסט מ-2 באוקטובר אינו מכיל משבצת מקור בכלל — זהו פער שהמפעיל צריך למלא ביד. שנית, התוצר הוא סינתטי באופן לגיטימי, ולא מספרים למאזין זאת אלא אם כן תספר לו. תווית היא שורת טקסט אחת, וזה ההבדל בין דמו לבין תוכן שמטעה צופה לגבי מה שהוא צופה בו. אם אתה רוצה שהפרמטרים ישאו במשקל הזה, הכנס את הגילוי לבריף והתייחס אליו כאל חובה, כפי שצריך לציין את שם הספק של הקול ולא להסתיר אותו.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

מריץ את זה על מקש אחד, והמקש האחד שהוא עדיין לא מכסה

אם אתם בונים את הפייפליין הזה, עלות האינטגרציה אינה הקריאות למודל — אלא הקרדנציאל השני. ניתן לנתב את Claude Opus 5.5 עוד היום בתור anthropic/claude-opus-5.5 במחיר המחירון של Anthropic עצמה — 4$ ו-20$ למיליון טוקנים, מועבר בתוספת של 0%, כך ששינוי מחיר של ספק מגיע לחשבונית שלכם באותו היום ולא בסקירת החוזה הבאה. ניתוב שלו לצד שאר הפייפליין שלכם דרך נקודת קצה אחת תואמת OpenAI הוא מה שמסיר את ה-SDK השני, ומעבר אוטומטי לגיבוי הוא מה שמאפשר לכם לנסות מודל חדש יותר או פחות מוכח על רינדור פנימי מבלי לתלות בו את נתיב הייצור.

הגבול האמיתי הוא הקול. נקודות הקצה Gemini 3.8 Flash TTS ו-Flash-Lite TTS של Google אינן בקטלוג שלנו היום — ה-API הציבורי של המודלים מחזיר not-found עבור google/gemini-3.8-flash-tts — ולכן תהליך העבודה בפוסט מ-2 באוקטובר אכן דורש מפתח Google של המחבר עצמו, וזה אילוץ אמיתי ולא אילוץ זמני שאפשר לנופף בו.נקודת הקצה ל-TTS שאנחנו כן מציעים היא הישנה יותר google/gemini-3.1-flash-tts-preview, בתעריף של $1.00 למיליון אסימוני טקסט בקלט ו-$20.00 למיליון אסימוני אודיו בפלט: ניתנת לשימוש באותה צורת pipeline, בתמחור של הדור הישן יותר, ולא המודל שתהליך העבודה הזה נבנה עליו. בחרו את הדרך שלכם בידיעה — מפתח אחד לרכיב החשיבה ומפתח שני לקול, או מפתח אחד וה-TTS הישן יותר.

מה לצפות

הדבר שהיה הופך את הפורמט הזה למשעמם, במובן הטוב, הוא מודאליות אודיו במודל המפיק. עד ש-Claude Opus 5.5 — או מה שיחליף אותו — יוכל לשמוע את הרצועה שהוא הזמין ולהתאים אותה, הקול נשאר שלב שנבדק ידנית, והצינורות האלה נשארים עם אדם בתוך הלולאה מכוח המבנה ולא מכוח מדיניות. שימו עין על מאגרי המיומנויות בשבועיים הקרובים ולא על ההדגמות: אלה שישרדו יהיו אלה שמצהירים על הספקים שלהם, נושאים רישיון, ומאפשרים לכם להריץ מחדש את אותו תדריך ולקבל את אותו סרטון. הפרומפט בפוסט מ-2 באוקטובר ייראה כמו החלק הקל, כי הוא היה כזה.

לצינור שכבר מחזיק בחומר ובתסריט משלו, חשבו את המספר שלכם בעצמכם במקום ללוות מספר מ-X: בקצב של 25 טוקנים לשנייה, כל דקה של קריינות מוגמרת היא 1,500 טוקנים אודיו וכ-1.35 סנט לפי התעריף הנוכחי של Flash TTS — נתון שאפשר לבדוק מול מחירון לפני שאתם מקצים משבצת הפקה למנחה סינתטי.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית