Ett hero-kort för "Tavus Griffin vs Google Veo 3.1" med tre chips med texterna "Veo 3.1 — SynthID på varje bildruta", "Griffin — 48 % i en live-studie blev lurade" och "Veo 3.1 Standard — från 0,40 USD per sekund", ovanför sex rader: Griffin-proveniens: ingen publicerad; Veo-proveniens: SynthID plus C2PA; Griffin-pris: inget publicerat; Veo-pris: 0,40 USD per sekund; Griffin-status: forskningsförhandsvisning; Veo-status: allmänt tillgänglig. Sidfot: "Priserna för Veo 3.1 är Google Gemini API:s listpriser; Griffin är en forskningsförhandsvisning utan prissättning."
Guides & Insights

Tavus Griffin vs Google Veo 3.1: Den ena vattenmärker varje bildruta, den andra lurade 48 % av ett rum

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ Tavus Griffin och Google Veo 3.1 sida vid sida och den konventionella jämförelsen – pris per sekund, Elo, klipplängd – faller samman omedelbart, eftersom bara en av dem har ett pris och bara en av dem får poäng utifrån något som en köpare kan slå upp. Men under ytan finns det en verklig axel, och det är inte kvalitet. Googles svar på syntetiska medier är att göra dem detekterbara: varje resultat från Veo 3.1 bär SynthID, en osynlig vattenstämpel som skrivs in i pixlarna bildruta för bildruta och i ljudspektrumet, plus C2PA Content Credentials som registrerar filens härkomst, och Google har släppt en detektor i Gemini-appen så att en användare kan fråga om Google AI har skapat ett klipp. Tavus Griffins angivna skäl att finnas i förhandsversion i stället för som en produkt är spegelbilden: i Tavus egen live-studie avslutade 26 av 54 deltagare ett enminuters videosamtal i tron att deras samtalspartner var en riktig person, mot 1 av 41 med företagets tidigare stack, och Tavus säger att man håller tillbaka modellen tills man har kommit fram till hur man ska avslöja vad den är. En av dessa leverantörer säljer detektion. Den andra är för närvarande anledningen till att detektion spelar roll, och vet det.

Två produkter byggda på motsatta antaganden

Veo 3.1 är en klippgenerator med en avsiktligt snäv ram. På Googles Gemini API producerar den 4, 6 eller 8 sekunder per pass vid 24 fps, med inbyggd 720p-upplösning, medan 1080p och 4K kommer via ett uppskalningspass som lades till i en uppdatering i januari 2026. Förlängning lägger till sju sekunder per pass och kan upprepas upp till tjugo gånger för ett teoretiskt tak på omkring 148 sekunder, men indata måste vara ett Veo-genererat klipp på högst 141 sekunder i 720p i 16:9 eller 9:16, och längden på åtta sekunder är obligatorisk för förlängning, för indata med referensbild och för allt över 720p. Du kan inte skapa ett fyra sekunder långt 1080p-klipp. Utdata är en fil som du äger, med vattenstämpel och en bifogad signerad provenienspost.

Griffin producerar inte en fil. Den för en konversation. En motor för kontinuerlig konversationsmodellering tar in ljud och video och omvärderar utbytet i intervall kortare än en sekund, väljer om den ska vara tyst, signalera, ge en backchannel eller ta turen, och sänder ut expressiva kontroller som driver en strömmande talgenerator och en strömmande videogenerator tillsammans. Videogeneratorn producerar 720p i segment om 320 ms, en latent i taget, vid 25 fps från ett enda referensfotografi, och spelar upp varje segment medan det avkodas. Det finns ingen klipplängd eftersom det inte finns något klipp; det finns en session som fortsätter tills någon slutar prata.

Den distinktionen avgör nästan varje annan rad i den här jämförelsen. Veo 3.1:s ram är en uppsättning begränsningar som en produktionspipeline kan planera kring – tagninglistor på åtta sekunder, en förlängningsstege för längre tagningar, en fast 24 fps, en känd upplösningsstege. Griffins utdata går inte alls att storyboarda i förväg, eftersom det som renderas beror på vad personen gör härnäst.

Vad Veo 3.1 kostar, på varje nivå

Googles publicerade priser för Gemini API inkluderar ljud, per sekund utdata, och det finns ingen kostnadsfri nivå på någon Veo 3.1-nivå. Ljud kan inte inaktiveras i det API:et – det genereras vid varje begäran – vilket spelar roll eftersom tredjepartskällor beskriver ett prisblad för Vertex AI där tyst video ligger på ungefär hälften av den ljudinkluderande siffran. Googles egen dokumentation visar inte den växeln. Om ett tyst pris har betydelse för din faktura bör du bekräfta det mot din egen Vertex-fakturering i stället för en jämförelsesida, inklusive denna.

• Veo 3.1 Standard — $0.40/s vid 720p och 1080p, $0.60/s vid 4K.

• Veo 3.1 Fast — $0,10/s vid 720p, $0,12/s vid 1080p, $0,30/s vid 4K.

• Veo 3.1 Lite — 0,05 $/s vid 720p, 0,08 $/s vid 1080p, utan någon 4K-nivå.

Ställ åttasekundersregeln mot de priserna, och kostnaden per försök är vad ett kreativt team faktiskt budgeterar: 32 cent för en åtta sekunder lång 1080p-tagning på Standard, 80 cent för en fyra sekunder lång tagning i samma upplösning eftersom åttasekundersgränsen inte gäller under 720p, och 4,80 dollar för en enda åtta sekunder lång 4K-tagning. Det sista talet är det man bör stanna upp vid, eftersom en sökning med fyra försök efter en användbar 4K-tagning ligger på strax under tjugo dollar, och kravet på åtta sekunder gör att du inte kan testa idén på halva längden för halva priset.

Griffin har inget pris, ingen gratisnivå och ingen prislista av något slag. Griffin-Lite är tillgängligt för utvalda betrodda testare som en forskningsförhandsvisning via ett förfrågningsformulär, finns inte på Tavus-plattformen, och tillkännagivandet är tydligt med att det inte kommer att vara tillgängligt för kundanvändning för närvarande. Tavus avslutande rad på sidan är att Griffin kommer att komma när företaget har listat ut hur det kan släppas på ett säkert sätt. Varje påstående i den här artikeln som jämför de två i något som liknar ett köpbeslut har ett hål i Griffins halva av det, och ingen mängd efterforskning fyller det.

Vad de två resultattavlorna faktiskt mäter

De två modellerna har utvärderats med olika instrument av samma anledning som de är svåra att prissätta mot varandra.

Veo 3.1 finns på Artificial Analysis videoarena, där Elo kommer från blind parvis mänsklig preferens över korta klipp. Läs den 2 oktober 2026 på text-till-video-tavlan med ljud:

• Veo 3.1 — 18:e–21:a, Elo 968 (±11) över 2 857 röster, $24,00/min.

• Veo 3.1 Fast — 18:e–21:a, Elo 961 (±10) över 3 595 röster, $7,20/min.

• Veo 3.1 Lite — 21:a–24:e, Elo 949 (±11) över 2 762 röster, $4,80/min. • Veo 3.1 i bild-till-video (med ljud) — 11:e av 34, Elo 1 082 över 7 049 röster, $24,00/min. Dess bästa placering på någon lista, och den med flest röster bakom sig.

Två saker framgår av detta. Alla tre nivåerna ligger inom nitton Elo-poäng från varandra med överlappande konfidensintervall, så standardnivåns fyra gånger högre pris per sekund köper inte någon mätbar blind preferens. Och Googles egen nyare Gemini Omni Flash-serie rankas högre än varje Veo 3.1-nivå på samma resultattavla — 7:e–8:e plats vid Elo 1 117 över 7 801 röster och $9,12/min, före alla tre nivåerna samtidigt som den kostar mellan en fjärdedel och en femtedel så mycket per minut — vilket är en fråga som varje Veo 3.1-köpare borde ställa, och en som den här artikeln inte är rätt plats att besvara.

Griffins siffror kommer från NVIDIAs VideoFDB, ett benchmark för full-duplex audiovisuell konversation som NVIDIA byggde och poängsatte oberoende i september 2026. Griffin-Lite fick 3,83 av 5 på generationsspåret mot en mänsklig referens på 3,92, medan det näst högst rankade publicerade systemet fick 2,80, och 3,73 på perceptionsspåret mot en mänsklig referens på 4,20. Tavus rapporterar också 0,43 sekunders faktisk ljud-till-video-latens för generatorn mot fyra publicerade streaming-diffusionsbaslinjer på H100s, och beskriver det som hälften av den näst snabbaste.

Ingen av uppsättningarna överförs. Ett Elo från preferensröstning på korta klipp säger inget om huruvida en modell kan avbrytas; en bedömares poäng enligt bedömningsmallen för konversation säger inget om huruvida ett klipp ser rätt ut i 4K. Och förbehållen gäller åt båda hållen: Griffins gap på 0,09 poäng till den mänskliga referensen är tillräckligt litet i en femgradig bedömningsmall bedömd av en språkmodell för att "nära mänsklig" ska vara den ärliga tolkningen, och en del av dess perceptionsförsprång är mätt mot system som körs helt utan videoindata.

A screenshot of the middle of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026, covering rows eleven to twenty-four: grok-imagine-video-1.5 at Elo 1,046, HappyHorse-1.1 at 1,045, Wan2.7-260612 at 1,032 with 4,645 votes and $9.00/min, HappyHorse-1.0 at 1,026, Kling 3.0 Omni 1080p Pro at 1,018, Kling 3.0 1080p Pro at 1,000 with 4,844 votes, PixVerse V6 at 987, Veo 3.1 at 968 with 2,857 votes and $24.00/min, Veo 3.1 Fast at 961 with 3,595 votes and $7.20/min, MAGI-2 Preview (0912) at 960, LTX-2.5 Fast at 950, Veo 3.1 Lite at 949 with 2,762 votes and $4.80/min, LTX-2.5 Pro at 944 and Vidu Q3 Pro at 941.

Proveniens, vilket är den verkliga produktskillnaden

För ett företag med någon form av upplysningsskyldighet är detta det enda avsnittet som spelar roll, och det är inte ens nära.

Veo 3.1:s utdata bär SynthID bildruta för bildruta i pixlarna och i ljudspektrumet, utformat för att överleva komprimering, storleksändring, beskärning och skärminspelning, och C2PA Content Credentials registrerar filhärkomst och redigeringshistorik, interoperabelt med Adobes och Microsofts implementationer. Google har rullat ut detektering i Gemini-appen, så en användare kan ladda upp en video och fråga om Google AI har skapat den, där detekteringen rapporterar vilken del av ljud- eller videospåret som bar märket. Begränsningen är verklig och värd att nämna: den detektorn känner bara igen Googles modeller. Inget i Alibabas eller Kuaishous utbud är jämförbart, och inget från Tavus är det heller.

A screenshot of Google DeepMind's SynthID page, captured 2 October 2026: the Google DeepMind wordmark, the "SynthID" heading, the strapline "A tool to watermark and identify content generated through AI", the section tabs Overview / How it works / Hands-on, the heading "What is SynthID?", and a "Build with Gemini" panel with a Try Gemini link.

Tavus har inte publicerat en vattenstämpel, en detektor eller en pipeline för content credentials för Griffin. Det man har publicerat är anledningen till att man behöver en. Ansikte-mot-ansikte-studien är ovanligt frispråkig om felmoden: över hälften av deltagarna uppgav att möjligheten att det var en AI inte hade fallit dem in under samtalet, nästan alla i den gruppen drog slutsatsen att deras samtalspartner var verklig, och de som ändå misstänkte något brukade komma på det inom de första tjugo sekunderna. De som trodde var i genomsnitt 79 % säkra och tvivlarna 81 %. Det är en modell vars bedräglighet inte är en bieffekt av genereringskvaliteten – det är genereringskvaliteten.

Tavus svar finns i tillkännagivandet snarare än i en fotnot: samma egenskaper som gör Human Interaction Models till kraftfulla gränssnitt för naturlig kommunikation gör att de kan lura en människa att tro att det inte är AI, ytterligare anpassnings- och säkerhetsrutiner krävs för säker lansering, och företaget arbetar med säkra funktioner för avslöjande och tillsammans med organisationer som arbetar med AI-säkerhet. Det är därför spärren finns. Griffin-Lite kommer inte att vara tillgängligt för kundanvändning i nuläget.

De företagsvillkor som Google erbjuder men inte Tavus.

Veo 3.1 tillhandahålls via Vertex AI med den regionala infrastruktur, IAM och företagsavtalsyta som det innebär, och Google begränsar vad modellen får göra beroende på jurisdiktion: via en parameter för persongenerering tillåter EU, Storbritannien, Schweiz och MENA endast vuxna personer, medan andra regioner kan tillåta alla. Det är en dokumenterad, regionsmedveten policyyta, och för en reglerad köpare kan den väga tyngre än en placering på en topplista.

Det finns en kostnad kopplad till dess utformning. Veo 3.1:s modell-ID:n på Gemini API är fortfarande förhandsversions-ID:n – veo-3.1-generate-preview och dess syskon – medan Vertex-SKU:n har en namngivning för allmän tillgänglighet, och rapporter från tredje part anger att förhandsversionskvoten är ungefär en femtedel av produktionskvoten. Google avvecklade de äldre Veo 3.0-SKU:erna den 30 juni 2026, vilket säger en hel del om hur generationsväxling hanteras och är värt att räkna in i prissättningen av allt som byggs på ett förhandsversions-ID. Konsumentsidan är också verkligt begränsad: Flow kräver en Google AI Pro- eller Ultra-prenumeration och är blockerat i EU, Storbritannien, Indien, Indonesien, Kinas fastland och Ryssland, utan att någon VPN-lösning erbjuds.

Griffin har inga användarvillkor att läsa, eftersom det inte finns någon tjänst. Åtkomst sker via ett ansökningsformulär och en forskningsförhandsvisning. Tavus har sagt att de arbetar med säkerhetsorganisationer kring utvärderingar och vill att människor ska delta i dem, vilket är en forskningshållning snarare än en kommersiell.

Att få någon av dem

Veo 3.1 är åtkomligt via Gemini API, Vertex AI, Google AI Studio och Flow, samt via Gemini-appen, men endast i 720p. Utanför Kina är det med bred marginal den av de två som är enklast att skaffa en nyckel till, vilket talar emot kvalitetsargumentet ovan och är huvudanledningen till att den här jämförelsen förblir intressant trots siffrorna.

Griffin kan nås genom att skicka in en åtkomstbegäran och bli utvald som betrodd testare. Det är hela anskaffningsvägen.

Där en router verkligen hjälper till i en Veo-pipeline är intill videomodellen snarare än i den. Googles textmodeller – Gemini 3.5 Flash, Gemini 3.1 Pro Preview, Gemini 3.6 Flash och resten av serien – finns i OrcaRouters katalog och kan anropas på samma OpenAI-kompatibla endpoint som 200+ andra modeller till leverantörens listpris med 0 % påslag. Shotlistor, promptutökning, generering av bildtexter, kontinuitetsanteckningar mellan åttasekunderssegment och sammanfattning av granskningar är alla textarbete, och det är det lagret där möjligheten att sätta en billig modell på en bulkkörning och en frontier-modell på den sista kostar en konfigurationsändring snarare än en migrering. Veo 3.1 i sig routar vi inte, och inte heller Griffin; det är värt att vara explicit om det snarare än att låta ett stycke som detta antyda något annat.

Vilken, ärligt talat

• Välj Veo 3.1 när leveransen behöver ett härstamningsspår, när köparen är reglerad, när distributionen måste vara en fil med bifogade autentiseringsuppgifter, eller när 4K inte är förhandlingsbart. Budgetera för åttasekundersgränsen i varje kostnadsmodell, och kontrollera livscykeln för förhandsgransknings-ID:t innan du bygger ett kundvänt flöde på den.

• Välj inte Griffin, för det kan du inte. Begär åtkomst om din fråga är huruvida en person kan skilja en AI från en människa i ett enminuterssamtal, eller om du behöver veta vart interaktionslagret är på väg innan du binder en färdplan till klipplagret.

• Titta på detektorn, inte demon. Om Tavus publicerar en avslöjandemekanism som överlever ett vardagligt samtal, minskar klyftan mellan dessa två leverantörer avsevärt. Om den inte gör det är Griffin ett resultat värt att citera och Veo 3.1 förblir den enda av de två som du kan sätta framför ett regelefterlevnadsteam.

A two-column scoreboard titled "Tavus Griffin vs Google Veo 3.1 — the scoreboard". Left column "Tavus Griffin": Provenance: none published; Price: none published; Clip length: no clip - a session; Resolution: 720p at 25 fps; Loop: full duplex; Status: research preview. Right column "Google Veo 3.1": Provenance: SynthID plus C2PA; Price: $0.40 per second; Clip length: 4, 6 or 8 seconds; Resolution: 720p native; Loop: one generation; Status: generally available. Footer: "Veo 3.1 per Google's Gemini API pricing, 2 October 2026."