Ett herokort för "Tavus Griffin vs HeyGen Video 1" med tre chips som lyder "HeyGen Video — 0,01 USD per sekund", "Griffin — inget pris, begär åtkomst" och "HeyGen Video — 5 till 15 sekunder i 768p", ovanför sex rader: HeyGen lanserades: 30 september 2026; Griffin tillkännagavs: 1 oktober 2026; HeyGen-pris: 0,01 USD per sekund; Griffin-pris: inget publicerat; HeyGen-utdata: 5 till 15 sekunders klipp; Griffin-utdata: en livesession. Sidfot: "HeyGen Video lanserades 30 september 2026; Griffin tillkännagavs 1 oktober 2026 som en förhandsvisning."
Guides & Insights

Tavus Griffin vs HeyGen Video 1: Trettiosex timmar ifrån varandra, och endast en är köpbar

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två lanseringar skedde med bara trettiosex timmars mellanrum i samma hörn av marknaden, och kalendern är det mest intressanta med kombinationen. HeyGen Video lanserades den 30 september 2026 för 0,01 dollar per sekund fram till och med oktober, finjusterad från MiniMax H3 och levereras under identifieraren heygen-video-1. Tavus Griffin tillkännagavs den 1 oktober 2026 med en live-studie ansikte mot ansikte där 26 av 54 deltagare trodde att deras partner var en riktig person, och den är endast tillgänglig för utvalda betrodda testare bakom ett förfrågningsformulär, utan identifierare, utan ändpunkt och utan pris. Båda handlar om att generera en övertygande människa. Det ärliga skälet att jämföra Tavus Griffin och HeyGen Video 1 är inte att en köpare skulle välja mellan dem – i dag kan bara en av dem köpas – utan att skillnaden förklarar vad var och en byggdes för att göra, och vad en sekund genererad människa faktiskt är värd.

Den ena säljer ett klipp, den andra säljer ett samtal.

HeyGen Video är en allmän videomodell som råkar vara ovanligt bra på människor. Den tar en prompt, eller en prompt plus en bild, eller en prompt plus upp till nio referensbilder, tre referensvideor och tre referensljudklipp, och returnerar ett klipp mellan 5 och 15 sekunder långt i 480p eller 768p, 24 fps, med AAC-ljud i 32 kHz stereo som bär genererad dialog, atmosfär och effekter. Tre lägen täcker betingningen – text_to_video, image_to_video och reference_to_video, vilket är standard – och listordningen blir den etikett du adresserar i prompten, så den första posten i reference_images är <Picture 1>. Okända fält i begäran avvisas i stället för att ignoreras, och ett seed är ett osignerat 32-bitars heltal som gör en tagning repeterbar när du håller den och ändrar en sats i taget. Det är ett produktionsverktyg med en deterministisk ram.

Griffin inverterar nästan alla dessa egenskaper. Den genererar 720p i segment om 320 ms vid 25 fps från ett enda referensfotografi och spelar upp varje segment medan det avkodas, så det finns ingen klipplängd att ange och ingen fil att lämna tillbaka. En Continuous Conversational Modeling-motor tar in ljud och video och omvärderar utbytet i subsekundintervall och väljer huruvida den ska förbli tyst, signalera, ge backchannel eller ta turen, och dess expressiva kontroller driver en strömmande talgenerator och en strömmande videogenerator parallellt. Ett beslut som fattas mitt i en mening syns i rösten och ansiktet inom samma minitur. Du skriver inte en prompt; du pratar med den, och den svarar på en paus, en blick bort eller en avbrytning.

Det är därför de två inte är substitut, även om båda genererar en människa. HeyGen Video får frågan hur ett beskrivet ögonblick ser ut. Griffin får frågan vad som bör hända härnäst.

Vad varje sekund kostar, på den där man kan köpa sekunder

HeyGen Videos lanseringspris är 0,01 USD per sekund till och med oktober, och HeyGens egen text beskriver det som 50 % rabatt på ett standardpris på 0,02 USD. Kostnadsdiagrammet på samma sida, med fotnoten listpris per sekund vid 768p med ljud före lanseringskampanjer, anger det till 0,03 USD. Det är en klyfta på 50 % mellan texten och diagrammet i en leverantörs eget lanseringsmaterial, och tills HeyGen publicerar en prissida för API:et är den säkra tolkningen att 0,01 USD är bekräftat eftersom det är aktivt, och att siffran efter oktober ligger någonstans mellan 0,02 och 0,03 USD.

Räkna på siffrorna för tusen sekunder – hundra klipp på tio sekunder – vilket är enheten ett bulkteam faktiskt tänker i:

• HeyGen Video i oktober — $10 till $0,01 per sekund.

• HeyGen Video efter oktober — 20 $ till 0,02 $, eller 30 $ till diagrammets 0,03 $.

• MiniMax H3, basmodellen som den finjusterades från – 80 $ till MiniMaxs listpris på 0,08 $ per sekund.

• Kling 3.0 Pro — 168 $ till 0,168 $ per sekund.

• Veo 3.1 — 400 $ till 0,40 $ per sekund.

Anledningen till att aritmetiken är rubriken för HeyGens lansering är kasseringsgraden. Team som gör sociala kortversioner, annonsvarianter och produktloopar genererar långt mer än de publicerar, och för en dime per tio-sekundersförsök ändrar ekonomin för att kasta bort kandidater form helt. Haken är taket: 768p vid 24 fps är inte ett 2K-leveransformat, och MiniMax H3 når 2K genom en separat regenereringsmodul på MiniMaxs eget hostade API för 0,13 dollar per sekund, utan motsvarighet på HeyGen Video. Om ditt leveransmål är över 768p är den billiga sekunden inte den sekund du behöver.

Griffins kolumn i den listan är tom, och inte på ett lovande sätt. Tavus har inte publicerat någon taxa, eftersom Griffin-Lite är en forskningsförhandsvisning som enligt dess eget tillkännagivande inte kommer att vara tillgänglig för kundanvändning för närvarande och inte finns på Tavus plattform. Under en tusen-sekundersmodell finns det inget att skriva ned. Den som anger en siffra för Griffin hittar på den.

Kvalitetssiffrorna, och vem som betygsätter

Ingen av dessa modeller har ett oberoende betyg, vilket är värt att säga redan från början, eftersom båda leverantörerna har diagram.

HeyGens är en Elo-tabell med HeyGen Video normaliserat till 1000, sedan Dreamina Seedance 2.0 på 955, H3 Max-familjen som sträcker sig från 952 ner till 860, Kling 3.0 Pro på 857 och Veo 3.1 på 744. Fotnoten gör det mesta av jobbet: poängen kommer från en intern utvärderingsuppsättning av Artificial Analysis Arena-frågor med 4 800 röster, och HeyGens egen poäng är normaliserad till 1000 för enklare jämförelse. Att en leverantör normaliserar sig själv till toppen av sitt eget diagram är ett presentationsval, inte ett bevis för att den leder. Det relativa avståndet under den är det informativa.

Mer användbar är direktjämförelsen, det enda stället där HeyGen testar mot något som det inte själv har byggt. HeyGen säger att blinda testare föredrog dess modell framför den redovisade H3 Max post-train i 55,8 % av jämförelserna över 650 röster, med ett intervall på 49–62 %. Det intervallet är den ärliga detaljen: i den nedre änden korsar det 50 %, så enligt leverantörens egna siffror är preferensen över den rivalen inte tydligt åtskild från brus. Uppdelningen per axel är blandad på ett sätt som framstår som en specifik felprofil – 65 % för att hålla sig trogen källbilden och 66 % för timing, mot 43 % för konsistens och 45 % för musik.

Griffins siffror kommer från ett instrument som har byggts av någon annan, vilket är skillnaden som spelar roll. NVIDIAs VideoFDB är ett riktmärke för full-duplex audiovisuell konversation som poängsätts på två spår, och NVIDIA byggde det och genomför utvärderingen med sin egen bedömare mot en publicerad bedömningsmall. Griffin-Lite fick 3,83 av 5 på generering mot en mänsklig referens på 3,92 och 2,80 för det näst högsta publicerade systemet, samt 3,73 på perception mot en mänsklig referens på 4,20. Tavus rapporterar också 0,43 sekunders verklig ljud-till-video-latens för generatorn mot fyra publicerade baslinjer för strömmande diffusion på H100s. Förbehållen gäller fortfarande – en skillnad på 0,09 punkter gentemot människa på en femgradig språkmodellsbedömd bedömningsmall är "nära", inte "lika", och en del av perceptionsförsprånget är uppmätt mot system som körs utan videoindata – men bedömaren är inte leverantören.

• Oberoende kvalitetsbetyg — ingen av dem har något. HeyGen Video finns inte med på någon av de tre videotopplistorna från Artificial Analysis per den 2 oktober 2026, och inte Griffin heller. Griffin kanske aldrig kommer att göra det: parvis preferensröstning på korta klipp kan inte bedöma ett levande samtal.

Samma topplistor innehåller faktiskt basmodellen. MiniMax H3 ligger fyra i text-till-video (med ljud) på Elo 1 139 och tvåa i bild-till-video på 1 181, båda till $4,80/min — så HeyGens post-träning tävlar på ett substrat som en oberoende arena redan rankar nära toppen, vilket är det starkaste argumentet till dess fördel som HeyGen inte själva publicerade.

A screenshot of the top of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026: Wan 3.0 first at Elo 1,157 and $12.00/min, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at Elo 1,139 with 7,496 votes and $4.80/min, MiniMax H3 Max (based on MiniMax H3) fifth at 1,134 with 5,510 votes, and FLUX 3 sixth at 1,127, with release months and per-minute API pricing columns visible.

Båda är billiga eller omöjliga att prissätta av samma anledning

Det strukturella faktum som ligger bakom båda lanseringarna är att det har blivit billigt att skapa en övertygande människa, och ingen av företagens kostnadsfördelar kommer från det de säljer.

HeyGen Video är en efterträning av MiniMax H3, som MiniMax släppte med vikter tillgängliga under sin egen community-licens. Det gjorde H3 till ett substrat som andra företag kan specialisera och sälja vidare, och HeyGen är den andra produkten på fem veckor som gör det för en annan vertikal – företagsvideo, produktdemonstrationer, utbildning, fastighetsvisningar. Mönstret är anledningen till att HeyGen kan prissätta under basmodellen: den bär inte kostnaden för basmodellen, och basen är någon annans släpp med öppna vikter.

Griffin är det motsatta vadet. Tavus byggde hela systemet — codecen, den streamande talgeneratorn, den streamande videogeneratorn, samtalsmodellen — kring själva interaktionen, genom att i tre etapper destillera en stor dubbelriktad diffusionslärare till en autoregressiv generator med få steg så att långa rollouts inte driver iväg. Det är dyr forskning utan en öppen bas att stå på, och det är en trolig del av varför släppet är begränsat: det finns inget billigt substrat därunder att amortera på.

Båda företagen kommer också fram till samma obekväma punkt, men från olika håll. HeyGens egen dokumentation listar vad modellen är sämst på, vilket är ovanligt och värt att läsa: lång text på skärmen, mjuk organisk rörelse som kronblad, papper och hår, samt närbilder av händer i arbete, som att montera eller manövrera utrustning. Den är bäst på korta, avgränsade tagningar – ett motiv, en plats, en handling, en låst eller knappt rörlig kamera. Griffins begränsning är inte en lista över felmoder utan ett olöst säkerhetsproblem: Tavus säger rent ut att de egenskaper som gör en modell för mänsklig interaktion till ett bättre gränssnitt också gör den bättre på att övertyga någon om att personen talar med en människa, och att företaget håller tillbaka förhandsvisningen medan det bygger upp mekanismer för avslöjande.

Vad en köpare faktiskt kan göra idag

HeyGen Video kan nu anropas. Det körs via POST /v3/models/videos med en x-api-key-header, endast på betalda API-nycklar, med nedladdningslänkar som är signerade och upphör att gälla – så att pollning uppdaterar dem – och återanrop som försöks en gång per jobb, vilket HeyGen själv säger att du ska behandla som en latensoptimering snarare än en garanti. Om du testar det den här månaden är kampanjsekunden för $0,01 live, utdatataket är 768p, och promptförbättringsläget är en riktig kostnadsfaktor: turbo som standard, quality för en längre körning, inaktiverat för att skicka din text orörd.

Griffin går inte att anropa. Åtkomst är ett begärformulär och en forskningsförhandsvisning. Det finns ingen nyckel, ingen identifierare, ingen slutpunkt och inget SLA, och det enda publicerade uttalandet om tillgänglighet är att det kommer när Tavus har kommit fram till hur det kan släppas på ett säkert sätt.

En sak som båda har gemensamt är att ingen av dem är en modell som en router kan hjälpa dig att nå, och när det gäller Griffin är det ett kategoriproblem snarare än ett tillfälligt sådant – en realtidsbaserad full-duplex-session är inte ett anrop av förfrågan-svar-typ. Det en router däremot hjälper till med i vardera pipelinen är lagret runt videon. Prompt-expansion, inventering av referensbilder, tagningsbeskrivningar, generering av bildtexter och sammanfattning av recensioner är alla textanrop, och de från OpenAI, Google och övriga ligger i OrcaRouter-katalogen bakom en enda OpenAI-kompatibel slutpunkt med 200+ modeller på samma nyckel, till leverantörens listpris med 0 % påslag, så en leverantörsprisändring slår igenom samma dag. När det gäller själva videomodellen finns det ett användbart faktum: MiniMax H3 – basmodellen som HeyGen Video finjusterades utifrån, och den vars per-sekundpris HeyGens $0,01 underbjuder – routas här som minimax/minimax-h3 till $0,08 per sekund, med 2K till $0,13. HeyGen Video självt finns inte i vår katalog och inte heller Griffin; båda tillhandahålls via sina egna leverantörers API:er och flera tredjepartsplattformar.

A screenshot of OrcaRouter's own model page for MiniMax-H3, captured 2 October 2026, showing the model id minimax/minimax-h3 labelled "text + image + video + audio", an Output type of video, a p50 time-to-first-token of 375 ms, and the OrcaRouter navigation and pricing panels alongside.

Vilken, och för vem?

• Använd HeyGen Video om leveransen består av kort, avgränsat, personcentrerat videomaterial med inbyggt ljud och du kan leva med 768p vid 24 fps. Räkna med priset efter oktober till någonstans mellan 0,02 och 0,03 dollar per sekund i stället för kampanjpriset på 10 cent, och testa lång text på skärmen och närbilder på handarbete innan du bygger ett arbetsflöde kring det, eftersom HeyGen redan har sagt till dig att det är där det brister.

• Planera inte kring Griffin. Begär åtkomst om din fråga är huruvida en person kan skilja en genererad människa från en verklig under ett enminuterssamtal, eller om du behöver se vart ett interaktionslager i realtid är på väg innan du binder en färdplan till renderade klipp.

• Håll ögonen på transparensfrågan, för det är det enda som kommer att påverka båda. HeyGen Videos kunder har ett enkelt svar tillgängligt – modellen är en efterträning av en bas med öppna vikter och resultatet är en fil med känd härkomst – medan Tavus håller tillbaka en modell specifikt eftersom den ännu inte har någon. Vilket företag som än publicerar den bättre transparensmekanismen kommer att ha löst det mer värdefulla problemet.

A two-column scoreboard titled "Tavus Griffin vs HeyGen Video 1 — the scoreboard". Left column "Tavus Griffin": Status: research preview; Price: none published; Output: live session; Resolution: 720p at 25 fps; Clip length: none - a session; Independent score: none. Right column "HeyGen Video 1": Status: live 30 September 2026; Price: $0.01 per second; Output: video file; Resolution: 768p at 24 fps; Clip length: 5 to 15 seconds; Independent score: none yet. Footer: "HeyGen price per HeyGen's launch page, October 2026. Neither has an independent score."