Hero-titelkort för "Tavus Griffin vs MiniMax H3" med underrubriken "En duplex samtalsmodell möter en släppt videogenerator", ovanför fyra chips: Tavus Griffin forskningsförhandsvisning, endast för testare; MiniMax H3 öppna vikter, släppt; MiniMax H3 $0.08/s vid 768P; Griffin: inget API, inget pris.
Guides & Insights

Tavus Griffin vs MiniMax H3: En duplex samtalsmodell möter en släppt videogenerator

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Tavus Griffin och MiniMax H3 sätter båda en rörlig, talande människa på skärmen, och bortom det första intrycket är de knappt ens i samma produktkategori. Griffin är en modell för mänsklig interaktion – ett video-till-video-system byggt för att föra en tvåvägskonversation i realtid, tillkännagivet av Tavus i oktober 2026 och för närvarande begränsat till en utvald grupp tidiga testare. MiniMax H3 är en omnimodal videogenerator: du ger den en prompt plus valfria bild-, video- och ljudreferenser och den returnerar ett färdigt klipp. Den ena utvärderas bakom stängda dörrar; den andra har varit nedladdningsbar, licensierbar och fakturerbar i månader. Den skillnaden – inte upplösningen eller bildfrekvensen – är det som avgör vilken av dem som hör hemma i din stack.

Vad var och en faktiskt är

Griffin är Tavus försök att bygga en modell som beter sig som en deltagare snarare än en renderare. Företaget beskriver den som den första Human Interaction Model, och arkitekturen den publicerade delar upp arbetet i två delar: Continuous Conversational Modeling, som avgör vad personan bör göra från ögonblick till ögonblick, och Audio-Visual Generation, som strömmar talet och ansiktet som matchar. Avgörande är att den är full duplex – den tittar och lyssnar medan den talar, så den kan avbrytas, reagera mitt i ett yttrande och väntar inte på en tydlig signal om att turen är slut innan den svarar. Tavus egen formulering är att tidigare system lärde sig generera ansikten; Griffin byggdes för att lära sig samtalsbeteende från människor.

MiniMax H3 är Hailuo 3-generationen, släppt den 31 juli 2026 och med öppen källkod den 3 augusti 2026 under MiniMax H3 Community License, med varianterna H3-Base-FL2VA och H3-Base-Ref2VA publicerade öppet. Den läser text-, bild-, video- och ljudreferenser som en enhetlig kontext och returnerar ett klipp på 4 till 15 sekunder i 768P eller 2K med native stereoljud, genererat genom en trestegspipeline (H3-Context-IR, sedan H3-Base i 768p, sedan H3-Regenerate-2K). Det är en generator med en ovanligt bred yta för indata och en genuint tillåtande licens – allt som Griffin för närvarande inte är.

Specifikationerna, sida vid sida

Two-card board titled 'One Is a Product'. Left card, MiniMax H3: omni-modal video generator, Hailuo 3 generation; released 31 July 2026 with open weights on 3 August 2026; 4 to 15 seconds at 768P or 2K with native stereo audio; text, image, video and audio inputs in one context; $0.08 per second at 768P and $0.13 at 2K; hosted and billable today. Right card, Tavus Griffin: duplex Human Interaction Model, video to video; announced October 2026 as a research preview; 720p at 25 fps in 320-millisecond chunks; the live participant's video and audio as input; no published price; selected testers only, not for customer use.

Varför "duplex" är det intressanta ordet

Varje videogenerator, inklusive H3, bedöms utifrån hur ett klipp ser ut när det är färdigt. Griffin bedöms utifrån något som ett klipp inte kan visa: vad som händer under de 200 millisekunderna efter att du avbryter det. Det är problemet som Human Interaction Model-inramningen pekar på, och det är därför Tavus huvudsiffror är beteendemässiga snarare än visuella.

Den mest citerade siffran är att 48 % av personerna trodde att Griffin var en riktig person efter ett videosamtal på en minut – 26 av 54 deltagare – mot 2,4 % för Tavus tidigare stack med Phoenix-4.5, Sparrow-2 och Raven-1, som lyckades med 1 av 41. Tavus rapporterar också att personer som inte blev övertygade tenderade att bli misstänksamma inom de första 20 sekunderna, vilket är en mer användbar detalj än rubriken: det betyder att illusionen antingen håller tidigt eller kollapsar tidigt.

Den andra uppsättningen siffror kommer från NVIDIA:s VideoFDB-benchmark, med poängsättning i september 2026, där Tavus uppger att Griffin placerade sig först i ett oberoende test av AI för ansikte mot ansikte. På generationssidan fick Griffin 3,83 mot 2,80 för den starkaste rapporterade baslinjen (en konfiguration med Gemini 2.5 plus Anam), med en mänsklig referens på 3,92 och en måluppfyllelsegrad för uppgifter på 62,8 %. På perceptionssidan fick Griffin 3,73 mot 3,44 för MiniCPM-o 4.5, 3,17 för Gemini 2.5 Flash Native och 2,97 för en konfiguration av OpenAI gpt-realtime med endast ljud, mot en mänsklig referens på 4,20 och en måluppfyllelsegrad för uppgifter på 73,8 %, över femton utvärderade modeller. Tavus hävdar också att Griffin leder med 37 % över det näst bästa systemet när det gäller att reagera i stunden. Detta är leverantörsrapporterade siffror som vilar på ett benchmark som NVIDIA har byggt, och de bör läsas på det sättet – men de mänskliga jämförelsepunkterna är de som är värda att hålla fast vid, eftersom 3,83 mot en mänsklig poäng på 3,92 är en mycket mindre skillnad än videogenerering historiskt har uppvisat.

Vad du kan köpa idag

Här upphör de två modellerna att vara jämförbara överhuvudtaget.

MiniMax H3 är en produkt. Den är hostad, den prissätts per sekund genererad utdata, och dess öppna varianter ligger på ett modellhub och väntar på att laddas ner. Om du vill ha ett femton sekunder långt 2K-klipp med stereoljud av något som inte existerar kan du få ett i eftermiddag, och du kan köra vikterna själv om du hellre vill slippa hyra dem.

Tavus Griffin är inte en produkt. Tavus säger uttryckligen i Griffin-artikeln att Griffin-Lite, forskningsförhandsvisningen, finns tillgänglig redan i dag för en utvald grupp tidiga testare, att en bredare lansering av en kraftfullare modell kommer att följa, och att Griffin ännu inte finns på Tavus-plattformen och bara kommer att komma när företaget har kommit fram till hur man kan släppa den på ett säkert sätt. Det är en ovanligt hög grad av öppenhet från en leverantör om sitt eget mest uppseendeväckande resultat, och det spelar roll för planeringen: du kan inte lägga in Griffin som ett beroende i en produktfärdplan, och du kan inte sätta ett pris på det, eftersom det inte finns något.

Så den ärliga planeringsfrågan är inte "vilken som är bättre" utan "vilken av dem som finns på den nivå jag behöver".

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard, the Overall board for text-to-video, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns. The board lists MiniMax H3 and MiniMax H3 Max fourth and fifth with audio, though the with-audio filter itself is not applied in this capture.

Var OrcaRouter passar

MiniMax H3 finns i vår katalog. Modellsidan ligger på minimax/minimax-h3, och den faktureras på samma sätt som leverantören fakturerar: $0.08 per sekund genererad utdata vid 768P och $0.13 per sekund vid 2K. OrcaRouter förmedlar leverantörens listpriser vidare med 0 % påslag, så en prisändring från MiniMax syns på vårt kort samma dag som den tillkännages i stället för vid nästa faktureringscykel. Griffin finns inte i katalogen och kommer inte att göra det förrän Tavus lanserar den till kunder – vi hostar inte en modell vi inte kan betjäna, och en forskningsförhandsvisning begränsad till utvalda testare är inget en router kan dirigera till.

Den praktiska konsekvensen är att en av dessa två modeller är en enda rad kod bort från din applikation och den andra är en forskningsartikel med ett telefonnummer. Om du redan routar flera video- och språkmodeller gör även H3:s fakturering per sekund att den är en sådan rutt som är värd att lägga bakom automatisk failover: en begäran som träffar en mättad leverantör görs om mot en frisk i stället för att visa en timeout, och ett routing-DSL låter dig fästa 2K-jobb vid en specifik leverantör medan 768P-utkast får falla där kapaciteten är billigast. Modellfusion är den andra hävstången värd att nämna här — H3:s pris per sekund är tillräckligt lågt för att det ofta är billigare att låta en textmodell skriva om och klippa om en prompt före generering än de bortkastade sekunderna från ett dåligt första försök.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Där jämförelsen skulle kunna slå om

Tre saker skulle ändra den här jämförelsen, och bara tre.

För det första: om Tavus lägger Griffin på ett kommersiellt API med ett publicerat pris blir hela "konversation kontra klipp"-ramverket ett verkligt köpbeslut snarare än ett schemaläggningsbeslut, och siffran 48 procent ansikte mot ansikte börjar konkurrera direkt med kvaliteten på generativ utdata. För det andra: om H3:s realtidsberättelse förbättras – och MiniMax har levererat aggressivt – skulle en generator per sekund som kan streama urholka Griffins främsta fördel. För det tredje: om NVIDIA eller en annan neutral part kör om VideoFDB med H3 eller dess efterföljare inkluderad upphör påståendet att Griffin är först med ansikte-mot-ansikte-AI att vara ofalsifierbart. Tavus säger att de räknar med att släppa Griffin mycket snart efter att deras säkerhetsproblem har åtgärdats; den meningen är hela tidslinjen.

Slutsats

MiniMax H3 och Tavus Griffin är inte rivaler just nu, eftersom bara en av dem är köpbar. H3 är en släppt omnimodal generator med öppna vikter och per sekund-prissättning, ett publicerat pris och ett utdatafönster på 4 till 15 sekunder; Griffin är en duplex samtalsmodell med de bästa ansikte-mot-ansikte-siffrorna som någon har publicerat, inget API, inget pris och ett uttryckligt uttalande från dess egen leverantör om att kunder inte kan använda den ännu. Om du behöver videogenerering idag är H3 svaret, och det är mätbart i cent per sekund. Om du behöver ett ansikte i realtid som kan avbrytas, håll koll på Tavus — men bygg resten av produkten först, eftersom releasedatumet är en mening, inte ett datum.