
Tavus Griffin vs MiniMax H3: En duplex samtalsmodell möter en släppt videogenerator
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 223 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Tavus Griffin och MiniMax H3 sätter båda en rörlig, talande människa på skärmen, och bortom det första intrycket är de knappt ens i samma produktkategori. Griffin är en modell för mänsklig interaktion – ett video-till-video-system byggt för att föra en tvåvägskonversation i realtid, tillkännagivet av Tavus i oktober 2026 och för närvarande begränsat till en utvald grupp tidiga testare. MiniMax H3 är en omnimodal videogenerator: du ger den en prompt plus valfria bild-, video- och ljudreferenser och den returnerar ett färdigt klipp. Den ena utvärderas bakom stängda dörrar; den andra har varit nedladdningsbar, licensierbar och fakturerbar i månader. Den skillnaden – inte upplösningen eller bildfrekvensen – är det som avgör vilken av dem som hör hemma i din stack.
Vad var och en faktiskt är
Griffin är Tavus försök att bygga en modell som beter sig som en deltagare snarare än en renderare. Företaget beskriver den som den första Human Interaction Model, och arkitekturen den publicerade delar upp arbetet i två delar: Continuous Conversational Modeling, som avgör vad personan bör göra från ögonblick till ögonblick, och Audio-Visual Generation, som strömmar talet och ansiktet som matchar. Avgörande är att den är full duplex – den tittar och lyssnar medan den talar, så den kan avbrytas, reagera mitt i ett yttrande och väntar inte på en tydlig signal om att turen är slut innan den svarar. Tavus egen formulering är att tidigare system lärde sig generera ansikten; Griffin byggdes för att lära sig samtalsbeteende från människor.
MiniMax H3 är Hailuo 3-generationen, släppt den 31 juli 2026 och med öppen källkod den 3 augusti 2026 under MiniMax H3 Community License, med varianterna H3-Base-FL2VA och H3-Base-Ref2VA publicerade öppet. Den läser text-, bild-, video- och ljudreferenser som en enhetlig kontext och returnerar ett klipp på 4 till 15 sekunder i 768P eller 2K med native stereoljud, genererat genom en trestegspipeline (H3-Context-IR, sedan H3-Base i 768p, sedan H3-Regenerate-2K). Det är en generator med en ovanligt bred yta för indata och en genuint tillåtande licens – allt som Griffin för närvarande inte är.
Specifikationerna, sida vid sida

Varför "duplex" är det intressanta ordet
Varje videogenerator, inklusive H3, bedöms utifrån hur ett klipp ser ut när det är färdigt. Griffin bedöms utifrån något som ett klipp inte kan visa: vad som händer under de 200 millisekunderna efter att du avbryter det. Det är problemet som Human Interaction Model-inramningen pekar på, och det är därför Tavus huvudsiffror är beteendemässiga snarare än visuella.
Den mest citerade siffran är att 48 % av personerna trodde att Griffin var en riktig person efter ett videosamtal på en minut – 26 av 54 deltagare – mot 2,4 % för Tavus tidigare stack med Phoenix-4.5, Sparrow-2 och Raven-1, som lyckades med 1 av 41. Tavus rapporterar också att personer som inte blev övertygade tenderade att bli misstänksamma inom de första 20 sekunderna, vilket är en mer användbar detalj än rubriken: det betyder att illusionen antingen håller tidigt eller kollapsar tidigt.
Den andra uppsättningen siffror kommer från NVIDIA:s VideoFDB-benchmark, med poängsättning i september 2026, där Tavus uppger att Griffin placerade sig först i ett oberoende test av AI för ansikte mot ansikte. På generationssidan fick Griffin 3,83 mot 2,80 för den starkaste rapporterade baslinjen (en konfiguration med Gemini 2.5 plus Anam), med en mänsklig referens på 3,92 och en måluppfyllelsegrad för uppgifter på 62,8 %. På perceptionssidan fick Griffin 3,73 mot 3,44 för MiniCPM-o 4.5, 3,17 för Gemini 2.5 Flash Native och 2,97 för en konfiguration av OpenAI gpt-realtime med endast ljud, mot en mänsklig referens på 4,20 och en måluppfyllelsegrad för uppgifter på 73,8 %, över femton utvärderade modeller. Tavus hävdar också att Griffin leder med 37 % över det näst bästa systemet när det gäller att reagera i stunden. Detta är leverantörsrapporterade siffror som vilar på ett benchmark som NVIDIA har byggt, och de bör läsas på det sättet – men de mänskliga jämförelsepunkterna är de som är värda att hålla fast vid, eftersom 3,83 mot en mänsklig poäng på 3,92 är en mycket mindre skillnad än videogenerering historiskt har uppvisat.
Vad du kan köpa idag
Här upphör de två modellerna att vara jämförbara överhuvudtaget.
MiniMax H3 är en produkt. Den är hostad, den prissätts per sekund genererad utdata, och dess öppna varianter ligger på ett modellhub och väntar på att laddas ner. Om du vill ha ett femton sekunder långt 2K-klipp med stereoljud av något som inte existerar kan du få ett i eftermiddag, och du kan köra vikterna själv om du hellre vill slippa hyra dem.
Tavus Griffin är inte en produkt. Tavus säger uttryckligen i Griffin-artikeln att Griffin-Lite, forskningsförhandsvisningen, finns tillgänglig redan i dag för en utvald grupp tidiga testare, att en bredare lansering av en kraftfullare modell kommer att följa, och att Griffin ännu inte finns på Tavus-plattformen och bara kommer att komma när företaget har kommit fram till hur man kan släppa den på ett säkert sätt. Det är en ovanligt hög grad av öppenhet från en leverantör om sitt eget mest uppseendeväckande resultat, och det spelar roll för planeringen: du kan inte lägga in Griffin som ett beroende i en produktfärdplan, och du kan inte sätta ett pris på det, eftersom det inte finns något.
Så den ärliga planeringsfrågan är inte "vilken som är bättre" utan "vilken av dem som finns på den nivå jag behöver".

Var OrcaRouter passar
MiniMax H3 finns i vår katalog. Modellsidan ligger på minimax/minimax-h3, och den faktureras på samma sätt som leverantören fakturerar: $0.08 per sekund genererad utdata vid 768P och $0.13 per sekund vid 2K. OrcaRouter förmedlar leverantörens listpriser vidare med 0 % påslag, så en prisändring från MiniMax syns på vårt kort samma dag som den tillkännages i stället för vid nästa faktureringscykel. Griffin finns inte i katalogen och kommer inte att göra det förrän Tavus lanserar den till kunder – vi hostar inte en modell vi inte kan betjäna, och en forskningsförhandsvisning begränsad till utvalda testare är inget en router kan dirigera till.
Den praktiska konsekvensen är att en av dessa två modeller är en enda rad kod bort från din applikation och den andra är en forskningsartikel med ett telefonnummer. Om du redan routar flera video- och språkmodeller gör även H3:s fakturering per sekund att den är en sådan rutt som är värd att lägga bakom automatisk failover: en begäran som träffar en mättad leverantör görs om mot en frisk i stället för att visa en timeout, och ett routing-DSL låter dig fästa 2K-jobb vid en specifik leverantör medan 768P-utkast får falla där kapaciteten är billigast. Modellfusion är den andra hävstången värd att nämna här — H3:s pris per sekund är tillräckligt lågt för att det ofta är billigare att låta en textmodell skriva om och klippa om en prompt före generering än de bortkastade sekunderna från ett dåligt första försök.

Där jämförelsen skulle kunna slå om
Tre saker skulle ändra den här jämförelsen, och bara tre.
För det första: om Tavus lägger Griffin på ett kommersiellt API med ett publicerat pris blir hela "konversation kontra klipp"-ramverket ett verkligt köpbeslut snarare än ett schemaläggningsbeslut, och siffran 48 procent ansikte mot ansikte börjar konkurrera direkt med kvaliteten på generativ utdata. För det andra: om H3:s realtidsberättelse förbättras – och MiniMax har levererat aggressivt – skulle en generator per sekund som kan streama urholka Griffins främsta fördel. För det tredje: om NVIDIA eller en annan neutral part kör om VideoFDB med H3 eller dess efterföljare inkluderad upphör påståendet att Griffin är först med ansikte-mot-ansikte-AI att vara ofalsifierbart. Tavus säger att de räknar med att släppa Griffin mycket snart efter att deras säkerhetsproblem har åtgärdats; den meningen är hela tidslinjen.
Slutsats
MiniMax H3 och Tavus Griffin är inte rivaler just nu, eftersom bara en av dem är köpbar. H3 är en släppt omnimodal generator med öppna vikter och per sekund-prissättning, ett publicerat pris och ett utdatafönster på 4 till 15 sekunder; Griffin är en duplex samtalsmodell med de bästa ansikte-mot-ansikte-siffrorna som någon har publicerat, inget API, inget pris och ett uttryckligt uttalande från dess egen leverantör om att kunder inte kan använda den ännu. Om du behöver videogenerering idag är H3 svaret, och det är mätbart i cent per sekund. Om du behöver ett ansikte i realtid som kan avbrytas, håll koll på Tavus — men bygg resten av produkten först, eftersom releasedatumet är en mening, inte ett datum.
