Ett hero-kort för "Tavus Griffin vs Kling 3" med tre chips som lyder "Kling 3 — $0.084 per begäran på OrcaRouter", "Griffin — inget pris, begär åtkomst" och "Kling 3 — upp till sex tagningar", ovanför sex rader: Kling-pris: $0.084 per begäran; Griffin-pris: inget publicerat; Kling-tagningar: upp till sex; Griffin-tagningar: inga att planera; Kling-routing: routas som kling/kling-v3; Griffin-routing: inte routbar. Sidfot: "Kling-priset per begäran är OrcaRouters live-kort; Griffin har ingen publicerad taxa."
Guides & Insights

Tavus Griffin vs Kling 3: En realtidskonversation mot ett tio sekunder långt klipp

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den ärliga formen av denna matchning är en routing-asymmetri. Kling 3 är en anropbar modell med ett pris, en parameteryta och en post i vår egen katalog; Tavus Griffin är en forskningsförhandsvisning för utvalda betrodda testare bakom ett förfrågningsformulär, tillkännagiven den 1 oktober 2026 utan identifierare, utan slutpunkt och utan publicerad taxa. Kling 3.0 finns i OrcaRouter-katalogen som kling/kling-v3, med ett pris på 0,084 USD per anrop, där leverantörens listpris förs vidare utan något påslag. Griffin är inte routbar, och inte för att ingen har hunnit med det — en full-duplex-session i realtid där modellen genererar 720p i 320-millisekundersbitar medan den lyssnar är inte ett request-response-anrop, och det skulle inte passa i samma form även om Tavus öppnade grindarna imorgon. Så detta är inte en jämförelse som en köpare löser genom pris. Det är en jämförelse av två svar på frågan vad en genererad människa är till för.

Vad Kling 3.0 egentligen är

Kling 3.0 lanserades den 5 februari 2026 som en serie med fyra modeller – Video 3.0, Video 3.0 Omni, Image 3.0 och Image 3.0 Omni. Dess utmärkande drag är automatisk sekvensering av flera tagningar: modellen planerar själv tagningarnas övergångar, och ett anpassat läge låter dig ange antalet tagningar och längden på var och en, med recensenter som rapporterar användbara sekvenser på upp till omkring sex distinkta tagningar från en enda prompt, och där bildutsnitt, kamerarörelse och narrativt beat kan anges per tagning. Taket är 15 sekunder per generering med en nedre gräns på tre sekunder. På OrcaRouter-sidan visas den som en flaggskeppsmodell för text-till-video och bild-till-video med multi-shot, motiv- och rörelsestyrning, klipp på 3–15 sekunder och upp till native 4K enligt uppgift, som tillhandahålls på POST /v1/video/generations.

Ljud genereras i samma pass, inbyggt. Kuaishous version stöder kinesiska, engelska, japanska, koreanska och spanska, hanterar flerspråkig dialog inom ett klipp, binder en distinkt röst till varje karaktär i scener med flera karaktärer, och erbjuder regionala accenter – amerikansk, brittisk och indisk engelska; nordöstra, pekingsk, taiwanesisk, kantonesisk och sichuanesisk kinesiska. Läppsynkroniseringskonsekvens är den enskilt mest flaggade svagheten i oberoende praktiska recensioner, där ett test rapporterade att ungefär två av fem dialogklipp behövde tas om, och rapporterade artefakter klustrar kring dialog i bullriga miljöer där vatten- och vindbakgrunder gör talet dämpat.

Vad Griffin faktiskt är, i ett stycke

Griffin är inte en videogenerator med ett konversationsläge. Det är två motorer som körs samtidigt. En motor för kontinuerlig konversationsmodellering tar in en persons ljud och video, omvärderar utbytet med intervall under en sekund och beslutar vid varje tillfälle om den ska vara tyst, signalera, ge backchannel eller ta turen — och avger uttrycksfulla kontroller som bär timing, hållning, ansiktsuttryck och gestik, inte bara ord. En motor för audiovisuell generering omvandlar dessa kontroller till ljud och pixlar tillsammans: en autoregressiv diffusionstransformator som genererar tal en latent chunk i taget från ett kodat talarprefix, och en fåstegs autoregressiv videogenerator som producerar 720p i chunkar om 320 ms vid 25 fps från ett enda referensfotografi. Det finns ingen prompt, ingen klipplängd och ingen fil. För ljud rapporterar den 0,43 sekunders verklig ljud-till-video-latens på H100s mot fyra publicerade baslinjer för strömmande diffusion, vilket Tavus beskriver som hälften av den näst snabbaste metoden.

Pris, och den ensidiga tabellen

Kling 3.0:s prissättning är det enda stället i den här artikeln där det finns en konkret siffra på båda sidorna i en jämförelse och den ena sidan är tom.

• Kling 3.0 på OrcaRouter – 0,084 USD per begäran, leverantörens listpris förs vidare med 0 % påslag, så en prisändring från Kuaishou eller en kampanjsänkning gäller här samma dag i stället för efter en avtalscykel.

• Kling 3.0 på den oberoende arenan – resultattavlan för text-till-video med ljud, avläst den 2 oktober 2026, listar 1080p Pro-nivån till $10,08/min och Omni 1080p Pro-nivån till $8,40/min. Samma tavla värderar Kling 3.0:s fyra nivåer till fyra olika priser, så "priset för Kling 3.0" är inte en enda siffra.

• Griffin — inget pris. Griffin-Lite är tillgängligt för utvalda betrodda testare som en forskningsförhandsvisning, finns inte på Tavus plattform, och dess egen tillkännagivelse säger att det inte kommer att vara tillgängligt för kundanvändning vid denna tidpunkt. Det finns ingen per-begäran-taxa, ingen per-sekund-taxa och ingen gratisnivå att ange, och modellen kommer endast att finnas tillgänglig efter att Tavus har kommit fram till hur man släpper den på ett säkert sätt.

Det är hela prisavsnittet, och det är ärligt att låta det stå där i stället för att hitta på en uppskattning per sekund utifrån beräkningsavtrycket.

Resultattavlorna mäter olika saker och möts inte

Båda modellerna har poängsatts av någon annan än deras leverantör, på instrument som inte kan jämföras.

Kling 3.0 finns på Artificial Analysis videoarena, där Elo kommer från blind parvis mänsklig preferens över korta klipp. Två mätningar samma dag berättar olika historier, vilket är fällan värd att namnge: på tavlan för text-till-video med ljud placerar sig Kling-nivåerna i mitten av tabellen, medan de på tavlan för bild-till-video med ljud placerar sig väsentligt högre — men Kling-nivåerna förekommer inte alla på båda. Endast Pro- och Omni Pro 1080p-versionerna finns överhuvudtaget med på texttavlan; 720p Standard-nivån poängsätts på bild-till-video och ingen annanstans.

• Kling 3.0 inom text-till-video (med ljud) — 1080p Pro på 16:e plats, Elo 1 000 över 4 844 röster, 10,08 USD/min; Omni 1080p Pro på 16:e plats, Elo 987 över 2 741 röster, 6,90 USD/min. Den dyrare av de två nivåerna får lägre poäng, vilket är samma icke-resultat som nivåspridningen visar överallt annars på den här resultattavlan.

• Kling 3.0 i bild-till-video (med ljud) — 1080p Pro på 18:e–20:e plats, Elo 1 055 (±6) över 14 896 röster, $20,16/min; 720p Standard på 18:e–20:e plats, Elo 1 051 (±6) över 14 692 röster, $15,60/min; Omni 1080p Pro på 21:a–22:a plats, Elo 1 044 (±8) över 2 945 röster, $16,80/min; Omni 720p Standard på 21:a–24:e plats, Elo 1 036, $13,44/min.

Tolkningen är att Kling 3.0 är starkare när den utgår från en tillhandahållen bild än när den utgår från text, och image-to-video-listan har tre gånger så många röster, så placeringen där är den bättre underbyggda. Det är också det läge som de flesta kommersiella arbeten använder. Notera vad de fyra nivåerna ger: inom image-to-video spänner de över sexton Elo-poäng inom ett prisintervall från $13,44 till $20,16 per minut, och den billigaste av de fyra är inte den lägst rankade. Att betala mer för Kling 3.0 flyttar inte upp den på den här listan.

A screenshot of Artificial Analysis's image-to-video-with-audio board, captured 2 October 2026, covering rows fifteen to thirty-one: PixVerse V6 at Elo 1,070, SkyReels V4 at 1,070, Veo 3.1 Fast at 1,066, Vidu Q3 Pro at 1,056, Kling 3.0 1080p Pro at Elo 1,055 with 14,896 votes and $20.16/min, Kling 3.0 720p Standard at 1,051 with 14,692 votes and $15.60/min, Kling 3.0 Omni 1080p Pro at 1,044 with 2,945 votes and $16.80/min, LTX-2.5 Fast at 1,038, Kling 3.0 Omni 720p Standard at 1,036 with 6,198 votes and $13.44/min, Agnes-Video-2.5 at 1,031, Vidu Q3 Turbo at 1,029, LTX-2.5 Pro at 1,007, Seedance 1.5 Pro at 1,000 and Kling 2.6 Pro (January) at 988.

Griffins poäng kommer från NVIDIAs VideoFDB, som bedömer full-duplex audiovisuell konversation på två spår och byggdes och kördes av NVIDIA med sin egen domare mot en publicerad bedömningsmall. Griffin-Lite fick 3,83 av 5 i generering mot en mänsklig referens på 3,92 och 2,80 för det näst högst rankade publicerade systemet, samt 3,73 i perception mot en mänsklig referens på 4,20, med överensstämmelse i övertagandefrekvens på 62,8 % och 73,8 %. Dessa siffror säger ingenting om huruvida ett klipp ser rätt ut vid 1080p, och Klings Elo säger ingenting om huruvida en modell kan avbrytas mitt i en mening. Det enda ärliga sättet att använda endera är inom dess egen fråga.

Gapet som ingen mäter: latens mot längd

Det finns en verklig ingenjörsmässig kontrast här som ingen av topplistorna fångar, och det är det mest användbara i den här jämförelsen för alla som planerar en produkt.

Kling 3.0 optimerar för längd och struktur inom en avgränsad generering: upp till femton sekunder, upp till ungefär sex planerade tagningar, styrning per tagning. Kostnaden skalas med utdatans varaktighet, och kvaliteten skalas med hur specifik prompten är. Inget av det körs medan användaren fortfarande pratar, och det är inte en brist — det är kategorins form.

Griffin optimerar för latens i en obegränsad session: 320-millisekundersblock, 25 fps, ett beslut som fattas varje subsekundintervall, inget klipp att planera eftersom samtalet inte har något slut. Dess kostnad, vad den nu visar sig bli, skulle skala med samtalets varaktighet snarare än med renderade sekunder, och dess kvalitet skalar med hur naturlig personen i andra änden är snarare än med briefen. Den trestegsdestillationen till en autoregressiv generator tränad på sin egen historia finns just för att den här arkitekturens felmod är drift över en lång utrullning snarare än en dålig tagning.

Ställ de två sida vid sida, och den praktiska konsekvensen är att de misslyckas i motsatta riktningar. Kling 3.0 misslyckas synligt och tidigt – en tagning på gränsen som du kan radera och generera om för ett par cent, med omtagningsbudgeten inbyggd i arbetsflödet. Griffin skulle, om det fungerade som rapporterat, misslyckas osynligt och sent, genom att inte vara vad det verkar vara, vilket är anledningen till att Tavus håller det tillbaka.

Där en router verkligen hjälper, och där den inte gör det

Kling 3.0 finns i OrcaRouter-katalogen som kling/kling-v3 för 0,084 USD per begäran, med samma nyckel och samma OpenAI-kompatibla endpoint som 200+ andra modeller. Det är en verklig skillnad mot att ha ett Kuaishou-konto plus en separat integration för vilken textmodell din pipeline än behöver: eftersom vi inte lägger på något på leverantörens pris blir en prisändring från Kuaishou live hos oss samma dag, och om den uppströms leverantören försämras eller begränsar anropstakten flyttar automatisk failover begäran innan svaret börjar, i stället för att returnera ett fel till din applikation. För en videopipeline där ett anrop kan kosta mer än tusen textanrop är att begäran överlever en dålig minut uppströms värt mer än påslaget du inte betalar.

Griffin finns inte i vår katalog, finns inte i någons katalog och kan inte finnas där – en full-duplex-sessionsmodell är inte en routad begäran. Den kan endast nås genom att skicka in en åtkomstbegäran. Att Tavus själva hänvisar blivande utvecklare till sina äldre modeller i stället för till Griffin är avslöjandet: de tre föregångarna driver de PALs som 150 000 utvecklare och företag redan använder, och Griffin finns inte bland dem.

A screenshot of OrcaRouter's own model page for kling/kling-v3, captured 2 October 2026: the description "Kling 3.0 — flagship text-to-video and image-to-video, multi-shot + subject + motion control, 3-15s clips, up to native 4K", the /v1/video/generations endpoint, a price of $0.08, a p50 of 1.00 s, and an OpenAI-compatible code sample against api.orcarouter.ai/v1.

Vilken, för vad?

• Välj Kling 3.0 för planerade sekvenser med flera tagningar utifrån en enda prompt, för bild-till-video-arbete där dess placering i no-audio-arenan är stark och har många röster, för flerspråkig dialog med röstbindning per karaktär över fem språk, för elementkonsekvens över kamerarörelser, och för 4K om du bekräftar nivån skriftligt — Kuaishous egen dokumentation hävdar nativ 4K medan deras användarguide endast listar 720p och 1080p, och tredjepartspriser i krediter för 4K varierar med mer än en faktor två mellan källor.

• Testa Kling 3.0 för läppsynk först om dialogen är själva poängen, eftersom det är där oberoende praktiska recensioner säger att det brister, och det är felet som kostar flest omtagningar.

• Planera inte utifrån Griffin. Begär åtkomst om frågan du behöver få besvarad är huruvida en person kan skilja en genererad människa från en riktig under ett enminuterssamtal, eller om att veta vart interaktionslagret är på väg bör forma vad du bygger på klipplagret nu.

Håll ögonen på två saker, inte en. På Kling-sidan: huruvida spridningen mellan nivåerna börjar följa priset, eftersom de fyra nivåerna för närvarande ligger inom nitton Elo-poäng från varandra på bild-till-video samtidigt som de skiljer sig i pris med hälften igen, och den billigaste nivån är inte den sämst placerade. På Griffin-sidan: huruvida en öppenhetsmekanism och ett modellkort dyker upp; om de gör det slutar jämförelsen vara en designessä och blir ett upphandlingsbeslut, och den här artikeln behöver skrivas om.

A two-column scoreboard titled "Tavus Griffin vs Kling 3 — the scoreboard". Left column "Tavus Griffin": Status: research preview; Price: none published; Loop: full duplex; Output: 720p in 320 ms chunks; Shots: none to plan; Routing: not routable. Right column "Kling 3": Status: generally available; Price: $0.084 per request; Loop: one generation; Output: 720p and 1080p; Shots: up to six; Routing: routed as kling/kling-v3. Footer: "Kling price per OrcaRouter's live card; arena Elo 1,000 to 1,055 per Artificial Analysis, 2 October 2026."