
Tavus Griffin vs Kling 3: een realtimegesprek tegenover een clip van tien seconden
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 223 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
De eerlijke vorm van deze confrontatie is een routing-asymmetrie. Kling 3is een aanroepbaar model met een prijs, een parameteroppervlak en een vermelding in onze eigen catalogus; Tavus Griffinis een research preview voor een selecte groep vertrouwde testers achter een aanvraagformulier, aangekondigd op 1 oktober 2026, zonder identificatie, zonder endpoint en zonder gepubliceerd tarief. Kling 3.0 staat in de OrcaRouter-catalogus als kling/kling-v3, geprijsd op $0.084 per aanvraag, waarbij de lijstprijs van de provider wordt doorgegeven en er niets bovenop komt. Griffin is niet routeerbaar, en niet omdat niemand eraan toegekomen is — een realtime full-duplexsessie waarin het model 720p in blokken van 320 milliseconden genereert terwijl het luistert, is geen request-response-aanroep, en die zou ook niet in dezelfde vorm passen zelfs als Tavus morgen de poorten zou openen. Dit is dus geen vergelijking die een koper op prijs beslecht. Het is een vergelijking van twee antwoorden op de vraag waarvoor een gegenereerd mens dient.
Wat Kling 3.0 eigenlijk is
Kling 3.0 werd gelanceerd op 5 februari 2026 als een serie van vier modellen — Video 3.0, Video 3.0 Omni, Image 3.0 en Image 3.0 Omni. Het kenmerkende ervan is automatische multi-shot-sequencing: het model plant zelf de shotovergangen, en een aangepaste modus laat je het aantal shots en de duur van elk instellen, waarbij reviewers bruikbare sequenties rapporteren van tot ongeveer zes verschillende shots uit één enkele prompt, en shotgrootte, camerabeweging en narratief moment per shot kunnen worden gespecificeerd. Het maximum is 15 seconden per generatie met een ondergrens van drie seconden. Aan de OrcaRouter-kant verschijnt het als een vlaggenschipmodel voor tekst-naar-video en afbeelding-naar-video met multi-shot-, onderwerp- en bewegingsregeling, clips van 3–15 seconden en naar verluidt tot native 4K, geserveerd op POST /v1/video/generations.
Audio wordt in dezelfde stap native gegenereerd. De versie van Kuaishou ondersteunt Chinees, Engels, Japans, Koreaans en Spaans, verwerkt meertalige dialogen binnen één clip, koppelt een afzonderlijke stem aan elk personage in scènes met meerdere personages en biedt regionale accenten — Amerikaans, Brits en Indiaas Engels; Noordoost-, Peking-, Taiwanees-, Kantonees- en Sichuan-Chinees. Lip-sync-consistentie is de meest gesignaleerde zwakte in onafhankelijke hands-onreviews, waarbij één test meldde dat ongeveer twee op de vijf dialoogclips opnieuw opgenomen moesten worden, en de gerapporteerde artefacten clusteren rond dialogen in lawaaiige omgevingen waar achtergronden van water en wind de spraak gedempt laten klinken.
Wat Griffin eigenlijk is, in één alinea
Griffin is geen videogenerator met een gespreksmodus. Het zijn twee engines die gelijktijdig draaien. Een Continuous Conversational Modeling-engine verwerkt de audio en video van een persoon, herbeoordeelt de uitwisseling met tussenpozen van minder dan een seconde, en beslist bij elk daarvan of hij stil moet blijven, een signaal moet geven, moet backchannelen of de beurt moet nemen — en stuurt daarbij expressieve controls uit die timing, houding, gezichtsuitdrukking en gebaar overdragen, niet alleen woorden. Een audiovisuele generatie-engine zet die controls samen om in geluid en pixels: een autoregressieve diffusietransformer die spraak genereert, telkens één latente chunk, op basis van een gecodeerde sprekerprefix, en een autoregressieve videogenerator met weinig stappen die 720p produceert in chunks van 320 ms bij 25 fps op basis van één enkele referentiefoto. Er is geen prompt, geen cliplengte en geen bestand. Voor audio rapporteert het 0,43 seconden werkelijke audio-naar-video-latentie op H100s, tegenover vier gepubliceerde streamingdiffusie-baselines, wat Tavus beschrijft als de helft van de op één na snelste methode.
Prijs, en de eenzijdige tafel
De prijsstelling van Kling 3.0 is de enige plek in dit artikel waar aan beide kanten van een vergelijking een hard getal staat en één kant leeg is.
• Kling 3.0 op OrcaRouter — $0.084 per verzoek, de lijstprijs van de aanbieder wordt met 0% opslag doorberekend, dus een tariefwijziging of promotiekorting van Kuaishou is hier dezelfde dag live in plaats van pas na een contractcyclus.
• Kling 3.0 op de onafhankelijke arena — de text-to-video-met-audio-ranglijst, uitgelezen op 2 oktober 2026, vermeldt de 1080p Pro-tier op $10,08/min en de Omni 1080p Pro-tier op $8,40/min. Dezelfde ranglijst beoordeelt de vier tiers van Kling 3.0 tegen vier verschillende prijzen, dus "de prijs van Kling 3.0" is niet één enkel bedrag.
• Griffin — geen prijs. Griffin-Lite is beschikbaar voor een selecte groep vertrouwde testers als onderzoekspreview, staat niet op het Tavus-platform, en in de eigen aankondiging staat dat het op dit moment niet beschikbaar is voor klantgebruik. Er is geen tarief per verzoek, geen tarief per seconde en geen gratis niveau om te vermelden, en het model komt pas nadat Tavus heeft uitgewerkt hoe het veilig kan worden uitgebracht.
Dat is het hele prijsgedeelte, en het is eerlijk om het daarbij te laten in plaats van een schatting per seconde te verzinnen op basis van de compute-voetafdruk.
De scoreborden meten verschillende dingen en komen niet overeen.
Beide modellen zijn door iemand anders dan hun leverancier gescoord, op instrumenten die niet met elkaar te vergelijken zijn.
Kling 3.0 staat op de videoarena van Artificial Analysis, waar Elo voortkomt uit blinde paarsgewijze menselijke voorkeur bij korte clips. Twee aflezingen op dezelfde dag vertellen verschillende verhalen, en dat is de valkuil die het benoemen waard is: op de ranglijst voor tekst-naar-video met audio staan de Kling-niveaus in de middenmoot, terwijl ze op de ranglijst voor afbeelding-naar-video met audio aanzienlijk hoger staan — maar de Kling-niveaus komen niet allemaal op beide voor. Alleen de Pro- en Omni Pro 1080p-builds staan überhaupt op de ranglijst voor tekst-naar-video; het 720p Standard-niveau wordt gescoord op afbeelding-naar-video en nergens anders.
• Kling 3.0 in tekst-naar-video (met audio) — 1080p Pro op de 16e plaats, Elo 1.000 bij 4.844 stemmen, $10,08/min; Omni 1080p Pro op de 16e plaats, Elo 987 bij 2.741 stemmen, $6,90/min. De duurdere van de twee tiers scoort lager, wat hetzelfde non-resultaat is dat de tierspreiding overal elders op deze ranglijst laat zien.
• Kling 3.0 bij beeld-naar-video (met audio) — 1080p Pro op de 18e–20e plaats, Elo 1.055 (±6) met 14.896 stemmen, $20,16/min; 720p Standard op de 18e–20e plaats, Elo 1.051 (±6) met 14.692 stemmen, $15,60/min; Omni 1080p Pro op de 21e–22e plaats, Elo 1.044 (±8) met 2.945 stemmen, $16,80/min; Omni 720p Standard op de 21e–24e plaats, Elo 1.036, $13,44/min.
De interpretatie is dat Kling 3.0 sterker is wanneer het begint met een aangeleverde afbeelding dan wanneer het begint met tekst, en de image-to-video-ranglijst telt drie keer zoveel stemmen, dus de positie daar is de beter uitgekristalliseerde. Dat is ook de modus die het meeste commerciële werk gebruikt. Let op wat de vier niveaus opleveren: binnen image-to-video beslaan ze zestien Elo-punten over een prijsbereik van $13,44 tot $20,16 per minuut, en de goedkoopste van de vier is niet de laagst gerangschikte. Meer betalen voor Kling 3.0 brengt het niet hoger op deze ranglijst.

Griffins scores komen van NVIDIA's VideoFDB, dat full-duplex audio-visuele gesprekken op twee sporen beoordeelt en door NVIDIA is gebouwd en uitgevoerd met zijn eigen beoordelaar aan de hand van een gepubliceerde rubric. Griffin-Lite scoorde 3,83 van de 5 op generatie tegen een menselijke referentie van 3,92 en 2,80 voor het op een na hoogst gepubliceerde systeem, en 3,73 op perceptie tegen een menselijke referentie van 4,20, met een afstemming van het overnamepercentage van 62,8% en 73,8%. Die cijfers zeggen niets over of een clip er goed uitziet op 1080p, en Kling's Elo zegt niets over of een model midden in een zin onderbroken kan worden. Het enige eerlijke gebruik van elk van beide is binnen zijn eigen vraag.
De kloof die niemand meet: latentie versus lengte
Er is hier een echt contrast op engineeringgebied dat geen van beide leaderboards vastlegt, en het is het nuttigste in deze vergelijking voor iedereen die een product plant.
Kling 3.0 is geoptimaliseerd voor lengte en structuur binnen een begrensde generatie: tot vijftien seconden, tot ongeveer zes geplande shots, controle per shot. De kosten schalen met de uitvoerduur, en de kwaliteit schaalt met hoe specifiek de prompt is. Niets ervan draait terwijl de gebruiker nog praat, en dat is geen gebrek — het is de vorm van de categorie.
Griffin optimaliseert voor latentie binnen een onbegrensde sessie: chunks van 320 milliseconden, 25 fps, elke subseconde wordt een beslissing genomen, geen clip om te plannen omdat het gesprek geen einde heeft. De kosten ervan, wat die ook blijken te zijn, zouden meeschalen met de gespreksduur in plaats van met gerenderde seconden, en de kwaliteit ervan schaalt met hoe natuurlijk de persoon aan de andere kant is in plaats van met de briefing. De drietrapsdistillatie tot een autoregressieve generator die op zijn eigen geschiedenis is getraind, bestaat juist omdat de faalmodus van deze architectuur drift gedurende een lange rollout is in plaats van een slechte opname.
Zet de twee naast elkaar en het praktische gevolg is dat ze op tegenovergestelde manieren falen. Kling 3.0 faalt zichtbaar en vroeg — een twijfelachtige take die je voor een paar cent kunt verwijderen en opnieuw kunt genereren, met het retakebudget ingebouwd in de workflow. Griffin zou, als het werkte zoals gerapporteerd, onzichtbaar en laat falen, doordat het niet is wat het lijkt te zijn, en dat is de reden dat Tavus het tegenhoudt.
Waar een router echt helpt, en waar niet
Kling 3.0 staat in de OrcaRouter-catalogus als kling/kling-v3 voor $0,084 per verzoek, op dezelfde key en hetzelfde OpenAI-compatibele endpoint als 200+ andere modellen. Dat is een echt verschil met het aanhouden van een Kuaishou-account plus een aparte integratie voor welk tekstmodel je pipeline ook nodig heeft: omdat we niets bovenop de providerprijs doen, is een tariefwijziging van Kuaishou dezelfde dag nog bij ons zichtbaar, en als de upstreamprovider degradeert of snelheidslimieten oplegt, verplaatst automatische failover het verzoek voordat het antwoord begint, in plaats van een fout naar je applicatie terug te sturen. Voor een videopipeline waarin één call meer kan kosten dan duizend tekstcalls, is het het verzoek een slechte minuut upstream laten overleven meer waard dan de opslag die je niet betaalt.
Griffin staat niet in onze catalogus, staat in niemands catalogus, en dat kan ook niet — een full-duplex-sessiemodel is geen gerouteerd verzoek. Het is alleen bereikbaar door een toegangsverzoek in te dienen. Dat Tavus zelf aspirant-bouwers naar zijn oudere modellen verwijst in plaats van naar Griffin, is veelzeggend: de drie voorgangers drijven de PALs aan die 150.000 ontwikkelaars en bedrijven al gebruiken, en Griffin is daar niet een van.

Welke, waarvoor?
• Kies Kling 3.0 voor geplande multi-shot-sequenties vanuit één prompt, voor image-to-video-werk waar de no-audio arena-positionering sterk is en veel stemmen krijgt, voor meertalige dialoog met per-personage stemkoppeling in vijf talen, voor elementconsistentie bij camerabewegingen, en voor 4K als je de tier schriftelijk bevestigt — Kuaishou's eigen documentatie beweert native 4K, terwijl de gebruikershandleiding alleen 720p en 1080p vermeldt, en credittarieven van derden voor 4K variëren tussen bronnen met meer dan een factor twee.
• Test Kling 3.0 eerst op lip-sync als dialoog het doel is, want dat is waar onafhankelijke praktijkreviews zeggen dat het misgaat, en het is de fout die de meeste retakes kost.
• Plan niet rond Griffin. Vraag toegang aan als de vraag die je beantwoord wilt hebben is of iemand tijdens een gesprek van één minuut een gegenereerd persoon van een echt persoon kan onderscheiden, of als weten waar de interactielaag naartoe gaat, vorm moet geven aan wat je nu op de cliplaag bouwt.
• Let op twee dingen, niet op één. Aan de Kling-kant: of de spreiding tussen de niveaus de prijs begint te volgen, want de vier niveaus liggen bij afbeelding-naar-video momenteel binnen negentien Elo-punten van elkaar, terwijl ze in prijs met de helft meer verschillen, en het goedkoopste niveau is niet het slechtst geplaatst. Aan de Griffin-kant: of er een mechanisme voor openbaarmaking en een modelkaart komen; als dat gebeurt, is de vergelijking niet langer een ontwerpassay maar wordt het een inkoopbeslissing, en moet dit artikel worden herschreven.

