Hero-titelkaart voor 'Tavus Griffin vs Seedance 2.5' met de ondertitel 'De ene genereert dertig seconden, de andere wacht tot je je zin afmaakt', boven vier chips: Seedance 2.5 30 s in één doorgang; Seedance 2.5 ongeveer $0,51 per 5 s bij 480p; Griffin 0,43 s audio-naar-video; Griffin nog niet verkoopbaar aan klanten.
Guides & Insights

Tavus Griffin vs Seedance 2.5: De een genereert dertig seconden, de ander wacht tot je je zin afmaakt

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De snelste manier om de kloof tussen Tavus Griffin en Seedance 2.5 te begrijpen, is kijken naar wat elk model doet wanneer je stopt met praten. Seedance 2.5, op 31 juli 2026 uitgebracht door het Seed-team van ByteDance, gaat door: geef het een prompt en het produceert tot dertig seconden video in één enkele doorgang, met gekoppelde audio, in een resolutie en framesnelheid die je koos voordat je op return drukte. Tavus Griffin, in oktober 2026 door Tavus aangekondigd als een onderzoekspreview, stopt — en begint dan weer, omdat het al die tijd heeft geluisterd en iets terug te zeggen heeft. Het ene model is een productie-engine die zonder toezicht draait. Het andere is een deelnemer die alleen werkt als jij er bent.

Dertig seconden in één take

Seedance 2.5's belangrijkste kenmerk is de duur. Terwijl zijn voorganger maximaal vijftien seconden aankon, produceert 2.5 dertig seconden in één generatie — een verdubbeling van het venster, en dat is het verschil tussen een shot en een scène. Daarnaast ondersteunt het uitbreiding in meerdere rondes, en ByteDance heeft in bèta een ultralange modus gedemonstreerd waarin het model wordt gevraagd zijn eigen output voort te zetten in plaats van helemaal opnieuw te beginnen.

Het invoeroppervlak is breed, zelfs naar de maatstaven van 2026. Eén enkele aanvraag kan tot ongeveer dertig afbeeldingen, tien videoclips en tien audioclips als referentie bevatten, waarbij referentievideo en -audio elk ongeveer dertig seconden duren. Dat is genoeg materiaal om in één keer een personage, een locatie, een beweging en een soundtrack te specificeren. Het model wordt ook geleverd met een reeks benoemde modi die meer weg hebben van een compositing-suite dan van een promptvak: een white-model- en kleimodus voor previz, green-screen, bewegingsreferentie en creatieve referentie. Daar bovenop zitten controle op timestampniveau en bewerking op regioniveau, en dat is waar het venster van dertig seconden ophoudt louter een lengte te zijn en een tijdlijn begint te worden.

Audio en video komen uit dezelfde pass voort in plaats van achteraf te worden gemuxt, over meer dan tien talen aan dialoog heen, en de lijst met launchpartners — XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei, Qiongche Intelligence — leest als een industriële en automotive klantenbasis in plaats van een creatieve-tools-klantenbasis. ByteDance' eigen framing is dat Seedance 2.5 bedoeld is voor mensen die een afgewerkt stuk beeldmateriaal nodig hebben, niet een interactie.

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard filtered to models with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144 with 7,526 votes and $34.12 per minute, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns.

Het model dat alleen bestaat terwijl je praat

Griffin is een systeem met de tegenovergestelde vorm, en Tavus is ongewoon expliciet over die vorm. Het noemt Griffin het eerste Human Interaction Model: een video-naar-video-systeem dat tijdens een gesprek naar een deelnemer kijkt en luistert en de andere kant ervan in realtime genereert. De architectuur valt uiteen in Continuous Conversational Modeling, dat van moment tot moment bepaalt wat de persona zou moeten doen, en Audio-Visual Generation, dat de bijpassende spraak en het bijpassende gezicht streamt. Het is full-duplex, dus het kan onderbroken worden, en het heeft geen helder einde-van-beurt-signaal nodig om te reageren.

Alles aan de implementatie is afgestemd op de volgende fractie van een seconde in plaats van op het volgende shot. De Tavec-audiocodec draait op 48 kHz met 40 waarden per frame bij 100 frames per seconde, geen codebooks, een volledig causale decoder, en pakketten van slechts 10 milliseconden. Video streamt op 720p in brokken van 320 milliseconden, één latent per acht frames bij 25 fps, drie diffusiestappen per latent, met een 8× temporele compressie in de VAE. Een driedelige distillatie — distributiematching, dan teacher-forcing autoregressief, dan self-forcing — is wat drie diffusiestappen in realtime haalbaar maakt. De audio-naar-video-latentie is gemiddeld 0,43 seconden op H100's, wat volgens Tavus ongeveer de helft is van de op één na snelste methode die het heeft gemeten. Voor het klonen van een stem is ongeveer een sample van tien seconden nodig.

En dan de zin die bepaalt hoe je eromheen plant: Tavus stelt dat Griffin-Lite, de onderzoekspreview, beschikbaar is voor een selecte groep vroege testers, dat Griffin-Lite op dit moment niet beschikbaar zal zijn voor gebruik door klanten, dat een bredere release van een krachtiger model zal volgen, en dat Griffin nog niet op het Tavus-platform staat — het zal verschijnen zodra het bedrijf heeft uitgewerkt hoe het veilig kan worden uitgebracht.

De beweringen die elk doet, en wat ze waard zijn

Het bewijs van Seedance 2.5 gaat vooral over capaciteit: wat het kan accepteren, hoe lang het kan draaien, wat het kost. Het bewijs van Griffin gaat vooral over effect. In een studie met Queen Mary University of London meldt Tavus dat 26 van de 54 deelnemers — 48% — geloofden dat Griffin een echt persoon was na een videogesprek van één minuut, tegenover 1 op 41 (2,4%) bij zijn eerdere stack Phoenix-4.5, Sparrow-2 en Raven-1, waarbij twijfelaars meestal binnen de eerste twintig seconden argwaan kregen. De VideoFDB-benchmark van NVIDIA, gescoord in september 2026, zet Griffin op de eerste plaats bij face-to-face-AI volgens Tavus' eigen cijfers: generatie 3,83 tegenover de sterkste gerapporteerde baseline van 2,80 en 3,92 voor een mens, perceptie 3,73 tegenover 3,44 en 4,20, en een voorsprong van 37% op het op een na beste systeem bij het onmiddellijk reageren. Door de leverancier gerapporteerd, op een benchmark die NVIDIA heeft gebouwd — maar het zijn de menselijke vergelijkingspunten die gewicht in de schaal leggen.

Er is geen vergelijkbare onafhankelijke test voor "geloofde het publiek het" op Seedance 2.5, want dat is niet waarvoor het bedoeld is. De twee modellen beantwoorden verschillende vragen en geen van beide sets cijfers is overdraagbaar naar de andere.

Wat je daadwerkelijk kunt kopen

Seedance 2.5 is een product met een tarievenkaart. Op het ModelArk-platform van ByteDance kost het $10,70 per miljoen tokens zonder video-invoer en $6,40 per miljoen met video-invoer, wat neerkomt op ongeveer $0,51 voor een clip van vijf seconden in 16:9 bij 480p en ongeveer $1,16 voor dezelfde clip bij 720p. Toegang verloopt via de consumenten-apps van ByteDance en via de API op Volcano Engine Ark in China en BytePlus ModelArk internationaal. Ten minste één distributeur stelt dat het niet beschikbaar is in de Verenigde Staten, en bronnen zijn het er niet over eens of de hoogste resolutie 720p of 1080p is — beide zijn het weten waard voordat je het in een specificatie vastlegt.

Griffin heeft geen tariefkaart, geen publieke API en geen datum. Daar komt de hele koopbeslissing op neer, en dat perkt de vraag sterker in dan de meeste vergelijkingsartikelen toegeven.

Board titled 'Seconds versus Sentences'. Seedance 2.5 card: what it reads a prompt plus up to 30 images, 10 video clips and 10 audio clips; what it returns up to 30 seconds of video in one pass; audio joint audio and video over 10 languages; latency batch generation, no real-time mode; price about $0.51 per five-second 480p clip on ModelArk; availability shipped 31 July 2026, live on ModelArk. Tavus Griffin card: what it reads the live participant, video and audio; what it returns the other side of the conversation in real time; audio streaming speech with a voice cloned from a ten-second sample; latency 0.43 s average audio to video on H100s; price none published; availability research preview, selected testers only.

Waar een router zijn plek verdient

Als je iets bouwt dat beide nodig heeft — een agent die een gesprek voert en ook afgewerkt beeldmateriaal produceert — dan kijk je naar twee leveranciers, twee consoles, twee factureringssystemen en twee verschillende opvattingen over wat een verzoek is. Dat is de naad waarop OrcaRouter echt nuttig is in plaats van decoratief: één sleutel voor meer dan tweehonderd modellen, met lijstprijzen van providers doorgegeven tegen 0% opslag zodat een prijsverlaging van een leverancier dezelfde dag nog op je rekening terechtkomt, automatische failover zodat één verzadigde provider niet jouw storing wordt, plus een routing-DSL om kritieke taken aan een specifieke backend vast te pinnen terwijl concepten gaan waar de capaciteit het goedkoopst is. Modelfusie is hier ook in de marge van belang — voor een generator met een prijs per token of per seconde is het inzetten van een goedkoop tekstmodel om een prompt aan te scherpen voordat je aan de dure generatie uitgeeft doorgaans de lijn met het hoogste rendement in de pipeline.

Om precies te zijn over de twee modellen in de titel: noch Seedance 2.5 noch Griffin is een OrcaRouter-route. Seedance is bereikbaar via ByteDance' eigen platforms en distributeurs van derden; Griffin is helemaal niet bereikbaar. Wat de catalogus aan de videokant wel bevat, is minimax/minimax-h3, MiniMax' omni-modale generator, voor $0,08 per seconde output bij 768P en $0,13 per seconde bij 2K, verkocht in dezelfde eenheden per seconde als Seedance en nu beschikbaar.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Veelgesteld, kort

Kan ik Seedance 2.5 en Griffin in hetzelfde product draaien?Architectonisch gezien ja, en het is de voor de hand liggende splitsing: Seedance voor alles wat vooraf gerenderd kan worden, Griffin voor het live-oppervlak. Commercieel gezien nee, want Griffin kan nog niet aan je worden verkocht.

Is Griffin gewoon een generator voor pratende hoofden? Nee, en Tavus is zorgvuldig over dat onderscheid — een generator voor pratende hoofden neemt tekst en geeft video terug, terwijl Griffin de video en audio van de deelnemer als input neemt en wordt beoordeeld op of hij op dat moment reageert.

Werkt Seedance 2.5 in realtime? Nee. Het is een batchgenerator met een plafond van dertig seconden en een uitbreidingsmodus in meerdere rondes; latentie is niet de as waarop het concurreert.

Kortom

Seedance 2.5 is een uitgebrachte productie-engine: dertig seconden in één doorgang, gecombineerde audio, tot dertig afbeeldingen en tien video- en audioreferenties, controle op tijdstempel- en regioniveau, ongeveer $0,51 voor een clip van vijf seconden in 480p en ongeveer $1,16 bij 720p op ModelArk, nu beschikbaar via de eigen platforms van ByteDance en niet, voor zover iemand heeft bevestigd, in de Verenigde Staten. Tavus Griffin is geen product: het is een duplex Human Interaction Model waarvan de gepubliceerde prestaties 48% van de deelnemers zijn die geloofden dat het een mens was in een gesprek van één minuut, en een gemiddelde audio-naar-video latentie van 0,43 seconden op H100's, en waarvan de leverancier schriftelijk heeft gezegd dat klanten het nog niet kunnen gebruiken. Als je vandaag beeldmateriaal nodig hebt, is Seedance het antwoord en de prijs is openbaar. Als je een gezicht nodig hebt dat reageert terwijl je praat, is het antwoord dat niemand er nog een verkoopt.