Een herokaart voor "Tavus Griffin vs Alibaba Wan 2.7", met twee chips met de tekst "Tavus Griffin — geen gepubliceerde prijs" en "Alibaba Wan 2.7 — $9,00 per minuut bij 1080p", boven zes rijen: Maakt: een livegesprek; Tegen: een clip van 2 tot 15 seconden; Griffin-prijs: niet gepubliceerd; Wan 2.7-prijs: $9,00 per minuut; Griffin-status: onderzoekspreview; Wan 2.7-status: algemeen beschikbaar. Voettekst: "Wan 2.7-tarieven zijn lijstprijzen van Alibaba Cloud; Griffin is een onderzoekspreview zonder tariefkaart."
Guides & Insights

Tavus Griffin vs Alibaba Wan 2.7: Een conversationeel model tegenover een generatief model

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De verleidelijke manier om Tavus Griffin en Alibaba Wan 2.7 te vergelijken is per seconde video, en die vergelijking kan niet worden gemaakt. Wan 2.7 heeft een gepubliceerde tariefkaart — $9.00 per minuut bij 1080p op de internationale Singapore-endpoints van Alibaba Cloud, met een goedkopere tier voor Beijing en Tokyo — en Tavus Griffin heeft helemaal geen tariefkaart, omdat Griffin-Lite op 1 oktober 2026 is uitgebracht als een onderzoekspreview voor geselecteerde vertrouwde testers achter een aanvraagformulier. Wat de twee wel delen is een woord: video. Verder zijn het antwoorden op verschillende vragen. De ene wordt gevraagd wat er vervolgens in een gesprek moet gebeuren; de andere wordt gevraagd hoe een beschreven scène eruitziet. De interessante vergelijking is niet kwaliteit, maar wat elk van hen van je nodig heeft voordat het iets produceert, en wat je terugkrijgt.

Het verschil is de loop, niet de resolutie.

Wan 2.7 genereert clip voor clip op basis van een prompt. Je schrijft een beschrijving, je krijgt een stuk beeldmateriaal, je bekijkt het, je schrijft er nog een. Wan 2.7 is een suite van vier modellen — tekst-naar-video, afbeelding-naar-video, referentie-naar-video en videobewerking — en de interactie is fundamenteel transactioneel: een invoer, een gerenderde uitvoer en een beslissing of je het houdt. Er draait niets aan terwijl je nog aan het beslissen bent wat je wilt vragen.

Griffin is andersom gebouwd. Het is een full-duplexsysteem: een Continuous Conversational Modeling-engine die audio en video binnenkrijgt en het gesprek met tussenpozen van minder dan een seconde opnieuw beoordeelt, en beslist of hij stil moet blijven, een signaal moet geven, een backchannel moet geven of de beurt moet nemen, en expressieve controls uitzendt die parallel een streaming spraakgenerator en een streaming videogenerator aansturen. Het genereert 720p in chunks van 320 ms op basis van één enkele referentiefoto, en de claim die ertoe doet, is dat een beslissing midden in een zin binnen dezelfde mini-beurt zichtbaar wordt in de stem en op het gezicht. De benchmark hiervoor is niet een leaderboard van clips. Het gaat erom of je het kunt onderbreken.

Simpel gezegd: Wan 2.7 beantwoordt de vraag “hoe ziet deze scène eruit in beweging?” Griffin beantwoordt “wat moeten dit gezicht en deze stem doen in de komende tweehonderd milliseconden, gegeven dat de persoon net pauzeerde?”

Prijs, aan de ene kant waar die er is

De gepubliceerde tarieven van Wan 2.7 gelden per seconde gegenereerde video, en de niveaus zijn niet uniform binnen de suite, een detail dat de meeste vergelijkingspagina's overslaan.

• wan2.7-t2v en wan2.7-i2v — worden alleen gefactureerd op basis van de duur van de output. Internationaal Singapore: $0,10/s bij 720p en $0,15/s bij 1080p, wat neerkomt op $9,00/min, het bedrag dat op de ranglijsten staat. Beijing en Tokyo vermelden $0,086/s en $0,143/s voor hetzelfde werk.

• wan2.7-r2v (referentie-naar-video) — gefactureerd op basis van de duur van de invoervideo, met een maximum van vijf seconden, plus de output. Voer een referentie van vijf seconden in een generatie van vijftien seconden en je wordt gefactureerd voor twintig seconden.

• wan2.7-videoedit — alleen op output gefactureerd, met de input footage gratis.

Er horen twee levenscyclusfeiten naast die cijfers. Alibaba gaf een tijdelijke korting van 30% bij de lancering op zijn eigen Bailian- en Qwen Cloud-oppervlakken, geldig tot 23 september 2026, wat inmiddels verleden tijd is. En de kennisgeving over buitendienststelling van Alibaba Cloud Model Studio (ID 118434) haalt verschillende oudere modellen offline op 10 oktober 2026, waaronder wan2.7-r2v en wan2.7-image. Dat is op variantniveau, niet een uitfasering van de generatie — wan2.7-t2v en wan2.7-i2v blijven vermeld met actuele tarieven en pagina's die nog op 11 september zijn bijgewerkt — maar als reference-to-video de reden is dat je naar 2.7 keek, dan zit er een datum aan die route vast.

De vergelijking met Griffin heeft één eerlijke regel: er is geen prijs naast die van Wan 2.7 te zetten, omdat Tavus er geen heeft gepubliceerd. Griffin-Lite staat niet op het Tavus-platform, de aankondiging zegt dat het op dit moment niet beschikbaar zal zijn voor klantgebruik, en de eigen afsluitende woorden van het bedrijf zijn dat Griffin komt zodra het heeft uitgewerkt hoe het veilig kan worden uitgebracht. Er is geen tarief per seconde, geen tarief per verzoek, geen gratis tier, geen enterprise-tier. Iedereen die een prijs voor Griffin noemt, verzint die.

Kwaliteitsscores: twee boards die niet voldoen

De twee modellen zijn beoordeeld met volledig verschillende instrumenten, daarom bestaat er geen Elo-vergelijking tussen beide.

Wan 2.7 heeft twee vermeldingen in de video-arena van Artificial Analysis, en ze staan niet op dezelfde plek — dat is precies de valkuil wanneer je één getal voor Wan 2.7 citeert. De Elo daar is afgeleid van blinde paarsgewijze menselijke voorkeursstemmen, een methodologie die is gebouwd voor korte gegenereerde clips, en beide onderstaande waarden komen van boards die op 2 oktober 2026 zijn uitgelezen.

• Wan2.7-260612 (de build van juni) in tekst-naar-video (met audio) — 13e–14e, Elo 1.032 (±10) met 4.645 stemmen, $9,00/min.

• Wan 2.7 (aprilversie) in afbeelding-naar-video (met audio) — 12e van 34, Elo 1.077 bij 4.571 stemmen, $9,00/min, een ranglijst die ongeveer hetzelfde aantal stemmen heeft, maar het aanzienlijk hoger positioneert.

• Wan 3.0, het nieuwere broertje — 1e met Elo 1.157 op tekst-naar-video en 6e met 1.164 op afbeelding-naar-video, beide tegen $12,00/min. Dat is het getal dat je moet kennen voordat je Wan 2.7 met wat dan ook vergelijkt: Alibaba's eigen volgende generatie staat bovenaan de ranglijst en 2.7 is een middenmoter.

A screenshot of the top of Artificial Analysis's "AA-Video-T2V v2.0" leaderboard, text-to-video with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157 with 7,575 votes and $12.00/min; Utopai X (based on MiniMax H3) second at 1,150; Dreamina Seedance 2.5 third at 1,144; MiniMax H3 (768p) fourth at 1,139 and $4.80/min; MiniMax H3 Max fifth at 1,134; FLUX 3 sixth at 1,127; Gemini Omni Flash eighth at 1,117 and $9.12/min; Wan2.7-260612 thirteenth at 1,032 with 4,645 votes and $9.00/min; and the two Kling 3.0 1080p tiers sixteenth, at Elo 1,018 and Elo 1,000.

Griffin staat op NVIDIA's VideoFDB, een benchmark voor full-duplex audio-visuele gesprekken die NVIDIA in september 2026 zelf heeft gebouwd en beoordeeld, met een taalmodel als beoordelaar volgens een rubric van nul tot vijf. Griffin-Lite scoorde 3,83 op de generatietrack tegen een menselijke referentie van 3,92 en 2,80 voor het op een na best presterende gepubliceerde systeem, en 3,73 op de perceptietrack tegen een menselijke referentie van 4,20. Tavus rapporteert ook 0,43 seconde werkelijke audio-naar-video-latentie voor de generator tegenover vier gepubliceerde streamingdiffusiebasislijnen op H100's.

Beide sets cijfers zijn legitiem en geen van beide is overdraagbaar. Elo op de arena is een stemmentelling over voorkeur voor clips; VideoFDB is de rubricscore van een beoordelaar over gespreksgedrag. Er is geen brug tussen beide, en de valkuil van kleine steekproeven werkt ook de andere kant op: de ±10-band van de arena op Wan 2.7 is breed genoeg dat de plaatsing ten opzichte van naburige systemen niet scherp is vastgesteld, en NVIDIA's verschil van 0,09 punt in generatiescore ten opzichte van de mens is op een vijfpuntsrubric klein genoeg dat "dicht bij de menselijke referentie" de eerlijke interpretatie is, niet "op menselijk niveau". De perceptievergelijking is ook niet een vergelijking van gelijke gevallen — verschillende van de systemen waar Griffin boven wordt geplaatst, waaronder OpenAI's gpt-realtime en MiniCPM-o 4.5, worden gescoord in alleen-audio-configuraties, terwijl Griffin ook video waarneemt. Een deel van de voorsprong van 0,29 punt meet het hebben van ogen.

Wat elk van jou nodig heeft

Dit is waar de vergelijking nuttig wordt, omdat de inputs de producten zijn.

• Invoer — Wan 2.7 accepteert tekst, een afbeelding, een video en audio. Griffin neemt een live persoon op via camera en microfoon, en genereert op verzoek helemaal geen clip.

• Uitvoer — Wan 2.7 produceert een videobestand, 2 tot 15 seconden per generatie, tot 1080p, met native audio. Griffin produceert een doorlopend gesprek: 720p-video met 25 fps in blokken van 320 ms, in realtime gegenereerd en afgespeeld terwijl het wordt gedecodeerd.

• Wat stuurt het aan — Wan 2.7 wordt aangestuurd door de prompt en door maximaal vijf afbeeldingen van het onderwerp en vijf referentieclips, binnen een maximum van tien referentie-assets per verzoek. Griffin wordt aangestuurd door wat de persoon doet: een pauze, een blik afgewend, een gebaar, een onderbreking.

• Tijdshorizon — de werkeenheid van Wan 2.7 is een clip van maximaal vijftien seconden, die je vervolgens samenvoegt. De werkeenheid van Griffin is een gesprek, en daarom moest de architectuur drift oplossen — de distillatie in drie fasen naar een autoregressieve generator, getraind op zijn eigen gegenereerde geschiedenis zodat lange rollouts stabiel blijven — in plaats van te vechten voor één langere generatie.

• Outputcontainer — Wan 2.7 geeft een bestand terug dat van jou is en dat je kunt bewerken, kleurcorrigeren en distribueren. Griffin geeft een gerenderde sessie terug. Er is geen bestand om te bewerken, omdat de pixels per chunk worden gegenereerd op basis van een referentiefoto en de eigen geschiedenis van het model, en de achtergrond, de schaduwen en de stoel waarin de persoon zit deel uitmaken van de generatie.

Eén structureel verschil dat het benoemen waard is: de kosten van Wan 2.7 schalen mee met de duur van de output en de kwaliteit schaalt mee met hoe specifiek je prompt is. De kosten van Griffin zijn niet gemeten en de kwaliteit schaalt mee met hoe natuurlijk de persoon aan de andere kant is. Je kunt de een verbeteren door betere briefs te schrijven en de ander alleen door het met echte mensen te gebruiken.

A screenshot of the top of Artificial Analysis's "AA-Video-I2V v1.0" leaderboard, image-to-video with audio, captured 2 October 2026: MiniMax H3 Max first at Elo 1,195; MiniMax H3 second at 1,181; Gemini Omni Flash third at 1,178; Dreamina Seedance 2.0 720p fourth at 1,176; HiDream-O1-Video-1.0 fifth at 1,175; Wan 3.0 sixth at 1,164 with 9,302 votes and $12.00/min; Veo 3.1 eleventh at 1,082; and Wan 2.7 twelfth at Elo 1,077 with 4,571 votes and $9.00/min. A note above the table says "AA-Video-I2V v2.0 is coming soon".

Referentie en consistentie, waar de twee ontwerpen botsen

Wan 2.7 regelt de consistentie van het onderwerp via aangeleverde referenties: vijf afbeeldingen van het onderwerp, vijf referentieclips, in totaal tien assets. Het is een fotografische aanpak — je laat zien hoe het onderwerp eruitziet en het behoudt dat uiterlijk gedurende de hele generatie.

Griffin bestuurt hetzelfde op de tegenovergestelde manier. Het genereert in realtime elke pixel in elk frame op basis van één referentieafbeelding, en in de aankondiging wordt expliciet gesteld dat het de hele scène aanstuurt in plaats van het gezicht: de armen en vingers, de beweging van de stoel, de geworpen schaduwen en de achtergrond daarachter. Consistentie wordt daar bereikt door de omgeving tot een generatiedoel te maken in plaats van een gecompositeerde plaat.

Geen van beide benaderingen is strikt beter en ze falen op verschillende manieren. Referentiegeconditioneerde generatie faalt doordat ze over een lange clip wegdrijft van het aangeleverde subject. Generatie per chunk met een autoregressieve geschiedenis faalt doordat ze over een lange sessie ronddwaalt als de driftafhandeling verkeerd is, wat precies het falen is dat de derde distillatiefase moet voorkomen. Wan 2.7 is de veiligere keuze wanneer de oplevering een specifiek persoon in een specifieke look is. Griffin dingt niet mee voor die opdracht.

Veiligheid, herkomst en de houding rond de release

Wan 2.7 beschikt niet over een gepubliceerd herkomstsysteem dat vergelijkbaar is met een watermerk dat compressie overleeft — de aankondiging noemt audiokwaliteit en de nauwkeurigheid van tekst op het scherm als gebieden die nog aandacht behoeven, wat een voorbehoud over de getrouwheid is, niet over de veiligheid.

Griffins veiligheidsverhaal is omgekeerd: Tavus' opgegeven reden om het in preview te houden, is dat dezelfde eigenschappen die het een betere interface maken, het ook beter maken in iemand ervan te overtuigen dat die met een mens praat, en de cijfers ondersteunen die zorg. In het eigen liveonderzoek van het bedrijf geloofden 26 van de 54 deelnemers dat hun gesprekspartner een echt persoon was, tegenover 1 van de 41 op de vorige Phoenix-4.5 / Raven-1 / Sparrow-2-stack. Deelnemers die wel iets vermoedden, deden dat doorgaans binnen de eerste twintig seconden. Tavus zegt dat er vóór de release nog meer werk aan alignment en openbaarmaking nodig is, dat het openbaarmakingsfuncties bouwt, en dat het met organisaties samenwerkt aan veiligheidsevaluaties. Dat is het meest substantiële dat iemand over dit model heeft gepubliceerd, en het is ook de reden waarom er geen product te koop is.

Voor iedereen die de twee als tools vergelijkt, is de praktische consequentie simpel: de ene is op aanvraag te genereren en vandaag nog te leveren, en de andere is een evaluatiedoel waarvan de release afhangt van een probleem dat de leverancier nog niet heeft opgelost.

Welke, waarvoor?

• Kies Wan 2.7 als het op te leveren resultaat beeldmateriaal is. Instructiegebaseerde bewerking van bestaand materiaal is de werklast waarin het ongewoon sterk en ongewoon goedkoop is, omdat de bewerkingsvariant alleen op output afrekent en het inputbeeldmateriaal als gratis behandelt. Het is de moeite waard om de reference-to-video-variant ervan te controleren met het oog op de buitengebruikstelling op 10 oktober voordat je je eraan vastlegt.

• Kies dit kwartaal Griffin nergens voor, want dat kan niet. Vraag toegang aan als je moet weten of iemand het kan merken, of als je roadmap afhangt van de interactielaag in plaats van de footagelaag.

• Let op de kloof, niet op een van beide modellen. De komst van Griffin maakt de interessantere vergelijking een toekomstige: een systeem dat het hele gesprek genereert tegenover een suite die de hele scène genereert. Het eerste product dat beide doet, is het product waartegen dit het herlezen waard zal zijn.

Waar een router past, en waar niet

Geen van deze modellen staat in de OrcaRouter-catalogus, en dat is het vermelden waard voordat we iets anders in deze sectie behandelen. Wan 2.7 is bereikbaar via Alibaba's eigen platforms — Model Studio op Alibaba Cloud en Qwen Cloud — en via creatieve tools van derden die het na de lancering hebben geïntegreerd; Tavus Griffin is alleen bereikbaar via een aanvraagformulier. Als een van beide routeerbaar wordt, verschijnen ze tegen de lijstprijs van de provider.

Het deel van een videopipeline dat een routeringsprobleem is, is de tekst eromheen. Shotlijsten, promptuitbreiding, het genereren van ondertitels, samenvattingen van kwaliteitsbeoordelingen en het transcript- of dialoogwerk dat een reference-to-video-pass voedt, zijn allemaal tekstaanroepen, en die draaien op hetzelfde OpenAI-compatibele endpoint bij OrcaRouter als 200+ andere modellen tegen de lijstprijs van de provider met 0% opslag erbij, dus een prijsverlaging van een leverancier is dezelfde dag live in plaats van na een contractcyclus. Een goedkoop model inzetten voor een bulkpass en een frontier-model voor de laatste is daar een configuratiewijziging in plaats van een tweede leveranciersrelatie — wat hetzelfde argument is dat van toepassing is op de generatielaag, zodra de generatielaag iets is dat je kunt aanroepen.

Waar op te letten: of de referentie- en bewerkingsvarianten van de Wan 2.7-suite de stopzetting van Model Studio op 10 oktober ongewijzigd overleven, en of de veiligheidspoort van Griffin een gepubliceerde modelkaart oplevert met een endpoint erop. Het zijn die twee gebeurtenissen die deze vergelijking van een ontwerpessay in een inkoopbeslissing zouden veranderen.

A two-column scoreboard titled "Tavus Griffin vs Alibaba Wan 2.7 — the scoreboard". Left column "Tavus Griffin": Makes: a live conversation; Price: none published; Output: 720p in 320 ms chunks; Input: a person on camera; Clip length: none - a session; Score: VideoFDB 3.83 of 5. Right column "Alibaba Wan 2.7": Makes: 2 to 15 second clips; Price: $9.00 per minute; Output: up to 1080p; Input: text, image, video; Clip length: 2 to 15 seconds; Score: arena Elo 1,032. Footer: "Wan rates per Alibaba Cloud; Elo per Artificial Analysis, 2 October 2026. Griffin figures Tavus-reported."