
Tavus Griffin vs Alibaba Wan 2.7: En samtalsmodell mot en generativ modell
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 223 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Det frestande sättet att jämföra Tavus Griffin och Alibaba Wan 2.7 är per sekund video, och den jämförelsen går inte att göra. Wan 2.7 har en publicerad prislista — 9,00 USD per minut vid 1080p på Alibaba Clouds internationella Singapore-slutpunkter, med en billigare nivå för Peking och Tokyo — och Tavus Griffin har ingen prislista alls, eftersom Griffin-Lite släpptes den 1 oktober 2026 som en forskningsförhandsvisning för utvalda betrodda testare bakom ett ansökningsformulär. Det de två har gemensamt är ett ord: video. Bortom det är de svar på olika frågor. Den ena får frågan vad som bör hända härnäst i en konversation; den andra får frågan hur en beskriven scen ser ut. Den intressanta jämförelsen är inte kvalitet, utan vad var och en behöver av dig innan den producerar något, och vad du får tillbaka.
Skillnaden är loopen, inte upplösningen
Wan 2.7 genererar ett klipp i taget utifrån en prompt. Du skriver en beskrivning, får ett stycke filmmaterial, tittar på det och skriver en till. Wan 2.7 är en svit med fyra modeller – text-till-video, bild-till-video, referens-till-video och videoredigering – och interaktionen är i grunden transaktionell: en indata, en renderad utdata och ett beslut om huruvida den ska behållas. Ingenting av det körs medan du fortfarande bestämmer vad du ska be om.
Griffin är byggt på motsatt sätt. Det är ett full-duplex-system: en motor för Continuous Conversational Modeling som tar in ljud och video och omvärderar samtalet med subsekundintervall, avgör om den ska vara tyst, signalera, ge ett backchannel-svar eller ta turen, och avger expressiva styrningar som driver en strömmande talgenerator och en strömmande videogenerator parallellt. Den genererar 720p i chunkar om 320 ms från ett enda referensfotografi, och det viktiga påståendet är att ett beslut som fattas mitt i en mening märks i rösten och i ansiktet inom samma mini-turn. Måttstocken för detta är inte en topplista över klipp. Det är huruvida du kan avbryta den.
Enkelt uttryckt: Wan 2.7 svarar på frågan "hur ser den här scenen ut i rörelse?" Griffin svarar "vad bör det här ansiktet och den här rösten göra under de kommande tvåhundra millisekunderna, med tanke på att personen just pausade."
Pris, på den ena sidan där det finns ett
Wan 2.7:s publicerade priser gäller per sekund genererad video, och nivåerna är inte enhetliga i hela sviten, vilket är detaljen som de flesta jämförelsesidor hoppar över.
• wan2.7-t2v och wan2.7-i2v — faktureras endast för utdatans varaktighet. Internationellt Singapore: $0,10/s vid 720p och $0,15/s vid 1080p, vilket är siffran $9,00/min som visas på topplistorna. Peking och Tokyo listar $0,086/s och $0,143/s för samma arbete.
• wan2.7-r2v (referens-till-video) — debiteras utifrån indatavideons längd, med ett tak på fem sekunder, plus utdata. Matar du in en referens på fem sekunder i en generering på femton sekunder debiteras du för tjugo sekunder.
• wan2.7-videoedit — faktureras endast för utdata, med ingångsmaterialet kostnadsfritt.
Två livscykelfakta hör hemma intill de där siffrorna. Alibaba införde en tidsbegränsad lanseringsrabatt på 30 % på sina egna plattformar Bailian och Qwen Cloud, gällande till och med den 23 september 2026, vilket nu har passerat. Och Alibaba Clouds avvecklingsmeddelande för Model Studio (ID 118434) tar flera äldre modeller offline den 10 oktober 2026, inklusive wan2.7-r2v och wan2.7-image. Det är på variantnivå snarare än en avveckling av generationen – wan2.7-t2v och wan2.7-i2v finns fortfarande listade med aktuella priser och sidor uppdaterade så sent som den 11 september – men om referens-till-video är anledningen till att du tittade på 2.7, har den vägen ett datum på sig.
Jämförelsen mot Griffin har en ärlig rad: det finns inget pris att sätta bredvid Wan 2.7:s, eftersom Tavus inte har publicerat något. Griffin-Lite finns inte på Tavus-plattformen, tillkännagivandet säger att det inte kommer att vara tillgängligt för kundanvändning i nuläget, och företagets egen avslutande rad är att Griffin kommer när man har listat ut hur det kan släppas säkert. Det finns ingen taxa per sekund, ingen taxa per begäran, ingen gratisnivå, ingen företagsnivå. Den som anger ett pris för Griffin hittar på det.
Kvalitetspoäng: två styrelser som inte uppfyller
De två modellerna har poängsatts utifrån helt olika instrument, vilket är anledningen till att det inte finns någon Elo-jämförelse mellan dem.
Wan 2.7 har två poster på Artificial Analysis videarena, och de ligger inte på samma plats — vilket är fällan med att citera ett enda nummer för den. Elo där är härlett från blinda parvisa mänskliga preferensröster, en metodik byggd för korta genererade klipp, och båda avläsningarna nedan kommer från resultattavlor avlästa den 2 oktober 2026.
• Wan2.7-260612 (juniversionen) inom text-till-video (med ljud) — 13:e–14:e, Elo 1 032 (±10) efter 4 645 röster, 9,00 USD/min.
• Wan 2.7 (aprilversion) i bild-till-video (med ljud) — 12:e av 34, Elo 1 077 över 4 571 röster, $9.00/min, en resultattavla som har ungefär samma röstantal men placerar den väsentligt högre.
• Wan 3.0, det nyare syskonet – 1:a med Elo 1 157 för text-till-video och 6:a med 1 164 för bild-till-video, båda för $12.00/min. Det är siffran som är värd att känna till innan du jämför Wan 2.7 med något: Alibabas egen nästa generation toppar tabellen och 2.7 är ett mittenbygge.

Griffin ligger på NVIDIA:s VideoFDB, ett riktmärke för full-duplex audiovisuell konversation som NVIDIA byggde och poängsatte oberoende i september 2026, med en språkmodellsdomare mot en noll-till-fem-rubrik. Griffin-Lite fick 3,83 på genereringsspåret mot en mänsklig referens på 3,92 och 2,80 för det näst högst rankade publicerade systemet, samt 3,73 på perceptionsspåret mot en mänsklig referens på 4,20. Tavus rapporterar också 0,43 sekunders verklig ljud-till-video-latens för generatorn mot fyra publicerade baslinjer för strömmande diffusion på H100s.
Båda uppsättningarna av siffror är legitima, och ingen av dem kan överföras. Elo på arenan är en rösträkning om klipppreferens; VideoFDB är en domares poäng enligt bedömningsmatris för samtalsbeteende. Det finns ingen bro mellan dem, och fällan med litet urval går också åt andra hållet: arenans ±10-band för Wan 2.7 är tillräckligt brett för att dess placering gentemot grannarna inte är snävt fastställd, och NVIDIA:s generationsgap på 0,09 poäng till människa är tillräckligt litet på en femgradig bedömningsmatris för att "nära den mänskliga referensen" är den ärliga tolkningen, inte "på mänsklig nivå". Perceptionsjämförelsen är inte heller gjord på lika villkor – flera av de system som Griffin placeras före, inklusive OpenAI:s gpt-realtime och MiniCPM-o 4.5, poängsätts i konfigurationer med enbart ljud, medan Griffin även uppfattar video. En del av ledningen på 0,29 poäng mäter att ha ögon.
Vad var och en behöver från dig
Det är här jämförelsen blir användbar, eftersom indata är produkterna.
• Indata – Wan 2.7 tar text, en bild, en video och ljud. Griffin tar en levande person i kamera och mikrofon och genererar överhuvudtaget inte ett klipp på begäran.
• Utdata — Wan 2.7 producerar en videofil, 2 till 15 sekunder per generering, upp till 1080p, med inbyggt ljud. Griffin producerar en pågående konversation: 720p-video vid 25 fps i segment på 320 ms, genererad i realtid och uppspelad i takt med att den avkodas.
• Vad som styr det — Wan 2.7 styrs av prompten och av upp till fem motivbilder och fem referensklipp, inom en gräns på tio referensresurser per begäran. Griffin styrs av vad personen gör: en paus, en blick bort, en gest, en avbrytning.
• Tidshorisont – Wan 2.7:s arbetsenhet är ett klipp på högst femton sekunder, som du sedan sätter samman. Griffins arbetsenhet är en konversation, vilket är anledningen till att arkitekturen måste lösa drift – den trestegsdestillationen till en autoregressiv generator, tränad på sin egen genererade historik så att långa rollouts förblir stabila – i stället för att kämpa för en längre enskild generering.
• Utdata-container — Wan 2.7 lämnar tillbaka en fil som du äger och kan redigera, färgkorrigera och distribuera. Griffin lämnar tillbaka en renderad session. Det finns ingen fil att redigera, eftersom pixlarna genereras chunk för chunk utifrån ett referensfoto och modellens egen historik, och bakgrunden, skuggorna och stolen som personen sitter i är en del av genereringen.
En strukturell skillnad värd att nämna: Wan 2.7:s kostnader skalas med utdatans varaktighet och dess kvalitet skalas med hur specifik din prompt är. Griffins kostnader är inte uppmätta och dess kvalitet skalas med hur naturlig personen i andra änden är. Du kan förbättra den ena genom att skriva bättre briefar och den andra endast genom att använda den med riktiga människor.

Referens och konsekvens, där de två designerna kolliderar
Wan 2.7 styr motivkonsistens genom medföljande referenser: fem motivbilder, fem referensklipp, tio resurser totalt. Det är ett fotografiskt tillvägagångssätt – du visar vad motivet ser ut som och den behåller det utseendet genom genereringen.
Griffin styr samma sak på motsatt sätt. Det genererar varje pixel i varje bildruta från en enda referensbild i realtid, och i tillkännagivandet sägs det uttryckligen att den styr hela scenen snarare än ansiktet: armarna och fingrarna, stolens rörelse, skuggorna som kastas och bakgrunden bakom. Där uppnås konsekvens genom att göra miljön till ett genereringsmål i stället för en kompositerad platta.
Ingen av metoderna är strikt bättre och de misslyckas på olika sätt. Referensvillkorad generering misslyckas genom att driva bort från det angivna subjektet under ett långt klipp. Generering per chunk med en autoregressiv historik misslyckas genom att vandra iväg under en lång session om drifthanteringen är fel, vilket är exakt det fel som det tredje destillationssteget finns för att förhindra. Wan 2.7 är det säkrare valet när leveransen är en specifik person i en specifik look. Griffin konkurrerar inte om den briefen.
Säkerhet, proveniens och utgivningshållningen
Wan 2.7 har inget publicerat provenienssystem som kan jämföras med en vattenstämpel som överlever komprimering — i tillkännagivandet nämns ljudkvalitet och noggrannhet i text på skärmen som områden som fortfarande behöver arbete, vilket är ett förbehåll om återgivningstrohet snarare än om säkerhet.
Griffins säkerhetsberättelse är inverterad: Tavus angivna skäl för att hålla den i förhandsvisning är att samma egenskaper som gör den till ett bättre gränssnitt gör den bättre på att övertyga någon om att de talar med en människa, och siffrorna stöder farhågan. I företagets egen live-studie trodde 26 av 54 deltagare att deras samtalspartner var en riktig person, mot 1 av 41 i den tidigare Phoenix-4.5 / Raven-1 / Sparrow-2-stacken. Deltagare som ändå misstänkte tenderade att misstänka inom de första tjugo sekunderna. Tavus säger att ytterligare alignment- och disclosure-arbete krävs före lansering, att man bygger disclosure-funktioner och att man arbetar med organisationer kring säkerhetsutvärderingar. Det är det mest substantiella någon har publicerat om den här modellen, och det är också därför det inte finns någon produkt att köpa.
För den som jämför de två som verktyg är den praktiska konsekvensen enkel: det ena kan genereras på begäran och levereras i dag, och det andra är ett utvärderingsobjekt vars släpp är villkorat av ett problem som leverantören ännu inte har löst.
Vilken, för vad?
• Välj Wan 2.7 om det som ska levereras är filmmaterial. Instruktionsbaserad redigering av befintligt material är den arbetsbelastning där den är ovanligt stark och ovanligt billig, eftersom redigeringsvarianten endast debiterar för utdata och behandlar det ingående filmmaterialet som gratis. Dess variant för referens-till-video är värd att kontrollera mot utfasningen den 10 oktober innan du bestämmer dig för den.
• Välj inte Griffin till något det här kvartalet, för det kan du inte. Begär åtkomst om du behöver veta huruvida en person kan avgöra det, eller om din färdplan är beroende av interaktionslagret snarare än filmmateriallagret.
• Håll ögonen på gapet, inte på endera modellen. Griffins ankomst gör den mer intressanta jämförelsen till en framtida sådan: ett system som genererar hela samtalet mot en svit som genererar hela scenen. Den första produkt som gör båda blir den som det är värt att läsa om detta mot.
Var en router passar in, och var den inte gör det
Ingen av dessa modeller finns i OrcaRouter-katalogen, och det är värt att säga innan något annat i det här avsnittet. Wan 2.7 är tillgänglig via Alibabas egna plattformar — Model Studio på Alibaba Cloud och Qwen Cloud — och via kreativa tredjepartsverktyg som integrerade den efter lanseringen; Tavus Griffin är endast tillgänglig via ett förfrågningsformulär. Om någon av dem blir routbar kommer den att visas till leverantörens listpris.
Den del av en videopipeline som är ett routningsproblem är texten runt den. Shot-listor, promptexpansion, textningsgenerering, sammanfattningar från kvalitetsgranskning och transkriberings- eller dialogarbetet som matar en reference-to-video-körning är alla textanrop, och de körs på samma OpenAI-kompatibla endpoint hos OrcaRouter som 200+ andra modeller till leverantörens listpris med 0 % påslag tillagt, så en leverantörsprissänkning är live samma dag i stället för efter en avtalscykel. Att dela upp en billig modell över en masskörning och en frontiermodell över den slutliga körningen är en konfigurationsändring där i stället för en andra leverantörsrelation – vilket är samma argument som gäller genereringslagret, när genereringslagret är något man kan anropa.
Vad man bör hålla ögonen på: huruvida Wan 2.7-svitens referens- och redigeringsvarianter överlever Model Studios avveckling den 10 oktober oförändrade, och huruvida Griffins säkerhetsgrind producerar ett publicerat modellkort med en slutpunkt på. Det är dessa två händelser som skulle förvandla denna jämförelse från en designessä till ett inköpsbeslut.

