Karta hero dla „Tavus Griffin vs Alibaba Wan 2.7”, z dwoma chipami o treści „Tavus Griffin — brak opublikowanej ceny” i „Alibaba Wan 2.7 — 9,00 USD za minutę w 1080p”, nad sześcioma wierszami: Tworzy: rozmowę na żywo; Kontra: klip od 2 do 15 sekund; Cena Griffin: nie opublikowano; Cena Wan 2.7: 9,00 USD za minutę; Status Griffin: podgląd badawczy; Status Wan 2.7: ogólnie dostępny. Stopka: „Stawki Wan 2.7 to ceny katalogowe Alibaba Cloud; Griffin to podgląd badawczy bez cennika.”
Guides & Insights

Tavus Griffin vs Alibaba Wan 2.7: Model konwersacyjny przeciwko generatywnemu

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Kuszący sposób porównania Tavus Griffin i Alibaba Wan 2.7 to porównywanie stawek za sekundę wideo, a takiego porównania nie da się przeprowadzić. Wan 2.7 ma opublikowany cennik — 9,00 USD za minutę przy 1080p w międzynarodowych punktach końcowych Alibaba Cloud w Singapurze, z tańszym poziomem cenowym dla Pekinu i Tokio — a Tavus Griffin nie ma żadnego cennika, ponieważ Griffin-Lite został udostępniony 1 października 2026 r. jako podgląd badawczy dla wybranych zaufanych testerów, dostępny po wypełnieniu formularza zgłoszeniowego. To, co je łączy, to jedno słowo: wideo. Poza tym są odpowiedziami na różne pytania. Jedno z nich otrzymuje pytanie, co powinno wydarzyć się dalej w rozmowie; drugie — jak wygląda opisana scena. Ciekawe porównanie nie dotyczy jakości, lecz tego, czego każde z nich potrzebuje od ciebie, zanim cokolwiek wygeneruje, i co otrzymujesz w zamian.

Różnica tkwi w pętli, a nie w rozdzielczości

Wan 2.7 generuje klip po klipie na podstawie promptu. Piszesz opis, otrzymujesz fragment materiału, oglądasz go, piszesz kolejny. Wan 2.7 to zestaw czterech modeli — text-to-video, image-to-video, reference-to-video i video-edit — a interakcja jest zasadniczo transakcyjna: dane wejściowe, wyrenderowany wynik i decyzja, czy go zachować. Nic się w nim nie uruchamia, kiedy wciąż zastanawiasz się, o co poprosić.

Griffin jest zbudowany odwrotnie. To system pełnodupleksowy: silnik ciągłego modelowania konwersacji, który przyjmuje dźwięk i obraz wideo i co ułamki sekundy na nowo ocenia rozmowę, decydując, czy milczeć, dać sygnał, przytaknąć czy przejąć turę, i emituje kontrolki ekspresji, które równolegle sterują strumieniowym generatorem mowy oraz strumieniowym generatorem wideo. Generuje obraz 720p w fragmentach po 320 ms na podstawie jednego zdjęcia referencyjnego, a najważniejsza obietnica jest taka, że decyzja podjęta w połowie zdania uwidacznia się w głosie i na twarzy w tej samej mini-turze. Testem tego nie jest ranking klipów. Testem jest to, czy można mu przerwać.

Mówiąc wprost: Wan 2.7 odpowiada na pytanie „jak wygląda ta scena w ruchu?”, a Griffin odpowiada na pytanie „co powinny zrobić ta twarz i ten głos w ciągu następnych dwustu milisekund, biorąc pod uwagę, że osoba właśnie zrobiła pauzę”.

Cena, po tej jednej stronie, gdzie taka występuje

Opublikowane stawki Wan 2.7 są naliczane za sekundę wygenerowanego wideo, a progi cenowe nie są jednolite w całym zestawie — to szczegół, który pomija większość stron porównawczych.

• wan2.7-t2v i wan2.7-i2v — rozliczane wyłącznie na podstawie czasu trwania danych wyjściowych. Międzynarodowy Singapur: 0,10 USD/s przy 720p i 0,15 USD/s przy 1080p, co odpowiada kwocie 9,00 USD/min widocznej w tabelach liderów. Pekin i Tokio podają 0,086 USD/s i 0,143 USD/s za tę samą pracę.

• wan2.7-r2v (reference-to-video) — rozliczany na podstawie czasu trwania wejściowego wideo, z limitem pięciu sekund, plus materiał wyjściowy. Wprowadź pięciosekundowy materiał referencyjny do piętnastosekundowej generacji, a zostaniesz rozliczony za dwadzieścia sekund.

• wan2.7-videoedit — opłata wyłącznie za wynik, materiał wejściowy bezpłatnie.

Do tych liczb dochodzą dwa fakty dotyczące cyklu życia. Alibaba wprowadziła ograniczoną czasowo 30% zniżkę startową na swoich własnych platformach Bailian i Qwen Cloud, obowiązującą do 23 września 2026 r., która już minęła. A powiadomienie Alibaba Cloud o wycofaniu Model Studio (ID 118434) wyłącza kilka starszych modeli 10 października 2026 r., w tym wan2.7-r2v i wan2.7-image. To wycofanie na poziomie wariantów, a nie całej generacji — wan2.7-t2v i wan2.7-i2v pozostają na liście z aktualnymi stawkami, a ich strony aktualizowano jeszcze 11 września — ale jeśli reference-to-video jest powodem, dla którego patrzysz na 2.7, ta ścieżka ma wyznaczoną datę.

Porównanie z Griffinem ma jedno uczciwe zdanie: nie ma ceny, którą można postawić obok ceny Wan 2.7, ponieważ Tavus nie opublikował żadnej. Griffin-Lite nie znajduje się na platformie Tavus, ogłoszenie mówi, że w tym momencie nie będzie dostępny do użytku przez klientów, a własne zdanie końcowe firmy brzmi, że Griffin pojawi się, gdy firma rozpracuje, jak bezpiecznie go udostępnić. Nie ma stawki za sekundę, stawki za żądanie, darmowego planu ani planu dla przedsiębiorstw. Każdy, kto podaje cenę za Griffina, wymyśla ją.

Wyniki jakości: dwie tablice, które nie spełniają wymagań

Oba modele zostały ocenione za pomocą całkowicie różnych narzędzi, dlatego nie istnieje między nimi porównanie Elo.

Wan 2.7 ma dwa wpisy na arenie wideo Artificial Analysis i nie znajdują się w tym samym miejscu — co jest pułapką przy podawaniu dla niego jednej liczby. Tamtejsze Elo wywodzi się z zaślepionych głosów preferencji ludzi w porównaniach parami — metodologii stworzonej dla krótkich generowanych klipów — a oba poniższe odczyty pochodzą z tabel odczytanych 2 października 2026 r.

• Wan2.7-260612 (czerwcowa kompilacja) w generowaniu wideo z tekstu (z dźwiękiem) — 13.–14. miejsce, Elo 1 032 (±10) na podstawie 4 645 głosów, 9,00 USD/min.

• Wan 2.7 (wersja kwietniowa) w konwersji obrazu na wideo (z dźwiękiem) — 12. miejsce na 34, Elo 1 077 przy 4 571 głosach, 9,00 USD/min, ranking, który ma mniej więcej taką samą liczbę głosów, ale plasuje go znacznie wyżej.

• Wan 3.0, nowszy brat — 1. miejsce z wynikiem Elo 1,157 w text-to-video i 6. miejsce z wynikiem 1,164 w image-to-video, oba po 12,00 USD/min. To liczba, którą warto znać, zanim porównasz Wan 2.7 z czymkolwiek: następna generacja samego Alibaby jest liderem tabeli, a 2.7 to model ze środka tabeli.

A screenshot of the top of Artificial Analysis's "AA-Video-T2V v2.0" leaderboard, text-to-video with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157 with 7,575 votes and $12.00/min; Utopai X (based on MiniMax H3) second at 1,150; Dreamina Seedance 2.5 third at 1,144; MiniMax H3 (768p) fourth at 1,139 and $4.80/min; MiniMax H3 Max fifth at 1,134; FLUX 3 sixth at 1,127; Gemini Omni Flash eighth at 1,117 and $9.12/min; Wan2.7-260612 thirteenth at 1,032 with 4,645 votes and $9.00/min; and the two Kling 3.0 1080p tiers sixteenth, at Elo 1,018 and Elo 1,000.

Griffin opiera się na VideoFDB firmy NVIDIA – benchmarku do pełnodupleksowych rozmów audiowizualnych, który NVIDIA zbudowała i niezależnie oceniła we wrześniu 2026 r., wykorzystując model językowy jako sędziego oceniającego według skali od zera do pięciu. Griffin-Lite uzyskał 3,83 w torze generowania wobec referencyjnego wyniku człowieka 3,92 i 2,80 dla następnego najwyżej ocenionego opublikowanego systemu oraz 3,73 w torze percepcji wobec referencyjnego wyniku człowieka 4,20. Tavus podaje również 0,43 sekundy rzeczywistego opóźnienia od dźwięku do wideo dla generatora w porównaniu z czterema opublikowanymi bazowymi modelami dyfuzyjnymi do strumieniowania na H100.

Oba zestawy liczb są prawomocne i żaden z nich nie przekłada się na drugi. Elo na arenie to liczba głosów dotycząca preferencji klipów; VideoFDB to ocena sędziowska według rubryki dotycząca zachowań konwersacyjnych. Nie ma między nimi pomostu, a pułapka małej próby działa też w drugą stronę: przedział ±10 areny dla Wan 2.7 jest wystarczająco szeroki, że jego pozycja względem sąsiadów nie jest ściśle ustalona, a różnica generacyjna NVIDII wynosząca 0,09 punktu do wyniku człowieka jest na pięciopunktowej rubryce wystarczająco mała, że uczciwym odczytem jest „blisko odniesienia ludzkiego”, a nie „na poziomie człowieka”. Porównanie percepcji również nie jest porównaniem na równych zasadach — kilka systemów, przed którymi umieszczono Griffina, w tym gpt-realtime OpenAI i MiniCPM-o 4.5, jest ocenianych w konfiguracjach tylko audio, podczas gdy Griffin odbiera również wideo. Część przewagi 0,29 punktu mierzy posiadanie oczu.

Czego każde potrzebuje od ciebie

Tu porównanie staje się przydatne, ponieważ danymi wejściowymi są produkty.

• Wejście — Wan 2.7 przyjmuje tekst, obraz, wideo i dźwięk. Griffin przyjmuje osobę na żywo przez kamerę i mikrofon i w ogóle nie generuje klipu na żądanie.

• Dane wyjściowe — Wan 2.7 tworzy plik wideo, od 2 do 15 sekund na jedno generowanie, do 1080p, z natywnym dźwiękiem. Griffin prowadzi nieprzerwaną rozmowę: wideo 720p przy 25 fps w fragmentach po 320 ms, generowane w czasie rzeczywistym i odtwarzane w miarę dekodowania.

• Co nim steruje — Wan 2.7 jest sterowany przez prompt oraz przez maksymalnie pięć obrazów podmiotu i pięć klipów referencyjnych, w ramach górnego limitu dziesięciu zasobów referencyjnych na żądanie. Griffin jest sterowany tym, co robi osoba: pauza, odwrócenie wzroku, gest, przerwanie.

• Horyzont czasowy — jednostką pracy Wan 2.7 jest klip trwający co najwyżej piętnaście sekund, który następnie montujesz. Jednostką pracy Griffina jest rozmowa, dlatego architektura musiała rozwiązać problem dryfu — trzystopniowa destylacja do generatora autoregresyjnego, trenowanego na własnej wygenerowanej historii, aby długie rollouty pozostawały stabilne — zamiast walczyć o dłuższą pojedynczą generację.

• Kontener wyjściowy — Wan 2.7 zwraca plik, który posiadasz i możesz edytować, korygować kolorystycznie i rozpowszechniać. Griffin zwraca wyrenderowaną sesję. Nie ma pliku do edycji, ponieważ piksele są generowane porcjami na podstawie zdjęcia referencyjnego i własnej historii modelu, a tło, cienie i krzesło, na którym siedzi osoba, są częścią procesu generowania.

Jedna różnica strukturalna warta nazwania: koszty Wan 2.7 skalują się z czasem trwania wyniku, a jego jakość skaluje się z tym, jak konkretny jest twój prompt. Koszty Griffina są niezmierzone, a jego jakość skaluje się z tym, jak naturalna jest osoba po drugiej stronie. Jedno z nich można poprawić, pisząc lepsze briefy, a drugie tylko używając go z prawdziwymi ludźmi.

A screenshot of the top of Artificial Analysis's "AA-Video-I2V v1.0" leaderboard, image-to-video with audio, captured 2 October 2026: MiniMax H3 Max first at Elo 1,195; MiniMax H3 second at 1,181; Gemini Omni Flash third at 1,178; Dreamina Seedance 2.0 720p fourth at 1,176; HiDream-O1-Video-1.0 fifth at 1,175; Wan 3.0 sixth at 1,164 with 9,302 votes and $12.00/min; Veo 3.1 eleventh at 1,082; and Wan 2.7 twelfth at Elo 1,077 with 4,571 votes and $9.00/min. A note above the table says "AA-Video-I2V v2.0 is coming soon".

Odniesienie i spójność, tam gdzie zderzają się dwa projekty

Wan 2.7 kontroluje spójność tematu za pomocą dostarczonych materiałów referencyjnych: pięć zdjęć tematu, pięć klipów referencyjnych, łącznie dziesięć materiałów. To podejście fotograficzne — pokazujesz mu, jak wygląda temat, a on utrzymuje ten wygląd przez cały proces generowania.

Griffin kontroluje to samo w odwrotny sposób. Generuje każdy piksel w każdej klatce z jednego obrazu referencyjnego w czasie rzeczywistym, a w zapowiedzi wprost stwierdzono, że kontroluje całą scenę, a nie twarz: ramiona i palce, ruch krzesła, rzucane cienie i tło za nią. Spójność jest tam osiągana dzięki temu, że środowisko staje się celem generowania, a nie komponowaną planszą.

Żadne z tych podejść nie jest bezwzględnie lepsze i zawodzą w różny sposób. Generowanie warunkowane referencją zawodzi, odchodząc od dostarczonego obiektu w trakcie długiego klipu. Generowanie fragment po fragmencie z historią autoregresyjną zawodzi poprzez błądzenie podczas długiej sesji, jeśli obsługa dryfu jest niewłaściwa — a to dokładnie ten błąd, któremu ma zapobiegać trzeci etap destylacji. Wan 2.7 to bezpieczniejszy wybór, gdy rezultatem ma być konkretna osoba w konkretnym wyglądzie. Griffin nie konkuruje o to zlecenie.

Bezpieczeństwo, pochodzenie i postawa wydania

Wan 2.7 nie ma opublikowanego systemu pochodzenia porównywalnego ze znakiem wodnym, który przetrwałby kompresję — w ogłoszeniu jako obszary wciąż wymagające pracy wskazano jakość dźwięku i dokładność tekstu na ekranie, co stanowi zastrzeżenie dotyczące wierności, a nie bezpieczeństwa.

Historia bezpieczeństwa Griffina jest odwrócona: podanym przez Tavus powodem trzymania go w wersji zapoznawczej jest to, że te same właściwości, które czynią go lepszym interfejsem, sprawiają, że lepiej przekonuje kogoś, iż rozmawia z człowiekiem, a liczby potwierdzają tę obawę. W przeprowadzonym przez samą firmę badaniu na żywo 26 z 54 uczestników uznało, że ich rozmówca był prawdziwą osobą, wobec 1 z 41 w poprzednim stacku Phoenix-4.5 / Raven-1 / Sparrow-2. U uczestników, którzy nabrali podejrzeń, pojawiały się one zwykle w ciągu pierwszych dwudziestu sekund. Tavus twierdzi, że przed wydaniem konieczna jest dalsza praca nad alignmentem i ujawnianiem, że buduje funkcje ujawniania oraz że współpracuje z organizacjami przy ocenach bezpieczeństwa. To najbardziej konkretna informacja, jaką ktokolwiek opublikował o tym modelu, i zarazem powód, dla którego nie ma produktu do kupienia.

Dla każdego, kto porównuje oba jako narzędzia, praktyczna konsekwencja jest prosta: jedno można wygenerować na żądanie i dostarczyć już dziś, a drugie jest celem ewaluacji, którego wydanie jest uzależnione od problemu, którego dostawca jeszcze nie rozwiązał.

Który, po co

• Wybierz Wan 2.7, jeśli efektem ma być materiał filmowy. Edycja istniejącego materiału na podstawie instrukcji to zadanie, w którym jest on wyjątkowo mocny i wyjątkowo tani, ponieważ wariant do edycji rozlicza wyłącznie wynik, a materiał wejściowy traktuje jako darmowy. Warto sprawdzić jego wariant reference-to-video pod kątem wycofania 10 października, zanim się na niego zdecydujesz.

• W tym kwartale nie wybieraj Griffin do niczego, ponieważ nie możesz. Poproś o dostęp, jeśli musisz wiedzieć, czy dana osoba potrafi to stwierdzić, albo jeśli Twój plan działania zależy od warstwy interakcji, a nie od warstwy materiału filmowego.

• Obserwuj różnicę, nie którykolwiek z modeli. Pojawienie się Griffina sprawia, że ciekawsze porównanie dopiero przed nami: system, który generuje całą rozmowę, kontra pakiet, który generuje całą scenę. Pierwszy produkt, który robi jedno i drugie, będzie tym, na którego tle warto będzie ponownie przeczytać ten tekst.

Gdzie router pasuje, a gdzie nie

Żaden z tych modeli nie znajduje się w katalogu OrcaRouter i warto to zaznaczyć, zanim przejdziemy do czegokolwiek innego w tej sekcji. Wan 2.7 jest dostępny za pośrednictwem własnych platform Alibaby — Model Studio w Alibaba Cloud i Qwen Cloud — oraz kreatywnych narzędzi innych firm, które zintegrowały go po premierze; Tavus Griffin jest dostępny wyłącznie przez formularz zgłoszeniowy. Jeśli którykolwiek z nich stanie się możliwy do routowania, pojawi się w cenie katalogowej dostawcy.

Tą częścią pipeline'u wideo, która stanowi problem routingu, jest otaczający go tekst. Listy ujęć, rozszerzanie promptów, generowanie podpisów, podsumowania przeglądu jakości oraz praca nad transkrypcją lub dialogiem, która zasila przebieg reference-to-video, to wszystko wywołania tekstowe, a te działają w tym samym punkcie końcowym zgodnym z OpenAI w OrcaRouter co ponad 200 innych modeli w cenie katalogowej dostawcy z doliczoną marżą 0%, więc obniżka ceny dostawcy wchodzi w życie tego samego dnia, a nie po cyklu umownym. Rozdzielenie taniego modelu na przebieg masowy, a modelu czołowego na przebieg końcowy, to tam zmiana konfiguracji, a nie druga relacja z dostawcą — a to ten sam argument, który stosuje się do warstwy generowania, gdy warstwa generowania jest już czymś, co można wywołać.

Na co zwrócić uwagę: czy warianty referencyjne i edycyjne pakietu Wan 2.7 przetrwają bez zmian planowane na 10 października wycofanie Model Studio oraz czy bramka bezpieczeństwa Griffina zaowocuje opublikowaniem karty modelu zawierającej endpoint. Te dwa zdarzenia sprawiłyby, że to porównanie zmieniłoby się z eseju projektowego w decyzję zakupową.

A two-column scoreboard titled "Tavus Griffin vs Alibaba Wan 2.7 — the scoreboard". Left column "Tavus Griffin": Makes: a live conversation; Price: none published; Output: 720p in 320 ms chunks; Input: a person on camera; Clip length: none - a session; Score: VideoFDB 3.83 of 5. Right column "Alibaba Wan 2.7": Makes: 2 to 15 second clips; Price: $9.00 per minute; Output: up to 1080p; Input: text, image, video; Clip length: 2 to 15 seconds; Score: arena Elo 1,032. Footer: "Wan rates per Alibaba Cloud; Elo per Artificial Analysis, 2 October 2026. Griffin figures Tavus-reported."