
Tavus Griffin kontra Google Veo 3.1: Jeden opatruje znakiem wodnym każdą klatkę, a drugi oszukał 48% sali
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Postaw Tavus Griffin i Google Veo 3.1 obok siebie, a konwencjonalne porównanie — cena za sekundę, Elo, długość klipu — natychmiast się rozsypuje, bo tylko jeden z nich ma podaną cenę, a tylko jeden jest oceniany na podstawie czegokolwiek, co kupujący może sprawdzić. Ale pod spodem kryje się prawdziwa oś i nie jest nią jakość. Odpowiedzią Google na media syntetyczne jest uczynienie ich wykrywalnymi: każdy materiał wyjściowy Veo 3.1 nosi SynthID, niewidzialny znak wodny wpisywany w piksele klatka po klatce oraz w widmo dźwięku, a do tego C2PA Content Credentials rejestrujące pochodzenie pliku, a Google dostarczyło detektor do aplikacji Gemini, dzięki czemu użytkownik może zapytać, czy klip powstał w Google AI. Podany przez Tavus powód, dla którego Griffin istnieje jako wersja preview, a nie jako produkt, jest lustrzanym odbiciem tego obrazu: w przeprowadzonym przez sam Tavus badaniu na żywo 26 z 54 uczestników zakończyło jednominutową rozmowę wideo w przekonaniu, że ich rozmówca był prawdziwą osobą, wobec 1 z 41 osób w przypadku poprzedniego stacku firmy, a Tavus twierdzi, że wstrzymuje model, dopóki nie wypracuje sposobu ujawniania, czym jest. Jeden z tych dostawców sprzedaje wykrywanie. Drugi jest obecnie powodem, dla którego wykrywanie ma znaczenie — i doskonale o tym wie.
Dwa produkty zbudowane na przeciwnych założeniach
Veo 3.1 to generator klipów o celowo wąskich ramach. W API Gemini od Google tworzy 4, 6 lub 8 sekund na jedno przejście przy 24 fps, natywnie w 720p, a 1080p i 4K pojawiają się w wyniku przebiegu skalowania w górę dodanego w aktualizacji ze stycznia 2026. Funkcja wydłużania dodaje siedem sekund na przebieg i można ją powtarzać do dwudziestu razy, co daje teoretyczny limit około 148 sekund, ale materiał wejściowy musi być klipem wygenerowanym przez Veo o długości nie większej niż 141 sekund, w 720p i formacie 16:9 lub 9:16, a długość ośmiu sekund jest obowiązkowa przy wydłużaniu, przy wprowadzaniu obrazu referencyjnego oraz w przypadku wszystkiego powyżej 720p. Nie da się stworzyć czterosekundowego klipu w 1080p. Wynikiem jest należący do ciebie plik, opatrzony znakiem wodnym, z dołączonym podpisanym zapisem pochodzenia.
Griffin nie tworzy pliku. Prowadzi rozmowę. Silnik Continuous Conversational Modeling przyjmuje dźwięk i obraz wideo oraz ponownie ocenia wymianę zdań w odstępach krótszych niż sekunda, wybierając, czy milczeć, sygnalizować, podtrzymywać kontakt czy przejmować turę, i emituje ekspresyjne sygnały sterujące, które wspólnie napędzają strumieniowy generator mowy i strumieniowy generator wideo. Generator wideo generuje obraz 720p w fragmentach po 320 ms, po jednym wektorze ukrytym naraz, z szybkością 25 fps na podstawie jednego zdjęcia referencyjnego, i odtwarza każdy fragment w miarę jego dekodowania. Nie ma długości klipu, ponieważ nie ma klipu; istnieje sesja, która trwa, dopóki ktoś nie przestanie mówić.
Ta różnica przesądza o niemal każdym innym elemencie tego porównania. Zakres możliwości Veo 3.1 to zestaw ograniczeń, wokół których potok produkcyjny może planować — listy ujęć po osiem sekund, drabinka przedłużeń dla dłuższych ujęć, stałe 24 fps, znana drabinka rozdzielczości. Wyników Griffina nie da się w ogóle wcześniej rozrysować w storyboardzie, ponieważ to, co wyrenderuje, zależy od tego, co dana osoba zrobi jako następne.
Ile kosztuje Veo 3.1, na każdym poziomie
Opublikowane przez Google stawki API Gemini obejmują dźwięk i są naliczane za sekundę danych wyjściowych, a na żadnym poziomie Veo 3.1 nie ma darmowego planu. W tym API nie można wyłączyć dźwięku — jest generowany przy każdym żądaniu — co ma znaczenie, ponieważ źródła zewnętrzne opisują cennik Vertex AI, w którym wideo bez dźwięku kosztuje około połowy kwoty obejmującej dźwięk. Dokumentacja samego Google nie udostępnia tego przełącznika. Jeśli cicha stawka ma znaczenie dla Twojego rachunku, potwierdź ją na podstawie własnego rozliczenia Vertex, a nie strony porównawczej, w tym tej.
• Veo 3.1 Standard — 0,40 USD/s przy 720p i 1080p, 0,60 USD/s przy 4K.
• Veo 3.1 Fast — 0,10 USD/s przy 720p, 0,12 USD/s przy 1080p, 0,30 USD/s przy 4K.
• Veo 3.1 Lite — 0,05 USD/s w 720p, 0,08 USD/s w 1080p, bez wariantu 4K.
Skonfrontuj zasadę ośmiu sekund z tymi stawkami, a koszt na próbę jest tym, co zespół kreatywny faktycznie uwzględnia w budżecie: 32 centy za ośmiosekundowe ujęcie 1080p w Standard, 80 centów za czterosekundowe przy tej samej rozdzielczości, ponieważ próg ośmiu sekund nie obowiązuje poniżej 720p, oraz 4,80 dolara za pojedyncze ośmiosekundowe ujęcie 4K. To właśnie przy tej ostatniej liczbie warto się zatrzymać, bo poszukiwanie jednego użytecznego ujęcia 4K w czterech próbach to nieco poniżej dwudziestu dolarów, a wymóg ośmiu sekund oznacza, że nie można przetestować pomysłu w połowie długości za połowę ceny.
Griffin nie ma ceny, nie ma darmowego planu ani jakiegokolwiek cennika. Griffin-Lite jest dostępny dla wybranych zaufanych testerów jako podgląd badawczy na podstawie formularza zgłoszeniowego, nie znajduje się na platformie Tavus, a ogłoszenie wyraźnie stwierdza, że w tym momencie nie będzie dostępny do użytku przez klientów. Ostatnie zdanie Tavus na stronie głosi, że Griffin pojawi się, gdy firma opracuje sposób bezpiecznego udostępnienia go. Każde twierdzenie w tym artykule, które porównuje oba rozwiązania pod kątem czegokolwiek przypominającego decyzję zakupową, ma lukę w części dotyczącej Griffina, której nie wypełni żadna ilość badań.
Co faktycznie mierzą dwie tablice wyników
Oba modele zostały ocenione za pomocą różnych instrumentów z tego samego powodu, dla którego trudno je wycenić względem siebie.
Veo 3.1 znajduje się w arenie wideo Artificial Analysis, gdzie Elo wynika z preferencji ludzi wyrażanych w ślepych porównaniach parami krótkich klipów. Odczyt z 2 października 2026 w rankingu tekst-na-wideo z dźwiękiem:
• Veo 3.1 — 18.–21., Elo 968 (±11) przy 2 857 głosach, 24,00 USD/min.
• Veo 3.1 Fast — 18.–21. miejsce, Elo 961 (±10) na podstawie 3 595 głosów, 7,20 USD/min.
• Veo 3.1 Lite — 21.–24. miejsce, Elo 949 (±11) przy 2762 głosach, 4,80 USD/min. • Veo 3.1 w trybie obrazu na wideo (z dźwiękiem) — 11. miejsce wśród 34, Elo 1082 przy 7049 głosach, 24,00 USD/min. To jego najlepsza pozycja w jakimkolwiek rankingu i ta, za którą stoi najwięcej głosów.
Wynikają z tego dwie rzeczy. Wszystkie trzy poziomy dzieli od siebie nie więcej niż dziewiętnaście punktów Elo, przy nakładających się przedziałach ufności, więc czterokrotnie wyższa cena za sekundę w poziomie standardowym nie przekłada się na mierzalną preferencję w testach ślepych. A nowsza linia Gemini Omni Flash samego Google plasuje się wyżej niż każdy poziom Veo 3.1 w tej samej klasyfikacji — 7.–8. miejsce z Elo 1 117 przy 7 801 głosach i 9,12 USD/min, przed wszystkimi trzema poziomami, kosztując przy tym za minutę od jednej czwartej do jednej piątej tego, co one — co jest pytaniem, które powinien zadać każdy nabywca Veo 3.1, a ten artykuł nie jest miejscem, by na nie odpowiadać.
Wyniki Griffina pochodzą z VideoFDB firmy NVIDIA, benchmarku do pełnodupleksowej konwersacji audio-wizualnej, który NVIDIA zbudowała i niezależnie oceniła we wrześniu 2026 r. Griffin-Lite uzyskał 3,83 na 5 w ścieżce generowania w porównaniu z ludzkim odniesieniem 3,92 i 2,80 dla drugiego najwyżej ocenionego opublikowanego systemu, a także 3,73 w ścieżce percepcji w porównaniu z ludzkim odniesieniem 4,20. Tavus podaje również 0,43 sekundy rzeczywistego opóźnienia z audio do wideo dla generatora w porównaniu z czterema opublikowanymi bazowymi modelami dyfuzyjnymi do streamingu na H100s, opisując tę wartość jako połowę opóźnienia drugiego najszybszego rozwiązania.
Żaden z tych zestawów nie przekłada się na drugi. Elo z głosowania preferencyjnego na krótkich klipach nic nie mówi o tym, czy model da się przerwać; ocena sędziego według rubryki za rozmowę nic nie mówi o tym, czy klip wygląda dobrze w 4K. A zastrzeżenia działają w obie strony: różnica 0,09 punktu między Griffinem a ludzkim punktem odniesienia jest na tyle mała w pięciopunktowej rubryce ocenianej przez model językowy, że „blisko człowieka” to uczciwe odczytanie, a część jego przewagi w percepcji jest mierzona wobec systemów działających całkowicie bez wejścia wideo.

Proweniencja, która jest prawdziwą różnicą produktu
Dla firmy z jakimkolwiek obowiązkiem ujawnienia informacji to jedyna sekcja, która się liczy, i nie ma tu nawet porównania.
Wynik generowany przez Veo 3.1 przenosi SynthID klatka po klatce w pikselach i w widmie audio, zaprojektowany tak, by przetrwał kompresję, zmianę rozmiaru, przycinanie i nagrywanie ekranu, a C2PA Content Credentials rejestruje pochodzenie pliku i historię edycji, zapewniając interoperacyjność z implementacjami Adobe i Microsoft. Google udostępniło funkcję wykrywania w aplikacji Gemini, dzięki czemu użytkownik może przesłać film i zapytać, czy został wytworzony przez Google AI, a wykrywanie wskazuje, która część ścieżki audio lub wideo zawierała znak. To ograniczenie jest realne i warte podkreślenia: ten detektor rozpoznaje wyłącznie modele Google. Nic z oferty Alibaba i Kuaishou nie jest porównywalne, podobnie jak nic od Tavus.

Tavus nie opublikował znaku wodnego, detektora ani potoku poświadczeń treści dla Griffina. To, co opublikował, jest powodem, dla którego go potrzebuje. Badanie rozmów twarzą w twarz jest niezwykle dosadne w opisie trybu awarii: ponad połowa uczestników stwierdziła, że podczas rozmowy nie przyszło im do głowy, że może to być AI, niemal wszyscy z tej grupy uznali, że ich rozmówca był prawdziwy, a osoby, które jednak coś podejrzewały, zwykle orientowały się w ciągu pierwszych dwudziestu sekund. Ci, którzy wierzyli, mieli średnio 79% pewności, a wątpiący 81%. To model, którego zwodniczość nie jest skutkiem ubocznym jakości generowania — ona jest jakością generowania.
Odpowiedź Tavusa znajduje się w ogłoszeniu, a nie w przypisie: te same właściwości, które czynią Human Interaction Models potężnymi interfejsami do naturalnej komunikacji, pozwalają im oszukać człowieka, by uwierzył, że nie ma do czynienia z AI; wymagane są dalsze procedury alignmentu i bezpieczeństwa, aby bezpiecznie je udostępnić, a firma pracuje nad funkcjami bezpiecznego ujawniania oraz współpracuje z organizacjami zajmującymi się bezpieczeństwem AI. Dlatego istnieje ta brama. Griffin-Lite nie będzie obecnie dostępny do użytku klientów.
Warunki dla przedsiębiorstw, które Google oferuje, a Tavus nie
Veo 3.1 jest udostępniane przez Vertex AI wraz z regionalną infrastrukturą, IAM i warstwą kontraktów korporacyjnych, które to implikuje, a Google ogranicza to, co model może robić, w zależności od jurysdykcji: za pomocą parametru generowania osób UE, Wielka Brytania, Szwajcaria i MENA dopuszczają wyłącznie osoby dorosłe, podczas gdy inne regiony mogą zezwalać na wszystkich. To udokumentowany, uwzględniający region zakres polityk, który dla regulowanego nabywcy może przeważyć nad pozycją w rankingu.
Ta forma ma swoją cenę. Identyfikatory modeli Veo 3.1 w Gemini API to wciąż identyfikatory wersji zapoznawczej — veo-3.1-generate-preview i podobne — podczas gdy SKU Vertex nosi nazewnictwo ogólnej dostępności, a raporty zewnętrzne szacują limit wersji zapoznawczej na około jedną piątą limitu produkcyjnego. Google wycofał starsze SKU Veo 3.0 w dniu 30 czerwca 2026 r., co pokazuje, jak obsługiwana jest rotacja generacji, i warto to wliczyć w koszt wszystkiego, co zbudowano na identyfikatorze wersji zapoznawczej. Warstwa konsumencka jest również naprawdę ograniczona: Flow wymaga subskrypcji Google AI Pro lub Ultra i jest zablokowany w UE, Wielkiej Brytanii, Indiach, Indonezji, Chinach kontynentalnych i Rosji, bez oferowanego obejścia przez VPN.
Griffin nie ma warunków korzystania z usługi do przeczytania, ponieważ nie ma usługi. Dostęp to formularz zgłoszeniowy i podgląd badawczy. Tavus poinformował, że pracuje z organizacjami ds. bezpieczeństwa nad ewaluacjami i chce, aby ludzie w nich uczestniczyli, co jest postawą badawczą, a nie komercyjną.
Zdobycie któregokolwiek z nich
Veo 3.1 jest dostępny przez Gemini API, Vertex AI, Google AI Studio i Flow, a także przez aplikację Gemini wyłącznie w 720p. Poza Chinami jest zdecydowanie łatwiejszy z tych dwóch, jeśli chodzi o zdobycie klucza, co podważa powyższy argument o jakości i jest głównym powodem, dla którego to porównanie pozostaje interesujące mimo liczb.
Griffin jest dostępny po złożeniu wniosku o dostęp i wybraniu jako zaufany tester. To cała ścieżka pozyskania.
Tam, gdzie router naprawdę pomaga w pipeline'ie Veo, jest to miejsce obok modelu wideo, a nie w nim samym. Modele tekstowe Google — Gemini 3.5 Flash, Gemini 3.1 Pro Preview, Gemini 3.6 Flash i reszta tej linii — znajdują się w katalogu OrcaRouter i można je wywoływać przez ten sam endpoint zgodny z OpenAI co ponad 200 innych modeli po cenie katalogowej dostawcy, z doliczoną marżą 0%. Listy ujęć, rozwijanie promptów, generowanie podpisów, notatki o ciągłości między ośmiosekundowymi segmentami oraz podsumowywanie przeglądów to wszystko praca tekstowa, a właśnie ta warstwa sprawia, że możliwość przypisania taniego modelu do masowego przebiegu, a modelu czołowego do tego finalnego, kosztuje zmianę konfiguracji, a nie migrację. Samego Veo 3.1 nie routujemy, podobnie jak Griffina; warto powiedzieć to wprost, zamiast pozwalać, by akapit taki jak ten sugerował coś przeciwnego.
Który, szczerze?
• Wybierz Veo 3.1, gdy produkt końcowy wymaga śladu pochodzenia, gdy nabywca podlega regulacjom prawnym, gdy dystrybucja musi mieć formę pliku z załączonymi poświadczeniami lub gdy 4K nie podlega negocjacjom. Uwzględnij ośmiosekundowe minimum w każdym modelu kosztów i sprawdź cykl życia identyfikatora podglądu, zanim zbudujesz na nim ścieżkę skierowaną do klientów.
• Nie wybieraj Griffina, ponieważ nie możesz. Poproś o dostęp, jeśli Twoje pytanie brzmi, czy człowiek potrafi odróżnić AI od człowieka podczas jednominutowej rozmowy, albo jeśli musisz wiedzieć, dokąd zmierza warstwa interakcji, zanim zatwierdzisz plan rozwoju dla warstwy klipów.
• Patrz na detektor, nie na demo. Jeśli Tavus opublikuje mechanizm ujawniania, który przetrwa swobodną rozmowę, luka między tymi dwoma dostawcami znacznie się zmniejszy. Jeśli tego nie zrobi, Griffin to wynik wart przytoczenia, a Veo 3.1 pozostaje jedynym z tych dwóch, który można postawić przed zespołem ds. zgodności.

