
Tavus Griffin vs HeyGen Video 1: Trzydzieści sześć godzin różnicy, a tylko jeden jest do kupienia
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Dwie premiery pojawiły się w odstępie trzydziestu sześciu godzin od siebie w tym samym segmencie rynku, a kalendarz jest najciekawszą rzeczą w tym zestawieniu. HeyGen Video ruszył 30 września 2026 r. w cenie 0,01 USD za sekundę do końca października, dostrojony na podstawie MiniMax H3 i udostępniany pod identyfikatorem heygen-video-1. Tavus Griffin został ogłoszony 1 października 2026 r. wraz z badaniem na żywo twarzą w twarz, w którym 26 z 54 uczestników uznało, że ich rozmówca jest prawdziwą osobą, i jest dostępny tylko dla wybranych zaufanych testerów po wypełnieniu formularza zgłoszeniowego, bez identyfikatora, bez punktu końcowego i bez ceny. Oba dotyczą generowania przekonującego człowieka. Uczciwy powód, by porównywać Tavus Griffin i HeyGen Video 1 nie polega na tym, że kupujący miałby wybierać między nimi — dziś można kupić tylko jeden z nich — ale na tym, że różnica wyjaśnia, do czego każdy został stworzony, i ile faktycznie warta jest sekunda wygenerowanego człowieka.
Jeden sprzedaje klip, drugi sprzedaje rozmowę
HeyGen Video to model wideo ogólnego przeznaczenia, który akurat wyjątkowo dobrze radzi sobie z ludźmi. Przyjmuje prompt, albo prompt plus obraz, albo prompt plus do dziewięciu obrazów referencyjnych, trzy filmy referencyjne i trzy referencyjne klipy audio, i zwraca klip o długości od 5 do 15 sekund w 480p lub 768p, 24 fps, z dźwiękiem AAC w 32 kHz stereo zawierającym wygenerowane dialogi, dźwięki otoczenia i efekty. Trzy tryby obejmują warunkowanie — text_to_video, image_to_video, i reference_to_video, który jest domyślny — a kolejność listy staje się etykietą, do której odnosisz się w prompcie, więc pierwszy wpis reference_images to <Picture 1>. Nieznane pola w żądaniu są odrzucane, a nie ignorowane, a seed to 32-bitowa liczba całkowita bez znaku, która czyni ujęcie powtarzalnym, gdy zachowujesz go i zmieniasz jedną klauzulę na raz. To narzędzie produkcyjne o deterministycznym zakresie.
Griffin odwraca niemal każdą z tych właściwości. Generuje 720p w fragmentach po 320 ms przy 25 fps z pojedynczego zdjęcia referencyjnego i odtwarza każdy fragment w miarę jego dekodowania, więc nie ma długości klipu do określenia ani pliku do przekazania. Silnik Continuous Conversational Modeling przetwarza dźwięk i wideo oraz ponownie ocenia wymianę w odstępach subsekundowych, decydując, czy milczeć, sygnalizować, przytakiwać, czy przejąć turę, a jego kontrolki ekspresji sterują generatorem mowy strumieniowej i generatorem wideo strumieniowego równolegle. Decyzja podjęta w połowie zdania pojawia się w głosie i na twarzy w ramach tej samej mini-tury. Nie piszesz podpowiedzi; rozmawiasz z nim, a on reaguje na pauzę, odwrócenie wzroku lub przerwanie.
Dlatego te dwa rozwiązania nie są zamiennikami, mimo że oba generują człowieka. HeyGen Video jest pytany, jak wygląda opisany moment. Griffin jest pytany, co powinno wydarzyć się dalej.
Ile kosztuje każda sekunda, na tym, gdzie można kupić sekundy
Cena startowa HeyGen Video wynosi 0,01 USD za sekundę do października, a własny tekst HeyGen opisuje to jako 50% zniżki od standardowej stawki 0,02 USD. Wykres kosztów na tej samej stronie, opatrzony przypisem jako cena katalogowa za sekundę przy 768p z dźwiękiem przed promocjami startowymi, podaje 0,03 USD. To 50-procentowa rozbieżność między tekstem a wykresem w materiałach startowych samego dostawcy, a dopóki HeyGen nie opublikuje strony z cennikiem API, najbezpieczniejsza interpretacja jest taka, że 0,01 USD jest potwierdzone, ponieważ już obowiązuje, a kwota po październiku mieści się gdzieś między 0,02 a 0,03 USD.
Przelicz to dla tysiąca sekund — stu dziesięciosekundowych klipów — co jest jednostką, w której faktycznie myśli zespół pracujący na masową skalę:
• HeyGen Video w październiku — $10 przy $0,01 za sekundę.
• HeyGen Video po październiku — 20 USD po 0,02 USD lub 30 USD po 0,03 USD z wykresu.
• MiniMax H3, model bazowy, na bazie którego został dostrojony — 80 USD przy cenniku MiniMax wynoszącym 0,08 USD za sekundę.
• Kling 3.0 Pro — 168 USD po 0,168 USD za sekundę.
• Veo 3.1 — 400 USD po 0,40 USD za sekundę.
Powodem, dla którego arytmetyka jest głównym tematem premiery HeyGen, jest wskaźnik odrzuceń. Zespoły tworzące skróty pod media społecznościowe, warianty reklam i pętle produktowe generują znacznie więcej, niż publikują, a przy stawce dziesięciu centów za dziesięciosekundową próbę ekonomia wyrzucania kandydatów zmienia się całkowicie. Haczyk tkwi w pułapie: 768p przy 24 fps to nie format dostarczania 2K, a MiniMax H3 osiąga 2K przez osobny moduł regeneracji we własnym hostowanym API MiniMax w cenie 0,13 USD za sekundę, bez odpowiednika w HeyGen Video. Jeśli docelowy format dostarczania przekracza 768p, tania sekunda to nie ta sekunda, której potrzebujesz.
Kolumna Griffina na tej liście jest pusta i to nie w obiecujący sposób. Tavus nie opublikował stawki, ponieważ Griffin-Lite to badawcza wersja zapoznawcza, o której w jej własnym ogłoszeniu napisano, że w tym czasie nie będzie dostępna do użytku przez klientów i nie znajduje się na platformie Tavus. W modelu tysiąca sekund nie ma czego wpisać. Każdy, kto podaje jakąś liczbę dla Griffina, zmyśla ją.
Liczby jakości i kto ocenia
Żaden z tych modeli nie ma niezależnego wyniku, co warto zaznaczyć od razu, ponieważ obaj dostawcy mają wykresy.
Tabela HeyGen to ranking Elo, w którym HeyGen Video znormalizowano do 1000, następnie Dreamina Seedance 2.0 z wynikiem 955, rodzina H3 Max rozpięta od 952 do 860, Kling 3.0 Pro z wynikiem 857 i Veo 3.1 z wynikiem 744. Najwięcej wyjaśnia przypis: wyniki pochodzą z wewnętrznego zestawu ewaluacyjnego zapytań Artificial Analysis Arena z 4800 głosami, a własny wynik HeyGen znormalizowano do 1000 dla łatwiejszego porównania. To, że dostawca normalizuje sam siebie na szczyt własnego wykresu, jest wyborem prezentacyjnym, a nie dowodem na to, że prowadzi. Tym, co niesie informację, są względne odstępy poniżej.
Bardziej przydatne jest bezpośrednie porównanie, które jest jedynym miejscem, w którym HeyGen mierzy się z czymś, czego nie zbudował. HeyGen twierdzi, że testerzy w ciemno preferowali jego model względem przedstawionego na wykresie H3 Max post-train w 55,8% porównań na 650 głosów, z zakresem 49–62%. Ten zakres to uczciwy szczegół: na dolnym końcu oscyluje wokół 50%, więc według własnych danych dostawcy preferencja względem tego rywala nie jest wyraźnie odseparowana od szumu. Rozkład na poszczególne osie jest mieszany w sposób, który wygląda jak konkretny profil niepowodzeń — 65% za wierność obrazowi źródłowemu i 66% za synchronizację czasową, wobec 43% za spójność i 45% za muzykę.
Liczby Griffina pochodzą z instrumentu zbudowanego przez kogoś innego, i to właśnie ta różnica ma znaczenie. VideoFDB firmy NVIDIA to benchmark pełnodupleksowej rozmowy audiowizualnej ocenianej na dwóch ścieżkach, a NVIDIA go zbudowała i prowadzi ocenę za pomocą własnego sędziego według opublikowanej rubryki. Griffin-Lite uzyskał 3,83 na 5 w generowaniu wobec 3,92 punktu odniesienia dla człowieka i 2,80 dla następnego najwyżej ocenionego opublikowanego systemu oraz 3,73 w percepcji wobec 4,20 punktu odniesienia dla człowieka. Tavus podaje również 0,43 sekundy rzeczywistego opóźnienia audio-wideo generatora w porównaniu z czterema opublikowanymi bazowymi modelami strumieniowej dyfuzji na H100s. Zastrzeżenia nadal obowiązują — różnica 0,09 punktu do wyniku człowieka w pięciopunktowej rubryce ocenianej przez model językowy to „blisko”, a nie „równo”, a część przewagi w percepcji jest mierzona względem systemów działających bez wejścia wideo — ale oceniającym nie jest dostawca.
• Niezależne oceny jakości — ani jedno, ani drugie takiej oceny nie ma. HeyGen Video nie znajduje się na żadnym z trzech rankingów wideo Artificial Analysis na dzień 2 października 2026 r., podobnie jak Griffin. Griffin może nigdy się nie pojawić: porównawcze głosowanie preferencyjne na krótkich klipach nie pozwala ocenić rozmowy na żywo.
Te same rankingi rzeczywiście uwzględniają model bazowy. MiniMax H3 zajmuje 4. miejsce w text-to-video (z dźwiękiem) z wynikiem Elo 1 139 i 2. miejsce w image-to-video z wynikiem 1 181, w obu przypadkach po 4,80 USD/min — więc post-train HeyGen konkuruje na podłożu, które niezależna arena już ocenia jako bliskie czołówki, co jest najsilniejszym argumentem na jego korzyść, którego samo HeyGen nie opublikowało.

Oba są tanie albo niewycenialne z tego samego powodu
Strukturalny fakt leżący u podstaw obu premier jest taki, że tworzenie przekonującego człowieka stało się tanie, a przewaga kosztowa żadnej z firm nie wynika z tego, co sprzedaje.
HeyGen Video to model po dotrenowaniu MiniMax H3, który MiniMax udostępnił z wagami dostępnymi na własnej licencji społecznościowej. To przekształciło H3 w substrat, który inne firmy mogą wyspecjalizować i odsprzedawać, a HeyGen jest drugim produktem, który zrobił to w ciągu pięciu tygodni w innej branży — wideo biznesowe, prezentacje produktów, szkolenia, wirtualne spacery po nieruchomościach. Ten wzorzec wyjaśnia, dlaczego HeyGen może ustalać cenę poniżej modelu bazowego: nie ponosi kosztów modelu bazowego, a model bazowy to czyjeś udostępnienie otwartych wag.
Griffin to przeciwstawny zakład. Tavus zbudował cały system — kodek, strumieniowy generator mowy, strumieniowy generator wideo, model konwersacyjny — wokół samej interakcji, destylując dużego dwukierunkowego nauczyciela dyfuzyjnego do kilkukrokowego generatora autoregresyjnego w trzech etapach, tak aby długie rolouty nie dryfowały. To kosztowne badania bez otwartej bazy, na której można się oprzeć, i to prawdopodobnie częściowo wyjaśnia, dlaczego wydanie ma ograniczony dostęp: nie ma pod nim taniego podłoża, które można by amortyzować.
Obie firmy dochodzą też do tego samego niewygodnego miejsca z różnych kierunków. Dokumentacja samego HeyGen wymienia, w czym model wypada najgorzej — co jest rzadkością i warto ją przeczytać: długi tekst na ekranie, miękkie organiczne ruchy, takie jak płatki, papier i włosy, oraz praca dłońmi z bliska, taka jak montowanie lub obsługiwanie sprzętu. Najlepiej wypada w krótkich, zamkniętych ujęciach — jeden obiekt, jedno miejsce, jedna czynność, kamera nieruchoma lub ledwie poruszająca się. Ograniczeniem Griffina nie jest lista trybów awarii, ale nierozwiązany problem bezpieczeństwa: Tavus stwierdza wprost, że właściwości, które sprawiają, że model interakcji z człowiekiem jest lepszym interfejsem, sprawiają też, że lepiej przekonuje kogoś, iż rozmawia z człowiekiem, oraz że wstrzymuje podgląd, podczas gdy buduje mechanizmy ujawniania.
Co kupujący może dziś faktycznie zrobić
HeyGen Video można już wywoływać. Działa przez POST /v3/models/videos z x-api-key w nagłówku, tylko na płatnych kluczach API, z linkami do pobrania, które są podpisane i wygasają — więc odpytywanie je odświeża — oraz wywołaniami zwrotnymi próbowanymi raz na zadanie, co sam HeyGen każe traktować jako optymalizację opóźnienia, a nie gwarancję. Jeśli testujesz to w tym miesiącu, promocyjna sekunda za 0,01 USD jest aktywna, limit wyjściowy to 768p, a tryb wzmacniania promptu to prawdziwa dźwignia kosztów: turbo domyślnie, quality dla dłuższego przebiegu, disabled, aby wysłać swój tekst bez zmian.
Griffin nie jest wywoływalny. Dostęp odbywa się przez formularz zgłoszeniowy i ma charakter badawczego podglądu. Nie ma klucza, identyfikatora, endpointu ani SLA, a jedyna opublikowana informacja o dostępności mówi, że pojawi się ona, gdy Tavus ustali, jak bezpiecznie go udostępnić.
Jedna rzecz, którą oba mają wspólną, to fakt, że żaden z nich nie jest modelem, do którego router może pomóc ci dotrzeć, a w przypadku Griffina jest to problem kategorii, a nie tymczasowy — sesja w czasie rzeczywistym w trybie pełnego dupleksu nie jest wywołaniem typu żądanie-odpowiedź. To, w czym router pomaga w obu potokach, to warstwa wokół wideo. Rozszerzanie promptów, inwentarz obrazów referencyjnych, opisy ujęć, generowanie podpisów i podsumowywanie recenzji to wszystko wywołania tekstowe, a te od OpenAI, Google i pozostałych znajdują się w katalogu OrcaRouter za jednym punktem końcowym zgodnym z OpenAI, oferującym ponad 200 modeli na tym samym kluczu, w cenie katalogowej dostawcy bez doliczonej marży, więc cena dostawcy jest aktualna tego samego dnia. Jeśli chodzi o sam model wideo, jest jeden przydatny fakt: MiniMax H3 — baza, na której dostrojono HeyGen Video, oraz to, którego cenę za sekundę HeyGen przebija swoim $0.01 — jest tu kierowany jako minimax/minimax-h3 za $0.08 za sekundę, a 2K za $0.13. Sam HeyGen Video nie znajduje się w naszym katalogu, podobnie jak Griffin; oba są obsługiwane przez własne API swoich dostawców oraz kilka platform zewnętrznych.

Który z nich i dla kogo
• Użyj HeyGen Video, jeśli efektem ma być krótki, zamknięty, skupiony na osobie materiał z wbudowanym dźwiękiem i możesz zaakceptować 768p przy 24 fps. Zaplanuj stawkę po październiku na gdzieś między $0.02 a $0.03 za sekundę, a nie promocyjne dziesięć centów, i dokładnie przetestuj długi tekst na ekranie oraz pracę dłoni w zbliżeniu, zanim powierzysz temu swój workflow, ponieważ HeyGen już ci powiedział, że właśnie tam się to psuje.
• Nie planuj w oparciu o Groka. Poproś o dostęp, jeśli zastanawiasz się, czy człowiek potrafi odróżnić renderowanego człowieka od prawdziwego podczas rozmowy w cztery oczy, albo jeśli musisz zobaczyć, dokąd zmierza warstwa interakcji w czasie rzeczywistym, zanim zwiążesz plan działania z renderowanymi klipami.
• Miej oko na kwestię ujawniania, bo to jedyna rzecz, która poruszy obie strony. Klienci HeyGen Video mają do dyspozycji prostą odpowiedź — model jest wynikiem dotrenowania bazowego modelu o otwartych wagach, a wynik to plik o znanym pochodzeniu — podczas gdy Tavus wstrzymuje model właśnie dlatego, że jeszcze go nie ma. Ta firma, która opublikuje lepszy mechanizm ujawniania, rozwiąże cenniejszy problem.

