
Tavus Griffin vs Kling 3: rozmowa w czasie rzeczywistym kontra dziesięciosekundowy klip
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Uczciwy kształt tego zestawienia to asymetria routingu. Kling 3 to model wywoływalny z ceną, powierzchnią parametrów i wpisem we własnym katalogu; Tavus Griffin to badawcza wersja zapoznawcza dla wybranych zaufanych testerów, dostępna za formularzem zgłoszeniowym, ogłoszona 1 października 2026 r. bez identyfikatora, bez endpointu i bez publikowanego cennika. Kling 3.0 figuruje w katalogu OrcaRouter jako kling/kling-v3, w cenie 0,084 USD za żądanie, z ceną katalogową dostawcy przekazywaną dalej i bez żadnych dodatków. Griffin nie podlega routingowi i nie dlatego, że nikt się jeszcze do tego nie zabrał — sesja pełnodupleksowa w czasie rzeczywistym, w której model generuje 720p w 320-milisekundowych porcjach, jednocześnie słuchając, nie jest wywołaniem typu żądanie-odpowiedź i nie pasowałaby do tego samego kształtu, nawet gdyby Tavus otworzył bramy już jutro. Nie jest to więc porównanie, które nabywca rozstrzyga ceną. To porównanie dwóch odpowiedzi na pytanie, do czego służy wygenerowany człowiek.
Czym właściwie jest Kling 3.0
Kling 3.0 został wydany 5 lutego 2026 jako seria czterech modeli — Video 3.0, Video 3.0 Omni, Image 3.0 i Image 3.0 Omni. Jego cechą charakterystyczną jest automatyczne sekwencjonowanie wielu ujęć: model samodzielnie planuje przejścia między ujęciami, a tryb niestandardowy pozwala ustawić liczbę ujęć i czas trwania każdego z nich, przy czym recenzenci raportują użyteczne sekwencje do około sześciu odrębnych ujęć z jednego promptu, a rozmiar ujęcia, ruch kamery i beat narracyjny można określić dla każdego ujęcia. Górny limit to 15 sekund na generację, a dolny to trzy sekundy. Po stronie OrcaRouter pojawia się jako flagowy model text-to-video i image-to-video z kontrolą wielu ujęć, podmiotu i ruchu, klipy 3–15 sekund i deklarowane do natywnego 4K, udostępniany pod adresem POST /v1/video/generations.
Audio jest generowane natywnie w tym samym przebiegu. Wersja Kuaishou obsługuje chiński, angielski, japoński, koreański i hiszpański, radzi sobie z dialogami w mieszanych językach w obrębie jednego klipu, przypisuje odrębny głos do każdej postaci w scenach z wieloma postaciami i oferuje akcenty regionalne — angielski amerykański, brytyjski i indyjski; chiński północno-wschodni, pekiński, tajwański, kantoński i syczuański. Spójność synchronizacji ust jest najczęściej zgłaszaną słabością w niezależnych recenzjach opartych na testach praktycznych; w jednym z testów zgłoszono, że około dwóch z pięciu klipów z dialogiem wymagało powtórzenia, a zgłaszane artefakty grupują się wokół dialogów w hałaśliwych otoczeniach dźwiękowych, w których tło z odgłosami wody i wiatru sprawia, że mowa jest przytłumiona.
Czym Griffin właściwie jest, w jednym akapicie
Griffin nie jest generatorem wideo z trybem konwersacji. To dwa silniki działające równocześnie. Silnik ciągłego modelowania konwersacyjnego (Continuous Conversational Modeling) przetwarza dźwięk i wideo osoby, ponownie ocenia wymianę zdań w odstępach poniżej sekundy i na każdym z nich decyduje, czy milczeć, dać sygnał, wtrącić się czy przejąć turę — emitując ekspresyjne elementy sterujące, które niosą ze sobą wyczucie czasu, postawę, mimikę i gesty, a nie tylko słowa. Silnik generowania audiowizualnego przekształca te elementy sterujące w dźwięk i piksele jednocześnie: autoregresyjny transformator dyfuzyjny, który generuje mowę fragment po fragmencie latentnym z zakodowanego prefiksu mówcy, oraz kilkuetapowy autoregresyjny generator wideo, który tworzy obraz 720p w porcjach po 320 ms przy 25 fps z jednego zdjęcia referencyjnego. Nie ma podpowiedzi, długości klipu ani pliku. Jeśli chodzi o dźwięk, raportuje 0,43 sekundy rzeczywistego opóźnienia audio-wideo na H100s w porównaniu z czterema opublikowanymi bazowymi modelami strumieniowej dyfuzji, co Tavus określa jako połowę czasu kolejnej najszybszej metody.
Cena i jednostronny stół
Cennik Kling 3.0 to jedyne miejsce w tym artykule, w którym po obu stronach porównania pojawia się konkretna liczba, a jedna strona jest pusta.
• Kling 3.0 w OrcaRouter — 0,084 USD za żądanie, cena cennikowa dostawcy przekazywana bez marży, przy 0% narzutu, więc zmiana stawek Kuaishou lub obniżka promocyjna obowiązuje tutaj tego samego dnia, a nie dopiero po zakończeniu cyklu umownego.
• Kling 3.0 na niezależnej arenie — ranking text-to-video z dźwiękiem odczytany 2 października 2026 r. wymienia poziom 1080p Pro w cenie 10,08 USD/min oraz poziom Omni 1080p Pro w cenie 8,40 USD/min. To samo zestawienie przypisuje czterem poziomom Kling 3.0 cztery różne ceny, więc „cena Kling 3.0” nie jest jedną liczbą.
• Griffin — brak ceny. Griffin-Lite jest dostępny dla wybranych zaufanych testerów jako podgląd badawczy, nie znajduje się na platformie Tavus, a w swoim własnym ogłoszeniu stwierdzono, że w tym momencie nie będzie dostępny do użytku przez klientów. Nie ma stawki za żądanie, stawki za sekundę ani darmowego planu, które można by podać, a model pojawi się dopiero po tym, jak Tavus opracuje sposób bezpiecznego udostępnienia go.
To cała sekcja cen i uczciwie jest zostawić to tak, zamiast wymyślać szacunek na sekundę na podstawie śladu obliczeniowego.
Tablice wyników mierzą różne rzeczy i nie pokrywają się.
Oba modele zostały ocenione przez kogoś innego niż ich dostawca, przy użyciu narzędzi, których nie można porównać.
Kling 3.0 znajduje się na arenie wideo Artificial Analysis, gdzie Elo pochodzi z anonimowych porównań parami dokonywanych przez ludzi na krótkich klipach. Dwa odczyty z tego samego dnia opowiadają różne historie, co jest pułapką wartą nazwania: na tablicy text-to-video z dźwiękiem poziomy Kling plasują się w środku tabeli, podczas gdy na tablicy image-to-video z dźwiękiem plasują się istotnie wyżej — ale nie wszystkie poziomy Kling występują na obu. Tylko wersje Pro i Omni Pro 1080p w ogóle znajdują się na tablicy tekstowej; poziom Standard 720p jest oceniany w image-to-video i nigdzie indziej.
• Kling 3.0 w generowaniu wideo z tekstu (z dźwiękiem) — 1080p Pro na 16. miejscu, Elo 1000 przy 4 844 głosach, 10,08 USD/min; Omni 1080p Pro na 16. miejscu, Elo 987 przy 2 741 głosach, 6,90 USD/min. Droższy z dwóch poziomów wypada niżej, co jest tym samym brakiem wyniku, jaki rozrzut poziomów pokazuje wszędzie indziej na tej tablicy.
• Kling 3.0 w kategorii image-to-video (z dźwiękiem) — 1080p Pro na miejscach 18–20, Elo 1,051 (±6) przy 14 896 głosach, 20,16 USD/min; 720p Standard na miejscach 18–20, Elo 1,051 (±6) przy 14 692 głosach, 15,60 USD/min; Omni 1080p Pro na miejscach 21–22, Elo 1,044 (±8) przy 2 945 głosach, 16,80 USD/min; Omni 720p Standard na miejscach 21–24, Elo 1,036, 13,44 USD/min.
Interpretacja jest taka, że Kling 3.0 jest mocniejszy, gdy wychodzi od dostarczonego obrazu, niż gdy wychodzi od tekstu, a ranking image-to-video ma trzykrotnie większą liczbę głosów, więc jego pozycja tam jest lepiej rozstrzygnięta. To także tryb najczęściej wykorzystywany w pracach komercyjnych. Zwróć uwagę, co dają cztery poziomy: w ramach image-to-video obejmują szesnaście punktów Elo w przedziale cenowym od 13,44 USD do 20,16 USD za minutę, a najtańszy z czterech nie jest najniżej sklasyfikowany. Płacenie więcej za Kling 3.0 nie przesuwa go wyżej w tym rankingu.

Wyniki Griffin pochodzą z VideoFDB firmy NVIDIA, które ocenia pełnodupleksową rozmowę audiowizualną na dwóch ścieżkach i zostało stworzone oraz przeprowadzone przez NVIDIA z własnym sędzią według opublikowanej rubryki. Griffin-Lite uzyskał 3,83 na 5 w generowaniu w porównaniu z ludzkim odniesieniem 3,92 oraz 2,80 dla następnego najwyżej ocenionego opublikowanego systemu, a także 3,73 w percepcji w porównaniu z ludzkim odniesieniem 4,20, przy zgodności wskaźnika przejmowania wynoszącej 62,8% i 73,8%. Te liczby nie mówią nic o tym, czy klip wygląda dobrze w 1080p, a Elo systemu Kling nie mówi nic o tym, czy model można przerwać w połowie zdania. Jedyne uczciwe zastosowanie jednego lub drugiego to użycie go w obrębie jego własnego pytania.
Luka, której nikt nie mierzy: opóźnienie kontra długość
Jest tu prawdziwy kontrast inżynieryjny, którego nie oddaje żaden z rankingów, i jest to najbardziej przydatna rzecz w tym porównaniu dla każdego, kto planuje produkt.
Kling 3.0 optymalizuje długość i strukturę w ramach ograniczonego generowania: do piętnastu sekund, do około sześciu zaplanowanych ujęć, kontrola na poziomie pojedynczego ujęcia. Jego koszt rośnie wraz z czasem trwania wyniku, a jakość rośnie wraz z precyzją promptu. Nic w nim nie działa, gdy użytkownik jeszcze mówi, i to nie jest wadą — to kształt tej kategorii.
Griffin optymalizuje opóźnienie w nieograniczonej sesji: fragmenty 320 milisekund, 25 fps, decyzja podejmowana co interwał poniżej sekundy, brak klipu do zaplanowania, ponieważ rozmowa nie ma końca. Jego koszt, jakikolwiek by się okazał, skalowałby się z czasem trwania rozmowy, a nie z wyrenderowanymi sekundami, a jego jakość skaluje się z tym, jak naturalna jest osoba po drugiej stronie, a nie z briefem. Trzystopniowa destylacja do generatora autoregresyjnego trenowanego na własnej historii istnieje właśnie dlatego, że trybem awarii tej architektury jest dryf podczas długiego rollout, a nie złe ujęcie.
Postaw oba obok siebie, a praktyczna konsekwencja jest taka, że zawodzą w przeciwnych kierunkach. Kling 3.0 zawodzi widocznie i wcześnie — ujęcie na granicy, które możesz usunąć i wygenerować ponownie za kilka centów, z budżetem na powtórki wbudowanym w przepływ pracy. Griffin, gdyby działał zgodnie z opisem, zawodziłby niewidocznie i późno, przez to, że nie jest tym, czym się wydaje, co jest powodem, dla którego Tavus go wstrzymuje.
Gdzie router naprawdę pomaga, a gdzie nie
Kling 3.0 znajduje się w katalogu OrcaRouter jako kling/kling-v3 za 0,084 USD za żądanie, na tym samym kluczu i tym samym punkcie końcowym zgodnym z OpenAI co ponad 200 innych modeli. To realna różnica w porównaniu z posiadaniem konta Kuaishou i osobnej integracji dla dowolnego modelu tekstowego, którego potrzebuje Twój potok: ponieważ nie doliczamy nic do ceny dostawcy, zmiana stawek Kuaishou obowiązuje po naszej stronie tego samego dnia, a jeśli dostawca upstream działa gorzej lub ogranicza liczbę żądań, automatyczne przełączanie awaryjne przenosi żądanie, zanim rozpocznie się odpowiedź, zamiast zwracać błąd do Twojej aplikacji. W przypadku potoku wideo, w którym jedno wywołanie może kosztować więcej niż tysiąc wywołań tekstowych, przetrwanie żądania przez złą minutę po stronie dostawcy jest warte więcej niż marża, której nie płacisz.
Griffin nie znajduje się w naszym katalogu, nie znajduje się w niczyim katalogu i nie może się w nim znaleźć — model sesji pełnodupleksowej to nie routowane żądanie. Jest osiągalny wyłącznie przez złożenie wniosku o dostęp. To, że sam Tavus kieruje potencjalnych twórców ku swoim starszym modelom, a nie ku Griffinowi, mówi wszystko: trzej poprzednicy zasilają PAL-e, z których korzysta już 150 000 deweloperów i firm, a Griffina wśród nich nie ma.

Który, po co
• Wybierz Kling 3.0 do zaplanowanych sekwencji wieloujęciowych z jednego polecenia, do pracy image-to-video, gdzie jego pozycja w arenie bez dźwięku jest mocna i cieszy się dużą liczbą głosów, do wielojęzycznych dialogów z przypisaniem głosu do poszczególnych postaci w pięciu językach, do spójności elementów podczas ruchów kamery oraz do 4K, jeśli potwierdzisz ten poziom na piśmie — własna dokumentacja Kuaishou twierdzi, że obsługuje natywne 4K, podczas gdy jego przewodnik użytkownika wymienia tylko 720p i 1080p, a stawki kredytowe podmiotów trzecich dla 4K różnią się między źródłami ponad dwukrotnie.
• Najpierw przetestuj Kling 3.0 pod kątem synchronizacji ust, jeśli dialog jest najważniejszy, ponieważ to właśnie tam niezależne recenzje praktyczne mówią, że to zawodzi, a to właśnie ten błąd kosztuje najwięcej powtórek.
• Nie planuj z myślą o Griffinie. Poproś o dostęp, jeśli pytanie, na które potrzebujesz odpowiedzi, brzmi: czy człowiek potrafi odróżnić wygenerowanego człowieka od prawdziwego podczas jednominutowej rozmowy, albo czy wiedza o tym, dokąd zmierza warstwa interakcji, powinna kształtować to, co budujesz teraz na warstwie klipów.
• Obserwuj dwie rzeczy, nie jedną. Po stronie Kling: czy rozrzut między poziomami zacznie podążać za ceną, ponieważ cztery poziomy obecnie mieszczą się w granicach dziewiętnastu punktów Elo od siebie w zadaniu obraz-do-wideo, a jednocześnie różnią się ceną o połowę więcej, i najtańszy poziom nie jest najgorzej uplasowany. Po stronie Griffin: czy pojawi się mechanizm ujawniania i karta modelu; jeśli tak, porównanie przestaje być esejem projektowym i staje się decyzją zakupową, a ten artykuł będzie wymagał przepisania.

