
Tavus Griffin vs. Seedance 2.5: Der eine erzeugt dreißig Sekunden, der andere wartet, bis du deinen Satz zu Ende gesprochen hast.
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Der schnellste Weg, die Kluft zwischen Tavus Griffin und Seedance 2.5 zu verstehen, ist ein Blick darauf, was jeder von beiden tut, wenn man aufhört zu sprechen. Seedance 2.5, am 31. Juli 2026 vom Seed-Team von ByteDance veröffentlicht, macht weiter: Gib ihm einen Prompt, und es erzeugt in einem einzigen Durchlauf bis zu dreißig Sekunden Video – mit gemeinsam erzeugtem Audio, in der Auflösung und Bildrate, die du gewählt hast, bevor du die Eingabetaste gedrückt hast. Tavus Griffin, im Oktober 2026 von Tavus als Forschungsvorschau angekündigt, hält inne – und beginnt dann wieder, weil es die ganze Zeit zugehört hat und etwas zu erwidern hat. Das eine Modell ist eine Produktionsmaschine, die unbeaufsichtigt läuft. Das andere ist ein Teilnehmer, der nur funktioniert, wenn man da ist.
Dreißig Sekunden in einem Take
Das Aushängeschild von Seedance 2.5 ist die Dauer. Während sein Vorgänger bei fünfzehn Sekunden Schluss machte, erzeugt 2.5 in einer einzigen Generierung dreißig Sekunden – die doppelte Zeitspanne, was den Unterschied zwischen einer Einstellung und einer Szene ausmacht. Darüber hinaus unterstützt es mehrrundige Erweiterung, und ByteDance hat in der Beta einen Ultralang-Modus demonstriert, bei dem das Modell seine eigene Ausgabe fortsetzen soll, statt von vorn zu beginnen.
Die Eingabeoberfläche ist umfangreich, selbst für 2026er Maßstäbe. Eine einzelne Anfrage kann bis zu etwa dreißig Bilder, zehn Videoclips und zehn Audioclips als Referenzen mitführen, wobei Referenzvideo und Referenzaudio jeweils rund dreißig Sekunden lang sein können. Das ist genug Material, um gleichzeitig eine Figur, einen Ort, eine Bewegung und einen Soundtrack festzulegen. Das Modell bringt außerdem eine Reihe benannter Modi mit, die eher wie eine Compositing-Suite denn wie eine Prompt-Box wirken: einen Weißmodell- und Clay-Modus für Previz, Green-Screen, Bewegungsreferenz und kreative Referenz. Darüber hinaus kommen zeitstempelgenaue Steuerung und Bearbeitung auf Regionsebene hinzu – und genau hier hört das Dreißig-Sekunden-Fenster auf, nur eine Länge zu sein, und beginnt, eine Timeline zu sein.
Audio und Video entstehen in ein und demselben Durchlauf, statt anschließend gemuxt zu werden, über mehr als zehn Dialogsprachen hinweg, und die Liste der Launch-Partner – XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei, Qiongche Intelligence – liest sich wie eine industrielle und automobile Kundschaft statt wie eine für Kreativwerkzeuge. ByteDances eigene Formulierung ist, dass Seedance 2.5 für Leute gedacht ist, die ein fertiges Stück Filmmaterial brauchen, keine Interaktion.

Das Modell, das nur existiert, während du sprichst
Griffin ist die entgegengesetzte Systemform, und Tavus ist ungewöhnlich explizit, was diese Form angeht. Tavus nennt Griffin das erste Human Interaction Model: ein Video-zu-Video-System, das während eines Gesprächs einen Teilnehmer beobachtet und ihm zuhört und die andere Seite davon in Echtzeit erzeugt. Die Architektur teilt sich in Continuous Conversational Modeling, das entscheidet, was die Persona von Moment zu Moment tun sollte, und Audio-Visual Generation, die die passende Sprache und das passende Gesicht streamt. Es ist Vollduplex, sodass es unterbrochen werden kann, und es braucht kein sauberes End-of-Turn-Signal, um zu antworten.
Bei der Implementierung ist alles auf den nächsten Sekundenbruchteil statt auf die nächste Aufnahme abgestimmt. Der Tavec-Audiocodec arbeitet mit 48 kHz, 40 Werten pro Frame bei 100 Frames pro Sekunde, ohne Codebooks, mit einem vollständig kausalen Decoder und Paketen von nur 10 Millisekunden. Video wird bei 720p in 320-Millisekunden-Blöcken gestreamt, ein Latent pro acht Frames bei 25 fps, drei Diffusionsschritte pro Latent, mit einer 8-fachen zeitlichen Kompression im VAE. Eine dreistufige Destillation – Distribution Matching, dann autoregressives Teacher Forcing, dann Self-Forcing – ermöglicht drei Diffusionsschritte in Echtzeit. Die Audio-zu-Video-Latenz liegt auf H100s durchschnittlich bei 0,43 Sekunden, was laut Tavus etwa die Hälfte der nächstschnellsten Methode ist, die gemessen wurde. Voice Cloning benötigt etwa ein zehn Sekunden langes Sample.
Und dann der Satz, der entscheidet, wie man damit plant: Tavus gibt an, dass Griffin-Lite, die Forschungsvorschau, für eine ausgewählte Gruppe früher Tester verfügbar ist, dass Griffin-Lite derzeit nicht zur Nutzung durch Kunden verfügbar sein wird, dass eine breitere Veröffentlichung eines leistungsfähigeren Modells folgen wird und dass Griffin noch nicht auf der Tavus-Plattform ist – es wird kommen, sobald das Unternehmen geklärt hat, wie es sicher veröffentlicht werden kann.
Die Behauptungen, die jeder Einzelne aufstellt, und was sie wert sind
Die Belege zu Seedance 2.5 betreffen größtenteils die Leistungsfähigkeit: was es akzeptieren kann, wie lange es laufen kann, was es kostet. Die Belege zu Griffin betreffen größtenteils die Wirkung. In einer Studie mit der Queen Mary University of London berichtet Tavus, dass 26 von 54 Teilnehmenden – 48 % – nach einem einminütigen Videoanruf glaubten, Griffin sei eine echte Person, gegenüber 1 von 41 (2,4 %) beim vorherigen Stack aus Phoenix-4.5, Sparrow-2 und Raven-1, wobei Zweifler meist innerhalb der ersten zwanzig Sekunden Verdacht schöpften. In NVIDIAs VideoFDB-Benchmark, ausgewertet im September 2026, liegt Griffin nach Tavus' Rechnung bei Face-to-Face-KI auf Platz eins: Generierung 3,83 gegenüber einer stärksten gemeldeten Baseline von 2,80 und 3,92 für einen Menschen, Wahrnehmung 3,73 gegenüber 3,44 und 4,20 sowie ein Vorsprung von 37 % gegenüber dem nächstbesten System beim Reagieren im Moment. Vom Anbieter berichtet, auf einem von NVIDIA erstellten Benchmark – doch die Vergleichspunkte zum Menschen sind die, die Gewicht haben.
Für „hat das Publikum es geglaubt“ gibt es bei Seedance 2.5 keinen vergleichbaren unabhängigen Test, denn dafür ist es nicht gedacht. Die beiden Modelle beantworten unterschiedliche Fragen, und keine der beiden Zahlenreihen lässt sich auf die andere übertragen.
Was du wirklich kaufen kannst
Seedance 2.5 ist ein Produkt mit einer Preisliste. Auf ByteDances ModelArk-Plattform kostet es 10,70 US-Dollar pro Million Tokens ohne Videoeingabe und 6,40 US-Dollar pro Million mit Videoeingabe, was ungefähr 0,51 US-Dollar für einen fünfsekündigen 16:9-Clip bei 480p und ungefähr 1,16 US-Dollar für denselben Clip bei 720p ergibt. Der Zugriff erfolgt über die Consumer-Apps von ByteDance sowie über die API auf Volcano Engine Ark in China und international über BytePlus ModelArk. Mindestens ein Distributor gibt an, dass es in den Vereinigten Staaten nicht verfügbar ist, und Quellen sind sich uneinig darüber, ob die höchste Auflösung 720p oder 1080p beträgt – beides ist wissenswert, bevor man es in eine Spezifikation schreibt.
Griffin hat keine Tarifkarte, keine öffentliche API und kein Datum. Das ist die gesamte Kaufentscheidung, und es engt die Frage weiter ein, als die meisten Vergleichsartikel zugeben.

Wo ein Router seinen Platz verdient
Wenn Sie etwas bauen, das beides braucht – einen Agenten, der ein Gespräch führt und zugleich fertiges Filmmaterial produziert –, dann stehen Sie vor zwei Anbietern, zwei Konsolen, zwei Abrechnungssystemen und zwei unterschiedlichen Vorstellungen davon, was eine Anfrage ist. Genau an dieser Nahtstelle ist OrcaRouter wirklich nützlich statt nur dekorativ: ein Schlüssel für mehr als zweihundert Modelle, wobei die Listenpreise der Anbieter mit 0 % Aufschlag durchgereicht werden, sodass eine Preissenkung eines Anbieters noch am selben Tag auf der Karte ankommt, automatischem Failover sodass ein ausgelasteter Anbieter nicht zu Ihrem Ausfall wird, und einer Routing-DSL, mit der Sie kritische Jobs an ein bestimmtes Backend binden können, während Entwürfe dorthin gehen, wo die Kapazität am günstigsten ist. Modell-Fusion spielt hier an den Rändern ebenfalls eine Rolle – bei einem Generator, der pro Token oder pro Sekunde abgerechnet wird, ist es meist die ertragreichste Zeile in der Pipeline, ein günstiges Textmodell dafür einzusetzen, einen Prompt zu schärfen, bevor Sie die teure Generierung bezahlen.
Um präzise zu sein, was die beiden Modelle im Titel betrifft: Weder Seedance 2.5 noch Griffin ist eine OrcaRouter-Route. Seedance erreicht man über ByteDances eigene Plattformen und Distributoren von Drittanbietern; Griffin ist überhaupt nicht erreichbar. Was der Katalog auf der Videoseite hingegen führt, ist minimax/minimax-h3, MiniMaxs omni-modaler Generator, zu 0,08 $ pro Sekunde Ausgabe bei 768P und 0,13 $ pro Sekunde bei 2K, verkauft in denselben Sekundeneinheiten wie Seedance und ab sofort verfügbar.

Häufig gefragt, kurz
Könnte ich Seedance 2.5 und Griffin im selben Produkt betreiben?Architektonisch ja, und es ist die naheliegende Aufteilung: Seedance für alles, was vorgerendert werden kann, Griffin für die Live-Oberfläche. Kommerziell nein, denn Griffin ist noch nicht an Sie verkäuflich.
Ist Griffin nur ein Talking-Head-Generator?Nein, und Tavus achtet sorgfältig auf den Unterschied — ein Talking-Head-Generator nimmt Text entgegen und liefert Video zurück, während Griffin das Video und Audio des Teilnehmers als Eingabe erhält und daran gemessen wird, ob er im Moment reagiert.
Arbeitet Seedance 2.5 in Echtzeit? Nein. Es ist ein Batch-Generator mit einer Obergrenze von dreißig Sekunden und einem mehrstufigen Erweiterungsmodus; Latenz ist nicht die Achse, auf der er konkurriert.
Fazit
Seedance 2.5 ist eine ausgelieferte Produktions-Engine: dreißig Sekunden in einem Durchgang, gemeinsames Audio, bis zu dreißig Bilder sowie zehn Video- und Audioreferenzen, zeitstempel- und regionengenaue Kontrolle, ungefähr 0,51 US-Dollar für einen fünfsekündigen 480p-Clip und ungefähr 1,16 US-Dollar bei 720p auf ModelArk, derzeit über ByteDances eigene Plattformen verfügbar und, soweit das irgendjemand bestätigt hat, nicht in den Vereinigten Staaten. Tavus Griffin ist kein Produkt: Es ist ein duplexes Human Interaction Model, dessen veröffentlichte Errungenschaften darin bestehen, dass 48 % der Teilnehmenden glaubten, es sei in einem einminütigen Anruf ein Mensch, und eine durchschnittliche Audio-zu-Video-Latenz von 0,43 Sekunden auf H100s, und dessen Anbieter schriftlich erklärt hat, dass Kunden es noch nicht nutzen können. Wenn Sie heute Filmmaterial benötigen, ist Seedance die Antwort, und der Preis ist offen einsehbar. Wenn Sie ein Gesicht brauchen, das reagiert, während Sie sprechen, lautet die Antwort, dass es noch niemand verkauft.
