
Odyssey-3 vs. MiniMax H3: Der Unterschied ist ein Download
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Am 3. August 2026 landeten die Gewichte eines 2K-Videomodells auf Hugging Face unter einem Namen, den jeder herunterladen und ausführen kann: MiniMax H3. Sechs Wochen später, am 15. September, veröffentlichte Odyssey eine Forschungsseite für Odyssey-3 – ein Foundation-Weltmodell, das Roboterarme, ein Auto, eine Drohne und drei Videospiele steuert – und setzte einen Satz dorthin, wo der Download-Link stehen würde: Es werde „in den kommenden Wochen“ öffentlich veröffentlicht. Diese beiden Sätze sind der gesamte Vergleich. Eines dieser Modelle kann heute Nacht in deinem Cluster sein, auf deiner eigenen Hardware, unter einer Lizenz, die du lesen kannst. Das andere kann von niemandem außerhalb seines Labors gekauft, gemietet oder heruntergeladen werden, und das Unternehmen hat nicht gesagt, wann sich das ändert. Diese Asymmetrie ist keine Fußnote zum Duell. Sie ist das Duell.
Was MiniMax H3 dir wirklich bietet
H3 wurde am 31. Juli 2026 angekündigt und am 3. August als Open Source veröffentlicht. Es ist ein allgemeines Modell und kein auf eine einzelne Aufgabe beschränkter Videogenerator: Es liest Text, Bilder, Video und Audio als Kontext und schreibt Videos von bis zu 15 Sekunden in bis zu 2K mit nativem Stereoton bei 32 kHz und 24 Bildern pro Sekunde. Sechs Seitenverhältnisse werden unterstützt (21:9 bis 9:16), und Dialoge werden in elf Sprachen stabil unterstützt. Es gibt zwei veröffentlichte Varianten der offenen Basis – H3-Base-FL2VA für Text-zu-Video sowie die Generierung aus dem ersten Frame, dem letzten Frame oder erstem und letztem Frame, und H3-Base-Ref2VA, die bis zu neun Bilder, drei Videoclips und drei Audioclips akzeptiert, begrenzt auf zwölf Eingabedateien.
Der Teil, der für diesen Vergleich zählt, ist, wo die offene Hälfte endet. Das vollständige H3-System ist eine dreistufige Pipeline: H3-Context-IR verarbeitet den Kontext vor und orchestriert ihn, H3-Base generiert mit 768p, und H3-Regenerate-2K hebt das Ergebnis auf 2K an. Nur die Gewichte von H3-Base sind öffentlich, und sie werden unter der MiniMax H3 Community License statt unter Apache oder MIT bereitgestellt – eine Lizenz mit Bedingungen, die man lesen sollte, bevor sie in einer kommerziellen Pipeline landet. Die Context-IR-Stufe und das 2K-Regenerationsmodul laufen auf der Seite von MiniMax. „Offene Gewichte“ bringen einem hier also die Mitte der Pipeline. Ein Team, das H3-Base herunterlädt und selbst hostet, bekommt 768p-Videogenerierung und keinen Weg zu 2K, ohne den Anbieter zu kontaktieren.

Was Odyssey-3 dir stattdessen bietet
Was Odyssey-3 Ihnen stattdessen bietet, ist eine Behauptung und eine Reihe von Demonstrationen. Odyssey beschreibt es als ein Foundation-Weltmodell, und die architektonischen Details, die es veröffentlicht hat, sind spezifisch genug, um später überprüfbar zu sein: ein autoregressiver Diffusions-Transformer, trainiert auf einer großen Sammlung visueller Beobachtungen der Welt, der laut dem Unternehmen ein erlerntes Verständnis von Physik, Dynamik, Ursache und Wirkung sowie menschlichem Verhalten hervorbringt. Die Aufgabenanpassung erfolgt durch das Anfügen eines Aktions-Decoders, der auf Beobachtungs-Aktions-Paaren trainiert wurde, während das vortrainierte Weltmodell eingefroren bleibt – eine kleine Policy liest die Repräsentationen des eingefrorenen Modells, anstatt das Modell selbst feinabzustimmen.
Die Demonstrationen erstrecken sich über sechs Embodiments. Roboterarme, nach Dutzenden Stunden Demonstrationen, einschließlich Recovery-Verhaltensweisen, die nicht in den Trainingsdaten enthalten waren – das Neuausrichten eines Greifers nach einem fehlgeschlagenen Greifversuch. Humanoide Policies, erstellt mit Flexion aus Dutzenden Stunden Teleoperationsdaten, die laut Odyssey besser generalisieren als die VLA-Baselines, gegen die Odyssey getestet hat, ohne eine Zahl zu veröffentlichen. Closed-Loop-Fahren, gelernt aus zwanzig Stunden simulierter Daten, in Indien gefahren. Hindernisvermeidender Drohnenflug in Innenräumen aus simulierten Daten. Spielumgebungen, einschließlich Policies, die in Grand Theft Auto V trainiert wurden und ohne zusätzliches Training in diesen Titeln auf Red Dead Redemption 2 und Sleeping Dogs übertragen wurden; etwa zwei Stunden GTA-Videomaterial reichten aus, um in RDR2 eine Reitbewegung zu erzeugen. Und Umgebungsgenerierung für das Training anderer KIs, verbunden mit der PROWL-Arbeit des Unternehmens zum Reinforcement Learning.
Die eine harte Zahl auf der Seite ist ein Vergleich mit echtem Filmmaterial: Odyssey berichtet, dass simulationsgeschulte Fahrpolitiken zwischen Eingriffen des Sicherheitsfahrers etwa 77 % so weit kamen wie Politiken, die auf echten Daten trainiert wurden. Das ist eine Herstellerangabe, nicht reproduziert, ohne technischen Bericht dahinter, und kein Dritter hat ein Ergebnis zu Odyssey-3 veröffentlicht. Es ist die Art von Zahl, die entscheidet, ob ein Weltmodell nützlich ist, und sie ist derzeit das Wort eines einzelnen Unternehmens.
Zwei Lock-ins, die sich überhaupt nicht ähnlich sehen
Es ist verlockend, MiniMax H3 als „den offenen“ und Odyssey-3 als „den geschlossenen“ einzuordnen, doch die Realität der Lizenzierung ist interessanter als das – und sie verläuft in beide Richtungen.
MiniMax H3 ist in der Mitte offen und an den Rändern geschlossen. Sie können den Generator halten, ihn untersuchen, feinabstimmen und ohne Netzwerkaufruf ausführen. Die Kontext-Orchestrierung, die es zu einem allgemeinen Modell macht, können Sie nicht halten, und den 2K-Schritt können Sie nicht halten. Wenn der Qualitätsanspruch Ihres Produkts von der Ausgabeauflösung abhängt, hat Ihre Open-Weights-Bereitstellung eine Obergrenze, die nur die gehostete Stufe des Anbieters anhebt.
Odyssey-3 ist auf jeder Ebene geschlossen, und die eigene Darstellung des Unternehmens ist der Grund, warum das seltsam ist. Ein Weltmodell, das auf Roboter, Drohnen und Fahrzeuge zugeschnitten ist, richtet sich an Käufer, die Inferenz auf Hardware ausführen, die sie selbst kontrollieren – Fabrikhallen, Testfahrzeuge, Luftfahrzeugzellen. Diese Käufer können keinen gehosteten Endpunkt für den Regelkreis nutzen; Latenz und Konnektivität schließen das aus. Also muss das Geschäftsmodell für ein Modell wie dieses Gewichte umfassen, sonst hat es keine Kunden in den Segmenten, die Odyssey immer wieder nennt. Das heutige Fehlen einer Lizenz ist weniger eine Absichtserklärung als die Aussage, dass die kommerziellen Bedingungen noch geschrieben werden. Odysseys Serie B über 310 Millionen Dollar, angekündigt im Juni 2026 bei einer Bewertung von 1,45 Milliarden Dollar, mit AWS als bevorzugter Cloud und Trainium als Compute-Substrat, ist der Kontext, in dem diese Bedingungen entschieden werden.
Dimension für Dimension
• Was dabei entsteht — MiniMax H3: ein gerenderter Clip, 4–15 s, bis zu 2K mit Stereo-Audio. Odyssey-3: ein simulierter Weltzustand plus motorische Aktionen für angeschlossene Hardware.
• Was Sie herunterladen können — MiniMax H3: H3-Base-Gewichte, Community-Lizenz, 768p. Odyssey-3: nichts; keine Gewichte, keine Lizenz, kein Repository.
• Was beim Anbieter bleibt — MiniMax H3: H3-Context-IR und H3-Regenerate-2K, die beiden Module, die es universell machen und 2K ermöglichen. Odyssey-3: alles.
• Preis — MiniMax H3: veröffentlichte Sekundentarife, etwa 0,08 $ bei 768p und 0,13 $ bei 2K, plus 0,05 $ pro Sekunde regenerierter Ausgabe (Angaben des Anbieters). Odyssey-3: nirgends veröffentlicht.
• Verfügbarkeit — MiniMax H3: seit 3. August 2026 geöffnet, jetzt aufrufbar. Odyssey-3: angekündigt am 15. September 2026, „in den kommenden Wochen“, kein Datum.
• Belege von Drittanbietern — MiniMax H3: In Bewertungen von Drittanbietern belegte er Platz eins beim Videoschnitt sowie Platz zwei oder drei bei Text-zu-Video und Bild-zu-Video. Odyssey-3: eine Herstellerangabe und überhaupt keine externen Durchläufe.
Wenn Sie diesen Monat etwas bauen müssen
Die praktische Konsequenz ist, dass nur eine dieser beiden Optionen eine Entscheidung ist, auf deren Grundlage Sie handeln können. MiniMax H3 wird auf OrcaRouter als minimax/minimax-h3 zum Listenpreis des Anbieters, mit 0 % Aufschlag geroutet – der Tarif des Anbieters ist also der Tarif, den Sie zahlen, und wenn MiniMax eine Zahl ändert, ändert sich Ihre Rechnung noch am selben Tag mit und nicht erst zur Verlängerung. Das fällt bei einem Videomodell mit Sekundenabrechnung stärker ins Gewicht als bei den meisten anderen Dingen, denn die Spanne von 768p bis 2K beträgt fast zwei zu eins, und der Unterschied zwischen einem Prototyp und einem Launch kann der Unterschied zwischen diesen beiden Stufen sein.
Es gibt einen zweiten Grund, hier zu einem Router zu greifen statt zu einer direkten Anbieterintegration. Die offene Hälfte von H3 ist für sich genommen wirklich nützlich, und die Teams, die sich am ehesten dafür interessieren, sind diejenigen mit GPUs und Meinungen dazu. Diese Teams landen in einem gemischten Setup: selbst gehostetes H3-Base für die Volumenarbeit, ein gehosteter Pfad für die 2K-Regenerierung und ein oder zwei andere Modelle für alles, was die Pipeline rund um das Video benötigt. Ein Schlüssel und automatisches Failover über Anbieter hinweg ist in dieser Form mehr wert als in einem Single-Model-Stack, und die Routing-DSL setzt die umgebenden Modelle — ein Prompt-Modell, ein Bildmodell für das Startbild, das Videomodell — zu einem einzigen Aufruf zusammen statt zu drei Integrationen.
Odyssey-3 wird, um es klar zu sagen, nicht von OrcaRouter oder von sonst jemandem geroutet. Es gibt keinen Endpunkt, zu dem geroutet werden könnte, und keinen Preis, der weitergegeben werden könnte. Dieser Artikel behauptet nichts anderes.
Die Frage, die es wert ist, beiden Anbietern gestellt zu werden
MiniMax hat die interessante Frage zu H3 bereits beantwortet, und die Antwort lautet: „die Mitte, bei 768p, unter unserer Lizenz.“ Wenn Sie H3 evaluieren, sollten Sie testen, ob die offene Basis plus Ihre eigene Infrastruktur den gehosteten 2K-Pfad bei den Kosten pro nutzbarer Sekunde schlägt – und das, bevor Sie eine Produktaussage auf 2K-Ausgabe stützen.
Odyssey hat seine Version noch nicht beantwortet. Wenn das Release-Fenster schließt, ist die erste Frage kein Benchmark, sondern eine Lizenz: Welche dieser sechs Embodiments ist ein unterstütztes Deployment, auf wessen Hardware, zu welchem Preis, und ob der Action-Decoder, der ein eingefrorenes Weltmodell dazu bringt, einen Roboterarm zu steuern, etwas ist, das ein Kunde trainiert, oder etwas, das Odyssey ausliefert. Ein Weltmodell, das mit einem einzigen Backbone Roboterarme, Humanoide, Autos, Drohnen und drei Spiele erreicht, ist eine Allgemeinheitsbehauptung, und Allgemeinheit ist genau das, was daraus ein Foundation-Modell statt einer Policy macht — und genau deshalb werden die kommerziellen Bedingungen, nicht das Demo-Reel, entscheiden, wer es nutzen kann.

Bis dahin lautet die ehrliche Anzeigetafel: ein Modell, das man pullen kann, ein Modell, das man beobachten kann. Achte zuerst auf ein Repository und eine Lizenz und erst danach auf einen Benchmark – in dieser Reihenfolge, denn ohne die ersten beiden ist der dritte nicht verifizierbar.

Stellen Sie die gesamte Pipeline hinter einen einzigen API-Schlüssel mit automatischem Failover anstelle von drei separaten Integrationen.
