So verwenden Sie MiniMax H3-1
Guides & Insights

So verwenden Sie MiniMax H3: Prompts, lokale Ausführungen und Audio, das kein Müll ist

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 4. August lud Simon Willison etwa 115 GB an Gewichten herunter, richtete einen inoffiziellen MLX-Port von MiniMax H3 auf sein M5 Max MacBook Pro und bat um ein regenbogenfarbenes Stinktier, das über einen moosbedeckten Baumstamm in einem Supermarkt springt. Knapp 45 Minuten später hatte er einen Clip, den er als wirklich beeindruckend beschrieb – mit einer Audiospur, die er als seltsamen, sprachähnlichen Müll beschrieb. Seine eigene Diagnose war der nützliche Teil: Er hatte dem Modell keine Audio-Anweisungen gegeben und den Prompting-Leitfaden vorher nicht gelesen. Das ist die kürzestmögliche Zusammenfassung dessen, wie es ist, mit H3 anzufangen, das auch als Hailuo 3.0 verkauft wird. Das Bild kommt mehr oder weniger kostenlos mit. Alles andere – den Ton, das Timing der Einstellungen, die 2K-Auflösung, die Figur, die vier Einstellungen in Folge überleben muss – muss man explizit anfordern, in einem Format, das strengere Anforderungen stellt als fast jedes andere derzeit verwendete Videomodell.

Dies ist eine Nutzungsanleitung, keine Startberichterstattung. Drei Quellenebenen durchziehen das Dokument, und sie sind jedes Mal gekennzeichnet: des Unternehmens eigene Dokumentation (die Modellkarte, die beiden im Repository enthaltenen Leitfäden zum Verfassen von Prompts, die API-Dokumentation der Plattform); Community-Ergebnisse von Menschen, die es tatsächlich ausgeführt haben — die Betreuer von ComfyUI, unabhängige Benchmark-Tester, Wiederverkäufer-Dokumente und Hugging-Face-Diskussionsthreads, alle datiert zwischen dem 31. Juli und dem 5. August 2026; sowie eine kleine Anzahl von Stellen, an denen wir selbst eine Primärdatei gelesen haben und dies auch angeben. Community-Zahlen sind Einzelberichte auf nicht kontrollierter Hardware, sofern nicht anders angegeben. Wo Praktiker untereinander uneins sind, wird die Uneinigkeit berichtet und nicht aufgelöst.

Vor allem anderen: Du führst wahrscheinlich nicht das gesamte Modell aus.

Ein Großteil der Verwirrung in der ersten Woche von H3 geht auf eine strukturelle Tatsache zurück, die der Marketingtext verschleiert. H3 ist kein einzelnes Modell. Laut seinem Modellblatt handelt es sich um ein dreiteiliges System, und nur der mittlere Teil wurde als Open Source veröffentlicht:

H3-Context-IR — ein multimodaler Anweisungs-Präprozessor. Er liest Ihren Text, Ihre Bilder, Audio und Video, analysiert, wie sie zueinander in Beziehung stehen, und erzeugt eine strukturierte, semantisch angereicherte Darstellung dessen, was Sie angefordert haben. Nur als gehostete API verfügbar. Er wird als eigener Aufgabentyp bereitgestellt, der einen angereicherten Prompt und überhaupt kein Video zurückgibt.

H3-Base — das 33B-Parameter-Generierungsmodell, das tatsächlich Frames und Ton erzeugt. Dies ist der Teil mit offenen Gewichten.

H3-Regenerate-2K — ein In-Context-Regenerationsdurchlauf, der das 768p-Ergebnis auf 2K bringt. Nur als gehostete API.

Zwei Konsequenzen ergeben sich unmittelbar, und sie bestimmen deinen gesamten Workflow. Erstens ist die lokale Generierung eine 768p-Obergrenze. H3s native Leinwand ist eine 768-Pixel-Kurzseite, begrenzt auf 768×1344 – also etwa 1344×768 bei 16:9. Wenn deine ComfyUI-Ausgabe nicht 2K ist, ist nichts kaputt; das Paket, das du heruntergeladen hast, ist H3-Base, und das Upscaling-Modul ist nicht darin enthalten. Zweitens wird die gehostete API einen schlampigen Prompt korrigieren, deine lokale Installation jedoch nicht. Alles, was Context-IR bei einem kostenpflichtigen API-Aufruf tut – Struktur abzuleiten, zu klären, welche Referenz was bedeutet, und die Teile auszufüllen, die du vage gelassen hast – ist ein Schritt, den du nun von Hand oder mit einem anderen Modell ausführst, bevor H3-Base deine Worte überhaupt sieht. Diese einzelne Asymmetrie erklärt die meisten Berichte, dass „Derselbe Prompt funktioniert auf Hailuo, sieht in ComfyUI aber kaputt aus.“

How to Use MiniMax H3-2

Erwähnenswert aus dem Repository selbst: Die Gewichte tragen das Label minimax-h3-community-license-agreement statt Apache oder MIT (dazu weiter unten mehr, denn genau das entscheidet, ob man das Modell überhaupt ausliefern darf); das Modell ist mit 33B Parametern in F32/BF16 gelistet, und aktuell wird es von genau einem Inferenzanbieter — fal — angeboten. 23 Finetunes, 20 Quantisierungen und 31 Spaces existieren bereits darauf aufbauend, ein deutliches Zeichen dafür, wie schnell sich die Community bewegt hat.

Das Prompt-Format: Shot-Blöcke, keine Timecodes

Hier stehen die Community und die Dokumentation offen im Widerspruch zueinander, und das ist wichtiger als jeder andere einzelne Punkt in diesem Artikel.

Die Vorlage, die sich am schnellsten verbreitete – über Reddit, dann in mehrere veröffentlichte Anleitungen – unterteilt den Clip in Zeitcode-Klammern: [0s-2s], [2s-5s], und so weiter, gefolgt von einer Struktur aus sechs Blöcken: Stilkontrakt, Zeitplan, Kamera, Audio, ausgeschriebenem Text und einer Negativliste. Sie wurde durch das Lesen der 45 vom Unternehmen mitgelieferten Beispiel-Prompts rekonstruiert, und sie ist kein Unsinn: Diese Beispiele sind tatsächlich Einstellungslisten mit einem beigefügten Sound-Cue-Blatt, mit einer Medianlänge von etwa 130 chinesischen Zeichen, und die längsten erreichen 657 und 858 Zeichen.

Aber die eigene VIDEO_PROMPT_WRITING_GUIDE_base_en.md, die im docs-Ordner des Repositories liegt, schreibt etwas anderes vor. Sie organisiert nach Einstellungsblöcken, nicht nach Zeitbereichen. Wir haben sie direkt gelesen; die Struktur, die sie verlangt, ist:

Anweisung — Regeln zur Bildausrichtung, die für die Keyframe-Modi (I2VA, FL2VA, L2VA) verwendet und bei reinem Text-zu-Video weggelassen werden.

Integrierte multimodale Beschreibung — der Hauptteil, unterteilt in [Einstellung 1], [Einstellung 2], und so weiter.

Gesamtklanglandschaft — ein bis vier Sätze diegetischen Sounds.

nicht_diegetische_Musik — ein bis drei Sätze zum Score.

Darin sind die Konventionen spezifisch genug, um überprüfbar zu sein. [Shot 1] erhält überhaupt keinen Zeitstempel — nachfolgende Einstellungen beginnen mit einem absoluten Schnitt, formuliert wie „At 00:03.500, the camera cuts to…“. Kamerabewegungen werden als Bewegungstyp plus Amplitude plus Geschwindigkeit geschrieben, in natürliches Englisch eingebettet statt als Labels aneinandergereiht: ein langsamer Push-in mit kleiner Amplitude, nicht camera: dolly-in, slow. Die verfügbaren Bewegungen sind die gängige Auswahl — Zoom, Schwenk, Neigung, Fahrt, Bogenfahrt, POV und Verwackeln in leichten oder starken Varianten. Dialoge sind in Tags eingefasst: <d>[English] Get in the car.</d>, wobei die Zeichensetzung exakt erhalten bleibt und niemals übersetzt oder paraphrasiert wird. Sprecher erhalten stabile IDs — (S1), (S2) und (S1,S2) für eine gemeinsame Zeile — wobei Alter, Geschlecht, Stimmfarbe und Akzent beim ersten Auftreten beschrieben werden. Voiceover wird als Off-Screen-Zeile markiert, mit einem expliziten Hinweis, dass die Lippen geschlossen bleiben — so verhindert man, dass das Modell eine Narration lippensynchron auf ein Gesicht animiert. Parallel geschnittene Dialoge verwenden einen <scenetrans>-Marker plus eine Kontinuitätsangabe.

Die ausdrücklichen Verbote des Leitfadens sind genauso aufschlussreich wie seine Regeln: versehe den ersten Schuss nicht mit einem Zeitstempel, wiederhole keinen Dialog, keinen Gesang und keine On-Screen-Musik in overall_soundscape, verwende keine abstrakten Stimmungswörter in non_diegetic_music, und schreibe nie eine Dialogzeile um. Und eine bemerkenswerte Abwesenheit – der offizielle Leitfaden hat überhaupt keinen Negative-Prompt-Abschnitt, was bedeutet, dass die Liste „Verbotene Übergänge“ in der beliebten Community-Vorlage eine Erfindung der Community ist, kein dokumentiertes Feature.

Wie ernst sollte man den Konflikt nehmen? In einer Hugging-Face-Diskussion zum H3-Repository postete ein Community-Mitglied die Struktur im Zeitcode-Stil als Leitfaden, und ein anderer Praktiker antwortete unverblümt, er habe eine ähnliche Struktur verwendet, sie sei völlig falsch, und man solle stattdessen das mitgelieferte Handbuch lesen. Das ist eine Person, die einer anderen widerspricht, keine Entscheidung eines Maintainers. Unsere Einschätzung der Beweislage: beide funktionieren über die gehostete API, weil Context-IR normalisiert, was auch immer man ihm sendet; nur das dokumentierte Format ist bei direkter Nutzung von H3-Base zuverlässig. Wenn Sie lokale Gewichte verwenden, halten Sie sich an die Datei im Repository. Wenn Sie die API nutzen und ein Prompt im Zeitcode-Stil gute Clips liefert, übernimmt der Preprocessor diese Arbeit für Sie, und Sie sollten nicht zu dem Schluss kommen, dass das Format dafür verantwortlich ist.

Kompilieren eines trägen Briefings in H3s Dialekt

Nehmen Sie Willisons Zwölf-Wörter-Prompt als Eingabe — ein regenbogenfarbenes Stinktier, das in einem Supermarkt über einen moosbedeckten Baumstamm springt. Auf die dokumentierte Art geschrieben, ergibt das ungefähr: ein [Shot 1]-Block, der zuerst den Stil (Live-Action, Handkamera, Leuchtstofflicht) und die Einstellung (ein Supermarktgang, ein moosbedeckter Baumstamm quer über dem Linoleum, zurückweichende Regale) benennt, dann das Subjekt und die Handlung in physischer Reihenfolge — zwei Anlaufschritte, ein Einkauern, der Sprung, die Landung — wobei die Kamera eine langsame Kamerafahrt mit geringer Amplitude ausführt, die auf der anderen Seite des Baumstamms endet; eine overall_soundscape aus Krallen auf Linoleum, dem feuchten Scharren des Baumstamms, dem Summen der Kühlanlage und fernen Einkaufswagenrädern; und eine non_diegetic_music-Zeile mit einem kurzen, leichten Einsatz gezupfter Saiten ohne Gesang. Nichts davon ist kreatives Genie. Es ist dieselbe Idee, nur dass die vier Dinge, die H3 verlangt, tatsächlich geliefert werden — und es ist der Unterschied zwischen einem nicht angeforderten Raumton und einem Soundtrack, den Sie entworfen haben.

Dieser Schritt ist mechanisch, repetitiv und eine denkbar schlechte Aufgabe für einen Menschen – genau deshalb hat das Unternehmen ein Werkzeug dafür herausgebracht, das fast keine Berichterstattung aufgegriffen hat. Das Repository enthält ein skills-Verzeichnis mit neun Agenten-Fähigkeiten, und die erste – h3-prompt-writing – macht genau das: sie nimmt eine Anfrage und schreibt einen strukturierten H3-Prompt in allen fünf Generierungsmodi, einschließlich der Abschnitte für Soundscape und Musik. Die anderen acht sind Genre-Rezepte (Produktwerbung, 3D-Animationskurzfilm, Papercraft-Erklärvideo, Musikvideo-Untertitel, Koop-Spiel-Intro, handgezeichneter Live-Action-Hybrid und so weiter), die dasselbe Format in einen Workflow verpacken.

Um diese Fähigkeit auszuführen, wird ein Textmodell benötigt, kein Videomodell, und genau hier ist ein Router wirklich nützlich statt eines Plug-ins. Das eigene LLM des Unternehmens, MiniMax M3, ist eine sinnvolle Wahl für diese Aufgabe und ist auf OrcaRouter für 0,30 $ pro Million Eingabe-Tokens und 1,20 $ pro Million Ausgabe-Tokens verfügbar – Listenpreis des Anbieters, da wir ihn mit 0 % Aufschlag durchreichen – mit einem Kontextfenster von 1M Tokens und, ungewöhnlicherweise, Video als akzeptiertem Eingabetyp. Genau dieses letzte Detail macht es passend: Du kannst ihm den offiziellen Prompt-Leitfaden, dein Briefing und einen echten Referenzclip in einem einzigen Aufruf übergeben und erhältst den [Shot N] Block, der es beschreibt. Das Erstellen eines Prompts kostet einen Bruchteil eines Cents gegenüber der Videogenerierung, die pro Sekunde abgerechnet wird, also gibt es keinen Grund, diese von Hand zu schreiben. Zwei ehrliche Einschränkungen: Die H3-Videogenerierung selbst läuft nicht auf OrcaRouter – die Clips stammen von der Plattform des Unternehmens, von fal oder von deiner eigenen GPU – und der Kompilierungsschritt ist eine Annehmlichkeit, keine Qualitätsgarantie. Was dir der Router hier bringt, ist: Die Textseite der Pipeline sitzt hinter einem einzigen Schlüssel mit automatischem Failover, sodass ein Provider-Ausfall mitten im Batch keine Render-Warteschlange strandet, und das Ersetzen von M3 durch ein anderes Modell, um kompilierte Prompts zu vergleichen, ist eine Änderung einer Zeichenkette und kein neuer Vertrag.

How to Use MiniMax H3-3

Beim Audio verlieren alle den ersten Tag.

Der am besten belegte Fehlermodus in der ersten Woche ist der, auf den Willison gestoßen ist: Geben Sie den Ton nicht vor, und H3 erfindet etwas, und zwar schlecht. Er erhielt sprachähnliches Rauschen aus einem Prompt ohne Audio-Anweisung. Der Reverse-Engineering-Bericht zu den offiziellen Beispielen beschreibt dieselbe Fehlerklasse in gemilderter Form — lässt man den Audioblock weg, liefert das Modell einen nicht angeforderten Raumton — und deutet diese als Abwesenheiten statt als Fehler, was die richtige Art ist, über ein gemeinsames Audio-Video-Modell nachzudenken. Es erzeugt immer einen Soundtrack. Ihre einzige Wahl ist, ob Sie ihn vorgeben.

Bündelt man die Hinweise aus dem offiziellen Prompt-Leitfaden mit dem, was Händlerdokumentationen und Rezensenten als tatsächlich funktionierend melden:

Dialog ist das Schwierigste, worum man bitten kann. Halten Sie gesprochene Zeilen auf ein oder zwei Sätze pro fünf Sekunden Clip. Zu lange Zeilen erzeugen hastigen Vortrag, Audio, das über das letzte Bild hinausläuft, oder angestrengte Lippensynchronisation — wie von Prüfern durchgängig berichtet wird.

Beschreiben Sie den Sprecher vor der Zeile und die Sprechweise dazu. Alter, Geschlecht, Klangfarbe und Akzent beim ersten Auftreten gemäß dem offiziellen Leitfaden; einfache, direkte Sprechhinweise (deutlich, warm, flach) anstelle ausführlicher Regieanweisungen, da diese Berichten zufolge die Synchronität beeinträchtigen.

Binden Sie jeden Effekt an ein sichtbares Ereignis."Ein Korkenknall genau dann, wenn der Korken fliegt" statt "Sound: ein Knall". Die Wörter as, when und then sind es, die die Synchronisation tragen.

Beschreibe Musik kurz nach Genre, Tempo, Stimmung und Instrumentierung — niemals nach Künstler oder Song. Füge „no vocals" hinzu, wenn das Bild im Vordergrund stehen soll; das ist eine dokumentierte Methode, um den Mix sauber zu halten.

Atmosphäre in einem Satz schichten. Regen auf Glas, ein leises Gesprächsgemurmel, gelegentliches Tassenklirren, sanfter Hintergrund-Jazz — in einem einzigen Satz geschichtet statt aufgelistet.

Wiederholen Sie keinen Dialog im Soundscape-Abschnitt. Ein ausdrückliches Verbot im offiziellen Leitfaden; die Abschnitte sollen überschneidungsfrei sein, und eine Zeile dort zu wiederholen ist ein Weg, sie doppelt zu bekommen.

Wenn ein Wort auf dem Bildschirm lesbar sein muss, tippen Sie das Wort in Anführungszeichen. Rezensenten berichten, dass klar angegebene Zeichenfolgen sauber gerendert werden, während vage Anfragen („HUD-Elemente“, „ein Schild“) als buchstabenförmiges Rauschen zurückkommen.

Wo der Ton laut mehreren Rezensenten wirklich überzeugt, sind konkrete physische Geräusche – Foley und Effekte, die an etwas Sichtbares gebunden sind – sowie Atmosphäre. Bei abstrakten oder atmosphärischen Anfragen ist er schwächer. Szenen mit mehreren Sprechern müssen häufig bearbeitet werden, um die Sprecherreihenfolge richtig hinzubekommen, und die Aussprachequalität variiert je nach Sprache – testen Sie Ihre Zielsprache also an einem Wegwerf-Clip, bevor Sie ein Projekt darauf festlegen. Mehrere Rezensenten weisen auch auf die ehrliche Obergrenze hin: Der Ton ist gut genug für die Verbreitung in sozialen Medien, aber im Allgemeinen nicht gut genug, um ohne Austausch als Broadcast- oder Werbemix ausgeliefert zu werden. Das ist keine Herstellervorgabe, sondern das, was Praktiker berichten.

Referenzen: Gib jeder Datei eine Aufgabe.

Das Referenzsystem von H3 ist sein stärkstes Unterscheidungsmerkmal und die Stelle, an der Einrichtungsfehler am häufigsten auftreten. Die dokumentierten Grenzwerte aus der Plattform-API-Dokumentation: bis zu 9 Bilder, 3 Videoclips und 3 Audioclips, begrenzt auf insgesamt 12 Dateien, wobei jedes Referenzvideo oder Referenzaudio zwischen 2 und 15 Sekunden lang sein muss und die Gesamtdauer aller zusammen 15 Sekunden nicht überschreiten darf. Reference-to-video erfordert mindestens ein Bild oder Video; Audio allein wird nicht akzeptiert.

Die Technik, auf die sich sowohl der offizielle Referenzleitfaden als auch Berichte aus der Community einigen, besteht darin, jede Eingabe zu taggen und ihr eine Aufgabe zuzuweisen. Referenzieren Sie per Tag in der genauen Reihenfolge, in der die Dateien angehängt wurden — <Picture 1>, <Video 1>, <Audio 1> — und geben Sie dann im Prompt an, welche Referenz welche Eigenschaft steuert: Identität, Stil, Bewegung, Kamera oder Stimme. Die offiziellen Beispiel-Prompts beginnen genau auf diese Weise und erklären, dass Bild eins die Referenz für Gesamtstimmung und Stil ist und Bild zwei die Hauptfigur. Praktiker berichten, dass explizite Zuweisung erheblich besser funktioniert, als neun Bilder zu laden und zu hoffen.

Zwei Details, die Leute Renderings kosten:

<Picture 1> ist kein Moodboard — es ist buchstäblich der erste Frame bei 0.000 Sekunden, und er gehört zu [Shot 1]. Beschreibe, was darauf zu sehen ist (Stil, Motive, Komposition, Szenenanker), bevor du die Handlung beschreibst, die daraus folgt. Behandle es als ein Standbild, das du animierst, nicht als Hinweis.

Es gibt zwei getrennte Checkpoints, und die Verwendung des falschen schlägt stillschweigend fehl. fl2va übernimmt Text-zu-Video- und Erst-/Letztframe-Arbeiten; ref2va übernimmt Referenz-zu-Video. Dies ist der am häufigsten gemeldete ComfyUI-Fehler: Der R2V-Graph läuft, während das FL2VA-Modell noch ausgewählt ist. Wissenswert ist auch, dass ein Kommentator unter der ComfyUI-Ankündigung darauf hinweist, dass die mitgelieferte R2V-Vorlage nur zwei Bildreferenz-Slots bereitstellt, obwohl das Modell neun akzeptiert — eine Einschränkung der Vorlage, nicht des Modells.

Auf der gehosteten Seite gibt es zwei weitere Praxishinweise aus der Reseller-Dokumentation: der ratio-Parameter ist auf ref2va-Endpunkten erforderlich und kann nicht auf „adaptive“ gesetzt werden, und überlappende Jobs geben bei Aufgabenparallelität eine 429 zurück, anstatt in die Warteschlange zu gehen — also Stapel sequenziell verarbeiten oder eine eigene Warteschlange aufbauen. Lokal ref_image_size steht standardmäßig auf match, was schneller ist; max erhält eine Kurzseite von bis zu 2048 Pixeln der Referenz und kostet Zeit.

Was ein lokaler Lauf tatsächlich an Wanduhrzeit kostet

Das vollständige offizielle Repository zu laden umfasst 498 GB, und der von ComfyUI neu verpackte Mirror umfasst 343 GB. Sie benötigen keines davon vollständig. Die vier Dateien, die ComfyUIs eigenes Tutorial für Text-zu-Video und Bild-zu-Video auflistet, ergeben zusammen etwa 42,5 GB:

Diffusionsmodellminimax_h3_fl2va_pruned_int8_convrot.safetensors, 20,97 GB, in models/diffusion_models.

Text-Encoderqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors, 15,69 GB, in models/text_encoders.

Video VAEminimax_h3_video_vae_fp16.safetensors, 5.21 GB, in models/vae.

Audio VAEminimax_h3_audio_vae_fp32.safetensors, 0,61 GB, ebenfalls in models/vae.

Für Referenz-zu-Video hinzufügenminimax_h3_ref2va_pruned_int8_convrot.safetensors, weitere 20,97 GB.

Die 42,5 GB sind kein VRAM-Wert – es ist Festplattenspeicher, und die Teile werden gestreamt und ausgelagert. Dass das Modell überhaupt auf Consumer-Karten passt, ist ein von ComfyUI dokumentierter technischer Kniff: Etwa 40 % der Parameter befinden sich in AdaLN-Modulationszweigen, deren Ausgaben vorab berechnet und durch funktional äquivalente Nachschlagetabellen ersetzt werden können, wodurch das geladene Modell von 33,12B auf etwa 20,11B reduziert wird – laut ComfyUI ohne Qualitätsverlust. Volle Präzision würde 123,6 GB entsprechen. Unpruned-int8-Checkpoints (je 34,04 GB) und bf16-Checkpoints (je 66,28 GB) existieren, wenn man Feintuning betreibt oder die letzten paar Prozent an Wiedergabetreue anstrebt.

ComfyUI 0.30.0 oder neuer ist erforderlich und wird mit drei Vorlagen ausgeliefert: T2V, I2V und R2V. Die Grundkonfiguration, auf die sich alle Leitfäden und Maintainer für einen ersten Lauf einigen, ist bewusst klein: 16:9 bei 0,4 MP (864×480), 5 Sekunden, 20 Schritte, res_multistep-Sampler mit dem simple-Scheduler, denoise 1.0, batch 1. Holen Sie sich eine MP4-Datei, die sowohl Video als auch Stereo-Audio enthält, bevor Sie Auflösung oder Länge anfassen. Eine arithmetische Besonderheit, die Sie erwarten sollten: Dauern rasten auf ein 17k+5-Frame-Raster ein, sodass eine 5-Sekunden-Anfrage 124 Frames wird – etwa 5,17 Sekunden bei 24 fps – und eine 10-Sekunden-Anfrage bei 243 Frames oder 10,125 Sekunden landet. Anfragen im Bereich von 5–15 Sekunden sind die sicherere Zone.

How to Use MiniMax H3-4

Was das in Echtzeit kostet, laut Community-Berichten (alles Einzelläufe, unkontrolliert, mit unterschiedlichen Einstellungen – das Diagramm oben zeigt jede Konfiguration neben ihrem Balken): Eine RTX 3060 mit 12 GB, 32 GB Arbeitsspeicher und einer schnellen NVMe schloss die Basislinie mit 864×480, 124 Frames und 20 Schritten in unter neun Minuten mit dynamischem Offloading ab. Ein 16-GB-RTX-4090-Laptop mit aktiviertem SageAttention erledigte 960×540, 5 Sekunden, 20 Schritte in 182 Sekunden. Ein NVFP4-Build auf einer einzelnen RTX 5090 erzeugte einen 243-Frame-Clip (10,1 s) mit 864×480 bei 10 Schritten in 175 Sekunden und erreichte einen Spitzenwert von 26,9 GiB VRAM bei nur 31,7 GB Dateien auf der Festplatte. SGLangs eigene Kochbuch-Referenz – 1344×768, 124 Frames, 50 Schritte auf zwei RTX 5090s mit schichtweisem Offloading – dauerte 559,67 Sekunden. Und der Apple-Silicon-Weg, über den inoffiziellen MLX-Port, dauerte für einen einzelnen Clip knapp unter 45 Minuten.

Praktische Hinweise, die aus diesen Berichten destilliert wurden:

System-RAM und Festplattengeschwindigkeit sind tragend, nicht optional. Bei einer 12-GB-Karte überschreiten die ausgewählten Dateien den VRAM konstruktionsbedingt, sodass der Auslagerungspfad über den RAM und dann die SSD verläuft. 32 GB RAM erscheinen in beiden erfolgreichen Low-VRAM-Berichten. Es gibt kein bestätigtes 8-GB-Ergebnis.

SageAttention ist die einzige kostenlose Beschleunigung — etwa 2× laut ComfyUI, weniger, wenn Ihr Durchlauf von Offload-Traffic dominiert wird. Installieren Sie das Wheel, das exakt zu Ihrem PyTorch- und CUDA-Build passt, sowie ComfyUI-KJNodes, dann platzieren Sie Patch Sage Attention KJ zwischen dem UNET-Loader und dem Guider und stellen Sie es auf Auto. Erwarten Sie Warnungen, dass einige H3-Schichten nicht FP16/BF16 sind; dieser Fallback ist dokumentiert und normal.

Schritte sind verhandelbar.Der 5090-Benchmark lief mit 10 und die ComfyUI-Baseline läuft mit 20, während die SGLang-Referenzkonfiguration 50 verwendet. Niemand hat eine Qualitätskurve pro Schritt veröffentlicht, also finde deine eigene Untergrenze, bevor du annimmst, dass du 50 brauchst.

Ändern Sie bei OOM jeweils nur eine Variable. Die dokumentierte Wiederherstellung besteht darin, auf 0,4 MP, 5 Sekunden und Batch 1 zurückzugehen und pro Versuch nur einen einzigen Regler zu bewegen.

Stiller Ton bedeutet, dass der Audio-VAE nicht mit dem Video-Ausgabeknoten verbunden ist. Ein deutlicher Fehler, der sich von schlechtem Ton unterscheidet, und leicht als Weigerung des Modells fehlgedeutet werden kann, Ton zu erzeugen.

Apple Silicon ist inoffiziell. Willisons Weg war PipeNetwork/minimax-h3-mlx, ein Community-Port, ausgeführt über uv gegen eine MLX-Requirements-Datei. Die eigenen Unterlagen des Unternehmens nennen SGLang, vLLM, Diffusers und ComfyUI, mit einer typischen Bereitstellung von vier GPUs in BF16, und sagen nichts über Metal oder MPS. Betrachten Sie den Mac-Support als von der Community gepflegt.

Lokal versus gehostet, mit den Zahlen.

Da das 2K-Modul und der Prompt-Präprozessor nur gehostet werden, ist dies kein echtes Entweder-oder. Das Muster, auf das die Architektur hinarbeitet, ist: iteriere lokal mit 768p, wo jeder Versuch Strom und drei Minuten kostet, und kaufe dann das Endergebnis. Eine Gebühr pro Sekunde ist für die Aufnahme, die du behältst, in Ordnung, aber ruinös für die vierzig, die du wegwirfst.

Was den Preis angeht, ist Vorsicht geboten, denn er variiert je nach Anbieter um etwa das Doppelte, und der eigene Blogbeitrag des Anbieters nennt keinen Dollarbetrag – nur dass 2K bei weniger als einem Drittel des Preises von Mainstream-Modellen liegt und 768p bei weniger als der Hälfte des Preises konkurrierender 720p-Modelle. Was konkret veröffentlicht ist: fal, derzeit der einzige im Hugging-Face-Repo gelistete Inferenzanbieter, verlangt$0,16 pro Sekunde bei 768p und $0,26 pro Sekunde bei 2K. Sekundäre Tracking-Dienste berichten, dass der eigene Listenpreis des Unternehmens deutlich niedriger liegt – etwa$0,09–$0,10 pro Sekunde bei 768p und $0,13–$0,14 pro Sekunde bei 2K – und sie stimmen nicht bis auf den Cent miteinander überein, also sollte man diese als Richtwerte behandeln und die Preisgestaltungsseite der Plattform prüfen, bevor man ein Budget plant. Außerdem sollte man einkalkulieren, dass ein Referenzvideo sowohl mit seiner eigenen Dauer als auch mit dem generierten Output abgerechnet wird.

Rechnen wir es mit einer echten Zahl durch. Hundert verwertbare Clips à acht Sekunden ergeben 800 generierte Sekunden: etwa 112 $ bei einem 2K-Preis von 0,14 $, grob 208 $ bei fal's 0,26 $ und ungefähr 76 $, wenn du in 768p zum niedrigen Listenpreis auslieferst. Die vierzig verworfenen Clips pro verwertetem Clip entscheiden über die Rechnung, und genau diese sollten lokal generiert werden. Das ist auch der Grund, den Preis, den du vergleichst, ehrlich zu halten — bei OrcaRouter wird die Textseite dieser Pipeline zum Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht, sodass eine Preissenkung eines Anbieters noch am selben Tag live ist und nicht erst nach einer Margen-Neuberechnung. Die Videogenerierung ist, wie gesagt, nicht unsere; es geht nur darum, dass der Kompilierungsschritt nicht der Posten sein sollte, über den du nachdenken musst.

Lies die Lizenz, bevor du ein Produkt darauf aufbaust.

Dies ist der Teil, den die meisten „How to use“-Anleitungen auslassen – und für viele Leser ist es der einzige Teil, der eine Entscheidung ändert. Wir haben die LICENSE-Datei direkt im Repository gelesen. Die Gewichte werden unter der H3 Community License Agreement ausgeliefert, nicht unter einer Open-Source-Lizenz, und sie enthält Bedingungen, die ungewöhnlich genug sind, um sie inhaltlich zu zitieren:

Gebiet. Die Lizenz definiert ihr „Anwendbares Gebiet“ als weltweit, ausgenommen die Europäische Union, das Vereinigte Königreich, die Republik Korea und die Vereinigten Staaten von Amerika. Versteht man es wörtlich, schließt das einen großen Teil der Personen aus, die derzeit Ergebnisse lokaler Generierung veröffentlichen – und die Beschränkung ist darauf ausgelegt, die Ausgaben zu erfassen, nicht nur die Gewichte.

Namensnennung. Die kommerzielle Nutzung erfordert das Anzeigen von „H3" auf der Benutzeroberfläche des Produkts; die Lizenz empfiehlt außerdem einen „Powered by H3"-Hinweis.

Umsatzschwelle. Organisationen, die mit darauf aufbauenden Produkten oder Dienstleistungen über 20 Millionen Dollar pro Jahr erwirtschaften, müssen eine separate schriftliche Genehmigung des Unternehmens einholen.

Keine Destillation. Sie dürfen H3 oder seine Ausgaben nicht verwenden, um ein anderes KI-Modell zu verbessern, außer H3-Derivaten. Das schließt das übliche Vorgehen mit synthetischen Daten aus.

Anwendbares Recht. Sonderverwaltungszone Hongkong, mit ausschließlicher Zuständigkeit der Gerichte Hongkongs.

Eine wirklich offene Komponente. Der Qwen3-VL-32B-Textencoder ist Apache 2.0; die obigen Einschränkungen gelten für die H3-Gewichte.

Wir sind nicht Ihre Anwälte und dies ist keine Rechtsberatung — lesen Sie die Lizenz und das Q&A-Dokument, das das Unternehmen mitliefert, und wenn Sie in einem ausgeschlossenen Gebiet kommerziell tätig werden, holen Sie sich anwaltlichen Rat, statt die Lesart eines Blogs zu übernehmen. Die praktische Weichenstellung: Die gehostete API ist eine andere Transaktion mit anderen Bedingungen als die Community-Lizenz für die Gewichte; wenn die lokale Lizenz also nicht für Sie funktioniert, steht Ihnen der API-Weg möglicherweise weiterhin offen. Prüfen Sie die Bedingungen der Plattform, bei der Sie kaufen.

Ein Testplan für die erste Woche

Fünf Läufe in dieser Reihenfolge genügen, um zu wissen, ob H3 in Ihre Pipeline gehört:

Lauf 1 — die Leitungen testen.T2V-Vorlage, 864×480, 5 Sekunden, 20 Schritte, res_multistep/simple. Das Erfolgskriterium ist eine MP4 mit Stereo-Audio darin, kein guter Clip.

Lauf 2 — beweisen Sie, dass das Format wichtig ist. Dasselbe Motiv zweimal: einmal als lockere einzeilige Beschreibung, einmal geschrieben als [Einstellung 1] plus Gesamtklanglandschaft plus nicht-diegetische Musik. Wenn das zweite nicht deutlich besser als H3-Base ist, stimmt etwas an deinem Setup nicht.

Run 3 — eine Dialogzeile. Ein Sprecher, ein Satz, beschriebene Sprechweise, fünf Sekunden. Das ist der schnellste Gradmesser dafür, ob das Audio für deine Zwecke gut genug ist und wie deine Zielsprache ausgesprochen wird.

Run 4 — Referenzdisziplin. R2V mit dem ref2va-Checkpoint, zwei oder drei Referenzen, jede explizit gekennzeichnet und mit einer Aufgabe versehen, wobei <Picture 1> als das tatsächliche erste Frame beschrieben wird. Dann brich es absichtlich: hänge dieselben Referenzen ohne Zuweisungen an und vergleiche.

Durchlauf 5 — der Abschluss. Bring deinen besten lokalen 768p-Prompt zur gehosteten API bei 2K und sieh, was Context-IR und der Regenerationsdurchgang hinzufügen. Dieses Delta ist das, was man mit dem Preis pro Sekunde kauft, und es ist der einzige Weg, den Hybrid-Workflow ehrlich zu bepreisen.

FAQ

Kann ich 2K aus den lokalen Gewichten herausholen?

Nein. Das offene Paket ist H3-Base, dessen nativer Canvas eine kurze Kante von 768 Pixeln hat (bis zu 768×1344). 2K stammt von H3-Regenerate-2K, einem separaten In-Context-Regenerationsmodul, das das Unternehmen in der gehosteten API belassen hat. Sie können lokal mit einem beliebigen Allzweck-Upscaler hochskalieren, aber das ist ein anderer Vorgang als der eigene Regenerationsdurchlauf von H3 und wird nicht damit übereinstimmen.

Warum verhält sich derselbe Prompt in der API und in ComfyUI unterschiedlich?

Weil die API zuerst H3-Context-IR ausführt. Sie liest deinen Text und deine Referenzen, überlegt, wie sie zusammenhängen, und übergibt H3-Base eine strukturierte, angereicherte Anweisung. Lokal gibt es diese Stufe nicht — H3-Base erhält deine rohen Worte. Ein vager Prompt, der über die API einen kompetenten Clip erzeugt, wird von einem Vorprozessor gerettet, den du nicht installiert hast. Deshalb ist das dokumentierte Prompt-Format für lokale Benutzer weitaus wichtiger als für API-Benutzer.

Ist die [0s-2s] Zeitcode-Vorlage falsch?

Das ist nicht das, was der mitgelieferte Leitfaden verlangt. Die VIDEO_PROMPT_WRITING_GUIDE_base_en.md des Unternehmens organisiert nach [Shot N]-Blöcken, vergibt Shot 1 keinen Zeitstempel und drückt spätere Schnitte als absolute Zeiten aus („Bei 00:03.500 schneidet die Kamera auf …“). Sie enthält außerdem keinen Abschnitt für Negativ-Prompts, daher ist die Liste der „verbotenen Übergänge“ in der beliebten Vorlage eine Ergänzung aus der Community. Allerdings berichten Praktiker von guten API-Ergebnissen mit der Zeitcode-Form — vermutlich weil Context-IR die Zeitcode-Form normalisiert. Unsere Lesart: Verwenden Sie das dokumentierte Format mit lokalen Gewichten und schreiben Sie die API-Ergebnisse, die der Preprozessor möglicherweise erzielt hat, nicht den Zeitcode-Klammern zu.

Kann ein Unternehmen in den USA oder der EU die offenen Gewichte kommerziell nutzen?

Der Lizenztext, den wir gelesen haben, schließt die EU, das Vereinigte Königreich, Südkorea und die USA aus seinem anwendbaren Gebiet aus, und der Ausschluss ist so formuliert, dass er sowohl Ausgaben als auch Gewichte abdeckt. Das ist ein ernsthaftes Hindernis für eine kommerzielle Bereitstellung an diesen Orten, und es ist eher eine rechtliche als eine technische Frage – lesen Sie die Lizenz und die Q&A-Datei selbst und holen Sie sich Rat. Die gehostete API unterliegt den eigenen Bedingungen der Plattform und nicht der Community-Lizenz, daher lohnt es sich, sie separat zu bewerten, anstatt davon auszugehen, dass sie gleichermaßen eingeschränkt ist.

Was Sie vor dem Commit überprüfen sollten

H3 ist ein ungewöhnlich gutes Preis-Leistungs-Verhältnis für eine bestimmte Art von Arbeit: kurze, soundgestaltete, referenzkonsistente Clips, bei denen du bereit bist, eine echte Shotliste zu schreiben. Es ist ungewöhnlich anspruchsvoll, wie du fragst. Die drei Dinge, die du selbst überprüfen solltest, weil sie sich am schnellsten ändern: ob neben fal weitere Inferenzanbieter auftauchen (was den Preis pro Sekunde senken würde), ob die ComfyUI R2V-Vorlage über zwei Referenzslots hinaus auf die neun des Modells wächst und ob sich die Timecode-Konvention der Community oder das dokumentierte Shot-Block-Format durchsetzt, sobald jemand einen kontrollierten Vergleich mit lokalen Gewichten durchführt. Bisher hat niemand diesen Vergleich veröffentlicht. Bis das passiert, ist das Handbuch im Repository die bessere Wahl – und es steckt in demselben Download, für den du bereits 42 GB aufgewendet hast.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube