Een titelkaart met de tekst 'Utopai X debuteert op #2 in tekst-naar-video', ondertiteld 'De post-training van MiniMax H3 door een filmstudio - Elo 1.150, tweede, alleen Wan 3.0 presteert beter', met pillabels 'Elo 1.150', '5.455 stemmen' en 'Geen API'.
Guides & Insights

Utopai X debuteert op #2 in tekst-naar-video: Een kijkje in de post-train van MiniMax H3 door een filmstudio

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Utopai X is een videomodel dat vorige week nog niet bestond, niet vanaf nul is getraind door een grensverleggend lab, en niet via een API wordt verkocht — en het staat momenteel tweede in de wereld op het gebied van tekst-naar-video. Het model komt van Utopai Studios, een AI-native film- en televisiestudio gevestigd in Mountain View, en het is een post-train van MiniMax H3, het omnimodale videomodel van MiniMax. Op de Artificial Analysis tekst-naar-video ranglijst met audio (de ranglijst die Artificial Analysis nu labelt als AA-Video-T2V v2.0, resultaten van 29 september 2026), staat Utopai X op Elo 1.150 — alleen achter Aliba​sba's Wan 3.0 op 1.157, en voor ByteDance's Dreamina Seedance 2.5 op 1.143 en het MiniMax H3 (768p) basismodel waar het uit is ontstaan op 1.138. Het arriveerde op 30-09-2026, dezelfde dag dat de ranglijst werd vernieuwd, en het is op precies één plek beschikbaar: binnen PAI, Utopai's eigen productieplatform. Er is geen publieke API, en de eigen prijskolom van Artificial Analysis voor de rij luidt "Geen API beschikbaar."

Die combinatie — tweede in de wereld, één distributiekanaal, geen tariefkaart per seconde in de gebruikelijke zin — is het hele verhaal. Een studio die films maakt, nam iemand anders' foundationmodel, finetunede het op basis van zijn eigen productieoordeel en sprong voor in de rij. Of dat een duurzaam resultaat is of een momentopname van een gloednieuwe arena, is de vraag die het stellen waard is, en het antwoord hangt af van het lezen van de ranglijst in plaats van het persbericht.

Wat het bord daadwerkelijk toont

Artificial Analysis rangschikt videomodellen met een Elo die is afgeleid van blinde paarsgewijze menselijke voorkeursstemmen. Stemmers zien twee clips die met dezelfde prompt zijn gegenereerd en kiezen degene die ze prefereren, zonder te weten welk model welke heeft geproduceerd. Het klassement verandert naarmate er stemmen bijkomen, en elke rij heeft een betrouwbaarheidsinterval dat aangeeft hoeveel de positie mag verschuiven. Vastgelegd op 2026-10-01 luidt het tekst-naar-video-klassement met audio:

A scoreboard card reading 'Utopai X (based on MiniMax H3) - the scoreboard', with rows for text-to-video rank #2 (board range #1-3), Elo 1,150 (+/-11), votes 5,455, parent model MiniMax H3 (768p), parent model Elo 1,138 (+/-10), and availability PAI subscribers only with no API.

• #1 Wan 3.0 — Elo 1.157 (±10), 6.391 voorbeelden, uitgebracht in aug. 2026, $12,00/min.

• #2 Utopai X (gebaseerd op MiniMax H3) — Elo 1.150 (±11), 5.455 monsters, uitgebracht in september 2026, geen API beschikbaar.

• #3 Dreamina Seedance 2.5 — Elo 1.143 (±10), 6.375 samples, uitgebracht jul 2026, $34,12/min.

• #4 MiniMax H3 (768p) — Elo 1.138 (±10), 6.343 samples, uitgebracht, $ 4,80.

• #5 FLUX 3 — Elo 1.129 (±10), 5.628 samples, uitgebracht jul 2026, $17,40/min.

Twee details wegen zwaarder dan de rangorde. Ten eerste: het verschil tussen de eerste en de tweede plaats is zeven Elo-punten, en de twee intervallen overlappen elkaar expliciet — Artificial Analysis geeft het bereik van Utopai X weer als 1.139 tot 1.161, dat de puntschatting van 1.157 van Wan 3.0 bevat. De ranglijst geeft de positie van Utopai X weer als een bereik, #1–3, niet als een vaste positie. Ten tweede: het verschil tussen Utopai X en het model waaruit het via post-training is voortgekomen bedraagt twaalf punten, met hetzelfde overlapprobleem, dus 'het nagetrainde model verslaat zijn ouder' is in de goede richting waar en statistisch zwak. De eigen uiteenzetting van Utopai is hierover zorgvuldiger dan de meeste lanceringsberichten: daarin staat dat het Elo-resultaat 'een onafhankelijke beoordeling biedt van hoe mensen reageren op zijn gegenereerde footage', wat een terechte interpretatie is van wat een arena voor menselijke voorkeuren meet, en geen bewering over filmmaken.

De door de leverancier gerapporteerde laag is daarentegen zelfverzekerd. Utopai beschrijft sterke punten bij reflecties en caustieken — de geconcentreerde patronen die ontstaan wanneer licht weerkaatst of breekt — en bij ruimtelijke consistentie binnen een clip, die beide ontwikkeldoelen zijn in plaats van benchmarkresultaten. Dat zijn de woorden van de leverancier, niet de metingen van Artificial Analysis.

Een studio in plaats van een lab

Utopai Studios ontwikkelt, financiert en produceert zijn eigen film- en televisieprojecten, en bouwt zijn modellen binnen dat bedrijf in plaats van ernaast. Het verklaarde mechanisme is feedback: producties genereren scenario's, goedgekeurde personage- en locatieontwerpen, shotplannen en opeenvolgende takes, en de regisseurs, cinematografen en kunstenaars van de studio registreren niet alleen welke takes zijn behouden, maar ook waarom de andere werden afgewezen. Die registratie wordt trainings- en evaluatiesignaal. Het onderzoeksteam beheert ook een intern Elo-systeem dat menselijke voorkeursbeoordeling combineert met geautomatiseerde stemming door visie-taalmodellen, waarbij kunstenaars deelnemen aan de menselijke kant.

Het is een aannemelijk voordeel, en van buitenaf niet verifieerbaar. Post-training kan een algemeen videomodel richting de voorkeuren van film- en reclamegebruikers bewegen zonder het fundamentele model te vervangen — dat is in elk geval consistent met het leaderboard. Hoeveel van de twaalfpuntsverschuiving ten opzichte van MiniMax H3 afkomstig is van trainingsdata, voorkeursoptimalisatie, promptverwerking, inferentie-instellingen of wijzigingen tijdens het serveren, zeggen de lanceringsmaterialen niet. Utopai heeft geen openbaarmaking van post-trainingdata, geen optimalisatiemethode, geen rekenbudget en geen veiligheidsevaluatie gepubliceerd. Onafhankelijke onderzoekers kunnen de winst niet reproduceren, en er is geen technisch rapport om tegen in te gaan.

De distributielaag is waar de studiothese concreet wordt. PAI — Production Assistive Intelligence — is het platform dat Utopai samen met het model lanceerde, en het bevat projectcontext: scriptopdeling in scènes en shots, een productiebibliotheek van personages, locaties en objecten, versiegeschiedenis, gedeelde goedkeuringen voor enterpriseteams, en een tijdlijn die exporteert naar Premiere Pro of DaVinci Resolve. De propositie is dat het genereren van een clip het goedkope deel is en het consistent houden van een shot met de rest van de film het dure deel. Utopai X genereert beeldmateriaal binnen die werkruimte "wanneer geselecteerd door de filmmaker", in de eigen bewoordingen van het bedrijf — het model is slechts één optie van de verschillende beeld-, video- en audiomodellen die in PAI beschikbaar zijn, niet de enige.

Wat Utopai X kost, en hoe je het leest

The Artificial Analysis Video Arena text-to-video leaderboard, last updated September 29, 2026, listing Wan 3.0 at Elo 1,157, Utopai X at 1,150, Dreamina Seedance 2.5 at 1,143, MiniMax H3 (768p) at 1,138 and FLUX 3 at 1,129, each with sample counts, release months and price per minute.

PAI wordt verkocht als een abonnement met credits, niet als een API per seconde. De gepubliceerde tariefniveaus zijn $15 per maand voor 1.000 credits, $49 per maand voor 3.500 credits, $129 per maand voor 10.000 credits en $379 per maand voor 35.000 credits, waarbij jaarlijkse facturering ongeveer 8 tot 10 procent korting geeft, plus top-ups van $15 per 1.000 credits. Utopai X heeft een eigen regel in de creditstabel van PAI: 93 credits per seconde video bij 1080p. De andere videomodellen van het platform staan lager — 50 credits per seconde bij 1080p op het standaardniveau en 76 op het pro-niveau.

Dat omrekenen naar een bedrag per minuut is een rekensom die iedereen kan maken en die bijna niemand als prijs zou moeten noemen. Bij 93 credits per seconde kost één minuut Utopai X-output 5.580 credits. Het instapabonnement van $15 levert 1.000 credits per maand op, wat ruwweg 10,8 seconden beeldmateriaal is als elke credit naar dit model zou gaan. Als je het instaptarief voor credits lineair opschaalt, komt de impliciete prijs uit op ruim $80 per minuut gegenereerde video. Dat getal is alleen het vermelden waard met de kanttekeningen erbij: het gaat uit van een strikt lineaire omrekening van credits naar dollars, het negeert dat credits één gemeenschappelijke pool vormen voor alle modellen in PAI en verlopen of ongebruikt blijven, het negeert jaarlijkse kortingen en bijvulbundels, en het zegt niets over resolutie- of lengtelimieten, die Utopai niet afzonderlijk voor Utopai X heeft gespecificeerd. Het is een nuttige orde van grootte, geen tariefkaart.

Ter vergelijking: op dezelfde Artificial Analysis-ranglijst staat MiniMax H3 (768p) vermeld voor $4,80 per minuut en Wan 3.0 voor $12,00, terwijl Dreamina Seedance 2.5 vermeld staat voor $34,12. Dat zijn geautomatiseerde prijsfeeds uit de eigen API's van de leveranciers, geen op abonnementen gebaseerde schattingen, dus de vergelijking is hoogstens richtinggevend — maar de richting is duidelijk: op het instapniveau concurreert generatie binnen een op credits gebaseerd studio-platform niet met per-seconde-API-prijzen. Waarvoor een koper betaalt, is de werkomgeving rond het model, niet de marginale seconde van het model.

Het deel dat niet openbaar is

Drie hiaten zijn het benoemen waard, omdat elk ervan een andere beslissing blokkeert.

• Geen API, en geen integratieroute.Utopai X heeft momenteel geen directe integratieroute. Een productteam dat het in een pipeline wil aanroepen, kan dat niet. Artificial Analysis vermeldt het als "No API available", en de lanceringsmaterialen beschrijven geen toegang voor ontwikkelaars.

• Geen afzonderlijke specificatie.MiniMax H3 genereert clips van 4 tot 15 seconden in maximaal 2K met native stereo-audio. Utopai heeft geen eigen maximale duur of resolutie voor Utopai X gepubliceerd, wat betekent dat de 1080p-waarde in de credittabel de enige beschikbare resolutievermelding is en dat de cliplengte onbekend is.

• Geen evaluatie buiten de arena. Het Elo-resultaat is een onafhankelijke meting van menselijke voorkeur op korte clips. Het is geen maatstaf voor of beeldmateriaal een bedoelde opname dient, in een montage past of een revisie overleeft. Utopai's eigen bericht geeft dit direct toe — "evaluatie gaat ook door nadat een clip is gegenereerd" — wat een ongewoon eerlijke formulering is voor een lancering en ook een waarschuwing over hoe ver de rangschikking reikt.

Aan de studiokant is er meer geschiedenis om naar te wijzen. Utopai lanceerde PAI 2.0 op 2 juni 2026 en zei toen dat het platform minder dan twee maanden na zijn debuut in april $11 miljoen aan jaarlijks terugkerende omzet had bereikt, gedreven door commerciële licenties die aan productiebedrijven werden verkocht. Het bedrijf zegt dat er drie bioscoopfilms en twee series voor 2027 gepland staan en dat het PAI en Utopai X toepast op zijn eigen producties, waaronder The Most Serious Fart, een animatiefilm geschreven en geregisseerd door Mike Bender. Dat zijn de cijfers van de studio en de planning van de studio, en dat is de reden waarom een post-train zonder API überhaupt de moeite van het schrijven waard is: het model wordt gebruikt om films te maken die het bedrijf van plan is uit te brengen, wat een zwaardere test is dan een leaderboard.

Waar het basismodel nog steeds de praktische keuze is

The OrcaRouter model page for MiniMax H3, showing the 0% markup badge, a description of omni-modal 4-to-15-second video generation at up to 2K with native stereo audio, a $0.08 per second price panel, a performance panel with p50 latency, and a release date of 7/31/2026.

Voor iedereen die deze week daadwerkelijk video moet genereren, is de routeerbare helft van deze familie het basismodel. MiniMax H3 is beschikbaar op OrcaRouter tegen de adviesprijs van de provider — $0,08 per seconde bij 768p, wat neerkomt op $4,80 per minuut, hetzelfde bedrag dat Artificial Analysis vermeldt — met 0% opslag, zodat een prijsverlaging van een leverancier dezelfde dag ingaat in plaats van pas na een herprijzingsronde, en automatische failover tussen providers, zodat een storing bij één endpoint je pipeline niet platlegt. Het accepteert tekst-, beeld-, video- en audioreferenties als één uniforme context en levert clips van 4 tot 15 seconden in 768P of 2K met native stereo-audio, gefactureerd per seconde gegenereerde output.

Utopai X is niet gerouteerd, en niets in dit artikel mag worden gelezen als een bewering dat dit wel zo is. Wat het basismodel je biedt, is een manier om de esthetische en bewegingskenmerken van de H3-familie te testen — hetzelfde fundament waarvan Utopai uitging, vóór welke post-training dan ook die erop is toegepast — via één API-sleutel naast meer dan 200 andere modellen, zonder een PAI-abonnement. Als Utopai X ooit een routeerbare provider bereikt, zou het dezelfde dag tegen lijstprijs verschijnen, waarbij het tarief van de leverancier wordt doorgegeven in plaats van er een opslag op te leggen. Tot die tijd is de eerlijke splitsing: Utopai X voor studio's binnen PAI, MiniMax H3 voor iedereen die een pipeline samenstelt.

Wat bepaalt of dit een debuut of een moment was?

Drie dingen zijn het komende kwartaal de moeite van het volgen waard. Ten eerste of de kloof van zeven punten aan de top nog een paar duizend stemmen overleeft — de intervallen overlappen elkaar vandaag, en een ranglijst die wordt herschud zodra een nieuwe reeks vergelijkingen binnenkomt, heeft niets beslecht. Ten tweede of Utopai überhaupt enige vorm van ontwikkelaarstoegang opent; een model dat wereldwijd op de tweede plaats staat en alleen door een PAI-abonnee kan worden aangeroepen, is een productbeslissing, en die is omkeerbaar. Ten derde of de concurrentie zich de andere kant op beweegt. Wan 3.0 genereert al tot 30 seconden 1080p met native audio en accepteert tekst, afbeeldingen, video, audio, documenten en webpagina's als referenties, en het leidt de ranglijst op het gebied van belichting, materialen en camerabesturing in de use-case-uitsplitsing. Een winst van twaalf punten na post-training ten opzichte van een basismodel is veelzeggend; de tweede plaats vasthouden tegen een foundationmodel met een breder inputbereik is een andere opgave.

Wat hier werkelijk nieuw is, is niet de Elo. Het is de vorm van de bewering: een studio met een productiepijplijn betoogt dat het bezitten van de beslissingen achter het beeldmateriaal — welke take, welke referentie, welke revisie — meer waard is dan het bezitten van de pre-training-run. Dat argument is toetsbaar, en de box office voor de 2027-slate is een van de tests.