Ett genererat hero-kort för HiDream-O1-Video-1.0 med kickern 'OrcaRouter · modellradar — video' ovanför rubriken 'Sjätte på resultattavlan, en indata i API:et', ett vänsterkort 'Resultattavlan' som listar AA image-to-video 6:e av 80+, Elo 1 175 ±10, 3 231 sampel och 0,80 per minut, ett högerkort 'Det dokumenterade API:et' som listar en referensbild, en valfri prompt, endast force_10s, och att video, upplösning och ljud inte exponeras, samt fyra chips med texten Släppt aug. 2026, Tillkännagavs 17 sep. 2026, Vikter: inga publicerade, och ingen post på T2V- eller redigeringslistorna.
Engineering & Research

HiDream-O1-Video-1.0 debuterar som sexa på Artificial Analysis — och dess publika API är mycket mindre än dess lansering

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

HiDream-O1-Video-1.0 ligger sexa på Artificial Analysis Image-to-Video-topplistan, med ett Elo på 1 175 över 3 231 röster till $5,80 per minut genererad video. Det är placeringen som dess tillverkare meddelade – förutom att HiDream.ais lanseringsmeddelande, daterat den 17 september 2026, angav nummer fyra. Båda siffrorna är sanna och de beskriver olika saker: meddelandet anger den placering modellen hade den dag den tillkännagavs, och listan har ändrats sedan dess. Läst den 10 oktober 2026 med ljudfiltret aktiverat ligger HiDream V1 bakom MiniMax H3 Max, MiniMax H3, Vidu Q4 Preview, Omni Flash och Dreamina Seedance 2.0 720p, i den ordningen.

Den mer intressanta historien är inte rankningen. Det är att HiDream-O1-Video-1.0 annonserades som en modell som tar text, bilder och video och returnerar fem till tjugo sekunder lång 1080p-film med nativt synkroniserat ljud – och att det du faktiskt kan anropa idag tar exakt en referensbild och en valfri textprompt, och inget annat. Båda dessa påståenden är dokumenterade. Glappet mellan dem är det som är värt att känna till innan du bygger på den här modellen.

Tavlan, läs ordentligt

Artificial Analysis kör sina videotopplistor i nivåer, var och en med sin egen Elo-skala och sin egen röstpool, så en poäng överförs inte mellan dem. På AA-Video-I2V v1.0 med ljudet inkluderat skiljs de sex bästa åt av tjugo Elo-poäng och konfidensintervallen är mellan sju och tio poäng breda. Toppsexan, per den 10 oktober 2026:

• MiniMax H3 Max — 1 195 ±9 över 5 894 prover, augusti 2026, 4,80 $/min

• MiniMax H3 — 1 181 ±8 över 7 284 prover, juli 2026, 7,80 USD/min

• Vidu Q4 Preview — 1 179 ±10 över 5 543 prover, oktober 2026, 5,04 $/min

• Gemini Omni Flash — 1 178 ±7 av 12 327 stickprov, maj 2026, 6,00 $/min

• Dreamina Seedance 2.0 720p — 1 176 ±7 över 15 721 prover, mars 2026, 9,07 $/min

• HiDream-O1-Video-1.0 — 1 175 ±10 över 3 231 sampel, augusti 2026, $5,80/min

Läs dessa intervall som en grupp, och den ärliga sammanfattningen är att positionerna ett till sex statistiskt sett är en enda tävling med en mycket lång svans av oavgjorda resultat. Gapet som inte ligger inom bruset är det mellan HiDream V1 och resten av fältet: sjundeplatsen, Alibabas Wan 3.0, ligger på 1 164 – elva poäng och ett helt intervall under sjätteplatsen, och nästan trehundra röster före den. HiDreams egen urvalsstorlek är den minsta bland de sex bästa, vilket innebär att dess intervall är ett av de bredaste och att dess placering är den minst fastställda.

A generated scoreboard titled 'HiDream-O1-Video-1.0 — announced versus served', contrasting the vendor's launch claims (inputs: text, image and video; output: 1080p, 5 to 20 seconds; audio: natively synchronised; duration planned from narrative; generation as one joint multimodal process; physics of gravity, collision and inertia) against the HiHarness request surface (one reference image; aspect ratio preserved; no audio parameter; force_10s boolean only; no resolution selector documented; physics not exposed as a control), with a footer stating the launch claims are vendor-reported.

Två saker som Artificial Analysis uppger om själva tavlan är värda att föra vidare. Den registrerar en enda modell som tillagd under de senaste 30 dagarna, och den säger att AA-Video-I2V v2.0 är på väg, anpassad till AA-Video-T2V v2.0-taxonomin med 1080p genomgående. Det spelar roll för en modell vars lanseringspåståenden handlar om 1080p och om text- och videobetingning: tavlan den debuterar på är uttryckligen en övergångstavia, och ersättaren förändrar vad som mäts.

Där modellen inte är

HiDream-O1-Video-1.0 visas på exakt en videotavla från Artificial Analysis. Det saknas på AA-Video-T2V v2.0, text-till-video-tavlan, och på videoredigeringstavlan. Jag kontrollerade båda den 10 oktober 2026 – Wan 3.0 leder text-till-video med 1 156 och videoredigering med 1 157, FLUX 3 är sexa i text-till-video med 1 128, och HiDream förekommer inte i någon av rankningarna.

Den frånvaron är en signal snarare än en diskvalificering. En modell som bara konsumerar en referensbild kan inte ställas upp i en text-till-video-omröstning, och en som bara animerar kan inte delta i en redigeringsjämförelse. Den praktiska konsekvensen är att det inte finns någon oberoende mätning av HiDream V1 som utför text-till-video eller videoredigering, vilket är precis två av de tre indatalägen som dess lansering gör reklam för.

Två datum, och de nittio dagarna mellan dem

Det finns en hake i detta som alla som citerar dessa siffror bör hantera försiktigt. Artificial Analysis anger HiDream-O1-Video-1.0:s releasedatum som den 28 augusti 2026 och datumet då den introducerades på resultattavlan som den 10 september 2026. HiDreams eget lanseringsmeddelande är daterat den 17 september. De modellreferenser från tredje part som sedan dess har dykt upp beskriver den som publicerad den 15 september och verifierad den 17 september.

Det som det mönstret beskriver är en modell som nådde utvärderingspipelinen innan den nådde pressmeddelandet — ganska normalt, och det betyder att releasedatumet på tavlan är det tidigare av de två, inte ett fel. Det beskriver inte en marsmodell som återannonseras i augusti, vilket är det felmönster som den här bloggen har bränt sig på tidigare. HiDream-O1-Video-1.0 är verkligen ny: själva leaderboard-infrastrukturen daterar dess ankomst till de senaste två månaderna.

Vad lanseringen påstår, och vem som säger det

Arkitekturhistorien kommer från HiDream och har inte oberoende reproducerats. Enligt leverantören: HiDream-O1-Video-1.0 — HiDream V1, eller HD-V1 — modellerar text, video och ljud gemensamt i en och samma genereringsprocess i stället för att generera bild och lägga till ljud efteråt, så att läpprörelser, omgivningsljud och fysisk handling delar en tidslinje. Varaktigheten planeras i stället för att vara fast, där modellen väljer en längd på mellan fem och tjugo sekunder utifrån händelsen som beskrivs. Fysiskt beteende — gravitation, kollision, tröghet, deformation, ljusavklingning — tränas in som en genereringsbegränsning. Efterträning använder diffusionsförstärkningsinlärning mot en multimodell belöningsmodell anpassad till mänsklig perception. Genereringen körs i tre steg som företaget beskriver som planering först, gemensam generering andra, anpassning tredje.

HiDream placerar modellen i en portfölj med fyra familjer som bygger på en gemensam enhetlig transformer-grund — HiDream-O1-Image, HiDream-O1-Video, HiDream-O1-World och HiDream-O1-Embodied — och hänvisar till tidigare benchmarkplaceringar för syskonmodellerna, däribland HiDream-O1-Image 1.5 på andra plats globalt på Artificial Analysiss text-till-bild-tavla och HiDream-O1-World på första plats på WBench. Det är leverantörens siffror för andra modeller i familjen, som här anges utan oberoende bekräftelse. Företagets företagsmaterial beskriver också en teknikstack för basmodeller på "mer än 200 miljarder" parametrar; det är ett uttalande på plattformsnivå, inte en specifikation för HiDream-O1-Video-1.0, och ingen källa publicerar ett parameterantal för denna checkpoint. Inga öppna vikter har släppts för den.

A screenshot of the Artificial Analysis AA-Video-I2V v1.0 image-to-video leaderboard with the audio filter applied, captured 10 October 2026, headed by MiniMax H3 Max at Elo 1,195 and .80 per minute, with HiDream-O1-Video-1.0 sixth at Elo 1,175 over 3,231 samples, released August 2026 at .80 per minute, and a banner noting that AA-Video-I2V v2.0 is coming soon with 1080p videos throughout.

Vad du faktiskt kan kalla

Här är dokumentationen ovanligt tydlig, och den är snävare än tillkännagivandet. HiDream tillhandahåller modellen via HiHarness, sin MaaS-plattform. Videoändpunkten är en POST till /api/maas/gw/v1/videos/generations med modellidentifieraren HiDream-O1-Video-1.0. Den obligatoriska indatan är exakt en referensbild – en offentlig URL, eller Base64 utan data-URL-prefixet, mellan 40 KB och 20 MB. Textprompten är valfri och är tom som standard. Genereringen är asynkron: du skickar in, får ett task_id och pollar /api/maas/gw/v1/videos/generations/results tills result.status visar 1.

Tre utelämnanden i det schemat förtjänar att nämnas explicit, eftersom vart och ett är en förmåga som lanseringsversionen gör reklam för.

• Referensvideo – i tillkännagivandet anges video som en av modellens indata; i den dokumenterade begäran finns inget fält för det.

• Explicit upplösning — meddelandet hävdar 1080p; den dokumenterade begäran har ingen upplösningsväljare, och resultatet bevarar i stället referensbildens bildförhållande.

• Ljudkontroll — tillkännagivandet hävdar inbyggt synkroniserat ljud; den dokumenterade förfrågan exponerar ingen ljudingång eller ljudgenereringsparameter.

Det som schemat faktiskt exponerar är force_10s, en boolesk variabel med standardvärdet false. Om den lämnas som false väljer modellen varaktigheten. Sätts den till true får du tio sekunder. Det finns inget numeriskt varaktighetsfält, så det annonserade intervallet på fem till tjugo sekunder är ett påstående på modellnivå som den publika förfrågningsytan inte låter dig styra annat än genom att välja ett av två lägen.

A screenshot of the HiHarness documentation page for the HiDream-O Series video models, captured 10 October 2026, describing HiDream-O1-Video-1.0 as a single-image-to-video model that generates a video from one reference image and a text prompt, with Model ID HiDream-O1-Video-1.0, input as one reference image by public URL or Base64, output of one video, resolution that preserves the input aspect ratio, a dynamic or fixed ten-second duration, and an asynchronous workflow of submitting a task and polling the result endpoint until result.status is 1.

Det finns en implementeringsdetalj i det svarskontraktet som kommer att ställa till problem för en integration som skrivits genom mönstermatchning mot andra video-API:er. result.status = 1 betyder att varje deluppgift har nått ett terminalt tillstånd – inte att genereringen lyckades. Du måste fortfarande läsa sub_task_results[].task_status, där 1 är lyckat, 3 är genereringsfel och 4 är ett fel i säkerhetsgranskningen. En klient som behandlar terminalt tillstånd som lyckat kommer att ge dig en video-URL som inte finns.

Priset, i sitt sammanhang

Med ett pris på $5,80 per minut enligt Artificial Analysis är HiDream V1 medelprissatt för sin klass snarare än billig. Inom topplistans sex bästa är den billigare än MiniMax H3 ($7,80) och Dreamina Seedance 2.0 ($9,07) och dyrare än MiniMax H3 Max och Vidu Q4 Preview. Jämfört med de modeller som den oftast kommer att jämföras med är spridningen större: Google Veo 3.1 kostar $24,00 per minut, Kling 3.0 1080p Pro $20,16, Alibaba Wan 2.7 $9,00 och Wan 3.0 $12,00, medan Grok Imagine Video 1.5 ligger på $8,40.

De där minutpriserna är inte direkt jämförbara, eftersom en minut utdata vid vilken upplösning och med vilket ljud är precis det som API-dokumentationen lämnar ospecificerat för den här modellen. Se siffran som en utgångspunkt för dina egna beräkningar snarare än en prislista.

Att prova en obeprövad väg utan att satsa en pipeline på den

Argumentet för försiktighet här är inte att modellen är dålig. Det är att en serving-yta från förhandsversionstiden – en indatatyp, en växel för varaktighet, en terminalflagga med två tillstånd – är fel plats att hårdkoda en produktionsväg i. HiDream-O1-Video-1.0 är inte en modell som vi serverar på OrcaRouter i dag, så inget nedan är ett påstående om att vara värd för den: stället där vår produkt verkligen gör nytta är på andra sidan beslutet, där du vill testa en ny videorutt mot en befintlig lösning och kunna lämna den när som helst. En OpenAI-kompatibel slutpunkt för fler än 200 modeller, automatisk failover så att en rutt som börjar misslyckas tyst inte är den rutt du levererar, leverantörslistpriser som förs vidare utan påslag, och ett routing-DSL som låter dig jämföra två modeller i en och samma begäran i stället för två integrationer. Inget av detta kräver specifikt HiDreams modell.

Vad skulle förändra det här stycket?

Tre utvecklingar skulle förändra bilden, i fallande sannolikhetsordning.

Först, ett bredare serving-kontrakt. Om HiHarness lägger till ett referensvideofält, en upplösningsväljare eller dokumenterade ljudkontroller, sluts gapet mellan tillkännagivandet och API:et och påståendena om 1080p och text-till-video blir testbara. Det är en dokumentationsändring, inte en modelländring, och den skulle kunna landa vilken vecka som helst.

För det andra, AA-Video-I2V v2.0-tavlan. Artificial Analysis har sagt att den är på väg, anpassad till T2V v2.0-taxonomin med 1080p genomgående. En tavla med enbart 1080p skulle vara den första oberoende miljön där HiDream V1:s upplösningspåstående har någon betydelse – och om modellen fortfarande inte kan föras in på text-till-video-tavlan under den nya taxonomin, blir dess frånvaro där ett substantiellt fynd snarare än en artefakt av de gamla kategorierna.

Tredje: urvalsstorlek. 3 231 röster är en verklig mätning, och en färsk sådan – den tunnaste bland de sex främsta. Intervallet är ±10 nu och kommer att bli snävare i vilken riktning väljarna än knuffar det. Den som citerar ”sjätte” som ett fastställt faktum bör ange datumet då de läste det, eftersom sjätteplatsen ingår i en sexdelad placering.

Frågan som är värd att hålla fast vid är inte huruvida HiDream-O1-Video-1.0 är konkurrenskraftig – på den enda resultattavlan där det går att mäta är den obestridligen det, och till ett försvarbart pris per minut. Det är huruvida den modell som till slut når ett brett API är den som annonserades. Enligt aktuell dokumentation är dessa fortfarande två olika produkter.

HiDream-O1-Video-1.0 är inte en av de rutter vi erbjuder idag, men samma typ av yta finns på över 200 modeller med leverantörslistpriser vidarebefordrade och inget påslag tillagt.