
Vidu Q4 Preview vs MiniMax H3: Toppen av listan är oavgjort, och bara en av dem finns med på tre listor
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Bild-till-video-tavlan hos Artificial Analysis, läst 8 oktober 2026, placerar MiniMax H3 Max först på 1 195 Elo, MiniMax H3 tvåa på 1 181 och Vidu Q4 Preview trea på 1 179. Sexton poäng skiljer första- från tredjeplatsen, med intervall på ungefär ±10 och ±11, över 5 894, 7 284 respektive 5 543 röster. Det är ett statistiskt dödläge utklätt till en prispall, och varje sida som inleds med att utropa en vinnare på den här tavlan läser brus.
Så den intressanta frågan är inte vilken av dessa två modeller som är bättre. Det är vad som händer med jämförelsen när man kliver av den enda resultattavlan där båda förekommer — för MiniMax H3 släpptes den 31 juli 2026 som en omnimodal modell som läser text-, bild-, video- och ljudreferenser som en enda kontext, och Vidu Q4 Preview kom den 7 oktober 2026 med två inmatningslägen och två API-slutpunkter. En av dem mäts på tre ställen. Den andra mäts på ett.
Vad oavgjort mellan tre betyder och inte betyder
Både MiniMax-bidragen och Vidu-versionen ligger inom varandras intervall, så det ärliga påståendet är att de tre bästa bild-till-video-modellerna inte går att skilja åt utifrån mänsklig preferens vid de nuvarande stickprovsstorlekarna. Två detaljer gör att det oavgjorda resultatet är mindre smickrande för alla än det låter.
Det första är åldern. MiniMax H3:s röster är från juli 2026 och H3 Max:s från augusti; Vidu Q4 Previews röster är från oktober. Större, äldre röstpooler mäts mot ett annat konkurrensfält och en annan uppsättning motståndare, vilket slår åt båda hållen: bättre mätt, och handlar om en något annan fråga. Ett gap på 16 punkter i någon riktning är här inte bevis.
Den andra är priskolumnen. Artificial Analysis registrerar MiniMax H3 till $7.80 per minut och H3 Max till $4.80 per minut i den här tabellen. Vidu Q4 Preview registreras till $7.20. Läser man dessa som en rangordning ser H3 Max ut som det mest prisvärda av de tre – men leverantörens bakomliggande priser förklarar beteckningen snarare än motsäger den. Vi listar MiniMax-H3 till $0.08 per sekund vid 768P och $0.13 per sekund vid 2K på vårt eget modellkort, vilket är $4.80 och $7.80 per minut. De två MiniMax-siffrorna i tabellen är samma modell prissatt i två upplösningsnivåer, inte en premiumnivå och en billig nivå. Kolumner med pris per minut i en preferenstabell är användbara för storleksordningar och farliga för något mer finmaskigt.
Där MiniMax H3 dyker upp och Vidu Q4 Preview inte gör det
Detta är den del av matchningen som överlever likheten – en strukturell skillnad snarare än en kvalitativ.
MiniMax H3 (768p) ligger på fjärde plats på text-till-video-listan med 1 137 Elo baserat på 8 315 röster, medan H3 Max ligger på femte plats med 1 130 baserat på 5 719. Den ligger återigen på fjärde plats på videoredigeringslistan med 1 119 baserat på 7 023 röster, på en lista som rangordnar modeller efter hur de redigerar en video utifrån en textinstruktion med ljudet bevarat. Vidu Q4 Preview finns inte med på någon av dem.
Den frånvaron är inte en mätlucka – det är vad produkten är. Vidu Q4 Previews API dokumenterar två slutpunkter, /ent/v2/img2video och /ent/v2/reference2video, och produktsidan listar två lägen, bild-till-video och referens-till-video. Det finns ingen text-till-video-väg i dokumentationen. Det finns inte heller någon videoredigeringsväg, vilket innebär att modellen inte kan ta ett befintligt klipp och ändra något i det. MiniMax H3 gör båda, och dess omnimodala inramning – text-, bild-, video- och ljudreferenser i en och samma kontext – är anledningen till att den kan.
Det är värt att vara precis när det gäller ljudsidan, eftersom båda modellerna har inbyggt ljud och de två är inte samma sak. Vidu Q4 Preview genererar ljud och video tillsammans, med en ljudparameter i bild-till-video-slutpunkten som matar ut en video med dialog och ljudeffekter, och den accepterar upp till tre referensljudklipp för att hålla en karaktärs röst konsekvent. MiniMax H3 matar ut inbyggt stereoljud och accepterar ljud som en indatamodalitet vid sidan av bilder och video. Användningsfallet med referensröst är Vidus specifika styrka; användningsfallet med referens-allt är MiniMaxs.
Aritmetiken per sekund, nivå för nivå
Båda modellerna debiterar per sekund genererad utdata, vilket gör detta till den sällsynta jämförelsen där prislistorna kan ställas mot varandra utan omräkning.
• 540p — endast Vidu Q4 Preview: 9 krediter per sekund, cirka 0,045 USD enligt plattformens publicerade standardkreditkurs på 0,005 USD
• 720P / 768P — Vidu Q4 Preview 19 krediter per sekund, cirka $0,095 jämfört med MiniMax-H3 $0,08 per sekund
• 1080p — Vidu Q4 Preview 24 krediter per sekund, ungefär $0,12 jämfört med MiniMax-H3 som inte har någon publicerad 1080p-nivå
• 2K — Vidu Q4 Preview 38 krediter per sekund, cirka $0,19 jämfört med MiniMax-H3 $0,13 per sekund
• 4K — endast Vidu Q4 Preview: 78 per sekund, cirka $0,0
Mönstret som framträder av detta är inte ”den ena är billigare”. Vidu Q4 Previews lägstanivå är verkligen lägre – dess 540p-nivå är en blocking-nivå prissatt för exakt vad den används till, att testa en komposition innan man betalar för en rendering i full upplösning, och inget i MiniMaxs prislista spelar den rollen. MiniMax H3 är billigare vid 2K, den högsta nivån som båda modellerna delar, med ungefär en tredjedel. Och Vidus 4K-nivå är den enda 4K-genereringsnivån i jämförelsen, till ett pris som speglar det.
Lanseringssiffran på 0,014 USD per sekund som åtföljde Vidus tillkännagivande är 540p-nivån till en rabatterad kreditavgift, inte en generell avgift. Shengshus plattform kör för närvarande tidsbegränsade paketrabatter på upp till 30 % på kreditpaket, vilka sänker varje nivå tillsammans i stället för att ändra kurvans form. Betrakta listpriskurvan som jämförelsegrund och rabatten som en tillfällig kompensation.
På vår sida: vi routar MiniMax-H3. Den är live i det publika modell-API:et på minimax/minimax-h3, fakturerad per sekund genererad utdata till leverantörens listpris som förs vidare utan påslag, anropbar på samma OpenAI-kompatibla endpoint som varje textmodell vi tillhandahåller. Vidu Q4 Preview är inte en OrcaRouter-rutt, och den här sidan påstår inte motsatsen — de videomodeller vi faktiskt tillhandahåller ligger på en nyckel och en förfrågningsform bredvid språkmodellerna, vilket är upplägget som gör det billigt att jämföra flera av dem. En praktisk konsekvens av vidarefakturering: när en leverantör ändrar ett per-sekund-pris syns den ändringen på rutten samma dag i stället för vid avtalsförnyelse.
Vad "omni-modal" ger i en faktisk förfrågan
MiniMax H3:s enhetliga kontext är lätt att läsa som en funktionslista och missa som en ingenjörsmässig skillnad. En modell som tar emot video som indatareferens kan riktas mot en befintlig sekvens och ombes fortsätta, förlänga eller styla om den; en modell utan videoindata kan inte det. Det är mekanismen bakom H3:s närvaro på redigeringsbordet, och det är också därför modellens utdataintervall på 4–15 sekunder är mindre av en begränsning än siffran antyder – förlängning i flera omgångar är det normala sättet att bygga en längre sekvens av den.
Vidu Q4 Previews 16-sekunderstak är också per generering, och dess Reference-to-Video-läge är byggt för berättande i flera tagningar inom det fönstret, med dokumentationen som beskriver intelligent kameraväxling och konsekvens över flera kamerapositioner. Det den inte har är en väg att ta emot ett klipp du redan har spelat in och ändra det. Om ditt arbetsflöde utgår från filmat material i stället för från en stillbild eller en referensuppsättning, är en av dessa två modeller helt enkelt inte tillgänglig för dig, och inget Elo-tal stänger det gapet.
Vilken, beroende på jobb
Välj MiniMax H3 när indata är något annat än en bild eller en referensuppsättning. Text-till-video, video-till-video-redigering, ljudinmatning, flerstegsförlängning över femton sekunder, eller en pipeline där modellen behöver hantera användningsfall motsvarande tre olika boards — det är H3:s territorium, och det är den enda av de två som har något av det. Dess 2K-pris är också det lägre av de två på den toppnivå de delar.
Välj Vidu Q4 Preview när uppgiften gäller konsekvens i rollbesättning och röst, eller när du behöver en 4K-genereringsnivå, eller när du vill ha en billig 540p-blockeringspass för att iterera en tagning innan du binder dig. Femton bildreferenser och tre ljudreferenser är en större publicerad referensbudget än vad MiniMax dokumenterar, och ingen annan modell i den här jämförelsen genererar nativt i 4K. Den snävare uppsättningen lägen är avvägningen för det.
Vad skulle ändra på detta: en fullständig Vidu Q4-utgåva som lägger till en endpoint för text-till-video skulle sätta de två modellerna på samma resultattavlor och förvandla detta till en ren tävling. AA-Video-I2V v2.0, som aviserats komma med 1080p genomgående och en reviderad kapacitetstaxonomi, skulle ersätta rösterna högst upp på tavlan i stället för att sortera om dem – och den skulle avgöra huruvida den nuvarande delade topplaceringen mellan tre är ett genuint oavgjort resultat eller en mätgräns. Fram till dess är siffran att hålla reda på sexton, med tavlans namn och datumet bredvid den.
Det enda som är värt att ta med sig från själva prispallen: en förstaplats som ligger sexton Elo över tredjeplatsen, med så breda intervall, är inte en rangordning. Det är tre modeller som mänskliga röstare inte kan skilja åt, och beslutet mellan dem måste komma från allt annat på den här sidan.



