
Vidu Q4 Preview vs Kling 3: Fyra Kling-varianter, en Vidu-build och ett 124-punkters gap
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Artificial Analysis-tavlan för bild-till-video har fyra separata Kling 3-poäng och en Vidu Q4 Preview. De fyra Kling-posterna – Kling 3.0 1080p (Pro), Kling 3.0 720p (Standard), Kling 3.0 Omni 1080p (Pro) och Kling 3.0 Omni 720p (Standard) – ligger på 1 055, 1 051, 1 044 och 1 036, en spridning på nitton poäng. Vidu Q4 Preview ligger på 1 179. Det är en enda modell med en enda poäng, och den ligger 124 poäng över den bästa Kling 3-varianten på den tavlan, vilket är ett större gap än hela Klings interna spann gånger sex.
Den inramningen förtjänar att slås fast redan i inledningen, eftersom de flesta "Vidu vs Kling"-sidor jämför ett namn mot ett namn, och Kling 3 är inte ett enda namn. Vidu Q4 Preview släpptes den 7 oktober 2026 som Shengshu Technologys första offentliga förhandsvisning av sitt nästa generations flaggskepp, före den fullständiga Q4-modellen, med två lägen: Image-to-Video och Reference-to-Video. Kling 3 kom i februari 2026 från Kuaishou som en nivåindelad familj som sedan dess har utökats med en Omni-gren, ett Turbo-spår och en Standard/Pro-uppdelning vid två upplösningar. Att jämföra "Kling 3" med vad som helst innebär att välja vilken av dessa du menar.
Tavlan, med varje Kling-variant namngiven
Artificial Analysis, läst 8 oktober 2026, ljudet behållet, AA-Video-I2V v1.0:
• Vidu Q4 Preview — 3:e, 1 179 ±10, 5 543 prover, okt. 2026, 7,20 USD/min
• Kling 3.0 1080p (Pro) — 20:e, 1 055 ±6, 14 896 prover, feb. 2026, $20,16/min
• Kling 3.0 720p (Standard) — 21:a, 1 051 ±6, 14 692 prover, feb 2026, $15,60/min
• Kling 3.0 Omni 1080p (Pro) — 22:a, 1 044 ±7, 6 185 prover, feb 2026, 16,80 $/min
• Kling 3.0 Omni 720p (Standard) — 24:e, 1 036 ±7, 6 198 prover, feb 2026, 13,44 $/min
Och för text-till-video (AA-Video-T2V v2.0), en separat resultattavla med egen skala och egen röstningspool:
• Kling 3.0 Omni 1080p (Pro) — 15:e, 1 015 ±10, 3 778 sampel, feb 2026, $8,40/min
• Kling 3.0 1080p (Pro) — 16:e, 1 000 (ankare), 5 677 prover, feb 2026, $10,08/min
• Vidu Q4 Preview — finns inte
Anmärkningen om ankaret är viktig. Kling 3.0 1080p (Pro) är referenspunkten för Elo-skalan på text-till-video-tavlan – modellen som alla andra poster kalibreras mot, fastställd till 1 000 genom sin konstruktion. Det är ett designbeslut av Artificial Analysis, inte en poäng som Kling förtjänade, och att citera det som ”Kling fick 1 000” utan ankarkvalificeringen skulle vara fel.
Läser man image-to-video-blocket med intervallen i åtanke är en slutsats oundviklig: de fyra Kling-varianterna går statistiskt sett inte att skilja från varandra och spänner över nitton Elo inom ett prisintervall på 6,72 dollar per minut. Att betala för Pro i stället för Standard, eller 1080p i stället för 720p, ger dig fyra till åtta Elo. Att betala för Omni-grenen ger dig ingenting alls på den här resultattavlan – Omni 1080p Pro får elva poäng under den vanliga 3.0 1080p Pro, väl inom det kombinerade intervallet, till ett lägre listpris.

Jämförelsen som tål granskning
Vidu Q4 Preview mot Kling 3.0 1080p (Pro) är matchen som är värd att köra, eftersom den parar ihop den bäst presterande varianten från varje familj på resultattavlan där båda förekommer.
• Elo — Vidu Q4 Preview 1 179 ±10 baserat på 5 543 röster mot Kling 3.0 1080p (Pro) 1 055 ±6 baserat på 14 896 röster, en skillnad på 124 poäng
• Publicerat pris per minut – Vidu Q4 Preview $7,20 jämfört med Kling 3.0 1080p (Pro) $20,16, enligt vad som registrerats av Artificial Analysis
• Röstmognad – Klings siffra vilar på nästan tre gånger så många stickprov och är åtta månader äldre, vilket slår åt båda hållen: bättre mätt, och handlar om ett annat konkurrensfält
• Maximal upplösning — Vidu Q4 Preview upp till 4K med 2K och 4K i 10-bitars färg jämfört med Kling 3.0 upp till nativ 4K på OrcaRouter-modellkortet
• Klipplängd — Vidu Q4 Preview 3–16 s vid bild-till-video, 1–16 s vid referens-till-video jämfört med Kling 3.0 3–15 s, upp till sex tagningar i en enda generering på Turbo-vägen
• Referensindata – Vidu Q4 Preview upp till 15 referensbilder och upp till 3 referensljudklipp jämfört med Kling 3.0:s motiv- och rörelsestyrning, inte publicerat som en numerisk referensbudget för bild-till-video
Ett gap på 124 punkter är ungefär åtta gånger den sammanlagda bredden av de två intervallen. Det är inte jämnt på den resultattavlan, och det skulle inte bli det om urvalen utjämnades. Vad det är, är en jämförelse mellan en nivåindelad familj från februari 2026 och en förhandsversion från ett mindre labb i oktober 2026 — vilket är den ärliga beskrivningen och också själva poängen.

Prisjämförelsen du faktiskt inte kan göra
Här skulle en rak avgiftslinje vara missvisande, så det är värt att i stället uttrycka det explicit.
Siffrorna $20.16 och $7.20 ovan är de API-priser per minut som Artificial Analysis registrerar för varje modell. De är användbara som en jämförbar referens. De är inte priset du betalar om du anropar modellen via en router, eftersom routrar prissätter video per anrop eller per sekund beroende på rutten, och ett pris per anrop dividerat med en okänd klipplängd är inte ett pris per minut.
OrcaRouters Kling-rutter illustrerar poängen. kling/kling-v3 listas på vår egen modellsida till en fast avgift per anrop på $0,084, med sidans egen notering att fast prissättning per anrop är hur bildgenererings- och videorutterna debiteras. Dividera det med ett femsekundersklipp och du hamnar nära $1,01 per minut; dividera det med femton och du hamnar nära $0,34. Ingen av siffrorna är $20,16 på Artificial Analysis-tavlan, och ingen av dem är fel — de beskriver olika saker: ett listpris som leverantören publicerar kontra vad en viss rutt tar betalt för en generering vid en viss längd. kling/kling-3-turbo och kling/kling-v2-6 har också sina egna avgifter per anrop, på $0,112 och $0,042.
Den praktiska konsekvensen: om du budgeterar för Kling 3 är siffran som spelar roll din klipplängd multiplicerad med taxan för den väg du faktiskt anropar, och om du budgeterar för Vidu Q4 Preview är siffran som spelar roll samma räkneoperation mot ett förhandsvisningspris som Shengshu uttryckligen kallar kampanjpris. Jämför listor med listor och fakturor med fakturor, och blanda inte samman de två.

Där Kling 3 är det enda svaret
Två saker som Kling 3 gör som Vidu Q4 Preview inte gör, och ingen av dem är liten.
Generering med flera tagningar. Kling 3.0 Turbo-rutten på OrcaRouter är dokumenterad för att kunna producera upp till sex tagningar i en enda generering, vilket är en annan typ av verktyg än en modell som renderar ett enda sammanhängande klipp. Vidu Q4 Previews 16-sekunderstak och referens-till-video-läge syftar till att hålla en scen konsekvent; Klings taglista syftar till att producera en sekvens. För storyboardat arbete är det inte en marginell skillnad.
Text-till-video. Produktsidan för Vidu Q4 Preview listar två lägen och dess API dokumenterar två slutpunkter — /ent/v2/img2video och /ent/v2/reference2video — utan någon text-till-video-väg någonstans. Kling 3.0 1080p (Pro) är ankarmodellen på text-till-video-tavlan. Om din indata är en prompt snarare än en bildruta är en av dessa två modeller helt enkelt otillgänglig för dig, och ingen Elo-jämförelse ändrar på det.
Värt att tillägga från vår sida: vi routar Kling. kling/kling-v3, kling/kling-3-turbo och kling/kling-v2-6 finns på det publika modell-API:et och kan anropas på samma OpenAI-kompatibla endpoint som textmodellerna, till listpriser som förs vidare utan påslag, så en ändring av leverantörens prissättning slår igenom samma dag i stället för vid förnyelse. Vidu Q4 är inte en OrcaRouter-rutt, och den här sidan bör inte läsas som att den påstår det — videomodellerna vi tillhandahåller ligger på en och samma nyckel och endpoint tillsammans med allt annat, och att lägga till en förhandsversion när den går GA är ett routingbeslut snarare än ett återförsäljararrangemang.
Vilken Kling, och om det är värt besväret
Om du väljer inom Kling-familjen säger resultattavlan det som marknadsföringen inte gör: de fyra varianterna för bild-till-video är en och samma poäng klädd i fyra prislappar. Kling 3.0 720p (Standard) på 1 051 ligger fyra Elo under 1080p (Pro) på 1 055 och är 4,56 USD billigare per minut enligt den registrerade taxan. Omni-grenen förtjänar inte alls sitt premiumpris på den här tavlan.
Om du väljer mellan familjer: för bild-till-video ligger Vidu Q4 Preview 124 Elo över den bästa Kling 3-varianten till ungefär en tredjedel av det registrerade minutpriset, och det är slutsatsen. Men det är en förhandsversion mot en produktionsfamilj, den har ingen väg för text-till-video, och priset är kampanjpris. Kling 3 besvarar fler frågor och får lägre poäng på den enda resultattavlan där båda kan mätas.
Vad skulle ändra på detta: den fullständiga Vidu Q4-utgåvan, som enligt Shengshus egen utsago är där funktionsuppsättningen stabiliseras — om den lägger till text-till-video, upphör överlappningen att vara en enda resultattavla. Och AA-Video-I2V v2.0, som aviserats komma med en reviderad taxonomi och 1080p genomgående, vilket skulle ersätta dessa röster snarare än att sortera om dem. Tills en av dem landar är det nummer som ska behållas 124, daterat, med resultattavlans namn bredvid.
