Kling O1 — nästa generations videogenerering med text-till-video, bild-till-video, motivkontroll och videoreferensredigering, 5–10 sekunders klipp, std/pro-lägen.
kling/kling-video-o1 är en text-till-video-genereringsmodell skapad av Kling, en division inom Kuaishou Technology. Den tar en naturlig språkprompt som indata och genererar en videofil. Modellen är…
kling/kling-video-o1 genererar korta videoklipp från textprompter. Den exakta maximala längden och upplösningen anges inte i de givna fakta; typiska text-till-video-modeller från Kling producerar klipp som varar från några sekunder upp till cirka 10 sekunder, ofta i 720p eller 1080p. Modellen kan avbilda en mängd olika scener, från realistiska miljöer till stiliserade animationer, beroende på prompten. Den strävar efter hög estetisk överensstämmelse, vilket innebär att utdata ska vara visuellt tilltalande och överensstämma med beskrivningen. Kvaliteten på genereringen kan dock variera beroende på promptens tydlighet och komplexitet.
AA T2V Arena (Aesthetic Alignment Text-to-Video Arena) mäter mänsklig preferens för videokvalitet och överensstämmelse med prompten. kling/kling-video-o1 fick 1209,0, vilket indikerar stark prestanda i att producera videor som bedömare fann estetiskt tilltalande och semantiskt korrekta. Detta tyder på att modellen är väl lämpad för kreativa projekt där visuell kvalitet prioriteras. Användare kan förvänta sig resultat som generellt matchar det beskrivna innehållet och ser sammanhängande ut. Poängen återspeglar också konkurrenskraft jämfört med andra videomodeller i samma riktmärke.
Om ditt användningsfall inte kräver hög estetisk kvalitet eller om du genererar videor för intern testning där visuell polish inte är avgörande, kan en billigare eller snabbare videomodell vara mer kostnadseffektiv. Dessutom, om du behöver mycket långa videor eller specifika upplösningar som inte stöds av kling/kling-video-o1, kan alternativa modeller erbjuda dessa funktioner till lägre kostnad. På OrcaRouter kan du jämföra priser mellan olika videomodeller för att hitta den bästa passformen. Utvärdera alltid avvägningen mellan kvalitet och pris för din specifika volym och dina krav.
Liksom de flesta text-till-video-modeller försämras prestandan vid extremt abstrakta, mycket detaljerade eller motsägelsefulla promptar. kling/kling-video-o1 är optimerad för tydligt, beskrivande naturligt språk. För promptar som anger flera karaktärer, handlingar och scenförändringar kan modellen förenkla eller utelämna element. Den fungerar bäst när prompten beskriver en enda sammanhängande scen eller handling. För sekventiellt berättande kan flera generationer behövas. Inga specifika riktlinjer för promptteknik tillhandahålls, men användare bör använda koncis och konkret språk för bästa resultat.
AA T2V Arena står för Aesthetic Alignment Text-to-Video Arena. Det är en crowdsourcad referenspunkt där mänskliga bedömare jämför två genererade videor från samma prompt och väljer den de föredrar baserat på övergripande kvalitet och överensstämmelse med texten. Poängen 1209,0 för kling/kling-video-o1 är en Eloliknande rating som härleds från dessa parvisa jämförelser. Poängen indikerar modellens relativa position; högre är bättre för mänsklig preferens. Referenspunkten fokuserar på visuell tilltalande och prompttrohet, inte på mått som FID eller CLIP-score.
Poängen 1209,0 är resultatet av att skicka in utdata från kling/kling-video-o1 till AA T2V Arena, där den tävlade mot andra text-till-video-modeller i blindjämförelser. Varje genererad video utvärderades av mänskliga bedömare med avseende på estetisk kvalitet och hur väl den matchade prompten. Elo-betygssystemet användes för att beräkna slutpoängen. Det innebär att modellen presterade bra i head-to-head-matcher och vann oftare än den förlorade mot en uppsättning konkurrerande modeller. För sammanhang: poängen ligger vanligtvis mellan 1000 och 1500; 1209 placerar den över genomsnittet.
Endast ett benchmarkresultat anges: 1209,0 på AA T2V Arena. Det finns ingen information om slutledningshastighet, latens, videolängdsbegränsningar, upplösning eller batchbearbetningskapacitet. Användare bör notera att benchmarkresultat inte garanterar prestanda på alla prompts eller produktionsarbetsbelastningar. Modellen kan ha fördomar, artefakter eller feltillstånd som är vanliga för text-till-video-modeller (t.ex. flimmer, orealistisk rörelse, objektmorfning). Utan ytterligare fakta kan specifika begränsningar inte räknas upp. Testa alltid med egna prompts innan du distribuerar i stor skala.
Inga specifika siffror för inferenshastighet eller latens anges för kling/kling-video-o1. Text-till-video-generering tar vanligtvis längre tid än bildgenerering på grund av den tidsmässiga dimensionen. Den faktiska prestandan beror på videons längd, upplösning, scenens komplexitet och den underliggande hårdvaran som används av Kling. På OrcaRouter kan API:t ha ytterligare nätverkslatens. För att förstå typiska svarstider rekommenderas användare att köra benchmarktester med representativa prompts under förväntad belastning. Kontakta OrcaRouter-supporten för vägledning på servicenivå om det behövs.
Exakt prissättning per videogenerering anges inte i de givna fakta. OrcaRouter fakturerar baserat på leverantörens taxa, vilken kan vara per sekund video, per genereringsförfrågan eller per beräkningstid. Vanligtvis kostar modeller av högre kvalitet mer. Användare bör besöka OrcaRouters prissättningssida eller API-dokumentation för aktuell kostnad för modellen "kling/kling-video-o1". Eftersom prissättningen kan förändras, verifiera alltid innan du bygger kostnadskänsliga applikationer. Det finns ingen indikation på gratis användning eller krediter.
Ingen information om volymrabatt ges. OrcaRouter kan erbjuda nivåbaserad prissättning eller förbetalda paket för API-åtkomst, men detta är inte specifikt för kling/kling-video-o1. För högfrekventa användare är det lämpligt att kontakta OrcaRouter direkt för att diskutera anpassad prissättning. Dessutom, om din användning tillåter lägre kvalitetsutdata, överväg att använda en billigare modell på OrcaRouter för att minska kostnaderna. Leverantören (Kling) kan också ha egna prisavtal som påverkar vad OrcaRouter tar betalt.
Cache nämns inte i de angivna fakta för kling/kling-video-o1. Typiskt sett genererar text-till-video-modeller unika utdata per prompt på grund av stokastisk sampling, vilket gör cacheträffar osannolika om inte exakt samma prompt och seed återanvänds. OrcaRouter kan cachelagra ofta efterfrågade generationer, men ingen information finns tillgänglig. För kostnadshantering, anta att varje generation medför en separat avgift. För att undvika överflödiga kostnader, utforma din applikation för att återanvända genererade videor när det är möjligt, istället för att återgenerera identiska prompts.
Använd antingen OpenAI-kompatibla chattkompletteringar eller en dedikerad videogenereringsslutpunkt. Bas-URL:en är https://api.orcarouter.ai/v1. Ställ in modellparametern till "kling/kling-video-o1". Autentisering krävs, vanligtvis via en API-nyckel i Authorization-huvudet. För text-till-video-generering skickar du troligen en JSON-nyttolast med ett fältet "prompt". Exakt förfrågningsformat kan variera; konsultera OrcaRouters dokumentation för det specifika schemat. Ett minimalt curl-exempel: curl https://api.orcarouter.ai/v1/video/generations \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"kling/kling-video-o1","prompt":"A cat walking on a beach at sunset"}'
Tillgängliga parametrar är inte fullt dokumenterade i de angivna fakta. Vanliga parametrar för text-till-video-modeller inkluderar prompt (obligatorisk), negative_prompt, num_frames, width, height, guidance_scale, seed och num_inference_steps. kling/kling-video-o1 stöder sannolikt en delmängd av dessa. Eftersom OrcaRouter abstraherar leverantören kan vissa parametrar omvandlas eller begränsas. Börja med de dokumenterade Kling-parametrarna och testa för kompatibilitet. Kontrollera alltid efter felmeddelanden om en parameter inte stöds. Standardvärden kommer att tillämpas för saknade parametrar.
Om du redan använder OrcaRouters OpenAI-kompatibla API med en annan videomodell är migreringen enkel: ändra modellfältet från det gamla ID:t till "kling/kling-video-o1". Se till att ditt promptformat är kompatibelt. Om du använde ett annat API (t.ex. direkt Kling API), skriv om förfrågningarna så att de matchar OrcaRouters schema. Inga ändringar i slutledningskoden är nödvändiga på klientsidan om du håller dig till OpenAIs standardformat. Testa med enskilda förfrågningar innan du växlar produktionstrafik. Observera att utdatakvalitet och latens kan skilja sig.
OrcaRouter använder API-nyckelautentisering. Du måste inkludera din API-nyckel i Authorization-header som "Bearer DIN_API_NYCKEL". API-nycklar genereras vanligtvis från OrcaRouters instrumentpanel. Håll dem hemliga. För säkerhet, undvik att hårdkoda nycklar i källkod; använd miljövariabler. Om du behöver rotera nycklar, uppdatera din konfiguration därefter. OrcaRouter kan även stödja andra autentiseringsmetoder som OAuth, men de angivna fakta specificerar inte detta. Följ bästa praxis för säker API-åtkomst.
Kling har släppt flera versioner, inklusive Kling 1.0, 1.5 och olika varianter som Kling-video-o1. AA T2V Arena-poängen på 1209,0 indikerar att modellen presterar bra i estetisk anpassning. Utan poäng för andra Kling-modeller är direkt jämförelse inte möjlig. Generellt sett förbättrar nyare modeller kvalitet och trohet. Beteckningen "o1" kan indikera förbättrat resonemang eller planering för komplexa uppmaningar, men detta är spekulativt. Användare bör jämföra utdata på sina egna uppmaningar för att avgöra vilken Kling-modell som bäst passar deras behov.
OrcaRouter erbjuder tillgång till flera videogenereringsmodeller från olika leverantörer. kling/kling-video-o1:s benchmark-poäng på 1209.0 på AA T2V Arena placerar den i ett konkurrenskraftigt intervall. Andra modeller som Stable Video Diffusion, Pika eller RunwayML kan ha olika styrkor (t.ex. hastighet, kontroll, realism). Eftersom ingen direkt jämförande benchmark mellan modeller tillhandahålls bör användare utvärdera baserat på sina specifika krav: promptföljsamhet, visuell stil, genereringstid och kostnad. OrcaRouters enhetliga API gör det enkelt att testa flera modeller genom att helt enkelt ändra modell-ID.
Billigare videomodeller kan ha lägre estetisk kvalitet, kortare videolängder eller fler artefakter. AA T2V Arena-poängen antyder att kling/kling-video-o1 levererar högkvalitativa resultat, vilket motiverar ett högre pris för användare som prioriterar visuellt tilltalande. Om ditt projekt tål lägre kvalitet eller är avsett för intern prototyputveckling kan en billigare modell minska kostnaderna. På OrcaRouter kan du jämföra genererade exempel sida vid sida för att kvantifiera skillnaden. Tänk också på inferenshastigheten: dyrare modeller kan även ta längre tid att generera. Beslutet bör balansera budget, kvalitet och genomströmning.
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="kling/kling-video-o1",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Per förfrågan | $0.0840 |
| Valuta | USD |
| Fast avgift per API-anrop (bildgenereringsmodeller) | |
GET /api/public/models/kling/kling-video-o1Öppna @misc{orcarouter_kling_video_o1,
title = {kling/kling-video-o1 API},
author = {kling},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kling/kling-video-o1}
}kling. (n.d.). kling/kling-video-o1 API. OrcaRouter. https://www.orcarouter.ai/models/kling/kling-video-o1