Kling O1 — génération vidéo de nouvelle génération avec texte vers vidéo, image vers vidéo, contrôle de sujet et édition de référence vidéo, clips de 5 à 10 secondes, modes standard/pro.
kling/kling-video-o1 est un modèle de génération texte-vers-vidéo créé par Kling, une division de Kuaishou Technology. Il prend en entrée une invite en langage naturel et produit un fichier vidéo. Le…
kling/kling-video-o1 génère de courtes vidéos à partir de descriptions textuelles. La durée maximale exacte et la résolution ne sont pas précisées dans les faits fournis ; les modèles texte-vers-vidéo typiques de Kling produisent des clips allant de quelques secondes à environ 10 secondes, souvent en 720p ou 1080p. Le modèle peut représenter une grande variété de scènes, allant d'environnements réalistes à des animations stylisées, selon la description. Il vise un alignement esthétique élevé, ce qui signifie que la sortie doit être visuellement agréable et cohérente avec la description. Cependant, la qualité de génération peut varier en fonction de la clarté et de la complexité de la description.
Le AA T2V Arena (Aesthetic Alignment Text-to-Video Arena) mesure la préférence humaine pour la qualité vidéo et l'alignement avec la consigne. kling/kling-video-o1 a obtenu un score de 1209.0, indiquant de bonnes performances dans la production de vidéos que les évaluateurs ont trouvées esthétiquement attrayantes et sémantiquement précises. Cela suggère que le modèle est bien adapté aux projets créatifs où la qualité visuelle est prioritaire. Les utilisateurs peuvent s'attendre à des sorties qui correspondent généralement au contenu décrit et qui sont cohérentes. Le score reflète également la compétitivité par rapport à d'autres modèles vidéo dans le même benchmark.
Si votre cas d'utilisation n'exige pas une qualité esthétique élevée ou si vous générez des vidéos pour des tests internes où la perfection visuelle n'est pas cruciale, un modèle vidéo moins cher ou plus rapide pourrait être plus rentable. De plus, si vous avez besoin de vidéos très longues ou de résolutions spécifiques non prises en charge par kling/kling-video-o1, d'autres modèles peuvent offrir ces fonctionnalités à moindre coût. Sur OrcaRouter, vous pouvez comparer les prix entre différents modèles vidéo pour trouver la meilleure solution. Évaluez toujours le compromis entre qualité et prix en fonction de votre volume et de vos besoins spécifiques.
Comme pour la plupart des modèles texte-vers-vidéo, les performances diminuent avec des prompts extrêmement abstraits, très détaillés ou contradictoires. kling/kling-video-o1 est optimisé pour un langage naturel clair et descriptif. Pour les prompts qui spécifient plusieurs personnages, actions et changements de scène, le modèle peut simplifier ou omettre des éléments. Il fonctionne mieux lorsque le prompt décrit une scène ou une action unique et cohérente. Pour une narration séquentielle, plusieurs générations peuvent être nécessaires. Aucune directive spécifique d'ingénierie de prompts n'est fournie, mais les utilisateurs doivent utiliser un langage concis et concret pour de meilleurs résultats.
AA T2V Arena signifie Aesthetic Alignment Text-to-Video Arena. Il s'agit d'un benchmark participatif où des évaluateurs humains comparent deux vidéos générées à partir de la même consigne et choisissent celle qu'ils préfèrent en fonction de la qualité globale et de l'alignement avec le texte. Le score de 1209.0 pour kling/kling-video-o1 est une note de type Elo dérivée de ces comparaisons par paires. Ce score indique le classement relatif du modèle ; plus il est élevé, meilleure est la préférence humaine. Le benchmark se concentre sur l'attrait visuel et la fidélité à la consigne, et non sur des métriques comme le FID ou le score CLIP.
Le score 1209.0 est le résultat de la soumission des sorties de kling/kling-video-o1 à l'AA T2V Arena, où il a été confronté à d'autres modèles texte-vers-vidéo dans des comparaisons en aveugle. Chaque vidéo générée a été évaluée par des juges humains pour la qualité esthétique et la fidélité à la consigne. Le système de classement Elo a été utilisé pour calculer le score final. Cela signifie que le modèle a bien performé dans des duels directs, gagnant plus souvent qu'il ne perdait face à un ensemble de modèles concurrents. Pour contexte, les scores varient généralement de 1000 à 1500 ; 1209 le place au-dessus de la moyenne.
Un seul score de benchmark est fourni : 1209.0 sur AA T2V Arena. Il n'y a aucune information sur la vitesse d'inférence, la latence, les limites de durée vidéo, la résolution ou les capacités de traitement par lots. Les utilisateurs doivent noter que les scores de benchmark ne garantissent pas les performances sur toutes les invites ou charges de travail en production. Le modèle peut présenter des biais, des artefacts ou des modes d'échec courants dans les modèles texte-vers-vidéo (par exemple, scintillement, mouvement irréaliste, morphing d'objets). Sans faits supplémentaires, les limitations spécifiques ne peuvent être énumérées. Testez toujours avec vos propres invites avant de déployer à grande échelle.
Aucune donnée spécifique sur la vitesse d'inférence ou la latence n'est fournie pour kling/kling-video-o1. La génération texte-vers-vidéo prend généralement plus de temps que la génération d'images en raison de la dimension temporelle. Les performances réelles dépendent de la durée de la vidéo, de la résolution, de la complexité de la scène et du matériel sous-jacent utilisé par Kling. Sur OrcaRouter, l'API peut présenter une latence réseau supplémentaire. Pour comprendre les temps de réponse typiques, il est conseillé aux utilisateurs d'exécuter des tests de performance avec des invites représentatives dans les conditions de charge attendues. Contactez le support d'OrcaRouter pour des conseils au niveau du service si nécessaire.
Les prix exacts par génération de vidéo ne sont pas fournis dans les informations données. OrcaRouter facture en fonction du tarif du fournisseur, qui peut être par seconde de vidéo, par demande de génération ou par temps de calcul. En général, les modèles de meilleure qualité coûtent plus cher. Les utilisateurs doivent consulter la page des prix d'OrcaRouter ou la documentation de l'API pour connaître le coût actuel du modèle « kling/kling-video-o1 ». Étant donné que les prix peuvent changer, il est toujours recommandé de vérifier avant de créer des applications sensibles aux coûts. Il n'y a aucune indication d'utilisation gratuite ou de crédits.
Aucune information sur une remise de volume n'est fournie. OrcaRouter peut proposer une tarification par paliers ou des forfaits prépayés pour l'accès à l'API, mais cela n'est pas spécifique à kling/kling-video-o1. Pour les utilisateurs à haute fréquence, il est conseillé de contacter OrcaRouter directement pour discuter d'une tarification personnalisée. De plus, si votre cas d'utilisation permet des sorties de moindre qualité, envisagez d'utiliser un modèle moins cher sur OrcaRouter pour réduire les coûts. Le fournisseur (Kling) peut également avoir ses propres accords de tarification qui affectent ce que OrcaRouter facture.
La mise en cache n'est pas mentionnée dans les faits fournis pour kling/kling-video-o1. En général, les modèles texte-vers-vidéo génèrent des sorties uniques par invite en raison de l'échantillonnage stochastique, ce qui rend les succès de cache peu probables sauf si la même invite et la même graine sont réutilisées. OrcaRouter peut mettre en cache les générations fréquemment demandées, mais aucune information n'est disponible. Pour la gestion des coûts, supposez que chaque génération entraîne des frais distincts. Pour éviter des coûts redondants, concevez votre application pour réutiliser les vidéos générées lorsque cela est possible, plutôt que de régénérer des invites identiques.
Utilisez le point de terminaison de complétions de chat compatible OpenAI ou le point de terminaison dédié à la génération de vidéos. L'URL de base est https://api.orcarouter.ai/v1. Définissez le paramètre model sur "kling/kling-video-o1". L'authentification est requise, généralement via une clé API dans l'en-tête Authorization. Pour une génération texte-vers-vidéo, vous envoyez probablement une charge utile JSON avec un champ prompt. Le format exact de la requête peut varier ; consultez la documentation d'OrcaRouter pour le schéma spécifique. Un exemple minimal avec curl : curl https://api.orcarouter.ai/v1/video/generations \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"kling/kling-video-o1","prompt":"A cat walking on a beach at sunset"}'
Les paramètres disponibles ne sont pas entièrement documentés dans les faits fournis. Les paramètres courants pour les modèles texte-vers-vidéo incluent prompt (obligatoire), negative_prompt, num_frames, width, height, guidance_scale, seed et num_inference_steps. kling/kling-video-o1 prend probablement en charge un sous-ensemble de ceux-ci. Puisque OrcaRouter abstrait le fournisseur, certains paramètres peuvent être transformés ou limités. Commencez par les paramètres Kling documentés et testez la compatibilité. Vérifiez toujours les messages d'erreur si un paramètre n'est pas pris en charge. Des valeurs par défaut seront appliquées pour les paramètres manquants.
Si vous utilisez déjà l'API compatible OpenAI d'OrcaRouter avec un modèle vidéo différent, la migration est simple : remplacez le champ model de l'ancien ID par « kling/kling-video-o1 ». Assurez-vous que le format de votre invite est compatible. Si vous utilisiez une API différente (par exemple, l'API directe Kling), réécrivez les requêtes pour correspondre au schéma d'OrcaRouter. Aucune modification du code d'inférence n'est nécessaire côté client si vous respectez le format standard d'OpenAI. Testez avec des requêtes individuelles avant de basculer le trafic de production. Notez que la qualité des résultats et la latence peuvent différer.
OrcaRouter utilise l'authentification par clé API. Vous devez inclure votre clé API dans l'en-tête Authorization sous la forme "Bearer YOUR_API_KEY". Les clés API sont généralement générées à partir du tableau de bord OrcaRouter. Gardez-les secrètes. Pour des raisons de sécurité, évitez de coder en dur les clés dans le code source ; utilisez des variables d'environnement. Si vous devez faire pivoter les clés, mettez à jour votre configuration en conséquence. OrcaRouter peut également prendre en charge d'autres méthodes d'authentification comme OAuth, mais les faits fournis ne le précisent pas. Suivez les bonnes pratiques pour un accès sécurisé à l'API.
Kling a publié plusieurs versions, notamment Kling 1.0, 1.5, et diverses variantes comme Kling-video-o1. Le score AA T2V Arena de 1209.0 suggère que ce modèle performe bien en alignement esthétique. Sans les scores des autres modèles Kling, une comparaison directe n'est pas possible. Généralement, les modèles plus récents améliorent la qualité et la fidélité. La désignation "o1" pourrait indiquer un raisonnement ou une planification améliorés pour les prompts complexes, mais cela reste spéculatif. Les utilisateurs devraient comparer les résultats sur leurs propres prompts pour décider quel modèle Kling correspond le mieux à leurs besoins.
OrcaRouter offre un accès à plusieurs modèles de génération vidéo provenant de différents fournisseurs. Le score de référence de 1209.0 de kling/kling-video-o1 sur AA T2V Arena le place dans une fourchette compétitive. D'autres modèles comme Stable Video Diffusion, Pika ou RunwayML peuvent avoir des atouts différents (par exemple, vitesse, contrôle, réalisme). Comme aucun benchmark direct entre modèles n'est fourni, les utilisateurs doivent évaluer en fonction de leurs besoins spécifiques : respect des consignes, style visuel, temps de génération et coût. L'API unifiée d'OrcaRouter permet de tester facilement plusieurs modèles en changeant simplement l'ID du modèle.
Les modèles vidéo moins chers peuvent avoir une qualité esthétique inférieure, des vidéos plus courtes ou davantage d'artefacts. Le score AA T2V Arena suggère que kling/kling-video-o1 produit des résultats de haute qualité, ce qui justifie un prix plus élevé pour les utilisateurs qui privilégient l'attrait visuel. Si votre projet tolère une qualité moindre ou s'il s'agit d'un prototype interne, un modèle moins cher peut réduire les coûts. Sur OrcaRouter, vous pouvez comparer des échantillons générés côte à côte pour quantifier la différence. Pensez également à la vitesse d'inférence : les modèles plus chers peuvent aussi prendre plus de temps à générer. La décision doit trouver un équilibre entre budget, qualité et débit.
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="kling/kling-video-o1",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Par requête | $0.0840 |
| Devise | USD |
| Frais fixes par appel API (modèles de génération d'images) | |
GET /api/public/models/kling/kling-video-o1Ouvrir @misc{orcarouter_kling_video_o1,
title = {kling/kling-video-o1 API},
author = {kling},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kling/kling-video-o1}
}kling. (n.d.). kling/kling-video-o1 API. OrcaRouter. https://www.orcarouter.ai/models/kling/kling-video-o1