Ovi : le modèle open source de vidéo IA avec son
Ovi permet de générer une courte vidéo avec son synchronisé à partir d’un texte ou d’une image : dialogues avec mouvement des lèvres, bruitages et musique naissent en même temps que l’image. C’est un modèle open source publié par des chercheurs de Character.AI, sous licence Apache 2.0. Il s’installe sur un ordinateur équipé d’une carte graphique puissante, ou s’utilise en ligne chez des hébergeurs payants à la vidéo. Il s’adresse aux développeurs, aux créateurs techniques et aux curieux de la vidéo IA open source.
Découvrir Ovi
Ovi a été présenté le 30 septembre 2025 dans un article scientifique signé par Chetwin Low et Weimin Wang, de Character.AI, et Calder Katyal, de l’université Yale. Le code est publié sur le GitHub de Character.AI, et les poids du modèle sur Hugging Face. La version 1.1, sortie le 10 novembre 2025, porte les clips à 10 secondes. Aucune version plus récente n’a été publiée depuis.
Le modèle compte 11 milliards de paramètres. Sa partie vidéo reprend Wan 2.2, et sa partie audio a été entraînée à part avant d’être fusionnée avec l’image. L’hébergeur fal.ai le présente comme le premier modèle vidéo open source à générer le son de façon native.
Le site ovi.video n’est pas un site officiel. Il ne cite jamais Character.AI, ne donne aucun éditeur et ses pages de conditions renvoient une erreur. D’autres sites copies portent aussi le nom Ovi.
Prise en main
En local, vous clonez le dépôt GitHub, vous téléchargez les poids sur Hugging Face, puis vous lancez l’interface Gradio. Le prompt décrit la scène, place les répliques entre des balises dédiées et termine par une description du son. Une image de départ reste facultative.
Il faut au moins 32 Go de mémoire vidéo avec les optimisations prévues, ou 24 Go en version allégée avec une perte de qualité. Sans cette machine, vous passez par un hébergeur comme fal.ai ou WaveSpeed : vous créez un compte, vous choisissez le mode texte ou image, puis vous payez chaque vidéo.
Fonctionnalités clés
Vidéo et son générés ensemble
Ovi produit en une seule passe l’image et le son : paroles synchronisées avec les lèvres, plusieurs personnes qui parlent, bruitages et musique. Les répliques s’écrivent directement dans le prompt. Les auteurs reconnaissent que la musique fine et les timbres complexes restent aplatis. Le modèle fonctionne mieux sur des personnages humains.
Clips de 5 à 10 secondes
La version 1.1 génère 10 secondes en 960 × 960 pixels à 24 images par seconde. La version courte produit 5 secondes en 720 × 720. Les formats vertical, horizontal et carré sont proposés. Les récits longs et les changements de plan sortent du périmètre du modèle.
Trois modes de création
Ovi part d’un texte, d’une image, ou d’un texte transformé en image puis en vidéo. Le troisième mode passe par le modèle d’image Flux. Le modèle fonctionne aussi dans ComfyUI grâce à une extension communautaire. Une intégration au moteur vLLM est en cours.
Cas d’usage
Développeur : il intègre Ovi par API dans une application qui génère des vidéos parlantes. Il paie alors chaque clip au lieu d’un abonnement.
Créateur équipé d’une grosse carte graphique : il installe le modèle et génère des clips sans frais par vidéo. Il enchaîne ensuite les essais, car le résultat varie d’une génération à l’autre.
Vidéaste amateur : il teste un dialogue court avec son synchronisé pour un projet personnel. Il assemble également plusieurs clips dans son logiciel de montage.
Chercheur ou étudiant : il étudie un modèle vidéo et audio ouvert, avec son code et son article. Il compare ainsi les approches open source et fermées.
Tarifs
Le modèle Ovi est gratuit sous licence Apache 2.0, qui autorise l’usage commercial, à condition de disposer d’un ordinateur avec au moins 24 à 32 Go de mémoire vidéo. Ensuite, les hébergeurs facturent chaque génération : 0,15 $ par vidéo de 5 secondes chez WaveSpeed et 0,20 $ par vidéo chez fal.ai. Enfin, le site non officiel ovi.video se dit gratuit et sans limite, sans éditeur identifié ni conditions consultables.
Analyse des points forts et limites
Points forts
- Son natif : les dialogues, les bruitages et la musique sortent avec l’image, sans outil séparé.
- Open source : le code et les poids sont publics, sous une licence qui autorise l’usage commercial.
- Coût faible en ligne : un clip revient à 0,15 ou 0,20 $ chez les hébergeurs.
- Équipe identifiée : les auteurs, l’article scientifique et le dépôt officiel sont publics.
Limites
- Machine exigeante : l’installation locale demande au moins 24 à 32 Go de mémoire vidéo.
- Résultats irréguliers : un testeur compare le modèle à une machine à sous, où une bonne consigne peut donner une mauvaise vidéo.
- Définition limitée : les clips plafonnent à 960 × 960 pixels et 10 secondes.
- Sites copies : ovi.video et d’autres domaines reprennent le nom sans lien démontré avec Character.AI.
- Français non documenté : aucune source ne précise les langues prises en charge pour les dialogues.
Notre recommandation
Ovi convient aux développeurs et aux créateurs techniques qui veulent un modèle vidéo avec son, ouvert et peu coûteux. Passez par fal.ai ou WaveSpeed pour tester quelques clips avant d’envisager une installation locale. Utilisez le dépôt GitHub officiel comme point de départ plutôt que les sites qui reprennent le nom. Pour une vidéo plus longue ou plus nette sans compétence technique, Kling ou Veo restent plus simples à utiliser.
Questions fréquentes sur Ovi
Ovi est-il gratuit ?
Oui, le modèle est gratuit et open source sous licence Apache 2.0. Il faut une carte graphique d’au moins 24 à 32 Go de mémoire vidéo pour le faire tourner. En ligne, les hébergeurs facturent environ 0,15 à 0,20 $ par clip.
Le site ovi.video appartient-il à Character.AI ?
Rien ne l’indique. Le site ne cite jamais Character.AI, ne donne aucun éditeur et ses conditions sont introuvables. L’accès officiel passe par le dépôt GitHub de Character.AI et la page Hugging Face du modèle.
Quelle est la durée maximale d’une vidéo Ovi ?
La version 1.1 génère jusqu’à 10 secondes en 960 × 960 pixels. La version courte produit 5 secondes en 720 × 720. Pour une vidéo plus longue, il faut assembler plusieurs clips.
Peut-on utiliser Ovi pour un projet commercial ?
La licence Apache 2.0 autorise l’usage commercial du modèle. Chez un hébergeur, ses propres conditions s’appliquent en plus. WaveSpeed rappelle que les droits dépendent de la licence fixée par Character.AI.
Ovi ou LTX-2 : lequel choisir ?
LTX-2.3, de Lightricks, génère aussi le son et monte jusqu’à la 4K et 20 secondes. Chez fal.ai, il coûte 0,08 $ par seconde en 1080p. Ovi produit des clips plus courts et moins nets, mais revient moins cher par vidéo.
Pour aller plus loin : parcourez notre page Créer des vidéos avec l’IA, et comparez avec Kling et Veo.
Mise à jour : 26 septembre 2026













