Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

LongCat-Video-Avatar 1.5 : licence MIT sur les poids, matériel lourd exigé

3 min de lecture · huggingface.co · 21 août 2026
Vérification : Contexte manquant L'information est exacte, mais il lui manque un élément sans lequel on la comprend mal. « Des développeurs chinois ont publié LongCat-Avatar, une IA libre et gratuite qui transforme une photo et un fichier audio en vidéo parlante réaliste, humiliant l'industrie payante de la vidéo par IA. » Voir la publication d'origine (ouvre un nouvel onglet)

D'après Fiche officielle du modèle LongCat-Video-Avatar 1.5 (Meituan), relayé par X (@mikenevermiss)

LongCat-Video-Avatar 1.5 : licence MIT sur les poids, matériel lourd exigé

Image : générée (Gemini)

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Ce sont les poids du modèle, c'est-à-dire le fichier contenant ce qu'il a appris, qui sont sous licence MIT. La nuance compte : l'ouverture porte sur le modèle livré, pas sur les données qui ont servi à l'entraîner, lesquelles ne sont pas publiées.
  • Ce que le modèle fait : il produit une vidéo à partir d'audio et de texte, ou d'audio, de texte et d'une image, et sait aussi prolonger une vidéo existante. La version 1.5 remplace son encodeur audio par Whisper-Large, ce que l'équipe présente comme le gain principal sur le mouvement des lèvres.
  • Il n'est pas neuf : la version 1.5 date du 4 juin 2026 et une première version existait dès décembre 2025. Le message viral parle d'une sortie toute récente, ce que la page officielle du modèle ne soutient pas.
  • Ce que le message passe sous silence : la commande officielle lance deux processus en parallèle sur cartes graphiques. Ce n'est pas un service en ligne où l'on dépose une photo, mais un modèle à installer soi-même, avec une option de compression pour réduire la mémoire vidéo nécessaire.
  • L'évaluation citée est celle du fabricant : 508 paires image-audio, 770 personnes recrutées pour noter les vidéos, 13 240 jugements. La méthode est détaillée, mais elle est menée par l'équipe qui publie le modèle, pas par un tiers indépendant.

Pourquoi ça compte

Des avatars parlants convaincants, produits à partir d'une seule photo et d'un fichier audio, deviennent accessibles à quiconque dispose du matériel voulu, sans abonnement ni autorisation. C'est utile pour de la formation, et c'est aussi, pour toute cette famille d'outils et non pour celui-ci en particulier, le socle des vidéos où l'on fait dire n'importe quoi à n'importe qui. L'équipe renvoie d'ailleurs aux développeurs la responsabilité d'évaluer sécurité et conformité avant tout usage sensible.

Chiffre-clé

13 240 jugements rendus par 770 personnes recrutées pour l'occasion, sur 508 paires image-audio, selon l'évaluation publiée par l'équipe LongCat de Meituan dans la fiche officielle de la version 1.5.

Citation

« This model has not been specifically designed or comprehensively evaluated for every possible downstream application. (Ce modèle n'a pas été spécifiquement conçu ni évalué de manière exhaustive pour tous les usages possibles qui pourraient en découler.) » Équipe LongCat de Meituan, fiche officielle du modèle

Action concrète

Avant d'espérer l'essayer : ce n'est pas un site où l'on téléverse une photo. Il faut installer l'environnement, télécharger les poids, et disposer de cartes graphiques, la commande officielle en mobilisant deux en parallèle. L'équipe recommande aussi des consignes longues et détaillées plutôt que courtes.

« SOME CHINESE DEVELOPERS JUST HUMILIATED THE ENTIRE PAID AI VIDEO INDUSTRY WITH A FREE TOOL. they released LongCat-Avatar, an open-source AI that turns a photo and audio file into a realistic talking video with synchronized lip movements. »

Fondée sur la source originale

Sources

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !