Guide de l’IA générative

Vidéo IA « Hotel Lobby » de Migos : réussir une scène en duo

underwood
underwood

Fondateur de Promptsref

Fondateur de Promptsref et créateur UGC spécialisé dans les workflows d’IA générative, l’ingénierie des prompts et la formation des créateurs, avec une audience de plus de 40 000 personnes sur les réseaux sociaux.

8 min de lecture
Dans cet article

Une pièce entièrement orange. Un seul micro vintage suspendu à hauteur des yeux. Deux silhouettes qui se répondent sur un rythme syncopé, parfaitement calées l’une sur l’autre.

En interprétant « HOTEL LOBBY » sur A COLORS SHOW en juin 2022, Quavo et Takeoff ont imposé une grammaire visuelle immédiatement reconnaissable. Des années plus tard, cette même dynamique revient dans nos fils d’actualité, transformée en un modèle de mème omniprésent.

À la place des grandes figures du hip-hop d’Atlanta, les algorithmes font désormais défiler des duos improbables : mascottes de dessins animés, méchants de cinéma, animaux de compagnie ou avatars de marques, tous installés dans le même décor minimaliste.

Mais derrière la plaisanterie virale se cache un véritable défi technique. Générer deux personnages qui interagissent tout en préservant leur identité, leur place respective et un éclairage cohérent pousse les modèles vidéo actuels dans leurs retranchements.

Voici ce qui fait fonctionner ce format, les obstacles rencontrés par les créateurs et ce que nos essais ont révélé sur la différence entre une vidéo exploitable et une scène où les personnages finissent par se confondre.

Les codes visuels qui rendent le format reconnaissable

Reproduire un format viral demande d’isoler les contraintes qui permettent au public de l’identifier au premier regard.

La plupart des créateurs qui tentent de reproduire ce mème partent dans la mauvaise direction avant même de lancer la génération, parce qu’ils comprennent mal la référence. « Hotel Lobby » est le titre du morceau ; les repères visuels viennent entièrement de l’esthétique du studio COLORS :

  • Un fond monochrome : un environnement orange, plat et très saturé, sans profondeur de pièce, angles de murs ni intérieur d’hôtel luxueux.
  • Un repère physique : un micro suspendu au centre, entre les deux personnages, qui fixe les proportions et les lignes de regard.
  • Une alternance rythmique : un échange clair, où l’un mène la performance pendant que l’autre réagit naturellement en retrait.

L’humour repose sur le contraste visuel. Lorsque deux chats ou deux ennemis de bande dessinée prennent place dans ce décor précis, le spectateur y projette spontanément le rythme et l’assurance de la vidéo d’origine.

Si les images de référence ne distinguent pas l’identité des personnages du contexte de la scène, le modèle de diffusion finit par mélanger les sujets et produire un résultat visuellement incohérent.

Les difficultés rencontrées par les créateurs

Les échanges sur des communautés Reddit comme r/ArtificialInteligence et r/aiagents font ressortir des obstacles techniques précis. Les utilisateurs ne cherchent pas des conseils génériques sur les prompts, mais une méthode de production qu’ils puissent reproduire.

Trois problèmes reviennent dans ces discussions :

  1. Le mélange des identités : les personnages de gauche et de droite échangent des traits du visage, des textures de vêtements ou des couleurs en cours de vidéo.
  2. La perte de l’alternance : les deux personnages parlent ou gesticulent en même temps, au lieu de se répondre chacun à leur tour.
  3. Le rejet des références : les dispositifs de sécurité signalent des contenus protégés lorsque des images du clip original sont directement utilisées pour guider les mouvements.

Au-delà de la technique, les discussions abordent aussi des questions culturelles plus nuancées. La recréation numérique de Takeoff après sa mort suscite souvent un sentiment mêlé de nostalgie et de malaise. D’où l’importance d’identifier clairement les contenus synthétiques et de créditer leurs créateurs d’origine.

Seedance 2.5 et MiniMax H3 à l’épreuve de nos tests

Pour évaluer la cohérence en conditions réelles, nous avons réalisé sur Promptsref des générations contrôlées avec les mêmes paires de personnages, en comparant deux grandes architectures de génération vidéo.

CritèreSeedance 2.5MiniMax H3
Maintien de l’identitéDétails riches, mais échecs fréquentsPersonnages bien distincts dans la durée
Fidélité des mouvementsConsignes souvent omisesÉchanges clairement alternés
Gestion de plusieurs sujetsTendance à les fusionnerSéparation spatiale nette

Lors de plusieurs séries de tests comparatifs, Seedance 2.5 s’est montré fragile sur les transferts de style prenant directement une vidéo comme référence.

Le modèle a signalé à plusieurs reprises les sources fournies ou ramené l’interaction du duo à un seul personnage central. Les éléments stylisés très contrastés étaient rendus proprement lorsqu’ils étaient générés seuls, mais les échanges alternés se réduisaient souvent à des poses statiques.

MiniMax H3 a montré une amélioration mesurable dans le maintien des rôles. L’attribution explicite des images d’entrée à des positions en coordonnées cartésiennes a permis au moteur de séparer la géométrie des personnages de la trajectoire des mouvements.

Dans les essais associant des formes très différentes — une figurine à l’allure de jouet et un personnage en forme de nuage, par exemple —, H3 a conservé la position du micro sans que les membres se déforment et se fondent les uns dans les autres au fil des échanges.

Deux exemples issus de nos tests

Un robot vert et un nuage couleur lavande

Voir la vidéo du robot vert et du nuage lavande, ainsi que son prompt.

Deux interprètes dans un studio orange

Voir la vidéo du duo dans le studio orange et son prompt.

Structurer les consignes de génération

Pour les équipes qui construisent leur propre chaîne de production, une interface spécialisée comme Hotel Lobby AI Video Generator évite la création fastidieuse de masques spatiaux à la main. L’outil gère les points de référence de la composition, ce qui permet de se concentrer sur le design des personnages.

Pour obtenir des résultats cohérents d’une génération à l’autre, il faut distinguer les consignes de placement de celles qui décrivent le déroulement de l’action.

Ne regroupez pas l’apparence et les mouvements dans une seule phrase interminable. Organisez plutôt les instructions par niveaux :

[Attribution des rôles]
- Rôle 1 (à gauche) : utiliser l’image d’entrée 01, conserver la position et la tenue propre à ce personnage.
- Rôle 2 (à droite) : utiliser l’image d’entrée 02, conserver la position et la silhouette du personnage.

[Environnement]
- Studio : cyclorama orange mat, micro de studio suspendu au centre, caméra fixe en plan large. Aucune rotation de la caméra autour de son axe optique.

[Déroulement des mouvements]
- Alternance : le rôle 1 fait un geste vers l’extérieur pendant que le rôle 2 écoute et bouge légèrement en rythme sur place ; le rôle 2 répond ensuite tandis que le rôle 1 ramène ses gestes.
  • Différenciez les personnages : choisissez des palettes et des silhouettes distinctes pour éviter que les mécanismes d’attention ne fassent la moyenne de leurs structures faciales.
  • Isolez les références : préparez les images des personnages sur un fond transparent ou neutre avant de les intégrer au processus.
  • Examinez les mains : vérifiez les séquences image par image lorsque les mains passent près du micro central. C’est le principal point de défaillance dans la génération de plusieurs personnages.
  • Respectez l’original : créditez explicitement la performance de Quavo et Takeoff et indiquez visiblement que votre vidéo est un hommage généré par IA.

Ce que ce format révèle de l’avenir de la vidéo IA

L’adoption rapide du décor à la manière de COLORS illustre la direction que prend la création de vidéos courtes avec l’IA.

Les prompts qui regroupent tout cèdent la place à des références modulaires. L’éclairage, les mouvements et l’identité des personnages peuvent être remplacés séparément, comme des éléments de production sur une timeline de montage.

Maîtriser la composition à plusieurs personnages donne un avantage considérable aux créateurs. Qu’il s’agisse de revisiter un format musical viral ou de réaliser un court métrage narratif, contrôler la façon dont deux personnages partagent le cadre reste le véritable test d’une génération vidéo adaptée à la production professionnelle.

À propos de l’auteur

underwood

underwood

Fondateur de Promptsref

Fondateur de Promptsref et créateur UGC spécialisé dans les workflows d’IA générative, l’ingénierie des prompts et la formation des créateurs, avec une audience de plus de 40 000 personnes sur les réseaux sociaux.