MiniMax H3 peut générer des interprétations plus expressives lorsque le prompt décrit non seulement ce que dit un personnage, mais aussi la manière dont il le dit et ce qu’il fait pendant qu’il parle. Dans CawCut, vous pouvez combiner des indications vocales intégrées avec des comportements visuels clairs pour guider les rires, les respirations, l’emphase, l’hésitation, la surprise et d’autres réactions. Les résultats peuvent varier : commencez donc par tester des prompts courts.
1. Comprendre le fonctionnement des tags
Utilisez quatre niveaux d’indications :
- Tags de format vocal : Tags intégrés dans le texte parlé, comme
<pause>,<inhale>,<whisper>...</whisper>et<i>word</i>. - Tags d’effets vocaux : Indications prédéfinies écrites entre chevrons, comme
<chuckle>,<sighs>ou<gasps>, qui peuvent ajouter des sons non verbaux à l’audio généré. - Contexte émotionnel : Langage naturel placé en dehors du dialogue pour expliquer l’intention, l’humeur ou la façon de parler du personnage.
- Comportement visible : Microexpressions faciales et actions corporelles qui rendent l’émotion visible, comme un bref sourire, une mâchoire crispée, des sourcils levés ou une pause avant d’établir un contact visuel.
Considérez les tags comme des indications de timing locales. Placez chaque indication près du mot ou du moment qu’elle doit influencer. Ne comptez pas sur un seul tag pour créer une émotion complète.
Par exemple, cette description est trop vague :
La femme est nerveuse.Cette description fournit davantage d’informations visibles à MiniMax H3 :
La femme regarde sa montre deux fois, tapote le dossier du bout des doigts, prend une courte inspiration, puis regarde la porte fermée.2. Rédiger le bloc de dialogue
MiniMax H3 utilise un bloc <d> pour le contenu parlé. Gardez le tag de langue et les mots exacts du dialogue à l’intérieur du bloc. Placez l’identité, l’action et la description de la façon de parler du personnage à l’extérieur.
Utilisez un ID vocal stable chaque fois qu’un personnage parle. Conservez le même ID pour ce personnage dans tous les plans.
Une jeune femme à la voix douce et légèrement soufflée (S1) dit avec hésitation :
<d>[French] Je pensais que tu viendrais. <inhale> Je me suis trompée.</d>Vous pouvez ajouter une indication d’emphase près d’un mot précis :
L’homme (S1) se penche vers la caméra et parle avec une colère maîtrisée :
<d>[French] Tu avais promis que cela n’arriverait jamais. <i>Jamais.</i></d>Vous pouvez également ajouter une réaction non verbale :
La femme (S1) essaie de rester sérieuse, puis laisse échapper un petit rire :
<d>[French] Je n’arrive pas à croire que tu aies fait ça. <chuckle></d>Les indications de format vocal comprennent notamment :
| Indication | Effet | Exemple |
|---|---|---|
<pause> | Ajoute une courte pause. | Le signal s’affaiblit. <pause> Reste avec moi. |
<long pause> | Ajoute une pause plus longue. | Elle m’a demandé de partir… <long pause> et je suis resté. |
<breath> | Ajoute un son de respiration. | Il atteint le dernier étage. <breath> La porte est ouverte. |
<inhale> / <exhale> | Ajoute une inspiration ou une expiration. | <inhale> On commence à trois. |
<catches breath> | Donne une façon de parler essoufflée. | J’ai couru jusqu’ici. <catches breath> Laisse-moi une minute. |
<deep breath> | Ajoute une profonde inspiration pour se calmer. | <deep breath> Je suis prêt à les affronter. |
<i>word</i> | Met en avant un à quatre mots. | C’est exactement le <i>résultat</i> dont je t’avais prévenu. |
<whisper>...</whisper> | Fait chuchoter les mots entourés. | <whisper> Les lumières sont toujours allumées.</whisper> |
<stutter> | Crée une façon de parler saccadée ou bégayée. | <stutter> N-non, ce n’était pas mon idée. |
Ces indications d’effets vocaux sont expérimentales et utilisent des réglages prédéfinis. Les tags d’émotion personnalisés écrits entre chevrons, comme <nervous>, peuvent être lus comme du texte normal au lieu d’être interprétés comme des commandes.
| Indication | Effet | Exemple |
|---|---|---|
<laughs> / <chuckle> | Ajoute un rire, du rire franc au petit rire bref. | C’est la chose la plus drôle que j’aie entendue. <laughs> |
<snorts> | Ajoute un reniflement, souvent comme réaction amusée involontaire. | J’ai essayé de ne pas rire. <snorts> |
<humming> | Ajoute un fredonnement à la place de paroles. | Elle traverse le couloir en fredonnant. <humming> |
<breath> | Ajoute un son de respiration général. | Et puis… <breath> c’est arrivé. |
<inhale> / <exhale> | Ajoute une inspiration ou une expiration. | <inhale> Très bien, commençons. |
<pant> / <gasps> | Ajoute des halètements rapides ou une inspiration brusque. | Il franchit enfin la ligne d’arrivée. <gasps> |
<coughs> / <clear-throat> | Ajoute une toux ou un raclement de gorge avant de parler. | <clear-throat> J’ai une annonce à faire. |
<sighs> | Ajoute un soupir pouvant exprimer la résignation, la tristesse ou le soulagement. | Je crois que tu as raison. <sighs> |
<lip-smacking> | Ajoute un claquement de lèvres. | Il marque une pause, <lip-smacking> puis parle. |
<sniffs> | Ajoute le son d’un reniflement. | Elle s’essuie les yeux et <sniffs> renifle. |
<groans> | Ajoute un gémissement, par exemple en cas d’inconfort ou de frustration. | <groans> Je ne peux pas soulever ça. |
<yawns> | Ajoute un bâillement. | Il est très tard. <yawns> |
<sneezes> | Ajoute un éternuement. | Il regarde les fleurs, puis <sneezes> éternue. |
<burps> | Ajoute un rot. | Le personnage finit sa boisson et <burps> rote. |
<whistles> | Ajoute un sifflement. | Il s’éloigne en sifflant. <whistles> |
<hissing> | Ajoute un sifflement aigu. | La vapeur s’échappe dans un bruit aigu de <hissing>. |
<emm> | Ajoute un son « emm » d’hésitation ou de remplissage. | <emm> Je ne suis pas sûr. |
<crying> | Ajoute des pleurs ou des sanglots. | J’ai essayé de l’arrêter. <crying> |
<applause> | Ajoute des applaudissements dans la scène ou en arrière-plan. | L’orateur termine, puis on entend des <applause> applaudissements. |
Ces indications fonctionnent mieux comme des instructions locales et précises que comme une liste de mots à mémoriser. Utilisez le format complet du personnage —(S1) avec [French] à l’intérieur de <d>— et placez chaque indication près du moment qu’elle doit influencer. Pour l’emphase, utilisez <i>word</i> autour d’un à quatre mots ; les indications entre crochets, comme [emphasis], peuvent être lues à voix haute ou s’appliquer à une partie de la phrase plus large que prévu. Si une indication produit un résultat indésirable, remplacez-la par une description naturelle de la façon de parler, à l’extérieur du bloc de dialogue. Si plusieurs indications d’emphase sont nécessaires, séparez-les avec <pause> afin de laisser au modèle l’espace nécessaire pour distinguer chaque moment.
3. Ajouter une émotion visible et du contexte
Les tags de voix peuvent influencer l’audio, mais le visage et le corps ont également besoin d’indications visuelles. Décrivez la réaction dans la chronologie du plan :
[Shot 1] Gros plan cinématographique d’un détective fatigué dans un bureau sombre. Il lit le message, lève brièvement les sourcils, serre les lèvres, puis détourne le regard. Sa voix est retenue, mais exprime une blessure (S1) :
<d>[French] Tu avais promis de rester. <sighs> Qu’est-ce que je suis censé faire maintenant ?</d>Utilisez des détails concrets et observables :
- Surprise : yeux écarquillés, sourcils levés, bouche brièvement ouverte et tête légèrement reculée.
- Doute : un sourcil levé, un regard qui se déplace sur le côté et des lèvres serrées.
- Peur : respiration superficielle, yeux écarquillés, épaules tendues et regard rapide vers la sortie.
- Soulagement : épaules qui retombent, paupières détendues, longue expiration et petit sourire irrégulier.
- Colère : mâchoire crispée, yeux plissés, posture rigide et débit haché.
- Tristesse : regard baissé, mouvements ralentis, lèvres tremblantes et respiration douce avant de parler.
Le contexte rend l’émotion plus cohérente. Expliquez ce qui vient de se passer avant la réplique et ce que veut le personnage. « Elle a peur parce que la poignée de la porte tourne » guide généralement mieux l’interprétation que « elle a peur ».
4. Créer et tester le prompt
- Ouvrez le workflow de génération vidéo MiniMax H3 dans CawCut.
- Choisissez le mode d’entrée dont vous avez besoin, comme texte vers vidéo ou image vers vidéo.
- Rédigez la description du plan dans l’ordre chronologique : décor, sujet, action, caméra, réaction et dialogue.
- Ajoutez un ID vocal stable et placez la réplique exacte dans
<d>. - Ajoutez une ou deux indications intégrées à l’endroit où elles doivent se produire. Utilisez
<i>...</i>pour mettre en avant un à quatre mots, les tags de format pour contrôler le timing ou la façon de parler, et les indications prédéfinies entre chevrons pour les effets vocaux. - Si possible, générez d’abord une version de test courte et moins coûteuse.
- Vérifiez la voix, le timing, la réaction du visage, le mouvement de la bouche et la continuité avant d’allonger le prompt ou d’augmenter la qualité de sortie.
Gardez le prompt ciblé. Il est généralement plus facile de contrôler un seul changement émotionnel par plan qu’un personnage qui passe de la peur à la colère, au rire et à la tristesse dans la même phrase.
5. Résoudre les résultats peu fiables
- Le tag est lu à voix haute : Utilisez le format complet
(S1) says: <d>[French] ...</d>, essayez une autre syntaxe ou remplacez le tag par une indication en langage naturel à l’extérieur de<d>. Les tags isolés peuvent être verbalisés. - La voix paraît émotive, mais l’image ne l’est pas : Ajoutez des actions concrètes du visage et du corps à la description du plan.
- Le personnage ignore la respiration ou le rire : Rapprochez l’indication de la phrase concernée, utilisez le préréglage correspondant, comme
<breath>ou<laughs>, et réduisez le nombre de tags. - La voix du personnage change d’un plan à l’autre : Réutilisez le même ID vocal et la même description de voix, et conservez une structure de dialogue cohérente.
- La réplique est prononcée trop vite : Raccourcissez la phrase, augmentez la durée de génération, ajoutez une pause ou une respiration et réduisez le nombre d’actions dans le plan.
- Le résultat n’est pas stable : Ne modifiez qu’une variable à la fois. Testez le même plan sans tag, avec un tag, puis avec une autre description en langage naturel.
Pour obtenir des visages particulièrement expressifs, essayez un gros plan avec un arrière-plan simple et gardez la tête et les épaules du sujet stables dans le cadre. Le modèle aura ainsi moins de tâches visuelles à traiter pendant la génération de la voix et des microexpressions.
Le prompt le plus fiable est une courte fiche de production : décrivez ce que voit le spectateur, ce que fait le personnage, ce qu’il dit et la manière dont le son évolue à ce moment-là.