O MiniMax H3 pode gerar interpretações mais expressivas quando o prompt descreve não apenas o que um personagem diz, mas também como ele diz e o que faz enquanto fala. No CawCut, você pode combinar instruções de voz inline com comportamentos visuais claros para orientar risadas, respirações, ênfases, hesitação, surpresa e outras reações. Os resultados podem variar, então comece testando prompts curtos.
1. Entenda como as tags funcionam
Use quatro níveis de instrução:
- Tags de formatação da voz: Tags inline inseridas no texto falado, como
<pause>,<inhale>,<whisper>...</whisper>e<i>word</i>. - Tags de efeitos vocais: Instruções predefinidas escritas entre sinais de menor e maior, como
<chuckle>,<sighs>ou<gasps>, que podem adicionar sons não verbais ao áudio gerado. - Contexto emocional: Linguagem natural fora do diálogo que explica a intenção, o estado emocional ou a forma de falar do personagem.
- Comportamento visível: Microexpressões faciais e ações corporais que tornam a emoção visível, como um sorriso breve, a mandíbula contraída, as sobrancelhas erguidas ou uma pausa antes de olhar nos olhos.
Trate as tags como instruções locais de timing. Coloque cada instrução perto da palavra ou do momento que ela deve afetar. Não dependa de uma única tag para criar uma emoção completa.
Por exemplo, esta descrição é vaga demais:
A mulher está nervosa.Esta descrição fornece mais informações visíveis ao MiniMax H3:
A mulher olha o relógio duas vezes, tamborila os dedos sobre a pasta, inspira brevemente e olha para a porta fechada.2. Escreva o bloco de diálogo
O MiniMax H3 usa um bloco <d> para o conteúdo falado. Mantenha a tag de idioma e as palavras exatas do diálogo dentro do bloco. Coloque fora dele a identidade, a ação e a descrição da forma de falar do personagem.
Use um ID de voz estável sempre que um personagem falar. Mantenha o mesmo ID para esse personagem em todos os planos.
Uma jovem com voz suave e levemente ofegante (S1) diz, hesitante:
<d>[Portuguese] Eu achei que você viria. <inhale> Eu estava errada.</d>Você pode adicionar uma instrução de ênfase perto de uma palavra específica:
O homem (S1) se inclina em direção à câmera e fala com raiva contida:
<d>[Portuguese] Você prometeu que isso nunca aconteceria. <i>Nunca.</i></d>Também é possível adicionar uma reação não verbal:
A mulher (S1) tenta manter a seriedade e depois solta uma risada breve:
<d>[Portuguese] Não acredito que você fez isso. <chuckle></d>As instruções de formatação da voz incluem:
| Instrução | O que faz | Exemplo |
|---|---|---|
<pause> | Adiciona uma pausa curta. | O sinal está desaparecendo. <pause> Fique comigo. |
<long pause> | Adiciona uma pausa mais longa. | Ela pediu que eu fosse embora… <long pause> e eu fiquei. |
<breath> | Adiciona um som de respiração. | Ele chega ao último andar. <breath> A porta está aberta. |
<inhale> / <exhale> | Adiciona uma inspiração ou expiração. | <inhale> Começamos na contagem de três. |
<catches breath> | Cria uma forma de falar ofegante. | Eu corri até aqui. <catches breath> Me dê um minuto. |
<deep breath> | Adiciona uma respiração profunda para acalmar. | <deep breath> Estou pronto para enfrentá-los. |
<i>word</i> | Dá ênfase a uma a quatro palavras. | Esse é exatamente o <i>resultado</i> que eu avisei. |
<whisper>...</whisper> | Faz as palavras delimitadas serem sussurradas. | <whisper> As luzes ainda estão acesas.</whisper> |
<stutter> | Cria uma fala entrecortada ou gaguejada. | <stutter> N-não, essa não foi minha ideia. |
Estas instruções de efeitos vocais são experimentais e usam predefinições. Tags de emoção personalizadas escritas entre sinais de menor e maior, como <nervous>, podem ser lidas como texto normal em vez de interpretadas como comandos.
| Instrução | O que faz | Exemplo |
|---|---|---|
<laughs> / <chuckle> | Adiciona uma risada, de uma gargalhada a uma risada breve. | Essa é a coisa mais engraçada que já ouvi. <laughs> |
<snorts> | Adiciona um resfolegar, geralmente como reação involuntária de diversão. | Tentei não rir. <snorts> |
<humming> | Adiciona um cantarolar em vez de palavras faladas. | Ela atravessa o corredor cantarolando. <humming> |
<breath> | Adiciona um som geral de respiração. | E então… <breath> aconteceu. |
<inhale> / <exhale> | Adiciona o som de inspirar ou expirar. | <inhale> Muito bem, vamos começar. |
<pant> / <gasps> | Adiciona ofegos rápidos ou uma inspiração brusca. | Ele finalmente cruza a linha de chegada. <gasps> |
<coughs> / <clear-throat> | Adiciona tosse ou pigarro antes da fala. | <clear-throat> Tenho um anúncio a fazer. |
<sighs> | Adiciona um suspiro que pode sugerir resignação, tristeza ou alívio. | Acho que você tem razão. <sighs> |
<lip-smacking> | Adiciona um estalo de lábios. | Ele faz uma pausa, <lip-smacking> e depois fala. |
<sniffs> | Adiciona o som de fungar. | Ela enxuga os olhos e <sniffs> funga. |
<groans> | Adiciona um gemido, como sinal de desconforto ou frustração. | <groans> Não consigo levantar isso. |
<yawns> | Adiciona um bocejo. | Está muito tarde. <yawns> |
<sneezes> | Adiciona um espirro. | Ele olha para as flores e depois <sneezes> espirra. |
<burps> | Adiciona um arroto. | O personagem termina a bebida e <burps> arrota. |
<whistles> | Adiciona um assobio. | Ele se afasta assobiando. <whistles> |
<hissing> | Adiciona um som sibilante. | O vapor escapa com um som agudo de <hissing>. |
<emm> | Adiciona um som “emm” de hesitação ou preenchimento. | <emm> Não tenho certeza. |
<crying> | Adiciona choro ou soluços. | Eu tentei impedir. <crying> |
<applause> | Adiciona aplausos na cena ou no fundo. | O orador termina, seguido por <applause> aplausos. |
Essas instruções funcionam melhor como comandos locais e precisos do que como uma lista de palavras para memorizar. Use o formato completo do personagem —(S1) junto com [Portuguese] dentro de <d>— e coloque cada instrução perto do momento que ela deve afetar. Para dar ênfase, use <i>word</i> ao redor de uma a quatro palavras; instruções entre colchetes, como [emphasis], podem ser lidas em voz alta ou afetar uma parte da frase maior do que o esperado. Se uma instrução produzir um resultado indesejado, substitua a tag por uma descrição natural da forma de falar fora do bloco de diálogo. Se precisar de várias instruções de ênfase, separe-as com <pause> para que o modelo tenha espaço para distinguir cada momento.
3. Adicione emoção visível e contexto
As tags de voz podem influenciar o áudio, mas o rosto e o corpo também precisam de instruções visuais. Descreva a reação na linha do tempo do plano:
[Shot 1] Close-up cinematográfico de um detetive cansado em um escritório escuro. Ele lê a mensagem, levanta as sobrancelhas por um instante, aperta os lábios e desvia o olhar. Sua voz é contida, mas transmite mágoa (S1):
<d>[Portuguese] Você prometeu ficar. <sighs> O que eu devo fazer agora?</d>Use detalhes concretos e observáveis:
- Surpresa: arregalar os olhos, levantar as sobrancelhas, abrir a boca por um instante e recuar a cabeça.
- Dúvida: levantar uma sobrancelha, desviar o olhar para o lado e apertar os lábios.
- Medo: respiração superficial, olhos arregalados, ombros tensos e um olhar rápido para a saída.
- Alívio: deixar os ombros caírem, relaxar as pálpebras, soltar uma longa expiração e esboçar um pequeno sorriso irregular.
- Raiva: contrair a mandíbula, semicerrar os olhos, manter a postura rígida e falar de forma seca.
- Tristeza: baixar o olhar, diminuir os movimentos, deixar os lábios tremerem e respirar suavemente antes de falar.
O contexto torna a emoção mais consistente. Explique o que aconteceu imediatamente antes da fala e o que o personagem quer. “Ela está com medo porque a maçaneta está girando” geralmente orienta melhor a atuação do que “ela está com medo”.
4. Crie e teste o prompt
- Abra o fluxo de geração de vídeo do MiniMax H3 no CawCut.
- Escolha o modo de entrada necessário, como texto para vídeo ou imagem para vídeo.
- Escreva a descrição do plano em ordem cronológica: cenário, sujeito, ação, câmera, reação e diálogo.
- Adicione um ID de voz estável e coloque a fala exata dentro de
<d>. - Adicione uma ou duas instruções inline no momento em que devem ocorrer. Use
<i>...</i>para enfatizar de uma a quatro palavras, tags de formatação para controlar o timing ou a forma de falar e instruções predefinidas entre sinais angulares para efeitos vocais. - Se possível, gere primeiro uma versão de teste curta e de menor custo.
- Confira a voz, o timing, a reação facial, o movimento da boca e a continuidade antes de ampliar o prompt ou aumentar a qualidade da saída.
Mantenha o prompt focado. Em geral, é mais fácil controlar uma única mudança emocional por plano do que um personagem que passa do medo à raiva, ao riso e à tristeza na mesma frase.
5. Resolva resultados pouco confiáveis
- A tag é lida em voz alta: Use o formato completo
(S1) says: <d>[Portuguese] ...</d>, teste outra sintaxe ou substitua a tag por uma instrução em linguagem natural fora de<d>. Tags isoladas podem ser verbalizadas. - A voz parece emotiva, mas a imagem não: Adicione ações concretas do rosto e do corpo à descrição do plano.
- O personagem ignora a respiração ou a risada: Aproxime a instrução da frase correspondente, use a predefinição adequada, como
<breath>ou<laughs>, e reduza a quantidade de tags. - A voz do personagem muda entre os planos: Repita o mesmo ID de voz e a mesma descrição da voz, e mantenha uma estrutura de diálogo consistente.
- A fala é rápida demais: Encurte a frase, aumente o tempo de geração, adicione uma pausa ou respiração e reduza a quantidade de ações no plano.
- O resultado não é estável: Altere apenas uma variável por vez. Teste o mesmo plano sem tags, com uma tag e com uma descrição diferente em linguagem natural.
Para obter rostos especialmente expressivos, experimente um close-up com fundo simples e mantenha a cabeça e os ombros do sujeito estáveis no enquadramento. Assim, o modelo terá menos tarefas visuais para processar enquanto gera a voz e as microexpressões.
O prompt mais confiável é um breve documento de produção: descreva o que o espectador vê, o que o personagem faz, o que ele diz e como o som muda naquele momento.