MiniMax H3 puede generar interpretaciones más expresivas cuando el prompt describe no solo lo que dice un personaje, sino también cómo lo dice y qué hace mientras habla. En CawCut, puedes combinar indicaciones de voz integradas con comportamientos visuales claros para guiar risas, respiraciones, énfasis, dudas, sorpresas y otras reacciones. Los resultados pueden variar, así que prueba primero con prompts cortos.
1. Comprende cómo funcionan las etiquetas
Usa cuatro niveles de indicaciones:
- Etiquetas de formato de voz: Etiquetas integradas dentro del texto hablado, como
<pause>,<inhale>,<whisper>...</whisper>y<i>word</i>. - Etiquetas de efectos vocales: Indicaciones predefinidas escritas entre signos angulares, como
<chuckle>,<sighs>o<gasps>, que pueden añadir sonidos no verbales al audio generado. - Contexto emocional: Lenguaje natural fuera del diálogo que explica la intención, el estado de ánimo o la forma de hablar del personaje.
- Comportamiento visible: Microexpresiones faciales y acciones corporales que hacen visible la emoción, como una sonrisa breve, la mandíbula tensa, las cejas levantadas o una pausa antes de mirar a alguien.
Es mejor tratar las etiquetas como indicaciones de tiempo locales. Coloca cada indicación cerca de la palabra o el momento al que debe afectar. No dependas de una sola etiqueta para crear una emoción completa.
Por ejemplo, esta descripción es demasiado vaga:
La mujer está nerviosa.Esta descripción proporciona a MiniMax H3 más información visible:
La mujer mira el reloj dos veces, da golpecitos con los dedos sobre la carpeta, inspira brevemente y mira hacia la puerta cerrada.2. Escribe el bloque de diálogo
MiniMax H3 usa un bloque <d> para el contenido hablado. Mantén dentro del bloque la etiqueta de idioma y las palabras exactas del diálogo. Coloca fuera del bloque la identidad, la acción y la descripción de la forma de hablar del personaje.
Usa un ID de voz estable cada vez que hable un personaje. Conserva el mismo ID para ese personaje en todos los planos.
Una joven de voz suave y entrecortada (S1) dice con vacilación:
<d>[Spanish] Pensé que vendrías. <inhale> Me equivoqué.</d>Puedes añadir una indicación de énfasis cerca de una palabra concreta:
El hombre (S1) se inclina hacia la cámara y habla con una ira contenida:
<d>[Spanish] Prometiste que esto nunca ocurriría. <i>Nunca.</i></d>También puedes añadir una reacción no verbal:
La mujer (S1) intenta mantener la seriedad y luego deja escapar una pequeña risa:
<d>[Spanish] No puedo creer que hayas hecho eso. <chuckle></d>Entre las indicaciones de formato de voz se incluyen:
| Indicación | Qué hace | Ejemplo |
|---|---|---|
<pause> | Añade una pausa breve. | La señal se está perdiendo. <pause> Quédate conmigo. |
<long pause> | Añade una pausa más larga. | Me pidió que me fuera... <long pause> y me quedé. |
<breath> | Añade un sonido de respiración. | Llega al último piso. <breath> La puerta está abierta. |
<inhale> / <exhale> | Añade una inhalación o una exhalación. | <inhale> Empezamos a la cuenta de tres. |
<catches breath> | Da una forma de hablar entrecortada por la falta de aire. | He corrido hasta aquí. <catches breath> Dame un momento. |
<deep breath> | Añade una respiración profunda para calmarse. | <deep breath> Estoy listo para enfrentarme a ellos. |
<i>word</i> | Enfatiza de una a cuatro palabras. | Esto es exactamente el <i>resultado</i> que te advertí. |
<whisper>...</whisper> | Susurra las palabras incluidas. | <whisper> Las luces siguen encendidas.</whisper> |
<stutter> | Crea una forma de hablar entrecortada o tartamuda. | <stutter> N-no, no fue idea mía. |
Estas indicaciones de efectos vocales son experimentales y utilizan ajustes predefinidos. Las etiquetas de emoción personalizadas escritas entre signos angulares, como <nervous>, pueden leerse como texto normal en lugar de interpretarse como controles.
| Indicación | Qué hace | Ejemplo |
|---|---|---|
<laughs> / <chuckle> | Añade una risa, desde una carcajada hasta una risa breve. | Es lo más gracioso que he oído. <laughs> |
<snorts> | Añade un resoplido, normalmente como reacción involuntaria de diversión. | Intenté no reírme. <snorts> |
<humming> | Añade un tarareo en lugar de palabras habladas. | Camina por el pasillo tarareando. <humming> |
<breath> | Añade un sonido de respiración general. | Y entonces... <breath> ocurrió. |
<inhale> / <exhale> | Añade un sonido de inhalación o exhalación. | <inhale> Muy bien, empecemos. |
<pant> / <gasps> | Añade jadeos rápidos o una inhalación brusca. | Por fin cruza la línea de meta. <gasps> |
<coughs> / <clear-throat> | Añade tos o carraspeo antes de hablar. | <clear-throat> Tengo un anuncio que hacer. |
<sighs> | Añade un suspiro que puede sugerir resignación, tristeza o alivio. | Creo que tienes razón. <sighs> |
<lip-smacking> | Añade un sonido de chasquido de labios. | Hace una pausa, <lip-smacking> y después habla. |
<sniffs> | Añade el sonido de sorber por la nariz. | Se seca los ojos y <sniffs> sorbe por la nariz. |
<groans> | Añade un gemido, como señal de incomodidad o frustración. | <groans> No puedo levantar esto. |
<yawns> | Añade un bostezo. | Es muy tarde. <yawns> |
<sneezes> | Añade un estornudo. | Mira las flores y después <sneezes> estornuda. |
<burps> | Añade un eructo. | El personaje termina la bebida y <burps> eructa. |
<whistles> | Añade un silbido. | Se aleja silbando. <whistles> |
<hissing> | Añade un sonido sibilante. | El vapor escapa con un fuerte sonido de <hissing>. |
<emm> | Añade un sonido «emm» de duda o de relleno. | <emm> No estoy seguro. |
<crying> | Añade llanto o sollozos. | Intenté detenerlo. <crying> |
<applause> | Añade aplausos en la escena o en el fondo. | El orador termina y se escucha <applause> aplausos. |
Estas indicaciones funcionan mejor como instrucciones locales y precisas, no como una lista de palabras que debas memorizar. Usa el formato completo del personaje —(S1) junto con [Spanish] dentro de <d>— y coloca cada indicación cerca del momento al que debe afectar. Para enfatizar, usa <i>word</i> alrededor de una a cuatro palabras; las indicaciones entre corchetes, como [emphasis], pueden leerse en voz alta o afectar a una parte de la frase mayor de la esperada. Si una indicación produce un resultado no deseado, sustituye la etiqueta por una descripción natural de la forma de hablar fuera del bloque de diálogo. Si necesitas varias indicaciones de énfasis, sepáralas con <pause> para que el modelo tenga espacio para distinguir cada momento.
3. Añade emoción visible y contexto
Las etiquetas de voz pueden influir en el audio, pero el rostro y el cuerpo también necesitan indicaciones visuales. Describe la reacción en la línea temporal del plano:
[Shot 1] Primer plano cinematográfico de un detective cansado en una oficina poco iluminada. Lee el mensaje, levanta las cejas por un instante, aprieta los labios y aparta la mirada. Su voz es contenida, pero transmite dolor (S1):
<d>[Spanish] Prometiste quedarte. <sighs> ¿Qué se supone que debo hacer ahora?</d>Usa detalles concretos y observables:
- Sorpresa: ojos muy abiertos, cejas levantadas, boca abierta por un instante y cabeza ligeramente hacia atrás.
- Duda: una ceja levantada, mirada hacia un lado y labios tensos.
- Miedo: respiración superficial, ojos muy abiertos, hombros tensos y una mirada rápida hacia la salida.
- Alivio: hombros relajados, párpados suaves, una exhalación larga y una pequeña sonrisa desigual.
- Enfado: mandíbula tensa, ojos entrecerrados, postura rígida y forma de hablar entrecortada.
- Tristeza: mirada baja, movimientos más lentos, labios temblorosos y una respiración suave antes de hablar.
El contexto ayuda a que la emoción sea más coherente. Explica qué acaba de ocurrir antes de la frase y qué quiere el personaje. «Tiene miedo porque el pomo de la puerta está girando» suele guiar mejor la interpretación que «tiene miedo».
4. Crea y prueba el prompt
- Abre el flujo de generación de vídeo de MiniMax H3 en CawCut.
- Elige el modo de entrada que necesites, como texto a vídeo o imagen a vídeo.
- Escribe la descripción del plano en orden cronológico: escenario, sujeto, acción, cámara, reacción y diálogo.
- Añade un ID de voz estable e introduce la frase exacta dentro de
<d>. - Añade una o dos indicaciones integradas en el momento en que deban ocurrir. Usa
<i>...</i>para enfatizar de una a cuatro palabras, etiquetas de formato para controlar el tiempo o la forma de hablar, y etiquetas predefinidas entre signos angulares para los efectos vocales. - Si es posible, genera primero una prueba breve y de menor coste.
- Comprueba la voz, el ritmo, la reacción facial, el movimiento de la boca y la continuidad antes de ampliar el prompt o aumentar la calidad de salida.
Mantén el prompt centrado. Normalmente es más fácil controlar un plano con un solo cambio emocional que un personaje que pasa del miedo al enfado, la risa y la tristeza en la misma frase.
5. Soluciona los resultados poco fiables
- La etiqueta se lee en voz alta: Usa el formato completo
(S1) says: <d>[Spanish] ...</d>, prueba otra sintaxis o sustituye la etiqueta por una indicación de lenguaje natural fuera de<d>. Las etiquetas aisladas pueden verbalizarse. - La voz suena emotiva, pero la imagen no: Añade acciones faciales y corporales concretas a la descripción del plano.
- El personaje omite la respiración o la risa: Acerca la indicación a la frase correspondiente, usa el preajuste adecuado, como
<breath>o<laughs>, y reduce el número de etiquetas. - La voz del personaje cambia entre planos: Repite el mismo ID de voz y la misma descripción de voz, y mantén una estructura de diálogo coherente.
- La frase se dice demasiado rápido: Acorta la frase, aumenta el tiempo de generación, añade una pausa o una respiración y reduce el número de acciones del plano.
- El resultado no es estable: Cambia una sola variable cada vez. Prueba el mismo plano sin etiquetas, con una etiqueta y con una descripción diferente en lenguaje natural.
Para obtener rostros especialmente expresivos, prueba un primer plano con un fondo sencillo y mantén estables la cabeza y los hombros del sujeto dentro del encuadre. Así el modelo tiene menos tareas visuales que procesar mientras genera la voz y las microexpresiones.
El prompt más fiable es un breve documento de producción: describe lo que ve el espectador, lo que hace el personaje, lo que dice y cómo cambia el sonido en ese momento.