当提示词不仅描述角色说了什么,还描述台词的表达方式以及角色说话时的动作时,MiniMax H3 可以生成更具表现力的表演。在 CawCut 中,你可以将内嵌语音提示与清晰的视觉行为结合起来,引导笑声、呼吸、强调、犹豫、惊讶和其他反应。结果可能有所不同,因此请先测试较短的提示词。
1. 了解标签的工作方式
使用四个层次的指导:
- 语音格式标签: 放在说话内容中的内嵌标签,例如
<pause>、<inhale>、<whisper>...</whisper>和<i>word</i>。 - 人声声音效果标签: 使用尖括号写出的预设提示,例如
<chuckle>、<sighs>或<gasps>,可以为生成的音频添加非语言声音。 - 情绪上下文: 在对话外使用自然语言解释角色的意图、情绪或表达方式。
- 可见行为: 通过面部微表情和身体动作呈现情绪,例如短暂微笑、绷紧下巴、抬起眉毛或在对视前停顿。
最好将标签视为局部的时间提示。将每个提示放在靠近它要影响的词语或时刻的位置。不要只依靠标签来创建完整的情绪。
例如,以下描述过于模糊:
女人感到紧张。以下描述为 MiniMax H3 提供了更多可见信息:
女人查看了两次手表,用手指轻敲文件夹,短促地吸了一口气,然后看向紧闭的门。2. 编写对话块
MiniMax H3 使用 <d> 块表示说话内容。将语言标签和准确的台词放在块内,将说话者身份、动作和表达方式描述放在块外。
角色说话时,请使用稳定的说话者 ID。在每个镜头中都为该角色保留相同的 ID。
一位声音轻柔、带有气声的年轻女子 (S1) 犹豫地说:
<d>[Chinese] 我以为你会来。<inhale> 是我错了。</d>你可以在特定词语附近添加强调提示:
男子 (S1) 向镜头靠近,以克制的愤怒说道:
<d>[Chinese] 你答应过我,这种事永远不会发生。<i>永远。</i></d>你也可以添加非语言反应:
女子 (S1) 努力保持严肃,随后忍不住轻笑起来:
<d>[Chinese] 我真不敢相信你做了那件事。<chuckle></d>语音格式提示包括:
| 提示 | 作用 | 示例 |
|---|---|---|
<pause> | 短暂停顿 | 信号越来越弱了。<pause> 坚持住。 |
<long pause> | 较长停顿 | 她让我离开……<long pause> 但我留下了。 |
<breath> | 呼吸声 | 他到达顶楼。<breath> 门开着。 |
<inhale> / <exhale> | 吸气或呼气 | <inhale> 我们数到三就开始。 |
<catches breath> | 气喘吁吁的表达 | 我一路跑过来的。<catches breath> 给我一点时间。 |
<deep breath> | 用于平静下来的深呼吸 | <deep breath> 我准备好面对他们了。 |
<i>word</i> | 强调一到四个词 | 这正是我警告过你的<i>结果</i>。 |
<whisper>...</whisper> | 将包裹的词语用耳语说出 | <whisper> 灯还亮着。</whisper> |
<stutter> | 结巴或断断续续的表达 | <stutter> 不、不是我的主意。 |
以下人声声音效果提示是预设式实验功能。使用尖括号编写的自定义情绪标签(例如 <nervous>)可能会被当作普通台词朗读,而不会被识别为控制提示。
| 提示 | 作用 | 示例 |
|---|---|---|
<laughs> / <chuckle> | 添加笑声,从较强的笑声到短暂的轻笑 | 这是我听过最好笑的事。<laughs> |
<snorts> | 添加喷鼻息声,通常表示不自觉的笑意反应 | 我努力忍住不笑。<snorts> |
<humming> | 添加哼唱,而不是说出词语 | 她哼着歌走过走廊。<humming> |
<breath> | 添加普通呼吸声 | 然后……<breath> 事情就发生了。 |
<inhale> / <exhale> | 添加吸气或呼气声 | <inhale> 好,我们开始吧。 |
<pant> / <gasps> | 添加急促喘息或突然倒吸气 | 他终于冲过终点线。<gasps> |
<coughs> / <clear-throat> | 在说话前添加咳嗽或清嗓声 | <clear-throat> 我有一件事要宣布。 |
<sighs> | 添加可以表示无奈、悲伤或释然的叹息 | 我想你说得对。<sighs> |
<lip-smacking> | 添加咂嘴声 | 他停了一下,<lip-smacking> 然后开口说话。 |
<sniffs> | 添加吸鼻子的声音 | 她擦了擦眼睛,又<sniffs>吸了一下鼻子。 |
<groans> | 添加表示不适或沮丧的呻吟声 | <groans> 我抬不动这个。 |
<yawns> | 添加打哈欠声 | 已经很晚了。<yawns> |
<sneezes> | 添加打喷嚏声 | 他看向那些花,然后打了个喷嚏。<sneezes> |
<burps> | 添加打嗝声 | 角色喝完饮料后<burps>打了个嗝。 |
<whistles> | 添加口哨声 | 他吹着口哨走远了。<whistles> |
<hissing> | 添加嘶嘶声 | 蒸汽伴随着尖锐的<hissing>嘶嘶声逸出。 |
<emm> | 添加表示犹豫或填充停顿的“emm”声音 | <emm> 我不太确定。 |
<crying> | 添加哭泣或抽泣声 | 我试过阻止这一切。<crying> |
<applause> | 在场景中或背景中添加掌声 | 演讲者结束发言,随后响起<applause>掌声。 |
与其把这些提示当作需要记忆的独立词汇,不如把它们当作精确的局部指令。使用完整的说话者格式——(S1) 加上 <d> 内的 [English]——并将每个提示放在靠近其影响时刻的位置。对于强调,请使用 <i>word</i> 包裹一到四个词;像 [emphasis] 这样的方括号提示有时会被朗读出来,或影响整句中超出预期的内容。如果某个提示产生了不理想的结果,请在对话块外用自然语言描述表达方式。当需要多个强调提示时,用 <pause> 将它们分开,让模型有足够空间区分每个节拍。
3. 添加可见情绪和上下文
语音标签可以影响音频,但仍需要为面部和身体提供视觉指导。在镜头时间线中描述反应:
[Shot 1] 电影感特写镜头,昏暗的办公室里,一名疲惫的侦探读完消息,短暂地抬起眉毛,随后抿紧嘴唇并移开视线。他的声音克制,却带着受伤的情绪 (S1):
<d>[Chinese] 你答应过会留在这边,<sighs> 我现在要怎么办才好?</d>使用具体、可观察的细节:
- 惊讶: 眼睛睁大、眉毛抬起、嘴巴短暂张开、头部向后缩。
- 怀疑: 一侧眉毛抬起、目光移向侧面、嘴唇绷紧。
- 恐惧: 浅呼吸、眼睛睁大、肩膀紧绷、快速看向出口。
- 释然: 肩膀下沉、眼睑放松、长长呼气、露出不太自然的微笑。
- 愤怒: 下巴绷紧、眼睛眯起、姿势僵硬、语气简短。
- 悲伤: 垂下目光、动作变慢、嘴唇颤抖、说话前轻轻吸气。
上下文可以让情绪更加一致。请解释台词前刚刚发生了什么,以及角色想要什么。“门把手正在转动,所以她很害怕”通常比“她很害怕”更能指导表演。
4. 构建并测试提示词
- 在 CawCut 中打开 MiniMax H3 视频生成工作流。
- 选择所需的输入模式,例如文生视频或图生视频。
- 按时间顺序编写镜头描述:场景、主体、动作、摄影机、反应和对话。
- 添加稳定的说话者 ID,并将准确的台词放在
<d>中。 - 在它们应该发生的位置添加一到两个内嵌提示。使用
<i>...</i>强调一到四个词,使用格式标签控制时间或表达方式,并使用尖括号预设提示添加人声效果。 - 如果可以,先生成较短、成本较低的测试版本。
- 在扩展提示词或提高输出质量前,检查声音、时间、面部反应、口型和连续性。
保持提示词简洁。相比让角色在同一句话中从恐惧转为愤怒、笑声和悲伤,每个镜头只包含一次情绪变化通常更容易控制。
5. 排查不稳定的结果
- 标签被朗读出来: 使用完整的
(S1) says: <d>[English] ...</d>结构,尝试其他语法,或在<d>外用自然语言描述表达方式。单独使用标签时,有时会被直接朗读出来。 - 听起来有情绪,但画面看起来不对: 在镜头描述中添加具体的面部和身体动作。
- 角色跳过了呼吸或笑声: 将提示移到靠近目标短语的位置,使用匹配的预设(例如
<breath>或<laughs>),并减少其他标签。 - 角色在不同镜头中的声音发生变化: 重复使用相同的说话者 ID 和声音描述,并保持对话结构一致。
- 台词说得太快: 缩短句子,延长生成时间,添加停顿或呼吸,并减少镜头中的动作数量。
- 结果不稳定: 一次只改变一个变量。分别测试不使用标签、使用一个标签,以及改用另一种自然语言描述的同一镜头。
如果你希望获得更有表现力的面部效果,请测试使用简单背景的特写镜头,并让主体的头部和肩膀稳定地保持在画面中。这样可以减少模型在生成语音和微表情时需要处理的视觉任务。
最可靠的提示词是一份简短的制作说明:描述观众能看到什么、角色做了什么、角色说了什么,以及声音在那个时刻如何变化。