在 CawCut 中掌握 MiniMax H3 情绪和语音标签

了解如何使用内嵌语音标签、情绪上下文和微表情,在 CawCut 中创建表现力更丰富的 MiniMax H3 视频。

更新于 2026年9月10日 · 5 分钟阅读

当提示词不仅描述角色说了什么,还描述台词的表达方式以及角色说话时的动作时,MiniMax H3 可以生成更具表现力的表演。在 CawCut 中,你可以将内嵌语音提示与清晰的视觉行为结合起来,引导笑声、呼吸、强调、犹豫、惊讶和其他反应。结果可能有所不同,因此请先测试较短的提示词。

1. 了解标签的工作方式

使用四个层次的指导:

  • 语音格式标签: 放在说话内容中的内嵌标签,例如 <pause><inhale><whisper>...</whisper><i>word</i>
  • 人声声音效果标签: 使用尖括号写出的预设提示,例如 <chuckle><sighs><gasps>,可以为生成的音频添加非语言声音。
  • 情绪上下文: 在对话外使用自然语言解释角色的意图、情绪或表达方式。
  • 可见行为: 通过面部微表情和身体动作呈现情绪,例如短暂微笑、绷紧下巴、抬起眉毛或在对视前停顿。

最好将标签视为局部的时间提示。将每个提示放在靠近它要影响的词语或时刻的位置。不要只依靠标签来创建完整的情绪。

例如,以下描述过于模糊:

女人感到紧张。

以下描述为 MiniMax H3 提供了更多可见信息:

女人查看了两次手表,用手指轻敲文件夹,短促地吸了一口气,然后看向紧闭的门。

2. 编写对话块

MiniMax H3 使用 <d> 块表示说话内容。将语言标签和准确的台词放在块内,将说话者身份、动作和表达方式描述放在块外。

角色说话时,请使用稳定的说话者 ID。在每个镜头中都为该角色保留相同的 ID。

一位声音轻柔、带有气声的年轻女子 (S1) 犹豫地说:
<d>[Chinese] 我以为你会来。<inhale> 是我错了。</d>

你可以在特定词语附近添加强调提示:

男子 (S1) 向镜头靠近,以克制的愤怒说道:
<d>[Chinese] 你答应过我,这种事永远不会发生。<i>永远。</i></d>

你也可以添加非语言反应:

女子 (S1) 努力保持严肃,随后忍不住轻笑起来:
<d>[Chinese] 我真不敢相信你做了那件事。<chuckle></d>

语音格式提示包括:

提示作用示例
<pause>短暂停顿信号越来越弱了。<pause> 坚持住。
<long pause>较长停顿她让我离开……<long pause> 但我留下了。
<breath>呼吸声他到达顶楼。<breath> 门开着。
<inhale> / <exhale>吸气或呼气<inhale> 我们数到三就开始。
<catches breath>气喘吁吁的表达我一路跑过来的。<catches breath> 给我一点时间。
<deep breath>用于平静下来的深呼吸<deep breath> 我准备好面对他们了。
<i>word</i>强调一到四个词这正是我警告过你的<i>结果</i>。
<whisper>...</whisper>将包裹的词语用耳语说出<whisper> 灯还亮着。</whisper>
<stutter>结巴或断断续续的表达<stutter> 不、不是我的主意。

以下人声声音效果提示是预设式实验功能。使用尖括号编写的自定义情绪标签(例如 <nervous>)可能会被当作普通台词朗读,而不会被识别为控制提示。

提示作用示例
<laughs> / <chuckle>添加笑声,从较强的笑声到短暂的轻笑这是我听过最好笑的事。<laughs>
<snorts>添加喷鼻息声,通常表示不自觉的笑意反应我努力忍住不笑。<snorts>
<humming>添加哼唱,而不是说出词语她哼着歌走过走廊。<humming>
<breath>添加普通呼吸声然后……<breath> 事情就发生了。
<inhale> / <exhale>添加吸气或呼气声<inhale> 好,我们开始吧。
<pant> / <gasps>添加急促喘息或突然倒吸气他终于冲过终点线。<gasps>
<coughs> / <clear-throat>在说话前添加咳嗽或清嗓声<clear-throat> 我有一件事要宣布。
<sighs>添加可以表示无奈、悲伤或释然的叹息我想你说得对。<sighs>
<lip-smacking>添加咂嘴声他停了一下,<lip-smacking> 然后开口说话。
<sniffs>添加吸鼻子的声音她擦了擦眼睛,又<sniffs>吸了一下鼻子。
<groans>添加表示不适或沮丧的呻吟声<groans> 我抬不动这个。
<yawns>添加打哈欠声已经很晚了。<yawns>
<sneezes>添加打喷嚏声他看向那些花,然后打了个喷嚏。<sneezes>
<burps>添加打嗝声角色喝完饮料后<burps>打了个嗝。
<whistles>添加口哨声他吹着口哨走远了。<whistles>
<hissing>添加嘶嘶声蒸汽伴随着尖锐的<hissing>嘶嘶声逸出。
<emm>添加表示犹豫或填充停顿的“emm”声音<emm> 我不太确定。
<crying>添加哭泣或抽泣声我试过阻止这一切。<crying>
<applause>在场景中或背景中添加掌声演讲者结束发言,随后响起<applause>掌声。

与其把这些提示当作需要记忆的独立词汇,不如把它们当作精确的局部指令。使用完整的说话者格式——(S1) 加上 <d> 内的 [English]——并将每个提示放在靠近其影响时刻的位置。对于强调,请使用 <i>word</i> 包裹一到四个词;像 [emphasis] 这样的方括号提示有时会被朗读出来,或影响整句中超出预期的内容。如果某个提示产生了不理想的结果,请在对话块外用自然语言描述表达方式。当需要多个强调提示时,用 <pause> 将它们分开,让模型有足够空间区分每个节拍。

3. 添加可见情绪和上下文

语音标签可以影响音频,但仍需要为面部和身体提供视觉指导。在镜头时间线中描述反应:

[Shot 1] 电影感特写镜头,昏暗的办公室里,一名疲惫的侦探读完消息,短暂地抬起眉毛,随后抿紧嘴唇并移开视线。他的声音克制,却带着受伤的情绪 (S1):
<d>[Chinese] 你答应过会留在这边,<sighs> 我现在要怎么办才好?</d>

亲自尝试这个场景!

使用具体、可观察的细节:

  • 惊讶: 眼睛睁大、眉毛抬起、嘴巴短暂张开、头部向后缩。
  • 怀疑: 一侧眉毛抬起、目光移向侧面、嘴唇绷紧。
  • 恐惧: 浅呼吸、眼睛睁大、肩膀紧绷、快速看向出口。
  • 释然: 肩膀下沉、眼睑放松、长长呼气、露出不太自然的微笑。
  • 愤怒: 下巴绷紧、眼睛眯起、姿势僵硬、语气简短。
  • 悲伤: 垂下目光、动作变慢、嘴唇颤抖、说话前轻轻吸气。

上下文可以让情绪更加一致。请解释台词前刚刚发生了什么,以及角色想要什么。“门把手正在转动,所以她很害怕”通常比“她很害怕”更能指导表演。

4. 构建并测试提示词

  1. 在 CawCut 中打开 MiniMax H3 视频生成工作流。
  2. 选择所需的输入模式,例如文生视频或图生视频。
  3. 按时间顺序编写镜头描述:场景、主体、动作、摄影机、反应和对话。
  4. 添加稳定的说话者 ID,并将准确的台词放在 <d> 中。
  5. 在它们应该发生的位置添加一到两个内嵌提示。使用 <i>...</i> 强调一到四个词,使用格式标签控制时间或表达方式,并使用尖括号预设提示添加人声效果。
  6. 如果可以,先生成较短、成本较低的测试版本。
  7. 在扩展提示词或提高输出质量前,检查声音、时间、面部反应、口型和连续性。

保持提示词简洁。相比让角色在同一句话中从恐惧转为愤怒、笑声和悲伤,每个镜头只包含一次情绪变化通常更容易控制。

5. 排查不稳定的结果

  • 标签被朗读出来: 使用完整的 (S1) says: <d>[English] ...</d> 结构,尝试其他语法,或在 <d> 外用自然语言描述表达方式。单独使用标签时,有时会被直接朗读出来。
  • 听起来有情绪,但画面看起来不对: 在镜头描述中添加具体的面部和身体动作。
  • 角色跳过了呼吸或笑声: 将提示移到靠近目标短语的位置,使用匹配的预设(例如 <breath><laughs>),并减少其他标签。
  • 角色在不同镜头中的声音发生变化: 重复使用相同的说话者 ID 和声音描述,并保持对话结构一致。
  • 台词说得太快: 缩短句子,延长生成时间,添加停顿或呼吸,并减少镜头中的动作数量。
  • 结果不稳定: 一次只改变一个变量。分别测试不使用标签、使用一个标签,以及改用另一种自然语言描述的同一镜头。

如果你希望获得更有表现力的面部效果,请测试使用简单背景的特写镜头,并让主体的头部和肩膀稳定地保持在画面中。这样可以减少模型在生成语音和微表情时需要处理的视觉任务。

最可靠的提示词是一份简短的制作说明:描述观众能看到什么、角色做了什么、角色说了什么,以及声音在那个时刻如何变化。

相关文章

常见问题

查找有关在 MiniMax H3 中使用情绪和表达提示的答案。

将提示直接放在 <d> 块中的说话内容里,紧挨着它要影响的词语前后。将说话者身份、动作和表达方式描述放在块外。对于强调,请用 <i>word</i> 包裹一到四个词。

使用完整的说话者格式,例如 (S1) says: <d>[English] ...</d>,不要单独测试标签。对于强调,请使用 <i>word</i> 包裹一到四个词,而不是使用 [emphasis]。如果结果仍不稳定,请在对话块外使用自然语言描述表达方式。

语音提示主要影响表达方式和非语言声音。请单独描述可见反应,例如眯起眼睛、露出犹豫的微笑、垂下目光或缓慢呼气,并将其放在镜头描述中。

可以,但请先在有意义的位置使用一到两个提示。在相邻标签之间留出空间,必要时添加暂停。过多标签可能相互竞争,使时间控制变得不稳定。

为说话角色指定稳定的说话者 ID,例如 (S1),重复使用相同的身份和声音描述,并按时间顺序描述每次情绪变化。