在 CawCut 中掌握 MiniMax H3 情緒與語音標籤

瞭解如何使用內嵌語音標籤、情緒脈絡與微表情,在 CawCut 中建立表現力更豐富的 MiniMax H3 影片。

更新於 2026年9月10日 · 5 分鐘閱讀

當提示詞不只描述角色說了什麼,也描述台詞的表達方式,以及角色說話時的動作,MiniMax H3 就能生成更具表現力的表演。在 CawCut 中,你可以將內嵌語音提示與清楚的視覺行為結合,引導笑聲、呼吸、強調、猶豫、驚訝與其他反應。結果可能有所不同,因此請先測試較短的提示詞。

1. 瞭解標籤的運作方式

使用四個層次的指示:

  • 語音格式標籤: 放在口說內容中的內嵌標籤,例如 <pause><inhale><whisper>...</whisper><i>word</i>
  • 人聲音效標籤: 使用尖括號寫出的預設提示,例如 <chuckle><sighs><gasps>,可以在生成的音訊中加入非語言聲音。
  • 情緒脈絡: 在對話外使用自然語言,解釋角色的意圖、情緒或表達方式。
  • 可見行為: 透過面部微表情與身體動作呈現情緒,例如短暫微笑、繃緊下巴、抬起眉毛,或在對視前停頓。

最好將標籤視為局部的時間提示。將每個提示放在靠近它要影響的詞語或時刻的位置。不要只依靠標籤來建立完整的情緒。

例如,以下描述過於模糊:

女人感到緊張。

以下描述則為 MiniMax H3 提供更多可見資訊:

女人查看了兩次手錶,用手指輕敲資料夾,短促地吸了一口氣,然後看向緊閉的門。

2. 撰寫對話區塊

MiniMax H3 使用 <d> 區塊表示口說內容。將語言標籤與準確的台詞放在區塊內,將說話者身分、動作與表達方式的描述放在區塊外。

角色說話時,請使用穩定的說話者 ID。在每個鏡頭中都為該角色保留相同的 ID。

一位聲音輕柔、帶有氣聲的年輕女子 (S1) 猶豫地說:
<d>[Chinese] 我以為你會來。<inhale> 是我錯了。</d>

你可以在特定詞語附近加入強調提示:

男子 (S1) 朝鏡頭靠近,以克制的憤怒說道:
<d>[Chinese] 你答應過我,這種事永遠不會發生。<i>永遠。</i></d>

你也可以加入非語言反應:

女子 (S1) 努力保持嚴肅,接著忍不住輕笑起來:
<d>[Chinese] 我真不敢相信你做了那件事。<chuckle></d>

語音格式提示包括:

提示作用範例
<pause>短暫停頓訊號越來越弱了。<pause> 撐住。
<long pause>較長停頓她要我離開……<long pause> 但我留下了。
<breath>呼吸聲他抵達頂樓。<breath> 門開著。
<inhale> / <exhale>吸氣或呼氣<inhale> 我們數到三就開始。
<catches breath>氣喘吁吁的表達我一路跑過來的。<catches breath> 給我一點時間。
<deep breath>用來平靜下來的深呼吸<deep breath> 我準備好面對他們了。
<i>word</i>強調一到四個詞這正是我警告過你的<i>結果</i>。
<whisper>...</whisper>將包住的詞語用耳語說出<whisper> 燈還亮著。</whisper>
<stutter>結巴或斷斷續續的表達<stutter> 不、不是我的主意。

以下人聲音效提示屬於預設式實驗功能。使用尖括號編寫的自訂情緒標籤(例如 <nervous>)可能會被當作普通台詞朗讀,而不會被識別為控制提示。

提示作用範例
<laughs> / <chuckle>加入笑聲,從較強的笑聲到短暫的輕笑這是我聽過最好笑的事。<laughs>
<snorts>加入噴鼻息聲,通常表示不自覺的笑意反應我努力忍住不笑。<snorts>
<humming>加入哼唱,而不是說出詞語她哼著歌走過走廊。<humming>
<breath>加入一般呼吸聲然後……<breath> 事情就發生了。
<inhale> / <exhale>加入吸氣或呼氣聲<inhale> 好,我們開始吧。
<pant> / <gasps>加入急促喘息或突然倒吸一口氣他終於衝過終點線。<gasps>
<coughs> / <clear-throat>在說話前加入咳嗽或清喉嚨聲<clear-throat> 我有一件事要宣布。
<sighs>加入可以表示無奈、悲傷或釋然的嘆息我想你說得對。<sighs>
<lip-smacking>加入咂嘴聲他停了一下,<lip-smacking> 然後開口說話。
<sniffs>加入吸鼻子的聲音她擦了擦眼睛,又<sniffs>吸了一下鼻子。
<groans>加入表示不適或沮喪的呻吟聲<groans> 我抬不動這個。
<yawns>加入打哈欠聲已經很晚了。<yawns>
<sneezes>加入打噴嚏聲他看向那些花,然後打了個噴嚏。<sneezes>
<burps>加入打嗝聲角色喝完飲料後<burps>打了個嗝。
<whistles>加入口哨聲他吹著口哨走遠了。<whistles>
<hissing>加入嘶嘶聲蒸氣伴隨著尖銳的<hissing>嘶嘶聲逸出。
<emm>加入表示猶豫或填充停頓的「emm」聲音<emm> 我不太確定。
<crying>加入哭泣或抽泣聲我試過阻止這一切。<crying>
<applause>在場景中或背景中加入掌聲演講者結束發言,隨後響起<applause>掌聲。

與其把這些提示當作需要記憶的獨立詞彙,不如將它們視為精確的局部指令。使用完整的說話者格式——(S1) 加上 <d> 內的 [English]——並將每個提示放在靠近其影響時刻的位置。若要強調,請使用 <i>word</i> 包住一到四個詞;像 [emphasis] 這樣的方括號提示有時會被朗讀出來,或影響整句中超出預期的內容。如果某個提示產生不理想的結果,請在對話區塊外使用自然語言描述表達方式。當需要多個強調提示時,使用 <pause> 將它們分開,讓模型有足夠空間區分每個節拍。

3. 加入可見的情緒與脈絡

語音標籤可以影響音訊,但仍需要為臉部與身體提供視覺指示。在鏡頭時間軸中描述反應:

[Shot 1] 電影感特寫鏡頭,昏暗的辦公室裡,一名疲憊的偵探讀完訊息,短暫地抬起眉毛,接著抿緊嘴唇並移開視線。他的聲音克制,卻帶著受傷的情緒 (S1):
<d>[Chinese] 你答應過會留在這裡。<sighs> 那我現在該怎麼辦?</d>

親自嘗試這個場景!

使用具體、可觀察的細節:

  • 驚訝: 眼睛睜大、眉毛抬起、嘴巴短暫張開、頭部向後縮。
  • 懷疑: 一側眉毛抬起、視線移向側面、嘴唇繃緊。
  • 恐懼: 淺呼吸、眼睛睜大、肩膀緊繃、快速看向出口。
  • 釋然: 肩膀下沉、眼皮放鬆、長長呼氣、露出不太自然的微笑。
  • 憤怒: 下巴繃緊、眼睛瞇起、姿勢僵硬、語氣簡短。
  • 悲傷: 垂下視線、動作變慢、嘴唇顫抖、說話前輕輕吸氣。

脈絡可以讓情緒更加一致。請解釋台詞前剛剛發生了什麼,以及角色想要什麼。「門把正在轉動,所以她很害怕」通常比「她很害怕」更能指導表演。

4. 建立並測試提示詞

  1. 在 CawCut 中開啟 MiniMax H3 影片生成工作流程。
  2. 選擇所需的輸入模式,例如文生影片或圖生影片。
  3. 按照時間順序撰寫鏡頭描述:場景、主體、動作、攝影機、反應和對話。
  4. 加入穩定的說話者 ID,並將準確的台詞放在 <d> 中。
  5. 在提示應該發生的位置加入一到兩個內嵌提示。使用 <i>...</i> 強調一到四個詞,使用格式標籤控制時間或表達方式,並使用尖括號預設提示加入人聲效果。
  6. 如果可以,先生成較短、成本較低的測試版本。
  7. 在擴充提示詞或提高輸出品質前,檢查聲音、時間、臉部反應、口型和連貫性。

保持提示詞簡潔。相比讓角色在同一句話中從恐懼轉為憤怒、笑聲和悲傷,每個鏡頭只包含一次情緒變化通常更容易控制。

5. 疑難排解不穩定的結果

  • 標籤被朗讀出來: 使用完整的 (S1) says: <d>[English] ...</d> 結構,嘗試其他語法,或在 <d> 外使用自然語言描述表達方式。單獨使用標籤時,有時會被直接朗讀出來。
  • 聽起來有情緒,但畫面看起來不對: 在鏡頭描述中加入具體的臉部和身體動作。
  • 角色跳過了呼吸或笑聲: 將提示移到靠近目標短語的位置,使用相符的預設提示(例如 <breath><laughs>),並減少其他標籤。
  • 角色在不同鏡頭中的聲音發生變化: 重複使用相同的說話者 ID 和聲音描述,並保持對話結構一致。
  • 台詞說得太快: 縮短句子、延長生成時間、加入停頓或呼吸,並減少鏡頭中的動作數量。
  • 結果不穩定: 一次只變更一個變數。分別測試不使用標籤、使用一個標籤,以及改用另一種自然語言描述的同一個鏡頭。

如果你希望獲得更有表現力的臉部效果,請測試使用簡單背景的特寫鏡頭,並讓主體的頭部和肩膀穩定地保持在畫面中。這樣可以減少模型在生成語音和微表情時需要處理的視覺任務。

最可靠的提示詞是一份簡短的製作說明:描述觀眾能看到什麼、角色做了什麼、角色說了什麼,以及聲音在那個時刻如何變化。

相關文章

常見問題

尋找在 MiniMax H3 中使用情緒與表達提示的相關答案。

將提示直接放在 <d> 區塊中的口說內容裡,緊鄰它要影響的詞語前後。將說話者身分、動作與表達方式的描述放在區塊外。若要強調,請使用 <i>word</i> 包住一到四個詞。

請使用完整的說話者格式,例如 (S1) says: <d>[English] ...</d>,不要單獨測試標籤。若要強調,請使用 <i>word</i> 包住一到四個詞,而不要使用 [emphasis]。如果結果仍不穩定,請在對話區塊外使用自然語言描述表達方式。

語音提示主要會影響表達方式與非語言聲音。請另外描述可見的反應,例如瞇起眼睛、露出猶豫的微笑、垂下視線或緩慢呼氣,並將這些描述放在鏡頭提示中。

可以,但請先在有意義的位置使用一到兩個提示。在相鄰標籤之間留出空間,必要時加入停頓。太多標籤可能彼此競爭,讓時間控制變得不穩定。

為說話的角色指定穩定的說話者 ID,例如 (S1),重複使用相同的身分與聲音描述,並依照時間順序描述每次情緒變化。