當提示詞不只描述角色說了什麼,也描述台詞的表達方式,以及角色說話時的動作,MiniMax H3 就能生成更具表現力的表演。在 CawCut 中,你可以將內嵌語音提示與清楚的視覺行為結合,引導笑聲、呼吸、強調、猶豫、驚訝與其他反應。結果可能有所不同,因此請先測試較短的提示詞。
1. 瞭解標籤的運作方式
使用四個層次的指示:
- 語音格式標籤: 放在口說內容中的內嵌標籤,例如
<pause>、<inhale>、<whisper>...</whisper>和<i>word</i>。 - 人聲音效標籤: 使用尖括號寫出的預設提示,例如
<chuckle>、<sighs>或<gasps>,可以在生成的音訊中加入非語言聲音。 - 情緒脈絡: 在對話外使用自然語言,解釋角色的意圖、情緒或表達方式。
- 可見行為: 透過面部微表情與身體動作呈現情緒,例如短暫微笑、繃緊下巴、抬起眉毛,或在對視前停頓。
最好將標籤視為局部的時間提示。將每個提示放在靠近它要影響的詞語或時刻的位置。不要只依靠標籤來建立完整的情緒。
例如,以下描述過於模糊:
女人感到緊張。以下描述則為 MiniMax H3 提供更多可見資訊:
女人查看了兩次手錶,用手指輕敲資料夾,短促地吸了一口氣,然後看向緊閉的門。2. 撰寫對話區塊
MiniMax H3 使用 <d> 區塊表示口說內容。將語言標籤與準確的台詞放在區塊內,將說話者身分、動作與表達方式的描述放在區塊外。
角色說話時,請使用穩定的說話者 ID。在每個鏡頭中都為該角色保留相同的 ID。
一位聲音輕柔、帶有氣聲的年輕女子 (S1) 猶豫地說:
<d>[Chinese] 我以為你會來。<inhale> 是我錯了。</d>你可以在特定詞語附近加入強調提示:
男子 (S1) 朝鏡頭靠近,以克制的憤怒說道:
<d>[Chinese] 你答應過我,這種事永遠不會發生。<i>永遠。</i></d>你也可以加入非語言反應:
女子 (S1) 努力保持嚴肅,接著忍不住輕笑起來:
<d>[Chinese] 我真不敢相信你做了那件事。<chuckle></d>語音格式提示包括:
| 提示 | 作用 | 範例 |
|---|---|---|
<pause> | 短暫停頓 | 訊號越來越弱了。<pause> 撐住。 |
<long pause> | 較長停頓 | 她要我離開……<long pause> 但我留下了。 |
<breath> | 呼吸聲 | 他抵達頂樓。<breath> 門開著。 |
<inhale> / <exhale> | 吸氣或呼氣 | <inhale> 我們數到三就開始。 |
<catches breath> | 氣喘吁吁的表達 | 我一路跑過來的。<catches breath> 給我一點時間。 |
<deep breath> | 用來平靜下來的深呼吸 | <deep breath> 我準備好面對他們了。 |
<i>word</i> | 強調一到四個詞 | 這正是我警告過你的<i>結果</i>。 |
<whisper>...</whisper> | 將包住的詞語用耳語說出 | <whisper> 燈還亮著。</whisper> |
<stutter> | 結巴或斷斷續續的表達 | <stutter> 不、不是我的主意。 |
以下人聲音效提示屬於預設式實驗功能。使用尖括號編寫的自訂情緒標籤(例如 <nervous>)可能會被當作普通台詞朗讀,而不會被識別為控制提示。
| 提示 | 作用 | 範例 |
|---|---|---|
<laughs> / <chuckle> | 加入笑聲,從較強的笑聲到短暫的輕笑 | 這是我聽過最好笑的事。<laughs> |
<snorts> | 加入噴鼻息聲,通常表示不自覺的笑意反應 | 我努力忍住不笑。<snorts> |
<humming> | 加入哼唱,而不是說出詞語 | 她哼著歌走過走廊。<humming> |
<breath> | 加入一般呼吸聲 | 然後……<breath> 事情就發生了。 |
<inhale> / <exhale> | 加入吸氣或呼氣聲 | <inhale> 好,我們開始吧。 |
<pant> / <gasps> | 加入急促喘息或突然倒吸一口氣 | 他終於衝過終點線。<gasps> |
<coughs> / <clear-throat> | 在說話前加入咳嗽或清喉嚨聲 | <clear-throat> 我有一件事要宣布。 |
<sighs> | 加入可以表示無奈、悲傷或釋然的嘆息 | 我想你說得對。<sighs> |
<lip-smacking> | 加入咂嘴聲 | 他停了一下,<lip-smacking> 然後開口說話。 |
<sniffs> | 加入吸鼻子的聲音 | 她擦了擦眼睛,又<sniffs>吸了一下鼻子。 |
<groans> | 加入表示不適或沮喪的呻吟聲 | <groans> 我抬不動這個。 |
<yawns> | 加入打哈欠聲 | 已經很晚了。<yawns> |
<sneezes> | 加入打噴嚏聲 | 他看向那些花,然後打了個噴嚏。<sneezes> |
<burps> | 加入打嗝聲 | 角色喝完飲料後<burps>打了個嗝。 |
<whistles> | 加入口哨聲 | 他吹著口哨走遠了。<whistles> |
<hissing> | 加入嘶嘶聲 | 蒸氣伴隨著尖銳的<hissing>嘶嘶聲逸出。 |
<emm> | 加入表示猶豫或填充停頓的「emm」聲音 | <emm> 我不太確定。 |
<crying> | 加入哭泣或抽泣聲 | 我試過阻止這一切。<crying> |
<applause> | 在場景中或背景中加入掌聲 | 演講者結束發言,隨後響起<applause>掌聲。 |
與其把這些提示當作需要記憶的獨立詞彙,不如將它們視為精確的局部指令。使用完整的說話者格式——(S1) 加上 <d> 內的 [English]——並將每個提示放在靠近其影響時刻的位置。若要強調,請使用 <i>word</i> 包住一到四個詞;像 [emphasis] 這樣的方括號提示有時會被朗讀出來,或影響整句中超出預期的內容。如果某個提示產生不理想的結果,請在對話區塊外使用自然語言描述表達方式。當需要多個強調提示時,使用 <pause> 將它們分開,讓模型有足夠空間區分每個節拍。
3. 加入可見的情緒與脈絡
語音標籤可以影響音訊,但仍需要為臉部與身體提供視覺指示。在鏡頭時間軸中描述反應:
[Shot 1] 電影感特寫鏡頭,昏暗的辦公室裡,一名疲憊的偵探讀完訊息,短暫地抬起眉毛,接著抿緊嘴唇並移開視線。他的聲音克制,卻帶著受傷的情緒 (S1):
<d>[Chinese] 你答應過會留在這裡。<sighs> 那我現在該怎麼辦?</d>使用具體、可觀察的細節:
- 驚訝: 眼睛睜大、眉毛抬起、嘴巴短暫張開、頭部向後縮。
- 懷疑: 一側眉毛抬起、視線移向側面、嘴唇繃緊。
- 恐懼: 淺呼吸、眼睛睜大、肩膀緊繃、快速看向出口。
- 釋然: 肩膀下沉、眼皮放鬆、長長呼氣、露出不太自然的微笑。
- 憤怒: 下巴繃緊、眼睛瞇起、姿勢僵硬、語氣簡短。
- 悲傷: 垂下視線、動作變慢、嘴唇顫抖、說話前輕輕吸氣。
脈絡可以讓情緒更加一致。請解釋台詞前剛剛發生了什麼,以及角色想要什麼。「門把正在轉動,所以她很害怕」通常比「她很害怕」更能指導表演。
4. 建立並測試提示詞
- 在 CawCut 中開啟 MiniMax H3 影片生成工作流程。
- 選擇所需的輸入模式,例如文生影片或圖生影片。
- 按照時間順序撰寫鏡頭描述:場景、主體、動作、攝影機、反應和對話。
- 加入穩定的說話者 ID,並將準確的台詞放在
<d>中。 - 在提示應該發生的位置加入一到兩個內嵌提示。使用
<i>...</i>強調一到四個詞,使用格式標籤控制時間或表達方式,並使用尖括號預設提示加入人聲效果。 - 如果可以,先生成較短、成本較低的測試版本。
- 在擴充提示詞或提高輸出品質前,檢查聲音、時間、臉部反應、口型和連貫性。
保持提示詞簡潔。相比讓角色在同一句話中從恐懼轉為憤怒、笑聲和悲傷,每個鏡頭只包含一次情緒變化通常更容易控制。
5. 疑難排解不穩定的結果
- 標籤被朗讀出來: 使用完整的
(S1) says: <d>[English] ...</d>結構,嘗試其他語法,或在<d>外使用自然語言描述表達方式。單獨使用標籤時,有時會被直接朗讀出來。 - 聽起來有情緒,但畫面看起來不對: 在鏡頭描述中加入具體的臉部和身體動作。
- 角色跳過了呼吸或笑聲: 將提示移到靠近目標短語的位置,使用相符的預設提示(例如
<breath>或<laughs>),並減少其他標籤。 - 角色在不同鏡頭中的聲音發生變化: 重複使用相同的說話者 ID 和聲音描述,並保持對話結構一致。
- 台詞說得太快: 縮短句子、延長生成時間、加入停頓或呼吸,並減少鏡頭中的動作數量。
- 結果不穩定: 一次只變更一個變數。分別測試不使用標籤、使用一個標籤,以及改用另一種自然語言描述的同一個鏡頭。
如果你希望獲得更有表現力的臉部效果,請測試使用簡單背景的特寫鏡頭,並讓主體的頭部和肩膀穩定地保持在畫面中。這樣可以減少模型在生成語音和微表情時需要處理的視覺任務。
最可靠的提示詞是一份簡短的製作說明:描述觀眾能看到什麼、角色做了什麼、角色說了什麼,以及聲音在那個時刻如何變化。