CawCut에서 MiniMax H3 감정 및 음성 태그 활용하기

인라인 음성 태그, 감정 맥락, 미세 표정을 사용해 CawCut에서 더욱 표현력 있는 MiniMax H3 동영상을 만드는 방법을 알아보세요.

2026년 9월 10일 업데이트 · 5분 읽기

캐릭터가 무엇을 말하는지만 아니라 어떻게 말하는지, 말하는 동안 무엇을 하는지도 프롬프트에 설명하면 MiniMax H3가 더욱 표현력 있는 연기를 생성할 수 있습니다. CawCut에서는 인라인 음성 지시와 명확한 시각적 행동을 결합해 웃음, 호흡, 강조, 망설임, 놀람 및 기타 반응을 유도할 수 있습니다. 결과는 달라질 수 있으므로 먼저 짧은 프롬프트로 테스트하세요.

1. 태그 작동 방식 이해하기

다음 네 가지 층위로 지시하세요.

  • 음성 형식 태그: 말하는 내용 안에 넣는 인라인 태그입니다. <pause>, <inhale>, <whisper>...</whisper>, <i>word</i> 등을 사용할 수 있습니다.
  • 음성 효과 태그: 꺾쇠괄호로 작성하는 사전 설정 지시입니다. <chuckle>, <sighs>, <gasps> 등을 사용하면 생성된 오디오에 비언어적 소리를 추가할 수 있습니다.
  • 감정 맥락: 대화 바깥에서 자연어로 캐릭터의 의도, 감정, 표현 방식을 설명합니다.
  • 보이는 행동: 짧은 미소, 굳어진 턱, 치켜 올라간 눈썹, 눈을 마주치기 전의 멈춤처럼 얼굴의 미세 표정과 신체 동작으로 감정을 표현합니다.

태그는 국소적인 타이밍 지시로 사용하는 것이 좋습니다. 각 지시를 영향을 주려는 단어나 순간 가까이에 배치하세요. 태그 하나만으로 감정 전체를 표현하려고 하지 마세요.

예를 들어 다음 설명은 너무 모호합니다.

여자는 긴장하고 있다.

다음과 같이 작성하면 MiniMax H3에 보이는 정보를 더 많이 전달할 수 있습니다.

여자는 손목시계를 두 번 확인하고, 파일을 손가락으로 두드린다. 짧게 숨을 들이마신 뒤 닫힌 문을 바라본다.

2. 대화 블록 작성하기

MiniMax H3에서는 <d> 블록으로 음성 대사를 표시합니다. 언어 태그와 정확한 대사는 블록 안에 넣고, 화자의 정체성, 동작, 표현 방식에 대한 설명은 블록 밖에 두세요.

캐릭터가 말할 때는 안정적인 화자 ID를 사용하세요. 모든 샷에서 해당 캐릭터에 동일한 ID를 사용해야 합니다.

조용하고 숨이 섞인 목소리를 가진 젊은 여성 (S1)이 망설이며 말한다.
<d>[Korean] 네가 올 줄 알았어. <inhale> 내가 틀렸어.</d>

특정 단어 근처에 강조 지시를 추가할 수 있습니다.

남성 (S1)이 카메라 쪽으로 몸을 기울이며 억눌린 분노로 말한다.
<d>[Korean] 이런 일은 절대 일어나지 않을 거라고 약속했잖아. <i>절대.</i></d>

비언어적 반응을 추가할 수도 있습니다.

여성 (S1)이 진지한 표정을 유지하려고 애쓰다가 작게 웃음을 터뜨린다.
<d>[Korean] 네가 그런 일을 했다니 믿을 수가 없어. <chuckle></d>

음성 형식 지시에는 다음과 같은 것이 있습니다.

지시기능예시
<pause>짧은 멈춤을 추가합니다.신호가 점점 약해져. <pause> 정신 차려.
<long pause>긴 멈춤을 추가합니다.그녀는 떠나라고 했어……<long pause> 그래도 나는 남았어.
<breath>호흡 소리를 추가합니다.그는 꼭대기 층에 도착한다. <breath> 문이 열려 있다.
<inhale> / <exhale>들숨 또는 날숨을 추가합니다.<inhale> 셋까지 세고 시작하자.
<catches breath>숨이 찬 말투로 표현합니다.여기까지 전력으로 뛰어왔어. <catches breath> 잠깐만 기다려.
<deep breath>진정하기 위한 깊은 호흡을 추가합니다.<deep breath> 그들을 마주할 준비가 됐어.
<i>word</i>1~4개의 단어를 강조합니다.이건 내가 경고했던 <i>결과</i>야.
<whisper>...</whisper>감싼 단어를 속삭이듯 말합니다.<whisper> 아직 불이 켜져 있어.</whisper>
<stutter>말을 더듬거나 끊기는 말투로 표현합니다.<stutter> 아, 아니, 내 생각이 아니야.

다음 음성 효과 지시는 사전 설정을 활용한 실험적 기능입니다. 꺾쇠괄호로 작성한 사용자 지정 감정 태그(예: <nervous>)는 제어 지시로 인식되지 않고 일반 대사처럼 읽힐 수 있습니다.

지시기능예시
<laughs> / <chuckle>큰 웃음부터 짧은 웃음까지 웃음소리를 추가합니다.내가 들어 본 것 중 가장 웃긴 이야기야. <laughs>
<snorts>보통 무심코 웃을 때 나는 콧소리를 추가합니다.웃지 않으려고 했는데. <snorts>
<humming>말 대신 허밍을 추가합니다.그녀는 콧노래를 부르며 복도를 걷는다. <humming>
<breath>일반적인 호흡 소리를 추가합니다.그리고……<breath> 일이 벌어졌다.
<inhale> / <exhale>들숨 또는 날숨 소리를 추가합니다.<inhale> 좋아, 시작하자.
<pant> / <gasps>빠른 헐떡임 또는 날카롭게 숨을 들이마시는 소리를 추가합니다.그는 마침내 결승선을 통과한다. <gasps>
<coughs> / <clear-throat>기침 또는 말하기 전 목을 가다듬는 소리를 추가합니다.<clear-throat> 발표할 내용이 있습니다.
<sighs>체념, 슬픔, 안도 등을 나타내는 한숨을 추가합니다.네 말이 맞는 것 같아. <sighs>
<lip-smacking>입맛을 다시는 소리를 추가합니다.그는 잠시 멈췄다가 <lip-smacking> 말을 시작한다.
<sniffs>코를 훌쩍이는 소리를 추가합니다.그녀는 눈물을 닦고 <sniffs> 코를 훌쩍인다.
<groans>불편함이나 좌절감을 나타내는 신음 소리를 추가합니다.<groans> 이건 들어 올릴 수가 없어.
<yawns>하품 소리를 추가합니다.너무 늦은 시간이야. <yawns>
<sneezes>재채기 소리를 추가합니다.그는 꽃을 바라보다가 재채기한다. <sneezes>
<burps>트림 소리를 추가합니다.캐릭터가 음료를 다 마신 뒤 <burps> 트림한다.
<whistles>휘파람 소리를 추가합니다.그는 휘파람을 불며 멀어진다. <whistles>
<hissing>쉭쉭거리는 소리를 추가합니다.증기가 날카로운 <hissing> 소리를 내며 새어 나온다.
<emm>망설임이나 말버릇을 나타내는 “emm” 소리를 추가합니다.<emm> 잘 모르겠어.
<crying>우는 소리나 흐느낌을 추가합니다.멈추려고 했어. <crying>
<applause>장면 안이나 배경에 박수 소리를 추가합니다.발표자가 말을 마치자 <applause> 박수가 나온다.

이 지시를 외워야 하는 별도의 단어 목록으로 생각하기보다, 정확한 국소 지시로 사용하는 것이 좋습니다. (S1)<d> 안의 [Korean]을 결합한 전체 화자 형식을 사용하고, 각 태그를 영향을 주려는 순간 가까이에 배치하세요. 강조에는 <i>word</i>로 1~4개의 단어를 감쌉니다. [emphasis]와 같은 대괄호 지시는 소리 내어 읽히거나 문장의 예상보다 넓은 범위에 영향을 줄 수 있기 때문입니다. 지시가 원하지 않는 결과를 만들면 대화 블록 밖에서 자연어로 표현 방식을 설명하세요. 여러 강조 지시가 필요하다면 <pause>로 구분해 모델이 각 박자를 구분할 수 있는 공간을 만드세요.

3. 보이는 감정과 맥락 추가하기

음성 태그는 오디오에 영향을 주지만 얼굴과 신체에는 시각적 지시도 필요합니다. 샷 타임라인에 반응을 설명하세요.

[Shot 1] 영화 같은 클로즈업. 어두운 사무실에서 지친 탐정이 메시지를 읽고 잠시 눈썹을 올린 다음 입술을 굳게 다물고 시선을 돌린다. 목소리는 절제되어 있지만 상처받은 느낌이 난다 (S1).
<d>[Korean] 여기 있겠다고 약속했잖아. <sighs> 이제 나는 어떻게 해야 해?</d>

이 장면을 직접 시도해 보세요!

구체적이고 관찰 가능한 세부 사항을 사용하세요.

  • 놀람: 눈을 크게 뜨고, 눈썹을 올리고, 입을 잠시 벌리며, 머리를 뒤로 살짝 뺍니다.
  • 의심: 한쪽 눈썹을 올리고, 시선을 옆으로 옮기며, 입술을 굳게 다뭅니다.
  • 두려움: 얕은 호흡, 커진 눈, 긴장한 어깨, 출구를 향한 빠른 시선을 사용합니다.
  • 안도: 어깨를 내리고, 눈꺼풀을 편안하게 하며, 길게 숨을 내쉬고, 약간 어색한 미소를 짓습니다.
  • 분노: 턱을 굳게 다물고, 눈을 가늘게 뜨며, 자세를 경직시키고, 짧고 끊어지는 말투를 사용합니다.
  • 슬픔: 시선을 내리고, 움직임을 느리게 하며, 입술을 떨고, 말하기 전에 조용히 숨을 들이쉽니다.

맥락을 추가하면 감정이 더욱 일관되게 표현됩니다. 대사 직전에 무슨 일이 있었는지, 캐릭터가 무엇을 원하는지 설명하세요. “문손잡이가 돌아가고 있어서 그녀가 두려워한다”라고 쓰는 편이 “그녀가 두려워한다”라고만 쓰는 것보다 연기를 유도하기 쉽습니다.

4. 프롬프트 작성 및 테스트하기

  1. CawCut에서 MiniMax H3 동영상 생성 워크플로를 엽니다.
  2. 텍스트-투-비디오나 이미지-투-비디오처럼 필요한 입력 모드를 선택합니다.
  3. 샷 설명을 시간 순서대로 작성합니다. 장면, 주체, 동작, 카메라, 반응, 대화 순으로 정리하세요.
  4. 안정적인 화자 ID를 추가하고 정확한 대사를 <d>에 넣습니다.
  5. 지시가 발생해야 하는 위치에 인라인 지시를 1~2개 추가합니다. <i>...</i>로 1~4개의 단어를 강조하고, 형식 태그로 시간이나 표현 방식을 지정하며, 꺾쇠괄호 사전 설정 지시로 음성 효과를 추가하세요.
  6. 가능하면 먼저 짧고 비용이 낮은 테스트 버전을 생성합니다.
  7. 프롬프트를 확장하거나 출력 품질을 높이기 전에 음성, 타이밍, 표정, 입 모양, 연속성을 확인합니다.

프롬프트는 간결하게 유지하세요. 한 샷에서 캐릭터가 두려움에서 분노, 웃음, 슬픔으로 모두 변하도록 하는 것보다, 각 샷에서 감정 변화를 하나로 제한하는 편이 보통 더 제어하기 쉽습니다.

5. 불안정한 결과 문제 해결하기

  • 태그가 소리 내어 읽힙니다. 전체 (S1) says: <d>[Korean] ...</d> 구조를 사용하고, 다른 구문을 시도하거나 <d> 밖에서 자연어로 표현 방식을 설명하세요. 태그만 단독으로 사용하면 읽힐 수 있습니다.
  • 음성에는 감정이 있지만 화면이 어색합니다. 샷 설명에 구체적인 얼굴 및 신체 동작을 추가하세요.
  • 캐릭터가 호흡이나 웃음을 생략합니다. 지시를 대상 문구 가까이 옮기고 <breath> 또는 <laughs>와 같은 해당 사전 설정을 사용하며, 다른 태그는 줄이세요.
  • 샷마다 캐릭터의 목소리가 바뀝니다. 동일한 화자 ID와 음성 설명을 반복해서 사용하고 대화 구조를 일관되게 유지하세요.
  • 대사가 너무 빠릅니다. 문장을 짧게 하고, 생성 시간을 늘리고, 멈춤이나 호흡을 추가하며, 샷 안의 동작 수를 줄이세요.
  • 결과가 불안정합니다. 한 번에 하나의 변수만 바꾸세요. 같은 샷을 태그 없이, 태그 하나와 함께, 다른 자연어 설명과 함께 각각 테스트합니다.

표정을 특히 풍부하게 만들고 싶다면 배경이 단순한 클로즈업을 테스트하고, 주체의 머리와 어깨가 화면 안에서 안정적으로 유지되도록 하세요. 그러면 음성과 미세 표정을 생성할 때 모델이 처리해야 하는 시각적 작업이 줄어듭니다.

가장 신뢰할 수 있는 프롬프트는 짧은 제작 지시서입니다. 시청자에게 보이는 것, 캐릭터가 하는 행동, 캐릭터가 말하는 내용, 그리고 그 순간 소리가 어떻게 변하는지를 설명하세요.

관련 기사

자주 묻는 질문

MiniMax H3에서 감정 및 표현 지시를 사용하는 방법을 알아보세요.

영향을 주려는 단어의 앞이나 뒤에 태그를 배치하고, <d> 블록 안의 음성 대사에 직접 입력하세요. 화자의 정체성, 동작, 표현 방식에 대한 설명은 블록 밖에 둡니다. 강조하려면 <i>word</i>로 1~4개의 단어를 감싸세요.

태그만 따로 테스트하지 말고 (S1) says: <d>[Korean] ...</d>와 같은 전체 화자 형식을 사용하세요. 강조할 때는 [emphasis] 대신 <i>word</i>로 1~4개의 단어를 감쌉니다. 그래도 결과가 불안정하면 대화 블록 밖에서 자연어로 표현 방식을 설명하세요.

음성 지시는 주로 말투와 비언어적 소리에 영향을 줍니다. 눈을 가늘게 뜨거나, 망설이는 듯 미소 짓거나, 시선을 내리거나, 천천히 숨을 내쉬는 등의 보이는 반응을 별도로 설명하고 샷 프롬프트에 넣으세요.

가능하지만 먼저 의미 있는 위치에 1~2개의 지시만 사용하세요. 서로 가까이 있는 태그 사이에 간격을 두고, 필요하면 멈춤을 추가합니다. 태그가 너무 많으면 서로 충돌해 타이밍이 불안정해질 수 있습니다.

말하는 캐릭터에 (S1)과 같은 안정적인 화자 ID를 지정하고, 동일한 정체성 및 음성 설명을 반복해서 사용하세요. 감정의 변화도 시간 순서에 따라 설명해야 합니다.