CawCut में MiniMax H3 के भाव और वॉइस टैग का उपयोग करें

CawCut में अधिक अभिव्यंजक MiniMax H3 वीडियो बनाने के लिए इनलाइन वॉइस टैग, भावनात्मक संदर्भ और सूक्ष्म हाव-भाव का उपयोग करना सीखें।

10 सित॰ 2026 को अपडेट किया गया · 5 मिनट पढ़ने का समय

जब प्रॉम्प्ट में केवल यह नहीं बताया जाता कि किरदार क्या कहता है, बल्कि यह भी बताया जाता है कि वह कैसे बोलता है और बोलते समय क्या करता है, तब MiniMax H3 अधिक अभिव्यंजक अभिनय तैयार कर सकता है। CawCut में आप इनलाइन वॉइस निर्देशों को स्पष्ट दृश्य व्यवहार के साथ जोड़कर हँसी, साँस, ज़ोर, झिझक, आश्चर्य और अन्य प्रतिक्रियाओं को निर्देशित कर सकते हैं। परिणाम अलग-अलग हो सकते हैं, इसलिए पहले छोटे प्रॉम्प्ट का परीक्षण करें।

1. समझें कि टैग कैसे काम करते हैं

निर्देशों के चार स्तरों का उपयोग करें:

  • वॉइस फ़ॉर्मैट टैग: बोले गए टेक्स्ट के अंदर रखे जाने वाले इनलाइन टैग, जैसे <pause>, <inhale>, <whisper>...</whisper> और <i>word</i>
  • वोकल साउंड-इफ़ेक्ट टैग: कोणीय कोष्ठकों में लिखे गए प्रीसेट निर्देश, जैसे <chuckle>, <sighs> या <gasps>। ये जनरेट किए गए ऑडियो में गैर-मौखिक ध्वनियाँ जोड़ सकते हैं।
  • भावनात्मक संदर्भ: संवाद के बाहर स्वाभाविक भाषा में किरदार की मंशा, मनोदशा या बोलने का तरीका समझाना।
  • दिखाई देने वाला व्यवहार: चेहरे के सूक्ष्म हाव-भाव और शारीरिक क्रियाएँ जो भाव को दृश्य बनाती हैं, जैसे हल्की मुस्कान, कसा हुआ जबड़ा, उठी हुई भौंहें या आँखों में देखने से पहले एक विराम।

टैग को स्थानीय टाइमिंग निर्देशों की तरह इस्तेमाल करना बेहतर होता है। हर निर्देश को उस शब्द या क्षण के पास रखें जिस पर उसका प्रभाव होना चाहिए। पूरा भाव पैदा करने के लिए केवल एक टैग पर निर्भर न रहें।

उदाहरण के लिए, यह विवरण बहुत अस्पष्ट है:

महिला घबराई हुई है।

यह विवरण MiniMax H3 को अधिक दृश्य जानकारी देता है:

महिला अपनी घड़ी दो बार देखती है, फ़ोल्डर पर उँगलियों से हल्की थपकी देती है, छोटी-सी साँस लेती है और बंद दरवाज़े की ओर देखती है।

2. संवाद ब्लॉक लिखें

MiniMax H3 बोले गए कंटेंट के लिए <d> ब्लॉक का उपयोग करता है। भाषा टैग और संवाद के सटीक शब्द ब्लॉक के अंदर रखें। किरदार की पहचान, क्रिया और बोलने के तरीके का विवरण ब्लॉक के बाहर रखें।

जब भी कोई किरदार बोले, स्थिर स्पीकर ID का उपयोग करें। सभी शॉट में उस किरदार के लिए वही ID रखें।

एक शांत, साँस मिली हुई आवाज़ वाली युवती (S1) झिझकते हुए कहती है:
<d>[Hindi] मुझे लगा था कि तुम आओगे। <inhale> मैं गलत थी।</d>

किसी खास शब्द के पास ज़ोर देने का निर्देश जोड़ा जा सकता है:

पुरुष (S1) कैमरे की ओर झुककर नियंत्रित गुस्से में बोलता है:
<d>[Hindi] तुमने वादा किया था कि ऐसा कभी नहीं होगा। <i>कभी नहीं।</i></d>

आप गैर-मौखिक प्रतिक्रिया भी जोड़ सकते हैं:

महिला (S1) गंभीर बने रहने की कोशिश करती है, फिर हल्का-सा हँस पड़ती है:
<d>[Hindi] मुझे यकीन नहीं हो रहा कि तुमने ऐसा किया। <chuckle></d>

वॉइस फ़ॉर्मैट निर्देशों में ये शामिल हैं:

निर्देशप्रभावउदाहरण
<pause>छोटा विराम जोड़ता है।सिग्नल कमज़ोर हो रहा है। <pause> मेरे साथ रहो।
<long pause>लंबा विराम जोड़ता है।उसने मुझे जाने को कहा… <long pause> और मैं रुक गया।
<breath>साँस लेने की ध्वनि जोड़ता है।वह सबसे ऊपरी मंज़िल तक पहुँचता है। <breath> दरवाज़ा खुला है।
<inhale> / <exhale>साँस अंदर लेने या बाहर छोड़ने की ध्वनि जोड़ता है।<inhale> तीन तक गिनकर शुरू करते हैं।
<catches breath>हाँफते हुए बोलने का तरीका बनाता है।मैं यहाँ तक दौड़कर आया हूँ। <catches breath> मुझे एक पल दो।
<deep breath>शांत होने के लिए गहरी साँस जोड़ता है।<deep breath> मैं उनका सामना करने के लिए तैयार हूँ।
<i>word</i>एक से चार शब्दों पर ज़ोर देता है।यही वह <i>नतीजा</i> है जिसके बारे में मैंने तुम्हें चेताया था।
<whisper>...</whisper>घिरे हुए शब्दों को फुसफुसाकर बोलता है।<whisper> लाइटें अभी भी जल रही हैं।</whisper>
<stutter>अटकती या हकलाती हुई बोलने की शैली बनाता है।<stutter> न-नहीं, यह मेरा विचार नहीं था।

ये वोकल साउंड-इफ़ेक्ट निर्देश प्रीसेट पर आधारित प्रयोगात्मक सुविधा हैं। कोणीय कोष्ठकों में लिखे गए कस्टम भावनात्मक टैग, जैसे <nervous>, कंट्रोल के रूप में पहचाने जाने के बजाय सामान्य टेक्स्ट की तरह पढ़े जा सकते हैं।

निर्देशप्रभावउदाहरण
<laughs> / <chuckle>तेज़ हँसी से लेकर हल्की हँसी तक, हँसी की ध्वनि जोड़ता है।यह सबसे मज़ेदार बात है जो मैंने सुनी है। <laughs>
<snorts>अक्सर अनायास हँसी की प्रतिक्रिया के रूप में नाक से आवाज़ निकालता है।मैंने हँसने की कोशिश नहीं की। <snorts>
<humming>बोले गए शब्दों के बजाय गुनगुनाने की ध्वनि जोड़ता है।वह गुनगुनाते हुए गलियारे से गुज़रती है। <humming>
<breath>सामान्य साँस लेने की ध्वनि जोड़ता है।और फिर… <breath> यह हो गया।
<inhale> / <exhale>साँस अंदर लेने या बाहर छोड़ने की ध्वनि जोड़ता है।<inhale> ठीक है, शुरू करते हैं।
<pant> / <gasps>तेज़ हाँफने या अचानक साँस खींचने की ध्वनि जोड़ता है।वह आखिरकार फ़िनिश लाइन पार करता है। <gasps>
<coughs> / <clear-throat>बोलने से पहले खाँसी या गला साफ़ करने की ध्वनि जोड़ता है।<clear-throat> मुझे एक घोषणा करनी है।
<sighs>हार मानने, उदासी या राहत का संकेत देने वाली आह जोड़ता है।मुझे लगता है तुम सही हो। <sighs>
<lip-smacking>होंठ चटकाने की ध्वनि जोड़ता है।वह एक पल रुकता है, <lip-smacking> फिर बोलता है।
<sniffs>नाक सुड़कने की ध्वनि जोड़ता है।वह अपनी आँखें पोंछती है और <sniffs> नाक सुड़कती है।
<groans>असहजता या निराशा जैसी कराह की ध्वनि जोड़ता है।<groans> मैं इसे उठा नहीं सकता।
<yawns>जम्हाई की ध्वनि जोड़ता है।बहुत देर हो चुकी है। <yawns>
<sneezes>छींक की ध्वनि जोड़ता है।वह फूलों की ओर देखता है और फिर <sneezes> छींकता है।
<burps>डकार की ध्वनि जोड़ता है।किरदार पेय खत्म करता है और <burps> डकार लेता है।
<whistles>सीटी की ध्वनि जोड़ता है।वह सीटी बजाते हुए दूर चला जाता है। <whistles>
<hissing>फुफकारने की ध्वनि जोड़ता है।भाप तेज़ <hissing> आवाज़ के साथ बाहर निकलती है।
<emm>झिझक या भराव शब्द के रूप में “emm” ध्वनि जोड़ता है।<emm> मुझे यकीन नहीं है।
<crying>रोने या सिसकने की ध्वनि जोड़ता है।मैंने इसे रोकने की कोशिश की। <crying>
<applause>दृश्य में या पृष्ठभूमि में तालियों की ध्वनि जोड़ता है।वक्ता समाप्त करता है और <applause> तालियाँ बजती हैं।

इन निर्देशों को याद रखने वाले अलग-अलग शब्दों की सूची के बजाय सटीक, स्थानीय निर्देशों की तरह इस्तेमाल करना बेहतर है। (S1) के साथ <d> के अंदर [Hindi] वाला पूरा स्पीकर फ़ॉर्मैट इस्तेमाल करें और हर टैग को उस क्षण के पास रखें जिस पर उसका प्रभाव होना चाहिए। ज़ोर देने के लिए एक से चार शब्दों के चारों ओर <i>word</i> लगाएं; [emphasis] जैसे वर्गाकार कोष्ठक वाले निर्देश कभी-कभी ज़ोर से पढ़े जा सकते हैं या वाक्य के अपेक्षित हिस्से से अधिक पर प्रभाव डाल सकते हैं। अगर कोई निर्देश अनचाहा परिणाम दे, तो संवाद ब्लॉक के बाहर स्वाभाविक भाषा में बोलने का तरीका बताएं। कई ज़ोर वाले निर्देशों की ज़रूरत हो तो उन्हें <pause> से अलग करें, ताकि मॉडल के पास हर भाव-खंड को अलग पहचानने की जगह हो।

3. दिखाई देने वाले भाव और संदर्भ जोड़ें

वॉइस टैग ऑडियो को प्रभावित कर सकते हैं, लेकिन चेहरे और शरीर के लिए दृश्य निर्देश भी ज़रूरी हैं। शॉट की टाइमलाइन में प्रतिक्रिया का विवरण दें:

[Shot 1] फ़िल्म जैसा क्लोज़-अप। धुंधले रोशन वाले दफ़्तर में एक थका हुआ जासूस संदेश पढ़ता है, पल भर के लिए भौंहें उठाता है, फिर होंठ भींचकर नज़रें फेर लेता है। उसकी आवाज़ संयमित है, लेकिन उसमें चोट का भाव है (S1):
<d>[Hindi] तुमने रुकने का वादा किया था। <sighs> अब मुझे क्या करना चाहिए?</d>

इस दृश्य को आज़माएँ!

ठोस और देखे जा सकने वाले विवरण इस्तेमाल करें:

  • आश्चर्य: आँखें फैलाना, भौंहें उठाना, पल भर के लिए मुँह खोलना और सिर थोड़ा पीछे करना।
  • संदेह: एक भौंह उठाना, नज़र बगल की ओर ले जाना और होंठ भींचना।
  • डर: उथली साँस, फैली हुई आँखें, तने हुए कंधे और बाहर निकलने के रास्ते की ओर तेज़ नज़र।
  • राहत: कंधे ढीले पड़ना, पलकें नरम होना, लंबी साँस छोड़ना और हल्की असमान मुस्कान।
  • गुस्सा: जबड़ा कसना, आँखें सिकोड़ना, शरीर को कड़ा रखना और छोटे-छोटे वाक्यों में बोलना।
  • उदासी: नज़रें झुकाना, गति धीमी करना, होंठ काँपना और बोलने से पहले धीरे से साँस लेना।

संदर्भ से भाव अधिक सुसंगत बनते हैं। संवाद से ठीक पहले क्या हुआ और किरदार क्या चाहता है, यह बताएं। “दरवाज़े का हैंडल घूम रहा है, इसलिए वह डर रही है” आम तौर पर “वह डर रही है” की तुलना में अभिनय को बेहतर दिशा देता है।

4. प्रॉम्प्ट बनाकर उसका परीक्षण करें

  1. CawCut में MiniMax H3 वीडियो जनरेशन वर्कफ़्लो खोलें।
  2. अपनी ज़रूरत के अनुसार इनपुट मोड चुनें, जैसे टेक्स्ट-टू-वीडियो या इमेज-टू-वीडियो।
  3. शॉट का विवरण समय के क्रम में लिखें: दृश्य, मुख्य विषय, क्रिया, कैमरा, प्रतिक्रिया और संवाद।
  4. स्थिर स्पीकर ID जोड़ें और सटीक संवाद को <d> में रखें।
  5. जहाँ निर्देश होना चाहिए, वहाँ एक या दो इनलाइन निर्देश जोड़ें। एक से चार शब्दों पर ज़ोर देने के लिए <i>...</i>, समय या बोलने के तरीके के लिए फ़ॉर्मैट टैग और वोकल प्रभावों के लिए कोणीय कोष्ठकों वाले प्रीसेट निर्देश इस्तेमाल करें।
  6. अगर संभव हो, तो पहले छोटा और कम लागत वाला परीक्षण संस्करण जनरेट करें।
  7. प्रॉम्प्ट बढ़ाने या आउटपुट गुणवत्ता बढ़ाने से पहले आवाज़, टाइमिंग, चेहरे की प्रतिक्रिया, मुँह की गति और निरंतरता जाँचें।

प्रॉम्प्ट को केंद्रित रखें। एक ही शॉट में किरदार को डर से गुस्से, हँसी और उदासी तक ले जाने की तुलना में, हर शॉट में एक ही भावनात्मक बदलाव रखना आम तौर पर अधिक आसानी से नियंत्रित होता है।

5. अस्थिर परिणामों की समस्या हल करें

  • टैग ज़ोर से पढ़ा जाता है: पूरा (S1) says: <d>[Hindi] ...</d> फ़ॉर्मैट इस्तेमाल करें, दूसरी सिंटैक्स आज़माएँ या <d> के बाहर स्वाभाविक भाषा में बोलने का तरीका बताएं। अकेले इस्तेमाल किए गए टैग कभी-कभी बोले जा सकते हैं।
  • आवाज़ में भाव है, लेकिन दृश्य में नहीं: शॉट के विवरण में चेहरे और शरीर की ठोस क्रियाएँ जोड़ें।
  • किरदार साँस या हँसी छोड़ देता है: निर्देश को संबंधित वाक्यांश के पास ले जाएँ, <breath> या <laughs> जैसे उपयुक्त प्रीसेट का इस्तेमाल करें और अन्य टैग कम करें।
  • अलग-अलग शॉट में किरदार की आवाज़ बदल जाती है: वही स्पीकर ID और आवाज़ का विवरण दोहराएँ और संवाद की संरचना एक जैसी रखें।
  • पंक्ति बहुत तेज़ बोली जाती है: वाक्य छोटा करें, जनरेशन का समय बढ़ाएँ, विराम या साँस जोड़ें और शॉट में क्रियाओं की संख्या कम करें।
  • परिणाम स्थिर नहीं है: एक बार में केवल एक वैरिएबल बदलें। उसी शॉट को बिना टैग, एक टैग के साथ और अलग स्वाभाविक भाषा वाले विवरण के साथ टेस्ट करें।

विशेष रूप से अभिव्यंजक चेहरों के लिए सरल पृष्ठभूमि वाला क्लोज़-अप आज़माएँ और किरदार के सिर व कंधों को फ़्रेम में स्थिर रखें। इससे आवाज़ और सूक्ष्म हाव-भाव जनरेट करते समय मॉडल के सामने आने वाले दृश्य कार्य कम हो जाते हैं।

सबसे विश्वसनीय प्रॉम्प्ट एक छोटा-सा प्रोडक्शन ब्रीफ़ होता है: दर्शक क्या देखता है, किरदार क्या करता है, किरदार क्या कहता है और उस क्षण ध्वनि कैसे बदलती है—इन सबका वर्णन करें।

संबंधित लेख

अक्सर पूछे जाने वाले प्रश्न

MiniMax H3 में भाव और अभिव्यक्ति संबंधी निर्देशों का उपयोग करने के बारे में उत्तर पाएं।

टैग को <d> ब्लॉक के अंदर बोले गए संवाद में सीधे रखें, उस शब्द से ठीक पहले या बाद में जिस पर उसका प्रभाव होना चाहिए। वक्ता की पहचान, क्रिया और बोलने के तरीके का विवरण ब्लॉक के बाहर रखें। ज़ोर देने के लिए एक से चार शब्दों को <i>word</i> से घेरें।

अलग टैग का परीक्षण करने के बजाय वक्ता का पूरा फ़ॉर्मैट इस्तेमाल करें, जैसे (S1) says: <d>[Hindi] ...</d>। ज़ोर देने के लिए [emphasis] के बजाय एक से चार शब्दों के चारों ओर <i>word</i> का उपयोग करें। अगर परिणाम फिर भी अस्थिर रहे, तो संवाद ब्लॉक के बाहर स्वाभाविक भाषा में बोलने का तरीका बताएं।

वॉइस निर्देश मुख्य रूप से बोलने के तरीके और गैर-मौखिक ध्वनियों को प्रभावित करते हैं। दिखाई देने वाली प्रतिक्रिया अलग से बताएं—जैसे आँखें सिकोड़ना, झिझक भरी मुस्कान, नज़रें झुकाना या धीरे-धीरे साँस छोड़ना—और उसे शॉट के विवरण में रखें।

हाँ, लेकिन शुरुआत में महत्वपूर्ण स्थानों पर एक या दो निर्देशों से शुरू करें। पास-पास रखे टैग के बीच जगह छोड़ें और ज़रूरत पड़ने पर विराम जोड़ें। बहुत अधिक टैग एक-दूसरे से टकरा सकते हैं और टाइमिंग को कम अनुमानित बना सकते हैं।

बोलने वाले किरदार को (S1) जैसा स्थिर स्पीकर ID दें, उसकी पहचान और आवाज़ का वही विवरण दोहराएं और हर भावनात्मक बदलाव को समय के क्रम में बताएं।