जब प्रॉम्प्ट में केवल यह नहीं बताया जाता कि किरदार क्या कहता है, बल्कि यह भी बताया जाता है कि वह कैसे बोलता है और बोलते समय क्या करता है, तब MiniMax H3 अधिक अभिव्यंजक अभिनय तैयार कर सकता है। CawCut में आप इनलाइन वॉइस निर्देशों को स्पष्ट दृश्य व्यवहार के साथ जोड़कर हँसी, साँस, ज़ोर, झिझक, आश्चर्य और अन्य प्रतिक्रियाओं को निर्देशित कर सकते हैं। परिणाम अलग-अलग हो सकते हैं, इसलिए पहले छोटे प्रॉम्प्ट का परीक्षण करें।
1. समझें कि टैग कैसे काम करते हैं
निर्देशों के चार स्तरों का उपयोग करें:
- वॉइस फ़ॉर्मैट टैग: बोले गए टेक्स्ट के अंदर रखे जाने वाले इनलाइन टैग, जैसे
<pause>,<inhale>,<whisper>...</whisper>और<i>word</i>। - वोकल साउंड-इफ़ेक्ट टैग: कोणीय कोष्ठकों में लिखे गए प्रीसेट निर्देश, जैसे
<chuckle>,<sighs>या<gasps>। ये जनरेट किए गए ऑडियो में गैर-मौखिक ध्वनियाँ जोड़ सकते हैं। - भावनात्मक संदर्भ: संवाद के बाहर स्वाभाविक भाषा में किरदार की मंशा, मनोदशा या बोलने का तरीका समझाना।
- दिखाई देने वाला व्यवहार: चेहरे के सूक्ष्म हाव-भाव और शारीरिक क्रियाएँ जो भाव को दृश्य बनाती हैं, जैसे हल्की मुस्कान, कसा हुआ जबड़ा, उठी हुई भौंहें या आँखों में देखने से पहले एक विराम।
टैग को स्थानीय टाइमिंग निर्देशों की तरह इस्तेमाल करना बेहतर होता है। हर निर्देश को उस शब्द या क्षण के पास रखें जिस पर उसका प्रभाव होना चाहिए। पूरा भाव पैदा करने के लिए केवल एक टैग पर निर्भर न रहें।
उदाहरण के लिए, यह विवरण बहुत अस्पष्ट है:
महिला घबराई हुई है।यह विवरण MiniMax H3 को अधिक दृश्य जानकारी देता है:
महिला अपनी घड़ी दो बार देखती है, फ़ोल्डर पर उँगलियों से हल्की थपकी देती है, छोटी-सी साँस लेती है और बंद दरवाज़े की ओर देखती है।2. संवाद ब्लॉक लिखें
MiniMax H3 बोले गए कंटेंट के लिए <d> ब्लॉक का उपयोग करता है। भाषा टैग और संवाद के सटीक शब्द ब्लॉक के अंदर रखें। किरदार की पहचान, क्रिया और बोलने के तरीके का विवरण ब्लॉक के बाहर रखें।
जब भी कोई किरदार बोले, स्थिर स्पीकर ID का उपयोग करें। सभी शॉट में उस किरदार के लिए वही ID रखें।
एक शांत, साँस मिली हुई आवाज़ वाली युवती (S1) झिझकते हुए कहती है:
<d>[Hindi] मुझे लगा था कि तुम आओगे। <inhale> मैं गलत थी।</d>किसी खास शब्द के पास ज़ोर देने का निर्देश जोड़ा जा सकता है:
पुरुष (S1) कैमरे की ओर झुककर नियंत्रित गुस्से में बोलता है:
<d>[Hindi] तुमने वादा किया था कि ऐसा कभी नहीं होगा। <i>कभी नहीं।</i></d>आप गैर-मौखिक प्रतिक्रिया भी जोड़ सकते हैं:
महिला (S1) गंभीर बने रहने की कोशिश करती है, फिर हल्का-सा हँस पड़ती है:
<d>[Hindi] मुझे यकीन नहीं हो रहा कि तुमने ऐसा किया। <chuckle></d>वॉइस फ़ॉर्मैट निर्देशों में ये शामिल हैं:
| निर्देश | प्रभाव | उदाहरण |
|---|---|---|
<pause> | छोटा विराम जोड़ता है। | सिग्नल कमज़ोर हो रहा है। <pause> मेरे साथ रहो। |
<long pause> | लंबा विराम जोड़ता है। | उसने मुझे जाने को कहा… <long pause> और मैं रुक गया। |
<breath> | साँस लेने की ध्वनि जोड़ता है। | वह सबसे ऊपरी मंज़िल तक पहुँचता है। <breath> दरवाज़ा खुला है। |
<inhale> / <exhale> | साँस अंदर लेने या बाहर छोड़ने की ध्वनि जोड़ता है। | <inhale> तीन तक गिनकर शुरू करते हैं। |
<catches breath> | हाँफते हुए बोलने का तरीका बनाता है। | मैं यहाँ तक दौड़कर आया हूँ। <catches breath> मुझे एक पल दो। |
<deep breath> | शांत होने के लिए गहरी साँस जोड़ता है। | <deep breath> मैं उनका सामना करने के लिए तैयार हूँ। |
<i>word</i> | एक से चार शब्दों पर ज़ोर देता है। | यही वह <i>नतीजा</i> है जिसके बारे में मैंने तुम्हें चेताया था। |
<whisper>...</whisper> | घिरे हुए शब्दों को फुसफुसाकर बोलता है। | <whisper> लाइटें अभी भी जल रही हैं।</whisper> |
<stutter> | अटकती या हकलाती हुई बोलने की शैली बनाता है। | <stutter> न-नहीं, यह मेरा विचार नहीं था। |
ये वोकल साउंड-इफ़ेक्ट निर्देश प्रीसेट पर आधारित प्रयोगात्मक सुविधा हैं। कोणीय कोष्ठकों में लिखे गए कस्टम भावनात्मक टैग, जैसे <nervous>, कंट्रोल के रूप में पहचाने जाने के बजाय सामान्य टेक्स्ट की तरह पढ़े जा सकते हैं।
| निर्देश | प्रभाव | उदाहरण |
|---|---|---|
<laughs> / <chuckle> | तेज़ हँसी से लेकर हल्की हँसी तक, हँसी की ध्वनि जोड़ता है। | यह सबसे मज़ेदार बात है जो मैंने सुनी है। <laughs> |
<snorts> | अक्सर अनायास हँसी की प्रतिक्रिया के रूप में नाक से आवाज़ निकालता है। | मैंने हँसने की कोशिश नहीं की। <snorts> |
<humming> | बोले गए शब्दों के बजाय गुनगुनाने की ध्वनि जोड़ता है। | वह गुनगुनाते हुए गलियारे से गुज़रती है। <humming> |
<breath> | सामान्य साँस लेने की ध्वनि जोड़ता है। | और फिर… <breath> यह हो गया। |
<inhale> / <exhale> | साँस अंदर लेने या बाहर छोड़ने की ध्वनि जोड़ता है। | <inhale> ठीक है, शुरू करते हैं। |
<pant> / <gasps> | तेज़ हाँफने या अचानक साँस खींचने की ध्वनि जोड़ता है। | वह आखिरकार फ़िनिश लाइन पार करता है। <gasps> |
<coughs> / <clear-throat> | बोलने से पहले खाँसी या गला साफ़ करने की ध्वनि जोड़ता है। | <clear-throat> मुझे एक घोषणा करनी है। |
<sighs> | हार मानने, उदासी या राहत का संकेत देने वाली आह जोड़ता है। | मुझे लगता है तुम सही हो। <sighs> |
<lip-smacking> | होंठ चटकाने की ध्वनि जोड़ता है। | वह एक पल रुकता है, <lip-smacking> फिर बोलता है। |
<sniffs> | नाक सुड़कने की ध्वनि जोड़ता है। | वह अपनी आँखें पोंछती है और <sniffs> नाक सुड़कती है। |
<groans> | असहजता या निराशा जैसी कराह की ध्वनि जोड़ता है। | <groans> मैं इसे उठा नहीं सकता। |
<yawns> | जम्हाई की ध्वनि जोड़ता है। | बहुत देर हो चुकी है। <yawns> |
<sneezes> | छींक की ध्वनि जोड़ता है। | वह फूलों की ओर देखता है और फिर <sneezes> छींकता है। |
<burps> | डकार की ध्वनि जोड़ता है। | किरदार पेय खत्म करता है और <burps> डकार लेता है। |
<whistles> | सीटी की ध्वनि जोड़ता है। | वह सीटी बजाते हुए दूर चला जाता है। <whistles> |
<hissing> | फुफकारने की ध्वनि जोड़ता है। | भाप तेज़ <hissing> आवाज़ के साथ बाहर निकलती है। |
<emm> | झिझक या भराव शब्द के रूप में “emm” ध्वनि जोड़ता है। | <emm> मुझे यकीन नहीं है। |
<crying> | रोने या सिसकने की ध्वनि जोड़ता है। | मैंने इसे रोकने की कोशिश की। <crying> |
<applause> | दृश्य में या पृष्ठभूमि में तालियों की ध्वनि जोड़ता है। | वक्ता समाप्त करता है और <applause> तालियाँ बजती हैं। |
इन निर्देशों को याद रखने वाले अलग-अलग शब्दों की सूची के बजाय सटीक, स्थानीय निर्देशों की तरह इस्तेमाल करना बेहतर है। (S1) के साथ <d> के अंदर [Hindi] वाला पूरा स्पीकर फ़ॉर्मैट इस्तेमाल करें और हर टैग को उस क्षण के पास रखें जिस पर उसका प्रभाव होना चाहिए। ज़ोर देने के लिए एक से चार शब्दों के चारों ओर <i>word</i> लगाएं; [emphasis] जैसे वर्गाकार कोष्ठक वाले निर्देश कभी-कभी ज़ोर से पढ़े जा सकते हैं या वाक्य के अपेक्षित हिस्से से अधिक पर प्रभाव डाल सकते हैं। अगर कोई निर्देश अनचाहा परिणाम दे, तो संवाद ब्लॉक के बाहर स्वाभाविक भाषा में बोलने का तरीका बताएं। कई ज़ोर वाले निर्देशों की ज़रूरत हो तो उन्हें <pause> से अलग करें, ताकि मॉडल के पास हर भाव-खंड को अलग पहचानने की जगह हो।
3. दिखाई देने वाले भाव और संदर्भ जोड़ें
वॉइस टैग ऑडियो को प्रभावित कर सकते हैं, लेकिन चेहरे और शरीर के लिए दृश्य निर्देश भी ज़रूरी हैं। शॉट की टाइमलाइन में प्रतिक्रिया का विवरण दें:
[Shot 1] फ़िल्म जैसा क्लोज़-अप। धुंधले रोशन वाले दफ़्तर में एक थका हुआ जासूस संदेश पढ़ता है, पल भर के लिए भौंहें उठाता है, फिर होंठ भींचकर नज़रें फेर लेता है। उसकी आवाज़ संयमित है, लेकिन उसमें चोट का भाव है (S1):
<d>[Hindi] तुमने रुकने का वादा किया था। <sighs> अब मुझे क्या करना चाहिए?</d>ठोस और देखे जा सकने वाले विवरण इस्तेमाल करें:
- आश्चर्य: आँखें फैलाना, भौंहें उठाना, पल भर के लिए मुँह खोलना और सिर थोड़ा पीछे करना।
- संदेह: एक भौंह उठाना, नज़र बगल की ओर ले जाना और होंठ भींचना।
- डर: उथली साँस, फैली हुई आँखें, तने हुए कंधे और बाहर निकलने के रास्ते की ओर तेज़ नज़र।
- राहत: कंधे ढीले पड़ना, पलकें नरम होना, लंबी साँस छोड़ना और हल्की असमान मुस्कान।
- गुस्सा: जबड़ा कसना, आँखें सिकोड़ना, शरीर को कड़ा रखना और छोटे-छोटे वाक्यों में बोलना।
- उदासी: नज़रें झुकाना, गति धीमी करना, होंठ काँपना और बोलने से पहले धीरे से साँस लेना।
संदर्भ से भाव अधिक सुसंगत बनते हैं। संवाद से ठीक पहले क्या हुआ और किरदार क्या चाहता है, यह बताएं। “दरवाज़े का हैंडल घूम रहा है, इसलिए वह डर रही है” आम तौर पर “वह डर रही है” की तुलना में अभिनय को बेहतर दिशा देता है।
4. प्रॉम्प्ट बनाकर उसका परीक्षण करें
- CawCut में MiniMax H3 वीडियो जनरेशन वर्कफ़्लो खोलें।
- अपनी ज़रूरत के अनुसार इनपुट मोड चुनें, जैसे टेक्स्ट-टू-वीडियो या इमेज-टू-वीडियो।
- शॉट का विवरण समय के क्रम में लिखें: दृश्य, मुख्य विषय, क्रिया, कैमरा, प्रतिक्रिया और संवाद।
- स्थिर स्पीकर ID जोड़ें और सटीक संवाद को
<d>में रखें। - जहाँ निर्देश होना चाहिए, वहाँ एक या दो इनलाइन निर्देश जोड़ें। एक से चार शब्दों पर ज़ोर देने के लिए
<i>...</i>, समय या बोलने के तरीके के लिए फ़ॉर्मैट टैग और वोकल प्रभावों के लिए कोणीय कोष्ठकों वाले प्रीसेट निर्देश इस्तेमाल करें। - अगर संभव हो, तो पहले छोटा और कम लागत वाला परीक्षण संस्करण जनरेट करें।
- प्रॉम्प्ट बढ़ाने या आउटपुट गुणवत्ता बढ़ाने से पहले आवाज़, टाइमिंग, चेहरे की प्रतिक्रिया, मुँह की गति और निरंतरता जाँचें।
प्रॉम्प्ट को केंद्रित रखें। एक ही शॉट में किरदार को डर से गुस्से, हँसी और उदासी तक ले जाने की तुलना में, हर शॉट में एक ही भावनात्मक बदलाव रखना आम तौर पर अधिक आसानी से नियंत्रित होता है।
5. अस्थिर परिणामों की समस्या हल करें
- टैग ज़ोर से पढ़ा जाता है: पूरा
(S1) says: <d>[Hindi] ...</d>फ़ॉर्मैट इस्तेमाल करें, दूसरी सिंटैक्स आज़माएँ या<d>के बाहर स्वाभाविक भाषा में बोलने का तरीका बताएं। अकेले इस्तेमाल किए गए टैग कभी-कभी बोले जा सकते हैं। - आवाज़ में भाव है, लेकिन दृश्य में नहीं: शॉट के विवरण में चेहरे और शरीर की ठोस क्रियाएँ जोड़ें।
- किरदार साँस या हँसी छोड़ देता है: निर्देश को संबंधित वाक्यांश के पास ले जाएँ,
<breath>या<laughs>जैसे उपयुक्त प्रीसेट का इस्तेमाल करें और अन्य टैग कम करें। - अलग-अलग शॉट में किरदार की आवाज़ बदल जाती है: वही स्पीकर ID और आवाज़ का विवरण दोहराएँ और संवाद की संरचना एक जैसी रखें।
- पंक्ति बहुत तेज़ बोली जाती है: वाक्य छोटा करें, जनरेशन का समय बढ़ाएँ, विराम या साँस जोड़ें और शॉट में क्रियाओं की संख्या कम करें।
- परिणाम स्थिर नहीं है: एक बार में केवल एक वैरिएबल बदलें। उसी शॉट को बिना टैग, एक टैग के साथ और अलग स्वाभाविक भाषा वाले विवरण के साथ टेस्ट करें।
विशेष रूप से अभिव्यंजक चेहरों के लिए सरल पृष्ठभूमि वाला क्लोज़-अप आज़माएँ और किरदार के सिर व कंधों को फ़्रेम में स्थिर रखें। इससे आवाज़ और सूक्ष्म हाव-भाव जनरेट करते समय मॉडल के सामने आने वाले दृश्य कार्य कम हो जाते हैं।
सबसे विश्वसनीय प्रॉम्प्ट एक छोटा-सा प्रोडक्शन ब्रीफ़ होता है: दर्शक क्या देखता है, किरदार क्या करता है, किरदार क्या कहता है और उस क्षण ध्वनि कैसे बदलती है—इन सबका वर्णन करें।