دليل موجّهات MiniMax H3: البنية الرسمية مجرّبة على مقاطع حقيقية
كيف تكتب موجّهات MiniMax H3: البنية الرسمية ذات الأجزاء الثلاثة، ووسوم الحوار، وتوقيت اللقطات، وتسميات المراجع، مجرّبة على أربعة مقاطع.
اقرأ بصيغة Markdownصُمّم MiniMax H3 ليقرأ الموجّهات في صيغة منظّمة من ثلاثة أجزاء: الصورة والحوار على امتداد خط زمني، والمشهد الصوتي العام، وأي موسيقى خلفية. تسمّي MiniMax الخطوة التي تحوّل الطلب العادي إلى هذه الصيغة H3-Context-IR، وتقول إنها "critical to the quality of the final output" (حاسمة لجودة المخرجات النهائية).[1] ويعيد SD Video، المبني على MiniMax H3، كتابة موجّهك افتراضيًا قبل التوليد. في مقاطعنا التجريبية الأربعة، أعطى الموجّه العادي والموجّه المكتوب بالبنية الرسمية نتائج صالحة للاستخدام بالقدر نفسه، أما إيقاف إعادة الكتابة فقد غيّر اللقطة والمزج الصوتي.
يشرح هذا الدليل البنية الرسمية، وكيف تكتب الحوار والقطعات والمراجع، وما أظهرته التجارب.
كيف يبدو موجّه MiniMax H3؟
في أوضاع النص والصورة والإطارات المفتاحية، يستخدم الدليل الرسمي ثلاثة حقول بترتيب ثابت:[2]
- integrated_multimodal_description: المتن الرئيسي. الأسلوب البصري، والتكوين، والشخصيات، والأفعال، والكاميرا، وتغيّر اللقطات، ومن يتكلم وماذا يقول، والأصوات المرتبطة بالأفعال على الشاشة، بالترتيب الزمني.
- overall_soundscape: الأجواء، وأصوات الأفعال، والأصوات البشرية غير الكلامية على امتداد المقطع كله.
- non_diegetic_music: الموسيقى الخلفية التي يسمعها الجمهور وحده، أو
N/Aإن لم توجد.
مثال قصير بهذه البنية من تجاربنا:
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/Aيطلب الدليل الرسمي كتابة هذه الأقسام بالإنجليزية، بينما يبقى الحوار وكلمات الأغاني والنص الظاهر على الشاشة بلغتها الأصلية.[3]
كيف تكتب الحوار في موجّه MiniMax H3؟
أعطِ كل متحدث معرّفًا ثابتًا مثل (S1) أو (S2)، وصِف الصوت خارج الوسم، ولا تضع داخل <d>…</d> إلا وسم اللغة والكلمات المنطوقة:[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>تُحفظ الكلمات داخل الوسم حرفيًا، لذا اكتبها تمامًا كما يجب أن تُنطق. يحتفظ المتحدث بالمعرّف نفسه عبر اللقطات، ولا تحصل الشخصيات التي لا تتكلم أبدًا على معرّف. أما الراوي، فيستخدم الدليل عبارة "says in an off-screen voiceover" (يقول بتعليق صوتي من خارج الكادر) ثم ينصّ على أن شفتي الشخصية الظاهرة على الشاشة تبقيان مغلقتين.[2]
كيف تضبط توقيت اللقطات والقطعات؟
ضع على كل لقطة علامة [Shot 1] و[Shot 2]، واذكر وقت القطع: "[Shot 2] At 00:05.000, the camera cuts to a close-up of…" (عند 00:05.000 تنتقل الكاميرا إلى لقطة مقرّبة لـ…). يجب أن يساوي مجموع الخط الزمني طول المقطع، وهو من 4 إلى 15 ثانية.[2][3] وفي تجربتنا نجحت الجملة العادية أيضًا: أنتجت "At 3 seconds, cut to a close-up of steam rising from the bread" (عند الثانية 3، انتقل إلى لقطة مقرّبة للبخار المتصاعد من الخبز) قطعًا عند الثانية 3 تقريبًا (المقطع C أدناه).
يحتاج الحوار إلى متّسع داخل لقطته. إرشادات SD Video نفسها تقدّر نحو 2.5 كلمة حوار في الثانية، لذا يتسع مقطع مدته 5 ثوانٍ لجملة قصيرة واحدة.[4]
كيف تشير إلى الصور ومقاطع الفيديو والصوت في الموجّه؟
يُشار إلى المراجع بتسميات مرقّمة حسب النوع وبالترتيب الذي ترسلها به: <Picture 1> و<Video 1> و<Audio 1>. ويطلب الدليل الرسمي أن تبقى كل تسمية كما هي في جميع أقسام الموجّه.[3] وفي وضع المراجع الكامل، تستخدم إعادة الكتابة الرسمية ستة أقسام بدل ثلاثة: تعريفات الشخصيات، وملخّصًا، وتحليل الاحتفاظ (ما يُحتفظ به من كل مرجع)، والوصف التفصيلي، والمشهد الصوتي، والموسيقى.[3]
كثيرًا ما يكفي موجّه عادي فيه تسمية واحدة. استخدم هذا المقطع فيديو مرجعيًا مدته 3 ثوانٍ لعزف على التشيلو، والموجّه "The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed." (عازف التشيلو في <Video 1> يواصل جرّة قوس واحدة طويلة، كاميرا ثابتة، صوت غرفة دافئ، نغمة التشيلو، بلا خلفية موسيقية.):
من المراجع إلى فيديو على SD Video، 480p، 5 ثوانٍ، فيديو مرجعي واحد.
كيف تبدو النتيجة مع أكثر من فيديو مرجعي؟
فيديو مرجعي واحد وموجّه قصير. المرجع مقطع مدته 6 ثوانٍ لمتزلجين، والموجّه "The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music." (يتزلّج المتزلجون في <Video 1> عبر حلبة خارجية عند الغسق، الكاميرا ثابتة، صوت الزلاجات وهي تخدش الجليد، أحاديث بعيدة، بلا موسيقى.):
فيديو مرجعي واحد، 480p، 5 ثوانٍ.
الموجّه نفسه والمرجع نفسه مع ضبط duration على 10:
فيديو مرجعي واحد، 480p، 10 ثوانٍ.
يُرقَّم الفيديوهان المرجعيان بترتيب إرسالهما. هنا <Video 1> هو المتزلجون و<Video 2> مقطع رقص مدته 8.6 ثانية، والموجّه "The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music." (يشاهد المتزلجون في <Video 1> الراقص في <Video 2> وهو يؤدي على الجليد عند الغسق، كاميرا ثابتة، صوت خدش الزلاجات، بلا موسيقى.):
فيديوهان مرجعيان، 480p، 5 ثوانٍ.
وهنا <Video 1> هو مقطع عازفة التشيلو ومدته 3 ثوانٍ، و<Video 2> هو مقطع الرقص، والموجّه "The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed." (تعزف عازفة التشيلو في <Video 1> بينما يتحرك الراقص في <Video 2> ببطء بجانبها، كاميرا ثابتة، نغمة التشيلو، وقع خطوات، بلا خلفية موسيقية.):
فيديوهان مرجعيان، 480p، 5 ثوانٍ.
عند ترك aspect_ratio على adaptive، يأخذ المقطع شكل الفيديو المرجعي الأول. مقطع الرقص عمودي، لذا خرجت هاتان النسختان عموديتين بمقاس 480 × 832. استخدمت كلتاهما الموجّه نفسه والمرجع نفسه من دون seed ثابت، فاختار كل تشغيل seed خاصًا به وجاءت النسختان مختلفتين. وكان الموجّه "The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music." (يكرر الراقص في <Video 1> الحركات نفسها في استوديو فارغ، كاميرا ثابتة، وقع خطوات على الخشب، بلا موسيقى.):
الطلب نفسه مُشغَّلًا مرتين، 480p، 5 ثوانٍ، عمودي.
هل تتفوّق الصيغة المنظّمة على الموجّه العادي؟
شغّلنا مشهد المخبز نفسه بأربع طرق على SD Video، المبني على MiniMax H3: من نص إلى فيديو، 480p، 5 ثوانٍ، 16:9، seed 42. شُغّل كل موجّه مرة واحدة، فاقرأ هذه النتائج بوصفها ملاحظات فردية لا متوسطات.
A. موجّه عادي. يضع الخبّاز الرغيف ويقول جملته للكاميرا أثناء اقتراب بطيء.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. البنية الرسمية. الموجّه المعروض في القسم الأول أعلاه. النتيجة قريبة من A: الفعل نفسه، والجملة منطوقة بشكل صحيح، وكادر أوسع قليلًا.
C. موجّه عادي مع قطع في توقيت محدد. تنتهي الجملة عند 2.5 ثانية تقريبًا، وتنتقل اللقطة إلى الخبز عن قرب بين 3 و3.5 ثانية.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. الموجّه A مع إيقاف إعادة الكتابة (prompt_enhancement: disabled). تقف الكاميرا أبعد ولا تكاد تتحرك، ويرنّ جرس الباب أولًا، وتبدأ الجملة عند 3.5 ثانية تقريبًا. والمسار الصوتي أهدأ بكثير: قيس متوسط مستواه فكان أقل بنحو 20 dB من المقاطع الثلاثة الأخرى.
ما يشير إليه ذلك:
| الموجّه | هل نُطقت الجملة بشكل صحيح | ما الذي تغيّر |
|---|---|---|
| A. عادي | نعم | خط الأساس |
| B. البنية الرسمية | نعم | قريب جدًا من A |
| C. عادي، قطع عند 3 ثوانٍ | نعم | وقع القطع حيث طُلب |
| D. عادي، إعادة الكتابة متوقفة | نعم | لقطة ثابتة أوسع، الجملة متأخرة، صوت أهدأ بكثير |
حين تعيد الخدمة كتابة موجّهك، يكفي موجّه عادي واضح. اكتب البنية بنفسك حين توقف إعادة الكتابة، أو حين تشغّل الأوزان المفتوحة من دون H3-Context-IR، لأنه لا شيء عندئذ يحوّل نصك إلى الصيغة التي يتوقعها النموذج.
نصائح لموجّهات MiniMax H3 أفضل
- طابِق الخط الزمني مع طول المقطع؛ لا تصف 10 ثوانٍ من الأحداث لمقطع مدته 5 ثوانٍ.[3]
- استخدم تفاصيل بصرية وصوتية ملموسة بدل كلمات مثل "cinematic" (سينمائي) أو "beautiful" (جميل).[3]
- صِف الصوت: صوت الغرفة، وأصوات الأفعال، ومدى بُعدها. اكتب
no musicإن لم ترغب في خلفية موسيقية.[4] - اجعل الحوار قصيرًا، جملة واحدة كل بضع ثوانٍ: بين علامتي تنصيص في الموجّه العادي، وداخل وسوم
<d>في الصيغة المنظّمة. - ثبّت قيمة seed وغيّر شيئًا واحدًا في كل مرة حين تحسّن لقطة.[4]
- مع الإطارات المفتاحية، اذكر كيف يتصل الإطار الأول أو الأخير بالحدث.[3]
في صفحة SD Video تجد Playground لتجربة الموجّهات، وفي مرجع API قائمة بكل المعاملات، ومنها prompt_enhancement.
أسئلة عن كتابة الموجّهات
هل يجب كتابة موجّهات MiniMax H3 بالإنجليزية؟
يكتب الدليل الرسمي الأقسام الوصفية بالإنجليزية ويُبقي الحوار وكلمات الأغاني والنص الظاهر على الشاشة بلغتها الأصلية.[3] ويوضع الحوار بلغة أخرى داخل وسم <d> مع وسم لغته.
ما هو H3-Context-IR؟
هو خطوة المعالجة المسبقة لدى MiniMax التي تقرأ النص والوسائط التي ترسلها وتعيد كتابتها في التمثيل المنظّم الذي يولّد H3 منه. وهو غير موجود في الإصدار مفتوح المصدر؛ إذ تقدّمه MiniMax بوصفه API وتنشر إرشادات الموجّهات ليبني المطورون أدواتهم الخاصة.[1][5]
ماذا يفعل prompt_enhancement في SD Video؟
يتحكم في إعادة كتابة موجّهك قبل التوليد: turbo (الافتراضي)، أو quality، أو disabled لإرسال نصك كما كتبته. ولا تغيّر إعادة الكتابة تسميات المراجع مثل <Picture 1>.[4]
ما الطول المناسب لموجّه MiniMax H3؟
طول يكفي لتغطية الخط الزمني كله. تمتد أمثلة MiniMax نفسها بعد إعادة الكتابة إلى عدة مئات من الكلمات للمقطع الواحد، وتشير إرشادات SD Video إلى أن التفصيل لا يُعاقَب عليه.[1][4]
المراجع
- MiniMax. بطاقة نموذج MiniMax-H3. تم الاسترجاع في 4 أكتوبر 2026 من huggingface.co.
- MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). تم الاسترجاع في 4 أكتوبر 2026 من github.com.
- MiniMax. مهارة H3 Prompt Writing. تم الاسترجاع في 4 أكتوبر 2026 من github.com.
- SeedRouter. SD Video API reference. تم الاسترجاع في 4 أكتوبر 2026 من seedrouter.ai.
- MiniMax. Create H3-Context-IR Task. تم الاسترجاع في 4 أكتوبر 2026 من platform.minimax.io.



