Claude Opus 5.5 כבר זמין ב-SeedRouter

מדריך פרומפטים ל-MiniMax H3: המבנה הרשמי, נבדק על קליפים אמיתיים

איך לכתוב פרומפטים ל-MiniMax H3: המבנה הרשמי בשלושה חלקים, תגיות דיאלוג, תזמון שוטים ותוויות ייחוס, שנבדקו על ארבעה קליפים.

קריאה כ-Markdown

MiniMax H3 בנוי לקרוא פרומפטים בצורה מובנית בת שלושה חלקים: התמונה והדיאלוג לאורך ציר זמן, הסאונד הכללי, ומוזיקת רקע אם יש. MiniMax קוראת לשלב שהופך בקשה רגילה לצורה הזו H3-Context-IR, ואומרת שהוא "critical to the quality of the final output" (קריטי לאיכות הפלט הסופי).[1] SD Video, שבנוי על MiniMax H3, משכתב את הפרומפט שלך כברירת מחדל לפני היצירה. בארבעת קליפי הבדיקה שלנו, פרומפט רגיל ופרומפט שנכתב במבנה הרשמי נתנו תוצאות שמישות באותה מידה, ואילו כיבוי השכתוב שינה את השוט ואת מיקס הסאונד.

המדריך הזה מסביר את המבנה הרשמי, איך כותבים דיאלוג, חיתוכים וייחוסים, ומה הבדיקות הראו.

איך נראה פרומפט ל-MiniMax H3?

במצבי טקסט, תמונה ופריימים מרכזיים, המדריך הרשמי משתמש בשלושה שדות בסדר קבוע:[2]

  • integrated_multimodal_description: הגוף הראשי. סגנון חזותי, קומפוזיציה, דמויות, פעולות, מצלמה, מעברי שוטים, מי מדבר ומה הוא אומר, והצלילים שקשורים לפעולות על המסך, לפי סדר הזמן.
  • overall_soundscape: אווירה, צלילי פעולה וצלילים אנושיים שאינם דיבור לאורך כל הקליפ.
  • non_diegetic_music: מוזיקת רקע שרק הקהל שומע, או N/A אם אין.

דוגמה קצרה במבנה הזה, מתוך הבדיקות שלנו:

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>

overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.

non_diegetic_music: N/A

ההנחיות הרשמיות מבקשות לכתוב את החלקים האלה באנגלית, בעוד שדיאלוג, מילות שירים וטקסט שנראה על המסך נשארים בשפת המקור.[3]

איך כותבים דיאלוג בפרומפט ל-MiniMax H3?

תן לכל דובר מזהה קבוע כמו (S1) או (S2), תאר את הקול מחוץ לתגית, ושים בתוך <d>…</d> רק תגית שפה ואת המילים שנאמרות:[2]

The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>

המילים שבתוך התגית נשמרות מילה במילה, אז כתוב אותן בדיוק כמו שהן צריכות להיאמר. דובר שומר על אותו מזהה לאורך כל השוטים, ודמויות שאף פעם לא מדברות לא מקבלות מזהה. לקריין, המדריך משתמש בביטוי "says in an off-screen voiceover" (אומר בקריינות מחוץ לפריים) ואז מציין שהשפתיים של הדמות שעל המסך נשארות סגורות.[2]

איך מתזמנים שוטים וחיתוכים?

סמן כל שוט כ-[Shot 1], [Shot 2] וציין את זמן החיתוך: ⁦"[Shot 2] At 00:05.000, the camera cuts to a close-up of…"⁩ (ב-00:05.000 המצלמה חותכת לתקריב של…). ציר הזמן חייב להסתכם באורך הקליפ, שהוא 4 עד 15 שניות.[2][3] בבדיקה שלנו גם משפט רגיל עבד: "At 3 seconds, cut to a close-up of steam rising from the bread" (בשנייה 3, חתוך לתקריב של אדים שעולים מהלחם) יצר חיתוך בערך בשנייה 3 (קליפ C למטה).

לדיאלוג צריך מקום בתוך השוט שלו. ההנחיות של SD Video עצמו הן בערך 2.5 מילים של דיאלוג לשנייה, כך שקליפ של 5 שניות מכיל משפט קצר אחד.[4]

איך מפנים לתמונות, סרטונים ואודיו בפרומפט?

מפנים לייחוסים לפי תווית, שממוספרת לפי סוג ולפי הסדר שבו שלחת אותם: <Picture 1>, <Video 1>, <Audio 1>. המדריך הרשמי מבקש לשמור על כל תווית זהה בכל חלקי הפרומפט.[3] במצב הייחוס המלא, השכתוב הרשמי משתמש בשישה חלקים במקום שלושה: הגדרות דמויות, תקציר, ניתוח שימור (מה לשמור מכל ייחוס), התיאור המפורט, הסאונד והמוזיקה.[3]

פרומפט רגיל עם תווית אחת מספיק פעמים רבות. הקליפ הזה השתמש בסרטון ייחוס של 3 שניות של נגינה בצ׳לו ובפרומפט ⁦"The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed."⁩ (הנגינה בצ׳לו ב-<Video 1> נמשכת במשיכת קשת ארוכה אחת, מצלמה סטטית, צליל חדר חם, צליל הצ׳לו, בלי מצע מוזיקלי.):

מייחוס לווידאו ב-SD Video, 480p, 5 שניות, סרטון ייחוס אחד.

איך זה נראה עם כמה סרטוני ייחוס?

סרטון ייחוס אחד ופרומפט קצר. הייחוס הוא קליפ של 6 שניות של מחליקים על הקרח, והפרומפט ⁦"The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music."⁩ (המחליקים ב-<Video 1> גולשים על פני משטח החלקה פתוח בשעת דמדומים, המצלמה נשארת במקום, צליל המחליקיים השורטים את הקרח, פטפוט מרוחק, בלי מוזיקה.):

סרטון ייחוס אחד, 480p, 5 שניות.

אותו פרומפט ואותו ייחוס, עם duration שמוגדר ל-10:

סרטון ייחוס אחד, 480p, 10 שניות.

שני סרטוני ייחוס מקבלים תוויות לפי הסדר שבו הם נשלחים. כאן <Video 1> הוא המחליקים ו-<Video 2> הוא קליפ ריקוד של 8.6 שניות, עם הפרומפט ⁦"The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music."⁩ (המחליקים ב-<Video 1> צופים ברקדן מ-<Video 2> שמופיע על הקרח בשעת דמדומים, מצלמה סטטית, שריטת מחליקיים, בלי מוזיקה.):

שני סרטוני ייחוס, 480p, 5 שניות.

כאן <Video 1> הוא קליפ הצ׳לנית של 3 שניות ו-<Video 2> הוא קליפ הריקוד, עם הפרומפט ⁦"The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed."⁩ (הצ׳לנית ב-<Video 1> מנגנת בזמן שהרקדן מ-<Video 2> נע לאט לצידה, מצלמה סטטית, צליל צ׳לו, צעדים, בלי מצע מוזיקלי.):

שני סרטוני ייחוס, 480p, 5 שניות.

כש-aspect_ratio נשאר על adaptive, הקליפ מקבל את הצורה של סרטון הייחוס הראשון. קליפ הריקוד אנכי, ולכן שתי התוצאות האלה יצאו אנכיות ב-⁦480 × 832⁩. בשתיהן השתמשנו באותו פרומפט ובאותו ייחוס בלי seed קבוע, כך שכל הרצה בחרה seed משלה והתוצאות שונות. הפרומפט היה ⁦"The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music."⁩ (הרקדן ב-<Video 1> חוזר על אותן תנועות בסטודיו ריק, מצלמה סטטית, צעדים על עץ, בלי מוזיקה.):

אותה בקשה הורצה פעמיים, 480p, 5 שניות, אנכי.

האם הפורמט המובנה עדיף על פרומפט רגיל?

הרצנו את אותה סצנת מאפייה בארבע דרכים ב-SD Video, שבנוי על MiniMax H3: מטקסט לווידאו, 480p, 5 שניות, 16:9, seed 42. כל פרומפט הורץ פעם אחת, אז קרא את התוצאות כתצפיות בודדות, לא כממוצעים.

A. פרומפט רגיל. האופה מניח את הכיכר ואומר את המשפט למצלמה במהלך התקרבות איטית.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.

B. המבנה הרשמי. הפרומפט שמופיע בחלק הראשון למעלה. התוצאה קרובה ל-A: אותה פעולה, המשפט נאמר נכון, פריים קצת יותר רחב.

C. פרומפט רגיל עם חיתוך מתוזמן. המשפט מסתיים בערך ב-2.5 שניות, והשוט חותך לתקריב של הלחם בין 3 ל-3.5 שניות.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.

D. פרומפט A עם שכתוב כבוי (prompt_enhancement: disabled). המצלמה רחוקה יותר וכמעט לא זזה, פעמון הדלת מגיע קודם, והמשפט מתחיל בערך ב-3.5 שניות. פס הקול שקט הרבה יותר: הרמה הממוצעת שלו נמדדה כ-20 dB מתחת לשלושת הקליפים האחרים.

מה זה מרמז:

פרומפטהמשפט נאמר נכוןמה השתנה
A. רגילכןנקודת ייחוס
B. המבנה הרשמיכןקרוב מאוד ל-A
C. רגיל, חיתוך ב-3 שניותכןהחיתוך נפל במקום שביקשנו
D. רגיל, שכתוב כבויכןשוט סטטי רחב יותר, המשפט מאוחר יותר, אודיו שקט הרבה יותר

כשהשירות משכתב את הפרומפט שלך, פרומפט רגיל וברור מספיק. כתוב את המבנה בעצמך כשאתה מכבה את השכתוב, או כשאתה מריץ את המשקלים הפתוחים בלי H3-Context-IR, כי אז שום דבר לא ממיר את הטקסט שלך לצורה שהמודל מצפה לה.

טיפים לפרומפטים טובים יותר ל-MiniMax H3

  • התאם את ציר הזמן לאורך הקליפ; אל תתאר 10 שניות של פעולה לקליפ של 5 שניות.[3]
  • השתמש בפרטים חזותיים וקוליים קונקרטיים במקום מילים כמו "cinematic" (קולנועי) או "beautiful" (יפה).[3]
  • תאר את הסאונד: צליל החדר, צלילי הפעולה וכמה הם רחוקים. כתוב no music אם אתה לא רוצה מצע מוזיקלי.[4]
  • שמור על דיאלוג קצר, משפט אחד לכל כמה שניות: במירכאות בפרומפט רגיל, ובתוך תגי <d> בפורמט המובנה.
  • קבע את ה-seed ושנה דבר אחד בכל פעם כשאתה משפר שוט.[4]
  • עם פריימים מרכזיים, ציין איך הפריים הראשון או האחרון מתחבר לפעולה.[3]

בעמוד SD Video יש Playground לניסוי פרומפטים, ובתיעוד ה-API מופיעים כל הפרמטרים, כולל prompt_enhancement.

שאלות על כתיבת פרומפטים

האם צריך לכתוב פרומפטים ל-MiniMax H3 באנגלית?

ההנחיות הרשמיות כותבות את החלקים התיאוריים באנגלית ומשאירות דיאלוג, מילות שירים וטקסט על המסך בשפת המקור.[3] דיאלוג בשפה אחרת נכנס לתוך תגית <d> יחד עם תגית השפה שלו.

מה זה H3-Context-IR?

זה שלב העיבוד המקדים של MiniMax, שקורא את הטקסט והמדיה שאתה שולח ומשכתב אותם לייצוג המובנה ש-H3 יוצר ממנו. הוא לא חלק מהגרסה בקוד פתוח; MiniMax מציעה אותו כ-API ומפרסמת את הנחיות הפרומפטים כדי שמפתחים יוכלו לבנות כלי משלהם.[1][5]

מה עושה prompt_enhancement ב-SD Video?

הוא שולט בשכתוב הפרומפט שלך לפני היצירה: turbo (ברירת המחדל), quality, או disabled כדי לשלוח את הטקסט כפי שכתבת אותו. השכתוב לא משנה תוויות ייחוס כמו <Picture 1>.[4]

כמה ארוך צריך להיות פרומפט ל-MiniMax H3?

ארוך מספיק כדי לכסות את כל ציר הזמן. הדוגמאות המשוכתבות של MiniMax עצמה מגיעות לכמה מאות מילים לקליפ אחד, וההנחיות של SD Video מציינות שאין מחיר על פירוט.[1][4]

מקורות

  1. MiniMax. כרטיס המודל MiniMax-H3. אוחזר ב-4 באוקטובר 2026 מ-huggingface.co.
  2. MiniMax. ⁦h3-prompt-writing: base mode reference (references/base-en.txt)⁩. אוחזר ב-4 באוקטובר 2026 מ-github.com.
  3. MiniMax. הסקיל H3 Prompt Writing. אוחזר ב-4 באוקטובר 2026 מ-github.com.
  4. SeedRouter. SD Video API reference. אוחזר ב-4 באוקטובר 2026 מ-seedrouter.ai.
  5. MiniMax. Create H3-Context-IR Task. אוחזר ב-4 באוקטובר 2026 מ-platform.minimax.io.

מדריכים קשורים