Claude Opus 5.5 đã có trên SeedRouter

Hướng dẫn viết prompt MiniMax H3: cấu trúc chính thức, thử trên clip thật

Cách viết prompt MiniMax H3: cấu trúc ba phần chính thức, thẻ lời thoại, thời điểm cắt cảnh và nhãn tham chiếu, đã thử trên bốn clip.

Đọc dạng Markdown

MiniMax H3 được xây dựng để đọc prompt ở dạng có cấu trúc gồm ba phần: hình ảnh và lời thoại theo dòng thời gian, toàn bộ âm thanh nền, và nhạc nền nếu có. MiniMax gọi bước chuyển một yêu cầu thông thường sang dạng này là H3-Context-IR, và cho rằng nó "critical to the quality of the final output" (mang tính quyết định với chất lượng đầu ra cuối cùng).[1] SD Video, được xây dựng trên MiniMax H3, mặc định viết lại prompt của bạn trước khi tạo. Trong bốn clip thử của chúng tôi, prompt thường và prompt viết theo cấu trúc chính thức cho kết quả dùng được ngang nhau, còn tắt tính năng viết lại thì cảnh quay và phần phối âm thay đổi.

Hướng dẫn này trình bày cấu trúc chính thức, cách viết lời thoại, cắt cảnh và tham chiếu, cùng những gì các bài thử cho thấy.

Prompt MiniMax H3 trông như thế nào?

Với các chế độ văn bản, ảnh và khung hình chính, hướng dẫn chính thức dùng ba trường theo thứ tự cố định:[2]

  • integrated_multimodal_description: phần thân chính. Phong cách hình ảnh, bố cục, chủ thể, hành động, máy quay, chuyển cảnh, ai nói và nói gì, cùng các âm thanh gắn với hành động trên màn hình, theo thứ tự thời gian.
  • overall_soundscape: âm thanh môi trường, tiếng động của hành động và các âm thanh không lời của con người trong suốt clip.
  • non_diegetic_music: nhạc nền chỉ khán giả nghe thấy, hoặc N/A nếu không có.

Một ví dụ ngắn theo cấu trúc đó, lấy từ các bài thử của chúng tôi:

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>

overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.

non_diegetic_music: N/A

Hướng dẫn chính thức yêu cầu viết các phần này bằng tiếng Anh, còn lời thoại, lời bài hát và chữ hiển thị trên hình giữ nguyên ngôn ngữ gốc.[3]

Viết lời thoại trong prompt MiniMax H3 thế nào?

Gán cho mỗi người nói một ID cố định như (S1) hoặc (S2), mô tả giọng nói bên ngoài thẻ, và chỉ đặt thẻ ngôn ngữ cùng lời nói bên trong <d>…</d>:[2]

The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>

Lời bên trong thẻ được giữ nguyên từng chữ, vì vậy hãy viết đúng như cần được nói ra. Một người nói giữ cùng ID qua các cảnh quay, và nhân vật không bao giờ nói thì không có ID. Với người dẫn chuyện, hướng dẫn dùng cụm "says in an off-screen voiceover" (nói bằng giọng thuyết minh ngoài khung hình) rồi ghi rõ môi của nhân vật trên màn hình vẫn khép.[2]

Căn thời gian cảnh quay và cắt cảnh thế nào?

Đánh dấu mỗi cảnh là [Shot 1], [Shot 2] và ghi thời điểm cắt: "[Shot 2] At 00:05.000, the camera cuts to a close-up of…" ([Shot 2] Tại 00:05.000, máy quay cắt sang cận cảnh…). Dòng thời gian phải cộng lại bằng độ dài clip, tức từ 4 đến 15 giây.[2][3] Trong bài thử của chúng tôi, một câu thông thường cũng có tác dụng: "At 3 seconds, cut to a close-up of steam rising from the bread" (Ở giây thứ 3, cắt sang cận cảnh hơi nóng bốc lên từ ổ bánh) tạo ra một lần cắt ở khoảng giây thứ 3 (clip C bên dưới).

Lời thoại cần đủ chỗ trong cảnh quay của nó. Hướng dẫn riêng của SD Video là khoảng 2,5 từ lời thoại mỗi giây, nên một clip 5 giây chứa được một câu ngắn.[4]

Tham chiếu ảnh, video và âm thanh trong prompt thế nào?

Tham chiếu được gọi bằng nhãn, đánh số theo từng loại theo thứ tự bạn gửi: <Picture 1>, <Video 1>, <Audio 1>. Hướng dẫn chính thức yêu cầu giữ mỗi nhãn giống nhau trong mọi phần của prompt.[3] Ở chế độ tham chiếu đầy đủ, bản viết lại chính thức dùng sáu phần thay vì ba: định nghĩa chủ thể, tóm tắt, phân tích giữ lại (giữ gì từ mỗi tham chiếu), mô tả chi tiết, âm thanh nền và nhạc.[3]

Một prompt thường có một nhãn thường là đủ. Clip này dùng một video tham chiếu 3 giây quay cảnh chơi cello và prompt "The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed." (Nghệ sĩ cello trong <Video 1> tiếp tục kéo một đường vĩ dài, máy quay cố định, âm nền ấm của căn phòng, tiếng đàn cello, không có nhạc nền.):

Tham chiếu thành video trên SD Video, 480p, 5 giây, một video tham chiếu.

Dùng nhiều video tham chiếu thì trông thế nào?

Một video tham chiếu và một prompt ngắn. Tham chiếu là một clip 6 giây quay những người trượt băng, và prompt là "The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music." (Những người trượt băng trong <Video 1> lướt qua một sân băng ngoài trời lúc chạng vạng, máy quay đứng yên, tiếng giày trượt cào trên mặt băng, tiếng trò chuyện từ xa, không có nhạc.):

Một video tham chiếu, 480p, 5 giây.

Cùng prompt và tham chiếu đó, đặt duration là 10:

Một video tham chiếu, 480p, 10 giây.

Hai video tham chiếu được gắn nhãn theo thứ tự gửi. Ở đây <Video 1> là những người trượt băng và <Video 2> là một clip nhảy dài 8,6 giây, với prompt "The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music." (Những người trượt băng trong <Video 1> xem vũ công trong <Video 2> biểu diễn trên băng lúc chạng vạng, máy quay cố định, tiếng giày trượt cào băng, không có nhạc.):

Hai video tham chiếu, 480p, 5 giây.

Ở đây <Video 1> là clip nghệ sĩ cello dài 3 giây và <Video 2> là clip nhảy, với prompt "The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed." (Nghệ sĩ cello trong <Video 1> chơi đàn trong khi vũ công trong <Video 2> chuyển động chậm bên cạnh cô ấy, máy quay cố định, tiếng đàn cello, tiếng bước chân, không có nhạc nền.):

Hai video tham chiếu, 480p, 5 giây.

Khi để aspect_ratio ở adaptive, clip sẽ lấy theo khung hình của video tham chiếu đầu tiên. Clip nhảy là video dọc, nên hai bản này ra dạng dọc 480 × 832. Cả hai dùng cùng prompt và cùng tham chiếu, không cố định seed, nên mỗi lần chạy tự chọn seed riêng và hai bản khác nhau. Prompt là "The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music." (Vũ công trong <Video 1> lặp lại cùng các động tác trong một phòng tập trống, máy quay cố định, tiếng bước chân trên sàn gỗ, không có nhạc.):

Cùng một yêu cầu chạy hai lần, 480p, 5 giây, dọc.

Định dạng có cấu trúc có tốt hơn prompt thường không?

Chúng tôi chạy cùng một cảnh tiệm bánh theo bốn cách trên SD Video, được xây dựng trên MiniMax H3: văn bản thành video, 480p, 5 giây, 16:9, seed 42. Mỗi prompt chỉ chạy một lần, vì vậy hãy xem đây là các quan sát đơn lẻ, không phải giá trị trung bình.

A. Prompt thường. Người thợ làm bánh đặt ổ bánh xuống và nói câu thoại vào máy quay trong một cú đẩy máy chậm.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.

B. Cấu trúc chính thức. Đây là prompt ở phần đầu tiên phía trên. Kết quả gần với A: cùng hành động, câu thoại được nói đúng, khung hình rộng hơn một chút.

C. Prompt thường có cắt cảnh theo mốc thời gian. Câu thoại kết thúc ở khoảng 2,5 giây và cảnh cắt sang cận cảnh ổ bánh trong khoảng từ 3 đến 3,5 giây.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.

D. Prompt A với tính năng viết lại bị tắt (prompt_enhancement: disabled). Máy quay đặt xa hơn và gần như không di chuyển, tiếng chuông cửa vang lên trước, và câu thoại bắt đầu ở khoảng 3,5 giây. Phần âm thanh nhỏ hơn nhiều: mức trung bình đo được thấp hơn ba clip còn lại khoảng 20 dB.

Điều này gợi ý:

PromptCâu thoại nói đúngĐiều gì thay đổi
A. ThườngCóMốc so sánh
B. Cấu trúc chính thứcCóRất gần với A
C. Thường, cắt ở 3 giâyCóCắt đúng chỗ yêu cầu
D. Thường, tắt viết lạiCóCảnh tĩnh rộng hơn, câu thoại muộn hơn, âm thanh nhỏ hơn nhiều

Khi dịch vụ viết lại prompt cho bạn, một prompt thường rõ ràng là đủ. Hãy tự viết theo cấu trúc khi bạn tắt tính năng viết lại, hoặc khi chạy trọng số mở mà không có H3-Context-IR, vì khi đó không có gì chuyển văn bản của bạn sang dạng mà mô hình mong đợi.

Mẹo viết prompt MiniMax H3 tốt hơn

  • Khớp dòng thời gian với độ dài clip; đừng mô tả 10 giây hành động cho một clip 5 giây.[3]
  • Dùng chi tiết hình ảnh và âm thanh cụ thể thay vì những từ như "cinematic" (điện ảnh) hay "beautiful" (đẹp).[3]
  • Mô tả âm thanh: âm nền căn phòng, tiếng động của hành động và chúng ở xa hay gần. Ghi no music nếu bạn không muốn có nhạc nền.[4]
  • Giữ lời thoại ngắn, mỗi vài giây một câu: đặt trong ngoặc kép ở prompt thông thường, trong thẻ <d> ở dạng có cấu trúc.
  • Cố định seed và chỉ thay đổi một thứ mỗi lần khi tinh chỉnh một cảnh quay.[4]
  • Khi dùng khung hình chính, hãy nói rõ khung hình đầu hoặc cuối nối với hành động thế nào.[3]

Trang SD Video có playground để thử prompt, và tài liệu API liệt kê mọi tham số, bao gồm prompt_enhancement.

Câu hỏi về cách viết prompt

Có nên viết prompt MiniMax H3 bằng tiếng Anh không?

Hướng dẫn chính thức viết các phần mô tả bằng tiếng Anh và giữ lời thoại, lời bài hát và chữ trên màn hình bằng ngôn ngữ gốc.[3] Lời thoại bằng ngôn ngữ khác được đặt trong thẻ <d> cùng thẻ ngôn ngữ của nó.

H3-Context-IR là gì?

Đó là bước tiền xử lý của MiniMax, đọc văn bản và tệp đa phương tiện bạn gửi rồi viết lại chúng thành dạng biểu diễn có cấu trúc mà H3 dùng để tạo video. Bước này không có trong bản phát hành mã nguồn mở; MiniMax cung cấp nó dưới dạng API và công bố hướng dẫn viết prompt để các nhà phát triển tự xây dựng.[1][5]

prompt_enhancement trên SD Video có tác dụng gì?

Tham số này điều khiển việc viết lại prompt trước khi tạo: turbo (mặc định), quality, hoặc disabled để gửi văn bản đúng như bạn viết. Việc viết lại không thay đổi các nhãn tham chiếu như <Picture 1>.[4]

Prompt MiniMax H3 nên dài bao nhiêu?

Đủ dài để bao quát toàn bộ dòng thời gian. Các ví dụ do chính MiniMax viết lại dài tới vài trăm từ cho một clip, và hướng dẫn của SD Video lưu ý rằng viết chi tiết không bị bất lợi gì.[1][4]

Tài liệu tham khảo

  1. MiniMax. Thẻ mô hình MiniMax-H3. Truy cập ngày 4 tháng 10 năm 2026 từ huggingface.co.
  2. MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Truy cập ngày 4 tháng 10 năm 2026 từ github.com.
  3. MiniMax. Skill H3 Prompt Writing. Truy cập ngày 4 tháng 10 năm 2026 từ github.com.
  4. SeedRouter. SD Video API reference. Truy cập ngày 4 tháng 10 năm 2026 từ seedrouter.ai.
  5. MiniMax. Create H3-Context-IR Task. Truy cập ngày 4 tháng 10 năm 2026 từ platform.minimax.io.

Hướng dẫn liên quan