MiniMax H3 프롬프트 가이드: 공식 구조를 실제 클립으로 테스트
MiniMax H3 프롬프트 작성법: 공식 3단 구조, 대사 태그, 샷 타이밍, 참조 라벨을 정리하고 클립 4개로 직접 테스트했습니다.
Markdown으로 읽기MiniMax H3는 세 부분으로 된 구조화된 형식의 프롬프트를 읽도록 만들어졌습니다. 타임라인을 따라 전개되는 화면과 대사, 전체 사운드스케이프, 그리고 배경 음악(있는 경우)입니다. MiniMax는 일반 요청을 이 형식으로 바꾸는 단계를 H3-Context-IR이라고 부르며, 이 단계가 "critical to the quality of the final output"(최종 결과물의 품질에 결정적)이라고 말합니다.[1] MiniMax H3를 기반으로 만든 SD Video는 기본적으로 생성 전에 프롬프트를 다시 씁니다. 테스트 클립 4개에서 일반 프롬프트와 공식 구조로 쓴 프롬프트는 똑같이 쓸 만한 결과를 냈고, 재작성을 끄자 샷과 사운드 믹스가 달라졌습니다.
이 가이드에서는 공식 구조, 대사·컷·참조를 쓰는 방법, 그리고 테스트 결과를 다룹니다.
MiniMax H3 프롬프트는 어떤 모습인가요?
텍스트, 이미지, 키프레임 모드에서 공식 가이드는 세 개의 필드를 정해진 순서로 사용합니다.[2]
- integrated_multimodal_description: 본문입니다. 시각적 스타일, 구도, 주체, 동작, 카메라, 샷 전환, 누가 말하고 무엇을 말하는지, 화면 속 동작에 연결된 소리를 시간 순서대로 씁니다.
- overall_soundscape: 클립 전체에 걸친 앰비언스, 동작 소리, 말이 아닌 사람 소리.
- non_diegetic_music: 관객에게만 들리는 배경 음악. 없으면
N/A.
이 구조로 쓴 짧은 예시입니다(테스트에서 사용).
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/A공식 가이드는 이 섹션들을 영어로 쓰도록 하고, 대사, 가사, 화면에 보이는 텍스트는 원래 언어로 둡니다.[3]
MiniMax H3 프롬프트에서 대사는 어떻게 쓰나요?
화자마다 (S1), (S2) 같은 고정 ID를 주고, 목소리 묘사는 태그 밖에 쓰고, <d>…</d> 안에는 언어 태그와 말할 내용만 넣습니다.[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>태그 안의 말은 그대로 유지되므로, 실제로 말해야 하는 그대로 정확히 쓰세요. 같은 화자는 여러 샷에 걸쳐 같은 ID를 쓰고, 한 번도 말하지 않는 인물에게는 ID를 주지 않습니다. 내레이터의 경우 가이드는 "says in an off-screen voiceover"(화면 밖 보이스오버로 말한다)라는 표현을 쓰고, 화면 속 인물의 입술은 닫혀 있다고 명시합니다.[2]
샷과 컷의 타이밍은 어떻게 지정하나요?
각 샷을 [Shot 1], [Shot 2]로 표시하고 컷 시점을 적습니다. "[Shot 2] At 00:05.000, the camera cuts to a close-up of…"([Shot 2] 00:05.000에 카메라가 …의 클로즈업으로 컷)처럼 씁니다. 타임라인의 합은 클립 길이, 즉 4~15초와 맞아야 합니다.[2][3] 테스트에서는 일반 문장도 통했습니다. "At 3 seconds, cut to a close-up of steam rising from the bread"(3초에 빵에서 피어오르는 김의 클로즈업으로 컷)라고 쓰자 약 3초에 컷이 들어갔습니다(아래 클립 C).
대사는 해당 샷 안에서 여유가 필요합니다. SD Video 자체 가이드는 초당 약 2.5단어의 대사를 기준으로 하므로, 5초 클립에는 짧은 문장 하나가 들어갑니다.[4]
프롬프트에서 이미지, 동영상, 오디오를 참조하려면?
참조는 라벨로 지정하며, 유형별로 보낸 순서대로 번호를 매깁니다: <Picture 1>, <Video 1>, <Audio 1>. 공식 가이드는 각 라벨을 프롬프트의 모든 섹션에서 똑같이 유지하라고 합니다.[3] 전체 참조 모드에서 공식 재작성은 세 개가 아니라 여섯 개의 섹션을 씁니다. 주체 정의, 요약, 유지 분석(각 참조에서 무엇을 유지할지), 상세 묘사, 사운드스케이프, 음악입니다.[3]
라벨 하나가 들어간 일반 프롬프트로 충분한 경우가 많습니다. 이 클립은 첼로 연주 장면이 담긴 3초 참조 동영상과 "The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed."(<Video 1>의 첼리스트가 긴 활 긋기 한 번을 계속 이어 간다. 고정 카메라, 따뜻한 룸톤, 첼로 소리, 배경 음악 없음.)라는 프롬프트를 사용했습니다.
SD Video 참조로 동영상 생성, 480p, 5초, 참조 동영상 1개.
참조 동영상을 여러 개 쓰면 어떻게 나오나요?
참조 동영상 하나와 짧은 프롬프트입니다. 참조는 스케이터들이 나오는 6초 클립이고, 프롬프트는 "The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music."(<Video 1>의 스케이터들이 해 질 녘 야외 링크를 미끄러지듯 달린다. 카메라는 고정, 얼음을 긁는 스케이트 소리, 멀리서 들리는 대화 소리, 음악 없음.)입니다.
참조 동영상 1개, 480p, 5초.
같은 프롬프트와 참조에 duration을 10으로 설정한 결과입니다.
참조 동영상 1개, 480p, 10초.
참조 동영상이 두 개면 보낸 순서대로 라벨이 붙습니다. 여기서 <Video 1>은 스케이터들, <Video 2>는 8.6초짜리 댄스 클립이고, 프롬프트는 "The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music."(<Video 1>의 스케이터들이 해 질 녘 얼음 위에서 공연하는 <Video 2>의 댄서를 바라본다. 고정 카메라, 스케이트가 얼음을 긁는 소리, 음악 없음.)입니다.
참조 동영상 2개, 480p, 5초.
여기서는 <Video 1>이 3초짜리 첼리스트 클립, <Video 2>가 댄스 클립이고, 프롬프트는 "The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed."(<Video 1>의 첼리스트가 연주하는 동안 <Video 2>의 댄서가 그 옆에서 천천히 움직인다. 고정 카메라, 첼로 소리, 발소리, 배경 음악 없음.)입니다.
참조 동영상 2개, 480p, 5초.
aspect_ratio를 adaptive로 두면 클립은 첫 번째 참조 동영상의 형태를 따릅니다. 댄스 클립이 세로형이라 이 두 결과물은 480 × 832 세로형으로 나왔습니다. 두 번 모두 같은 프롬프트와 같은 참조를 썼고 seed를 고정하지 않았기 때문에, 실행할 때마다 각자 seed가 정해져 결과가 다릅니다. 프롬프트는 "The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music."(<Video 1>의 댄서가 텅 빈 스튜디오에서 같은 동작을 반복한다. 고정 카메라, 나무 바닥 위 발소리, 음악 없음.)입니다.
같은 요청을 두 번 실행, 480p, 5초, 세로형.
구조화된 형식이 일반 프롬프트보다 나은가요?
MiniMax H3를 기반으로 만든 SD Video에서 같은 빵집 장면을 네 가지 방식으로 생성했습니다. 텍스트로 동영상 생성, 480p, 5초, 16:9, seed 42입니다. 프롬프트마다 한 번씩만 실행했으므로 평균이 아니라 단일 관찰로 읽어 주세요.
A. 일반 프롬프트. 제빵사가 빵을 내려놓고, 느린 푸시인 속에서 카메라를 보며 대사를 말합니다.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. 공식 구조. 위 첫 번째 섹션에서 보여 준 프롬프트입니다. 결과는 A와 비슷합니다. 같은 동작, 정확하게 말한 대사, 약간 더 넓은 화면입니다.
C. 시간 지정 컷이 들어간 일반 프롬프트. 대사는 약 2.5초에 끝나고, 3초에서 3.5초 사이에 빵 클로즈업으로 컷됩니다.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. 재작성을 끈 프롬프트 A (prompt_enhancement: disabled). 카메라가 더 뒤에 있고 거의 움직이지 않으며, 초인종이 먼저 울리고, 대사는 약 3.5초에 시작됩니다. 사운드트랙은 훨씬 조용합니다. 평균 레벨이 나머지 세 클립보다 약 20 dB 낮게 측정됐습니다.
여기서 알 수 있는 것:
| 프롬프트 | 대사 정확도 | 달라진 점 |
|---|---|---|
| A. 일반 | 예 | 기준 |
| B. 공식 구조 | 예 | A와 매우 비슷함 |
| C. 일반, 3초 컷 | 예 | 요청한 위치에 컷 |
| D. 일반, 재작성 끔 | 예 | 더 넓은 고정 샷, 대사가 늦음, 오디오가 훨씬 조용함 |
서비스가 프롬프트를 재작성해 준다면 명확한 일반 프롬프트로 충분합니다. 재작성을 끄거나 H3-Context-IR 없이 오픈 웨이트를 실행할 때는 구조를 직접 쓰세요. 그때는 텍스트를 모델이 기대하는 형식으로 바꿔 주는 것이 아무것도 없기 때문입니다.
MiniMax H3 프롬프트를 더 잘 쓰는 팁
- 타임라인을 클립 길이에 맞추세요. 5초 클립에 10초 분량의 동작을 묘사하지 마세요.[3]
- "cinematic"(영화 같은)이나 "beautiful"(아름다운) 같은 단어 대신 구체적인 시각·오디오 디테일을 쓰세요.[3]
- 소리를 묘사하세요: 룸톤, 동작 소리, 그리고 그 소리가 얼마나 멀리 있는지. 배경 음악을 원하지 않으면
no music이라고 쓰세요.[4] - 대사는 짧게, 몇 초에 한 문장씩. 일반 프롬프트에서는 따옴표 안에, 구조화 형식에서는
<d>태그 안에 넣으세요. - 샷을 다듬을 때는 seed를 고정하고 한 번에 하나만 바꾸세요.[4]
- 키프레임을 쓸 때는 첫 프레임이나 마지막 프레임이 동작과 어떻게 이어지는지 적으세요.[3]
SD Video 페이지에는 프롬프트를 시험해 볼 수 있는 Playground가 있고, API 레퍼런스에는 prompt_enhancement를 포함한 모든 파라미터가 나와 있습니다.
프롬프트 관련 질문
MiniMax H3 프롬프트는 영어로 써야 하나요?
공식 가이드는 묘사 섹션을 영어로 쓰고, 대사, 가사, 화면 속 텍스트는 원래 언어로 둡니다.[3] 다른 언어의 대사는 언어 태그와 함께 <d> 태그 안에 넣습니다.
H3-Context-IR이란 무엇인가요?
보낸 텍스트와 미디어를 읽고, H3가 생성에 사용하는 구조화된 표현으로 다시 쓰는 MiniMax의 전처리 단계입니다. 오픈소스 릴리스에는 포함되어 있지 않습니다. MiniMax는 이를 API로 제공하고, 개발자가 직접 만들 수 있도록 프롬프트 가이드를 공개합니다.[1][5]
SD Video의 prompt_enhancement는 무엇을 하나요?
생성 전 프롬프트 재작성을 제어합니다. turbo(기본값), quality, 또는 쓴 그대로 보내는 disabled입니다. 재작성은 <Picture 1> 같은 참조 라벨을 바꾸지 않습니다.[4]
MiniMax H3 프롬프트는 얼마나 길게 써야 하나요?
타임라인 전체를 다룰 수 있을 만큼입니다. MiniMax가 직접 재작성한 예시는 클립 하나에 수백 단어에 이르며, SD Video 가이드도 디테일을 많이 써서 불리할 것은 없다고 설명합니다.[1][4]
참고 자료
- MiniMax. MiniMax-H3 모델 카드. 2026년 10월 4일 huggingface.co에서 가져옴.
- MiniMax. h3-prompt-writing: base mode reference(references/base-en.txt). 2026년 10월 4일 github.com에서 가져옴.
- MiniMax. H3 Prompt Writing 스킬. 2026년 10월 4일 github.com에서 가져옴.
- SeedRouter. SD Video API reference. 2026년 10월 4일 seedrouter.ai에서 가져옴.
- MiniMax. Create H3-Context-IR Task. 2026년 10월 4일 platform.minimax.io에서 가져옴.



