Claude Opus 5.5 已在 SeedRouter 上线
SeedRouter Docs

MiniMax H3

用 MiniMax H3 生成 4–15 秒、768P 或 2K 的带声音视频:支持文生视频、首尾帧生视频和参考生视频,采用 MiniMax 官方请求格式,以任务形式交付。

View Markdown

MiniMax H3(Hailuo 03)是 MiniMax 的多模态视频模型。一次请求就能同时生成画面和声音:一段 4–15 秒、768P 或 2K 的视频,自带对白、环境声和音效。请求体采用 MiniMax 官方格式,模型 ID 为 minimax-h3。发送请求,保存返回的任务 ID,再从该任务读取生成完成的视频。首尾帧和参考素材以 URL 形式传入。

模型 ID

模型 ID输入分辨率时长
minimax-h3文本、首帧与尾帧、参考图片、视频和音频768P、2K4–15 秒

当前价格请查看模型页面。

快速示例

curl https://api.seedrouter.ai/v1/videos/generations \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax-h3",
    "content": [
      {"type": "text", "text": "A small sailboat glides across a calm turquoise bay at sunrise, seagulls in the distance, the sound of water and wind. No text, no logos."}
    ],
    "resolution": "768P",
    "duration": 5,
    "ratio": "16:9"
  }'

端点

POST https://api.seedrouter.ai/v1/videos/generations
请求头值
AuthorizationBearer YOUR_API_KEY
Content-Typeapplication/json

响应是一个任务({"id": "task_...", "status": "processing"}),而不是生成完成的视频。请轮询 GET /v1/tasks/{task_id} 获取结果。请把 API 密钥保存在服务端代码中。

参数

字段类型默认值说明
modelstring必填minimax-h3
contentarray必填提示词和所有素材,按下文所述的条目组织。必须恰好包含一个非空的 text 条目。
resolutionenum必填768P 或 2K。
durationinteger必填4 到 15 秒之间的任意整数。
ratioenum取决于输入adaptive、21:9、16:9、4:3、1:1、3:4、9:16。仅用文本时必填,且不接受 adaptive。
content_filterbooleantrueSeedRouter 的内容过滤,见下文。不会发送给模型。

请求结构是严格校验的:未知字段会被拒绝,而不是被忽略。不支持 callback_url;请改为轮询任务。extra 属于 MiniMax-H3-Max,本模型不接受该字段。

Content 条目

type条目role
text{"type": "text", "text": "..."},最多 7,000 个字符无
image_url{"type": "image_url", "image_url": {"url": "https://..."}, "role": "..."}first_frame、last_frame 或 reference_image
video_url{"type": "video_url", "video_url": {"url": "https://..."}, "role": "reference_video"}reference_video
audio_url{"type": "audio_url", "audio_url": {"url": "https://..."}, "role": "reference_audio"}reference_audio

只有一张图片且没有 role 时,它就是首帧。多于一张图片时,每张图片都需要 role。

模式

由 content 中的条目决定模式;没有单独的模式字段。

模式content 包含ratio
文生视频一个 text 条目必填,不能是 adaptive
图生视频text,加上一张 first_frame 和/或一张 last_frame 图片任何取值都按 adaptive 处理:画幅由图片决定
参考生视频text,加上最多 9 个 reference_image、3 个 reference_video 和 3 个 reference_audio 条目的任意组合可选,默认 adaptive

同一个请求中,首尾帧和参考素材不能同时使用。

{
  "model": "minimax-h3",
  "content": [
    {"type": "text", "text": "The person in the photo speaks to camera: Follow the wind. Voice follows the reference audio."},
    {"type": "image_url", "image_url": {"url": "https://example.com/person.jpg"}, "role": "reference_image"},
    {"type": "audio_url", "audio_url": {"url": "https://example.com/voice.mp3"}, "role": "reference_audio"}
  ],
  "resolution": "2K",
  "duration": 6
}

媒体输入

每个图片、视频和音频条目都是一个公开的 HTTP(S) URL。不接受 Base64 data URI 和 mm_file:// ID:请把文件上传到你自己的存储,再传入它的 URL。

输入格式限制
图片JPG、JPEG、PNG、WebP、HEIC、HEIF不超过 30 MB;每边 256–5760 px;宽 / 高 0.4–2.5
视频MP4、MOV(H.264 或 H.265)不超过 50 MB;每段 2–15 秒,总计 15 秒;每边 256–5760 px;宽 / 高 0.4–2.5;23.976–60 fps
音频WAV、MP3不超过 15 MB;每段 2–15 秒,总计 15 秒

参考视频在请求被受理时测量时长;无法读取时长的视频会被拒绝,且不扣费。其他限制在生成前检查,违反任意一项的请求会失败,且不扣费。

内容过滤

除非你自行设置,content_filter 默认为 true。开启过滤时,文本、每张图片以及每段参考视频的三帧(首帧、中间帧和末帧)会在模型运行前接受检查。被标记的请求会以错误码 60001 失败,且不扣费;无法完成检查的请求同样如此。参考音频不做检查。把 content_filter 设为 false 可跳过检查;网站上的 Playground 始终保持开启。

计费维度

当前费率请查看模型定价部分。MiniMax H3 按视频秒数计费,费率由输出分辨率决定,另外对前五张之后的输入图片计费:

billed seconds = duration + ceil(Σ each reference video's seconds)
extra images   = max(0, number of images − 5)
cost = billed seconds × rate per second + extra images × rate per image

首帧、尾帧和参考图片都计为图片。参考音频不计费。这两个数量在请求被受理时就已确定,因此预扣金额就是实际扣费金额。最终扣费请在账户的用量记录中查看。失败的任务不计费。

输出结构

提交后返回任务:

{"id": "task_...", "model": "minimax-h3", "status": "processing", "created_at": 1789689600}

查询任务

GET https://api.seedrouter.ai/v1/tasks/{task_id}

每 10–20 秒轮询一次,直到 status 变为 completed 或 failed。轮询过程中出现网络超时,并不意味着生成失败:请保留任务 ID 并继续查询。不要为了查看进度而再创建一个任务。

完成的任务

{
  "id": "task_...",
  "model": "minimax-h3",
  "status": "completed",
  "created_at": 1789689600,
  "finished_at": 1789689740,
  "output": {
    "video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
    "resolution": "768P",
    "ratio": "16:9",
    "duration": 5
  }
}

ratio 是视频实际采用的宽高比,包括为 adaptive 选定的那一个。在我们的测试中,一段 4 秒、16:9 的 768P 视频返回为 MP4(H.264),分辨率 1344 × 768,24 fps,附带 32 kHz 的立体声 AAC 音轨。

错误

在任务创建之前被拒绝的请求,会返回 HTTP 错误状态码和一个 error 对象,且不计费。受理之后才失败的任务,在查询时返回 HTTP 200,并带有 status: "failed" 和一个 error 对象。

错误码、HTTP 状态码和重试建议请参见公共错误目录。

{
  "id": "task_...",
  "model": "minimax-h3",
  "status": "failed",
  "error": {
    "code": 60001,
    "message": "the request was blocked by content moderation"
  }
}

如果提交本身超时,请先检查你的任务列表再重新提交:第一次请求有可能已经被受理。

实用建议

  • 把画面和声音一起描述:主体、地点、镜头、光线、对白和音效。
  • 把对白写进提示词;希望声音照着某个人来时,附上一段参考音频。
  • 先用 768P 出草稿,再用同一个请求以 2K 渲染最终镜头。
  • 用首帧和尾帧控制镜头从哪里开始、在哪里结束;用参考素材保留某个产品、某个人或某种动作。
  • 加上 no text, no logos,避免出现凭空编造的标记。

相关内容