Claude Opus 5.5 đã có trên SeedRouter
SeedRouter Docs

SD Video

Tạo clip 5–15 giây có lời thoại và âm thanh khớp hình bằng SD Video: văn bản thành video, ảnh thành video và tham chiếu thành video ở 480p hoặc 768p, giao kết quả qua tác vụ.

View Markdown

SD Video là mô hình tạo video của SeedRouter, được xây dựng trên MiniMax H3. Một yêu cầu tạo cả cảnh, hình ảnh và âm thanh cùng lúc: một clip 5–15 giây có sẵn lời thoại, âm thanh nền và hiệu ứng. Hãy gửi yêu cầu, giữ ID tác vụ được trả về, rồi đọc video hoàn chỉnh từ tác vụ. Khung hình đầu và tham chiếu được truyền vào dưới dạng URL.

ID mô hình

ID mô hìnhChế độĐộ phân giảiĐộ dài
sd-videotext_to_video, image_to_video, reference_to_video480p, 768p5–15 giây

Xem trang mô hình để biết giá hiện tại.

Ví dụ nhanh

curl https://api.seedrouter.ai/v1/videos/generations \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "sd-video",
    "mode": "text_to_video",
    "prompt": "A lighthouse keeper in a wool coat stands on a wet stone pier at dawn and says, \"The fog lifts at seven.\" Locked-off shot, waves slapping the stones, no music.",
    "duration": 5,
    "resolution": "768p",
    "aspect_ratio": "16:9"
  }'

Endpoint

POST https://api.seedrouter.ai/v1/videos/generations
HeaderGiá trị
AuthorizationBearer YOUR_API_KEY
Content-Typeapplication/json

Phản hồi là một tác vụ ({"id": "task_...", "status": "processing"}), không phải video hoàn chỉnh. Hãy truy vấn GET /v1/tasks/{task_id} để lấy kết quả. Hãy giữ khóa API trong code phía máy chủ.

Tham số

TrườngKiểuMặc địnhGhi chú
modelstringbắt buộcsd-video
modeenumreference_to_videotext_to_video, image_to_video, reference_to_video. Cũng chấp nhận dạng viết tắt t2v, i2v và ref2va.
promptstringbắt buộc1 đến 32.000 ký tự. Mô tả hình ảnh và âm thanh.
durationinteger5Số nguyên bất kỳ từ 5 đến 15 giây.
resolutionenum768p480p hoặc 768p.
aspect_ratioenumtheo chế độ21:9, 16:9, 4:3, 1:1, 3:4, 9:16, thêm adaptive trong reference_to_video. image_to_video theo khung hình đầu.
prompt_enhancementenumturboturbo, quality hoặc disabled.
seedintegerngẫu nhiênSố nguyên không dấu 32 bit. Đặt giá trị này để lặp lại một cảnh quay.
imagereferenceChỉ dùng với image_to_video, và bắt buộc ở chế độ đó. Là khung hình đầu.
reference_imagesarray[]Chỉ dùng với reference_to_video. Tối đa 9.
reference_videosarray[]Chỉ dùng với reference_to_video. Tối đa 3.
reference_audioarray[]Chỉ dùng với reference_to_video. Tối đa 3.

Lược đồ được kiểm tra chặt chẽ: trường không xác định sẽ bị từ chối chứ không bị bỏ qua. Không hỗ trợ callback_url và callback_id; hãy truy vấn tác vụ thay thế.

Các chế độ

mode chọn điều kiện mà mô hình dựa vào để tạo video. Mỗi chế độ có các trường riêng; trường của chế độ khác sẽ trả về 400 nếu có giá trị (danh sách rỗng hoặc null vẫn được chấp nhận).

Chế độBắt buộcNhận
text_to_videopromptcác trường dùng chung
image_to_videoprompt và imageimage làm khung hình đầu
reference_to_video (mặc định)prompt và ít nhất một ảnh hoặc video tham chiếureference_images, reference_videos, reference_audio

image_to_video coi ảnh là khung hình đầu theo đúng nghĩa đen, nên clip mở đầu giống hệt ảnh tĩnh đó. Để đặt một sản phẩm hoặc một người vào bối cảnh do bạn tự dựng, hãy dùng reference_to_video và mô tả bối cảnh xung quanh.

Tham chiếu và nhãn trong prompt

Trong reference_to_video, thứ tự trong danh sách trở thành nhãn bạn dùng trong prompt. Mục đầu tiên của reference_images là <Picture 1>, mục thứ hai là <Picture 2>; mục đầu tiên của reference_videos là <Video 1>, và cứ thế tiếp tục. Ảnh, video và âm thanh được đánh số độc lập. Tăng cường prompt có thể viết lại phần còn lại của prompt nhưng không thay đổi các nhãn này; hãy đặt prompt_enhancement thành disabled để giữ nguyên văn bản bạn viết.

{
  "model": "sd-video",
  "mode": "reference_to_video",
  "prompt": "A supervisor wearing the harness in <Picture 1> stands still and speaks to camera.",
  "reference_images": [{ "type": "url", "url": "https://example.com/harness.jpg" }],
  "duration": 10
}

Đầu vào media

Mỗi tham chiếu, và khung hình đầu của image_to_video, là một đối tượng có URL HTTP(S) công khai:

{ "type": "url", "url": "https://example.com/photo.jpg" }
Đầu vàoKích thước tối đa
Ảnh16 MB
Video hoặc âm thanh32 MB

Tối đa 9 ảnh, 3 video và 3 đoạn âm thanh, tổng cộng 12 tham chiếu. Không chấp nhận dữ liệu Base64 và ID tài nguyên: hãy tải tệp lên kho lưu trữ của riêng bạn rồi truyền URL của tệp. URL phải truy cập được mà không qua chuyển hướng.

Các yếu tố chi phí

Xem phần giá của mô hình để biết mức giá hiện tại. SD Video tính phí theo từng giây video, với mức giá do chế độ và độ phân giải đầu ra quyết định:

billed seconds = duration                                                   (text_to_video, image_to_video)
billed seconds = duration + ceil(Σ min(each reference video's seconds, 5))  (reference_to_video)
cost = billed seconds × rate per second

Mỗi video tham chiếu cộng thêm độ dài của nó, tối đa 5 giây; clip dài hơn vẫn chỉ cộng 5 giây. Ảnh tham chiếu và âm thanh tham chiếu không bị tính phí. Video tham chiếu được đo khi yêu cầu được tiếp nhận, nên số tiền tạm giữ chính là số tiền bị tính. Xem khoản phí cuối cùng trong lịch sử sử dụng của tài khoản. Tác vụ thất bại không bị tính phí.

Lược đồ đầu ra

Khi gửi, API trả về tác vụ:

{"id": "task_...", "model": "sd-video", "status": "processing", "created_at": 1789689600}

Lấy thông tin tác vụ

GET https://api.seedrouter.ai/v1/tasks/{task_id}

Hãy truy vấn 10–20 giây một lần cho đến khi status là completed hoặc failed. Hết thời gian mạng trong lúc truy vấn không có nghĩa là việc tạo video đã thất bại: hãy giữ ID tác vụ và tiếp tục kiểm tra. Đừng tạo tác vụ khác chỉ để xem tiến độ.

Tác vụ hoàn tất

{
  "id": "task_...",
  "model": "sd-video",
  "status": "completed",
  "created_at": 1789689600,
  "finished_at": 1789689720,
  "output": {
    "video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
    "duration": 5,
    "width": 1344,
    "height": 768,
    "aspect_ratio": "16:9",
    "seed": 42
  }
}

Video là MP4 (H.264) ở 24 fps với âm thanh AAC stereo 32 kHz. Khi chỉ định rõ aspect_ratio, kích thước là cố định:

aspect_ratio768p480p
21:91536 × 672960 × 416
16:91344 × 768832 × 480
4:31024 × 768640 × 480
1:1768 × 768480 × 480
3:4768 × 1024480 × 640
9:16768 × 1344480 × 832

text_to_video mặc định là 16:9. reference_to_video mặc định là adaptive: theo khuôn hình của ảnh tham chiếu đầu tiên, hoặc của video tham chiếu đầu tiên khi không có ảnh. image_to_video luôn theo khung hình đầu, kể cả hướng EXIF của ảnh; hãy cắt ảnh nếu muốn đổi khuôn hình. Clip adaptive giữ khuôn hình của nguồn, được co giãn theo cạnh ngắn của độ phân giải với mỗi cạnh làm tròn thành bội số của 32, và báo aspect_ratio dưới dạng tỷ lệ điểm ảnh đã rút gọn, ví dụ 23:15.

Tác vụ hoàn tất cho biết seed đã dùng. Cùng prompt và seed sẽ trả về cùng một clip; bỏ seed thì mỗi yêu cầu chọn một giá trị mới.

Lỗi

Những yêu cầu bị từ chối trước khi tác vụ được tạo sẽ trả về lỗi HTTP kèm đối tượng error và không bị tính phí. Tác vụ thất bại sau khi đã được tiếp nhận sẽ trả về HTTP 200 khi truy vấn, kèm status: "failed" và một đối tượng error.

Hãy xem danh mục lỗi dùng chung để biết mã lỗi, mã trạng thái HTTP và hướng dẫn thử lại.

{
  "id": "task_...",
  "model": "sd-video",
  "status": "failed",
  "error": {
    "code": 60001,
    "message": "The request was rejected by the content policy. Please revise the prompt or input images."
  }
}

Nếu chính lần gửi bị hết thời gian chờ, hãy kiểm tra các tác vụ của bạn trước khi gửi lại: yêu cầu đầu tiên có thể đã được tiếp nhận.

Mẹo

  • Hãy viết prompt dài. Vài trăm ký tự trở lên cho kết quả tốt hơn; viết chi tiết không có hại gì.
  • Hãy nêu máy quay, không phải không khí: thân máy, ống kính và khẩu độ thay đổi hình ảnh, còn "cinematic" gần như không có tác dụng.
  • Hãy mô tả âm thanh: âm nền của không gian, hiệu ứng và khoảng cách của chúng. Ghi no music nếu bạn không muốn nhạc nền. Lời thoại vừa khoảng 2,5 từ mỗi giây.
  • Thêm no logos, brand names, printed words or badges anywhere in frame để tránh các dấu hiệu tự bịa ra.
  • Giữ chữ trong khung hình ngắn, viết chính xác từng chữ, và nói rõ đó là chữ duy nhất trong khung hình.
  • Ưu tiên sự tĩnh: một chủ thể, một địa điểm, máy quay cố định. Thao tác tay cận cảnh và chuyển động mềm như tóc hay giấy là những điểm yếu nhất.
  • Cố định seed và chỉ đổi một vế câu mỗi lần để tinh chỉnh một cảnh quay.

Liên quan