Seedance 2.5 提示词指南:结构、运镜、时间轴、音频与参考素材
如何写 Seedance 2.5 提示词:核心公式、运镜术语、时间戳、对白与音效语法、参考素材、视频编辑,以及 Seedance 2.0 的不同之处。
以 Markdown 阅读一个好的 Seedance 2.5 提示词,要按顺序说清楚:谁在做什么、在哪里、镜头怎么拍、我们听到什么。也就是先写主体和动作,再写场景、视觉风格、运镜和音频。较长的片段可以拆成"0-3s"这样的时间段或编号镜头,每个参考文件都按编号点名("Image 1"、"Video 1"),时长、宽高比和分辨率作为请求参数设置,而不是写在文本里。下面的规则来自 ByteDance 针对 Seedance 2.5 和 2.0 的官方提示词指南,核查于 2026年9月29日。所有示例提示词都是为本文编写的。
Seedance 2.5 提示词怎么写?
从 ByteDance 的核心公式出发:"主体 + 动作或事件 + 场景与环境(可选)+ 视觉风格(可选)+ 运镜/切镜(可选)+ 音频(可选)"。只有第一部分是必需的。指南把主体和动作称为"视频的基础",其余不需要的部分可以省略。
实际写起来,就是四个短句:
<Subject> performs <main action or event> in <scene and environment>.
The visuals feature <visual style>.
Use <shot size, camera angle, camera movement, or cuts>.
Audio includes <dialogue, ambience, sound effects, or music>.填好后的版本:
A street baker pulls a tray of round loaves from a brick oven at night and sets it on a flour-dusted counter.
Warm orange light from the oven, visible steam, shallow depth of field, realistic film look.
Start with a close-up of the oven door opening, then pull back slowly to a medium shot of the counter.
Audio: crackling wood, the scrape of the metal tray, quiet street noise outside.有三个习惯很关键:
- 描述你想要的,而不是你不想要的。 官方指南要求"尽可能使用正向描述",并指出字幕和音频是支持否定指令的地方(见下文)。
- 参数不要写进提示词。 片段时长、宽高比、分辨率以及是否生成声音都是请求字段(
duration、ratio、resolution、generate_audio);指南说参数"不需要写进提示词"。 - 最后写必须保持不变的内容,例如机位角度、场景和氛围,让它们在整段片段中保持一致。
如何控制运镜和镜头?
直接写运镜术语。ByteDance 列出了景别(大远景、远景、中景、中近景、特写)、运镜方式(推、拉、摇、移、跟、环绕、上摇、手持晃动)和机位角度(低角度、俯拍、第一人称),以及一镜到底/长镜头、希区柯克变焦(dolly zoom)、FPV、子弹时间和变速等具名技法。
对于更冷门的术语,在术语后面加一句通俗解释。指南自己的例子是:"焦点转移:焦点平滑转移,原本清晰的前景树木变得模糊,而背景中的人物逐渐变得清晰。"
对于切镜或转场,同时给出时间点和方式,例如"在第 5 秒,快速向左甩镜进入下一个场景。"Seedance 2.0 指南还有一条在 2.5 上依然有用的规则:每个镜头只用一种运镜,因为要求"同时推、拉、摇、移"会让画面变得不稳定。
多机位场景就是几个编号镜头,每个镜头有自己的构图:
Shot 1: Wide shot, locked-off camera, eye level. Two chess players sit across a table in an empty library.
Shot 2: Over-the-shoulder shot from behind the older player. The younger player moves a knight and looks up.
Shot 3: Close-up of the older player's hand hovering over the board, then tapping the table once.
Quiet room tone, the soft click of chess pieces, no music.Seedance 支持时间戳吗?
Seedance 2.5 支持,精确到整秒。Seedance 2.0 不支持。ByteDance 的对比说得很直接:"Seedance 2.0 不响应时间戳,只响应镜头编号,而 Seedance 2.5 支持整数秒时间戳。"
在 2.5 上有三种写法可用:
- 时间段: "0-3s … 3-7s … 7-15s",段与段之间不留空隙。
- 时间点: "在第 2 秒,一阵风掀起了桌布。"
- 相对时间: "她在门边等待。3 秒后,走廊里的灯熄灭了。"
内容量要和你给的时间匹配。如果某个时间段里发生的事太少,模型会自行发挥;如果太多,指南警告结果"可能出现过多切镜或遗漏部分情节"。不要用时间戳表现快速重复的动作,比如一秒摇头三次。
对于最长可达 Seedance 2.5 上限 30 秒的片段,把它写成几个阶段,每个阶段都有明确的结束状态:
A lighthouse keeper's evening routine, realistic, cool blue dusk turning to night, no music.
0-6s: Wide shot of a lighthouse on a rocky coast at dusk. The keeper climbs the outside stairs with a lantern.
6-14s: Inside the lamp room, medium shot. He wipes the large lens with a cloth, then checks a brass gauge.
14-22s: Close-up of his hand turning a wheel. The main lamp starts to rotate and throws a beam across the room.
22-30s: Aerial shot pulling back from the tower. The beam sweeps over dark water. Waves and wind only.对白、音效和字幕怎么写?
Seedance 2.5 默认随视频一起生成音频(generate_audio 为 true)。所有内容都可以用普通句子描述,但当你需要区分不同类型的声音时,官方指南定义了几种括号:
| 内容 | 语法 | 示例 |
|---|---|---|
| 音乐 | ( ) | (soft piano plays in the background) |
| 音效 | < > | <a bell rings in the distance> |
| 对白 | { } | {Welcome back.} |
| 字幕 | 【 】 | 【Chapter One】 |
如果对白要用特定语言或口音,在台词前先写明。指南的公式是 Dialogue Language + Regional Variety or Accent + Delivery Style + Speaker + {Dialogue},例如:Dialogue language: American English. The girl says in natural, conversational American English: {I thought you weren't coming.} ByteDance 表示 Seedance 2.5 原生支持 10 多种语言的语音生成;指南没有列出具体语言,所以请自己测试你要用的语言。不要在同一句台词里混用多种语言,2.0 指南对此有警告,专有名词除外。
多个角色说话时,每句台词按"角色台词(情绪):内容"的形式只写一次演绎方式。指南发现,在台词后面重复词语,或给单个词语附加单独的语气和动作说明,是导致模型添加字幕的原因之一。
否定指令在这里有效:"No subtitles"(无字幕)、"No BGM; only ambient and action sounds"(无背景音乐;只保留环境音和动作音)或"No audio"(无音频)。字幕仍可能漏出来,按 ByteDance 的说法比 2.0 少见;而带字幕的参考视频可能会覆盖"no subtitles"。如果要让角色使用某个现成的声音或歌曲,把它作为参考音频附上并绑定到该角色,就像指南的例子:"图片 1 描绘的是主角 John,使用音频 1 的音色。"
如何在提示词中引用图片、视频和音频?
按附加顺序给每个文件编号,并在文本中绑定。ByteDance 的示例是这样写的:"图片 1-2 是角色 1,对应音频 1;图片 3-4 是角色 2,对应音频 2。"不要依赖写在图片里的名字;指南说,给一张图片标上"John",然后写"John is at school","很容易导致角色混淆或重复"。
说明每个文件的用途,以及要忽略什么:
Image 1 defines the courier's face, hairstyle and yellow raincoat. Do not use the image background.
Image 2 defines the narrow alley, wet cobblestones and neon reflections. Do not use any people in it.
Video 1 defines the running pace and the handheld follow camera only.
The courier from Image 1 runs through the alley from Image 2 at night, jumps a puddle, and stops at a green door.如果参考视频已经展示了确切的动作,就写"follow the actions and camera movement in Video 1"(参照视频 1 的动作和运镜),而不是逐步重新描述;重复描述可能与视频冲突。当几张图片从不同角度展示同一个物体时,要说明这一点("All four images show the same desk lamp; only one lamp appears",即四张图片都是同一盏台灯,画面中只出现一盏),否则模型可能把它们当成不同的物体。
用多少:Seedance 2.5 最多接受 30 张图片、10 段视频和 10 段音频(视频和音频各自总时长最多 30 秒)。ByteDance 建议主体图片覆盖 1-8 个主体,视频或音频参考覆盖 1-5 个主体、每段 5-10 秒;更多也可以,但稳定性会下降。Seedance 2.0 最多接受 9 张图片、3 段视频和 3 段音频,其指南建议总共用 4-5 个文件。每种参考类型的请求结构见如何添加图片、视频和音频。包含真人面部的参考图和参考视频会被拒绝;这篇文章解释了这个报错以及官方允许的做法。
视频编辑和延长的提示词怎么写?
在 SeedRouter 上,编辑和延长是 Seedance 2.5 的功能:发送一段参考视频,并把 omni_reference_task_type 设为 edit 或 extend。这时提示词要做好两件事。
编辑时,指明范围,并描述从 A 到 B 的变化。 加入 add、remove、replace 或 change to 这类触发词,局部编辑时使用时间段。指南的例子:"把视频 1 中第 4-6 秒男子的动作从喝咖啡改为拖地,其余内容保持不变。"替换物体也是同样的写法:
Edit Video 1: replace the paper coffee cup on the desk with the green ceramic mug from Image 1. Keep the person, the camera and the audio unchanged.延长时,说明方向,并从边界帧开始写。 使用"extend forward"(向前延长)、"extend backward"(向后延长)或"continue"(继续),然后描述接下来发生什么:
Continue Video 1: the cyclist reaches the top of the hill, stops, and takes off her helmet. The camera stays on the same side angle. Wind and distant birds.编辑或延长会保留源视频的宽高比,所以让 ratio 保持为 adaptive;编辑还会保留源视频的时长,所以 duration 必须为 -1。ByteDance 建议输入和输出都使用 MOV(output_format: "mov"),以获得最好的色彩和音频连续性。如果"参考素材 + 编辑"的组合请求结果不稳定,指南给出的解决办法是拆成一个参考任务,再接一个编辑任务。确切的请求体见如何用 Seedance 2.5 编辑或延长片段。
分镜图和关键帧怎么用?
它们的作用不同。多格分镜图(一张图里有多个画面)是宽松的情节参考:模型"不会严格对齐"它。关键帧(按顺序附加的独立图片)则会被紧密遵循。
- 分镜图: 使用不带文字的简单线稿或火柴人,不超过 15 格。先对应好分镜图,写一句话的故事概要,再逐个描述镜头,补充画面没有表现的内容(动作、运镜、风格)。
- 关键帧: 把每一帧作为单独的参考图附上,提示词开头写"Use Images 1 to 6 in order as keyframes."(按顺序把图片 1 到 6 用作关键帧。)
- 首尾帧: 把图片的 role 设为
first_frame和last_frame。这会把输出锁定为第一张图的宽高比,所以要用两张宽高比相同的图片。设为reference_image并写"Image 1 is the first frame"不会锁定宽高比,但输出可能与图片不完全一致。
Seedance 2.0 的提示词有什么不同?
结构相同(主体、动作、场景、运镜、风格、音频),但 2.0 指南要求几点 2.5 已经不再需要的写法:
- 用镜头,而不是秒数。 把片段组织成"Shot 1 / Shot 2 / Shot 3",让模型自己控制节奏;2.0 指南称精确计时"不稳定"。
- 柔和、连贯的动作。 它偏好"缓慢、柔和、连贯的细微动作",而不是冲刺、大幅跳跃和剧烈翻滚,并要求你描述一个动作如何过渡到下一个。
- 用动作表现情绪。 不写"very sad"(非常难过),而写"lowers her head, shoulders trembling slightly, eyes reddening"(低下头,肩膀微微颤抖,眼眶泛红)。
- 每个角色一张面部特写和一张全身图,而不是多角度设定图,2.0 可能会把后者理解成多个人。Seedance 2.5 接受多视角图片。
- 每次都用同样的方式指代同一个主体,例如"the woman in the red coat@Image 1"(穿红外套的女人@Image 1),或者先定义一个名字再反复使用。
Seedance 2.0 的片段时长为 4-15 秒(默认 5 秒),它有 Fast 和 Mini 版本,接受相同的请求,但只支持 480p 或 720p。Seedance 2.5 与 2.0 对比指南和 Seedance 2.0、Fast 与 Mini 对比指南介绍了该选哪个模型。ByteDance 还提醒,两个版本"审美风格偏好差异显著",所以同一个提示词不会得到相同的画面风格。
Seedance 为什么不按我的提示词生成?
大多数失败都可以追溯到官方 FAQ 中列出的几个原因:
- 时间太短、内容太多。 把事件分散开,或加长
duration。 - 前后矛盾。 对同一个角色有两种不同的描述,或者运镜与动作相冲突。
- 角色在参考素材之间被调换。 按角色首次出场的顺序附加参考文件,并相应地重新编号提示词。
- 眼睛发光。 "fanatical"(狂热)或"extremely shocked"(极度震惊)这类强烈的词可能让瞳孔发光。改用更平和的措辞,并加上"normal human eyes; no glowing eyes"(正常人类眼睛;眼睛不发光)。
- 画面文字拼写错误。 把单词逐个字母拼出来,或者把确切的文字作为参考图提供。
- 一个请求做的事太多。 把参考和编辑拆成不同的任务。
- 人脸被拦截。 参考素材中的真人面部会被拒绝;见 Seedance 真人报错。
先用 480p 和较短的 duration 打草稿,再以更高分辨率渲染你要保留的版本。失败的任务不收费;成片的费用见 Seedance API 价格。
常见问题
Seedance 提示词需要用 JSON 写吗?
不要求任何格式。ByteDance 的指南说提示词"可以完全用自然语言书写",它的所有模板都是普通句子,可选地加上"Shot 1"或"0-3s"这样的标签。结构有帮助,JSON 语法则没有必要。
Seedance 2.5 怎么生成打斗场景?
整体概括地描述打斗,只为一两个关键动作留出细节;指南推荐"双方展开近身搏斗"这样的写法,而不是逐拳列出。把节拍放在时间轴上,每个镜头只用一种运镜,并用 < > 音效描述声音。
Seedance 2.5 视频最长多少秒?
每个请求最长 30 秒,用 duration 设置(4-30,或 -1 由模型决定)。Seedance 2.0 最长 15 秒。
有官方的 Seedance 提示词优化工具吗?
有。ByteDance 发布了一个 Seedance 2.5 提示词 skill,sd25-pe,编程助手可以用它在你发送之前改写提示词。安装命令见官方指南。
可以用自己的照片作为参考图吗?
不可以。Seedance 会拒绝包含真人面部的参考图和参考视频。Seedance 真人报错指南介绍了 ByteDance 允许的替代做法。
试试你的提示词
把提示词粘贴到 Seedance 2.5 playground 或 Seedance 2.0 playground,或者参照 Seedance 2.5 API 文档从代码发送。一次充值、无需订阅,额度永不过期,失败的任务不收费。



