Kling 3.0 提示词指南:运镜、多镜头场景、对白与角色一致性
Kling 3.0 提示词怎么写:好的视频提示词包含的五个部分、有效的运镜语言、多镜头场景、带声音的对白,以及如何让角色保持一致。
以 Markdown 阅读一条好的 Kling 3.0(可灵 3.0)提示词,会用平实的语言写清五件事:主体、它做出的可见动作、它在哪里、镜头怎样取景和运动,以及光线和氛围。 Kling 自己的提示词指南也是这么说的:好的提示词“从清晰的人类写作开始:主体、动作、场景、镜头语言、光线和氛围”。[2] 本文其余内容,包括多镜头场景、对白和角色一致性,都建立在这个结构之上。
Kling 3.0 提示词应该包含什么?
Kling 的提示词指南列出了一条清晰提示词的各个部分,以及每一部分的作用:[2]
| 部分 | 决定什么 | 示例 |
|---|---|---|
| 主体 | 主要角色、产品或地点 | 一位穿条纹衬衫的女人;天鹅绒展台上的一瓶香水 |
| 动作 | 可见的运动 | 朝镜头走来,在杯中晃动果汁 |
| 场景 | 地点和周围的细节 | 户外露台,马德里的一条老街 |
| 镜头 | 取景、角度和运动 | 特写,低角度,缓慢推近,跟拍镜头 |
| 光线与氛围 | 整体气氛 | 黄金时刻,冷蓝色的夜晚,柔和的薄雾 |
把主体写具体。这份指南建议把“魔法”这类模糊的词换成“旋转的蓝色能量粒子,散发着空灵的光芒”,让模型有东西可画。[2] 描写观众能看到的动作,例如烟雾向上飘散、跑步的人身体前倾,而不是写感受或意图。
我们自己测试用的一条提示词,五个部分都写在一句话里:
夜里下着小雨,一位街头小提琴手在石拱门下演奏,镜头从广场对面缓慢推近,温暖的灯光洒在湿漉漉的鹅卵石上,小提琴的旋律伴着细雨回响。无文字,无标志。
Kling 3.0,1080p,5 秒,带声音。
Kling 3.0 能听懂哪些运镜指令?
像导演那样描述镜头。Kling 的指南推荐使用平实的取景和运镜术语,并给出了这些用法:[2]
| 指令 | 写法 | 适合 |
|---|---|---|
| 特写 | 说话人面部特写 | 对白、情绪、产品细节 |
| 全景 | 全景镜头,展示露台和两个角色 | 环境和规模感 |
| 推镜 | 镜头缓慢推向主体 | 强调、紧张感、揭示 |
| 摇镜或俯仰 | 镜头横摇扫过房间,或向上仰拍到招牌 | 展示空间或高度 |
| 跟拍镜头 | 镜头在跑步者身旁跟随 | 动作和连贯性 |
需要时加上节奏:“缓慢”适合平静或悬疑,“平稳”适合让动作看得清楚,“快速”适合营造活力。[2] 大特写、中近景、全身和建立全景这类取景术语,告诉模型观众离主体有多远。[2]
多镜头场景怎么写?
Kling 3.0 可以把一段视频切成多个镜头。Kling 介绍了两种方式:让模型根据一条提示词自己规划剪辑,或者由你自己定义每个镜头及其时长;后者 Kling 称为自定义多镜头(Custom Multi-Shot),并表示模型会“严格遵循”。[1] Kling 自己的示例把每个镜头写成一行“取景 + 动作”:“镜头 1,低角度后方全景,跟拍在骑手身后……镜头 2,低角度侧面特写,摩托车车轮的细节镜头……”[1]
通过 API,自定义版本就是 multi_shots: true 加一个 multi_prompt 列表,每个镜头一个条目,各有自己的提示词和时长。我们的测试请求了两个 3 秒镜头:
{
"model": "kling-3-0",
"mode": "pro",
"sound": true,
"multi_shots": true,
"multi_prompt": [
{"prompt": "Wide shot of a small open kitchen, a chef tosses vegetables in a wok, flames rising, warm light. No text, no logos.", "duration": 3},
{"prompt": "Close-up of the wok, vegetables flipping through the flames, oil sizzling, steam drifting. No text, no logos.", "duration": 3}
]
}Kling 3.0,1080p,两个 3 秒镜头,带声音。
给每个镜头写上各自的取景,并在每个镜头里用同样的方式描述主体,这样看起来才是同一个人或同一件物品。各镜头时长相加必须在 3–15 秒之间。
对白和声音的提示词怎么写?
把台词写进提示词,并把它挂在说这句话的角色身上。Kling 的指南给出的格式是“角色(语气):台词”,例如“妈妈(轻声,带着惊讶的语气):哇,我完全没想到会是这样的剧情”,并表示即使画面中有三个或更多角色,Kling 3.0 也能把每句台词对应到正确的说话人。[1]
- 语言。 对白支持中文、英语、日语、韩语和西班牙语,角色还能在同一段视频里切换语言。Kling 表示,其他任何语言的台词都会被翻译成英语。[1]
- 口音和方言。 在台词旁边标注,例如“用带印度口音的英语说”;Kling 列出了美式、英式和印度式英语口音,以及包括粤语和四川话在内的几种中文方言。[1]
- 环境声。 背景声音也要写出来:Kling 的示例开头就是“背景里客厅空调发出微弱的嗡嗡声”。[1]
只有在你要求时才会生成声音:在请求中把 sound 设为 true。
怎么让角色或产品保持一致?
使用主体。在 Kling 3.0 中,主体是由 2–4 张参考图片构建的对象;绑定之后,Kling 表示在推拉、横摇和俯仰中,这个主体都能保持“清晰稳定,不会偏移或消失”。[1] 在 API 中,它放在 kling_elements 里,带一个 name、一句简短的 description 和图片 URL,提示词按名字提到它:
{
"prompt": "@hero walks out of the elevator, takes off her sunglasses and nods to a colleague, steady tracking shot",
"kling_elements": [
{
"name": "hero",
"description": "a professional woman in a camel coat with a black commuter bag",
"element_input_urls": ["https://example.com/hero-front.png", "https://example.com/hero-side.png"]
}
]
}第一张图片用正面视角,再补充侧面或四分之三侧面视角;描述里要写明哪些地方不能变,例如服装,或产品上的标志。
15 秒视频里的节奏怎么控制?
用时间标出每个节拍。Kling 自己的 15 秒示例按时间推进动作:“第 4 秒,镜头随她加速向前……第 8 秒,镜头逐渐推近成中景……第 12 秒,音乐和动作达到高潮……最后 3 秒……”[1] 如果要一个连续不断的长镜头,就明确写出来,就像 Kling 的另一个示例那样:“一个没有任何剪辑转场的连续长镜头”。[1] 视频时长可以是 3 到 15 之间的任意整数秒,所以要让时长和你写的节拍数相匹配。
哪些内容不要写?
- 单独使用的空泛质量词。 只写“电影感”或“杰作”,却没有运镜或光线,模型几乎没有可执行的内容。[2]
- 不想要的文字和标记。 Kling 3.0 渲染文字的能力很强,包括你要求的招牌和标志。[1] 如果你一个都不想要,就在提示词末尾加上“no text, no logos”,我们所有的测试提示词都是这样写的。
- 一句话里塞好几次剪辑。 如果一个场景需要特定的剪辑,就用多镜头,每个镜头一个条目,而不是在一条提示词里串起“然后镜头切到……”。
Kling 3.0 提示词常见问题
Kling 3.0 提示词最长能写多少?
在 SeedRouter 上最多 2,500 个字符,多镜头请求中每个镜头最多 500 个字符。大多数好的提示词只有一到四句话。
Kling 3.0 支持反向提示词吗?
SeedRouter 的 Kling 3.0 请求没有单独的反向提示词字段。把要避免的内容直接写进提示词,例如“no text, no logos”。Kling 当前的 API 也把这一点并入了提示词:它的文档写道“提示词可以包含正向和反向描述”。[3]
Kling 3.0 有哪些好用的运镜提示词?
缓慢推近、跟拍镜头、横摇、俯仰和低角度揭示,是 Kling 自己的指南里用到的运镜,用平实的句子写出来,例如“镜头缓慢推向主体”。[2]
在哪里可以测试提示词?
Kling 3.0 Playground 运行的请求和 API 接收的完全一样,Kling 3.0 API 指南 介绍了怎样从代码里发送它。



