Kling 3.0 提示詞指南:運鏡、多鏡頭場景、對白與角色一致性
Kling 3.0 提示詞怎麼寫:好的影片提示詞包含的五個部分、有效的運鏡語言、多鏡頭場景、含聲音的對白,以及如何讓角色保持一致。
以 Markdown 閱讀一條好的 Kling 3.0(可靈 3.0)提示詞,會用平實的語言寫清楚五件事:主體、它做出的可見動作、它在哪裡、鏡頭怎樣取景和移動,以及光線和氛圍。 Kling 自己的提示詞指南也是這麼說的:好的提示詞「從清楚的人類寫作開始:主體、動作、場景、鏡頭語言、光線和氛圍」。[2] 本文其餘內容,包括多鏡頭場景、對白和角色一致性,都建立在這個結構之上。
Kling 3.0 提示詞應該包含什麼?
Kling 的提示詞指南列出了一條清楚的提示詞包含哪些部分,以及每個部分的作用:[2]
| 部分 | 決定什麼 | 範例 |
|---|---|---|
| 主體 | 主要角色、產品或地點 | 一位穿條紋襯衫的女人;天鵝絨展示台上的一瓶香水 |
| 動作 | 可見的移動 | 朝鏡頭走來,在杯中晃動果汁 |
| 場景 | 地點和周圍的細節 | 戶外露台,馬德里的一條老街 |
| 鏡頭 | 取景、角度和移動 | 特寫,低角度,緩慢推近,跟拍鏡頭 |
| 光線與氛圍 | 整體氣氛 | 黃金時刻,冷藍色的夜晚,柔和的薄霧 |
把主體寫具體。這份指南建議把「魔法」這類模糊的詞換成「旋轉的藍色能量粒子,散發著空靈的光芒」,讓模型有東西可畫。[2] 描寫觀眾看得到的動作,例如煙霧向上飄散、跑步的人身體前傾,而不是寫感受或意圖。
我們自己測試用的一條提示詞,五個部分都寫在一句話裡:
夜裡下著小雨,一位街頭小提琴手在石拱門下演奏,鏡頭從廣場對面緩慢推近,溫暖的燈光灑在濕漉漉的鵝卵石上,小提琴的旋律伴著細雨迴盪。不要文字,不要標誌。
Kling 3.0,1080p,5 秒,含聲音。
Kling 3.0 能聽懂哪些運鏡指令?
像導演那樣描述鏡頭。Kling 的指南建議使用平實的取景和運鏡術語,並給出了這些用法:[2]
| 指令 | 寫法 | 適合 |
|---|---|---|
| 特寫 | 說話者的臉部特寫 | 對白、情緒、產品細節 |
| 遠景 | 遠景鏡頭,呈現露台和兩個角色 | 環境和規模感 |
| 推鏡 | 鏡頭緩慢推向主體 | 強調、緊張感、揭曉 |
| 橫搖或直搖 | 鏡頭橫搖掃過房間,或向上直搖到招牌 | 呈現空間或高度 |
| 跟拍鏡頭 | 鏡頭在跑者身旁跟隨 | 動作和連貫性 |
需要時加上節奏:「緩慢」適合平靜或懸疑,「平穩」適合讓動作看得清楚,「快速」適合營造活力。[2] 大特寫、中特寫、全身和建立鏡頭這類取景術語,告訴模型觀眾離主體有多遠。[2]
多鏡頭場景怎麼寫?
Kling 3.0 可以把一段影片切成多個鏡頭。Kling 介紹了兩種方式:讓模型根據一條提示詞自己規劃剪接,或由你自己定義每個鏡頭及其長度;後者 Kling 稱為自訂多鏡頭(Custom Multi-Shot),並表示模型會「嚴格遵循」。[1] Kling 自己的範例把每個鏡頭寫成一行「取景 + 動作」:「鏡頭 1,低角度後方遠景,跟拍在騎士身後……鏡頭 2,低角度側面特寫,機車車輪的細節鏡頭……」[1]
透過 API,自訂版本就是 multi_shots: true 加上一個 multi_prompt 清單,每個鏡頭一個項目,各有自己的提示詞和長度。我們的測試請求了兩個 3 秒鏡頭:
{
"model": "kling-3-0",
"mode": "pro",
"sound": true,
"multi_shots": true,
"multi_prompt": [
{"prompt": "Wide shot of a small open kitchen, a chef tosses vegetables in a wok, flames rising, warm light. No text, no logos.", "duration": 3},
{"prompt": "Close-up of the wok, vegetables flipping through the flames, oil sizzling, steam drifting. No text, no logos.", "duration": 3}
]
}Kling 3.0,1080p,兩個 3 秒鏡頭,含聲音。
為每個鏡頭寫上各自的取景,並在每個鏡頭裡用同樣的方式描述主體,這樣看起來才是同一個人或同一件物品。各鏡頭長度相加必須在 3–15 秒之間。
對白和聲音的提示詞怎麼寫?
把台詞寫進提示詞,並把它掛在說這句話的角色身上。Kling 的指南給出的格式是「角色(語氣):台詞」,例如「媽媽(輕聲,帶著驚訝的語氣):哇,我完全沒想到會是這樣的劇情」,並表示即使畫面中有三個以上的角色,Kling 3.0 也能把每句台詞對應到正確的說話者。[1]
- 語言。 對白支援中文、英語、日語、韓語和西班牙語,角色還能在同一段影片裡切換語言。Kling 表示,其他任何語言的台詞都會被翻譯成英語。[1]
- 口音和方言。 在台詞旁邊標註,例如「用帶印度口音的英語說」;Kling 列出了美式、英式和印度式英語口音,以及包括粵語和四川話在內的幾種中文方言。[1]
- 環境音。 背景聲音也要寫出來:Kling 的範例一開頭就是「背景裡客廳冷氣發出微弱的嗡嗡聲」。[1]
只有在你要求時才會生成聲音:在請求中把 sound 設為 true。
怎麼讓角色或產品保持一致?
使用主體。在 Kling 3.0 中,主體是由 2–4 張參考圖片建立的對象;綁定之後,Kling 表示在推拉、橫搖和直搖中,這個主體都能保持「清晰穩定,不會偏移或消失」。[1] 在 API 中,它放在 kling_elements 裡,帶一個 name、一句簡短的 description 和圖片 URL,提示詞用名字提到它:
{
"prompt": "@hero walks out of the elevator, takes off her sunglasses and nods to a colleague, steady tracking shot",
"kling_elements": [
{
"name": "hero",
"description": "a professional woman in a camel coat with a black commuter bag",
"element_input_urls": ["https://example.com/hero-front.png", "https://example.com/hero-side.png"]
}
]
}第一張圖片用正面視角,再補上側面或四分之三側面視角;描述裡要寫明哪些地方不能變,例如服裝,或產品上的標誌。
15 秒影片裡的節奏怎麼控制?
用時間標出每個節拍。Kling 自己的 15 秒範例按時間推進動作:「第 4 秒,鏡頭隨她加速向前……第 8 秒,鏡頭逐漸推近成中景……第 12 秒,音樂和動作達到高潮……最後 3 秒……」[1] 如果要一個連續不斷的長鏡頭,就明確寫出來,就像 Kling 的另一個範例那樣:「一個沒有任何剪接轉場的連續長鏡頭」。[1] 影片長度可以是 3 到 15 之間的任意整數秒,所以要讓長度和你寫的節拍數相符。
哪些內容不要寫?
- 單獨使用的空泛品質詞。 只寫「電影感」或「傑作」,卻沒有運鏡或光線,模型幾乎沒有可以執行的內容。[2]
- 不想要的文字和標記。 Kling 3.0 呈現文字的能力很強,包括你要求的招牌和標誌。[1] 如果你一個都不想要,就在提示詞結尾加上「no text, no logos」,我們所有的測試提示詞都是這樣寫的。
- 一句話裡塞好幾次剪接。 如果一個場景需要特定的剪接,就用多鏡頭,每個鏡頭一個項目,而不是在一條提示詞裡串起「然後鏡頭切到……」。
Kling 3.0 提示詞常見問題
Kling 3.0 提示詞最長可以寫多少?
在 SeedRouter 上最多 2,500 個字元,多鏡頭請求中每個鏡頭最多 500 個字元。大多數好的提示詞只有一到四句話。
Kling 3.0 支援負向提示詞嗎?
SeedRouter 的 Kling 3.0 請求沒有獨立的負向提示詞欄位。把要避免的內容直接寫進提示詞,例如「no text, no logos」。Kling 目前的 API 也把這一點併入了提示詞:它的文件寫道「提示詞可以包含正向和負向描述」。[3]
Kling 3.0 有哪些好用的運鏡提示詞?
緩慢推近、跟拍鏡頭、橫搖、直搖和低角度揭曉,是 Kling 自己的指南裡用到的運鏡,用平實的句子寫出來,例如「鏡頭緩慢推向主體」。[2]
在哪裡可以測試提示詞?
Kling 3.0 Playground 執行的請求和 API 接收的完全相同,Kling 3.0 API 指南 介紹了怎樣從程式碼傳送它。



