Guia de prompts do Kling 3.0: movimentos de câmera, sequências multicena, diálogos e personagens consistentes
Prompts no Kling 3.0: cinco partes de um bom prompt de vídeo, linguagem de câmera eficaz, sequências multicena, diálogo com áudio e personagens consistentes.
Ler em MarkdownUm bom prompt do Kling 3.0 diz cinco coisas em linguagem simples: o assunto, o que ele faz de forma visível, onde está, como a câmera enquadra e se move, e a luz e o clima. O próprio guia de prompts do Kling diz o mesmo: bons prompts "começam com uma escrita humana clara: assunto, ação, cenário, linguagem de câmera, iluminação e clima".[2] Todo o resto deste guia, sequências multicena, diálogos e personagens consistentes, parte dessa estrutura.
O que um prompt do Kling 3.0 deve ter?
O guia de prompts do Kling lista as partes de um prompt claro e o que cada uma faz:[2]
| Parte | O que define | Exemplo |
|---|---|---|
| Assunto | O personagem, produto ou lugar principal | Uma mulher de camisa listrada; um frasco de perfume sobre um pedestal de veludo |
| Ação | Movimento visível | Caminha em direção à câmera, gira o suco em um copo |
| Cenário | Local e detalhes ao redor | Terraço ao ar livre, uma rua antiga de Madri |
| Câmera | Enquadramento, ângulo e movimento | Close, contra-plongée, aproximação lenta, travelling |
| Luz e clima | A atmosfera | Golden hour, noite azul e fria, névoa suave |
Descreva o assunto de forma concreta. O mesmo guia sugere trocar uma palavra vaga como "magia" por "partículas de energia azul em espiral com um brilho etéreo", para o modelo ter algo para desenhar.[2] Descreva movimentos que o espectador consegue ver, como fumaça subindo ou um corredor inclinando o corpo para a frente, em vez de sentimentos ou intenções.
Um prompt dos nossos próprios testes, com as cinco partes em uma única frase:
Um violinista de rua toca sob um arco de pedra à noite enquanto cai uma chuva fina, aproximação lenta a partir do outro lado da praça, luz quente de lampião sobre os paralelepípedos molhados, a melodia do violino ecoando com a chuva suave. Sem texto, sem logotipos.
Kling 3.0, 1080p, 5 segundos, com áudio.
Quais indicações de câmera o Kling 3.0 segue?
Descreva a câmera como um diretor faria. O guia do Kling recomenda termos simples de enquadramento e movimento e dá estes usos:[2]
| Indicação | Como escrever | Bom para |
|---|---|---|
| Close | Close no rosto de quem fala | Diálogo, emoção, detalhe de produto |
| Plano aberto | Plano aberto mostrando o terraço e os dois personagens | Ambientação e escala |
| Aproximação | A câmera avança devagar em direção ao assunto | Ênfase, tensão, uma revelação |
| Pan ou tilt | A câmera faz um pan pela sala, ou um tilt para cima até a placa | Revelar espaço ou altura |
| Travelling | A câmera acompanha o corredor ao lado dele | Ação e continuidade |
Acrescente o ritmo quando importar: "lento" para calma ou suspense, "estável" para uma ação legível, "rápido" para energia.[2] Termos de enquadramento como close extremo, plano médio fechado, corpo inteiro e plano geral de ambientação dizem ao modelo a que distância o espectador está do assunto.[2]
Como escrever uma sequência multicena?
O Kling 3.0 pode dividir um clipe em várias cenas. O Kling descreve duas formas: deixar o modelo planejar os cortes a partir de um único prompt, ou você mesmo definir cada cena e a duração dela, o que o Kling chama de Custom Multi-Shot e diz que o modelo vai "seguir à risca".[1] Os próprios exemplos do Kling escrevem cada cena como uma linha de enquadramento mais ação: "Cena 1, plano aberto traseiro em contra-plongée, acompanhando o piloto por trás… Cena 2, close lateral em contra-plongée, um plano detalhe da roda da moto…"[1]
Pela API, a versão personalizada é multi_shots: true com uma lista multi_prompt, uma entrada por cena com prompt e duração próprios. Nosso teste pediu duas cenas de 3 segundos:
{
"model": "kling-3-0",
"mode": "pro",
"sound": true,
"multi_shots": true,
"multi_prompt": [
{"prompt": "Wide shot of a small open kitchen, a chef tosses vegetables in a wok, flames rising, warm light. No text, no logos.", "duration": 3},
{"prompt": "Close-up of the wok, vegetables flipping through the flames, oil sizzling, steam drifting. No text, no logos.", "duration": 3}
]
}Kling 3.0, 1080p, duas cenas de 3 segundos, com áudio.
Dê a cada cena seu próprio enquadramento e descreva o assunto do mesmo jeito em todas, para que ele pareça a mesma pessoa ou o mesmo objeto. As durações das cenas precisam somar de 3 a 15 segundos.
Como escrever diálogo e áudio no prompt?
Escreva a fala no prompt e associe-a ao personagem que a diz. O guia do Kling mostra o padrão "Personagem (tom): fala", por exemplo "Mãe (baixinho, em tom de surpresa): Nossa, eu não esperava essa história de jeito nenhum", e diz que o Kling 3.0 associa cada fala ao personagem certo mesmo com três ou mais personagens no quadro.[1]
- Idiomas. O diálogo funciona em chinês, inglês, japonês, coreano e espanhol, e os personagens podem trocar de idioma dentro do mesmo clipe. O Kling diz que uma fala em qualquer outro idioma é traduzida para o inglês.[1]
- Sotaques e dialetos. Indique-os ao lado da fala, por exemplo "fala em inglês com sotaque indiano"; o Kling lista os sotaques americano, britânico e indiano do inglês e vários dialetos chineses, entre eles o cantonês e o de Sichuan.[1]
- Ambiência. Descreva também o som de fundo: o exemplo do Kling começa com "um leve zumbido do ar-condicionado da sala ao fundo".[1]
O áudio só é gerado quando você pede: defina sound como true na requisição.
Como manter um personagem ou produto consistente?
Use um elemento. No Kling 3.0, um elemento é um assunto criado a partir de 2 a 4 imagens de referência; depois de vinculado, o Kling diz que o assunto continua "nítido e estável, sem se deslocar nem desaparecer" durante zooms, pans e tilts.[1] Na API, ele vai em kling_elements com um name, uma description curta e as URLs das imagens, e o prompt o menciona pelo nome:
{
"prompt": "@hero walks out of the elevator, takes off her sunglasses and nods to a colleague, steady tracking shot",
"kling_elements": [
{
"name": "hero",
"description": "a professional woman in a camel coat with a black commuter bag",
"element_input_urls": ["https://example.com/hero-front.png", "https://example.com/hero-side.png"]
}
]
}Use uma vista frontal como primeira imagem e adicione vistas laterais ou de três quartos; a descrição deve dizer o que não pode mudar, como a roupa ou um logotipo em um produto.
Como controlar o tempo em um clipe de 15 segundos?
Marque os momentos com tempos. O próprio exemplo de 15 segundos do Kling avança a ação pelo relógio: "No 4º segundo, a câmera acelera para a frente com ela… No 8º segundo, a câmera aproxima aos poucos até um plano médio… No 12º segundo, a música e o movimento chegam ao clímax… Nos 3 segundos finais…"[1] Para uma única cena contínua, diga isso explicitamente, como faz o outro exemplo do Kling: "uma única cena ininterrupta, sem transições de edição".[1] A duração do clipe é qualquer número inteiro de 3 a 15 segundos, então ajuste a duração à quantidade de momentos que você escreveu.
O que deixar de fora?
- Palavras vagas de qualidade, sozinhas. "Cinematográfico" ou "obra-prima" sem um movimento de câmera ou uma luz dão pouco para o modelo trabalhar.[2]
- Texto e marcas indesejados. O Kling 3.0 renderiza bem letras, incluindo placas e logotipos que forem pedidos.[1] Quando você não quiser nenhum, termine o prompt com "sem texto, sem logotipos", como fazem todos os nossos prompts de teste.
- Vários cortes em uma frase. Se uma sequência precisa de cortes específicos, use o multicena com uma entrada por cena em vez de encadear "então a câmera corta para…" em um único prompt.
Perguntas sobre prompts do Kling 3.0
Qual o tamanho máximo de um prompt do Kling 3.0?
Até 2.500 caracteres no SeedRouter, e até 500 caracteres por cena em uma requisição multicena. A maioria dos bons prompts tem de uma a quatro frases.
O Kling 3.0 aceita prompt negativo?
A requisição do Kling 3.0 no SeedRouter não tem um campo separado de prompt negativo. Escreva o que evitar no próprio prompt, por exemplo "sem texto, sem logotipos". A API atual do Kling também coloca isso no prompt: a documentação dela diz que "o prompt pode incluir descrições positivas e negativas".[3]
Quais prompts de movimento de câmera funcionam bem no Kling 3.0?
Aproximação lenta, travelling, pan, tilt e revelação em contra-plongée são os movimentos que o próprio guia do Kling usa, escritos como frases simples, por exemplo "a câmera avança devagar em direção ao assunto".[2]
Onde posso testar um prompt?
O Playground do Kling 3.0 executa a mesma requisição que a API aceita, e o guia da API do Kling 3.0 mostra como enviá-la pelo código.
Referências
- Kling AI. Kling VIDEO 3.0 Model User Guide. 6 de fevereiro de 2026. Consultado em 6 de outubro de 2026 em kling.ai.
- Kling AI. Kling AI Prompt Guide: The Secret to Cinematic Video Prompts. 7 de agosto de 2026. Consultado em 6 de outubro de 2026 em kling.ai.
- Kling AI. Kling 3.0: Text to Video (referência da API). Consultado em 6 de outubro de 2026 em kling.ai.



