Claude Opus 5.5 ya está disponible en SeedRouter
LogoSeedRouter

Busca modelos por nombre, p. ej. 'nano banana'

Busca modelos por nombre, p. ej. 'nano banana'

Guía de prompts de Kling 3.0: movimientos de cámara, escenas multitoma, diálogos y personajes coherentes

Cómo escribir prompts para Kling 3.0: cinco partes de un buen prompt, lenguaje de cámara eficaz, escenas multitoma, diálogo con sonido y personajes coherentes.

Leer en Markdown

Un buen prompt de Kling 3.0 nombra cinco cosas en lenguaje sencillo: el sujeto, lo que hace de forma visible, dónde está, cómo lo encuadra y se mueve la cámara, y la luz y el ambiente. La propia guía de prompts de Kling lo plantea igual: los buenos prompts «empiezan con una redacción humana clara: sujeto, acción, escenario, lenguaje de cámara, iluminación y ambiente».[2] Todo lo demás en esta guía, las escenas multitoma, los diálogos y los personajes coherentes, se apoya en esa estructura.

¿Qué debe incluir un prompt de Kling 3.0?

La guía de prompts de Kling enumera las partes de un prompt claro y lo que hace cada una:[2]

ParteQué defineEjemplo
SujetoEl personaje, producto o lugar principalUna mujer con camisa de rayas; un frasco de perfume sobre un pedestal de terciopelo
AcciónMovimiento visibleCamina hacia la cámara, remueve zumo en un vaso
EscenaLugar y detalles del entornoTerraza al aire libre, una calle antigua de Madrid
CámaraEncuadre, ángulo y movimientoPrimer plano, contrapicado, lento acercamiento, travelling
Luz y ambienteLa atmósferaHora dorada, noche azul y fría, bruma suave

Describe el sujeto de forma concreta. La misma guía propone sustituir una palabra vaga como «magia» por «partículas de energía azul arremolinadas con un brillo etéreo», para que el modelo tenga algo que dibujar.[2] Describe movimientos que el espectador pueda ver, como humo que sube o un corredor que se inclina hacia delante, en lugar de sentimientos o intenciones.

Un prompt de nuestras propias pruebas, con las cinco partes en una sola frase:

Un violinista callejero toca bajo un arco de piedra de noche mientras cae una lluvia ligera, lento acercamiento desde el otro lado de la plaza, luz cálida de farolas sobre los adoquines mojados, la melodía del violín resuena con la lluvia suave. Sin texto, sin logotipos.

Kling 3.0, 1080p, 5 segundos, con sonido.

¿Qué indicaciones de cámara sigue Kling 3.0?

Nombra la cámara como lo haría un director. La guía de Kling recomienda términos sencillos de encuadre y movimiento y les da estos usos:[2]

IndicaciónEscríbela asíÚtil para
Primer planoPrimer plano de la cara de quien hablaDiálogo, emoción, detalle de producto
Plano generalPlano general que muestra la terraza y a los dos personajesEscenario y escala
AcercamientoLa cámara avanza despacio hacia el sujetoÉnfasis, tensión, una revelación
Paneo o inclinaciónLa cámara hace un paneo por la sala o se inclina hacia arriba hasta el letreroRevelar el espacio o la altura
TravellingLa cámara sigue al corredor por su ladoAcción y continuidad

Añade el ritmo cuando importe: «lento» para calma o suspense, «estable» para una acción legible, «rápido» para dar energía.[2] Términos de encuadre como primerísimo primer plano, plano medio corto, cuerpo entero y plano general de situación le dicen al modelo a qué distancia está el espectador del sujeto.[2]

¿Cómo se escribe una escena multitoma?

Kling 3.0 puede dividir un clip en varias tomas. Kling describe dos formas: dejar que el modelo planifique los cortes a partir de un solo prompt, o definir tú mismo cada toma y su duración, lo que Kling llama Custom Multi-Shot y que, según dice, el modelo «seguirá estrictamente».[1] Los propios ejemplos de Kling escriben cada toma como una línea de encuadre más acción: «Toma 1, plano general trasero en contrapicado, siguiendo al motorista por detrás… Toma 2, primer plano lateral en contrapicado, un plano detalle de la rueda de la moto…»[1]

En la API, la versión personalizada es multi_shots: true con una lista multi_prompt, una entrada por toma con su propio prompt y duración. Nuestra prueba pidió dos tomas de 3 segundos:

{
  "model": "kling-3-0",
  "mode": "pro",
  "sound": true,
  "multi_shots": true,
  "multi_prompt": [
    {"prompt": "Wide shot of a small open kitchen, a chef tosses vegetables in a wok, flames rising, warm light. No text, no logos.", "duration": 3},
    {"prompt": "Close-up of the wok, vegetables flipping through the flames, oil sizzling, steam drifting. No text, no logos.", "duration": 3}
  ]
}

Kling 3.0, 1080p, dos tomas de 3 segundos, con sonido.

Dale a cada toma su propio encuadre y describe el sujeto igual en todas para que se lea como la misma persona u objeto. Las duraciones de las tomas deben sumar de 3 a 15 segundos.

¿Cómo se escriben los diálogos y el sonido en el prompt?

Escribe la frase en el prompt y asígnala al personaje que la dice. La guía de Kling muestra el patrón «Personaje (tono): frase», por ejemplo «Mamá (en voz baja, en tono sorprendido): Vaya, no me esperaba para nada esta trama», y dice que Kling 3.0 asigna cada frase al personaje correcto incluso con tres o más personajes en el encuadre.[1]

  • Idiomas. El diálogo funciona en chino, inglés, japonés, coreano y español, y los personajes pueden cambiar de idioma dentro de un mismo clip. Kling dice que una frase en cualquier otro idioma se traduce al inglés.[1]
  • Acentos y dialectos. Indícalos junto a la frase, por ejemplo «habla en inglés con acento indio»; Kling enumera los acentos del inglés estadounidense, británico e indio y varios dialectos chinos, entre ellos el cantonés y el de Sichuan.[1]
  • Ambiente. Nombra también el sonido de fondo: el ejemplo de Kling empieza con «un leve zumbido del aire acondicionado del salón de fondo».[1]

El sonido solo se genera cuando lo pides: pon sound en true en la solicitud.

¿Cómo se mantiene coherente un personaje o un producto?

Usa un elemento. En Kling 3.0, un elemento es un sujeto creado a partir de 2 a 4 imágenes de referencia; una vez vinculado, Kling dice que el sujeto se mantiene «nítido y estable, sin desplazarse ni desaparecer» durante zooms, paneos e inclinaciones.[1] En la API va en kling_elements con un name, una description breve y las URL de las imágenes, y el prompt lo menciona por su nombre:

{
  "prompt": "@hero walks out of the elevator, takes off her sunglasses and nods to a colleague, steady tracking shot",
  "kling_elements": [
    {
      "name": "hero",
      "description": "a professional woman in a camel coat with a black commuter bag",
      "element_input_urls": ["https://example.com/hero-front.png", "https://example.com/hero-side.png"]
    }
  ]
}

Usa una vista frontal como primera imagen y añade vistas laterales o de tres cuartos; la descripción debe nombrar lo que no puede cambiar, como la ropa o un logotipo en un producto.

¿Cómo se controlan los tiempos en un clip de 15 segundos?

Marca los momentos clave con tiempos. El propio ejemplo de 15 segundos de Kling hace avanzar la acción con el reloj: «En el segundo 4, la cámara acelera hacia delante con ella… En el segundo 8, la cámara se acerca poco a poco hasta un plano medio… En el segundo 12, la música y el movimiento llegan al clímax… En los últimos 3 segundos…»[1] Para una sola toma continua, dilo de forma explícita, como hace el otro ejemplo de Kling: «una única toma ininterrumpida, sin transiciones de montaje».[1] La duración del clip es cualquier número entero de 3 a 15 segundos, así que ajústala a los momentos que hayas escrito.

¿Qué conviene dejar fuera?

  • Palabras vagas de calidad sin más. «Cinematográfico» u «obra maestra» sin un movimiento de cámara ni una luz le dan al modelo poco con lo que trabajar.[2]
  • Texto y marcas no deseados. Kling 3.0 renderiza bien las letras, incluidos los letreros y logotipos que se le piden.[1] Si no quieres ninguno, termina el prompt con «sin texto, sin logotipos», como hacen todos nuestros prompts de prueba.
  • Varios cortes en una sola frase. Si una escena necesita cortes concretos, usa el modo multitoma con una entrada por toma en lugar de encadenar «luego la cámara corta a…» en un solo prompt.

Preguntas sobre prompts de Kling 3.0

¿Qué longitud puede tener un prompt de Kling 3.0?

Hasta 2500 caracteres en SeedRouter, y hasta 500 caracteres por toma en una solicitud multitoma. La mayoría de los buenos prompts tienen de una a cuatro frases.

¿Kling 3.0 admite prompts negativos?

La solicitud de Kling 3.0 en SeedRouter no tiene un campo aparte para el prompt negativo. Escribe lo que hay que evitar en el propio prompt, por ejemplo «sin texto, sin logotipos». La API actual de Kling también lo integra en el prompt: su documentación dice que «el prompt puede incluir descripciones positivas y negativas».[3]

¿Qué prompts de movimiento de cámara funcionan bien en Kling 3.0?

El acercamiento lento, el travelling, el paneo, la inclinación y la revelación en contrapicado son los movimientos que usa la propia guía de Kling, escritos como frases sencillas, por ejemplo «la cámara avanza despacio hacia el sujeto».[2]

¿Dónde puedo probar un prompt?

El Playground de Kling 3.0 ejecuta la misma solicitud que admite la API, y la guía de la API de Kling 3.0 muestra cómo enviarla desde código.

Referencias

  1. Kling AI. Kling VIDEO 3.0 Model User Guide. 6 de febrero de 2026. Obtenido el 6 de octubre de 2026 de kling.ai.
  2. Kling AI. Kling AI Prompt Guide: The Secret to Cinematic Video Prompts. 7 de agosto de 2026. Obtenido el 6 de octubre de 2026 de kling.ai.
  3. Kling AI. Kling 3.0: Text to Video (referencia de la API). Obtenido el 6 de octubre de 2026 de kling.ai.

Guías relacionadas