Claude Opus 5.5 ya está disponible en SeedRouter

Guía de prompts de Seedance 2.5: estructura, cámara, tiempos, audio y referencias

Cómo escribir prompts para Seedance 2.5: fórmula base, cámara, marcas de tiempo, sintaxis de diálogo y sonido, referencias, ediciones y qué cambia en 2.0.

Leer en Markdown

Un buen prompt de Seedance 2.5 dice quién hace qué, dónde, cómo lo filma la cámara y qué se oye, en ese orden: primero el sujeto y la acción, después la escena, el estilo visual, la cámara y el audio. Divide los clips largos en rangos de tiempo como «0-3s» o en planos numerados, nombra cada archivo de referencia por su número («Image 1», «Video 1») y define la duración, la relación de aspecto y la resolución como parámetros de la solicitud, no en el texto. Las reglas de abajo salen de las guías oficiales de prompts de ByteDance para Seedance 2.5 y 2.0, revisadas el 29 de septiembre de 2026. Todos los prompts de ejemplo se escribieron para este artículo.

¿Cómo se escribe un prompt para Seedance 2.5?

Parte de la fórmula base de ByteDance: «Sujeto + Acción o Evento + Escena y Entorno (opcional) + Estilo Visual (opcional) + Movimiento de Cámara/Corte (opcional) + Audio (opcional)». Solo la primera parte es obligatoria. La guía llama al sujeto y la acción «la base del vídeo» y te deja omitir las partes que no necesites.

En la práctica, eso se convierte en cuatro frases cortas:

<Subject> performs <main action or event> in <scene and environment>.
The visuals feature <visual style>.
Use <shot size, camera angle, camera movement, or cuts>.
Audio includes <dialogue, ambience, sound effects, or music>.

Una versión completa:

A street baker pulls a tray of round loaves from a brick oven at night and sets it on a flour-dusted counter.
Warm orange light from the oven, visible steam, shallow depth of field, realistic film look.
Start with a close-up of the oven door opening, then pull back slowly to a medium shot of the counter.
Audio: crackling wood, the scrape of the metal tray, quiet street noise outside.

Tres hábitos marcan la diferencia:

  • Describe lo que quieres, no lo que no quieres. La guía oficial pide «descripciones positivas siempre que sea posible» y señala los subtítulos y el audio como los ámbitos donde se admiten instrucciones negativas (ver más abajo).
  • Deja los parámetros fuera del prompt. La duración del clip, la relación de aspecto, la resolución y si se genera sonido son campos de la solicitud (duration, ratio, resolution, generate_audio); la guía dice que los parámetros «no necesitan incluirse en el prompt».
  • Termina con lo que debe mantenerse constante, como el ángulo de cámara, el escenario y el ambiente, para que se conserve durante todo el clip.

¿Cómo se controlan la cámara y los planos?

Escribe los términos de cámara tal cual. ByteDance enumera tamaños de plano (gran plano general, plano general, plano medio, plano medio corto, primer plano), movimientos (acercamiento, alejamiento, paneo, travelling, seguimiento, órbita, inclinación hacia arriba, cámara en mano con temblor) y ángulos (contrapicado, cenital, primera persona), además de técnicas con nombre propio como plano secuencia/toma larga, dolly zoom, FPV, bullet time y rampa de velocidad.

Para cualquier término menos conocido, añade después una explicación en lenguaje llano. El ejemplo de la propia guía es «Cambio de foco: el enfoque se desplaza con suavidad; los árboles que estaban nítidos en primer plano se desenfocan, mientras el personaje del fondo se vuelve nítido poco a poco».

Para un corte o una transición, indica tanto el momento como el método, por ejemplo «En el segundo 5, un barrido rápido de cámara hacia la izquierda lleva a la siguiente escena». La guía de Seedance 2.0 añade una regla que sigue sirviendo en 2.5: un solo movimiento de cámara por plano, porque pedir «acercar, alejar, panear y desplazarse a la vez» hace la imagen menos estable.

Una escena con varias cámaras no es más que varios planos numerados, cada uno con su encuadre:

Shot 1: Wide shot, locked-off camera, eye level. Two chess players sit across a table in an empty library.
Shot 2: Over-the-shoulder shot from behind the older player. The younger player moves a knight and looks up.
Shot 3: Close-up of the older player's hand hovering over the board, then tapping the table once.
Quiet room tone, the soft click of chess pieces, no music.

¿Seedance respeta las marcas de tiempo?

Seedance 2.5 sí, en segundos enteros. Seedance 2.0 no. La comparación de ByteDance es directa: «Seedance 2.0 no responde a marcas de tiempo y solo responde a números de plano, mientras que Seedance 2.5 admite marcas de tiempo en segundos enteros».

En 2.5 funcionan tres formas:

  • Rangos: «0-3s … 3-7s … 7-15s», sin huecos entre ellos.
  • Puntos: «At the 2-second mark, a gust of wind lifts the tablecloth.» (En el segundo 2, una ráfaga de viento levanta el mantel.)
  • Tiempo relativo: «She waits by the door. After 3 seconds, the light in the hallway goes out.» (Ella espera junto a la puerta. Tras 3 segundos, la luz del pasillo se apaga.)

Ajusta el contenido al tiempo que le das. Si en un rango pasa demasiado poco, el modelo improvisa; si pasa demasiado, la guía advierte que el resultado «puede contener cortes excesivos u omitir partes de la trama». No uses marcas de tiempo para movimientos rápidos y repetidos, como sacudir la cabeza tres veces por segundo.

Para un clip de hasta el límite de 30 segundos de Seedance 2.5, escríbelo por etapas con un estado final claro para cada una:

A lighthouse keeper's evening routine, realistic, cool blue dusk turning to night, no music.
0-6s: Wide shot of a lighthouse on a rocky coast at dusk. The keeper climbs the outside stairs with a lantern.
6-14s: Inside the lamp room, medium shot. He wipes the large lens with a cloth, then checks a brass gauge.
14-22s: Close-up of his hand turning a wheel. The main lamp starts to rotate and throws a beam across the room.
22-30s: Aerial shot pulling back from the tower. The beam sweeps over dark water. Waves and wind only.

¿Cómo se escriben el diálogo, el sonido y los subtítulos?

Seedance 2.5 genera el audio junto con el vídeo por defecto (generate_audio es true). Todo se puede describir con frases normales, pero la guía oficial define corchetes para cuando necesitas separar los tipos de sonido:

ContenidoSintaxisEjemplo
Música( )(soft piano plays in the background)
Efecto de sonido< ><a bell rings in the distance>
Diálogo{ }{Welcome back.}
Subtítulos【 】【Chapter One】

Para un diálogo en un idioma o acento concreto, nómbralo antes de la frase. La fórmula de la guía es Dialogue Language + Regional Variety or Accent + Delivery Style + Speaker + {Dialogue}, por ejemplo: Dialogue language: American English. The girl says in natural, conversational American English: {I thought you weren't coming.} ByteDance dice que Seedance 2.5 genera voz de forma nativa en más de 10 idiomas; la guía no los enumera, así que prueba el tuyo. No mezcles idiomas dentro de una misma frase, algo que la guía de 2.0 desaconseja, salvo en nombres propios.

Cuando hablan varios personajes, escribe la entonación una vez por frase con la forma «Frase del personaje (emoción): contenido». Según la guía, repetir palabras después de una frase, o añadir notas separadas de tono y acción a palabras sueltas, es una de las cosas que hacen que el modelo añada subtítulos.

Aquí sí funcionan las instrucciones negativas: «No subtitles», «No BGM; only ambient and action sounds» o «No audio.». Aun así, pueden colarse subtítulos, con menos frecuencia que en 2.0 según ByteDance, y un vídeo de referencia que contenga subtítulos puede anular «no subtitles». Para dar a un personaje una voz o una canción que ya existe, adjúntala como audio de referencia y vincúlala a ese personaje, como en el ejemplo de la guía: «La Imagen 1 muestra al protagonista John y usa el timbre de voz del Audio 1».

¿Cómo se referencian imágenes, vídeos y audio en un prompt?

Numera cada archivo según el orden en que lo adjuntas y vincúlalo en el texto. Los ejemplos de ByteDance dicen así: «Las Imágenes 1-2 son el Personaje 1 y corresponden al Audio 1; las Imágenes 3-4 son el Personaje 2 y corresponden al Audio 2». No confíes en un nombre escrito dentro de la imagen; la guía dice que etiquetar una imagen como «John» y luego escribir «John está en el colegio» «puede causar fácilmente confusión o duplicación de personajes».

Di para qué sirve cada archivo y qué hay que ignorar:

Image 1 defines the courier's face, hairstyle and yellow raincoat. Do not use the image background.
Image 2 defines the narrow alley, wet cobblestones and neon reflections. Do not use any people in it.
Video 1 defines the running pace and the handheld follow camera only.
The courier from Image 1 runs through the alley from Image 2 at night, jumps a puddle, and stops at a green door.

Si un vídeo de referencia ya muestra el movimiento exacto, escribe «follow the actions and camera movement in Video 1» (sigue las acciones y el movimiento de cámara del Video 1) en lugar de volver a describir cada paso; repetirlo puede entrar en conflicto con el vídeo. Cuando varias imágenes muestran un mismo objeto desde ángulos distintos, dilo («All four images show the same desk lamp; only one lamp appears»), o el modelo puede tratarlas como objetos diferentes.

Cuántas usar: Seedance 2.5 acepta hasta 30 imágenes, 10 vídeos y 10 clips de audio (vídeos y audio con un máximo de 30 segundos en total cada uno). ByteDance recomienda de 1 a 8 sujetos en las imágenes de sujeto y de 1 a 5 sujetos, con 5-10 segundos cada uno, en las referencias de vídeo o audio; se permiten más, pero el resultado es menos estable. Seedance 2.0 acepta hasta 9 imágenes, 3 vídeos y 3 clips de audio, y su guía recomienda 4-5 archivos en total. Para la forma de la solicitud de cada tipo de referencia, consulta cómo añadir imágenes, vídeos y audio. Las imágenes y los vídeos de referencia con rostros de personas reales se rechazan; este artículo explica el error y qué está permitido.

¿Cómo se escribe el prompt para editar o extender un vídeo?

En SeedRouter, editar y extender son funciones de Seedance 2.5: envía un vídeo de referencia y define omni_reference_task_type como edit o extend. El prompt tiene entonces que hacer dos cosas.

Para ediciones, nombra el alcance y describe el cambio de A a B. Incluye un verbo de acción como añadir, quitar, reemplazar o cambiar a, y usa un rango de tiempo para las ediciones parciales. El ejemplo de la guía: «Cambia la acción del hombre de beber café a fregar el suelo entre los segundos 4 y 6 del Video 1, y deja el resto del contenido sin cambios». Un cambio de objeto sigue el mismo patrón:

Edit Video 1: replace the paper coffee cup on the desk with the green ceramic mug from Image 1. Keep the person, the camera and the audio unchanged.

Para extensiones, di en qué dirección y parte del fotograma del límite. Usa «extend forward», «extend backward» o «continue» y luego describe lo que pasa a continuación:

Continue Video 1: the cyclist reaches the top of the hill, stops, and takes off her helmet. The camera stays on the same side angle. Wind and distant birds.

Una edición o extensión conserva la relación de aspecto del vídeo original, así que deja ratio en adaptive; una edición también conserva su duración, así que duration debe ser -1. ByteDance recomienda MOV tanto para la entrada como para la salida (output_format: "mov") para la mejor continuidad de color y audio. Si una solicitud que combina referencias y ediciones da resultados inestables, la solución de la guía es dividirla en una tarea de referencias y después una tarea de edición. Los cuerpos de solicitud exactos están en cómo editar o extender un clip.

¿Cómo se usan los storyboards y los fotogramas clave?

Cumplen funciones distintas. Un storyboard de varias viñetas, varios fotogramas en una sola imagen, es una referencia de trama flexible: el modelo «no se alinea estrictamente» con él. Los fotogramas clave, imágenes separadas adjuntadas en orden, se siguen de cerca.

  • Storyboard: usa dibujo lineal sencillo o figuras de palitos sin texto, 15 viñetas o menos. Relaciona primero la imagen del storyboard, escribe un resumen de la historia en una línea y luego describe cada plano para completar lo que el dibujo no muestra (acción, cámara, estilo).
  • Fotogramas clave: adjunta cada fotograma como su propia imagen de referencia y empieza el prompt con «Use Images 1 to 6 in order as keyframes.» (Usa las Imágenes 1 a 6 en orden como fotogramas clave.)
  • Primer y último fotograma: asigna a las imágenes los roles first_frame y last_frame. Esto fija la salida a la relación de aspecto de la primera imagen, así que usa dos imágenes con la misma relación. Asignarlas como reference_image y escribir «Image 1 is the first frame» no fija la relación, pero la salida puede no coincidir exactamente con las imágenes.

¿Qué cambia al escribir prompts para Seedance 2.0?

La estructura es la misma (sujeto, acción, escena, cámara, estilo, audio), pero la guía de 2.0 pide algunas cosas que 2.5 ya no necesita:

  • Planos, no segundos. Organiza el clip como «Shot 1 / Shot 2 / Shot 3» y deja que el modelo marque el ritmo; la guía de 2.0 califica de «inestable» la temporización precisa.
  • Movimiento suave y continuo. Prefiere «movimientos sutiles, lentos, suaves y coherentes» a los sprints, los saltos grandes y las volteretas violentas, y te pide describir cómo una acción fluye hacia la siguiente.
  • Emociones mostradas como acciones. En lugar de «muy triste», escribe «baja la cabeza, los hombros le tiemblan ligeramente, los ojos se le enrojecen».
  • Un primer plano de la cara y una imagen de cuerpo entero por personaje, no una hoja con varios ángulos, que 2.0 puede interpretar como varias personas. Seedance 2.5 acepta imágenes multivista.
  • Refiérete a un sujeto siempre de la misma manera, por ejemplo «the woman in the red coat@Image 1», o define un nombre una vez y reutilízalo.

Los clips de Seedance 2.0 duran de 4 a 15 segundos (5 por defecto), y tiene versiones Fast y Mini que aceptan la misma solicitud, solo en 480p o 720p. La comparativa de versiones y la guía de 2.0, Fast y Mini explican qué modelo elegir. ByteDance también advierte de que las dos versiones tienen «preferencias de estilo estético significativamente diferentes», así que el mismo prompt no dará el mismo aspecto.

¿Por qué Seedance no sigue mi prompt?

La mayoría de los fallos se deben a un puñado de causas que recoge el FAQ oficial:

  • Demasiado en muy poco tiempo. Reparte los eventos o aumenta duration.
  • Contradicciones. Dos descripciones distintas del mismo personaje, o un movimiento de cámara que choca con la acción.
  • Personajes intercambiados entre referencias. Adjunta los archivos de referencia en el orden en que aparecen los personajes por primera vez y renumera el prompt para que coincida.
  • Ojos brillantes. Palabras fuertes como «fanático» o «extremadamente sorprendido» pueden hacer que las pupilas brillen. Usa un lenguaje más calmado y añade «normal human eyes; no glowing eyes».
  • Texto en pantalla mal escrito. Deletrea la palabra letra por letra o proporciona el texto exacto como imagen de referencia.
  • Una sola solicitud que hace demasiado. Separa las referencias y las ediciones en tareas distintas.
  • Una cara bloqueada. Los rostros de personas reales en las referencias se rechazan; consulta el error de persona real.

Haz los borradores en 480p con una duration corta y después renderiza la versión que te quedes a una resolución más alta. Las tareas fallidas no se cobran; para saber cuánto cuesta un clip terminado, consulta Precio de la API de Seedance.

Preguntas frecuentes

¿Hay que escribir los prompts de Seedance en JSON?

No se exige ningún formato. La guía de ByteDance dice que los prompts «pueden escribirse íntegramente en lenguaje natural», y todas sus plantillas son frases normales con etiquetas opcionales como «Shot 1» o «0-3s». La estructura ayuda; la sintaxis JSON no hace falta.

¿Cómo se hace una escena de pelea en Seedance 2.5?

Describe la pelea en términos generales y guarda el detalle para uno o dos movimientos clave; la guía recomienda frases como «ambos bandos enzarzados en un combate cuerpo a cuerpo» en lugar de enumerar cada puñetazo. Coloca los momentos en una línea de tiempo, usa un solo movimiento de cámara por plano y describe el sonido con efectos < >.

¿Cuánto puede durar un vídeo de Seedance 2.5?

Hasta 30 segundos por solicitud, definidos con duration (de 4 a 30, o -1 para que el modelo elija). Seedance 2.0 llega hasta 15 segundos.

¿Existe un optimizador de prompts oficial para Seedance?

Sí. ByteDance publica una skill de prompts para Seedance 2.5, sd25-pe, que los asistentes de programación pueden usar para reescribir tu prompt antes de enviarlo. El comando de instalación está en la guía oficial.

¿Puedo usar una foto mía como referencia?

No. Seedance rechaza imágenes y vídeos de referencia que contengan rostros humanos reales. La guía del error de persona real explica qué permite ByteDance en su lugar.

Prueba tu prompt

Pega un prompt en el playground de Seedance 2.5 o en el playground de Seedance 2.0, o envíalo desde código con la referencia de la API de Seedance 2.5. Recargas una sola vez, sin suscripción, los créditos nunca caducan y una tarea que falla no cuesta nada.

Guías relacionadas