La guía de prompts definitiva para Wan 3.0 [2026]
El prompt que desperdicia veinte de tus treinta segundos
Pides un violinista tocando. Lo que obtienes es un violinista tocando, sostenido durante toda la duración, sin nada en el segundo veintiocho que no fuera ya real en el segundo dos. La generación tuvo éxito. El clip no se puede usar, porque una descripción estática de una persona produjo una grabación estática de una persona.
Ahora pide algo más: ella termina la frase, baja el arco y se queda quieta mientras la última nota se desvanece mientras la cámara se desplaza hacia la izquierda. Mismo sujeto, mismo instrumento, misma habitación. La diferencia es que la segunda versión contiene un arco, y Wan 3.0 genera aproximadamente 30 segundos en una sola pasada con audio nativo, lo que significa que renderizará cualquier arco que le hayas dado, incluido ninguno.
Wan 3.0 está disponible en Atlabs, por lo que todo lo que se incluye en esta guía es algo que puedes ejecutar hoy mismo sin una cuenta de API independiente.
Por qué las tomas largas cambian tu forma de escribir
La creación de prompts para clips cortos premiaba la descripción porque solo había un momento que describir. A los cinco segundos, la diferencia entre un gran prompt y uno adecuado son principalmente los adjetivos. Todo lo que te enseñaron en 2024 asume esto, razón por la cual muchos consejos sobre prompts parecen una lista de compras de cualidades visuales.
A los treinta segundos no estás describiendo un fotograma, estás programando un cambio. El modelo tiene que saber qué es diferente al final respecto al principio, y cada segundo que dejas sin justificar es un segundo que llena con su propio criterio. Por eso las generaciones largas a menudo se sienten de relleno. No son de relleno, simplemente no han recibido instrucciones.
De eso se derivan tres cosas. El comportamiento de la cámara tiene que ser nombrado, porque una cámara no especificada o bien se bloquea como una señal de seguridad o se desplaza como prefiera el modelo, y ninguna de las dos es una decisión que hayas tomado tú. El audio tiene que ser dirigido, porque el sonido se genera en la misma pasada, por lo que dejarlo fuera no es una solicitud de silencio, es una solicitud de la mezcla de otra persona. Y las referencias necesitan tareas explícitas, porque Wan 3.0 acepta alrededor de diez imágenes junto con clips, audio e incluso documentos, y un recurso sin una función declarada sigue influyendo en el resultado de formas que no elegiste.
La cuarta cosa es más sutil. Wan 3.0 razona sobre la composición y el movimiento antes de renderizar, lo que significa que el orden de tu prompt importa. Empieza con el sujeto, el movimiento y la cámara para que el paso de planificación fije primero la composición, y luego añade capas de luz, acción y audio detrás. Un prompt que entierra el tipo de toma en la cuarta frase se planifica en torno a lo incorrecto.
La fórmula SPACE
La estructura que mejor se mantiene en las pruebas iniciales es SPACE, que es un breve resumen de la toma en lugar de una leyenda.
El Sujeto (Subject) es quién o qué está en el encuadre, de forma concreta. Un mensajero con una chaqueta amarilla empapada, no una persona. El Desempeño (Performance) es el movimiento y cómo evoluciona. Empuja la puerta para abrirla y pasa a través, no se queda ahí parado. El Ambiente (Ambience) es el entorno, el tiempo y la luz. Un callejón estrecho de noche, reflejos de neón sobre ladrillo húmedo. La Cámara (Camera) es un tamaño de toma y un movimiento deliberado. Toma media, acercamiento lento. No dos movimientos, no tres, porque las instrucciones de cámara que compiten dentro de una sola toma producen un clip que no puede decidir lo que está haciendo. Las Pistas adicionales (Extra cues) llevan la base de audio, el ritmo, las reglas de continuidad y las etiquetas de referencia.
Escrita de corrido, la plantilla funciona así: sujeto y acción principal en la escena, luz y tiempo, luego estilo visual y atmósfera, luego tamaño de toma y un movimiento de cámara, luego una línea de audio específica, luego etiquetas de referencia y si se trata de una sola toma ininterrumpida o de una secuencia planificada con estados finales.
La diferencia entre un prompt débil y uno fuerte se nota claramente al compararlos. "Una calle lluviosa de noche" frente a "toma media de un mensajero, un acercamiento lento por un callejón iluminado por neón, lluvia cayendo a través de la luz clave". "Usa estas referencias" frente a "el mensajero de la referencia de personaje cruza la plaza que se muestra en la referencia de ubicación". "Añade algo de sonido" frente a "base de lluvia baja, sin música, el obturador se cierra de golpe cuando la cámara llega a la puerta". "Video de producto con logotipo" frente a "rotación lenta iluminada en estudio de una tetera de acero cepillado, logotipo legible durante todo el giro". En cada par, la versión fuerte no es mucho más larga. Es específica en los lugares donde el modelo, de lo contrario, estaría adivinando.
El flujo de trabajo de Atlabs para esto
Wan 3.0 se encuentra en la gama de modelos de Atlabs junto con Kling, Veo, Seedance y Hailuo, lo que significa que escribes el resumen una vez y eliges el motor que se adapta a la toma en lugar de reconstruir el mismo resumen en una herramienta diferente.
El flujo de trabajo que mejor se adapta a esta disciplina es el del guion al video, porque convierte el resumen de una toma en campos en lugar de un párrafo que tienes que estructurar correctamente de memoria.
El paso del guion al video se realiza en tres pasos. El Paso 1 ofrece dos modos de entrada: "Añade tu guion" para trabajos dirigidos por narración con un selector de idioma, el botón de redactor de guiones con IA y un panel de guiones sugeridos con tres puntos de partida generados, y "Añade tu guion gráfico" para trabajos estructurados. Pega cualquier cosa con formato de guion cinematográfico y Atlabs mostrará "Guion detectado", abriendo una vista donde el panel izquierdo muestra la Voz del narrador, Ubicaciones y Actores analizados por la IA, y el panel derecho divide la pieza en escenas que contienen Tipo de ubicación, Ubicación y Hora del día, con descripciones de TOMA individuales y bloques de DIÁLOGO dentro de cada una.
Esos bloques de TOMA son la versión de interfaz de los estados finales planificados. El panel de reparto es la versión de interfaz de un bloqueo de referencia de personaje.
Guía paso a paso
1. Escribe el arco antes de abrir nada. Decide qué es lo que cambia de forma observable al final con respecto al principio, luego divídelo en etapas con estados finales. Un resumen planificado dice: la etapa uno termina con la rueda en posición vertical en el soporte y el banco vacío, la etapa dos termina con la rueda centrada y la llave todavía en la mano, la etapa tres termina con el soporte vacío y la rueda en el gancho. Esos estados finales son puntos de control con los que el modelo puede planificar. Un cambio principal por etapa, y pon la revelación al final para que el compás final tenga un lugar donde aterrizar.
2. Elige tu modo de entrada en el Paso 1. Usa "Añade tu guion" cuando la pieza esté dirigida por la narración. Usa "Añade tu guion gráfico" cuando ya conozcas tus tomas, ya que la vista estructurada evita que una lista de tomas se convierta silenciosamente en un único párrafo corrido, que es el fallo más común en la creación de prompts de formato largo.
3. Crea el desglose de la escena. Establece el Tipo de ubicación como Exterior o Interior, luego la Ubicación y la Hora del día. Escribe cada descripción de TOMA como movimiento en lugar de composición. "Acercamiento lento desde una toma media, manteniendo al sujeto en el centro del encuadre" le da al modelo algo que ejecutar. "Hermosa toma cinematográfica" no le da nada sobre lo que planificar. Añade bloques de DIÁLOGO donde hablen los personajes, completando el nombre del personaje, la línea hablada y el tono de la interpretación. Las tomas y los diálogos se pueden añadir o eliminar por escena, por lo que el ritmo se ajusta aquí en lugar de reescribiendo todo el resumen y regenerando a ciegas.
4. Define tu estilo en el Paso 2. La relación de aspecto ofrece 9:16 para TikTok e Instagram, 16:9 para YouTube y 1:1 para LinkedIn, Twitter, Facebook y Pinterest. El Estilo de video ofrece Video de IA (Recomendado), Storyboard de IA y Subir si traes tus propios archivos. Bloquea la relación antes de finalizar el encuadre, porque un acercamiento lento que se ve bien en 16:9 se recorta en una toma diferente en 9:16.
5. Finaliza el reparto en el Paso 3. Los personajes extraídos del guion aparecen con la opción de "Hacer clic para editar", junto con una opción para "Añadir personaje" y menús desplegables para el Acento del país y la Voz del narrador. Definir un personaje aquí hace el mismo trabajo que nombrar una referencia de personaje en un prompt de Wan 3.0. El modelo obtiene una respuesta fija sobre quién es esta persona en lugar de improvisar una nueva en cada escena.
6. Genera en Wan 3.0, luego repara en lugar de reiniciar. Cuando un tramo falle, lleva el clip a Modificar video, súbelo, haz referencia a él como @Video1 en el prompt, describe el video final que deseas y adjunta hasta cuatro imágenes de referencia para la guía de estilo. La opción de Mantener audio original tiene un interruptor de encendido y apagado, por lo que solucionar un problema de imagen no te costará una banda sonora con la que estabas conforme.
Por qué Atlabs funciona bien para esto
La primera razón es el enrutamiento de modelos. La disciplina del prompt se mantiene entre modelos, la estética no, y el motor que renderiza bien un primer plano de un personaje estilizado rara vez es el que renderiza bien un plano general exterior iluminado por una tormenta. Atlabs ejecuta Wan 3.0 para tomas únicas largas con audio nativo y continuidad de referencia, Kling 3.0 y Kling 2.6 para movimiento cinematográfico y transiciones suaves, Google Veo 3.1 para fotorrealismo, tomas amplias y tomas de establecimiento, Seedance 2.0 para contenido estilizado, anime y primeros planos de personajes, Hailuo 2.3 para alto movimiento y visuales cercanos al anime, y Wan 2.6 para resultados cinematográficos de código abierto. Escribes el resumen una vez y eliges el motor en lugar de reconstruirlo en cinco cuentas diferentes.
La segunda es que la identidad y el movimiento siguen siendo separables. El Control de movimiento acepta un video de referencia de entre 3 y 30 segundos, aplica su movimiento a una imagen de personaje que subas y mantiene el movimiento completamente bajo el control del clip de referencia en lugar del prompt, con un campo de prompt opcional de hasta 2500 caracteres para los detalles del fondo y la escena. Esa es exactamente la instrucción que escribirías como "movimiento solo de la referencia de movimiento", excepto que la herramienta la impone en lugar de confiar en que la redacción se mantenga.
La tercera es que existe la opción de reparación. Las tomas largas fallan en lugares específicos en lugar de hacerlo de manera uniforme, y la diferencia entre un flujo de trabajo viable y uno frustrante es si un tramo malo de cuatro segundos te cuesta una corrección o una regeneración completa. Modificar video acepta un clip de entre 3 y 10 segundos con hasta cuatro imágenes de referencia de estilo, y el Escalado se encarga del paso de entrega final con resoluciones de destino de 720p, 1080p o 4K y velocidades de fotogramas de 15, 30, 45 o 60.
Ejemplos de prompts
1. La toma larga cinematográfica. Una fortaleza de montaña azotada por el viento bajo la luz de una tormenta en la hora dorada, estandartes negros ondeando contra el cielo. Comienza con una toma abierta, luego acércate lentamente a medida que se despliega un mapa sobre una mesa de guerra iluminada por velas. Una reina de cabello plateado vestida de terciopelo negro se encuentra ante sus asesores en un salón iluminado por antorchas mientras un ejército se mueve entre la niebla abajo. Solo movimientos de cámara lentos y deliberados, sin barridos rápidos. El audio es de tambores bajos, viento y un crescendo de orquesta que llega tarde. Un arco narrativo continuo. (Se enruta mejor a través de Wan 3.0) Prueba este prompt en del guion al video de Atlabs
2. El clip instructivo planificado. Un mecánico centra una rueda de bicicleta en un pequeño taller iluminado por el sol. Etapa uno: la rueda doblada descansa sobre el banco junto a un soporte de centrado vacío, y él la levanta para colocarla en su lugar, terminando con la rueda en posición vertical y el banco despejado. Etapa dos: la rueda gira mientras él aprieta los radios, terminando con la rueda centrada y la llave todavía en su mano derecha. Etapa tres: la levanta y la cuelga en el gancho de la pared, terminando con el soporte vacío. Mantén consistentes la ropa, la distribución del taller y la luz de la tarde que entra por la ventana en todo momento. El audio es de clics de la llave de radios, el giro de la rueda y el ambiente tranquilo del taller. Una toma continua. (Se enruta mejor a través de Wan 3.0) Prueba este prompt en del guion al video de Atlabs
3. El giro de producto estrella. Una tetera de acero cepillado sobre una superficie limpia y reflectante bajo una suave luz clave desde la izquierda de la pantalla. Rotación lenta de 360 grados con el logotipo legible durante todo el giro, terminando en una composición principal orientada hacia el frente. Solo un tono de sala ambiental sutil, sin música, sin superposiciones de texto, sin accesorios adicionales. La forma del producto, el acabado y la posición del logotipo se conservan exactamente. (Se enruta mejor a través de Wan 3.0) Prueba este prompt en anuncios de producto estilo UGC de Atlabs
4. El paseo con referencia bloqueada. Una mujer con un abrigo largo gris cruza una plaza al atardecer, la piedra mojada refleja la última luz. Toma de seguimiento lenta desde el lateral a la altura de los ojos, una cálida luz de contorno incide en su hombro, mira hacia la cámara una vez y luego continúa sin romper el paso. El movimiento proviene completamente del clip de referencia, el fondo y la iluminación del prompt. Identidad, rostro y ropa bloqueados. Un zumbido bajo de la ciudad y pasos suaves, sin música. Prueba este prompt en el Control de movimiento de Atlabs
5. La promo estilizada. Animación pura en 2D cel en una paleta fría de azul océano profundo, cobalto, cian y blanco puro con sombreado de bordes duros. Una protagonista con cabello negro hasta los hombros y una espada de gran tamaño camina de perfil mientras una ciudad de tuberías y rejillas se desliza detrás de ella. Máscaras geométricas e inversiones llevan a cabo las transiciones, resolviéndose en una amplia composición gráfica. Efectos nítidos y una partitura de tensión, sin diálogo. Una toma estilizada ininterrumpida. (Se enruta mejor a través de Seedance 2.0) Prueba este prompt en del guion al video de Atlabs
6. La reparación dirigida por referencia. Toma el clip subido como @Video1 y mantén exactamente el encuadre y el movimiento de cámara existentes. Cambia el color a una paleta más fría con sombras más frías y una clave más cálida en el rostro, coincidiendo con las cuatro referencias de estilo adjuntas. Preserva el rostro, el cabello y el vestuario del personaje sin alteraciones. Sin texto añadido, sin figuras adicionales, sin cambios en el movimiento. Prueba este prompt en Modificar video de Atlabs
Consejos profesionales
Ordena el prompt de la forma en que el modelo planifica. Toma, luego sujeto, luego luz, luego acción, luego audio. Debido a que Wan 3.0 razona sobre la composición antes de renderizar, lo primero que pongas es lo que se fijará primero. Un resumen que comienza con el estado de ánimo y llega al tipo de toma cuatro frases más tarde se planifica en torno al estado de ánimo.
Dale a cada referencia una tarea y di para qué no sirve. El mensajero de la referencia de personaje, el callejón de la referencia de ubicación, el movimiento solo de la referencia de movimiento. Las referencias limpias, de un solo sujeto y bien iluminadas superan con creces a los collages ruidosos, y la exclusión hace tanto trabajo como la instrucción, ya que una referencia de ubicación no calificada te prestará tanto su vestuario como sus paredes.
Olvídate de las etiquetas antiguas. Cadenas como 8k, obra maestra y tendencia eran trucos de prompts para una generación anterior de modelos y ahora compiten con una dirección clara en lugar de sumarse a ella. Una frase de instrucción específica de cámara y luz supera a un párrafo de etiquetas de calidad.
Preguntas frecuentes
¿Está disponible Wan 3.0 en Atlabs? Sí. Funciona dentro de los mismos flujos de trabajo que el resto de la gama, por lo que puedes crear un resumen en del guion al video y enrutar la generación a Wan 3.0 sin configurar una cuenta separada.
¿Qué longitud puede tener un clip de Wan 3.0? Aproximadamente 30 segundos en una sola pasada con audio nativo, a una resolución de 1080p lista para entrega. Algunas interfaces te permiten solicitar una duración o dejarla en modo adaptativo para que el modelo elija en función del prompt y las referencias.
¿Cuántas referencias puedo usar? Alrededor de diez imágenes junto con clips, audio y, en algunos casos, documentos. Etiqueta cada una en el prompt según la función que desempeñe, ya que los recursos no etiquetados siguen influyendo en el resultado de formas que no especificaste.
¿Cuál es la forma más rápida de mejorar un prompt largo? Añade etapas con estados finales observables. Nombrar lo que es real al final de cada segmento le da al modelo puntos de control sobre los cuales planificar, lo que soluciona problemas de ritmo que ninguna cantidad de descripción adicional solucionará.
¿Debería usar Wan 3.0 o Wan 2.6? Elige Wan 3.0 cuando la toma sea larga, cuando las referencias deban permanecer fijas durante toda la duración o cuando desees que el sonido se genere junto con la imagen. Wan 2.6 sigue siendo una opción sólida de código abierto para clips cinematográficos más cortos donde no se aplican esas limitaciones.
¿Qué modelo debería elegir para otros aspectos? Kling 3.0 para movimiento cinematográfico y transiciones suaves, Google Veo 3.1 para fotorrealismo y tomas de establecimiento, Seedance 2.0 para trabajos de personajes estilizados y anime, y Hailuo 2.3 para alto movimiento. El flujo de trabajo sigue siendo el mismo, solo cambia el motor detrás de él.
Veredicto final
La creación de prompts para tomas largas premia la planificación sobre la descripción. Empieza con el sujeto, el movimiento y la cámara para que la composición se fije primero. Divide la toma en etapas con estados finales a los que el modelo pueda aspirar. Nombra un movimiento de cámara en lugar de tres. Dirige el audio al mismo tiempo que la imagen. Dile a cada referencia exactamente qué controla.
Esos hábitos sobrevivirán al próximo modelo que se lance, por lo que vale la pena desarrollarlos ahora. Lo que no se transfiere tan fácilmente es todo lo que rodea al prompt: la lista de tomas, el reparto, la relación de aspecto, la elección del modelo y el paso de reparación cuando un tramo sale mal. Del guion al video proporciona la estructura, los anuncios de producto estilo UGC se encargan del trabajo con el objeto principal, el Control de movimiento mantiene el movimiento bajo el control de la referencia y Modificar video soluciona lo que necesita arreglarse sin enviarte de vuelta al principio, con Wan 3.0 disponible detrás de todos ellos.










