El prompt que produce una postal en lugar de una escena
Escribes: un viajero cruza una cresta del desierto al atardecer, cinematográfico, hermosa iluminación. Lo que recibes es técnicamente correcto y completamente inerte. Está en la cresta. La luz es cálida. No pasa nada durante doce segundos, y cualquier sonido que llega fue elegido por el modelo en lugar de por ti.
El prompt no estaba mal. Era el pie de foto de una fotografía entregado a un sistema que genera tiempo. MiniMax H3, también escrito Hailuo 3 o simplemente H3, produce clips de hasta 15 segundos con audio estéreo nativo, y cada uno de esos segundos es algo que diriges o a lo que te rindes. H3 ya está disponible en Atlabs, lo que significa que la solución está disponible en el mismo lugar que el modelo.
Por qué la dirección temporal importa más que la descripción
El hábito que la mayoría de los creadores traen a H3 se formó en los modelos de imágenes, donde un prompt es una lista de cualidades y el resultado es un momento congelado. Añadir adjetivos al prompt de una imagen realmente lo mejora. Añadir adjetivos al prompt de un video produce principalmente una versión más hermosa de la nada sucediendo.
El video necesita tres cosas que la descripción no puede proporcionar. Necesita cambios a lo largo del tiempo, lo que significa nombrar qué es diferente en el segundo doce respecto al segundo dos. Necesita el comportamiento de la cámara, porque un encuadre que no se mueve se lee como una cámara de seguridad fija a menos que indiques lo contrario, y un encuadre que se mueve sin instrucciones se mueve como el modelo prefiera. Y necesita sonido, porque H3 genera audio estéreo nativo en la misma pasada, lo hayas pedido o no, por lo que una banda sonora no especificada no es silencio, es una banda sonora que otra persona eligió.
El manejo de referencias sigue la misma lógica. H3 acepta múltiples imágenes, comúnmente hasta unas nueve, además de referencias limitadas de video y audio según la interfaz. El número importa mucho menos que la asignación. Una referencia sin una tarea definida sigue influyendo en el resultado, simplemente influye en lo que el modelo decida que debe influir, que es donde realmente comienzan la mayoría de las quejas sobre la pérdida de identidad. Di que la imagen uno fija el rostro y el vestuario, la imagen dos define solo la iluminación, y la pérdida de identidad dejará de ser misteriosa.
El flujo de trabajo de Atlabs para esto

El flujo de trabajo que mejor se adapta a la creación de prompts en H3 es del guion al video, porque convierte la disciplina en campos que rellenas en lugar de un párrafo que tienes que acordarte de estructurar correctamente.
del guion al video se ejecuta en tres pasos. El Paso 1 te ofrece dos modos de entrada: "Añade tu guion" para piezas dirigidas por narración y "Añade tu guion técnico" para trabajos estructurados. Pega cualquier cosa con formato de guion técnico y Atlabs mostrará "Guion técnico detectado", abriendo una vista dedicada donde el panel izquierdo muestra la voz del narrador analizada por IA, las ubicaciones y los actores, y el panel derecho divide la pieza en escenas con tipo de ubicación, ubicación y momento del día. Dentro de cada escena se encuentran las descripciones de cada TOMA individual y bloques de DIÁLOGO que contienen el nombre del personaje, la línea hablada y el tono de interpretación.
Esa lista de tomas es la versión en interfaz de los ritmos temporales. El panel del reparto es la versión en interfaz de un bloqueo de rol de referencia. Estás escribiendo el mismo informe de instrucciones, pero con la estructura impuesta en lugar de tener que recordarla.
Guía paso a paso
1. Escribe los ritmos antes de abrir nada. Decide qué cambia en cada etapa. Para un clip de 15 segundos, normalmente son tres bloques: de 0s a 5s, de 5s a 10s y de 10s a 15s. Una acción por bloque, un movimiento de cámara por bloque. Si un bloque contiene dos eventos no relacionados, divídelo o elimina uno. Los clips de H3 son cortos, y un ritmo fuerte supera sistemáticamente a tres apresurados.
2. Elige tu modo de entrada en el Paso 1. Usa "Añade tu guion" cuando la pieza esté dirigida por la narración y quieras que el selector de idioma y el botón de redactor de guiones con IA hagan el trabajo pesado. Usa "Añade tu guion técnico" cuando ya conozcas tus tomas. El panel de guiones sugeridos ofrece tres puntos de partida generados si editar te resulta más fácil que enfrentarte a un campo en blanco.
3. Crea el desglose de la escena. Define el tipo de ubicación como exterior o interior, luego la ubicación y el momento del día. Añade descripciones de TOMA en orden cronológico, una por ritmo, describiendo cada una como movimiento en lugar de composición. "Paneo lateral lento a la altura de la cintura, manteniendo el perfil" le da al modelo algo que ejecutar. "Hermosa toma cinematográfica" no le da nada. Añade bloques de DIÁLOGO donde los personajes hablen, completando el nombre del personaje, la línea y el tono de interpretación.
4. Define tu estilo en el Paso 2. La relación de aspecto ofrece 9:16 para TikTok e Instagram, 16:9 para YouTube y 1:1 para LinkedIn, Twitter, Facebook y Pinterest. El estilo de video ofrece Video de IA (recomendado), storyboard de IA y subir archivos para tus propios medios. Elige la relación antes de finalizar el encuadre, porque un arco lento que se ve bien en 16:9 se recorta en algo completamente diferente en 9:16.
5. Finaliza el reparto en el Paso 3. Los personajes extraídos de tu guion aparecen con la opción de hacer clic para editar, junto con una opción para añadir personaje y menús desplegables para el acento del país y la voz del narrador. Definir un personaje aquí hace el mismo trabajo que poner tu imagen de identidad al principio de un conjunto de referencias. El modelo obtiene una respuesta fija sobre quién es esta persona en lugar de improvisar una nueva en cada toma.
6. Genera, luego repara en lugar de reiniciar. Cuando un tramo falle, lleva el clip a Modificar video, súbelo, haz referencia a él como @Video1 en el prompt, describe el video final que deseas y adjunta hasta cuatro imágenes de referencia para guiar el estilo. Mantener audio original tiene un interruptor de encendido y apagado, por lo que arreglar la imagen no te costará el sonido con el que ya estabas conforme.
Por qué Atlabs funciona bien para esto
La primera razón es el enrutamiento de modelos. La disciplina del prompt se mantiene entre modelos, pero la estética no; y el modelo que maneja bien un primer plano de un personaje estilizado rara vez es el que maneja bien un plano general de un exterior costero. Atlabs ejecuta MiniMax H3 junto con Kling 3.0 y Kling 2.6 para movimiento cinematográfico y fluidez, Google Veo 3.1 para fotorrealismo y tomas de establecimiento, Seedance 2.0 para contenido estilizado, anime y primeros planos de personajes, Hailuo 2.3 para alto movimiento y visuales cercanos al anime, y Wan 2.6 para resultados cinematográficos de código abierto. Escribes la escena una vez y eliges el motor, en lugar de tener que reconstruir las mismas instrucciones en seis cuentas separadas.
La segunda es que el movimiento y la identidad se mantienen separables. El control de movimiento acepta un video de referencia de entre 3 y 30 segundos, aplica su movimiento a la imagen de un personaje que subas y mantiene el movimiento completamente bajo el control del clip de referencia en lugar del prompt, con un campo de prompt opcional para el fondo y los detalles de la escena. Esa es la misma instrucción que decirle a H3 que el video uno controla solo el movimiento, excepto que la herramienta lo impone en lugar de confiar en la redacción.
La tercera es que la estructura sobrevive al enfrentarse a una fecha límite. Una lista de tomas construida a partir de bloques de TOMA y DIÁLOGO no se desmoronará silenciosamente en un solo párrafo largo y corrido a las once de la noche, que es el modo de fallo que produce la mayoría de los prompts largos y decepcionantes. Para trabajos basados en la música, la misma lógica se encuentra en video musical, donde el paso de dirección creativa genera seis conceptos de escena a partir del tempo, estado de ánimo y género detectados en tu pista, cada uno con un título, descripción y etiquetas de estado de ánimo, para que los ritmos lleguen ya adaptados a la pista.
Ejemplos de prompts
1. Toma única cinematográfica. Un viajero solitario con un abrigo desgastado cruza una cresta del desierto azotada por el viento al atardecer, inclinándose contra el viento, con el abrigo y la bufanda ondeando detrás de él, arena fina levantándose alrededor de sus botas con cada paso. La cámara mantiene una toma de seguimiento lateral lenta a la altura de la cintura, manteniendo el perfil, en una sola toma continua. Retroiluminación cálida, sombras largas, gradación sutil en tonos verde azulado y naranja, grano de película sutil. Termina cuando se detiene y mira hacia una ciudad lejana. El audio es el rugido del viento, el flamear de la tela, el suave crujido de la arena, un zumbido bajo y lejano, sin diálogo. Sin subtítulos, sin marcas de agua, sin figuras adicionales. Prueba este prompt en Atlabs del guion al video
2. El video publicitario de producto estrella. Una botella de perfume naranja translúcida se encuentra sobre una roca negra húmeda durante la hora azul, con la condensación deslizándose por el vidrio. La cámara realiza un arco lento y pequeño en el sentido de las agujas del reloj mientras un estrecho haz de luz cálida se mueve a lo largo de la etiqueta, para luego asentarse en una composición frontal limpia y destacada del producto. Ambiente nocturno suave de la ciudad, sutil goteo de condensación, una nota baja y contenida de cuerdas que aumenta ligeramente en la estabilización final. Diseño exacto de la botella y la etiqueta preservados, sin superposiciones de texto, sin accesorios adicionales. Prueba este prompt en Atlabs anuncios de producto estilo UGC
3. La escena de dos personajes con tiempos definidos. Una acogedora panadería artesanal bajo la luz de la mañana. 0s a 5s: plano general de establecimiento, polvo de harina suspendido en la luz que entra por la ventana, bandejas enfriándose en los estantes. 5s a 10s: plano medio de dos personajes, una aprendiz dando forma a la masa mientras el mentor observa, con las manos de este entrando en el encuadre para corregir el agarre de ella. 10s a 15s: primer plano de la hogaza terminada mientras se gira hacia la cámara. Iluminación práctica cálida, profundidad de campo reducida. El audio es el zumbido del horno, el golpe de la masa, un sonido ambiente silencioso de la sala, una línea de diálogo pronunciada suavemente. Sin pérdida de identidad, sin subtítulos, sin personal adicional en el encuadre. Prueba este prompt en Atlabs del guion al video
4. La actuación adaptada al ritmo de la música. Una cantante con una chaqueta de satén rojo actúa en una azotea resbaladiza por la lluvia durante la hora azul, con letreros de neón difuminándose detrás de ella y la neblina de la ciudad captando la luz. La cámara gira lentamente durante la estrofa y luego corta de manera más enérgica en el estribillo, coincidiendo cada corte con el ritmo de la música. Profundidad de campo reducida, luces frías en contraste con tonos de piel cálidos, gradación cinematográfica. El audio es la pista de música más el viento ligero de la azotea, sin ambiente adicional que compita con la voz. (Se enruta mejor a través de Kling 3.0) Prueba este prompt en Atlabs video musical
5. La persecución cinética. Exactamente dos corredores en dos motocicletas a lo largo de una carretera costera húmeda al anochecer, con decoraciones en negro mate y amarillo señalización, sin otros vehículos en el encuadre. Velocidad de avance continua en todo momento: seguimiento trasero, luego paralelo lateral, y luego un final de ángulo bajo mientras la moto líder derrapa en la curva final. Salpicaduras de agua, chispas que saltan del estribo, peso real en la inclinación. El audio es la carga del motor, el siseo de los neumáticos sobre el asfalto mojado, el azote del viento, sin música. Sin interrupciones en cámara lenta, sin subtítulos, sin motoristas adicionales. (Se enruta mejor a través de Hailuo 2.3) Prueba este prompt en Atlabs del guion al video
6. La transferencia de movimiento. Un bailarín con una camisa de lino holgada actúa en una galería de hormigón vacía, con ventanas altas que proyectan rectángulos marcados de luz de la tarde sobre el suelo, polvo visible en los haces de luz. El movimiento proviene completamente del clip de referencia, el fondo y la iluminación del prompt. Encuadre estático amplio, sin movimiento de cámara, reverberación natural de la sala, sin música. Preserva exactamente el rostro, el cabello y la ropa del personaje. Prueba este prompt en Atlabs Control de Movimiento
Consejos profesionales
Dale a cada referencia una tarea y di para qué no sirve. La imagen uno fija el rostro y el vestuario. La imagen dos define solo la iluminación y el ambiente. El video uno controla solo el movimiento y los tiempos. La exclusión hace tanto trabajo como la instrucción, porque una referencia de iluminación sin especificar de buena gana también le prestará su vestuario a tu personaje.
Escribe el sonido en el mismo paso en que describes la imagen. Nombra el sonido ambiente, nombra cualquier efecto de acción, etiqueta el idioma de las líneas habladas y describe la música no diegética según la instrumentación y cómo se mueve a lo largo del clip. Si no quieres nada debajo de la escena, indica "solo sonido de producción" en lugar de dejar el campo vacío, porque estar vacío no es una petición que el modelo pueda cumplir.
Utiliza tus términos negativos donde realmente ocurre la pérdida de identidad. Sin pérdida de identidad, sin texto en pantalla, sin vibración de cámara, sin extremidades adicionales, sin marcas de agua. Enumerar las reglas de preservación de manera exhaustiva al final de un prompt te cuesta treinta segundos y te ahorra una regeneración, y funciona mejor que añadir otra frase descriptiva al principio.
Preguntas frecuentes
¿Está MiniMax H3 disponible en Atlabs? Sí. Funciona dentro de los mismos flujos de trabajo que el resto de la gama, por lo que puedes crear una escena en del guion al video o video musical y dirigir la generación a H3 sin necesidad de configurar una cuenta separada.
¿Qué longitud puede tener un clip de MiniMax H3? Normalmente de 4 a 15 segundos con audio estéreo nativo incluido en la generación. Planifica tus ritmos en función de ese límite en lugar de intentar comprimir un minuto de historia en él.
¿Cuántas referencias puedo usar? Múltiples imágenes, comúnmente hasta unas nueve, además de referencias limitadas de video y audio según la interfaz. Asigna un rol a cada una en el prompt, ya que las referencias no asignadas siguen influyendo en el resultado de formas que no elegiste.
¿Cuál es el mejor punto de partida para un principiante? De texto a video con una acción clara, un movimiento de cámara explícito y una descripción básica de sonido. Consigue que eso funcione de forma fiable primero, luego añade ritmos temporales y, después, añade las referencias. Añadir las tres cosas a la vez hace imposible saber qué cambio ha ayudado.
¿Puedo arreglar parte de un clip sin volver a generarlo por completo? Sí. Modificar video toma un clip existente de entre 3 y 10 segundos, referenciado como @Video1 en tu prompt, junto con una descripción del video final y hasta cuatro imágenes de referencia para el estilo. Mantener audio original puede permanecer activado para que el arreglo de la imagen no te cueste el sonido.
Veredicto final
H3 recompensa un informe de producción por encima de una descripción. Decide qué cambia y cuándo, nombra el movimiento de cámara en lugar del estado de ánimo, dirige el audio en lugar de aceptar lo que llegue y dile a cada referencia exactamente qué controla. Esos cuatro hábitos se mantendrán para cualquier modelo que se lance a continuación, por lo que vale la pena desarrollarlos ahora.
Lo que no se transfiere tan fácilmente es todo lo que rodea al prompt: la lista de tomas, el reparto, la relación de aspecto, la elección del modelo y el paso de reparación cuando un tramo sale mal. del guion al video te da la estructura, video musical te da la versión adaptada a la pista de música, anuncios de producto estilo UGC maneja el trabajo con el producto estrella y Control de Movimiento mantiene el movimiento bajo el control de la referencia en lugar del prompt.










