Anuncios de vídeo con IA: de la idea al montaje final
Blog Automatizaciones

Anuncios de vídeo con IA: de la idea al montaje final

Cómo producir un anuncio entero con agentes de IA en Flova y Seedance, corrigiendo plano a plano, y dejarlo como skill para que lo lance tu agente.

Kilian Párraga
8 min de lectura

Generar un vídeo con IA ya no es el problema

Generar un vídeo con inteligencia artificial está resuelto. Lo hace cualquiera, con cualquier herramienta, en un minuto.

El problema es lo que pasa al día siguiente. Todo el contexto vivía dentro de una conversación: el producto, el tono, el gancho, lo que funcionó y lo que no. Cierras la pestaña y vuelves a empezar de cero. Y si además montaste el anuncio saltando entre cinco herramientas distintas, ni siquiera puedes reconstruir cómo lo hiciste.

En este artículo hago justo lo contrario: monto un anuncio real de principio a fin dentro de un proyecto que guarda el producto, la marca, el guion, los planos y las decisiones que fui tomando por el camino. Y cuando lo tengo funcionando, congelo todo ese método en una skill y se la entrego entera a mi agente.

Qué es Flova y por qué no es “otro generador de vídeo”

Flova AI no es una herramienta de generación de vídeo: es un espacio de trabajo con agentes de creación de vídeo. La diferencia está en tres cosas.

La primera, que gestiona por proyectos. El proyecto guarda los activos de la marca, el guion, los planos generados y las decisiones. Vuelves mañana y sigues donde lo dejaste, con la misma persona, el mismo logo y el mismo estilo.

La segunda, que es agéntica: no le sueltas un prompt y esperas un vídeo. Le dices lo que quieres, te hace una entrevista, te propone opciones, te enseña el guion gráfico y va avanzando contigo.

La tercera, que es multimodal: por debajo tiene varios modelos y eliges cuál usa para el vídeo y cuál para la música.

Para el anuncio de este artículo usé una marca de café y le puse Suno para la música.

Seedance 2.5: el modelo de vídeo por debajo

El modelo de vídeo es Seedance, de ByteDance. La versión 2.5 se presentó el 23 de junio de 2026 en la conferencia Volcano Engine FORCE, y lo que aporta frente a la generación anterior es exactamente lo que necesita un anuncio:

  • Hasta 30 segundos en una sola pasada, sin tener que coser trozos.
  • Hasta 50 activos de referencia multimodales — texto, imágenes, vídeos y audio.
  • Edición parcial de escena: revisar solo una parte de un plano manteniendo el resto.
  • Vídeo guiado por referencia (R2V): puedes darle entradas estructuradas como clips de croma, referencias de movimiento o modelos 3D sin texturizar para dirigir escenas complejas.

La edición parcial es la que cambia el flujo de trabajo, y ahora verás por qué.

Cómo se monta el anuncio, paso a paso

Cargar los activos de marca

Si tienes un producto que quieres anunciar, lo primero es ir a la biblioteca de recursos y subirlo. En mi caso, una bolsa de café. Ese activo se queda en el proyecto y todos los planos que se generen lo respetan.

Este paso es el que la mayoría se salta y luego se queja de que “la IA no respeta mi producto”.

El prompt es corto de verdad

El prompt que usé es breve y directo:

Un anuncio de café de especialidad con el ritual completo de un café de filtro, sin voz en off y sin diálogo, solo sonido ambiente.

Eso es todo. No hace falta una parrafada, porque el trabajo fino no va en el prompt: va en la skill y en la conversación posterior.

Elegir una skill

Aquí está la parte interesante. Flova trae skills precargadas y te deja crear las tuyas. Yo elegí una llamada one take commercial, que es la que le entrega al agente el criterio de cómo se rueda un anuncio de una sola toma.

La skill es, en la práctica, un prompt largo y bien construido que alguien ya afinó. Le asignas el activo — la bolsa de café —, eliges los modelos y le das a generar.

La entrevista: dónde se decide el vídeo

Lo primero que hace es cargar la skill (puedes abrirla y leer exactamente qué hace), preparar las especificaciones del vídeo y montar un guion gráfico con todos los planos.

Y entonces empieza lo agéntico de verdad: te pregunta. En mi caso quiso saber qué modo de producción prefería para encadenar los planos, con dos opciones y su coste:

  • Conexión por primer fotograma: más rápida y más económica.
  • Referencia del vídeo previo: más lenta y con mayor consumo de créditos.

Elegí la primera, que para este anuncio era más que suficiente.

Antes de generar un solo segundo de vídeo, genera los activos de imagen: la cocina, la persona que manipula el café. La bolsa no la genera porque se la di yo. Y te los enseña para que los valides.

Aquí hice algo que recomiendo: en vez de dejarle avanzar, le escribí “procede a darme el resumen de los vídeos que vas a hacer, dame el prompt y cuánto van a durar”. Con eso lees el plan entero antes de gastar un crédito.

Los errores que van a aparecer (y son parte del proceso)

Esto es lo que no te cuentan en las demos, y es la parte más útil del artículo.

Plano 2: anatomía. Aparecía un brazo por partida doble. Le escribí el error en lenguaje natural y regeneró el plano corregido en un par de minutos.

Planos 3 y 4: lógica. Se me escapó a la primera. El agua caía del filtro directamente a la taza, saltándose la jarra. Es un error de proceso, no visual: cualquiera que sepa cómo se hace un café de filtro lo ve. Se lo describí, y con una sola indicación corrigió los dos planos, porque afectaba a ambos.

En esa corrección tuvo que regenerar un elemento — cambiar la taza por un embudo — y también le salió mal a la primera. Se lo dije, lo rehízo, y a la segunda salió como quería.

Por qué esto es mejor que un vídeo de 30 segundos de una vez

Aquí está el valor real del enfoque agéntico. Va produciendo poco a poco y tú corriges sobre la marcha.

Compáralo con el modelo mental habitual: le pides un vídeo de 40 segundos, esperas, y descubres que en el segundo 20 hay un error. ¿Ahora qué? Vuelves a generar los 40 segundos y cruzas los dedos.

Con producción plano a plano, un error cuesta un plano. Y como puedes editar solo parte de una escena, ni siquiera siempre cuesta el plano entero.

Del proyecto a la skill: congelar el método

Cuando el anuncio quedó montado — con su música de Suno, su enlace entre la última escena y el sorbo final, y el logo de marca —, hice el paso que de verdad importa: convertirlo en una skill.

En el apartado de skills creas una nueva y vas rellenando las fases del método: planificación del proceso, análisis de medios, diseño del guion gráfico, generación de medios, redacción de prompts y edición de vídeo. Todo pensado para que actúe como ha actuado en este proyecto, correcciones incluidas.

Hay un asistente de optimización de skills que te ayuda a redactarla, o la vas afinando tú a medida que descubres qué funciona.

Y esto es lo que resuelve el problema del principio del artículo. La skill es tu método, guardado. Es la diferencia entre “una vez me salió un anuncio bueno” y “sé producir anuncios de esta marca con este criterio, y puedo repetirlo”.

Conectarlo con tu agente

El último paso es sacar todo esto de la web y ponerlo donde ya trabajas.

Flova tiene una CLI y genera una clave de API. El proceso es directo: le pasas a tu agente de Hermes la instrucción de conexión junto con la clave, le das las aprobaciones que te va pidiendo, y se conecta.

A partir de ahí, le pregunté si veía la skill que acababa de crear. Me la describió entera, con el detalle de lo que hace. Y le pedí que creara un proyecto nuevo llamado Hermes Project sin generar nada todavía — para comprobar que podía operar sin quemar créditos. Lo creó.

El resultado práctico: ya no tienes que entrar en Flova. Le describes a tu agente el vídeo que quieres, igual que se lo describirías a la plataforma, y él lleva la voz cantante.

Lo que se abre cuando el agente entra en la ecuación

Y aquí es donde deja de ser una herramienta de vídeo. Tu agente tiene el contexto de tu negocio: sabe qué producto estás promocionando, qué campaña está corriendo, qué funcionó el mes pasado. Cuando ese agente puede además producir el creativo, lo que estás montando no es “generación de vídeo”: es una parte del proceso de marketing que se ejecuta sin pasar por ti.

Si quieres entender el modelo de agente que hace esto posible, está en la guía definitiva de Hermes Agent.

Para quién tiene sentido esto de verdad

Siendo honesto, porque no es para todo el mundo:

  • Tiene mucho sentido si produces creatividades con frecuencia: e-commerce con catálogo, marcas que testean varios ganchos, agencias que necesitan volumen para campañas.
  • Tiene sentido si tienes un producto físico y quieres probar ángulos distintos antes de invertir en una producción de verdad.
  • Tiene menos sentido si haces un vídeo al año. Para eso, el tiempo de aprender el flujo no lo recuperas.
  • No sustituye una producción real cuando el vídeo es la pieza central de tu marca. Sustituye a la mitad de las piezas que hoy no produces porque no te compensa el coste.

Si lo que buscas es el escalón anterior — generar imágenes y vídeos sueltos de forma automatizada, sin todo el aparato de proyectos y skills —, lo tienes resuelto con imágenes y vídeos desde Telegram con n8n.

Una advertencia de precio: el coste de Seedance 2.5 aún no está publicado oficialmente, y todo apunta a que estará por encima de la generación anterior por la carga de cómputo que exige. Mide el consumo de créditos en tus primeras pruebas antes de planificar volumen.

Conclusión

Lo importante de este flujo no es que la IA genere vídeo bonito. Es que el método queda guardado: el proyecto conserva la marca y las decisiones, la skill conserva el criterio, y el agente conserva el contexto de tu negocio. Con eso, el segundo anuncio cuesta una fracción del primero, y el vigésimo lo lanza tu agente mientras tú haces otra cosa.

Ese es el patrón que aplicamos en ExpertBrain con cualquier proceso de un cliente: primero se hace bien a mano, después se convierte en método, y solo entonces se automatiza. Si quieres montarlo así en tu negocio, échale un vistazo a lo que hacemos en automatizaciones para empresas o hablemos directamente.

Tags: vídeo IAFlovaSeedanceHermesagentes IAmarketingautomatización
¿Te suena familiar?

Automatizamos cualquier proceso de tu empresa

Elegimos el stack que mejor se adapta a tu caso real: n8n, Make, Zapier, Python, serverless… Sin atarte a una sola herramienta.