Te llevas esto: un mapa mental claro de qué hace cada herramienta de IA — para que dejes de ahogarte con el «¿cuál uso?».
Las cuatro capas del stack de vídeo IA y las herramientas de cada una: imagen, movimiento, voz y montaje.
La mayoría abre Twitter, ve cinco herramientas nuevas de «vídeo IA» a la semana y se bloquea. Aquí va la cura: el vídeo IA es un stack, no una herramienta. No eliges una. Eliges una de cada capa y las encajas como piezas de Lego.
Las 4 capas
Imagen (el fotograma) — Nanobanana PRO, Midjourney v7, Flux. Generas la imagen fija que quieres dar vida. Piénsalo como el casting y el diseño del decorado.
Movimiento (el plano) — Kling 2.5, Higgsfield, Runway Gen-3, Luma Ray 2, Veo 3. Le metes la imagen fija (o un prompt) y le pides un plano en movimiento de 5 a 10 segundos. Aquí es donde vive casi todo el «wow».
Voz (la voz en off) — ElevenLabs (clona tu voz o coge una de catálogo), PlayHT, Suno para camas musicales. Esto es lo que hace que un vídeo sin cara parezca hecho por una persona.
Montaje (el corte) — CapCut (gratis y rápido), Descript (montas editando la transcripción), Submagic (subtítulos automáticos + b-roll), y Claude Code como tu montador por script (de eso va la lección de dentro de dos).
Para qué sirve de verdad cada una
Nanobanana PRO — el caballo de batalla para imágenes fijas limpias de producto o personaje, con estilo consistente. Barata por imagen. Perfecta para el primer fotograma de un plano de Kling.
Midjourney v7 — el look más cinematográfico nada más sacarla de la caja, pero cuesta más controlar objetos o texto concretos. Úsala para moodboards y planos estrella.
Kling 2.5 — ahora mismo, el mejor realismo de movimiento por euro y segundo. Muy bueno con personas, telas y agua.
Higgsfield — la herramienta para movimientos de cámara. Dolly, grúa, órbita, whip-pan. Es la dueña de la capa de fotografía (siguiente lección).
Runway Gen-3 — el mejor pincel de movimiento e interpolación de fotogramas si necesitas control preciso sobre qué parte del plano se mueve.
ElevenLabs — clona tu voz con 60 segundos de audio y a partir de ahí «escribes» tus vídeos. La bomba nuclear del creador sin cara.
Mapa aproximado de costes (a ojo, 2026)
Un anuncio IA de 30 segundos: 3-5 imágenes fijas (~1 $) + 4-6 planos de movimiento (~3-8 $) + 30 s de voz (gratis-1 $) + 1 hora de montaje. ~10 $ de gasto en API y ~1 hora de reloj. Este es el cambio de unit economics: hace un año esto era un freelance de 2.000 $.
Lo que hacen mal los principiantes
Intentar hacerlo todo en una sola herramienta. Solo-Sora o solo-Kling queda genérico, porque los prompts de todo el mundo convergen. Encadena etapas.
Elegir la herramienta de moda en vez de la adecuada. Higgsfield para movimientos de cámara, Kling para movimiento humano, Runway para control quirúrgico. Usa cada una para lo que domina.
Saltarse la imagen fija. El modelo de movimiento solo puede animar lo que ve — una gran imagen fija es un gran plano.
Fuente: Claude Code Club · Aula · Etapa 8 «AI Video Mastery» — lección «🧰 The 2026 AI Video Stack (Pick Your Lego Bricks)». Nota: los precios son estimaciones del autor en 2026, tómalos como orden de magnitud. · Añadido al cuaderno: 27 de julio de 2026. Traducción al español para estudio personal.