Las herramientas exactas, cuánto cuesta hacer un vídeo con IA, el coste real en créditos y la plantilla de prompt con la que se hizo GTA España.
📅 Actualizado: agosto 2026 · ⏱️ Lectura aproximada: 10 minutos
Los precios de las herramientas de IA cambian cada pocas semanas. Los datos de esta guía están verificados a fecha de agosto de 2026 con las fuentes oficiales enlazadas al final. Si lees esto meses después, comprueba los números antes de contratar nada.
Respuesta corta
Para hacer un vídeo estilo GTA con IA necesitas una sola cosa: el modelo Seedance 2.5, al que puedes acceder desde tres sitios distintos (Magnific o Dreamina/CapCut, Higgsfield ). Generas los clips ahí y los montas en CapCut.
Tiempo real: 3-5 horas para un minuto acabado. Coste real: entre 80 $ y 130 $ en créditos, porque vas a generar 4 o 5 veces más material del que se ve en pantalla.
Y el truco que casi nadie conoce: no le pides a la IA un videojuego. Le pides todo lo contrario. Lo explico en la sección 4.
- Respuesta corta
- Qué vas a conseguir
- De qué vídeo estamos hablando
- 1. Lo que cuesta de verdad un vídeo así
- Comparativa de las tres plataformas
- La cuenta real del vídeo de un minuto
- 2. La receta en una pantalla
- 3. Por qué Seedance 2.5 y no otro modelo
- 4. El truco que nadie te cuenta: pide LIVE ACTION, no videojuego
- 5. La regla nº 1: acepta 50 referencias, tú usa 1
- Ojo: prompt largo no es lo mismo que prompt sobrecargado
- 6. La plantilla de los 7 bloques
- 7. Ejemplo práctico: una misión de principio a fin
- 8. Los 4 errores que te queman créditos
- 9. Por qué el vídeo funcionó (esto ya no va de herramientas)
- Errores frecuentes
- Preguntas frecuentes
- ¿Se puede hacer gratis?
- ¿El prompt tiene que estar en inglés?
- ¿Cuál de las tres plataformas elijo?
- No me aparece Seedance en CapCut, ¿qué hago?
- ¿Cuánto se tarda de verdad?
- ¿Puedo usar mi propia cara?
- ¿Puedo usar la marca GTA?
- ¿Por qué mis vídeos se ven falsos?
- ¿Esto sirve para mi negocio o es solo para hacer gracias?
- De hacer un vídeo a que te sirva para algo
- Sobre esta guía
- Sigue aprendiendo
Qué vas a conseguir
- Saber exactamente cuánto te va a costar antes de gastar el primer crédito
- El truco del prompt que hace que el vídeo parezca real y no un dibujo animado
- La plantilla de 7 bloques completa, lista para copiar y pegar
- La regla que más créditos ahorra (y que va justo al revés de lo que todo el mundo hace)
- Los 4 errores que convierten 20 $ en 120 $ sin que te des cuenta
De qué vídeo estamos hablando
Estos son los números reales de las dos partes:
Vídeo | TikTok | Instagram |
GTA España 1 | 375.000 | 247.000 |
GTA España 2 | 121.000 | 159.000 |
1. Lo que cuesta de verdad un vídeo así
Aquí está el dato que cambia la conversación. Un clip generado con Seedance 2.5 no es "casi gratis". Se paga por segundo generado, y tú vas a generar mucho más de lo que usas.
Comparativa de las tres plataformas
Precio orientativo de un clip de 8 segundos a 720p con Seedance 2.5:
Plataforma | Coste por clip 8s | Plan de entrada | Notas |
~2,55 $ | 49 $/mes · 1.000 créditos | El más barato por segundo | |
~3,52 $ | 20 $/mes · 20.000 créditos | Factura por bloques de 4s | |
Dreamina (CapCut) | ~3,57 $ | 19 $/mes · 1.575 créditos | Créditos diarios gratis para probar |
Fuentes: comparativa de precios de Seedance 2.5 y precios oficiales de Magnific, agosto 2026.
Ojo con Magnific: factura por bloques de 4 segundos. Un clip de 5 segundos te cuesta lo mismo que uno de 8. Si generas a 5 segundos, estás tirando 3 segundos pagados a la basura en cada intento.
La cuenta real del vídeo de un minuto
Esto es lo que salió en mi caso:
- 12-15 clips generados, de unos 20 segundos cada uno
- Eso son 240-300 segundos generados para 60 segundos que se ven
- A ~0,44 $/segundo en Magnific → entre 105 $ y 132 $
Ratio real: 4-5 segundos generados por cada segundo que acaba en el vídeo.
Ese número es el que tienes que interiorizar. No planifiques tu presupuesto por los segundos del vídeo final; planifícalo por los segundos que vas a generar. Si te dices "un minuto son 60 segundos, unos 26 $", te vas a quedar sin créditos a mitad y vas a acabar montando con tomas malas.
Regla de bolsillo: multiplica por 5 el minutaje final y multiplica eso por el precio por segundo de tu plataforma. Ése es tu presupuesto real.
2. La receta en una pantalla
Paso | Herramienta | Para qué |
1. Las misiones | Tu cabeza (o ChatGPT/Claude para pulir) | Decidir qué pasa en cada escena |
2. La foto del protagonista | Cualquier generador de imagen, o una foto tuya | Es la referencia que fija la cara en todos los clips |
3. Los clips | Seedance 2.5 vía Higgsfield, Magnific o Dreamina | Generar vídeo + audio + HUD de una vez |
4. El montaje | CapCut | Cortar, ordenar, ritmo |
5. Los textos | CapCut | Nombre de la misión, subtítulos, remate del HUD |
6. La portada | CapCut o Canva | El frame que decide si te ven |
No hace falta nada más. Ni editor profesional, ni herramienta de voz aparte: Seedance 2.5 genera audio estéreo sincronizado — ambiente, efectos y diálogo con lip-sync — dentro del propio clip (documentación de CapCut).
El minimapa y la barra de estado no se ponen en CapCut: se piden en el prompt. El modelo los dibuja encima del vídeo y salen integrados con la luz de la escena. En CapCut solo rematas el nombre de la misión y los subtítulos.
3. Por qué Seedance 2.5 y no otro modelo
Tres cosas concretas, no marketing:
- Genera hasta 30 segundos de una sola vez. Con modelos de 5-8 segundos tendrías que encadenar 8 clips por misión y reparar cada transición. Aquí una misión entera cabe en una generación.
- Trae el audio dentro. Diálogo, ambiente y efectos sincronizados, con lip-sync en español.
- Acepta hasta 50 referencias multimodales (imágenes, vídeo, música, guion). Y aquí viene el problema, que es la sección 5.
Si quieres el detalle técnico del modelo, lo tienes en la guía de Seedance y su prompt.
4. El truco que nadie te cuenta: pide LIVE ACTION, no videojuego
Éste es el hallazgo que hace que el vídeo funcione, y es completamente contraintuitivo.
Cuando quieres un vídeo estilo GTA, lo primero que se te ocurre es escribir "estilo GTA", "gráficos de videojuego", "render 3D", "estética de gameplay". Y ahí es donde se rompe. El modelo te devuelve algo que parece un dibujo animado regular: caras de plástico, movimientos raros, luz de motor gráfico. Ni es un videojuego bueno ni es real. Es el valle inquietante, y no lo comparte nadie.
Lo que funciona es lo contrario:
Pide cine de acción real, rodado con cámara, y añade el HUD encima.
En el prompt eso se escribe literalmente así:
Cinematic LIVE-ACTION footage, 16:9, shot on a digital cinema camera,
35mm lens: real actors, real skin texture, natural harsh midday light,
subtle film grain, handheld camera. This is a real action-comedy short
film — NOT animation, NOT CGI.Tres cosas están pasando ahí, y las tres importan:
- "LIVE-ACTION", "real actors", "real skin texture" empujan al modelo hacia su territorio fuerte: rodar personas. Ahí es donde mejor está entrenado.
- "NOT animation, NOT CGI" es un freno explícito. El modelo tiende a irse solo hacia lo generado; hay que decirle que no.
- "35mm lens", "film grain", "handheld camera" le dan lenguaje de rodaje real. "Handheld" es especialmente potente: el temblor de cámara es lo que hace que el cerebro lo lea como grabado y no como generado.
Y la estética de videojuego, ¿de dónde sale entonces? De dos elementos gráficos, nada más:
Minimal graphic overlay composited in post: a small semi-transparent
circular map bottom-left and a thin status bar top-right.
Nothing else on screen.Un minimapa abajo a la izquierda y una barra fina arriba a la derecha. Ya está. Con eso el cerebro del espectador dice "GTA" en menos de un segundo, y el resto del plano es cine real.
"Nothing else on screen" no sobra. Sin esa frase el modelo se anima y te llena la pantalla de iconos, números y marcadores inventados que quedan sucios.
5. La regla nº 1: acepta 50 referencias, tú usa 1
El error que más dinero me ha costado, y va justo al contrario de lo que hace todo el mundo.
Cuando ves que el modelo admite 50 referencias, la reacción natural es llenarlo todo: cuatro fotos del personaje desde distintos ángulos, un vídeo de estilo, una imagen del escenario, otra de la ropa. Y el resultado sale peor.
La razón, en cristiano: capacidad de referencia no es lo mismo que obediencia a la referencia. El modelo acepta 50 entradas, pero no las respeta todas por igual. Cuantas más le metes, más se reparte su atención y más probable es que ignore justo la que te importaba. Es un problema documentado por los propios usuarios del modelo (recopilación de valoraciones).
Una sola imagen de referencia del protagonista. Una. Y el parecido no lo sostiene la foto: lo sostiene que además describas al personaje con palabras en el propio prompt.
Protagonist reference image attached @img1 — keep face, hair and outfit
identical: athletic man late 20s, clean-shaven, light blue-grey eyes,
short light-brown fade swept back, white button-up shirt sleeves rolled,
navy slim trousers.Foto más descripción. Los dos a la vez. Con la foto sola, el personaje se te va cambiando de clip en clip; con la descripción sola, no se parece a nadie.
Ojo: prompt largo no es lo mismo que prompt sobrecargado
Aquí hay un matiz que confunde a mucha gente. El prompt que usé para GTA España tiene más de 250 palabras, y funciona perfectamente.
Lo que mata la generación no es la longitud. Es la redundancia y la contradicción: describir el mismo plano tres veces con palabras distintas, o pedir "plano cerrado" y luego "vista general de la calle". Si cada línea de tu prompt hace un trabajo distinto, puede ser larguísimo.
El test: lee tu prompt y pregúntate línea por línea "¿esto le dice algo nuevo al modelo?". Si la respuesta es no, bórrala.
Y limita el reparto: "No crowd — only the protagonist and four hooded men". El modelo falla más cuanta más gente hay interactuando, así que decir explícitamente cuánta gente aparece te ahorra tomas rotas.
6. La plantilla de los 7 bloques
Ésta es la plantilla completa, en el mismo orden en que la uso. Rellena lo que va entre corchetes y pégala tal cual.
Qué preparar antes: una foto de referencia del protagonista (una sola, buena luz) y la escena decidida en una frase.
Va en inglés a propósito. El modelo entiende mejor las instrucciones técnicas de cámara en inglés, pero el diálogo lo pones en español y lo dice en español. No es contradicción: son dos capas distintas.
Qué personalizar: solo lo que va entre corchetes. Los bloques 1, 2 y 4 se quedan casi tal cual en todos tus clips — son los que sostienen que la serie entera parezca la misma serie.
Cómo funcionan los tiempos: los tramos tienen que sumar la duración del clip que vas a generar. Un beat de acción normal aguanta 2-4 segundos; una escena de pelea necesita 5-7; un remate de diálogo, 3-4. Si un tramo te sale de más de 8 segundos, es que ahí hay dos beats disfrazados de uno.
Error habitual: escribir los beats sin marcar los tiempos. Sin (0-3s), (3-5s), el modelo reparte la duración como le parece, te acelera la parte buena y te alarga la aburrida. Los paréntesis con segundos son lo que te da el control del ritmo, y son lo primero que quita la gente porque parece un detalle. No lo es.
El bloque de audio del final no es decorativo. Esa cadena con flechas le marca al modelo la secuencia de sonidos, y es lo que hace que el audio esté sincronizado con la acción en vez de ser ambiente genérico de fondo.
Resultado esperado: un clip de 15-20 segundos con aspecto de rodaje real, HUD integrado, personaje estable y audio ya sincronizado. No va a ser perfecto a la primera. Con la plantilla limpia deberías acertar en 2-3 intentos en vez de en 8.
Paso de seguimiento: cuando un clip salga bien, guarda el mejor fotograma del protagonista y úsalo como @img1 del siguiente. La referencia mejora sola conforme avanzas.
7. Ejemplo práctico: una misión de principio a fin
Así se construye una misión completa, encadenando lo anterior:
- La idea en una frase. "Le intentan atracar y resulta que sabe pelear." Si la idea no cabe en una frase, no cabe en 18 segundos.
- Partirla en beats con tiempos. Cuatro: el atraco (0-3s), el esquive a cámara lenta (3-5s), la pelea (5-12s), el giro final (12-18s). Fíjate en el reparto: la pelea se lleva 7 segundos y el planteamiento solo 3. El tiempo va donde está el espectáculo.
- Elegir dónde va el chiste. El último beat es el que se comparte. En GTA España el remate no es la pelea: es lo que dice el policía después. La pelea es el pretexto.
- Generar con el test de los 10 $. Antes de lanzar la escena buena, genera una versión corta y barata. Si el protagonista y el encuadre salen bien, sube la duración. Si sale mal con poco, con mucho va a salir peor.
- Montaje en CapCut. El clip entero suele venir usable, pero casi siempre sobra medio segundo al principio y otro al final. Encima: nombre de la misión en el estilo del juego y subtítulos.
Total: 2-3 generaciones si sale bien, 6-8 si tienes un mal día. Entre 20 $ y 40 $ por una misión. Tres o cuatro misiones son tu vídeo de un minuto.
8. Los 4 errores que te queman créditos
Cada uno con lo que cuesta cometerlo:
- Pedir "estilo videojuego" en vez de live action. El resultado no es ni real ni videojuego, y no hay forma de arreglarlo en el montaje. Coste: el vídeo entero.
- Generar a 5 segundos en una plataforma que factura por bloques de 4. Pagas 8, usas 5. Coste: ~35% de todo tu presupuesto, en silencio.
- Meter varias imágenes de referencia. Más fotos, menos parecido. Coste: 3-5 generaciones fallidas por escena, a 10-18 $ cada una.
- Escribir los beats sin marcar los segundos. El modelo reparte el tiempo a su aire y te destroza el ritmo justo en la parte buena. Coste: repetir la escena entera.
9. Por qué el vídeo funcionó (esto ya no va de herramientas)
Aquí es donde se separa el que hace un vídeo bonito del que hace un vídeo que se ve.
El segundo 2 lo decide todo. En mis datos, un vídeo que retiene menos del 50% de la gente en el segundo 2 está muerto: Instagram lo reparte al principio, ve que la gente se va y deja de empujarlo. Por eso el primer beat de la plantilla arranca ya con la acción — el atraco empieza en el segundo 0, no hay plano de establecimiento ni logo.
Necesita un ancla. La gente no para el scroll por "un vídeo hecho con IA". Para por algo que ya reconoce: una ciudad que conoce, una situación que ha vivido, un formato que tiene en la cabeza. Si haces el mismo vídeo con una estética inventada, no lo ve nadie.
El chiste es lo único que no se copia. La plantilla la tienes ahí arriba, gratis. Lo que hace que un vídeo circule es qué misiones eliges y dónde pones el remate, y eso sale de conocer a tu gente, no de conocer el software.
Errores frecuentes
- Planificar el presupuesto por los segundos del vídeo final. Son 4-5 veces más. Es el error nº1 y el que más gente abandona a mitad.
- Buscar el prompt perfecto en vez de la escena simple. Un prompt mediocre sobre una acción clara gana siempre a un prompt brillante sobre una escena imposible.
- Generar en 4K desde el principio. Para redes sociales, 720p es más que suficiente y cuesta la mitad. Sube la resolución solo en la toma final si de verdad la necesitas.
- Copiar el formato en vez del método. Si haces "GTA España" otra vez, compites con un vídeo que ya tiene cientos de miles de visitas. Si haces el de tu ciudad, tu barrio o tu oficio, eres el primero.
Preguntas frecuentes
¿Se puede hacer gratis?
Probar sí, hacer un vídeo entero no. Dreamina y CapCut dan créditos diarios gratuitos con los que puedes generar algún clip suelto y ver si te gusta el resultado. Para un vídeo de un minuto necesitas plan de pago sí o sí. Las promociones cambian constantemente: mira la página oficial de Dreamina antes de fiarte de ninguna cifra.
¿El prompt tiene que estar en inglés?
Las instrucciones técnicas sí, el diálogo no. El modelo entiende mejor el vocabulario de cámara y de rodaje en inglés, pero el diálogo lo escribes en español entre comillas y lo interpreta en español con lip-sync. Añade Dialogue in Castilian Spanish para que no te salga con acento latino.
¿Cuál de las tres plataformas elijo?
Si vas a hacer un vídeo suelto para probar, Magnific o Dreamina, porque el plan de entrada es de unos 20 $. Si vas a producir varios vídeos al mes, Higgsfield sale más barato por segundo aunque el plan de entrada sea más caro. Haz la cuenta con tus minutos, no con el precio del plan.
No me aparece Seedance en CapCut, ¿qué hago?
La disponibilidad de las funciones de IA de CapCut ha ido cambiando por países. Si en tu cuenta no aparece, la vía alternativa es Dreamina, que es la plataforma de generación de la misma empresa, o cualquiera de las otras dos de la tabla. El modelo es el mismo.
¿Cuánto se tarda de verdad?
Entre 3 y 5 horas la primera vez, para un minuto. La generación en sí es rápida; lo que se lleva el tiempo es decidir las misiones, repetir tomas y el montaje. A partir del tercer vídeo baja bastante, porque ya reutilizas la plantilla y las referencias.
¿Puedo usar mi propia cara?
Sí, y funciona mejor que una cara generada. Pero solo tu cara o la de alguien que te haya dado permiso por escrito. Poner la cara de otra persona en un vídeo generado sin su autorización te mete en un problema legal y personal que no compensa por unas visitas.
¿Puedo usar la marca GTA?
Esto es una parodia con estética de videojuego, no un producto oficial ni afiliado a Rockstar Games. Para un vídeo satírico gratuito en redes no suele haber problema, pero no pongas el nombre de la marca en un producto de pago tuyo (un curso, una plantilla, un servicio) ni des a entender que hay relación con el juego original. Si vas a monetizar, consúltalo con alguien que sepa de propiedad intelectual.
¿Por qué mis vídeos se ven falsos?
Casi siempre por tres razones: pediste estética de videojuego en vez de live action (sección 4), hay demasiada gente interactuando en la escena, o el personaje cambia de cara entre planos porque metiste varias fotos de referencia. Los usuarios del modelo reportan que la consistencia de rostro ha mejorado pero las proporciones del cuerpo todavía bailan entre tomas. Planos cortos y poca gente por escena.
¿Esto sirve para mi negocio o es solo para hacer gracias?
Sirve, pero no como lo estás pensando. No se trata de hacer un anuncio con IA: se trata de que un vídeo que costó ~100 $ en créditos llegó a cientos de miles de personas sin publicidad. Lo caro no es producir. Lo caro es que nadie lo vea.
De hacer un vídeo a que te sirva para algo
Hay una diferencia grande entre saber usar una herramienta de IA y usarla para que entre dinero por la puerta. La mayoría de la gente que lea esta guía va a hacer un vídeo, le va a gustar, y ahí se va a quedar.
La parte que de verdad importa qué formato repites, cómo conviertes a quien te ve en alguien que te escribe, y qué haces con esa gente después no cabe en una guía.
El directo: te enseño el vídeo entero por dentro
Abro el proyecto y enseño el vídeo completo: las 15 generaciones (las buenas y las que tiré), cómo encadeno las misiones para que parezcan un solo vídeo, el montaje real y cómo decidí dónde iba el chiste.
Es gratis. [ REGISTRATE ]
El reto: haz el de tu ciudad o tu país con la plantilla de arriba y etiquétame. Los mejores los subo yo a mis redes.
No hagas otra vez GTA España: eso ya existe y compites contra un vídeo con cientos de miles de visitas. Haz el que solo puedes hacer tú.
Sobre esta guía
Escrita por Arti (IAEmpresa) a partir de la producción real de GTA España 1 y 2, en agosto de 2026. La plantilla es la que usé de verdad. Las cifras de coste son las de mis propias facturas de créditos; las de las otras plataformas están tomadas de sus páginas públicas en agosto de 2026.
Los precios y los límites de las herramientas de IA cambian cada pocas semanas. Si lees esto meses después, verifica los números en la fuente oficial antes de contratar nada.
Fuentes principales revisadas:
- Seedance 2.5 en CapCut — página oficial de la función
- Dreamina — Seedance 2.5, página oficial
- Magnific — precios oficiales
- Comparativa de coste por clip entre plataformas
- Especificaciones técnicas de Seedance 2.5
- Valoraciones y problemas reportados por usuarios
Sigue aprendiendo
- Seedance: guía y prompt — el detalle técnico del modelo
- Trend viral con IA gratis — otro formato viral, éste sin coste de créditos
- 7 IAs chinas gratis en español — alternativas gratuitas para imagen y vídeo
- IAs gratis vs IAs de pago — cuándo merece la pena pagar