En el tráfico de esquemas, los videos con “rostro” se utilizan para retener al usuario en el embudo y motivarlo a hacer un depósito. Trabajar con actores reales o diseñadores externos resulta costoso y ralentiza el lanzamiento, especialmente cuando se necesitan muchos materiales para diferentes enfoques. Las redes neuronales permiten resolver el tema de los creativos de forma independiente: el buyer puede generar personajes para cualquier tarea sin depender de terceros.

El uso de herramientas de IA reduce el coste de cada video a unos pocos centavos y acelera el lanzamiento de campañas. En este material analizamos métodos para crear deepfakes en tu propio hardware y en la nube, comparamos precios de herramientas y preparamos una guía paso a paso para animar fotos estáticas.

Métodos de generación: nube vs hardware local

La elección de la solución técnica depende de la escala del tráfico y del presupuesto inicial. En arbitraje se usan dos enfoques: montar tu propia “granja” para software pesado o utilizar recursos en la nube.

Software local (Faceswap, DeepFaceLab)

Esta opción es adecuada para equipos que trabajan con grandes volúmenes y planean generar cientos de materiales por semana. El requisito principal es contar con una tarjeta gráfica NVIDIA compatible con CUDA. Para un funcionamiento estable en 2026, se necesita un setup tipo RTX 3080 o RTX 4090 con al menos 12 GB de memoria de video.

La principal ventaja de este método es la total independencia. Utilizas código abierto, al que no le importa la temática de los videos. Aquí puedes poner cualquier texto sobre hackeos de algoritmos o estrategias de juego sin temor a bloqueos. 

Tras adquirir el hardware, el coste de cada video se vuelve nulo, pero la barrera de entrada para este tipo de producción parte de $1500–3000 por computadora. También hay que estar preparado para trabajar con la consola y configurar librerías de Python.

Servicios en la nube (HeyGen, Synthesia)

Las plataformas con avatares listos son ideales para crear videos de calentamiento y montar contenido UGC rápidamente. Para 2026, el plan Creator en HeyGen cuesta $29 al mes. El paquete incluye 200 créditos, lo que usando el modelo premium Avatar IV equivale a 10 minutos de video terminado. El coste por minuto dentro del límite es de $2.9, pero al escalar, el precio por minuto adicional sube a $5. El tema de las restricciones se resuelve creando avatares fotográficos personalizados a partir de tus propios materiales. Aunque las reglas oficiales prohíben usar rostros de personas públicas sin consentimiento, existen formas técnicas de saltarse estos filtros en la etapa de pruebas.

Дипфейк с Илоном Маском - GoAff
Fuente: Cómo crear creativos AI para cripto

Los servicios pueden bloquear cuentas por scripts agresivos, pero usando textos con formulaciones neutras, la nube sigue siendo una herramienta útil para el tráfico. La principal desventaja es el alto coste por minuto al escalar campañas.

Alquiler de GPU a través de RunPod

Comprar tu propio hardware para redes neuronales pesadas requiere una inversión de $2000–3000, lo que a menudo no es razonable en la etapa de pruebas. RunPod permite alquilar potencia al nivel de una RTX 4090 o H200 pagando solo por el tiempo real de uso de la tarjeta gráfica. Esto elimina la necesidad de comprar componentes y permite lanzar el render directamente desde el navegador.

La principal ventaja de este método es la total ausencia de censura. A diferencia de los servicios en la nube “white”, la combinación RunPod + ComfyUI permite usar codificadores NSFW. Esto da la posibilidad de incluir sin restricciones fajos de dinero, logotipos de casinos o interfaces de aplicaciones en los prompts. 

Дипфейки из спай-сервиса - GoAff
Fuente: Tyver.io 

El coste de producción de un video en Wan 2.1 con este enfoque es mínimo, y la flexibilidad del modelo permite renderizar movimientos y objetos complejos para tareas específicas en el embudo.

Limitaciones técnicas: preproducción y calidad

El resultado de la generación depende directamente de la calidad de los originales. Si se superpone la cara de un europeo sobre un video de una persona india o se usan fotos de baja resolución, la máscara quedará borrosa y desentonará con el resto de la imagen.

Selección de donantes y zona de reemplazo. El algoritmo no cambia toda la cabeza. La zona de reemplazo está limitada a la “máscara facial” desde las cejas hasta la barbilla y de oreja a oreja. Las orejas, el cabello, la forma del cráneo y el cuello permanecen del donante de video. Por eso, los personajes deben ser similares en tipo.

Al preparar los materiales es importante considerar raza, color de piel y complexión. La diferencia de tono entre la máscara y el cuello crea bordes marcados difíciles de corregir en la edición. Tampoco se puede combinar una cara ancha con una barbilla estrecha del donante sin distorsiones visuales y artefactos en las uniones.

Ángulos de giro y artefactos. Las redes neuronales que funcionan por transferencia de mímica (por ejemplo, LivePortrait) son sensibles a la posición de la cabeza. Lo óptimo es usar videos donde el personaje mire directamente a la cámara.

Дипфейки в рекламе - GoAff

Si en el original la persona gira de perfil, el algoritmo a menudo no reconoce los rasgos faciales, ya que no puede reconstruir las áreas ocultas. En estos casos, el deepfake comienza a “flotar” o a moverse de forma extraña. Un problema similar ocurre con la gesticulación: si la mano pasa frente al rostro, la máscara se cubre con los dedos y la imagen se distorsiona.

Postproducción en editores. El video tras pasar por la red neuronal suele verse demasiado suave, lo que delata su origen. Para que el creativo luzca natural, en los editores de video se añade un ligero grano para simular una grabación de móvil común y se realiza corrección de color, ajustando los tonos de la máscara al color del cuello y el fondo. Un leve desenfoque en los bordes del rostro superpuesto ayuda a que se integre mejor en la cabeza del donante y elimina el efecto de imagen pegada.

Economía del proceso: reemplazando al diseñador por IA

Pasar a la generación de creatividades mediante redes neuronales no es solo seguir una tendencia, sino una forma radical de reducir costos y eliminar la dependencia de proveedores. En el tráfico scheming, donde es necesario probar constantemente nuevas caras y enfoques, la IA se amortiza tras los primeros lanzamientos.

Reducción directa de costos. Actores y diseñadores son caros: una simple reseña en video en una plataforma o chat especializado cuesta entre $20 y $50. Si para un buen volumen necesitas 5–10 caras diferentes, solo el presupuesto para preparar materiales sube a $300–500.

Usar la combinación de LivePortrait + Replicate o software local reduce estos gastos a centavos. Generar un deepfake cuesta en promedio entre $0.01 y $0.1. Básicamente, por el precio de un pedido estándar obtienes cientos de videos únicos, lo que te permite escalar sin aumentar los gastos de producción.

Velocidad y trabajo en “tormenta”. El principal inconveniente del outsourcing es el tiempo de espera. Un diseñador o actor entrega el video terminado en el mejor de los casos en unas horas, pero normalmente solo al día siguiente.

La red neuronal entrega el resultado listo en 1–2 minutos. Esto es crucial en épocas de tormentas en Facebook, cuando las cuentas se banean una tras otra. La posibilidad de rehacer el creativo al instante con una nueva cara permite no detener el tráfico y mantener el ritmo. Ya no tienes que esperar a que tu diseñador esté libre, sino que gestionas el proceso tú mismo.

Solución al problema del desgaste. La audiencia en los esquemas se acostumbra rápidamente a los mismos personajes, lo que lleva a una caída del CTR. Si usas actores reales, su base simplemente se quema.

La IA permite crear decenas de personajes únicos para cada grupo de cuentas. Puedes generar una cara en Midjourney, adaptarla a un GEO específico (por ejemplo, hacer un experto árabe para tráfico en EAU o un latinoamericano para Brasil) y animar la foto en unos minutos. Esto permite probar nuevos enfoques cada día y no depender de si tienes videos originales frescos a mano.

Guía paso a paso para generar en Wan 2.1

Para crear creativos realistas usaremos el modelo Wan 2.1. Como requiere potencia que un portátil común no tiene, todo el proceso lo haremos en un servidor remoto.

Paso 1. Alquilar un servidor en RunPod

RunPod es un servicio donde puedes alquilar un ordenador potente con una tarjeta gráfica profesional. Así no necesitas comprar hardware por varios miles de dólares.

Para empezar, nos registramos en el sitio y desplegamos un nuevo contenedor. El modelo Wan 2.1 requiere mucha memoria de video, así que elegimos una tarjeta tipo RTX 5090 o H200.

Аренда сервера на RunPod - GoAff

En la configuración del disco (Volume Disk) ponemos 150 GB — este volumen es suficiente para todos los modelos y no pagarás de más por espacio extra. Haz clic en “Deploy” y espera a que el estado cambie a “Running”.

Настройки RunPod - GoAff

Paso 2. Subir los pesos a través de Jupyter Lab

Después de iniciar el servidor, necesitamos descargarle el “cerebro” de la red neuronal. Son archivos que contienen la información sobre cómo deben verse los objetos y sus movimientos. Sin ellos, el programa no funcionará.

Para esto, nos conectamos al servidor a través de “Connect” -> “Jupyter Lab” (este es tu espacio de trabajo en el navegador). 

Models RunPod - GoAff

En el menú de la izquierda buscamos la carpeta Models. Si está vacía, significa que el servidor aún se está descomprimiendo, espera un par de minutos. 

Проект в RunPod - GoAff

Abrimos la terminal y lanzamos la descarga de los pesos por enlaces directos:

Рабоат с RunPod - GoAff
1) cd /workspace/ComfyUI/models/diffusion_models/
wget https://huggingface.co/FX-FeiHou/wan2.2-Remix/resolve/main/NSFW/Wan2.2_Remix_NSFW_i2v_14b_high_lighting_v2.0.safetensors
2) cd /workspace/ComfyUI/models/diffusion_models/
wget https://huggingface.co/FX-FeiHou/wan2.2-Remix/resolve/main/NSFW/Wan2.2_Remix_NSFW_i2v_14b_low_lighting_v2.0.safetensors
3) cd /workspace/ComfyUI/models/text_encoders/
wget https://huggingface.co/NSFW-API/NSFW-Wan-UMT5-XXL/resolve/main/nsfw_wan_umt5-xxl_fp8_scaled.safetensors
4) cd /workspace/ComfyUI/models/vae/
wget https://huggingface.co/QuantStack/Wan2.2-I2V-A14B-GGUF/resolve/c3641726f909b3446b7eefe994bcf8779c842a06/VAE/Wan2.1_VAE.safetensors

Para ahorrar tiempo, abre los comandos en 2 o 3 pestañas de terminal diferentes al mismo tiempo. Los archivos finales deben aparecer en la carpeta models/diffusion_models.

Paso 3. Lanzar ComfyUI e importar el workflow

ComfyUI es una interfaz gráfica para gestionar la red neuronal. En vez de escribir código, aquí el trabajo se basa en bloques visuales (nodos) que se conectan entre sí con cables improvisados. Simplemente arrastras líneas desde la salida de un nodo a la entrada de otro, transfiriendo datos y construyendo la lógica de generación: desde la carga de los pesos del modelo hasta el render final del video.

Запуск ComfyUI - GoAff

En RunPod haz clic en «Connect» -> «HTTP Service Port 8188». Se abrirá un campo vacío. Para no montar el esquema manualmente, utiliza este workflow JSON listo. Es un archivo de configuración donde ya está definida toda la lógica de generación. Solo arrástralo a la ventana del navegador. 

Si los bloques se resaltan en rojo, significa que al programa le faltan nodos personalizados (plugins).

Haz clic en Manager -> Install Missing Custom Nodes, instala todo (incluido el interpolador para suavizar los fotogramas) y recarga la página.

Paso 4. Configuración técnica de los modelos 

Después de cargar el workflow, debes vincular los pesos descargados a los bloques correspondientes. En la parte izquierda de la interfaz, encuentra tres nodos de selección de modelos.

Настройка моделей генерации - GoAff

En el primer campo selecciona High Lighting, en el segundo Low Lighting. En el tercer bloque (Encoder) elige NSFW Encoder Wan 2.1. Esto es necesario para que el sistema no bloquee la generación por filtros y puedas trabajar sin restricciones.

Paso 5. Cargar fuentes y parámetros técnicos

En el esquema de trabajo, encuentra el bloque «Load Image» y sube la foto de tu personaje. 

Загрузка исходников и технические параметры - GoAff

La cara debe estar de frente y sin detalles innecesarios. Es mejor usar imágenes generadas en Midjourney o Flux, ya que tienen mayor nitidez.

En los bloques vecinos revisa los parámetros:

  • Resolución: para creatividades verticales, pon 720 por 1280;
  • Número de fotogramas: para que el video dure 30–40 segundos, pon un valor entre 630 y 840. Ten en cuenta que generar esta duración requiere una gran cantidad de memoria de video, por lo que son obligatorias tarjetas como H200 o RTX 5090. Si el hardware no lo soporta, es mejor generar videos en partes de 10 segundos y unirlas en un editor;
  • Modelos: en los nodos de selección de pesos, verificamos la presencia de archivos actuales y es obligatorio elegir NSFW Encoder para que el sistema no bloquee la generación por censura.

Paso 6. Prompting y obtención del resultado

En el campo Positive Prompt escribimos exactamente qué debe hacer el personaje. Describe los movimientos de la forma más concreta posible: «man smiling, holding a phone, counting dollar bills». Si necesitas varias acciones en un solo video, haz una división por tiempo: «0-2s: talking, 3-6s: pointing at screen».

Промптинг - GoAff

Para un video esquemático de 30 segundos, el prompt puede verse así:

«0-5s: A man looking at the camera, smiling and talking. 5-15s: He holds up a smartphone in his left hand, pointing at the screen with his right hand, showing a betting app with a growing balance. 15-25s: He takes out a stack of cash and starts counting dollar bills with a confident expression. 25-30s: He points his finger at the bottom of the screen with a call to action, smiling wide, high quality, realistic skin texture.»

Pulsamos Queue Prompt. El primer render siempre tarda más, ya que la tarjeta gráfica carga archivos de pesos pesados. 

En la ventana de vista previa aparecerán dos archivos. Para subir, siempre elegimos la versión procesada por el interpolador (30 FPS), ya que se ve como una grabación de video fluida y no como una animación. Si la máscara en la cara “se mueve”, simplemente cambia el valor de Seed y vuelve a generar.

Conclusión

El uso de redes neuronales es ante todo una oportunidad para reducir drásticamente los costos de producción. Ya no tiene sentido acudir al diseñador cada vez: la combinación Wan 2.1 + RunPod permite crear creatividades únicas para iGaming y Crypto por muy poco dinero. 

Todo el presupuesto que antes se destinaba a pagar materiales originales y correcciones interminables, ahora se puede invertir directamente en la compra de tráfico, lo que es mucho más lógico en la etapa de búsqueda de una combinación ganadora.