Generar videos con Veo 3 y HeyGen para tu marca

AgentesNexo
··6 min lectura

Por que Veo 3 y HeyGen cambian la produccion de video para empresas

Si tu equipo de marketing produce un video al mes porque el proceso toma semanas, hay una forma mas eficiente. Combinando Veo 3 de Google para b-roll generativo y HeyGen para presentadores IA, una empresa puede producir contenido de video estructurado en horas, con consistencia de marca y sin contratar produccion externa.

Esta guia esta dirigida a equipos de marketing de empresas medianas en LATAM que quieren escalar su agente video IA sin escalar costos de produccion.

Requisitos previos

  • Cuenta en Google AI Studio o acceso a Vertex AI (plan con billing activo para Veo 3)
  • Cuenta en HeyGen (plan Creator o superior para acceso a API)
  • Brief de marca documentado: colores, tono, voz, productos clave
  • Script base por segmento (puede generarlo tu agente IA antes de producir)
  • Presupuesto estimado: $0.35 por segundo de Veo 3 + HeyGen desde $29/mes

1. Generar el script con un agente IA

Antes de llamar a cualquier API, necesitas un script estructurado por segmento. Un agente con el brief de tu marca puede producirlo automaticamente:

typescript
const scriptPrompt = #43a047">`
  Marca: ${brand.name}
  Producto: ${brand.product}
  Audiencia: ${brand.audience}
  Duracion objetivo: 60 segundos
  Tono: ${brand.tone}

  Genera un script con cuatro segmentos:
  - Hook (0-5s): gancho visual + audio
  - Problema (5-15s): tension que resuelve el producto
  - Solucion (15-40s): demostracion concreta
  - CTA (40-60s): llamada a la accion especifica

  Por cada segmento incluye:
  [TEXTO_PRESENTADORA] y [PROMPT_VISUAL_VEO]
`;

El agente devuelve el script completo con los prompts listos para Veo 3 y el texto para el avatar HeyGen. Este paso elimina el ida y vuelta con una agencia y la reunion de briefing.

2. Generar b-roll con Veo 3

Veo 3 esta disponible en Google AI Studio y en Vertex AI para produccion. Genera clips de hasta 8 segundos a 1080p. Para automatizacion, la via es la API de Vertex AI:

bash
curl -X POST \
  #43a047">"https://us-central1-aiplatform.googleapis.com/v1/projects/${PROJECT_ID}/locations/us-central1/publishers/google/models/veo-3.0-generate-preview:generateVideo" \
  -H #43a047">"Authorization: Bearer $(gcloud auth print-access-token)" \
  -H #43a047">"Content-Type: application/json" \
  -d '{
    #43a047">"instances": [{
      #43a047">"prompt": "Latin american professional reviewing analytics dashboard, modern office, natural light, cinematic 4K, no text, no watermark",
      #43a047">"parameters": {
        #43a047">"aspectRatio": "16:9",
        #43a047">"sampleCount": 1,
        #43a047">"durationSeconds": 8,
        #43a047">"fps": 24
      }
    }]
  }'

Tips de prompt que funcionan en produccion:

  • Prompts de 15 a 20 palabras dan mejores resultados que prompts de 50
  • Siempre cerrar con "no text, no watermark"
  • Para contexto LATAM: "latin american setting" o "hispanic professional" da resultados mas relevantes que prompts genericos
  • Generar 2 variantes del mismo prompt y seleccionar la mejor: el costo extra es minimo

El agente puede generar todos los clips en paralelo y reducir el tiempo total de produccion de 30 a 12 minutos.

3. Crear el presentador IA con HeyGen

HeyGen permite crear un avatar a partir de una grabacion de 2 minutos, o usar uno de sus avatares publicos. Para consistencia de imagen de marca, el avatar propio es la opcion correcta: se crea una vez y se reutiliza en todos los videos.

bash
curl -X POST https://api.heygen.com/v2/video/generate \
  -H #43a047">"X-Api-Key: ${HEYGEN_API_KEY}" \
  -H #43a047">"Content-Type: application/json" \
  -d '{
    #43a047">"video_inputs": [{
      #43a047">"character": {
        #43a047">"type": "avatar",
        #43a047">"avatar_id": "TU_AVATAR_ID",
        #43a047">"avatar_style": "normal"
      },
      #43a047">"voice": {
        #43a047">"type": "text",
        #43a047">"input_text": "Tu empresa maneja 200 procesos manuales. Nosotros los automatizamos en 30 dias.",
        #43a047">"voice_id": "TU_VOICE_ID",
        #43a047">"speed": 1.0
      }
    }],
    #43a047">"dimension": {"width": 1920, "height": 1080},
    #43a047">"aspect_ratio": "16:9"
  }'

La API devuelve un video_id. Haces polling con GET /v1/video_status.get?video_id={id} cada 30 segundos hasta que el estado sea "completed".

4. Ensamblar el video final con ffmpeg

Con los clips de Veo 3 y el video de HeyGen listos, el ensamblado es programatico:

bash
# clips.txt define el orden de los segmentos:
# file 'broll_hook.mp4'
# file 'avatar_problema.mp4'
# file 'broll_solucion.mp4'
# file 'avatar_cta.mp4'

ffmpeg -f concat -safe 0 -i clips.txt \
  -c:v libx264 -crf 18 -preset slow \
  -c:a aac -b:a 192k \
  output_final_1080p.mp4

El proceso completo desde script hasta video listo tarda entre 15 y 35 minutos corriendo en un agente de contenido desatendido.

Arquitectura del sistema

Agente de contenido (cron semanal)
          |
   Script segmentado (JSON)
          |
    +-----+------+
    |             |
Prompts Veo   Texto HeyGen
    |             |
 Clips .mp4   Avatar .mp4
    |             |
    +-----+------+
          |
       ffmpeg
          |
   Video final 1080p
          |
   Upload automatico
   YouTube / Instagram / LinkedIn

Con esta arquitectura, un agente de contenido puede producir 4 a 8 videos por semana sin intervencion humana en produccion.

Lo que aprendimos implementando esto

  1. El prompt de Veo es critico: demasiado detalle empeora el resultado. Prompts de 15 a 20 palabras con tipo de plano, iluminacion y movimiento de camara funcionan mejor que descripciones largas.
  1. Avatar propio vs publico: los avatares publicos de HeyGen aparecen en cientos de canales. Si tu competencia usa el mismo, el video pierde credibilidad. Una grabacion de 2 minutos crea un avatar propio en 24 horas.
  1. El script es el bottleneck real: con un script estructurado, la produccion es totalmente automatizable. Sin el, cada video requiere supervision manual.
  1. Paralelizar las llamadas a la API: Veo tarda entre 3 y 8 minutos por clip. Si el agente genera los clips en paralelo en vez de en secuencia, el tiempo total baja de 35 a 15 minutos.
  1. Costo real en produccion: un video de 60 segundos con 5 clips Veo de 8 segundos mas un segmento de avatar HeyGen cuesta entre 3 y 6 USD en APIs. A 20 videos al mes, menos de 120 USD frente a mas de 2,000 USD en produccion externa.

En resumen

  • Veo 3 genera b-roll de alta calidad desde prompts de texto; usa Vertex AI para automatizar la generacion
  • HeyGen crea presentadores IA con tu voz y cara a partir de una grabacion de 2 minutos
  • El script estructurado por segmento es la pieza mas critica: el agente lo genera antes de llamar a cualquier API de video
  • ffmpeg ensambla los clips en video final de forma programatica sin intervencion humana
  • Costo estimado: 3 a 6 USD por video frente a 2,000 USD o mas en produccion tradicional
  • Un agente con esta arquitectura puede producir 4 a 8 videos semanales de forma autonoma

Si quieres implementar esto en tu negocio sin construirlo desde cero, en AgentesNexo lo hacemos por ti. Escribenos en agentesnexo.com o por WhatsApp al +591 67564218

Articulos relacionados