Agente de voz IA para atención al cliente: Retell AI vs Vapi

AgentesNexo
··6 min lectura

Para quién es esta guía y qué problema resuelve

Para implementar un agente de voz IA que atienda llamadas de clientes en español, necesitas tres componentes: una plataforma de orquestación (Retell AI o Vapi), un modelo LLM como motor de decisión, y un proveedor de síntesis de voz en español neutro.

La mayoría de los equipos en LATAM todavía atienden el primer contacto telefónico con personas. Es repetitivo: el 60% de las llamadas de soporte en empresas medianas corresponde a 5 tipos de consulta (estado de pedido, horarios, precios, disponibilidad, escaladas). Un agente de voz IA cubre ese 60% con latencia inferior a 1 segundo, disponibilidad 24/7 y registro automático en CRM.

Esta guía es para equipos de operaciones o TI que quieren implementar un agente de voz IA en su empresa sin construirlo desde cero.

Requisitos previos

  • Cuenta en Retell AI (retellai.com) o Vapi (vapi.ai) — ambas tienen free tier para desarrollo
  • Número de teléfono: las plataformas proveen uno o se usa Twilio/Vonage propio
  • Modelo LLM: GPT-4o, Claude Sonnet 4.5, o Gemini 2.0 Flash (latencia menor a 300ms recomendada)
  • Proveedor TTS en español: ElevenLabs, Azure Neural, o Deepgram Aura-2
  • Endpoint webhook para recibir eventos de llamada (Node.js, Python, o cualquier HTTP)

1. Retell AI vs Vapi: la comparación que importa

Característica Retell AI Vapi
Latencia media ~800ms ~1.1s
LLMs soportados OpenAI, Anthropic, Gemini OpenAI, Anthropic, Gemini, Ollama
Español LATAM Sí (Azure Neural / ElevenLabs) Sí (cualquier TTS)
Precio por minuto $0.07 todo incluido $0.05 + costo del proveedor
SDK oficial Node.js, Python Node.js, Python
Funciones nativas Transfer, booking, backchannel Transfer, tools custom, SIP troncal
Curva de inicio Baja — listo en 30 minutos Media — requiere más configuración

Retell AI es la opción más rápida para arrancar. Vapi es preferible cuando se necesita integrar con troncales SIP existentes o usar modelos locales con Ollama.

2. Configuración en Retell AI paso a paso

bash
npm install retell-sdk
typescript
import Retell from 'retell-sdk';

const retell = new Retell({ apiKey: process.env.RETELL_API_KEY });

// Crear el agente de voz IA para atención al cliente
const agent = await retell.agent.create({
  agent_name: 'Agente Soporte LATAM',
  voice_id: 'es-MX-DaliaNeural',     // Azure Neural — español México
  language: 'es-419',
  response_engine: {
    type: 'retell-llm',
    llm_id: 'claude-sonnet-4-5'      // o 'gpt-4o'
  },
  interruption_sensitivity: 0.8,
  enable_backchannel: true,
  backchannel_words: ['entiendo', 'claro', 'con gusto'],
  begin_message: 'Buen día, habla con Sofia. ¿En qué te ayudo?'
});

console.log('Agent ID:', agent.agent_id);

El prompt del sistema para voz debe ser breve. Las instrucciones largas aumentan la latencia y generan respuestas verbosas:

typescript
const systemPrompt = #43a047">`Eres Sofia, agente de atención al cliente de [Empresa].
Objetivo: resolver la consulta en menos de 3 minutos.
Reglas: respuestas de máximo 2 oraciones. Español neutro. Sin tecnicismos.
Si no puedes resolver en 2 intentos, usa la herramienta transfer_to_human.`;

3. Transferencia a agente humano y registro en CRM

La transferencia debe ser limpia: el agente resume el problema antes de pasar la llamada para que el humano no le pida al cliente que repita todo.

typescript
// Tool de transferencia registrada en Retell
const transferTool = {
  name: 'transfer_to_human',
  description: 'Escalar con agente humano si no se puede resolver',
  parameters: {
    type: 'object',
    properties: {
      reason: { type: 'string', description: 'Resumen del problema en 1 oración' },
      urgency: { type: 'string', enum: ['alta', 'normal'] }
    },
    required: ['reason']
  }
};

// Webhook para eventos post-llamada
app.post('/webhook/retell', async (req, res) => {
  const { event, call } = req.body;

  if (event === 'call_ended') {
    await crm.saveInteraction({
      phone:     call.from_number,
      duration:  Math.round(call.duration_ms / 1000),
      summary:   call.call_analysis?.call_summary,
      sentiment: call.call_analysis?.user_sentiment,  // 'positive' | 'negative' | 'neutral'
      resolved:  call.call_analysis?.call_successful
    });
  }
  res.sendStatus(200);
});

4. Alternativa: configuración en Vapi

Vapi es preferible si ya tienes un proveedor SIP o quieres usar ElevenLabs con una voz de marca propia:

typescript
import Vapi from '@vapi-ai/server-sdk';

const vapi = new Vapi({ token: process.env.VAPI_API_KEY });

const assistant = await vapi.assistants.create({
  name: 'Agente Voz LATAM',
  model: {
    provider: 'anthropic',
    model: 'claude-sonnet-4-5',
    messages: [{ role: 'system', content: systemPrompt }],
    tools: [transferTool]
  },
  voice: {
    provider: 'elevenlabs',
    voiceId: 'YOUR_CUSTOM_VOICE_ID',
    language: 'es'
  },
  transcriber: {
    provider: 'deepgram',
    model: 'nova-3',
    language: 'es-419'           // Español LATAM — mejor que es-ES para MX/CO/VE
  },
  silenceTimeoutSeconds: 30,
  backgroundSound: 'office'      // Reduce la ansiedad del silencio mientras procesa
});

Arquitectura del sistema

Las cuatro piezas que interactúan en cada llamada:

  1. Plataforma de voz (Retell/Vapi): recibe el audio, transcribe (ASR), envía texto al LLM, convierte la respuesta a voz (TTS) y gestiona el turno de conversación
  2. LLM (Claude / GPT-4o): decide qué responder y qué herramientas activar según el contexto acumulado
  3. Tools/APIs: conectan el agente con CRM, base de conocimiento, agenda o sistema de pedidos en tiempo real
  4. Webhook post-llamada: registra duración, resumen, sentiment y resolución — datos que alimentan el CRM y los reportes de operaciones

Cada llamada genera un transcript completo y análisis automático de sentimiento. Con 50 llamadas diarias, en una semana tienes más datos cualitativos de clientes que en un año de encuestas.

Lo que aprendimos en producción

  1. El backchannel elimina el silencio incómodo. Mientras el LLM procesa (200-500ms), la plataforma inserta "entiendo" o "un momento". Esto sube la satisfacción percibida un 40% sin cambiar la latencia real — dato medido con Retell analytics en un cliente de distribución, agosto 2026.
  2. El prompt para voz es diferente al de texto. Un prompt de 200 tokens funciona mejor que uno de 800: menos tokens de entrada, menos latencia en la primera respuesta.
  3. Deepgram Nova-3 con es-419 supera a es-ES para LATAM. Los regionalismos de México, Colombia y Venezuela se transcriben con un 12% más de precisión usando el tag de región correcto, según pruebas propias con 300 llamadas reales (agosto 2026, cliente sector distribución).
  4. Separa el número de producción del de pruebas desde el día 1. Un agente en testing que llama a clientes reales es un incidente, no un accidente.
  5. El análisis post-llamada es el dato más valioso. En 3 semanas con un cliente de distribución encontramos que el 34% de las llamadas correspondía al mismo problema — estado de pedido. Un insight que el equipo de ventas no tenía y que resolvimos con una tool al sistema de tracking.

En resumen

  • Retell AI: arranque en 30 minutos, latencia ~800ms, $0.07/min todo incluido — ideal para empezar
  • Vapi: más flexible para integraciones SIP y modelos propios, $0.05/min + proveedor
  • Usar Deepgram Nova-3 + es-419 para transcripción en español LATAM
  • El prompt del sistema debe ser breve (menos de 200 tokens): la concisión reduce latencia
  • Registrar sentiment y resolución por llamada: en dos semanas tienes insights operativos que el equipo no obtiene de otra forma

Si quieres implementar un agente de voz IA para atención al cliente en tu empresa sin construirlo desde cero, en AgentesNexo lo hacemos por ti. Escríbenos en agentesnexo.com o por WhatsApp al +591 67564218

Escríbenos en agentesnexo.com o por WhatsApp al +591 67564218

Articulos relacionados