Agente de voz IA para atención al cliente: Retell AI vs Vapi
Para quién es esta guía y qué problema resuelve
Para implementar un agente de voz IA que atienda llamadas de clientes en español, necesitas tres componentes: una plataforma de orquestación (Retell AI o Vapi), un modelo LLM como motor de decisión, y un proveedor de síntesis de voz en español neutro.
La mayoría de los equipos en LATAM todavía atienden el primer contacto telefónico con personas. Es repetitivo: el 60% de las llamadas de soporte en empresas medianas corresponde a 5 tipos de consulta (estado de pedido, horarios, precios, disponibilidad, escaladas). Un agente de voz IA cubre ese 60% con latencia inferior a 1 segundo, disponibilidad 24/7 y registro automático en CRM.
Esta guía es para equipos de operaciones o TI que quieren implementar un agente de voz IA en su empresa sin construirlo desde cero.
Requisitos previos
- Cuenta en Retell AI (retellai.com) o Vapi (vapi.ai) — ambas tienen free tier para desarrollo
- Número de teléfono: las plataformas proveen uno o se usa Twilio/Vonage propio
- Modelo LLM: GPT-4o, Claude Sonnet 4.5, o Gemini 2.0 Flash (latencia menor a 300ms recomendada)
- Proveedor TTS en español: ElevenLabs, Azure Neural, o Deepgram Aura-2
- Endpoint webhook para recibir eventos de llamada (Node.js, Python, o cualquier HTTP)
1. Retell AI vs Vapi: la comparación que importa
| Característica | Retell AI | Vapi |
|---|---|---|
| Latencia media | ~800ms | ~1.1s |
| LLMs soportados | OpenAI, Anthropic, Gemini | OpenAI, Anthropic, Gemini, Ollama |
| Español LATAM | Sí (Azure Neural / ElevenLabs) | Sí (cualquier TTS) |
| Precio por minuto | $0.07 todo incluido | $0.05 + costo del proveedor |
| SDK oficial | Node.js, Python | Node.js, Python |
| Funciones nativas | Transfer, booking, backchannel | Transfer, tools custom, SIP troncal |
| Curva de inicio | Baja — listo en 30 minutos | Media — requiere más configuración |
Retell AI es la opción más rápida para arrancar. Vapi es preferible cuando se necesita integrar con troncales SIP existentes o usar modelos locales con Ollama.
2. Configuración en Retell AI paso a paso
El prompt del sistema para voz debe ser breve. Las instrucciones largas aumentan la latencia y generan respuestas verbosas:
3. Transferencia a agente humano y registro en CRM
La transferencia debe ser limpia: el agente resume el problema antes de pasar la llamada para que el humano no le pida al cliente que repita todo.
4. Alternativa: configuración en Vapi
Vapi es preferible si ya tienes un proveedor SIP o quieres usar ElevenLabs con una voz de marca propia:
Arquitectura del sistema
Las cuatro piezas que interactúan en cada llamada:
- Plataforma de voz (Retell/Vapi): recibe el audio, transcribe (ASR), envía texto al LLM, convierte la respuesta a voz (TTS) y gestiona el turno de conversación
- LLM (Claude / GPT-4o): decide qué responder y qué herramientas activar según el contexto acumulado
- Tools/APIs: conectan el agente con CRM, base de conocimiento, agenda o sistema de pedidos en tiempo real
- Webhook post-llamada: registra duración, resumen, sentiment y resolución — datos que alimentan el CRM y los reportes de operaciones
Cada llamada genera un transcript completo y análisis automático de sentimiento. Con 50 llamadas diarias, en una semana tienes más datos cualitativos de clientes que en un año de encuestas.
Lo que aprendimos en producción
- El backchannel elimina el silencio incómodo. Mientras el LLM procesa (200-500ms), la plataforma inserta "entiendo" o "un momento". Esto sube la satisfacción percibida un 40% sin cambiar la latencia real — dato medido con Retell analytics en un cliente de distribución, agosto 2026.
- El prompt para voz es diferente al de texto. Un prompt de 200 tokens funciona mejor que uno de 800: menos tokens de entrada, menos latencia en la primera respuesta.
- Deepgram Nova-3 con
es-419supera aes-ESpara LATAM. Los regionalismos de México, Colombia y Venezuela se transcriben con un 12% más de precisión usando el tag de región correcto, según pruebas propias con 300 llamadas reales (agosto 2026, cliente sector distribución). - Separa el número de producción del de pruebas desde el día 1. Un agente en testing que llama a clientes reales es un incidente, no un accidente.
- El análisis post-llamada es el dato más valioso. En 3 semanas con un cliente de distribución encontramos que el 34% de las llamadas correspondía al mismo problema — estado de pedido. Un insight que el equipo de ventas no tenía y que resolvimos con una tool al sistema de tracking.
En resumen
- Retell AI: arranque en 30 minutos, latencia ~800ms, $0.07/min todo incluido — ideal para empezar
- Vapi: más flexible para integraciones SIP y modelos propios, $0.05/min + proveedor
- Usar Deepgram Nova-3 +
es-419para transcripción en español LATAM - El prompt del sistema debe ser breve (menos de 200 tokens): la concisión reduce latencia
- Registrar sentiment y resolución por llamada: en dos semanas tienes insights operativos que el equipo no obtiene de otra forma
Si quieres implementar un agente de voz IA para atención al cliente en tu empresa sin construirlo desde cero, en AgentesNexo lo hacemos por ti. Escríbenos en agentesnexo.com o por WhatsApp al +591 67564218
Escríbenos en agentesnexo.com o por WhatsApp al +591 67564218