Agente de voz IA para atención al cliente empresa: guía 2026

AgentesNexo
··6 min lectura

Para implementar un agente de voz IA en tu empresa que atienda llamadas en español de forma autónoma, necesitas tres piezas: una plataforma de voz (Retell AI o Vapi), un número telefónico SIP o PSTN, y un webhook para capturar los datos al finalizar la llamada.

Por qué un agente de voz IA para atención al cliente

Cada llamada sin respuesta tiene un costo real: lead perdido, cliente frustrado, o ticket sin resolver. Las empresas con volumen alto de llamadas entrantes enfrentan el mismo problema — el equipo humano no puede escalar al ritmo de la demanda sin disparar los costos de personal.

Un agente de voz IA en español resuelve el desbordamiento sin contratar agentes adicionales. Atiende en paralelo, califica en tiempo real, y entrega la conversación completa transcripta al CRM. Esta guía muestra cómo construirlo con Retell AI o Vapi — las dos plataformas más maduras para voz IA empresarial en 2026.

Requisitos previos

  • Cuenta en Retell AI (retellai.com) o Vapi (vapi.ai) — ambas tienen plan de prueba gratuito
  • Número de teléfono SIP o PSTN: Twilio, Zadarma, o Telnyx funcionan bien en LATAM
  • Node.js 20+ o Python 3.11+ en tu servidor
  • Acceso a tu CRM o base de datos (opcional, pero necesario para cerrar el ciclo)
  • API key de un LLM: GPT-4o, Claude 3.5 Sonnet, o Gemini 1.5 Flash

1. Elegir la plataforma: Retell AI vs Vapi

Criterio Retell AI Vapi
Latencia promedio 800-1000 ms 600-900 ms
Español nativo Sí (es-MX, es-ES, es-CO) Sí (es-MX, es-ES)
Modelos soportados GPT-4o, Claude, Gemini GPT-4o, Claude, custom
Precio por minuto ~$0.07 USD ~$0.05 USD
SDK Python, Node.js Python, Node.js, Web
Integración n8n Webhooks + Zapier Webhooks nativos

Regla práctica: usa Retell AI para flujos complejos con múltiples pasos de validación y branching. Usa Vapi si tu stack ya incluye n8n y quieres la integración más rápida.

2. Configurar el agente en Retell AI

Instalar el SDK y crear el agente

bash
npm install retell-sdk

# Variables de entorno necesarias
export RETELL_API_KEY=#43a047">"key_xxxxxxxxxxxx"
export OPENAI_API_KEY=#43a047">"sk-xxxxxxxxxxxx"
typescript
import Retell from 'retell-sdk';

const client = new Retell({ apiKey: process.env.RETELL_API_KEY });

const agent = await client.agent.create({
  llm_websocket_url: 'wss://tu-servidor.com/llm-websocket',
  agent_name: 'Asistente de Ventas',
  voice_id: 'es-MX-DaliaNeural',
  language: 'es-MX',
  responsiveness: 1.0,
  interruption_sensitivity: 0.8,
  ambient_sound: 'office',
});

console.log('Agente creado:', agent.agent_id);

Definir el prompt del agente

El prompt determina el 80% del comportamiento. Corto y específico funciona mejor que largo y genérico:

Eres María, asistente de [Empresa]. Cuando alguien llame:
1. Saluda y pregunta en qué puedes ayudar
2. Clasifica: ventas, soporte, o información general
3. Ventas: captura nombre, presupuesto estimado, y disponibilidad para llamada
4. Soporte: solicita número de caso y descripción breve del problema
5. Al cierre: confirma los datos capturados y avisa que el equipo hará seguimiento

Reglas:
- Español neutro, tono profesional pero cercano
- Máximo 2 oraciones por turno
- Si no sabes algo, di "Déjame verificarlo" y captura el contacto
- No inventes precios ni fechas de entrega

3. Conectar con tu línea telefónica

Opción A — Twilio (recomendado para México, Colombia, Chile)

typescript
// Vincular número Twilio al agente
const phoneNumber = await client.phoneNumber.import({
  twilio_account_sid: process.env.TWILIO_ACCOUNT_SID,
  twilio_auth_token: process.env.TWILIO_AUTH_TOKEN,
  phone_number: '+52551234567',
  inbound_agent_id: agent.agent_id,
});

Opción B — Zadarma (más económico, funciona en Bolivia, Venezuela, Argentina)

bash
# En tu PBX Zadarma, configurar el DID con webhook SIP
# URL destino: https://api.retellai.com/twilio-voice-webhook/[AGENT_ID]
# Método: POST
# El número local de Zadarma redirige automáticamente las llamadas a Retell AI

4. Capturar datos y alimentar el CRM

El agente extrae información estructurada al finalizar cada llamada. Configura un webhook para recibirla:

typescript
import express from 'express';
const app = express();

app.post('/webhook/call-ended', async (req, res) => {
  const { call_id, transcript, call_analysis } = req.body;

  const leadData = {
    nombre: call_analysis.custom_analysis_data?.nombre,
    telefono: call_analysis.custom_analysis_data?.telefono,
    presupuesto: call_analysis.custom_analysis_data?.presupuesto,
    categoria: call_analysis.custom_analysis_data?.tipo,
    transcripcion: transcript,
    duracion_seg: call_analysis.call_duration,
  };

  // Insertar en tu CRM o BD
  await crm.createContact(leadData);

  // Notificar al equipo si el lead cumple el criterio
  if (leadData.presupuesto > 500) {
    await slack.notify(#43a047">`Nuevo lead calificado: ${leadData.nombre} — ${leadData.telefono}`);
  }

  res.json({ status: 'ok' });
});

app.listen(3000);

Arquitectura del sistema

Llamada entrante (número local)
        ↓
Twilio o Zadarma (enrutamiento SIP)
        ↓
Retell AI / Vapi
(motor de voz + transcripción en tiempo real)
        ↓
Claude 3.5 Sonnet o GPT-4o (razonamiento y respuesta)
        ↓
Webhook al finalizar la llamada
        ↓
CRM / Base de datos — Notificación al equipo de ventas

La latencia de extremo a extremo es 700-1100 ms por turno de conversación. Con una voz natural y ambient_sound activo, el usuario raramente percibe que no es humano.

Lo que aprendimos implementando esto en producción

  1. La voz importa más que el modelo: un agente con voz sintética robótica convierte menos que uno con voz natural, incluso si el LLM subyacente es más potente. Probar al menos 3 voces antes de lanzar.
  1. Prompts cortos, comportamiento consistente: prompts de más de 800 tokens causan inconsistencia durante llamadas largas. Ser específico y breve mejora la tasa de éxito.
  1. Español neutro, no localizado: los acentos marcados generan fricción en mercados distintos al propio. es-MX funciona bien en Bolivia, Colombia, y Argentina sin ajustes.
  1. El silencio mata la experiencia: activar ambient_sound: 'office' reduce la percepción de latencia. El usuario tolera espera con sonido de fondo mejor que en silencio total.
  1. Transcripciones desde el día 1: son el activo más valioso para iterar el agente. Sin ellas, es imposible saber dónde falla la conversación.

En resumen

  • Retell AI y Vapi son las plataformas maduras para agentes de voz IA en español en 2026
  • La integración con Twilio o Zadarma permite usar números locales en cualquier país de LATAM
  • El ciclo completo — llamada, calificación, webhook al CRM — se configura en menos de 2 días
  • La latencia de 700-1100 ms es aceptable para atención al cliente si la voz es natural
  • Las transcripciones automáticas al CRM eliminan el registro manual y aceleran el seguimiento de ventas

Si quieres implementar esto en tu negocio sin construirlo desde cero, en AgentesNexo lo hacemos por ti. Escríbenos en agentesnexo.com o por WhatsApp al +591 67564218

Si quieres implementar esto en tu negocio sin construirlo desde cero, en AgentesNexo lo hacemos por ti. Escríbenos en agentesnexo.com o por WhatsApp al +591 67564218

Articulos relacionados