Orquestacion de agentes IA: cuando usar cada modelo
Por que la eleccion del modelo define el exito del proyecto
Montar un ecosistema de agentes IA no es instalar un modelo y listo. Es decidir, para cada tarea, que tan inteligente necesita ser el agente que la resuelve. Usar siempre el modelo mas poderoso es caro. Usar siempre el mas barato da respuestas mediocres. La clave es la orquestacion.
En produccion, la diferencia de costo entre modelos es real. Claude Opus 4.5 cuesta alrededor de $15 por millon de tokens de salida; Claude Haiku 4.5 cuesta $0.80. La diferencia es 18 veces. Para un agente que procesa mil conversaciones diarias, elegir mal el modelo puede significar $1,000 al mes extra sin ningun beneficio tangible.
Pero el costo no es el unico factor. Un agente de voz que responde en tiempo real no puede esperar cuatro segundos de Opus cuando Haiku responde en 0.3 segundos con calidad suficiente. Un agente que analiza un contrato legal de 50 paginas si necesita razonamiento profundo.
La orquestacion es la disciplina de asignar el modelo correcto a cada nodo del flujo.
Que necesitas para orquestar agentes IA bien
- Un modelo de lenguaje por tier (grande, medio, pequeno)
- Una capa de enrutamiento que clasifica intent antes de delegar
- Memoria compartida o handoff de contexto entre agentes
- Metricas por tipo de tarea (costo, latencia, calidad)
- Un orquestador central que conoce el estado del ecosistema
Los tres niveles del ecosistema multi-agente
Nivel 1: el cerebro orquestador (Opus o Sonnet)
El agente que planifica, descompone tareas y toma decisiones criticas. No habla con el usuario final; habla con los agentes hijos y decide que delega a quien.
Cuando usarlo:
- Analisis de documentos complejos: contratos, informes financieros, auditorias
- Razonamiento multi-paso con dependencias entre subtareas
- Generacion de planes de accion para otros agentes
- Validacion de resultados donde el error tiene costo real
En el sistema NexoAgents (el ecosistema interno de AgentesNexo que corre 24/7 en una Mac mini M4), BRAIN usa Claude Sonnet. Analiza el contexto global, decide que agente activa y que instrucciones le da. Solo escalaria a Opus para decisiones irreversibles con alta exposicion.
Regla practica: si la tarea requiere entender antes de actuar, empieza con Sonnet. Si ademas tiene consecuencias irreversibles, enviar un email masivo, tomar una decision de credito, publicar contenido externo, evalua subir a Opus.
Nivel 2: agentes especializados (Sonnet)
Agentes con skill propio y dominio definido. El agente de contenido que redacta posts, el agente comercial que califica leads, el agente de codigo que escribe y revisa scripts.
Cuando usarlo:
- Generacion de texto que necesita tono, estilo y coherencia de marca
- Razonamiento de un solo paso con contexto de tamaño medio
- Respuestas conversacionales en chat de soporte o ventas
- Analisis de datos estructurados con interpretacion humana
Sonnet 4.5 entrega alrededor del 85% de la calidad de Opus al 20% del costo. Para la mayoria de tareas de negocio, eso es suficiente y el tradeoff es obvio.
Nivel 3: agentes de alta frecuencia (Haiku)
Los que trabajan en loop, procesan grandes volumenes, clasifican, enrutan o responden preguntas con variacion minima.
Cuando usarlo:
- Clasificacion de intents en mensajes entrantes (antes de enrutar)
- Extraccion de campos de formularios, emails o documentos simples
- Respuestas a preguntas frecuentes donde la respuesta es predecible
- Monitoreo de estado de servicios y health checks
- Resumen de un parrafo a tres palabras para etiquetado automatico
En NexoAgents, WATCHER usa Haiku 4.5 y corre cada 15 minutos revisando servicios, generando alertas y respondiendo preguntas de estado. Costo mensual: menos de dos dolares.
Como disenar el flujo de orquestacion
El punto de entrada es siempre un enrutador Haiku. Clasifica el intent del usuario en menos de 500 ms y decide a que nivel del ecosistema escalar la solicitud. Si la pregunta es simple o conocida, responde directamente. Si requiere razonamiento, sube a un agente Sonnet especializado. Si el problema es complejo o multi-dominio, el orquestador Sonnet lo descompone en subtareas y las delega a los agentes correspondientes, cada uno con el modelo correcto.
El resultado se consolida, se valida si es necesario y se entrega al usuario. Todo el flujo queda logueado por tarea para poder medir costo y calidad por tipo de solicitud.
Tabla de asignacion por tipo de tarea
La siguiente tabla resume como asignamos modelos en produccion:
- Responder preguntas frecuentes: Haiku. Respuesta predefinida, alta frecuencia.
- Redactar propuesta comercial: Sonnet. Tono, estructura, persuasion.
- Revisar contrato de alto valor: Opus. El error tiene costo legal real.
- Etiquetar y clasificar 10.000 leads: Haiku. Alta frecuencia, baja complejidad.
- Generar reporte financiero mensual: Sonnet. Interpretacion mas formato narrativo.
- Detectar anomalia en datos de ventas: Sonnet. Analisis multivariable con contexto.
- Enviar recordatorio de cita: Haiku. Template con variable simple.
- Analizar churn de clientes B2B: Opus. Decision estrategica con datos complejos.
Arquitectura del sistema en produccion
El ecosistema NexoAgents corre en una Mac mini M4 como servidor principal:
- BRAIN con Sonnet actua como planificador y coordinador central
- CODER con Opus solo para codigo critico o revision profunda
- CONTENT con Sonnet para posts, blog y copy de marca
- OUTREACH con Sonnet para calificacion de leads y mensajes personalizados
- OPS con Haiku para tareas rutinarias y administracion
- WATCHER con Haiku para monitoring cada 15 minutos
Cada agente recibe solo el contexto que necesita. BRAIN no le pasa a WATCHER los logs de OUTREACH. Eso reduce tokens, mantiene cada modelo enfocado y evita filtraciones de informacion entre dominios.
Lo que aprendimos implementando esto en produccion
El enrutador es la inversion que mas retorna. Un Haiku bien calibrado puede clasificar intent con 95% de precision. Eso decide el costo de todo lo que sigue.
Mide antes de escalar. Empieza con Sonnet para todo, identifica donde la calidad no es suficiente, ahi sube a Opus. No al reves.
Los modelos pequenos necesitan prompts cortos. Haiku con un prompt de 800 tokens rinde mejor que con uno de 4,000. Las instrucciones deben ser precisas, no largas.
Pasa resumenes, no historiales completos. En vez de enviar el historial completo a cada agente hijo, BRAIN pasa solo el resumen de contexto relevante. Esto solo redujo un 40% el costo de tokens en nuestro sistema.
Monitorea por tarea, no por agente. El costo y la calidad se miden por tipo de tarea, no por sesion. Eso te dice donde optimizar el modelo asignado.
La trampa del modelo unico
El error mas comun en implementaciones nuevas: usar Opus para todo porque es el mejor. Resultado: facturas de API entre 10 y 18 veces mas altas de lo necesario, latencias altas en respuestas simples y ninguna ventaja real, porque el 70% de las tareas no requieren ese nivel de razonamiento.
La orquestacion inteligente no es un lujo de equipos de ingenieria grandes. Es la diferencia entre un proyecto de agentes IA que escala y uno que se abandona por costo.
En resumen
- Haiku para clasificacion, alta frecuencia y respuestas predecibles
- Sonnet para la mayoria de tareas de negocio: texto, analisis, razonamiento de profundidad media
- Opus solo cuando el costo del error supera el costo del token
- Un enrutador Haiku al inicio del flujo ahorra entre 40 y 60% en costos de API
- Empieza con Sonnet, sube a Opus donde la calidad no alcanza, baja a Haiku donde sobra
- Pasa contexto resumido, no historiales completos, entre agentes
Si quieres implementar un ecosistema multi-agente IA en tu empresa sin construirlo desde cero, en AgentesNexo lo hacemos por ti. Escribenos en agentesnexo.com o por WhatsApp al +591 67564218.
Implementa un ecosistema multi-agente en tu empresa. Escribenos en agentesnexo.com o por WhatsApp al +591 67564218