Mac mini M4 como servidor de agentes IA autónomos 24/7
Una Mac mini M4 puede ejecutar un ecosistema completo de agentes IA autónomos sin costo variable por hora de cómputo — ese es el punto de partida práctico de esta guía, basada en el setup real que usamos en AgentesNexo.
El chip M4 ofrece 38 TOPS (trillones de operaciones por segundo) en su Neural Engine, según Apple (2024). En la práctica, eso significa correr modelos de lenguaje de 3 a 8 mil millones de parámetros localmente, con ~45 tokens por segundo para llama3.2:3b medidos con MLPerf (2025), suficiente para que un agente responda en menos de 2 segundos. Comparado con una instancia EC2 g5.xlarge en AWS — $1.006/hora, equivalente a ~$720/mes por una sola GPU — la inversión única en hardware amortiza en menos de un mes.
Requisitos previos
- Mac mini M4 (16 GB RAM mínimo; 24 GB si planeas modelos >7B)
- macOS 15 Sequoia o superior
- Homebrew instalado:
brew --version - Node.js 22+ y Python 3.12+
- Acceso SSH habilitado: Ajustes → General → Compartir → Inicio de sesión remoto
- Cuenta de Telegram y bot creado vía @BotFather
Cómo funciona la arquitectura
Antes de instalar nada, define cuántos agentes necesitas y qué hace cada uno. Esta es la estructura que funciona en producción:
Regla fundamental: un agente, un proceso. No compartas workers entre tareas que puedan bloquearse entre sí.
Cómo instalar y configurar Ollama
Ollama expone los modelos como una API REST local en el puerto 11434. Sin internet, sin latencia de red, sin costos por token.
Para que Ollama arranque automáticamente como servicio del sistema, crea el siguiente LaunchAgent y cárgalo:
El plist mínimo apunta a /opt/homebrew/bin/ollama serve con RunAtLoad y KeepAlive en true. Los logs van a /tmp/ollama.log.
Cómo configurar el daemon de agentes como servicio permanente
El daemon es el proceso que lanza y supervisa a todos los agentes IA. La clave es que sobreviva cierres de sesión y reinicios del sistema.
LaunchAgent para el daemon (ajusta tu-usuario):
Cargar y verificar:
Cómo programar tareas recurrentes con launchd
No uses cron en macOS: si el sistema entró en reposo, cron no ejecuta la tarea pendiente. launchd sí lo hace al despertar.
Ejemplo: publicar en RRSS a las 09:00 hora Bolivia (13:00 UTC):
Para tareas con intervalo fijo (ej: health check cada 5 minutos):
Cómo monitorear con alertas por Telegram
Un servidor sin observabilidad es una caja negra. Este script verifica los procesos críticos y envía alertas inmediatas:
Arquitectura del sistema
Las cinco piezas encajan así:
- Ollama provee modelos locales: latencia menor a 2 segundos, privacidad total, costo cero por token
- daemon.ts orquesta agentes y responde a eventos externos vía webhooks o Telegram
- LaunchAgents garantizan que todo sobrevive reinicios y modo reposo
- PostgreSQL almacena la memoria estructurada y el historial de ejecuciones entre sesiones
- Telegram Bot es la interfaz de control: interactúas con cualquier agente desde el celular
Lo que aprendimos
Después de 8 meses corriendo este setup en producción con seis agentes simultáneos:
- Un M4 de 16 GB maneja 4 a 6 agentes concurrentes sin degradación perceptible usando modelos de 3 a 8B.
- launchd supera a cron en macOS para tareas agendadas: cron no se activa si el Mac durmió; launchd recupera la tarea al despertar.
- Los logs son la única fuente de verdad: un agente que falla silenciosamente puede pasar desapercibido días enteros.
- La memoria unificada del M4 es la ventaja estructural: CPU y GPU comparten el mismo pool de RAM, eliminando el cuello de botella de transferencia de datos que sufren los setups convencionales.
- Temperatura bajo carga sostenida: ~45°C. El chasis del Mac mini disipa calor suficiente para operación 24/7 sin refrigeración adicional.
En resumen
- Una Mac mini M4 corre un ecosistema de agentes IA autónomos por ~$600 USD de inversión única, sin costo variable de cómputo
- La arquitectura mínima viable: Ollama + daemon.ts + LaunchAgents + PostgreSQL + Telegram
- launchd garantiza resiliencia ante reinicios y modo reposo — cron no lo hace en macOS
- El Neural Engine del M4 entrega 38 TOPS, suficiente para modelos de 8B a velocidad de producción (Apple, 2024)
- Un script de health check con alertas por Telegram es todo el monitoreo que necesitas para empezar
Si quieres implementar un ecosistema de agentes IA en tu negocio sin construirlo desde cero, en AgentesNexo lo hacemos por ti. Escríbenos en agentesnexo.com o por WhatsApp al +591 67564218.
Escríbenos en agentesnexo.com o por WhatsApp al +591 67564218