Guía · Costos de IA

La escalera de costos de IA: local, suscripción y API

AgentesNexo
·

La escalera de costos de IA es un criterio para decidir dónde corre cada tarea de inteligencia artificial. Tiene tres peldaños: modelos locales gratuitos (Ollama, costo cero por consulta) para tareas simples de alto volumen y datos que no pueden salir del equipo; suscripción de tarifa plana (20 a 200 dólares por mes por persona) para el trabajo diario; y API premium por token (0,28 a 30 dólares por millón de tokens de salida, agosto 2026) para producción y picos de demanda. La regla es una sola: cada tarea baja al peldaño más barato que la resuelve bien.

Por qué hace falta una escalera

Porque los precios de la IA en la nube dejaron de bajar. En 2026 hubo reemplazos de modelos que llegaron costando 3 veces más que el modelo que sustituían, y entre el modelo más caro y el más barato de la API hay una diferencia de 107 veces por el mismo millón de tokens (30 frente a 0,28 dólares). Pagar todo al precio del peldaño más alto es la forma más común de que un proyecto de IA muera por factura.

La solución no es elegir un solo proveedor barato: es asignar cada tarea al peldaño correcto. Lo repetitivo y simple no debería pagar precio premium, y lo crítico no debería resolverse con un modelo que no le llega.

Peldaño 1

Modelos locales: costo cero por consulta

Un modelo abierto corriendo en tu propia computadora, sin servidor de por medio. La vía más común es Ollama, que instala y ejecuta modelos abiertos (Gemma, Llama, DeepSeek) en una Mac o PC común. Chrome incluso trae uno adentro: Gemini Nano, que cualquier página web puede usar sin que el texto salga del equipo.

Los números

  • Costo por consulta: 0 dólares. El software y los modelos abiertos son gratuitos.
  • Hardware: con 16 GB de RAM corren modelos de hasta 12 mil millones de parámetros cuantizados; un modelo chico (1 a 4 mil millones) corre con 8 GB.
  • Gemini Nano en Chrome: solo escritorio, pide 22 GB libres de disco y una GPU con 4 GB.

Cuándo conviene

Para tareas acotadas que se repiten miles de veces: clasificar lo que entra (consultas, reclamos, ventas), extraer datos de documentos, resumir conversaciones, traducir, deduplicar registros, puntuar leads. Y para todo lo que no puede salir del equipo por privacidad: datos de clientes, información legal o de salud.

Ejemplo concreto: clasificar 50.000 fichas de negocios con un modelo premium de API cuesta cientos de dólares; con un modelo local en una computadora de oficina cuesta cero y corre de noche.

El límite honesto

Un modelo local no razona en varios pasos ni toma decisiones complejas. No compite con los modelos grandes en tareas de criterio. Es el peldaño del volumen, no el del juicio.

Probá un modelo local en tu navegador ahora (demo interactiva, requiere Chrome de escritorio): traduce, resume y clasifica sin que el texto salga de tu equipo.

Peldaño 2

Suscripción plana: el trabajo diario

Los planes de tarifa fija de los grandes proveedores (Claude, ChatGPT, Gemini) cuestan entre 20 y 200 dólares por mes por persona y dan acceso a los mejores modelos con un tope de uso, no con un precio por consulta.

Cuándo conviene

Para el uso intensivo de personas: redactar, programar, analizar, preparar propuestas. Quien usa IA varias horas al día gastaría mucho más pagando por token; la suscripción convierte un costo variable en un costo fijo y predecible. El límite que importa acá es el tope de uso, no la factura.

El límite honesto

No sirve para automatizar producción. Las suscripciones no están pensadas para integrarse en sistemas que atienden clientes 24/7, y sus topes de uso no acompañan el volumen de un negocio. Es el peldaño de las personas, no el de los sistemas.

Peldaño 3

API premium: producción y picos

Pagar por token directamente a Anthropic, OpenAI, Google o DeepSeek. Es el único peldaño que escala sin límite y se integra en sistemas: agentes que atienden WhatsApp, procesos que corren solos, productos con IA adentro. Se paga exactamente lo que se usa, y por eso los picos de demanda no requieren pagar capacidad ociosa el resto del mes.

Precio de salida por millón de tokens (agosto 2026)

ModeloProveedorUSD por 1M tokens de salida
GPT-5.6OpenAI30
Claude Opus 5Anthropic25
Gemini 3.1 ProGoogle12
Claude Sonnet 5Anthropic10 (15 desde el 31-08-2026)
Claude Haiku 4.5Anthropic5
Gemini Flash-LiteGoogle2,50
DeepSeek V4DeepSeek0,28
Modelo local (Ollama)Tu equipo0

La escalera también funciona adentro de la API: las tareas simples van a los modelos económicos (Haiku 4.5, Flash-Lite, DeepSeek) y los modelos premium se reservan para lo que exige criterio. Un agente bien diseñado enruta cada paso al modelo más barato que lo resuelve bien, igual que la escalera completa.

Cuándo conviene

Cuando la IA es parte del negocio y no de una persona: un agente que responde clientes a las 3 de la mañana, un proceso que analiza cada pedido que entra, un producto que necesita IA embebida. Ahí el volumen es variable, la disponibilidad es obligatoria y el costo se diseña por tarea.

Los tres peldaños, lado a lado

LocalSuscripciónAPI
Costo0 USD por consulta20-200 USD/mes fijo0,28-30 USD por 1M tokens
Dónde van los datosNo salen del equipoNube del proveedorNube del proveedor
Para qué sirveTareas simples de alto volumen y privacidadTrabajo diario de personasProducción, integraciones y picos
El límiteNo razona en varios pasosTopes de uso, no se integraEl costo crece con cada consulta
Señal de que convieneLa tarea se repite miles de vecesUna persona la usa horas por díaUn sistema la necesita 24/7

Así diseñamos los costos de nuestros clientes

En AgentesNexo esta escalera no es teoría: es la columna vertebral de cómo cotizamos y operamos. Cuando construimos un sistema de agentes, cada tarea se asigna al peldaño más barato que la resuelve bien. Lo repetitivo (clasificar mensajes, resumir conversaciones, extraer datos) baja a modelos locales o a los modelos económicos de la API. Lo que exige criterio (responder a un cliente, decidir el siguiente paso) sube al modelo que lo hace bien.

El resultado es una factura que no crece al ritmo del volumen. El negocio atiende más y el costo por conversación baja, porque el grueso del trabajo corre en los peldaños baratos.

Preguntas frecuentes

¿Qué es la escalera de costos de IA?

Es un criterio para decidir dónde corre cada tarea de inteligencia artificial: modelos locales gratuitos (Ollama) para tareas simples y datos sensibles, suscripción de tarifa plana (20 a 200 dólares por mes) para el trabajo diario de las personas, y API premium por token (0,28 a 30 dólares por millón de tokens de salida) para producción y picos. La regla: cada tarea baja al peldaño más barato que la resuelve bien.

¿Cuándo conviene un modelo local en vez de la API?

Cuando la tarea es acotada (clasificar, extraer datos, resumir, traducir), el volumen es alto, o los datos no pueden salir del equipo. Con Ollama y una computadora de 16 GB de RAM alcanza para correr modelos abiertos de hasta 12 mil millones de parámetros, con costo cero por consulta.

¿La suscripción de 20 dólares no alcanza para todo?

Para el trabajo diario de una persona, casi siempre alcanza y es más barata que pagar por token. Para automatizar un negocio, no: las suscripciones tienen topes de uso y no están pensadas para integrarse en sistemas que atienden clientes 24/7. Para eso existe la API.

¿Cuánto cuesta la API de los modelos grandes?

Entre 0,28 dólares (DeepSeek V4) y 30 dólares (GPT-5.6) por millón de tokens de salida, con precios verificados en agosto 2026. Entre el más caro y el más barato hay una diferencia de 107 veces por el mismo texto, por eso el modelo se elige por tarea y no por costumbre.

¿Un modelo local sirve para atender clientes?

Solo como apoyo. Un modelo local no razona en varios pasos ni compite con los modelos grandes en tareas de criterio, así que la respuesta final al cliente conviene darla con un modelo grande. Lo local rinde en el trabajo previo: clasificar lo que entra, resumir conversaciones y extraer datos, que es el volumen que más se repite.

¿Los precios de la IA van a seguir bajando?

Dejaron de bajar en 2026. Hubo reemplazos de modelos que llegaron costando 3 veces más que su antecesor. Por eso conviene diseñar los costos con esta escalera en vez de asumir que el tiempo abarata la factura solo.

Si querés saber cuánto costaría operar tu negocio con la IA bien escalonada, lo calculamos con tus números reales: qué tareas van a cada peldaño y cuánto pagarías por mes. Sin compromiso.