Los costos ocultos de los agentes de IA no están en el precio del token. Están en cuántos tokens consume un agente para completar una sola tarea. Entre noviembre de 2022 y octubre de 2024, el costo de consultar un modelo con performance equivalente a GPT-3.5 pasó de USD 20 a USD 0,07 por millón de tokens, una caída de más de 280 veces según el AI Index 2025 de Stanford. Y sin embargo, los presupuestos de IA en producción se siguen desbordando. La razón es que el precio unitario bajó mientras el consumo por tarea se multiplicaba. Si estás evaluando un proyecto de agentes, este artículo te muestra dónde se va realmente la plata y qué preguntas hacer antes de firmar.
Un chat responde. Un agente ejecuta un ciclo
La confusión más cara del mercado hoy es tratar a un agente como si fuera un chatbot con mejor nombre.
Un chat recibe una consulta, genera una respuesta y termina. El consumo es predecible: entrada más salida, una vez.
Un agente no funciona así. Recibe un objetivo, no una pregunta. Para cumplirlo razona sobre el problema, decide qué herramienta usar, la llama, evalúa el resultado, corrige si el resultado no sirve, vuelve a intentar, y arrastra todo el contexto acumulado en cada uno de esos pasos. Cada vuelta del ciclo se paga.
Anthropic publicó las mediciones de su propio sistema en producción: un agente usa aproximadamente 4 veces más tokens que una interacción de chat, y un sistema multiagente unas 15 veces más. No son estimaciones teóricas, son datos de operación real.
Ese multiplicador es el que rompe los presupuestos. Un cálculo hecho sobre el precio de lista y un volumen de consultas puede quedar corto por un orden de magnitud, sin que nadie haya hecho nada mal en la planilla.
Dónde se acumula el costo que no aparece en la cotización
Cuatro lugares concretos, en orden de impacto habitual:
El contexto que se arrastra. Cada paso del ciclo vuelve a enviar el historial acumulado. En una tarea de veinte pasos, el contexto del paso uno se pagó veinte veces. Es el costo más invisible porque no aparece como una acción nueva, aparece como un input que crece solo.
Los reintentos. Cuando una herramienta devuelve un error o un resultado vacío, el agente reintenta. Si no hay un registro de lo que ya intentó, puede volver a llamar la misma herramienta varias veces. Sin un límite de reintentos explícito, un fallo puntual se convierte en un ciclo que consume presupuesto sin resolver nada.
La orquestación. En arquitecturas multiagente hay un agente coordinador que reparte trabajo y consolida resultados. Ese trabajo de coordinación también consume tokens, y crece con cada agente que se suma. No es trabajo productivo, es el peaje de la arquitectura.
Lo que rodea al modelo. Observabilidad, logging, almacenamiento de contexto, ambientes de prueba, integraciones con los sistemas existentes y el trabajo de gobernanza. Nada de esto figura en la factura del proveedor del modelo, pero todo forma parte del costo de tener un agente en producción.
Lo que dice el mercado sobre el desenlace
Gartner proyecta que más del 40% de los proyectos de IA agéntica van a ser cancelados antes de fin de 2027. Los tres motivos que identifica son costos crecientes, valor de negocio poco claro y controles de riesgo inadecuados.
Vale detenerse en esa lista. No aparece la capacidad del modelo. No aparece la complejidad técnica. Los tres motivos son de gestión y de definición del alcance, no de tecnología. Un modelo más potente no arregla ninguno de los tres.
En el mismo análisis, Gartner señala una práctica que complica la evaluación: el «agent washing», el rebranding de asistentes, chatbots y automatizaciones de tipo RPA como si fueran agentes, sin capacidades agénticas reales detrás. La consultora estima que solo unos 130 de los miles de proveedores que se presentan como agénticos lo son efectivamente.
Esto tiene una consecuencia práctica para quien está evaluando: parte de lo que se cotiza como proyecto de agentes se resolvería mejor, más barato y con menos riesgo con automatización tradicional. Y parte de lo que se cotiza como automatización simple sí necesita un agente. Distinguir uno de otro antes de firmar es el ahorro más grande disponible.
El patrón se repite en modernización de sistemas. En junio de 2026, Gartner proyectó que más del 70% de los proyectos de salida de mainframe iniciados ese año no van a producir los beneficios esperados, por sobreestimar las capacidades de las herramientas de IA generativa. El analista a cargo lo describió como una brecha creciente entre la promesa de marketing de la IA generativa y su capacidad real de transformar y migrar código legacy complejo.
6 preguntas para hacer antes de aprobar el presupuesto
Estas son las preguntas que usamos cuando acompañamos a un equipo en la evaluación. Sirven tanto para un proveedor externo como para un proyecto interno.
1. ¿Cuántos tokens consume una tarea completa, no una consulta?
La unidad de medida correcta es la tarea terminada, con sus reintentos y su contexto acumulado. Si la respuesta viene expresada en costo por consulta, todavía no hay una estimación de producción.
2. ¿Qué pasa cuando algo falla?
Cuántos reintentos están permitidos, si hay un tope por ejecución, y si el agente registra lo que ya intentó. Sin límites explícitos, el peor escenario de costo no tiene techo.
3. ¿Esto necesita ser un agente?
Si la tarea es un flujo determinístico de pasos conocidos, una automatización tradicional lo resuelve mejor y con costo predecible. El agente se justifica cuando el camino no se puede definir de antemano.
4. ¿Cómo se mide el costo por tarea en producción?
Saber cuánto se gastó en el mes no permite optimizar nada. Hace falta granularidad por flujo y por tarea para detectar dónde se está yendo el consumo antes de escalar.
5. ¿Qué pasa cuando el volumen se multiplica por diez?
El costo de un agente rara vez escala de forma lineal. Conviene modelar el escenario de adopción alta antes de aprobar, no después.
6. ¿Quién es el dueño del proyecto y contra qué métrica se mide?
De los tres motivos de cancelación que identifica Gartner, dos se resuelven acá. Un proyecto sin dueño y sin métrica de negocio definida es un candidato a cancelación, independientemente de qué tan bien funcione en la demo.
El criterio de fondo
La cuenta de la demo no es la cuenta de producción. Una prueba de concepto corre sobre casos limpios, sin reintentos, sin edge cases y sin el contexto acumulado de un flujo real. Producción es exactamente lo contrario.
Esto no es un argumento en contra de los agentes de IA. Es un argumento a favor de dimensionarlos bien. Cuando la tarea lo justifica, un agente resuelve trabajo que ninguna automatización tradicional puede resolver, y el multiplicador de consumo se paga solo. El problema no es el costo, es el costo que aparece después de haber aprobado el presupuesto.
En CCYD trabajamos con soluciones agnósticas, sin atar a nuestros clientes a un proveedor único. Eso incluye ser directos cuando la respuesta correcta a un problema no es un agente. Preferimos ese tipo de conversación antes de arrancar y no seis meses después.
¿Estás evaluando un proyecto de agentes de IA?
Revisemos juntos el número antes de que lo apruebes. Agendá una llamada de 30 minutos con nuestro equipo y salimos con una estimación sobre el ciclo completo, no sobre la demo.