✨︎ Resumen (TL;DR):
- Mavvrik encuestó a 396 empresas y solo el 11% declaró prever su gasto de IA con una desviación máxima de 10%.
- El 98% de las organizaciones usa herramientas de IA para programar, pero solo el 42% las incluye en sus reportes de costos de IA.
- Una tarifa menor por token puede acabar en una factura más alta si crece el consumo o siguen activos otros servicios.
Solo el 11% de las 396 empresas encuestadas por Mavvrik declaró que puede prever su gasto en inteligencia artificial con una desviación máxima de 10%. Las respuestas se recopilaron entre abril y mayo de 2026 y describen un problema doble: calcular el consumo de los modelos y hacer visibles los servicios que ya se están pagando.
La gobernanza de costos de IA es una práctica que controla el gasto de los modelos y de los servicios de infraestructura que usa una aplicación.

El presupuesto puede fallar antes de contar tokens
El reporte State of AI Cost Governance 2026 procede de Mavvrik, una empresa que vende herramientas para controlar costos. La encuesta considera precisa una previsión que se mantiene dentro de un margen de 10%.
La desviación puede ir en ambas direcciones: la empresa puede gastar más o menos de lo que había previsto. Si rebasa el límite, queda fuera del margen de precisión.
La brecha aparece antes de estimar el siguiente trabajo. El 98% de las organizaciones usa herramientas de IA para programar, pero solo el 42% las incluye en sus reportes de costos de IA. Si esos servicios que ya se están pagando quedan fuera de los reportes, el presupuesto omite una parte del gasto existente.
Un modelo barato puede elevar el costo total
Un preprint elaborado por investigadores de Microsoft Research, Stanford, Carnegie Mellon y Berkeley analizó ocho modelos en 6,877 tareas, agrupadas en 12 conjuntos de pruebas.
El preprint, actualizado el 28 de mayo de 2026 en arXiv, encontró una relación inversa entre tarifa y costo en 106 de 336 comparaciones entre pares de modelos, aproximadamente 32%.
Ese 32% cuenta comparaciones por conjunto de pruebas. No equivale a una proporción de tareas individuales: cambiar el denominador también cambiaría el significado del hallazgo.
Los autores atribuyen las diferencias principalmente al volumen de tokens de razonamiento y al número de interacciones. El análisis usa los precios del 1 de mayo de 2026 y estudia por separado el costo y la calidad de las respuestas.
Paul Kedrosky cuestionó en un comentario publicado el 5 de octubre que los casos en los que un modelo barato consume mucho más justifiquen favorecer siempre a los modelos de mayor precio. Su lectura insiste en la adecuación al trabajo: una alternativa económica puede conservar su ventaja cuando se usa en tareas que resuelve bien.
También sostiene que dar protagonismo a esas excepciones favorece el argumento comercial de los proveedores de modelos de frontera.
Una cuenta aritmética muestra la tensión: con una sola tarifa, pagar la mitad por unidad y consumir el triple eleva el gasto 50%. El descuento y el volumen terminan en la misma factura.
La factura incluye más que el modelo
Microsoft documenta esta diferencia para los hubs de Foundry clásico. Una aplicación puede generar cargos por tokens de entrada y salida, búsqueda, máquinas virtuales, almacenamiento y red.
Algunos recursos siguen generando cargos cuando el equipo deja de trabajar en el proyecto. Microsoft incluso documenta servicios que permanecen después de borrar el hub, hasta que se eliminan por separado. Detener una actividad y terminar sus costos son operaciones distintas.
Para estos proyectos, Microsoft recomienda revisar todos los recursos de Azure utilizados por la aplicación y configurar presupuestos y alertas. Una tarifa más baja por token puede convivir con una factura mayor si aumenta el consumo o permanecen activos otros servicios.
El costo real de un proyecto de IA depende del consumo del modelo y de los recursos que siguen generando cargos. Mientras el 98% de las organizaciones usa herramientas de IA para programar y solo el 42% las incluye en sus reportes de costos de IA, el presupuesto puede fallar antes de calcular el siguiente trabajo.
