El verdadero costo de la IA es un costo unitario. Casi nadie lo mide.
El costo de la IA en una empresa no es la factura de la API. Es el costo total de producir un resultado de IA útil, una vez que se cuentan la inferencia, la capacidad de las GPU detrás, los datos y la integración, la revisión humana, los reintentos y la gobernanza. El precio por token cayó unas diez veces al año, pero las facturas de IA de las empresas están subiendo, porque los modelos de razonamiento y los agentes consumen muchos más tokens por tarea. Las empresas que ganarán la próxima fase son las que sepan responder a una pregunta engañosamente simple: ¿cuánto cuesta de verdad una unidad de nuestra IA, y es rentable entregarla?
Lo esencial
El precio por token se desploma, pero la factura total sube porque cada tarea consume muchos más tokens (el efecto Jevons). Costee el resultado de IA por su causa, con el TDABC, y descubrirá qué casos de uso son rentables y cuáles drenan utilidad. La IA deja de ser un gasto que nadie entiende y pasa a ser una decisión de rentabilidad.
01 · La fórmula del costo unitario de la IA0%
La fórmula del costo unitario de la IA, en una línea
Contribución neta = valor del resultado - ese costo.
Cuatro términos, cada uno con su tasa y su cantidad. El primero es el único que aparece en la factura.
¿Cuánto cuesta de verdad la IA a una empresa?
Ilustrativo. El precio de la API por token es la punta visible. Bajo la superficie están el costo de capacidad de las GPU (buena parte ociosa), la preparación de datos y la integración, la revisión humana que valida el resultado de la IA, los reintentos y la gobernanza. Una cuenta de resultados estándar no muestra nada de esto como costo de la IA.
Hay una contradicción en el centro de la conversación sobre IA. Los estudios patrocinados por proveedores reportan varios dólares de retorno por cada dólar gastado, mientras que la investigación independiente concluye que la mayoría de las organizaciones no puede señalar ningún efecto en sus resultados. Ambas cosas pueden ser ciertas a la vez, por la misma razón: el retorno de la IA se afirma mucho y se mide poco. Cuando nadie ha costeado un solo resultado de IA, nadie puede decir si compensa. Esta brecha no es un problema de tecnología. Es un problema de contabilidad de costos, y es justo el que existimos para resolver.
El hecho peor entendido sobre el costo de la IA es que tokens más baratos no significan facturas menores. El precio de generar un token de una calidad dada se ha desplomado, una tendencia que a16z llamó LLMflation. Pero los tokens más baratos invitan a un uso mucho más intensivo de tokens. Un flujo lineal simple de 2023 podía costar unos centavos por interacción; un sistema agéntico orquestado en 2026, con herramientas, bucles de razonamiento y contexto reenviado, puede costar más de un dólar por la misma interacción, unas treinta veces más según una estimación de EY. Es el clásico efecto Jevons: cuando un recurso se abarata por unidad, el consumo total puede crecer más rápido de lo que baja el precio.
¿Cómo calcula el TDABC el costo de la IA?
El costeo por actividades basado en el tiempo (TDABC) se hizo exactamente para esto. El costo de un resultado de IA es la suma de: tokens por precio por token, más GPU-segundos por la tasa de capacidad práctica, más minutos de revisión humana por el costo cargado, más el overhead de reintentos y gobernanza. La contribución neta es el valor del resultado menos ese costo. Cuando se construye por caso de uso, aparece una curva de la ballena de la IA: algunos casos de uso pagan muy bien, muchos quedan a la par, y una cola destruye utilidad en silencio. Sin este número, la IA es fe; con él, es gestión.
¿Por qué sube la factura de IA si el precio por token está bajando?
No es una contradicción, es el efecto Jevons aplicado a la IA: cuando un recurso se abarata por unidad, el consumo total puede crecer más rápido de lo que baja el precio. Dos fuerzas empujan a la vez. Los modelos de razonamiento piensan produciendo largas cadenas internas de tokens antes de responder. Y los sistemas agénticos reenvían el contexto, entran en ciclos, se corrigen y encadenan llamadas.
El efecto práctico es que un servicio vendido por suscripción plana cambia de signo sin que nadie toque el precio: el usuario intensivo, que era el mejor cliente, pasa a ser el más caro de servir. Esa fue la razón por la que tantas herramientas de programación repreciaron a lo largo de 2025. El punto no es que la suscripción plana esté mal; funciona bien mientras el consumo por usuario sea parecido. Se rompe cuando la variación entre usuarios se vuelve grande, que es justo lo que provocan los agentes.
La mayor parte de la factura de GPU es capacidad que nadie usó
Este es el término que suele salir mal, así que conviene hacer la división en voz alta. Tome una instancia de GPU reservada a 3,00 US$ la hora. Reservada significa que se paga corra algo en ella o no, de modo que en un año son 8.760 horas y 26.280 US$. La capacidad práctica, una vez descontadas las ventanas de mantenimiento, las actualizaciones y el tiempo que el planificador no puede usar, suele rondar el 85 por ciento de los segundos teóricos: 26.805.600 GPU-segundos de 31.536.000.
Póngale ahora una carga real. Suponga que la tarjeta entrega 400.000 resultados de IA en el año y que cada uno consume unos 3 GPU-segundos. Son 1.200.000 GPU-segundos de trabajo, costeados en 1.200.000 × 0,00098 = 1.176 US$. La tarjeta costó 26.280. La diferencia, 25.104 US$, es capacidad no utilizada, alrededor del 96 por ciento de lo que esa GPU costó, con una utilización del 4,5 por ciento.
De ahí salen dos conclusiones, y la segunda es la que suele sorprender. La primera es que el costo de GPU que pertenece a un resultado de IA es pequeño, aquí una décima de centavo. La segunda es que los 25.104 US$ de capacidad ociosa no pertenecen a ningún resultado. Si se reparten entre los 400.000 resultados, cada uno carga 6,3 centavos de la ociosidad ajena, lo que hace que la IA parezca cara y que la solución parezca escribir mejores prompts. Repórtelos como línea propia y la solución se vuelve evidente: consolidar la carga, redimensionar la reserva o vender las horas libres. Esa elección de reporte es todo el argumento para costear la IA a capacidad práctica.
Ilustrativo. Las tasas y la utilización varían mucho según el montaje, y un clúster compartido con buena planificación queda bastante mejor que esto. La mecánica no cambia: la capacidad de GPU ociosa es una cifra de gestión y desaparece en el instante en que se promedia dentro de un costo unitario.
Un ejemplo con la cuenta hecha: cuánto cuesta un resultado de IA
Tome un resultado de un asistente de revisión de documentos: el usuario hace la pregunta, el modelo lee el archivo, redacta una respuesta y una persona la revisa antes de que salga. Cuatro términos, cada uno con su tasa y su cantidad, y la aritmética cuadra.
| Término | Cantidad × tasa | Costo |
|---|---|---|
| Tokens | 40.000 × 0,000002 US$ | 0,08 US$ |
| Capacidad de GPU | 3 GPU-segundos × 0,00098 US$ | 0,003 US$ |
| Revisión humana | 2 minutos × 0,60 US$ cargados | 1,20 US$ |
| Reintentos y gobernanza | provisión fija por resultado | 0,20 US$ |
| Costo total de un resultado | 1,48 US$ | |
| Lo que mostraba la factura de la API | 0,08 US$ |
Cifras ilustrativas. 0,08 + 0,003 + 1,20 + 0,20 = 1,48 US$. La línea de la factura es 0,08, así que el costo completo es unas dieciocho veces el visible.
Lo interesante no son las dieciocho veces. Es qué término domina. La revisión humana es 1,20 de los 1,48, alrededor del 81 por ciento de lo que cuesta el resultado, y los dos términos sobre los que discute todo el mundo, tokens y GPU, suman menos del seis por ciento. Con esta forma de carga, negociar un mejor precio por token no mueve casi nada, y quitar un minuto a la revisión, estrechando lo que una persona tiene que revisar en lugar de revisar con menos cuidado, mueve el 40 por ciento del costo.
Esto no se sostiene en todas partes. Un proceso por lotes sin persona en el circuito tiene un perfil completamente distinto, y ahí el término de los tokens es casi toda la respuesta. Y por eso mismo se costea en lugar de suponer: el término que hay que atacar es el que la propia aritmética pone arriba, y mientras nadie haga la división nadie en la sala sabe cuál es.
¿Basta el FinOps de IA para gestionar el margen?
Las herramientas de FinOps, tokenomics y showback dicen dónde aterrizó el gasto: qué proyecto, qué equipo, qué modelo quemó cuánto. Eso es útil y es un avance real de visibilidad, y una empresa que todavía no tiene ese rastreo debería empezar por ahí antes que por cualquier modelo de costeo.
El límite aparece después. Saber dónde cayó el costo no dice por qué ocurrió, ni qué parte se paga sin usar. El showback informa que la partida de GPU costó 26.280 US$; la asignación por tiempo informa que 25.104 US$ de eso es capacidad ociosa y que los 400.000 resultados del año consumieron 1.176 US$. Es la diferencia entre una factura y una decisión, y ninguna etiqueta de proyecto produce la segunda.
Preguntas frecuentes
- ¿Cuánto cuesta de verdad la IA a una empresa?
- Bastante más de lo que sugiere la línea de la API o de la suscripción. El costo completo de un resultado de IA suma los tokens consumidos, el costo de capacidad de las GPU que ejecutan el modelo (buena parte de ella ociosa), la preparación de datos y la integración, la revisión humana necesaria para confiar en la salida, los reintentos cuando el modelo se equivoca, y la gobernanza. La única manera de conocer su propia cifra es costear un resultado de punta a punta.
- ¿Por qué sube la factura de IA si el precio por token está bajando?
- Porque los tokens más baratos invitan a un uso mucho más intensivo de tokens. Los modelos de razonamiento y los sistemas agénticos reenvían contexto y recorren muchos pasos, consumiendo varias veces más tokens por tarea que una llamada simple. El consumo crece más rápido de lo que baja el precio unitario, así que la factura total sube aunque cada token se abarate.
- ¿Cómo se calcula el costo unitario de un resultado de IA?
- Sumando cuatro términos: tokens por el precio por token, GPU-segundos por la tasa de capacidad práctica, minutos de revisión humana por el costo cargado, y una provisión para reintentos y gobernanza. El término de GPU es el costo completo del recurso dividido por la capacidad práctica, no por el tiempo que la tarjeta estuvo efectivamente ocupada.
- ¿Se puede calcular esto sin cambiar de sistema?
- Para una primera cifra sí, y conviene empezar así. Los datos que necesita (conteo de llamadas por caso de uso, tokens por llamada, costo del parque de GPU y una estimación de minutos de revisión) suelen estar en los registros de la plataforma y en sus registros financieros. La hoja de cálculo deja de servir cuando el cálculo tiene que correr todos los meses y explicarse línea por línea ante la dirección.
- ¿Cómo saber si un caso de uso de IA es rentable?
- Ordenando los casos de uso del más rentable al más destructivo y dibujando su curva de la ballena. El núcleo rentable suele financiar una cola deficitaria invisible, y solo la asignación del costo completo, con la GPU ociosa reportada aparte, muestra cuáles crean y cuáles destruyen margen.
Profundizar
¿Cuánto cuesta de verdad su IA?
Empiece con un diagnóstico de rentabilidad y descubra qué casos de uso de IA compensan.
- Duración
- 10 minutos
- Recibe
- Puntuación, 7 dimensiones, referencia del sector
- Precio
- Gratis, sin email
¿Su modelo de costos respalda sus decisiones de precio, mix y capacidad? El Profit Check gratuito toma de 10 minutos y entrega una lectura de su modelo en siete dimensiones. O escríbanos por la página de contacto.
América Latina
Hacer el Profit CheckPrueba
Un distribuidor en Nueva Zelanda. €1,335M de costo de servir hecho visible, luego reducido a la mitad, y 830 clientes deficitarios reducidos a 295.
Leer el caso →Con quién vas a hablar
Miguel Guimarães, Socio fundador
Trabajando en costos y rentabilidad desde hace más de 25 años. Presentó el caso de cost-to-serve de Damco en Managing for Profit (Ámsterdam RAI, diciembre de 2009), en el mismo programa que Robert S. Kaplan.
Llame al +351 910 313 731