O verdadeiro custo da IA é um custo unitário. Quase ninguém o mede.
O custo da IA numa empresa não é a fatura da API. É o custo total de produzir um resultado de IA útil, depois de contar a inferência, a capacidade das GPUs por trás dela, dados e integração, revisão humana, repetições e governação. O preço por token caiu cerca de dez vezes por ano, mas as faturas de IA das empresas estão a subir, porque os modelos de raciocínio e os agentes consomem muito mais tokens por tarefa. As empresas que vão ganhar a próxima fase são as que conseguem responder a uma pergunta enganadoramente simples: quanto custa, de facto, uma unidade da nossa IA, e é rentável servi-la?
01 · Como se calcula o custo unitário da IA?0%
Como se calcula o custo unitário da IA?
Contribuição líquida = valor do resultado − esse custo.
Onde está a evidência em 2025 e 2026
Os números são atribuídos à respetiva fonte e refletem o estado do reporte em 2025-2026. O número do MIT mede organizações sem impacto mensurável no P&L, não uma taxa de falha técnica; é investigação preliminar e deve ser citado como tal.
Há uma contradição no centro da conversa sobre IA. Estudos patrocinados por fornecedores reportam vários dólares de retorno por cada dólar gasto, enquanto a investigação independente conclui que a maioria das organizações não consegue apontar qualquer efeito nos resultados. As duas coisas podem ser verdade ao mesmo tempo, pela mesma razão: o retorno da IA é muito alegado e raramente medido. Quando ninguém custeou um único resultado de IA, ninguém consegue dizer se ele compensa. Esta lacuna não é um problema de tecnologia. É um problema de contabilidade de custos, e é precisamente esse que existimos para resolver.
Porque é que as faturas de IA sobem se o preço por token está a cair?
O facto mais mal compreendido sobre o custo da IA é que tokens mais baratos não significam faturas menores. O preço de gerar um token de determinada qualidade colapsou, uma tendência a que a a16z chamou LLMflation. Mas tokens mais baratos convidam a um uso muito mais intensivo de tokens. Um workflow linear simples de 2023 podia custar uns cêntimos por interação; um sistema agêntico orquestrado em 2026, com ferramentas, ciclos de raciocínio e contexto re-enviado, pode custar mais de um dólar pela mesma interação, cerca de trinta vezes mais segundo uma estimativa da EY. É o clássico efeito Jevons: quando um recurso fica mais barato por unidade, o consumo total pode crescer mais depressa do que o preço desce. O resultado é que features de IA com preço fixo passam discretamente a dar prejuízo com utilizadores intensivos, razão pela qual os fornecedores de ferramentas de programação passaram 2025 a abandonar os planos fixos.
Quanto custa realmente a IA a uma empresa?
Ilustrativo. O preço da API por token é a ponta visível. Abaixo da superfície estão o custo de capacidade das GPUs (boa parte muitas vezes ociosa), a preparação de dados e a integração, a revisão humana que valida o output da IA, as repetições e a governação. Uma demonstração de resultados padrão não mostra nada disto como custo da IA.
Como é que o TDABC calcula o custo da IA?
A contabilidade de custos já resolveu um problema com exatamente a mesma forma do custo da IA. Uma GPU que alugamos à hora mas usamos só uma fração do tempo tem a mesma forma de uma máquina ou uma equipa que pagamos esteja ou não ocupada. O Time-Driven Activity-Based Costing, o método desenvolvido por Kaplan e Anderson, custeia um recurso à sua taxa de capacidade prática: o custo total de fornecer o recurso a dividir pela capacidade que ele consegue realisticamente entregar, com a parte não utilizada tornada visível em vez de escondida numa taxa inflacionada. Os dados do setor colocam a utilização média de GPU empresarial em valores de um só dígito, o que significa que a maior parte da fatura de GPU é o custo de capacidade não utilizada, uma rubrica que o TDABC foi feito para revelar.
A partir daí, o resto segue. O token passa a ser o cost driver, e o preço por token a sua taxa de driver. Um processo assistido por IA passa a ser uma atividade com uma equação de tempo curta que combina unidades: tantos tokens, tantos GPU-segundos, tantos minutos de revisão humana. Some esses custos e consegue atribuir o custo da IA a um processo, a um produto, a um cliente ou a um caso de uso, exatamente como o custeio baseado em atividades atribui custos indiretos há trinta anos. O mundo FinOps está a redescobrir isto sob nomes novos, tokenomics e showback, mas o tagging diz onde o custo caiu, não porque ocorreu nem que capacidade ficou ociosa. É esse rigor que a contabilidade de custos clássica acrescenta.
O showback diz onde o custo da IA caiu. O custeio baseado em atividades diz porque ocorreu, e que parte dele está a pagar sem usar.
A maior parte da fatura de GPU é capacidade que ninguém usou
É este o termo que costuma sair errado, por isso vale a pena fazer a divisão em voz alta. Considere uma instância de GPU reservada a 3,00 euros por hora. Reservada significa que paga quer corra alguma coisa nela quer não, portanto ao longo de um ano são 8.760 horas e 26.280 euros. A capacidade prática, depois de retiradas as janelas de manutenção, as atualizações e o tempo que o escalonador não consegue usar, anda normalmente à volta de 85 por cento dos segundos teóricos: 26.805.600 GPU-segundos em 31.536.000.
Ponha-lhe agora uma carga de trabalho real. Digamos que a placa serve 400.000 resultados de IA no ano e que cada um consome cerca de 3 GPU-segundos. São 1.200.000 GPU-segundos de trabalho, custeados em 1.200.000 × 0,00098 = 1.176 euros. A placa custou 26.280. A diferença, 25.104 euros, é capacidade não utilizada, cerca de 96 por cento do que aquela GPU lhe custou, e a taxa de utilização é de 4,5 por cento.
Daqui saem duas conclusões, e é a segunda que costuma apanhar as pessoas de surpresa. A primeira é que o custo de GPU que pertence a um resultado de IA é pequeno, cerca de um décimo de cêntimo neste caso. A segunda é que os 25.104 euros de capacidade ociosa não pertencem a resultado nenhum. Se os espalhar pelos 400.000 resultados, cada um passa a carregar 6,3 cêntimos da ociosidade dos outros, o que faz a IA parecer cara e faz a solução parecer melhores prompts. Reporte-os como linha própria e a solução torna-se óbvia: consolidar a carga, redimensionar a reserva ou vender as horas livres. É essa escolha de reporte, e só ela, que justifica custear a IA pela capacidade prática.
Ilustrativo. As taxas e a utilização variam muito conforme a configuração, e um cluster partilhado com bom escalonamento fica bastante melhor do que isto. A mecânica não muda: a capacidade de GPU não utilizada é um número de gestão e desaparece no instante em que é diluída num custo unitário.
Um exemplo com a conta feita: quanto custa um resultado de IA
Tome um resultado de um assistente de revisão documental: o utilizador faz a pergunta, o modelo lê o ficheiro, redige uma resposta, e uma pessoa verifica-a antes de sair. Quatro termos, cada um com uma taxa e uma quantidade, e a aritmética fecha.
| Quantidade × taxa | Custo | |
|---|---|---|
| Tokens | 40.000 × 0,000002 euros | 0,08 euros |
| Capacidade de GPU | 3 GPU-segundos × 0,00098 euros | 0,003 euros |
| Revisão humana | 2 minutos × 0,60 euros carregados | 1,20 euros |
| Repetições e governação | provisão fixa por resultado | 0,20 euros |
| Custo total de um resultado | 1,48 euros | |
| O que a fatura da API mostrava | 0,08 euros |
Números ilustrativos. 0,08 + 0,003 + 1,20 + 0,20 = 1,48 euros. A linha da fatura são 0,08, portanto o custo completo é cerca de dezoito vezes o custo visível.
A parte interessante não são as dezoito vezes. É qual dos termos domina. A revisão humana são 1,20 dos 1,48, à volta de 81 por cento do que o resultado custa, e os dois termos sobre os quais toda a gente discute, tokens e GPU, somam menos de seis por cento. Nesta forma de carga de trabalho, negociar um preço melhor por token não move quase nada, e tirar um minuto à revisão, estreitando o que uma pessoa tem de verificar em vez de verificar com menos cuidado, move 40 por cento do custo.
Isto não se mantém em todo o lado. Um processamento em lote sem pessoa no circuito tem um perfil completamente diferente, e aí o termo dos tokens é quase toda a resposta. E é precisamente por isso que se custeia em vez de se presumir: o termo a atacar é aquele que a sua própria aritmética põe no topo, e enquanto ninguém fizer a divisão ninguém na sala sabe qual é.
Perguntas frequentes
- Quanto custa, de facto, a IA a uma empresa?
- Mais do que a linha da API ou da subscrição sugere. O verdadeiro custo de um resultado de IA inclui os tokens consumidos, o custo de capacidade das GPUs que correm o modelo (boa parte muitas vezes ociosa), a preparação de dados e a integração, a revisão humana necessária para confiar no output, as repetições quando o modelo erra, e a governação. Os estudos de custo total de propriedade colocam o valor completo bem acima do preço visível da API; a única forma de saber o seu número é custear um resultado de ponta a ponta.
- Porque sobem as faturas de IA se o preço por token está a descer?
- Porque tokens mais baratos convidam a muito mais uso de tokens. Os modelos de raciocínio e os sistemas agênticos re-enviam contexto e percorrem muitos passos, consumindo várias vezes mais tokens por tarefa do que uma simples chamada de chatbot. O consumo de tokens cresce mais depressa do que o preço por token desce, por isso a fatura total sobe mesmo com cada token a ficar mais barato. É o efeito Jevons aplicado à IA.
- Como se calcula o custo unitário da IA?
- Trate-a como uma atividade. Custeie a capacidade de GPU à sua taxa de capacidade prática, o custo total do recurso a dividir pela capacidade que ele consegue realisticamente entregar. Use o token como cost driver, com o preço por token como taxa. Escreva o processo assistido por IA como uma equação de tempo que combina tokens, GPU-segundos e minutos de revisão humana, e depois atribua o resultado ao cliente, produto ou processo que o desencadeou. É o Time-Driven Activity-Based Costing aplicado à IA.
- A nossa IA é rentável?
- Só consegue responder a isso depois de ter um custo unitário. Com o custo de um resultado de IA estabelecido, coloca-o face ao valor que esse resultado cria e ordena clientes, produtos ou features do mais ao menos rentável de servir com IA. O resultado é uma curva da baleia para a IA: um núcleo rentável, um meio plano, e uma cauda onde a IA discretamente devolve margem. A maioria das organizações nunca a desenhou.
- O que é o AI FinOps, e chega?
- O AI FinOps, por vezes chamado tokenomics, é a disciplina de medir e atribuir o gasto de IA, e é um avanço real em visibilidade. Não chega por si só porque o showback por tags diz onde o custo caiu, não porque ocorreu nem quanta capacidade ficou por usar. O custeio baseado em atividades fornece a lógica de alocação que falta e torna visível o custo de capacidade não utilizada, e é isso que transforma o acompanhamento do gasto em gestão de rentabilidade.
Descubra o custo unitário real da sua IA.
O Profit Check mostra onde o seu custo de servir, IA incluída, está escondido, em 10 minutos, sem carregar dados.
- Duração
- 10 minutos
- Recebe
- Pontuação, 7 dimensões, referência do sector
- Preço
- Grátis, sem email
Prova
Um distribuidor na Nova Zelândia. €1,335M de custo de servir tornado visível, depois reduzido a metade, e 830 clientes deficitários reduzidos a 295.
Ler o estudo de caso →Com quem vai falar
Miguel Guimarães, Sócio-fundador
A trabalhar em custos e rentabilidade há mais de 25 anos. Apresentou o caso de cost-to-serve da Damco no Managing for Profit (Amesterdão RAI, dezembro de 2009), no mesmo programa que Robert S. Kaplan.
Ligue +351 910 313 731