Ir para o conteúdo
Análise · O custo da IA

O verdadeiro custo da IA é um custo unitário. Quase ninguém o mede.

O custo da IA numa empresa não é a fatura da API. É o custo total de produzir um resultado de IA útil, depois de contar a inferência, a capacidade das GPUs por trás dela, dados e integração, revisão humana, repetições e governação. O preço por token caiu cerca de dez vezes por ano, mas as faturas de IA das empresas estão a subir, porque os modelos de raciocínio e os agentes consomem muito mais tokens por tarefa. As empresas que vão ganhar a próxima fase são as que conseguem responder a uma pergunta enganadoramente simples: quanto custa, de facto, uma unidade da nossa IA, e é rentável servi-la?

01 · Como se calcula o custo unitário da IA?0%

    Como se calcula o custo unitário da IA?

    O custo da IA, numa linha
    Custo de um resultado de IA = tokens × preço por token + GPU-segundos × taxa de capacidade prática + minutos de revisão humana × custo carregado + overhead de repetições e governação.
    Contribuição líquida = valor do resultado esse custo.

    Onde está a evidência em 2025 e 2026

    95%
    das organizações não reportam impacto mensurável no P&L da IA generativa, seis meses depois do piloto.
    MIT NANDA, 2025
    ~10×
    mais barato por token, por ano, a qualidade constante, mas a fatura total continua a subir à medida que as tarefas consomem mais tokens.
    a16z LLMflation, 2024
    >3 $
    custo previsto por resolução de IA no apoio ao cliente até 2030, acima de muitos agentes humanos offshore.

    Os números são atribuídos à respetiva fonte e refletem o estado do reporte em 2025-2026. O número do MIT mede organizações sem impacto mensurável no P&L, não uma taxa de falha técnica; é investigação preliminar e deve ser citado como tal.

    Há uma contradição no centro da conversa sobre IA. Estudos patrocinados por fornecedores reportam vários dólares de retorno por cada dólar gasto, enquanto a investigação independente conclui que a maioria das organizações não consegue apontar qualquer efeito nos resultados. As duas coisas podem ser verdade ao mesmo tempo, pela mesma razão: o retorno da IA é muito alegado e raramente medido. Quando ninguém custeou um único resultado de IA, ninguém consegue dizer se ele compensa. Esta lacuna não é um problema de tecnologia. É um problema de contabilidade de custos, e é precisamente esse que existimos para resolver.

    Porque é que as faturas de IA sobem se o preço por token está a cair?

    O facto mais mal compreendido sobre o custo da IA é que tokens mais baratos não significam faturas menores. O preço de gerar um token de determinada qualidade colapsou, uma tendência a que a a16z chamou LLMflation. Mas tokens mais baratos convidam a um uso muito mais intensivo de tokens. Um workflow linear simples de 2023 podia custar uns cêntimos por interação; um sistema agêntico orquestrado em 2026, com ferramentas, ciclos de raciocínio e contexto re-enviado, pode custar mais de um dólar pela mesma interação, cerca de trinta vezes mais segundo uma estimativa da EY. É o clássico efeito Jevons: quando um recurso fica mais barato por unidade, o consumo total pode crescer mais depressa do que o preço desce. O resultado é que features de IA com preço fixo passam discretamente a dar prejuízo com utilizadores intensivos, razão pela qual os fornecedores de ferramentas de programação passaram 2025 a abandonar os planos fixos.

    Quanto custa realmente a IA a uma empresa?

    Ilustrativo. O preço da API por token é a ponta visível. Abaixo da superfície estão o custo de capacidade das GPUs (boa parte muitas vezes ociosa), a preparação de dados e a integração, a revisão humana que valida o output da IA, as repetições e a governação. Uma demonstração de resultados padrão não mostra nada disto como custo da IA.

    Como é que o TDABC calcula o custo da IA?

    A contabilidade de custos já resolveu um problema com exatamente a mesma forma do custo da IA. Uma GPU que alugamos à hora mas usamos só uma fração do tempo tem a mesma forma de uma máquina ou uma equipa que pagamos esteja ou não ocupada. O Time-Driven Activity-Based Costing, o método desenvolvido por Kaplan e Anderson, custeia um recurso à sua taxa de capacidade prática: o custo total de fornecer o recurso a dividir pela capacidade que ele consegue realisticamente entregar, com a parte não utilizada tornada visível em vez de escondida numa taxa inflacionada. Os dados do setor colocam a utilização média de GPU empresarial em valores de um só dígito, o que significa que a maior parte da fatura de GPU é o custo de capacidade não utilizada, uma rubrica que o TDABC foi feito para revelar.

    A partir daí, o resto segue. O token passa a ser o cost driver, e o preço por token a sua taxa de driver. Um processo assistido por IA passa a ser uma atividade com uma equação de tempo curta que combina unidades: tantos tokens, tantos GPU-segundos, tantos minutos de revisão humana. Some esses custos e consegue atribuir o custo da IA a um processo, a um produto, a um cliente ou a um caso de uso, exatamente como o custeio baseado em atividades atribui custos indiretos há trinta anos. O mundo FinOps está a redescobrir isto sob nomes novos, tokenomics e showback, mas o tagging diz onde o custo caiu, não porque ocorreu nem que capacidade ficou ociosa. É esse rigor que a contabilidade de custos clássica acrescenta.

    O showback diz onde o custo da IA caiu. O custeio baseado em atividades diz porque ocorreu, e que parte dele está a pagar sem usar.

    A maior parte da fatura de GPU é capacidade que ninguém usou

    É este o termo que costuma sair errado, por isso vale a pena fazer a divisão em voz alta. Considere uma instância de GPU reservada a 3,00 euros por hora. Reservada significa que paga quer corra alguma coisa nela quer não, portanto ao longo de um ano são 8.760 horas e 26.280 euros. A capacidade prática, depois de retiradas as janelas de manutenção, as atualizações e o tempo que o escalonador não consegue usar, anda normalmente à volta de 85 por cento dos segundos teóricos: 26.805.600 GPU-segundos em 31.536.000.

    A taxa de custo de capacidade de uma GPU
    26.280 euros ÷ 26.805.600 GPU-segundos = 0,00098 euros por GPU-segundo.

    Ponha-lhe agora uma carga de trabalho real. Digamos que a placa serve 400.000 resultados de IA no ano e que cada um consome cerca de 3 GPU-segundos. São 1.200.000 GPU-segundos de trabalho, custeados em 1.200.000 × 0,00098 = 1.176 euros. A placa custou 26.280. A diferença, 25.104 euros, é capacidade não utilizada, cerca de 96 por cento do que aquela GPU lhe custou, e a taxa de utilização é de 4,5 por cento.

    Uma GPU reservada, um ano8.760 h × 3,00=26.280
    Taxa de custo de capacidade26.280 ÷ 26.805.600 s=0,00098
    Trabalho efectivamente custeado1.200.000 s × 0,00098=1.176
    Capacidade não utilizada26.280 − 1.176=25.104 euros

    Daqui saem duas conclusões, e é a segunda que costuma apanhar as pessoas de surpresa. A primeira é que o custo de GPU que pertence a um resultado de IA é pequeno, cerca de um décimo de cêntimo neste caso. A segunda é que os 25.104 euros de capacidade ociosa não pertencem a resultado nenhum. Se os espalhar pelos 400.000 resultados, cada um passa a carregar 6,3 cêntimos da ociosidade dos outros, o que faz a IA parecer cara e faz a solução parecer melhores prompts. Reporte-os como linha própria e a solução torna-se óbvia: consolidar a carga, redimensionar a reserva ou vender as horas livres. É essa escolha de reporte, e só ela, que justifica custear a IA pela capacidade prática.

    Ilustrativo. As taxas e a utilização variam muito conforme a configuração, e um cluster partilhado com bom escalonamento fica bastante melhor do que isto. A mecânica não muda: a capacidade de GPU não utilizada é um número de gestão e desaparece no instante em que é diluída num custo unitário.

    Um exemplo com a conta feita: quanto custa um resultado de IA

    Tome um resultado de um assistente de revisão documental: o utilizador faz a pergunta, o modelo lê o ficheiro, redige uma resposta, e uma pessoa verifica-a antes de sair. Quatro termos, cada um com uma taxa e uma quantidade, e a aritmética fecha.

    Quantidade × taxaCusto
    Tokens40.000 × 0,000002 euros0,08 euros
    Capacidade de GPU3 GPU-segundos × 0,00098 euros0,003 euros
    Revisão humana2 minutos × 0,60 euros carregados1,20 euros
    Repetições e governaçãoprovisão fixa por resultado0,20 euros
    Custo total de um resultado1,48 euros
    O que a fatura da API mostrava0,08 euros

    Números ilustrativos. 0,08 + 0,003 + 1,20 + 0,20 = 1,48 euros. A linha da fatura são 0,08, portanto o custo completo é cerca de dezoito vezes o custo visível.

    Custo completo de um resultado1,48Tokens, capacidade de GPU, revisão humana, repetições e governação.
    O que a fatura da API mostrava0,08A única linha que a maioria dos relatórios de custo de IA vê.
    Peso da revisão humana81%1,20 dos 1,48 - o termo dominante nesta carga.

    A parte interessante não são as dezoito vezes. É qual dos termos domina. A revisão humana são 1,20 dos 1,48, à volta de 81 por cento do que o resultado custa, e os dois termos sobre os quais toda a gente discute, tokens e GPU, somam menos de seis por cento. Nesta forma de carga de trabalho, negociar um preço melhor por token não move quase nada, e tirar um minuto à revisão, estreitando o que uma pessoa tem de verificar em vez de verificar com menos cuidado, move 40 por cento do custo.

    Isto não se mantém em todo o lado. Um processamento em lote sem pessoa no circuito tem um perfil completamente diferente, e aí o termo dos tokens é quase toda a resposta. E é precisamente por isso que se custeia em vez de se presumir: o termo a atacar é aquele que a sua própria aritmética põe no topo, e enquanto ninguém fizer a divisão ninguém na sala sabe qual é.

    Perguntas frequentes

    Quanto custa, de facto, a IA a uma empresa?
    Mais do que a linha da API ou da subscrição sugere. O verdadeiro custo de um resultado de IA inclui os tokens consumidos, o custo de capacidade das GPUs que correm o modelo (boa parte muitas vezes ociosa), a preparação de dados e a integração, a revisão humana necessária para confiar no output, as repetições quando o modelo erra, e a governação. Os estudos de custo total de propriedade colocam o valor completo bem acima do preço visível da API; a única forma de saber o seu número é custear um resultado de ponta a ponta.
    Porque sobem as faturas de IA se o preço por token está a descer?
    Porque tokens mais baratos convidam a muito mais uso de tokens. Os modelos de raciocínio e os sistemas agênticos re-enviam contexto e percorrem muitos passos, consumindo várias vezes mais tokens por tarefa do que uma simples chamada de chatbot. O consumo de tokens cresce mais depressa do que o preço por token desce, por isso a fatura total sobe mesmo com cada token a ficar mais barato. É o efeito Jevons aplicado à IA.
    Como se calcula o custo unitário da IA?
    Trate-a como uma atividade. Custeie a capacidade de GPU à sua taxa de capacidade prática, o custo total do recurso a dividir pela capacidade que ele consegue realisticamente entregar. Use o token como cost driver, com o preço por token como taxa. Escreva o processo assistido por IA como uma equação de tempo que combina tokens, GPU-segundos e minutos de revisão humana, e depois atribua o resultado ao cliente, produto ou processo que o desencadeou. É o Time-Driven Activity-Based Costing aplicado à IA.
    A nossa IA é rentável?
    Só consegue responder a isso depois de ter um custo unitário. Com o custo de um resultado de IA estabelecido, coloca-o face ao valor que esse resultado cria e ordena clientes, produtos ou features do mais ao menos rentável de servir com IA. O resultado é uma curva da baleia para a IA: um núcleo rentável, um meio plano, e uma cauda onde a IA discretamente devolve margem. A maioria das organizações nunca a desenhou.
    O que é o AI FinOps, e chega?
    O AI FinOps, por vezes chamado tokenomics, é a disciplina de medir e atribuir o gasto de IA, e é um avanço real em visibilidade. Não chega por si só porque o showback por tags diz onde o custo caiu, não porque ocorreu nem quanta capacidade ficou por usar. O custeio baseado em atividades fornece a lógica de alocação que falta e torna visível o custo de capacidade não utilizada, e é isso que transforma o acompanhamento do gasto em gestão de rentabilidade.

    Descubra o custo unitário real da sua IA.

    O Profit Check mostra onde o seu custo de servir, IA incluída, está escondido, em 10 minutos, sem carregar dados.

    Duração
    10 minutos
    Recebe
    Pontuação, 7 dimensões, referência do sector
    Preço
    Grátis, sem email
    Fazer o Profit Check

    Prova

    Um distribuidor na Nova Zelândia. €1,335M de custo de servir tornado visível, depois reduzido a metade, e 830 clientes deficitários reduzidos a 295.

    Ler o estudo de caso →

    Com quem vai falar

    Miguel Guimarães, Sócio-fundador

    A trabalhar em custos e rentabilidade há mais de 25 anos. Apresentou o caso de cost-to-serve da Damco no Managing for Profit (Amesterdão RAI, dezembro de 2009), no mesmo programa que Robert S. Kaplan.

    Ligue +351 910 313 731

    Workshops

    Traga o método para a sala.

    Um modelo de rentabilidade a funcionar, construído com dados reais, que leva consigo no fim do dia.

    Reservar lugar
    Miguel Guimarães

    Revisto por

    Miguel Guimarães

    Sócio-fundador, Cost and Profitability Consulting

    Mais de 150 projetos de Time-Driven ABC em 11 setores desde 2010, dentro do enquadramento de Kaplan e Anderson.

    Sobre o autor →

    Publicado

    M
    Pergunte-nos o que quiser
    costuma responder em minutos
    Olá. Respondo aqui mesmo às perguntas rápidas sobre custo, método e prazos. Para algo específico do seu negócio, passo-o a um especialista no WhatsApp.
    Grátis. Sem voltas de robô. Direto a um especialista.
    Mais lidos
    1. 1De Custos a Lucros - Workshop Prático TDABC + CostCtrl + IA Brasil - 25-26 Agosto 2026
    2. 2Workshop TDABC Presencial Porto - 13 Outubro 2026
    3. 3Workshop TDABC Presencial Lisboa - 15 Outubro 2026
    4. 4Eventos
    5. 5Análise Custo-Volume-Resultado (CVR) e Ponto Crítico
    6. 6Curva da baleia: o que é, como construir, simulador interativo
    7. 7Comece Aqui: Um Guia do Site
    8. 8A Curva da Baleia Revisitada: Como a Ler e O Que Fazer a Seguir
    9. 9Análise de Custo de Servir
    10. 10Custeio baseado em actividades orientado ao tempo: o ABC simples e escalável