07/10/2026

Custo da IA precisa incluir falhas e custo do tempo humano em revisão

Por Adilson Damasio, Diretor de Operações na Faiston 

 

As empresas costumam acompanhar a conta da inteligência artificial generativa pela unidade que o fornecedor usa para cobrar, o volume de tokens de entrada e de saída de cada chamada ao modelo, e esse número orienta a comparação entre modelos, a negociação de contratos e a projeção de orçamento.  

A medida explica a fatura, mas diz pouco sobre o que a operação recebeu em troca, porque parte das chamadas gera respostas que alguém descarta, refaz ou corrige antes de usar. Com a passagem dos projetos-piloto para operações que atendem clientes e equipes internas em volume, a diferença entre o que a empresa paga e o que aproveita passou a pesar no orçamento de tecnologia. 

O custo que interessa ao negócio é o de cada resultado aproveitável: a resposta, o documento, a classificação ou a ação que chega ao usuário e cumpre a função sem retrabalho. Para chegar a esse número, é preciso somar ao gasto com tokens o custo das tentativas descartadas, das tarefas que terminaram sem resultado, das ferramentas e bases de dados que o sistema consulta a cada etapa e das horas de revisão humana, e dividir o total pelo volume de resultados que a área usuária aceitou. A gestão financeira de IA depende, por isso, de instrumentação técnica e de uma definição de negócio sobre o que conta como resultado em cada caso de uso. 

A distância entre medir consumo e medir resultado aparece na 6ª edição do State of FinOps, que a FinOps Foundation, divulgou em 2026 com respostas de 1.192 profissionais, cujas organizações somam mais de US$ 83 bilhões em gasto anual com nuvem, com 15% das respostas vindas das Américas do Sul e Central.  

Segundo o relatório, 98% dos respondentes incluem os gastos com IA entre as áreas que a equipe de FinOps gerencia hoje ou vai gerenciar no próximo ano, ante 63% na edição anterior e 31% dois anos antes. O estudo aponta a gestão de custos de IA como a principal competência que as equipes precisam desenvolver e reúne, entre as dificuldades mais citadas ao aplicar FinOps aos gastos com IA, a visibilidade sobre esses custos, a divisão do gasto entre as unidades de negócio e a medição do retorno.  

Entre os recursos que os profissionais gostariam de encontrar nas ferramentas e que ainda não existem, o mais pedido é o monitoramento detalhado do gasto com IA por tokens, por requisições a modelos de linguagem e por uso de GPU. 

 

Custo por resultado aproveitável começa na definição de cada caso de uso 

A área que usa a entrega precisa definir, com apoio da equipe de tecnologia, o que conta como resultado aproveitável em cada processo. No service desk, o critério pode ser o chamado encerrado, e na análise de documentos, a extração de dados que o revisor aprova sem correção. Em assistentes de programação, vale a sugestão de código que passa pela revisão e chega à produção, enquanto no atendimento ao cliente a referência precisa ser a conversa que resolve a solicitação sem transferência para um atendente e sem novo contato sobre o mesmo assunto. 

Entre o resultado aceito e o descartado ficam as respostas que o usuário aproveita depois de editar, e esse grupo precisa de registro próprio. As respostas editadas entram na conta com o tempo de edição, porque a economia que a empresa espera da IA depende de quanto trabalho humano a resposta ainda exige. A taxa de aceitação, que a equipe calcula sobre o total de respostas geradas, mostra que parcela da produção virou entrega, e a mesma conta, ponderada pelos tokens de cada resposta, mostra quanto do consumo ficou em tentativas que ninguém usou. 

Depois que a área registra essa definição, a empresa consegue comparar o custo por resultado com o custo do mesmo processo sem IA, medido pelas horas que a equipe dedicava a cada entrega e pelo valor dessas horas. A comparação orienta a escolha dos casos de uso que merecem ampliação e evita que a decisão dependa de demonstrações que não reproduzem as condições da operação diária, com volume, exceções e dados incompletos. 

 

Custo de cada resposta inclui tentativas, contexto e chamadas a ferramentas 

O consumo de tokens de uma mesma tarefa varia mais do que a fatura sugere, porque o modelo recebe a cada chamada, além da pergunta, as instruções do sistema, o histórico da conversa e os trechos de documentos que a aplicação recupera da base da empresa.  

Em fluxos com agentes, cada etapa em geral reenvia ao modelo o contexto acumulado, e o consumo de entrada cresce mais depressa que o número de passos, a menos que a aplicação resuma o histórico ou reaproveite o contexto em cache. Por isso, o custo médio por chamada esconde a distribuição do gasto, na qual uma parcela pequena de tarefas longas pode concentrar boa parte da conta. 

A nova chamada que a aplicação dispara depois de um erro ou de tempo esgotado, a resposta que a validação da própria aplicação rejeita por formato incorreto ou por violar regras de conteúdo e a resposta que o usuário pede de novo quando a primeira não atende geram cobrança como qualquer outra chamada, embora a tarefa termine com um único resultado. As falhas pesam da mesma forma quando um agente percorre várias etapas, consome tokens em cada uma e encerra a execução sem concluir a tarefa.  

A revisão humana não aparece na fatura de tecnologia, mas esse custo também precisa ser contabilizado. Quando associa tokens, tentativas, ferramentas e revisão à mesma tarefa, a equipe de FinOps calcula o custo por resultado aproveitável de cada caso de uso e acompanha a evolução desse número.  

Com essa avaliação, a empresa deixa de escolher o modelo pelo preço do token, já que um modelo mais barato pode sair mais caro por resultado quando exige mais tentativas, mais contexto e mais revisão. Antes de ampliar um caso de uso, passa a comparar o custo de cada resposta que chega pronta ao cliente ou à equipe interna com o custo do processo que a IA substitui, e essa conta oferece a medida de retorno que a fatura de tokens, sozinha, não mostra. 

 

Sobre a Faiston 

Fundada em 2001, e com um novo posicionamento de mercado desde 2021, a Faiston é uma integradora de serviços e soluções 100% nacional. Com sede em São Paulo, a empresa conta com mais de 300 funcionários e 5.500 parceiros de tecnologia em todo o Brasil. Para saber mais, acesse: https://faiston.com  


Legenda: Adilson Damasio, Diretor de Operações na Faiston 
Créditos: Arquivo/Reprodução