Neste momento, a inteligência artificial (IA) deixou de ser promessa para passar a ser prática corrente nas empresas. Com essa transição, a questão central mudou, de forma silenciosa, mas decisiva: já não discutimos se a IA funciona, nem se o seu potencial é real, até porque essa fase já está ultrapassada.
A pergunta agora é outra: quanto custa colocá-la a funcionar em escala e como medir, de forma objetiva, o valor que gera, sem perder de vista a relação benefício/custo? Entrámos na era da economia de consumo da IA. Tal como qualquer outro recurso empresarial crítico, a IA exige: orçamento, métricas, otimização e, sobretudo, governação. Dado que os custos de IA não tendem para zero e o seu potencial é incalculável, é muito fácil que o consumo de tokens ultrapasse qualquer previsão.
Da economia da cloud à economia dos tokens
Este padrão não é inédito. Quem acompanhou a adoção da cloud reconhece-o bem: primeiro o entusiasmo pela capacidade e pela elasticidade aparentemente infinita, depois a realidade da fatura ao final do mês bem como a necessidade de demonstrar o ROI e, por fim, a emergência de práticas de controlo e de otimização financeira do consumo de cloud (FinOps), que transformaram a infraestrutura numa disciplina de gestão.
Hoje, assistimos ao mesmo fenómeno. O lift-and-shift de há alguns anos, migrar tudo para a cloud sem repensar as arquiteturas, tem agora um equivalente direto: enviar tudo para um LLM. Documentos completos, longos históricos de conversa e contexto redundante são enviados para os modelos de linguagem de grande escala (large language models – LLMs), muitas vezes sem qualquer preocupação com a eficiência, a latência ou custos. O resultado é previsível: consumo excessivo de tokens, soluções difíceis de escalar e maior risco de exposição de dados internos e conhecimento da organização com os modelos de IA.
Importa, no entanto, clarificar um ponto essencial: o facto de algumas tarefas ficarem, pontualmente, mais caras quando executadas com IA não é um sinal de estagnação da tecnologia. Pelo contrário, é um sinal de maturidade, de adoção generalizada e de integração nos processos de negócio. Foi assim com praticamente todas as tecnologias nos negócios desde o início do século XX como a rede ferroviária, a fibra ótica, os smartphones ou própria cloud. Primeiro, o entusiasmo com as novas capacidades, depois a expansão desordenada, mais tarde, a necessidade de otimizar custos e de estabelecer modelos sustentáveis de utilização e, por fim, a integração plena no funcionamento das organizações. Quando o custo passa a fazer parte da equação, a tecnologia deixa de ser uma experiência para passar a ser uma capacidade operacional crítica. É precisamente essa transição que a Inteligência Artificial está agora a atravessar.
Para gerir, é preciso primeiro medir. Na IA generativa, a unidade de medida é o token: um pequeno segmento de texto (cerca de 4 a 5 caracteres) que os modelos processam e geram, e que determina diretamente o custo de cada interação.
A partir desta unidade de medida nasce uma nova lógica de gestão: a economia dos tokens. Quantos tokens consome cada pedido (request)? Cada utilizador? Cada processo de negócio? Quanto custa processar um pedido de cliente, responder a um ticket de suporte, analisar um contrato ou gerar um relatório? E, acima de tudo, qual é a relação entre esse custo e o valor efetivamente criado? Sem esta contabilidade analítica do consumo de tokens, qualquer avaliação sobre a produtividade ou o retorno do investimento em IA será necessariamente incompleta.
TokenOps: uma nova disciplina para governar a IA
É neste contexto que poderá emergir uma nova disciplina, na interseção entre arquitetura, dados, engenharia e finanças: o TokenOps. À semelhança do que o FinOps fez pela cloud, o TokenOps procura otimizar a gestão operacional e financeira do consumo de IA, garantindo que cada token utilizado contribui para gerar valor para o negócio.
Na prática, isso traduz-se em decisões concretas, como:
- Model routing, selecionando o modelo mais adequado à complexidade de cada tarefa. Operações simples, como classificação, extração de informação ou resumo, podem recorrer a modelos mais leves e económicos, reservando os modelos mais avançados para tarefas de raciocínio complexo.
- Segmentação inteligente de documentos (chunking), dividindo a informação em blocos relevantes em vez de enviar documentos completos para o modelo.
- Recuperação seletiva de contexto, recorrendo a arquiteturas de retrieval-augmented generation (RAG), que identificam e fornecem apenas a informação necessária antes de cada chamada ao modelo.
- Monitorização contínua do custo, da latência, da qualidade das respostas e do consumo de tokens, reconhecendo que estas dimensões estão intimamente ligadas: demasiado contexto aumenta os custos, introduz latência e pode, paradoxalmente, degradar a qualidade das respostas.
A eficiência da IA começa nos dados
No centro desta equação estão os dados. As empresas acumulam volumes massivos de informação, nomeadamente: contratos, registos, relatórios, tickets, e-mails e outros documentos que alimentam os principais casos de uso de IA como a pesquisa de conhecimento interno, o apoio ao cliente, a análise documental e o reporting.
Contudo, é a qualidade, a estruturação e a segmentação desses dados, que determinam diretamente o consumo e o desempenho da IA. Dados duplicados, desatualizados ou mal segmentados obrigam os modelos a processar mais contexto para produzir resultados frequentemente piores. Em termos práticos, cada documento redundante que entra num fluxo de IA é pago três vezes: em consumo de tokens, em latência e em qualidade da resposta.
Os exemplos são familiares a qualquer organização. Responder a um ticket de suporte recorrendo apenas a três artigos relevantes é mais barato e mais eficaz do que enviar todo o histórico do cliente ao modelo. Da mesma forma, analisar cláusulas específicas de um contrato é significativamente mais eficiente do que processar o documento completo. De igual modo, gerar um relatório a partir de dados agregados e estruturados reduz drasticamente o consumo de tokens quando comparado com o processamento de dados em bruto.
A conclusão é clara: a eficiência da IA começa muito antes do modelo, começa nos dados.
Boas práticas para uma IA sustentável
Por isso, as organizações deverão adotar, desde o início, um conjunto de boas práticas:
- Medir o custo por operação e por processo de negócio.
- Investir na curadoria, na estruturação e segmentação dos dados, bem como a segmentação das fontes documentais antes de os disponibilizar aos modelos.
- Definir políticas claras de model routing, estabelecendo os critérios para selecionar o modelo mais adequado a cada tipo de tarefa.
- Avaliar continuamente a qualidade das respostas a par do custo, latência, consumo de tokens e qualidade das respostas.
- Atribuir responsabilidade organizacional pelo consumo de IA, tal como existe para a cloud ou para as telecomunicações.
Em última análise, as organizações terão de passar a gerir a IA como qualquer outro recurso estratégico: com disciplina, métricas e governação. Tal como a energia, a largura de banda ou o capital, a capacidade de inferência é um recurso poderoso, mas limitado e com um custo associado. A diferença entre gerar valor ou desperdício dependerá da forma como esse recurso é gerido.
O verdadeiro desafio já não é perceber o que a IA consegue fazer, mas sim quanto custa fazê-lo à escala, com que latência, com que qualidade e com que retorno para o negócio. Sem governação, dificilmente existirá IA escalável e sustentável. À medida que a adoção aumenta, o principal desafio deixa de ser tecnológico e passa a ser económico: gerir, otimizar e justificar cada token consumido.





