Por que o agente de IA que funcionava para de funcionar
Agentes de IA pioram com o tempo sem dar aviso: o modelo é aposentado, o sistema muda, o contexto envelhece. O que causa isso e como evitar.

- Um agente de IA não quebra como um programa comum: ele continua respondendo, só que pior, e ninguém percebe até um cliente reclamar.
- As causas mais comuns são quatro: o modelo é aposentado ou atualizado, um sistema ligado ao agente muda, as informações que ele consulta ficam velhas e o volume cresce.
- Pesquisas de 2025 e 2026 mostram que a qualidade do contexto que o agente recebe prevê a confiabilidade dele melhor do que o modelo escolhido.
- A solução é tratar o agente como operação contínua: testar com casos reais todo mês, corrigir o que piorou e trocar o modelo com planejamento.
Um agente de IA que funcionava bem em março pode estar errando em setembro sem que ninguém tenha tocado nele. Não aparece mensagem de erro e nada trava na tela. Ele continua respondendo, com a mesma segurança, só que pior.
Este texto explica por que isso acontece e o que fazer para não descobrir pelo cliente.
Agente de IA não quebra, piora
Um sistema comum, quando dá problema, para. O boleto não é gerado, a tela mostra um erro, alguém liga para o suporte.
Um agente de IA falha de outro jeito. Ele sempre devolve uma resposta. Se a informação que ele consulta ficou velha, ele responde com a informação velha. Se o sistema do lado mudou um campo, ele preenche o campo errado. E faz isso com o mesmo tom confiante de sempre.
Automação comum quebra e avisa. Agente de IA piora e não avisa.
Por isso a piora demora a ser notada. Quem percebe primeiro costuma ser o cliente que recebeu o prazo errado ou o financeiro que achou uma diferença no fechamento.
As quatro causas mais comuns
O modelo muda ou é aposentado. Os fornecedores de IA trocam de modelo o tempo todo. A Anthropic aposentou o Claude Sonnet 4 e o Opus 4 em 15 de junho de 2026, e o Opus 4.1 em 5 de agosto de 2026. A documentação é direta: depois da data, as chamadas para o modelo antigo falham. A OpenAI desligou a Assistants API, usada por muitos agentes, em 26 de agosto de 2026. Mesmo quando o modelo não sai do ar, uma versão nova se comporta diferente. Um estudo de Stanford e Berkeley mostrou que o GPT-4 caiu de 84% para 51% de acerto numa mesma tarefa entre as versões de março e junho de 2023.
Um sistema ligado ao agente muda. O ERP atualiza, o CRM ganha um campo novo, a planilha de preços muda de formato. O agente continua lendo e escrevendo como antes, só que agora no lugar errado.
O contexto envelhece. O agente responde com base nos documentos, regras e tabelas que recebeu. Quando a política de trocas muda e o documento não, ele segue informando a regra antiga.
O volume cresce. Um agente testado com vinte conversas por dia se comporta diferente com duzentas. Históricos mais longos e mais informação misturada deixam o modelo mais sujeito a erro.
O problema costuma estar no contexto, não no modelo
Quando um agente começa a errar, a reação comum é trocar de modelo. Na maioria das vezes, o problema está no que ele recebe para ler.
Duas pesquisas recentes apontam na mesma direção:
- Contexto longo piora a resposta. Em julho de 2025, a Chroma testou 18 modelos, entre eles GPT-4.1, Claude 4 e Gemini 2.5, e concluiu que o desempenho cai conforme a quantidade de texto de entrada aumenta, de formas pouco previsíveis. Um único trecho irrelevante no meio já atrapalha.
- A qualidade do contexto prevê a confiabilidade. Um estudo publicado em julho de 2026 manteve o modelo fixo e variou só o contexto. Com contexto fraco, os agentes inventaram informação, usaram ferramentas do jeito errado e ignoraram regras. O título do estudo resume a ideia: o contexto falha primeiro.
Outro estudo, de maio de 2026, acompanhou agentes por até 200 sessões seguidas. Mesmo com o modelo fixo, a precisão caiu com o tempo, porque a memória do agente cresce, é resumida e se mistura. E os testes de comportamento continuaram passando enquanto a precisão dos fatos piorava.
Na prática, isso significa que um agente bom depende de alguém cuidar do que ele sabe: documentos atualizados, regras claras e informação desnecessária fora do caminho.
Construir ficou fácil. Manter é o trabalho
Hoje dá para montar um agente em poucos dias com ferramentas acessíveis. Por isso o mercado está cheio de projetos que funcionaram na demonstração e pararam alguns meses depois.
O Gartner prevê que mais de 40% dos projetos de agentes de IA serão cancelados até o fim de 2027, por custo alto, valor pouco claro ou falta de controle de risco. Construir não costuma ser o problema. Sem ninguém responsável pela operação, o agente vai perdendo valor até alguém desligar.
O que fazer para o agente continuar funcionando
- Monte uma bateria de casos-teste. Vinte a trinta situações reais da operação, com a resposta certa conhecida. É a régua para saber se o agente melhorou ou piorou.
- Rode os testes todo mês. E também sempre que um sistema ligado ao agente mudar. Compare com o mês anterior.
- Cuide do que o agente lê. Documento que mudou precisa ser atualizado. Documento que ninguém usa mais precisa sair.
- Acompanhe o calendário dos modelos. Os fornecedores publicam as datas de aposentadoria com antecedência. Troque antes, teste com os mesmos casos e só vire a chave quando o resultado for igual ou melhor.
- Tenha um responsável. Alguém precisa receber o alerta, entender o que piorou e corrigir. Sem isso, o resto não acontece.
Na Elev, é assim que funcionam os agentes que construímos: a construção vem junto com a operação. Testamos todo mês com os casos da sua empresa, corrigimos o que piorou e trocamos o modelo quando faz sentido. Se você tem um agente rodando sem ninguém olhando, ou quer construir um que continue funcionando, veja como trabalhamos com IA personalizada ou fale com a gente.
Fontes
- Deprecações de modelos, documentação da Anthropic.
- Deprecações da API, documentação da OpenAI.
- How is ChatGPT's behavior changing over time?, Chen, Zaharia e Zou, 2023.
- Context Rot, Chroma, julho de 2025.
- AI Agents Do Not Fail Alone: The Context Fails First, Bousetouane, julho de 2026.
- Your Agents Are Aging Too, Zhu et al., maio de 2026.
- Gartner prevê o cancelamento de mais de 40% dos projetos de agentes de IA até 2027, Gartner, junho de 2025.
Perguntas frequentes
Por que meu agente de IA começou a errar se ninguém mexeu nele?
Porque tudo em volta dele mexeu. O fornecedor atualiza ou aposenta o modelo, o sistema que ele consulta muda um campo, os documentos que ele usa ficam desatualizados. O agente segue respondendo com confiança, só que com base em algo que já não é verdade.
Com que frequência um agente de IA precisa de manutenção?
O mínimo razoável é um teste por mês com casos reais da operação, e uma revisão sempre que um sistema ligado a ele mudar ou o fornecedor anunciar a troca do modelo. A Anthropic, por exemplo, avisa com pelo menos 60 dias de antecedência antes de desligar um modelo.
O que acontece quando um modelo de IA é aposentado?
As chamadas para aquele modelo deixam de funcionar na data marcada. Se o agente não foi trocado e testado antes, ele simplesmente para. Aconteceu com vários modelos da Anthropic e da OpenAI entre 2025 e 2026.
Vale a pena contratar só a construção de um agente de IA?
Raramente. Construir ficou mais barato a cada ano; o que custa é manter funcionando. Um agente sem ninguém responsável pela operação tende a ficar pior a cada mês, e o prejuízo aparece no atendimento ou no financeiro, não no painel.
Como saber se o agente está piorando?
Com uma bateria fixa de casos-teste: perguntas e tarefas reais, com a resposta certa conhecida. Roda-se a mesma bateria todo mês e compara-se o resultado. Sem isso, a piora só aparece quando alguém reclama.
Receba os próximos textos.
Um e-mail quando sair texto novo. Sem sequência de vendas, sem frequência inventada.
Publicado em 23 de setembro de 2026