Pular para o conteúdo

Por que o agente de IA que funcionava para de funcionar

Agentes de IA pioram com o tempo sem dar aviso: o modelo é aposentado, o sistema muda, o contexto envelhece. O que causa isso e como evitar.

Léo ConterCEO da Elev5 min de leitura
Curva do acerto do GPT-4 na mesma tarefa, de 84% em março para 51% em junho de 2023. Fonte: Chen, Zaharia e Zou.
Acerto do GPT-4 na mesma tarefa: 84% em março e 51% em junho de 2023. Fonte: Chen, Zaharia e Zou, 2023.
Em resumo
  • Um agente de IA não quebra como um programa comum: ele continua respondendo, só que pior, e ninguém percebe até um cliente reclamar.
  • As causas mais comuns são quatro: o modelo é aposentado ou atualizado, um sistema ligado ao agente muda, as informações que ele consulta ficam velhas e o volume cresce.
  • Pesquisas de 2025 e 2026 mostram que a qualidade do contexto que o agente recebe prevê a confiabilidade dele melhor do que o modelo escolhido.
  • A solução é tratar o agente como operação contínua: testar com casos reais todo mês, corrigir o que piorou e trocar o modelo com planejamento.

Um agente de IA que funcionava bem em março pode estar errando em setembro sem que ninguém tenha tocado nele. Não aparece mensagem de erro e nada trava na tela. Ele continua respondendo, com a mesma segurança, só que pior.

Este texto explica por que isso acontece e o que fazer para não descobrir pelo cliente.

Agente de IA não quebra, piora

Um sistema comum, quando dá problema, para. O boleto não é gerado, a tela mostra um erro, alguém liga para o suporte.

Um agente de IA falha de outro jeito. Ele sempre devolve uma resposta. Se a informação que ele consulta ficou velha, ele responde com a informação velha. Se o sistema do lado mudou um campo, ele preenche o campo errado. E faz isso com o mesmo tom confiante de sempre.

Automação comum quebra e avisa. Agente de IA piora e não avisa.

Por isso a piora demora a ser notada. Quem percebe primeiro costuma ser o cliente que recebeu o prazo errado ou o financeiro que achou uma diferença no fechamento.

As quatro causas mais comuns

O modelo muda ou é aposentado. Os fornecedores de IA trocam de modelo o tempo todo. A Anthropic aposentou o Claude Sonnet 4 e o Opus 4 em 15 de junho de 2026, e o Opus 4.1 em 5 de agosto de 2026. A documentação é direta: depois da data, as chamadas para o modelo antigo falham. A OpenAI desligou a Assistants API, usada por muitos agentes, em 26 de agosto de 2026. Mesmo quando o modelo não sai do ar, uma versão nova se comporta diferente. Um estudo de Stanford e Berkeley mostrou que o GPT-4 caiu de 84% para 51% de acerto numa mesma tarefa entre as versões de março e junho de 2023.

Um sistema ligado ao agente muda. O ERP atualiza, o CRM ganha um campo novo, a planilha de preços muda de formato. O agente continua lendo e escrevendo como antes, só que agora no lugar errado.

O contexto envelhece. O agente responde com base nos documentos, regras e tabelas que recebeu. Quando a política de trocas muda e o documento não, ele segue informando a regra antiga.

O volume cresce. Um agente testado com vinte conversas por dia se comporta diferente com duzentas. Históricos mais longos e mais informação misturada deixam o modelo mais sujeito a erro.

O problema costuma estar no contexto, não no modelo

Quando um agente começa a errar, a reação comum é trocar de modelo. Na maioria das vezes, o problema está no que ele recebe para ler.

Duas pesquisas recentes apontam na mesma direção:

  • Contexto longo piora a resposta. Em julho de 2025, a Chroma testou 18 modelos, entre eles GPT-4.1, Claude 4 e Gemini 2.5, e concluiu que o desempenho cai conforme a quantidade de texto de entrada aumenta, de formas pouco previsíveis. Um único trecho irrelevante no meio já atrapalha.
  • A qualidade do contexto prevê a confiabilidade. Um estudo publicado em julho de 2026 manteve o modelo fixo e variou só o contexto. Com contexto fraco, os agentes inventaram informação, usaram ferramentas do jeito errado e ignoraram regras. O título do estudo resume a ideia: o contexto falha primeiro.

Outro estudo, de maio de 2026, acompanhou agentes por até 200 sessões seguidas. Mesmo com o modelo fixo, a precisão caiu com o tempo, porque a memória do agente cresce, é resumida e se mistura. E os testes de comportamento continuaram passando enquanto a precisão dos fatos piorava.

Na prática, isso significa que um agente bom depende de alguém cuidar do que ele sabe: documentos atualizados, regras claras e informação desnecessária fora do caminho.

Construir ficou fácil. Manter é o trabalho

Hoje dá para montar um agente em poucos dias com ferramentas acessíveis. Por isso o mercado está cheio de projetos que funcionaram na demonstração e pararam alguns meses depois.

O Gartner prevê que mais de 40% dos projetos de agentes de IA serão cancelados até o fim de 2027, por custo alto, valor pouco claro ou falta de controle de risco. Construir não costuma ser o problema. Sem ninguém responsável pela operação, o agente vai perdendo valor até alguém desligar.

O que fazer para o agente continuar funcionando

  1. Monte uma bateria de casos-teste. Vinte a trinta situações reais da operação, com a resposta certa conhecida. É a régua para saber se o agente melhorou ou piorou.
  2. Rode os testes todo mês. E também sempre que um sistema ligado ao agente mudar. Compare com o mês anterior.
  3. Cuide do que o agente lê. Documento que mudou precisa ser atualizado. Documento que ninguém usa mais precisa sair.
  4. Acompanhe o calendário dos modelos. Os fornecedores publicam as datas de aposentadoria com antecedência. Troque antes, teste com os mesmos casos e só vire a chave quando o resultado for igual ou melhor.
  5. Tenha um responsável. Alguém precisa receber o alerta, entender o que piorou e corrigir. Sem isso, o resto não acontece.

Na Elev, é assim que funcionam os agentes que construímos: a construção vem junto com a operação. Testamos todo mês com os casos da sua empresa, corrigimos o que piorou e trocamos o modelo quando faz sentido. Se você tem um agente rodando sem ninguém olhando, ou quer construir um que continue funcionando, veja como trabalhamos com IA personalizada ou fale com a gente.

Fontes

Perguntas frequentes

Por que meu agente de IA começou a errar se ninguém mexeu nele?

Porque tudo em volta dele mexeu. O fornecedor atualiza ou aposenta o modelo, o sistema que ele consulta muda um campo, os documentos que ele usa ficam desatualizados. O agente segue respondendo com confiança, só que com base em algo que já não é verdade.

Com que frequência um agente de IA precisa de manutenção?

O mínimo razoável é um teste por mês com casos reais da operação, e uma revisão sempre que um sistema ligado a ele mudar ou o fornecedor anunciar a troca do modelo. A Anthropic, por exemplo, avisa com pelo menos 60 dias de antecedência antes de desligar um modelo.

O que acontece quando um modelo de IA é aposentado?

As chamadas para aquele modelo deixam de funcionar na data marcada. Se o agente não foi trocado e testado antes, ele simplesmente para. Aconteceu com vários modelos da Anthropic e da OpenAI entre 2025 e 2026.

Vale a pena contratar só a construção de um agente de IA?

Raramente. Construir ficou mais barato a cada ano; o que custa é manter funcionando. Um agente sem ninguém responsável pela operação tende a ficar pior a cada mês, e o prejuízo aparece no atendimento ou no financeiro, não no painel.

Como saber se o agente está piorando?

Com uma bateria fixa de casos-teste: perguntas e tarefas reais, com a resposta certa conhecida. Roda-se a mesma bateria todo mês e compara-se o resultado. Sem isso, a piora só aparece quando alguém reclama.

Publicado em 23 de setembro de 2026

Quer ver isso na sua operação?

Conte o que hoje só funciona porque alguém lembra. Você recebe uma leitura direta do que a IA já consegue assumir e do que precisa existir antes.

Agendar uma conversa