Inteligência Artificial

Esquecimento catastrófico: quando o modelo simplesmente esquece

Por Vivian Kang
Pumpkin LabsPumpkin ExplainsSérieEnsaio Nº 10
O que é
esquecimento
catastrófico?
Treinar um modelo numa nova tarefa pode apagar o que ele já dominava, sem aviso, de uma só vez.
Pumpkin Labs
Aprendizado contínuo
Por Pumpkin Labs · Pesquisa
pumpkinlabs.io
~8 min · jun 2026
Espaço de pesos · esquemático
Fig. 10
01.
Vales
perda × pesos
02.
Gradiente
→ vale b
03.
Trajetória
a → b
perda da tarefa A após treinar B → sobe · o custo do esquecimento
S01 · E10
Pumpkin Explica, #10
(Por que um modelo que aprende algo novo apaga o que sabia antes, e como o harness resolve isso sem retreinar)
TL;DR

Você faz fine-tuning de um LLM para a política de reembolso de eletrônicos. Funciona. Depois faz fine-tuning para devolução de roupas. O modelo agora é ótimo em roupas, mas no reembolso de eletrônicos ele age como se nunca tivesse visto o assunto. Esse é o esquecimento catastrófico: quando o fine-tuning sequencial sobrescreve conhecimento prévio. O problema é estrutural, não um bug. Os gradientes (vetores que apontam a direção de maior aumento da perda) da nova tarefa empurram os pesos para fora da região de baixa perda da tarefa anterior, e como o modelo tem um único conjunto de parâmetros, não há como manter duas especializações ao mesmo tempo. As técnicas clássicas (EWC, replay, Wise-FT, LoRA) aliviam o sintoma, mas nenhuma elimina a raiz: o modelo continua sendo um recipiente único para conhecimentos que competem. A saída não é melhorar a memória do modelo, é parar de misturar competências dentro dele, usando um harness que separa os contextos e mantém cada especialização isolada, sem que o modelo precise esquecer nada.

Você treina um agente de atendimento. Primeiro, ele aprende a política de reembolso de eletrônicos, prazos, condições, exceções. Tudo certo. Depois você adiciona a política de devolução de roupas. O modelo vira um especialista em roupas. E na primeira pergunta sobre reembolso de eletrônicos, ele responde como se a política anterior nunca tivesse existido.

Isso não é um bug no código nem um erro de curadoria de dados. É o que a literatura chama de esquecimento catastrófico, um fenômeno que acompanha as redes neurais desde os experimentos clássicos de McClelland e French nos anos 1990. Quando um modelo é treinado sequencialmente em duas tarefas, o fine-tuning na segunda sobrescreve os pesos que codificavam a primeira. O resultado é um modelo que só se lembra do último assunto que viu. E isso não é uma falha menor: o fenômeno é observado de forma ampla em LLMs treinados sequencialmente, documentado empiricamente e replicado em dezenas de experimentos. A escala do modelo não elimina o problema, pelo contrário: modelos maiores têm mais capacidade ociosa, parâmetros sobressalentes que não são usados pela tarefa original, e essa sobra absorve e mascara melhor o esquecimento. Mas o mecanismo subjacente, os gradientes sobrescrevendo pesos compartilhados, continua o mesmo. A escala não é uma proteção real, é um disfarce.

O problema é que a gente quer que o modelo seja um depósito único de todo o conhecimento que a empresa acumula. Mas a arquitetura do transformer não foi desenhada para isso. Cada novo fine-tuning mexe no mesmo conjunto de parâmetros, e se a segunda tarefa puxa os pesos para uma direção diferente, a primeira se perde. No fim, o agente não é confiável: ele alterna entre competências de acordo com o último treino que recebeu, sem nenhum aviso de que esqueceu o resto.

01 — O diagnóstico

Por que o esquecimento catastrófico acontece no fine-tuning sequencial?

Para entender por que o esquecimento catastrófico é tão comum, vale olhar o que acontece na prática durante um fine-tuning sequencial. O modelo começa com os pesos do pré-treino, um conhecimento geral, amplo, mas raso na sua política específica. Você faz o primeiro fine-tuning com exemplos de reembolso de eletrônicos. Os pesos se ajustam para capturar as regras daquela tarefa: prazos de 30 dias, necessidade de nota fiscal, exceções para produtos lacrados. O modelo fica bom nisso.

Agora você pega o mesmo modelo, carrega os pesos que acabou de treinar, e faz um segundo fine-tuning com exemplos de devolução de roupas. Os gradientes da nova tarefa empurram os pesos para minimizar o erro nas roupas. Mas eles não sabem que estão pisando em cima do que foi aprendido antes. Como não há nenhuma restrição que proteja as regiões dos pesos que codificam eletrônicos, o gradiente as sobrescreve. O resultado é que o modelo se especializa em roupas e desaprende eletrônicos. O fenômeno é documentado empiricamente e replicado em LLMs de diferentes portes. Mesmo com instruction tuning prévio, que ajuda a reter conhecimento geral, o esquecimento persiste.

O mecanismo por trás disso é geométrico. O espaço de pesos (o espaço multidimensional onde cada eixo é um parâmetro do modelo) contém uma região de baixa perda para a primeira tarefa. Durante o segundo fine-tuning, os gradientes da nova tarefa apontam para uma direção que pode sair dessa região. A sobreposição entre as regiões de baixa perda das duas tarefas é pequena, e como não há restrição, os pesos saem da região da primeira tarefa. A retropropagação (algoritmo que calcula gradientes propagando o erro da saída para as camadas anteriores) não distingue entre pesos importantes para uma tarefa ou outra; ela simplesmente atualiza todos os pesos na direção que reduz a perda atual. É por isso que o esquecimento é catastrófico: a mudança é abrupta e total.

●/10 — esquecimento · pumpkin labs
anim · 16:9 · t = 00:00.00
trajetória dos pesos · a → b
série · 10 / 12
No espaço de pesos existem dois vales: A e B.
espaço de pesos · trajetória
vale avale bcampo de gradiente → vale bpesos θ
perfil de perda
perdapesos · θperda · tarefa bperda · tarefa avale avale bgradiente
0:00.00
0:32.00

O esquecimento catastrófico não é um acidente de percurso. É a consequência inevitável de um único conjunto de parâmetros ter que armazenar duas competências que puxam em direções opostas. A escala do modelo não elimina o mecanismo, só esconde melhor o sintoma.

02 — O mecanismo

Como os gradientes do fine-tuning causam esquecimento catastrófico?

O mecanismo por trás do esquecimento catastrófico é direto. Durante o fine-tuning, o modelo ajusta seus pesos para minimizar a perda na nova tarefa. O gradiente calcula em que direção mexer em cada peso para reduzir o erro. Se a nova tarefa exige uma configuração diferente da anterior, o gradiente aponta para uma região do espaço de pesos que contradiz a configuração anterior. Como não há memória do que era importante antes, o modelo simplesmente segue o gradiente.

É aí que entra o dilema: os mesmos pesos que codificam a primeira tarefa são os únicos disponíveis para codificar a segunda. Não há um "espaço separado" para cada especialização. Tudo está entrelaçado nos parâmetros. Estudos mecanísticos recentes mostram que o alinhamento dos gradientes entre tarefas antigas e novas prevê a severidade do esquecimento com correlação de 0,87. Esse alinhamento é medido pelo cosseno do ângulo entre os vetores de gradiente das duas tarefas. Se o ângulo for próximo de 0 graus (cosseno ~1), os gradientes apontam na mesma direção e a atualização beneficia ambas as tarefas. Se o ângulo for próximo de 180 graus (cosseno ~ -1), eles puxam em direções opostas, e o esquecimento é mais severo. A correlação de 0,87 significa que essa medida explica 87% da variação no esquecimento entre diferentes pares de tarefas.

As técnicas de mitigação tentam lidar com isso de formas diferentes. O Elastic Weight Consolidation (EWC) penaliza mudanças em pesos considerados importantes para a tarefa anterior, usando a matriz de informação de Fisher para estimar a importância. O Knowledge Distillation (KD) usa a saída do modelo antigo como regularizador, forçando o novo modelo a não se desviar muito das previsões anteriores. O Wise-FT interpola os parâmetros entre o modelo original e o fine-tunado. Nenhuma delas elimina o problema por completo. O LoRA, que muitos imaginam que protegeria por mexer em poucos parâmetros, também não resolve: estudos mostram que sua eficácia em mitigar o esquecimento catastrófico é limitada, justamente porque o delta de baixo rank ainda pode sobrescrever direções importantes da tarefa anterior.

03 — A raiz

O dilema estabilidade-plasticidade: por que o esquecimento catastrófico é inevitável?

O problema fundamental é conhecido na neurociência como o dilema estabilidade-plasticidade. Um sistema precisa ser plástico o bastante para aprender coisas novas, mas estável o bastante para não esquecer o que já aprendeu. Redes neurais artificiais, como são construídas hoje, pendem fortemente para a plasticidade: cada nova tarefa reconfigura os pesos sem resistência.

Esse dilema não é um defeito que se possa corrigir com um truque de treino. Ele é consequência direta de um modelo ter um único conjunto de parâmetros. Para que a estabilidade fosse garantida, seria preciso reservar parte dos pesos exclusivamente para conhecimento antigo, mas isso reduziria a plasticidade, e o modelo teria dificuldade de se adaptar a novos domínios. O trade-off é inevitável. E, como mostram experimentos, a escala não elimina o esquecimento catastrófico: o que acontece é que modelos maiores têm mais capacidade ociosa, parâmetros sobressalentes que não são usados pela tarefa original, e essa sobra absorve e mascara melhor o esquecimento. O mecanismo subjacente, os gradientes sobrescrevendo pesos compartilhados, continua o mesmo. A escala não é uma proteção real, é um disfarce. A retropropagação não discrimina entre parâmetros.

A arquitetura do transformer materializa esse dilema de forma concreta. As camadas de atenção e feedforward são compartilhadas entre todas as tarefas. Quando a retropropagação atualiza os pesos para minimizar a perda da nova tarefa, ela mexe em parâmetros que também são usados para processar a tarefa anterior. Não há um mecanismo intrínseco de "proteção" para pesos importantes. O dilema aparece também quando se tenta treinar um modelo em múltiplas tarefas simultaneamente. O multi-task learning (aprender várias tarefas de uma vez) evita o esquecimento porque os gradientes são combinados antes da atualização. Mas isso exige que todas as tarefas estejam disponíveis no mesmo momento, o que raramente acontece no mundo real. Conhecimento novo chega o tempo todo, e o modelo precisa ser atualizado sem perder o que já sabe. É aí que o dilema se torna um problema prático, não só teórico.

04 — O experimento mental

Por que o multi-task não resolve o esquecimento catastrófico?

Uma reação comum é pensar: "então vou treinar o modelo em todas as tarefas de uma vez, multi-task". De fato, se você juntar os dados de eletrônicos e roupas num mesmo fine-tuning, o modelo não esquece. Os gradientes de ambas as tarefas atuam juntos, e os pesos encontram um ponto de equilíbrio. O problema é que isso só funciona se você tem todos os dados disponíveis ao mesmo tempo. Na prática, o conhecimento de uma empresa não chega de uma vez. Políticas mudam, novos produtos são lançados, regulamentações se alteram. Você não pode congelar o treino e esperar ter tudo.

Além disso, o multi-task impõe um custo de armazenamento e de re-treino que escala com o número de tarefas. Cada vez que uma nova política entra, você precisa reunir todos os dados antigos e re-treinar o modelo do zero. Isso é inviável para a maioria das operações. E mesmo que você fizesse isso, o resultado seria um modelo que tenta ser bom em tudo ao mesmo tempo, mas acaba sendo mediano em cada tarefa, o chamado trade-off entre especialização e generalidade. Estudos mostram que o melhor equilíbrio ainda perde generalidade. Você não consegue um modelo que seja especialista em reembolso de eletrônicos e ao mesmo tempo especialista em devolução de roupas, porque os pesos são os mesmos.

O experimento mental revela uma verdade incômoda: o problema não está no treino, está na arquitetura do modelo como depósito único de conhecimento. Enquanto você insistir em colocar tudo dentro dos parâmetros, o esquecimento catastrófico será uma sombra constante. A saída não passa por melhorar a memória do modelo, passa por parar de usá-lo como única fonte de conhecimento.

05 — A saída

Como evitar o esquecimento catastrófico com um harness?

Se o modelo é um recipiente único que esquece quando recebe conteúdo novo, a solução é não colocar todo o conhecimento dentro dele. Em vez de fine-tunar o modelo para cada política, você mantém o modelo como um núcleo genérico e coloca o conhecimento especializado numa camada externa, o harness. O harness é o aparato que cerca o modelo: ele decide qual contexto entregar, qual fonte consultar e como formatar a resposta.

No exemplo do nosso agente, você não treina o modelo para reembolso de eletrônicos e depois para roupas. Você mantém o modelo com um instruction tuning geral e constrói um harness que, a cada pergunta, injeta o contexto correto: o documento de política de eletrônicos quando o cliente fala de notebook, o documento de devolução de roupas quando o assunto é vestuário. O modelo nunca "aprende" a política, ele a lê no contexto. E como o contexto muda a cada chamada, não há sobrescrita. O conhecimento especializado vive fora dos pesos.

Essa abordagem resolve o dilema estabilidade-plasticidade porque o modelo não precisa ser plástico para novos domínios e estável para os antigos. Ele é sempre o mesmo modelo genérico, e a especialização vem do harness. Você pode adicionar dezenas de políticas sem nunca re-treinar o modelo. Cada uma vive num documento separado, e o harness roteia a consulta certa. O esquecimento catastrófico simplesmente não acontece, porque nunca houve mistura de competências dentro dos parâmetros.

Há um princípio matemático por trás disso. Como exploramos em detalhe no post sobre prompts como LoRA, um prompt bem estruturado age como uma atualização de baixo rank nos pesos efetivos do modelo, sem modificar os parâmetros. O harness usa esse mesmo princípio: em vez de gravar o conhecimento nos pesos via fine-tuning, ele o injeta via contexto a cada chamada. O modelo "incorpora" o conhecimento na hora, sem risco de sobrescrita, porque a atualização é temporária e específica para aquela consulta.

06 — A Pumpkin

Como a Pumpkin elimina o esquecimento catastrófico na prática?

Na Pumpkin a gente constrói esse harness. Em vez de empilhar fine-tuning sobre fine-tuning e aceitar o esquecimento como inevitável, a gente projeta uma camada de contexto que separa cada especialização. O modelo central é mantido como um núcleo confiável, e o conhecimento de negócio (políticas, catálogos, regulamentos) vive em documentos e bases externas, que o harness consulta e insere no prompt a cada interação. Isso significa que você pode atualizar uma política sem tocar no modelo, sem re-treinar, sem risco de apagar o que já estava funcionando. O harness não elimina o fine-tuning para todos os casos. Quando um comportamento precisa estar entranhado nos próprios pesos, como um estilo de resposta específico ou um jargão muito idiossincrático, o fine-tuning ainda é necessário. Mas, para a grande maioria dos conhecimentos que um agente precisa, o contexto basta. E ao separar o que é do modelo do que é do contexto, a gente elimina a causa raiz do esquecimento catastrófico: a competição entre tarefas dentro dos mesmos parâmetros. O modelo não precisa esquecer, porque ele nunca tentou aprender tudo sozinho.

FAQ · Perguntas frequentes

O que é esquecimento catastrófico em modelos de linguagem?

Esquecimento catastrófico é o fenômeno em que um modelo de linguagem perde conhecimento previamente aprendido ao ser treinado em uma nova tarefa. Durante o fine-tuning sequencial, os gradientes da nova tarefa sobrescrevem os pesos que codificavam a anterior, fazendo o modelo "esquecer" o que sabia. Não é um bug, é uma consequência estrutural de um único conjunto de parâmetros ter que armazenar competências concorrentes.

Por que o fine-tuning sequencial causa esquecimento catastrófico?

Porque os mesmos pesos que codificam a primeira tarefa são os únicos disponíveis para codificar a segunda. Quando os gradientes da nova tarefa apontam em direção diferente da anterior, eles sobrescrevem as regiões de peso que eram importantes para a tarefa antiga. Estudos mostram que o alinhamento dos gradientes entre tarefas prevê a severidade do esquecimento com correlação de 0,87.

Como evitar o esquecimento catastrófico sem retreinar o modelo?

A forma mais eficaz é não colocar todo o conhecimento dentro dos pesos do modelo. Em vez disso, use um harness que mantém o conhecimento especializado em documentos externos e os injeta no contexto a cada pergunta. O modelo nunca "aprende" a política, ele a lê no contexto. Como o contexto muda a cada chamada, não há sobrescrita e o esquecimento catastrófico simplesmente não acontece.

O multi-task learning resolve o esquecimento catastrófico?

O multi-task learning evita o esquecimento se todas as tarefas forem treinadas simultaneamente, porque os gradientes são combinados antes da atualização. Mas isso exige que todos os dados estejam disponíveis ao mesmo tempo, o que raramente acontece na prática. Além disso, o custo de re-treinar o modelo do zero a cada nova política é inviável para a maioria das operações.

O LoRA protege contra o esquecimento catastrófico?

Não. Embora o LoRA treine apenas uma fração dos parâmetros, ele ainda modifica os pesos efetivos do modelo. Estudos mostram que sua eficácia em mitigar o esquecimento catastrófico é limitada. O LoRA pode reduzir o custo do treino, mas não elimina a competição entre tarefas dentro dos mesmos parâmetros.

Como o harness da Pumpkin elimina o esquecimento catastrófico?

O harness da Pumpkin separa cada especialização de negócio em documentos e bases externas, consultados a cada interação. O modelo central permanece um núcleo genérico, e o conhecimento específico vive fora dos pesos. Isso permite atualizar políticas sem re-treinar o modelo, eliminando a causa raiz do esquecimento catastrófico: a competição entre tarefas dentro dos mesmos parâmetros.
O que está provado e o que é interpretação

Formalizado. O esquecimento catastrófico em fine-tuning sequencial é documentado empiricamente em McClelland et al. (1995), French (1999) e replicado em LLMs por Luo et al. (2023). O gradiente alignment como preditor (r=0.87) é um resultado quantitativo de Laitinen et al. (2026).

Robusto (suporte empírico). O dilema estabilidade-plasticidade é um princípio aceito em aprendizado de máquina. As mitigações (EWC, KD, Wise-FT, replay) são testadas e mostram alívio parcial, mas nenhuma elimina o fenômeno.

Interpretação (prática). A tese de que separar competências via harness resolve o problema para a maioria dos casos de conhecimento de negócio é uma conclusão de engenharia, não um teorema. Ela se apoia no fato de que o conhecimento factual cabe em contexto, não precisa estar nos pesos, desde que o modelo seja bem instruído.

O esquecimento catastrófico não é um bug, é uma consequência de tratar o modelo como um único depósito de conhecimento. Enquanto você fizer fine-tuning sequencialmente, o último sempre vence. A saída não é treinar melhor, é parar de misturar: usar um harness que mantém cada especialização fora dos pesos, onde o modelo não precisa escolher entre lembrar ou aprender.

Gostou do conteúdo?

Entre em contato conosco para descobrir como implementar essas soluções na sua empresa.