Ilustración editorial para De las RNN a los Transformers: qué cambió en las arquitecturas de lenguaje y qué no fue un progreso lineal
Imagen generada con gpt-image-2.5-sunburst para InferamaFonte ↗
01

A arquitetura importa, mas não explica tudo

Uma arquitetura determina como as informações são representadas e processadas: quais elementos podem influenciar uns aos outros, em que ordem os cálculos são realizados e quais partes do contexto estão disponíveis na hora de produzir uma saída. Em tarefas de linguagem, essas decisões têm consequências práticas. Um sistema de tradução, por exemplo, precisa relacionar palavras da entrada às palavras da saída e produzir uma sequência coerente.

Mas uma arquitetura não explica, sozinha, as capacidades de um sistema. Também importam o objetivo de treinamento, os dados disponíveis, o poder computacional e a forma como o modelo é adaptado a uma tarefa. Por isso, descrever essa história como uma cadeia em que cada projeto «supera» e elimina o anterior é enganoso. Muitas vezes, o que muda é o equilíbrio entre vantagens e custos, e as técnicas continuam úteis em contextos distintos.

A tradução automática permite examinar essas mudanças porque exige resolver vários problemas ao mesmo tempo: estimar quais expressões de um idioma correspondem às de outro e produzir uma frase no idioma de destino. A modelagem de linguagem oferece outro estudo de caso: aprender a atribuir probabilidades a sequências e, no caso autorregressivo, prever qual token pode vir em seguida. Esses exemplos permitem comparar escolhas de projeto sem confundir a arquitetura com a tarefa.

02

Antes das redes recorrentes: tradução estatística

Antes dos modelos neurais de tradução discutidos nos trabalhos desta trajetória, uma linha de pesquisa aplicava métodos estatísticos ao problema. O artigo de Peter F. Brown e colaboradores sobre métodos estatísticos para tradução automática documenta essa abordagem inicial. Em vez de tratar a tradução como uma lista fixa de regras linguísticas escritas à mão, esses métodos estimavam relações probabilísticas a partir de dados e buscavam uma saída adequada com base nessas estimativas.

A diferença em relação a uma rede neural não é simplesmente que uma abordagem use números e a outra não: ambas fazem cálculos. A diferença relevante está em como as relações são representadas e como se organizam os componentes envolvidos na tarefa. Em um sistema estatístico, o problema é formulado por meio de modelos de probabilidade e procedimentos para selecionar uma tradução. Já nos sistemas neurais encoder-decoder, uma rede aprende representações internas da sequência de entrada e as utiliza para gerar a sequência de saída.

Esse ponto de partida serve como referência, não como um relato exaustivo de toda a tradução estatística. Um artigo fundamental permite descrever uma contribuição específica, mas não basta para reconstruir todas as variantes, sistemas em operação ou decisões técnicas que existiram na área. A mudança para métodos neurais tampouco significa que os métodos anteriores desapareceram de imediato ou que uma arquitetura, por si só, garantisse uma tradução melhor em qualquer conjunto de dados.

03

Encoder-decoder recorrente: codificar e gerar passo a passo

O trabalho de Sutskever, Vinyals e Le estudou uma arquitetura neural encoder-decoder baseada em redes LSTM para tradução do inglês para o francês. O encoder processa a sequência de entrada, e o decoder produz a sequência de saída. Na formulação descrita no artigo, a entrada é representada por um vetor de tamanho fixo, que o decoder utiliza para gerar a tradução.

Esse projeto permitia aprender uma transformação entre sequências sem definir manualmente uma correspondência para cada palavra. O encoder e o decoder podiam aprender representações úteis a partir de exemplos de tradução. No entanto, o vetor fixo também concentrava as informações da frase de entrada inteira em uma representação de tamanho limitado. A dificuldade potencial aumenta quando a sequência é longa ou contém informações que o decoder precisa recuperar com precisão: essa representação precisa preservar tudo o que for necessário para produzir a saída.

A recorrência introduz outro compromisso. O estado que processa uma posição depende do estado anterior, de modo que a sequência é percorrida passo a passo. Essa estrutura oferece uma maneira natural de lidar com entradas de comprimentos variados e manter um estado que resume o que já foi processado. Ao mesmo tempo, limita quanto pode ser calculado em paralelo ao longo da sequência, pois cada passo precisa do resultado do anterior. Isso não é uma deficiência abstrata: afeta a organização do cálculo e o custo do treinamento com sequências.

É importante separar o que o trabalho demonstrou de uma conclusão mais ampla. O artigo avaliou uma arquitetura específica para tradução do inglês para o francês; não prova que todas as redes recorrentes comprimam informações da mesma maneira nem que o vetor fixo seja sempre insuficiente. Essa limitação é uma motivação para estudar mecanismos que permitam consultar a entrada de forma mais direta, não uma demonstração de que a recorrência não tenha utilidade.

Percurso de um encoder-decoder recorrente

Esquema conceitual do fluxo descrito para a tradução neural.

  1. 01O encoder percorre os elementos da frase de entrada e atualiza seu estado recorrente.
  2. 02A representação final, de tamanho fixo, resume a entrada para o decoder.
  3. 03O decoder produz a tradução sequencialmente, condicionando cada passo ao contexto recebido e ao que já foi gerado.
04

Atenção: consultar a entrada sem abandonar a recorrência

Bahdanau, Cho e Bengio propuseram um mecanismo de atenção para aprender conjuntamente a alinhar e traduzir. A motivação era reduzir o gargalo de representar toda a frase de origem por meio de um único vetor fixo. Em vez de obrigar o decoder a depender apenas desse resumo, o mecanismo permite que ele busque partes relevantes da entrada ao prever cada palavra do idioma de destino.

Em termos intuitivos, o decoder pode atribuir importâncias diferentes aos elementos da frase de origem a cada etapa da geração. Para produzir determinada palavra, pode se apoiar mais em uma parte pertinente da entrada do que no restante. Isso oferece uma representação mais flexível da relação entre entrada e saída e torna explícita uma operação ligada ao alinhamento, que a tradução precisa resolver de alguma forma.

A atenção desse trabalho ainda não equivale ao Transformer. Ela é incorporada a uma arquitetura que mantém componentes recorrentes: o processamento da sequência e a geração continuam organizados passo a passo. A mudança importante é que o decoder ganha acesso seletivo às informações da entrada, em vez de recebê-las apenas por meio de um resumo único. Assim, a atenção melhora uma dimensão do problema — o acesso à entrada — sem eliminar a dependência sequencial própria das redes recorrentes.

Essa diferença ajuda a evitar uma simplificação frequente: «atenção» não é o nome de uma arquitetura única nem implica automaticamente paralelização total. O mecanismo pode ser integrado a modelos que mantêm a recorrência. Para entender o que mudou em cada projeto, é preciso perguntar onde a atenção é aplicada, quais representações consulta e quais operações continuam dependendo de etapas anteriores.

05

O Transformer: autoatenção e um novo equilíbrio computacional

O Transformer propõe processar sequências com mecanismos de atenção, sem recorrência. O artigo original estudou esse projeto em tarefas de tradução automática e apresentou um encoder e um decoder com camadas de autoatenção e redes feed-forward. A autoatenção permite que as representações de uma sequência incorporem informações de outras posições da mesma sequência; no decoder, o acesso é restringido para que a previsão não use tokens futuros.

A eliminação da recorrência muda a organização do cálculo. Durante o treinamento, as representações de diferentes posições de uma camada podem ser calculadas em paralelo, em vez de esperar a conclusão da etapa recorrente anterior. Essa possibilidade foi uma das vantagens de paralelização atribuídas ao projeto original. Isso não significa que todas as operações do sistema ocorram simultaneamente: as camadas ainda são construídas em ordem, e a geração autorregressiva de uma saída continua exigindo a produção de um token antes que se possa condicionar o seguinte.

A mudança também traz custos. Na autoatenção, cada posição pode se relacionar com muitas outras. Portanto, à medida que aumenta o comprimento da sequência, cresce o trabalho de calcular e armazenar essas relações. A arquitetura não elimina o custo computacional; ela redistribui onde esse custo aparece. O artigo original compara custo, número de operações sequenciais e complexidade dos caminhos entre posições, além de medir resultados em tarefas de tradução. Essas comparações sustentam vantagens nas condições avaliadas, não uma regra universal para qualquer tarefa ou tamanho de sequência.

Também é importante não transformar a história em uma transição instantânea. O Transformer demonstrou uma alternativa capaz de aproveitar a paralelização durante o treinamento, mas redes recorrentes e outras técnicas continuaram sendo possibilidades. A escolha de uma arquitetura depende da tarefa, do comprimento do contexto, dos recursos, do objetivo e do sistema de treinamento. A história descreve uma mudança importante no equilíbrio entre acesso ao contexto e execução sequencial, não o desaparecimento automático de todas as opções anteriores.

O que muda com a autoatenção

Comparação esquemática de propriedades arquitetônicas; não constitui uma classificação universal de desempenho.

AspectoRNN ou encoder-decoder recorrenteTransformer
Dependência entre posiçõesO estado de uma posição depende do estado anterior.A autoatenção relaciona posições dentro de uma camada sem percorrê-las por meio de um estado recorrente.
Treinamento de uma sequênciaO percurso recorrente limita o cálculo paralelo entre etapas.As posições de uma camada podem ser processadas em paralelo durante o treinamento.
Geração autorregressivaA saída é gerada passo a passo.A saída também é gerada passo a passo quando cada token depende dos anteriores.
Acesso à entradaPode depender de estados recorrentes ou, com atenção, consultar partes da origem.A autoatenção permite combinar informações de várias posições; seu custo cresce com as relações entre elas.
06

Modelos autorregressivos do tipo GPT: objetivo e arquitetura

A linha do GPT mostra por que é necessário distinguir arquitetura de objetivo de treinamento. O trabalho da OpenAI sobre pré-treinamento generativo descreve um processo em duas etapas: primeiro, pré-treinamento generativo com texto não rotulado; depois, ajuste discriminativo para tarefas de compreensão de linguagem. No objetivo generativo autorregressivo, o modelo aprende a prever o próximo token condicionado ao contexto anterior. A geração aplica essa mesma dependência de forma sucessiva: cada novo token é incorporado ao contexto para produzir o seguinte.

Na família de modelos do tipo GPT, o projeto se concentra no componente decoder e na previsão autorregressiva, em vez de necessariamente construir um encoder e um decoder separados para uma tradução. Isso permite que uma mesma interface de modelagem — continuar uma sequência — sirva como ponto de partida para tarefas de linguagem. Mas daí não se conclui que a arquitetura, por si só, produza capacidades gerais. O resultado também depende do texto usado no pré-treinamento, do tamanho e do procedimento de treinamento e da maneira como a tarefa posterior é formulada e avaliada.

O pré-treinamento pode fornecer parâmetros que depois são adaptados a uma tarefa, mas não deve ser confundido com o próprio ajuste nem com a avaliação. «É treinado para prever o próximo token» descreve um objetivo; não equivale a afirmar que o modelo compreende qualquer instrução, dispõe de informações atualizadas ou resolve toda tarefa de maneira confiável. Para sustentar afirmações desse tipo, são necessários resultados sobre o modelo e a tarefa específicos.

Assim, Transformer e GPT não são sinônimos. Transformer designa uma arquitetura baseada em atenção; GPT se refere a uma família de modelos autorregressivos e a uma abordagem de pré-treinamento generativo seguida, no trabalho fundamental citado, de adaptação a tarefas. Uma arquitetura pode ser usada com objetivos diferentes, e um objetivo de treinamento não determina, por si só, todos os usos ou comportamentos posteriores.

Do pré-treinamento a uma tarefa

Resumo do procedimento descrito no trabalho original sobre pré-treinamento generativo.

  1. 01Pré-treinar o modelo com texto não rotulado usando um objetivo generativo.
  2. 02Preparar o modelo para uma tarefa posterior por meio de ajuste discriminativo, conforme a formulação do trabalho.
  3. 03Avaliar o sistema nessa tarefa; não inferir seus resultados apenas pelo nome da arquitetura ou pelo objetivo de pré-treinamento.
07

Comparação transversal: o que mudou e o que permaneceu

A comparação mais útil não é uma lista de vencedores, mas um conjunto de perguntas. O modelo processa a sequência passo a passo ou consegue calcular representações de várias posições em paralelo? Como recupera informações da entrada ao gerar uma saída? Qual objetivo é otimizado? Que custo aparece quando aumenta o comprimento da sequência? Que parte do resultado se deve ao projeto e qual parte aos dados, à computação ou à adaptação? Essas perguntas permitem analisar sistemas atuais sem supor que uma inovação isolada explique todo o desempenho.

Nas RNNs, o estado recorrente organiza as informações e cria uma dependência entre etapas. Na atenção recorrente, o decoder pode consultar partes da entrada, mas a recorrência continua presente. O Transformer elimina essa recorrência e permite mais paralelismo durante o treinamento, ao custo de calcular relações de atenção cujo custo cresce com o número de posições. Em um modelo autorregressivo, mesmo com Transformer, a geração de uma sequência continua acontecendo passo a passo: a arquitetura paraleliza parte do treinamento, não a dependência lógica de cada token gerado em relação aos anteriores.

Também permanece a necessidade de escolher um objetivo adequado. Uma arquitetura de tradução encoder-decoder e um modelo que prevê o próximo token não são necessariamente treinados para resolver a mesma tarefa da mesma maneira. E uma tradução estatística e uma neural não diferem apenas em rapidez ou qualidade: elas organizam de formas distintas as estimativas e representações que levam a uma saída. Comparações de desempenho precisam considerar o conjunto de dados, o protocolo e a métrica utilizados; não é rigoroso extrapolar uma medição pontual para todas as aplicações.

A tabela a seguir resume compromissos gerais. Ela não substitui a consulta a um artigo ou a uma implementação: diferentes variantes de uma família podem alterar esses compromissos, e as condições de avaliação podem mudar o resultado.

Guia de decisão por problema

Perguntas práticas para orientar a comparação; não prescreve uma arquitetura universal.

Se a prioridade for…Vale examinar…Limite que não deve ser esquecido
Entender o fluxo de informações em uma traduçãoSe há encoder-decoder, como a entrada é representada e se o decoder dispõe de atenção.Um vetor de resumo ou um mecanismo de atenção não garantem, por si sós, uma tradução correta.
Paralelizar cálculos durante o treinamentoSe o processamento por camadas evita dependências recorrentes entre posições.A geração autorregressiva mantém dependências sequenciais, e a atenção tem custos ligados ao comprimento.
Aproveitar o pré-treinamento para várias tarefasQual objetivo foi usado, com quais dados e qual procedimento de adaptação foi aplicado.O objetivo de prever o próximo token não basta para atribuir capacidades gerais ou confiabilidade.
Comparar resultados publicadosQual tarefa, dados, métrica e condições foram avaliados no artigo original.Um resultado em tradução ou compreensão não se generaliza automaticamente para outras tarefas.
08

Conclusão: a arquitetura é apenas parte da explicação

O percurso dos métodos estatísticos de tradução aos modelos autorregressivos do tipo GPT não é uma marcha inevitável rumo a uma única forma de processar a linguagem. O encoder-decoder recorrente aprendeu uma transformação entre sequências, mas resumiu a entrada em um vetor de tamanho fixo. A atenção introduziu acesso seletivo a partes dessa entrada, mantendo a recorrência. O Transformer eliminou a dependência recorrente no processamento das posições e favoreceu a paralelização do treinamento, mas manteve os custos da atenção e a geração token a token. O GPT combinou uma arquitetura autorregressiva com pré-treinamento generativo e adaptação posterior, sem que o objetivo ou a arquitetura, isoladamente, expliquem todas as capacidades observadas.

Essa história ajuda a formular perguntas concretas sobre um modelo atual: a que contexto ele pode acessar, quais partes do cálculo podem ser paralelizadas, como a saída é produzida e qual objetivo foi aprendido. Ela não responde automaticamente se o modelo é preciso, seguro ou adequado para um uso específico. Para isso, são necessárias evidências sobre o sistema e a tarefa. Separar arquitetura, treinamento e avaliação evita tanto o relato simplista de substituições quanto a atribuição de capacidades a uma única inovação.

Para continuar esse percurso, vale relacionar esta explicação a um guia de fundamentos sobre modelos de linguagem, a uma comparação de abordagens e a uma visão geral de técnicas de IA. Em cada caso, a pergunta principal é a mesma: quais evidências descrevem o comportamento do sistema e o que é interpretação sobre seu projeto?

Questões em aberto

  • Os trabalhos citados são casos fundamentais pertinentes, não uma história exaustiva de todas as variantes estatísticas, recorrentes ou neurais desenvolvidas.
  • As vantagens de paralelização e desempenho do Transformer se baseiam nas tarefas e condições estudadas no artigo original; não devem ser generalizadas automaticamente para qualquer sequência ou implementação.
  • A exposição resume o objetivo e o procedimento do trabalho original sobre GPT; não permite inferir, por si só, o comportamento de modelos posteriores nem sua confiabilidade em usos específicos.
  • As comparações qualitativas entre arquiteturas descrevem compromissos gerais. A melhor escolha depende da tarefa, dos dados, dos recursos e da implementação.
09

Continue a explorar

09

Fontes consultadas

03

Correções e transparência

Se encontrar informação incorreta ou desatualizada, envie-nos a página e a fonte que devemos rever.

Propor uma correção