L’architecture compte, mais elle n’explique pas tout
Une architecture détermine la manière dont l’information est représentée et traitée : quels éléments peuvent s’influencer, dans quel ordre les calculs sont effectués et quelles parties du contexte sont accessibles au moment de produire une sortie. Dans les tâches de langage, ces choix ont des conséquences pratiques. Un système de traduction, par exemple, doit mettre en relation les mots de l’entrée et ceux de la sortie, puis produire une séquence cohérente.
Mais une architecture ne suffit pas à expliquer les capacités d’un système. L’objectif d’entraînement, les données disponibles, les ressources de calcul et la manière dont le modèle est adapté à une tâche comptent également. Présenter l’histoire comme une chaîne où chaque conception « dépasse » et élimine la précédente est donc trompeur. Souvent, l’équilibre entre avantages et coûts change, tandis que les techniques restent utiles dans des contextes différents.
La traduction automatique permet d’examiner ces changements, car elle oblige à résoudre plusieurs problèmes à la fois : estimer quelles expressions d’une langue correspondent à celles d’une autre, puis produire une phrase cible. La modélisation du langage offre un autre cas d’étude : apprendre à attribuer des probabilités à des séquences et, dans le cas autorégressif, prédire quel token peut venir ensuite. Ces exemples permettent de comparer des choix de conception sans confondre l’architecture et la tâche.
Avant les réseaux récurrents : la traduction statistique
Avant les modèles neuronaux de traduction étudiés dans les travaux évoqués ici, une ligne de recherche appliquait des méthodes statistiques à ce problème. L’article de Peter F. Brown et de ses collaborateurs sur les méthodes statistiques pour la traduction automatique documente cette approche précoce. Au lieu de traiter la traduction comme une liste fixe de règles linguistiques écrites à la main, ces méthodes estimaient des relations probabilistes à partir de données, puis cherchaient une sortie appropriée au regard de ces estimations.
La différence avec un réseau neuronal ne se résume pas à dire qu’une approche utilise des nombres et l’autre non : toutes deux effectuent des calculs. La différence pertinente tient à la façon de représenter les relations et d’organiser les composants impliqués dans la tâche. Dans un système statistique, le problème est formulé à l’aide de modèles probabilistes et de procédures visant à choisir une traduction. Dans les systèmes neuronaux de type encodeur-décodeur, un réseau apprend plutôt des représentations internes de la séquence d’entrée, puis les utilise pour générer la séquence de sortie.
Ce point de départ sert de référence, et non de récit exhaustif de toute la traduction statistique. Un article fondateur permet de décrire une contribution précise, mais ne suffit pas à reconstituer toutes les variantes, tous les systèmes opérationnels ni tous les choix techniques qui ont existé dans le domaine. Le passage aux méthodes neuronales ne signifie pas non plus que les méthodes antérieures ont immédiatement disparu, ni qu’une architecture garantit à elle seule une meilleure traduction sur n’importe quel jeu de données.
Encodeur-décodeur récurrent : encoder et générer pas à pas
Les travaux de Sutskever, Vinyals et Le ont étudié une architecture neuronale encodeur-décodeur fondée sur des réseaux LSTM pour la traduction de l’anglais vers le français. L’encodeur traite la séquence d’entrée et le décodeur produit la séquence de sortie. Dans la formulation décrite par l’article, l’entrée est représentée par un vecteur de longueur fixe que le décodeur utilise pour générer la traduction.
Cette conception permettait d’apprendre une transformation entre séquences sans devoir concevoir à la main une correspondance pour chaque mot. L’encodeur et le décodeur pouvaient apprendre des représentations utiles à partir d’exemples de traduction. Cependant, le vecteur fixe concentrait aussi l’information de toute la phrase d’entrée dans une représentation de taille limitée. La difficulté potentielle augmente lorsque la séquence est longue ou contient des informations que le décodeur doit retrouver avec précision : la représentation doit alors conserver tout ce qui est nécessaire pour produire la sortie.
La récurrence introduit un autre compromis. L’état qui traite une position dépend de l’état précédent ; le parcours de la séquence progresse donc pas à pas. Cette structure offre une façon naturelle de prendre en charge des entrées de longueur variable et de maintenir un état résumant ce qui a déjà été traité. En même temps, elle limite les calculs pouvant être parallélisés le long de la séquence, car chaque étape a besoin du résultat de la précédente. Ce n’est pas une limite abstraite : elle influe sur l’organisation des calculs et sur le coût de l’entraînement avec des séquences.
Il faut distinguer ce que les travaux ont montré d’une conclusion plus générale. L’article évaluait une architecture précise pour la traduction de l’anglais vers le français ; il ne prouve pas que tous les réseaux récurrents compressent l’information de la même façon, ni que le vecteur fixe est toujours insuffisant. Cette limite motive l’étude de mécanismes permettant de consulter l’entrée plus directement ; elle ne démontre pas que la récurrence est dépourvue d’utilité.
Parcours d’un encodeur-décodeur récurrent
Schéma conceptuel du flux décrit pour la traduction neuronale.
- 01L’encodeur parcourt les éléments de la phrase d’entrée et met à jour son état récurrent.
- 02La représentation finale de longueur fixe résume l’entrée pour le décodeur.
- 03Le décodeur produit la traduction de façon séquentielle, en conditionnant chaque étape sur le contexte reçu et sur ce qui a déjà été généré.
L’attention : consulter l’entrée sans abandonner la récurrence
Bahdanau, Cho et Bengio ont proposé un mécanisme d’attention pour apprendre conjointement à aligner et à traduire. Leur motivation était de réduire le goulot d’étranglement que constitue la représentation de toute la phrase source par un seul vecteur fixe. Au lieu de contraindre le décodeur à dépendre uniquement de ce résumé, le mécanisme lui permet de rechercher les parties pertinentes de l’entrée lors de la prédiction de chaque mot cible.
Intuitivement, le décodeur peut accorder une importance différente aux divers éléments de la phrase source selon l’étape de génération. Pour produire un mot donné, il peut s’appuyer davantage sur une partie pertinente de l’entrée que sur le reste. Cela offre une représentation plus souple du lien entre entrée et sortie et rend explicite une opération liée à l’alignement, que la traduction doit résoudre d’une manière ou d’une autre.
L’attention proposée dans ces travaux n’est pas encore le Transformer. Elle est intégrée à une architecture qui conserve des composants récurrents : le traitement de la séquence et la génération restent organisés étape par étape. Le changement important est que le décodeur accède sélectivement à l’information d’entrée, au lieu de ne la recevoir qu’à travers un résumé unique. L’attention améliore donc une dimension du problème — l’accès à l’entrée — sans supprimer la dépendance séquentielle propre aux réseaux récurrents.
Cette différence aide à éviter une simplification fréquente : « attention » ne désigne pas une architecture unique et n’implique pas automatiquement une parallélisation totale. Le mécanisme peut être intégré à des modèles qui conservent la récurrence. Pour comprendre ce qui change d’une conception à l’autre, il faut demander où l’attention s’applique, quelles représentations elle consulte et quelles opérations restent dépendantes des étapes précédentes.
Le Transformer : auto-attention et nouvel équilibre des calculs
Le Transformer propose de traiter les séquences à l’aide de mécanismes d’attention, sans récurrence. L’article fondateur étudie cette conception sur des tâches de traduction automatique et présente un encodeur et un décodeur comportant des couches d’auto-attention et des réseaux à propagation avant. L’auto-attention permet aux représentations d’une séquence d’intégrer des informations provenant d’autres positions de cette même séquence ; dans le décodeur, l’accès est restreint afin que la prédiction ne puisse pas utiliser des tokens futurs.
La suppression de la récurrence modifie l’organisation des calculs. Pendant l’entraînement, les représentations de différentes positions d’une couche peuvent être calculées en parallèle, au lieu d’attendre la fin de l’étape récurrente précédente. Cette possibilité figurait parmi les avantages de parallélisation attribués à la conception originale. Cela ne signifie pas que toutes les opérations du système se déroulent simultanément : les couches restent construites dans l’ordre, et la génération autorégressive d’une sortie doit toujours produire un token avant de pouvoir conditionner le suivant.
Le changement entraîne aussi des coûts. Avec l’auto-attention, chaque position peut être mise en relation avec de nombreuses autres. Lorsque la séquence s’allonge, le travail nécessaire pour calculer et stocker ces relations augmente donc lui aussi. L’architecture ne supprime pas le coût de calcul ; elle en déplace la répartition. L’article original compare le coût, le nombre d’opérations séquentielles et la complexité des chemins entre positions, en plus de mesurer les résultats sur des tâches de traduction. Ces comparaisons étayent des avantages dans les conditions évaluées, et non une règle universelle applicable à toutes les tâches ou à toutes les longueurs de séquence.
Il importe également de ne pas transformer l’histoire en transition instantanée. Le Transformer a montré une autre voie, capable de tirer parti de la parallélisation pendant l’entraînement, mais les réseaux récurrents et d’autres techniques restent possibles. Le choix architectural dépend de la tâche, de la longueur du contexte, des ressources, de l’objectif et du système d’entraînement. L’histoire décrit une évolution importante de l’équilibre entre accès au contexte et exécution séquentielle, pas la disparition automatique de toutes les options précédentes.
Ce que l’auto-attention change
Comparaison schématique de propriétés architecturales ; il ne s’agit pas d’un classement universel des performances.
| Aspect | RNN ou encodeur-décodeur récurrent | Transformer |
|---|---|---|
| Dépendance entre positions | L’état d’une position dépend de l’état précédent. | L’auto-attention met les positions en relation au sein d’une couche sans les parcourir au moyen d’un état récurrent. |
| Entraînement d’une séquence | Le parcours récurrent limite le calcul parallèle entre les étapes. | Les positions d’une couche peuvent être traitées en parallèle pendant l’entraînement. |
| Génération autorégressive | La sortie est produite pas à pas. | La sortie est également produite pas à pas lorsque chaque token dépend des précédents. |
| Accès à l’entrée | Peut dépendre d’états récurrents ou, avec l’attention, consulter des parties de la source. | L’auto-attention permet de combiner des informations provenant de plusieurs positions ; son coût augmente avec le nombre de relations entre elles. |
Modèles autorégressifs de type GPT : objectif et architecture
La lignée GPT montre pourquoi il faut distinguer l’architecture de l’objectif d’entraînement. Les travaux d’OpenAI sur le préentraînement génératif décrivent un processus en deux étapes : d’abord un préentraînement génératif sur du texte non étiqueté, puis un ajustement discriminatif pour des tâches de compréhension du langage. Avec l’objectif génératif autorégressif, le modèle apprend à prédire le token suivant à partir du contexte précédent. La génération applique cette même dépendance de manière successive : chaque nouveau token est ajouté au contexte pour produire le suivant.
Dans la famille des modèles de type GPT, la conception se concentre sur le composant décodeur et sur la prédiction autorégressive, plutôt que de construire nécessairement un encodeur et un décodeur séparés pour une tâche de traduction. Une même interface de modélisation — poursuivre une séquence — peut ainsi servir de point de départ à des tâches de langage. Cela ne signifie pas pour autant que l’architecture, à elle seule, produit des capacités générales. Le résultat dépend également du texte de préentraînement, de l’ampleur et du déroulement de l’entraînement, ainsi que de la formulation et de l’évaluation de la tâche ultérieure.
Le préentraînement peut fournir des paramètres qui seront ensuite adaptés à une tâche, mais il ne faut pas le confondre avec l’ajustement lui-même ni avec l’évaluation. « Le modèle est entraîné à prédire le token suivant » décrit un objectif ; cela ne revient pas à affirmer qu’il comprend n’importe quelle instruction, dispose d’informations à jour ou résout fiablement toutes les tâches. Pour étayer de telles affirmations, il faut des résultats portant sur le modèle et la tâche concernés.
La relation entre Transformer et GPT n’est donc pas une relation de synonymie. Transformer désigne une architecture fondée sur l’attention ; GPT renvoie à une famille de modèles autorégressifs et à une approche de préentraînement génératif suivie, dans les travaux fondateurs cités, d’une adaptation aux tâches. Une architecture peut être employée avec différents objectifs, et un objectif d’entraînement ne détermine pas à lui seul tous les usages ou comportements ultérieurs.
Du préentraînement à une tâche
Résumé du processus décrit dans les travaux originaux sur le préentraînement génératif.
- 01Préentraîner le modèle sur du texte non étiqueté à l’aide d’un objectif génératif.
- 02Préparer le modèle à une tâche ultérieure au moyen d’un ajustement discriminatif, selon la formulation des travaux.
- 03Évaluer le système sur cette tâche ; ne pas déduire ses résultats du seul nom de l’architecture ou de l’objectif de préentraînement.
Comparaison transversale : ce qui a changé et ce qui a persisté
La comparaison la plus utile n’est pas une liste de gagnants, mais un ensemble de questions. Le modèle traite-t-il la séquence pas à pas ou peut-il calculer en parallèle les représentations de plusieurs positions ? Comment récupère-t-il des informations de l’entrée lorsqu’il génère une sortie ? Quel objectif optimise-t-il ? Quel coût apparaît lorsque la séquence s’allonge ? Quelle part du résultat tient à la conception, et quelle part aux données, au calcul ou à l’adaptation ? Ces questions permettent d’analyser les systèmes actuels sans supposer qu’une innovation isolée explique toutes leurs performances.
Dans les RNN, l’état récurrent organise l’information et crée une dépendance entre les étapes. Avec l’attention récurrente, le décodeur peut consulter des parties de l’entrée, mais la récurrence reste présente. Le Transformer supprime cette récurrence et permet davantage de parallélisme pendant l’entraînement, au prix du calcul des relations d’attention, dont le coût augmente avec le nombre de positions. Dans un modèle autorégressif, même fondé sur un Transformer, la génération d’une séquence reste pas à pas : l’architecture parallélise une partie de l’entraînement, pas la dépendance logique de chaque token généré à l’égard des précédents.
La nécessité de choisir un objectif adapté demeure également. Un encodeur-décodeur conçu pour la traduction et un modèle qui prédit le token suivant ne sont pas nécessairement entraînés pour résoudre la même tâche de la même manière. De même, une traduction statistique et une traduction neuronale ne diffèrent pas seulement par leur rapidité ou leur qualité : elles organisent différemment les estimations et les représentations qui conduisent à une sortie. Pour comparer les performances, il faut tenir compte du jeu de données, du protocole et de la métrique utilisés ; il n’est pas rigoureux d’extrapoler une mesure ponctuelle à toutes les applications.
Le tableau suivant résume des compromis généraux. Il ne remplace pas l’examen d’un article ou d’une implémentation : différentes variantes d’une même famille peuvent modifier ces compromis, et les conditions d’évaluation peuvent changer le résultat.
Repères pour choisir selon le problème
Questions pratiques pour orienter une comparaison ; aucune architecture universelle n’est prescrite.
| Si la priorité est… | Il est utile d’examiner… | Limite à ne pas oublier |
|---|---|---|
| Comprendre le flux d’information dans une traduction | La présence d’un encodeur-décodeur, la représentation de l’entrée et la possibilité pour le décodeur d’utiliser l’attention. | Un vecteur de résumé ou un mécanisme d’attention ne garantit pas, à lui seul, une traduction correcte. |
| Paralléliser les calculs pendant l’entraînement | La capacité du traitement par couches à éviter les dépendances récurrentes entre positions. | La génération autorégressive conserve des dépendances séquentielles, et l’attention entraîne des coûts liés à la longueur. |
| Tirer parti du préentraînement pour plusieurs tâches | L’objectif utilisé, les données et la procédure d’adaptation appliquée. | L’objectif de prédiction du token suivant ne suffit pas à attribuer des capacités générales ni une fiabilité. |
| Comparer des résultats publiés | La tâche, les données, la métrique et les conditions évaluées dans l’article original. | Un résultat en traduction ou en compréhension ne se généralise pas automatiquement à d’autres tâches. |
Conclusion : l’architecture n’est qu’une partie de l’explication
Le parcours des méthodes statistiques de traduction aux modèles autorégressifs de type GPT n’est pas une marche inévitable vers une seule façon de traiter le langage. L’encodeur-décodeur récurrent apprenait une transformation entre séquences, mais résumait l’entrée dans un vecteur de longueur fixe. L’attention a introduit un accès sélectif à des parties de cette entrée tout en conservant la récurrence. Le Transformer a supprimé la dépendance récurrente dans le traitement des positions et favorisé la parallélisation de l’entraînement, tout en conservant les coûts liés à l’attention et la génération token par token. GPT a associé une architecture autorégressive à un préentraînement génératif et à une adaptation ultérieure, sans que l’objectif ou l’architecture suffise à expliquer toutes les capacités observées.
Cette histoire aide à poser des questions précises sur un modèle actuel : à quel contexte peut-il accéder, quelles parties du calcul peuvent être parallélisées, comment la sortie est-elle produite et quel objectif le modèle a-t-il appris ? Elle ne permet pas de déterminer automatiquement si le modèle est exact, sûr ou adapté à un usage particulier. Pour répondre à ces questions, il faut des éléments portant sur le système et la tâche concernés. Distinguer architecture, entraînement et évaluation évite à la fois le récit simpliste des remplacements successifs et l’attribution de capacités à une seule innovation.
Pour poursuivre, il est utile de rapprocher cette explication d’un guide sur les bases des modèles de langage, d’une comparaison des approches et d’un panorama des techniques d’IA. Dans chaque cas, la question essentielle reste la même : quels éléments décrivent le comportement du système, et lesquels relèvent d’une interprétation de sa conception ?
Questions ouvertes
- Les travaux cités sont des exemples fondateurs pertinents, et non une histoire exhaustive de toutes les variantes statistiques, récurrentes ou neuronales développées.
- Les avantages de parallélisation et de performance du Transformer reposent sur les tâches et conditions étudiées dans l’article original ; ils ne doivent pas être automatiquement généralisés à toutes les séquences ou implémentations.
- La présentation résume l’objectif et la procédure des travaux originaux sur GPT ; elle ne permet pas, à elle seule, de déduire le comportement de modèles ultérieurs ni leur fiabilité dans des usages concrets.
- Les comparaisons qualitatives entre architectures décrivent des compromis généraux. Le meilleur choix dépend de la tâche, des données, des ressources et de l’implémentation.
Poursuivre l’exploration
Sources consultées
Corrections et transparence
Si vous repérez une information incorrecte ou obsolète, envoyez-nous la page et la source à vérifier.
Proposer une correction