Pourquoi regarder sous le capot ?
Il n’est pas nécessaire de connaître toutes les équations d’un grand modèle de langage pour bien l’utiliser. Quelques principes suffisent toutefois à comprendre pourquoi il excelle dans certaines tâches, pourquoi il consomme autant de ressources et pourquoi sa réponse dépend du contexte disponible.
Un réseau de transformations
Un réseau de neurones artificiels est un ensemble de fonctions mathématiques organisées en couches. Chaque couche reçoit des nombres, leur applique des transformations, puis transmet le résultat à la suivante.
Dans sa forme la plus simple, un neurone artificiel combine ses entrées à l’aide de poids, ajoute un biais, puis applique une fonction d’activation. Cette dernière introduit de la non-linéarité : sans elle, un empilement de couches resterait équivalent à une seule transformation linéaire et ne pourrait pas représenter des relations complexes.
Les poids ne sont pas écrits à la main. Pendant l’entraînement, le réseau produit une prédiction, mesure son erreur à l’aide d’une fonction de perte, puis calcule comment modifier ses paramètres pour réduire cette erreur. La rétropropagation du gradient transmet ce signal de correction à travers les couches. Un algorithme d’optimisation ajuste ensuite les paramètres, exemple après exemple.
Du texte aux nombres
Avant d’entrer dans le réseau, le texte est découpé en tokens. Chaque token reçoit une représentation numérique initiale que le modèle combine avec une information de position. Selon l’architecture, cette information peut être ajoutée à la représentation ou intégrée aux calculs d’attention. Le modèle peut ainsi distinguer les mêmes tokens placés dans un ordre différent.
Au fil des couches, cette représentation évolue selon le contexte. Le mot « port », par exemple, n’est pas représenté exactement de la même façon dans « port réseau » et « port maritime ». Le modèle ne manipule donc pas seulement des définitions isolées : il construit des représentations contextuelles.
Le Transformer et l’attention
Les grands modèles de langage modernes reposent généralement sur l’architecture Transformer, publiée en 2017. Son mécanisme central, l’attention, permet à chaque position de pondérer les autres positions pertinentes de la séquence.
On peut comparer ce mécanisme à un surligneur dynamique. Pour interpréter « Le service a redémarré après sa mise à jour », le modèle peut accorder davantage d’importance à « service » lorsqu’il traite « sa ». Ces liens ne sont pas fournis par une règle grammaticale explicite : ils sont appris pendant l’entraînement.
L’attention n’agit pas seule. Une couche de Transformer combine généralement :
- un mécanisme d’attention ;
- un réseau de neurones appliqué à chaque position ;
- des connexions résiduelles, qui facilitent la circulation de l’information ;
- des opérations de normalisation, qui stabilisent les calculs.
Ces blocs sont répétés de nombreuses fois. Chaque passage affine la représentation des tokens.
Pourquoi le modèle ne regarde-t-il pas la réponse à l’avance ?
Dans un modèle génératif de type GPT, l’attention est causale : lorsqu’il prédit un token, le modèle peut utiliser les tokens précédents, mais pas les tokens futurs. Un masque empêche cette fuite d’information pendant l’entraînement.
Cette distinction explique un point souvent mal compris :
- pendant l’entraînement, de nombreuses positions d’une séquence peuvent être traitées en parallèle ;
- lors de la lecture du prompt, le modèle peut également traiter de nombreux tokens simultanément ;
- pendant la génération classique, les nouveaux tokens sont produits successivement, car chacun dépend de ceux déjà générés.
Les Transformers ont donc fortement amélioré le parallélisme de l’entraînement par rapport aux réseaux récurrents, sans rendre instantanée la génération de longues réponses.
La fenêtre de contexte : une mémoire de travail
Un modèle ne peut traiter qu’un nombre limité de tokens à la fois. Cette fenêtre de contexte contient la consigne, la conversation, les documents fournis et la réponse en cours.
Elle ressemble davantage à une mémoire de travail qu’à une mémoire durable. Si une information ne figure plus dans le contexte et n’est pas stockée ailleurs, le modèle ne peut pas la retrouver simplement parce qu’elle a été mentionnée autrefois.
Une grande fenêtre de contexte permet de fournir davantage d’informations, mais elle ne garantit pas que le modèle exploitera chaque détail avec la même fiabilité. La sélection et l’organisation du contexte restent importantes.
À retenir
Un grand modèle de langage transforme des tokens à travers de nombreuses couches. L’attention met en relation les éléments utiles du contexte ; l’entraînement ajuste les paramètres ; le masque causal préserve la logique de prédiction du token suivant.
Dans l’article suivant, nous préciserons le rôle des tokens et des embeddings, puis nous verrons comment formuler une demande réellement exploitable.
Pour aller plus loin
- Vaswani et al., Attention Is All You Need, 2017.