HarmonyFidelisHarmonyFidelis
Connexion
Fondamentaux IAFonctionnement des LLMCompétences LLMÉvaluationGlossaireConfigurateur
Académie Aura

Section 2 · Mécanismes

Comment fonctionnent les grands modèles de langage

Un LLM prédit des tokens à partir du contexte. L’échelle et l’entraînement rendent cet objectif simple étonnamment puissant, mais le modèle génère toujours des continuations probables au lieu de consulter une réserve garantie de faits.

Débutant à intermédiaire25 minutes

À la fin, vous saurez

  • Expliquer tokens, embeddings, attention et Transformer à un niveau pratique.
  • Distinguer pré-entraînement, post-entraînement et inférence.
  • Prévoir l’effet du contexte, de l’échantillonnage et de la mémoire externe.

Cinq étapes de la chaîne LLM

01

Tokenisation

Le texte est découpé en unités apprises. Un token n’est pas toujours un mot : orthographe, langue et format changent le compte et le coût.

02

Embeddings

Les tokens deviennent des vecteurs. L’entraînement fait émerger des relations géométriques utiles pour opérer sur des représentations contextualisées.

03

Attention et Transformers

L’auto-attention permet à chaque position de pondérer les autres. Les blocs Transformer répètent attention et calculs feed-forward.

04

Pré-entraînement et post-entraînement

Le pré-entraînement apprend des régularités par prédiction. SFT, RLHF ou DPO façonnent ensuite le suivi d’instructions et le comportement.

05

Inférence

À l’usage, le modèle calcule une distribution puis sélectionne le token suivant, encore et encore. Les réglages d’échantillonnage modulent la variation, pas les connaissances.

Du texte au texte généré

  1. 01

    Tokeniser

  2. 02

    Vectoriser

  3. 03

    Porter attention

  4. 04

    Prédire le token

  5. 05

    Répéter avec le contexte

La fenêtre de contexte est un état de travail, pas une mémoire durable. Un contexte plus long aide seulement si l’information est présente, accessible et bien utilisée.

Confusions fréquentes

  • Le token n’est pas une unité stable de mot : compte de mots et compte de tokens diffèrent.
  • Une grande fenêtre de contexte ne garantit pas une attention uniforme ; une preuve importante peut être manquée.
  • Le post-entraînement façonne le comportement sans transformer des probabilités générées en vérité garantie.

Exercice : suivre une réponse

Prenez une courte question et identifiez ce qui influence la réponse.

  • Séparer la consigne, le contexte fourni et l’information inférée depuis les paramètres.
  • Lister une ambiguïté susceptible de changer la prédiction des tokens.
  • Changer une fois le contexte ou l’échantillonnage et comparer la stabilité avec prudence.

Vérification rapide

Un LLM récupère-t-il une phrase vérifiée avant chaque réponse ?

Non. Par défaut il génère depuis ses paramètres et le contexte ; la recherche est un composant séparé.

Que fait l’auto-attention ?

Elle pondère l’information d’autres positions pour construire une représentation dépendante du contexte.

Quelle différence entre pré-entraînement et inférence ?

Le pré-entraînement modifie les paramètres sur beaucoup de données ; l’inférence utilise ces paramètres fixes sur une nouvelle entrée.

Mots-clés à connaître

  • token
  • tokenizer
  • embedding
  • attention
  • Transformer
  • pré-entraînement
  • SFT
  • RLHF
  • DPO
  • inférence

Recherche primaire

Attention Is All You NeedArticle primaire introduisant l’architecture Transformer.SentencePieceArticle primaire sur la tokenisation sous-mots indépendante de la langue.Entraîner les modèles à suivre des instructionsArticle primaire sur SFT et apprentissage par renforcement depuis des retours humains.Direct Preference OptimizationArticle primaire présentant l’optimisation directe depuis des préférences.Lost in the MiddleÉtude de l’utilisation par les LLM d’informations placées à différents endroits du contexte.
Précédent: IA, ML et deep learningSuivant: Compétences d’ingénierie LLM