OLKERIActus IA
← Toutes les actus IA
Qu'est-ce qu'un grand modèle de langage ? Comment fonctionnent vraiment les LLM, expliqué simplement

Image: Olkeri

RechercheMonde29 août 20266 min de lecture

Par Olkeri.space

Qu'est-ce qu'un grand modèle de langage ? Comment fonctionnent vraiment les LLM, expliqué simplement

Un guide clair et non technique sur ce que sont les grands modèles de langage, comment ils sont entraînés, pourquoi ils hallucinent, et ce qu'ils peuvent ou ne peuvent pas faire.

Lire cet article en: Deutsch · English · Español

Un grand modèle de langage, souvent abrégé en LLM, est un programme informatique entraîné à prédire du texte. Cette seule phrase explique bien plus de choses sur l'intelligence artificielle moderne qu'on ne l'imagine, car presque tous les produits d'IA dont on parle aujourd'hui, des agents conversationnels aux assistants de programmation en passant par le service client automatisé, reposent sur cette unique idée.

Ce guide explique ce qu'est un LLM, comment il est construit, pourquoi il se comporte comme il le fait, et où se situent ses limites réelles. Aucune mathématique n'est nécessaire.

Ce qu'est réellement un grand modèle de langage :

Un LLM est un modèle statistique du langage de très grande taille. Pendant son entraînement, on lui présente des quantités énormes de texte et on lui confie une tâche répétitive unique : étant donné tout ce qui précède, prédire ce qui vient ensuite. Au fil de milliards de répétitions, le modèle ajuste des nombres internes, appelés paramètres, jusqu'à ce que ses prédictions deviennent très bonnes.

Les modèles modernes contiennent des centaines de milliards de ces paramètres. Ce ne sont pas des faits stockés dans une base de données. Ce sont des poids qui encodent des régularités : quels mots ont tendance à en suivre d'autres, comment les questions se rapportent aux réponses, en quoi le ton d'une clause juridique diffère de celui d'une recette, comment le code est structuré.

Lorsque vous tapez une question, le modèle ne consulte rien. Il génère une continuation plausible de votre texte, un jeton à la fois, un jeton correspondant approximativement à un fragment de mot. Tout ce que fait un LLM, y compris raisonner, traduire et écrire du code, émerge de ce processus de prédiction.

Comment un LLM est entraîné :

L'entraînement se déroule par étapes, et les comprendre explique l'essentiel du comportement des modèles.

La première étape est le pré-entraînement. Le modèle lit un très vaste corpus de texte : livres, sites web, dépôts de code, ouvrages de référence et bien d'autres. Il y apprend la grammaire, des faits, des styles, des schémas de raisonnement et des structures. Cette étape est de loin la plus coûteuse : elle mobilise des milliers de puces spécialisées pendant des semaines ou des mois, ce qui explique que seules des organisations bien financées construisent des modèles de pointe à partir de zéro.

La deuxième étape est l'affinage. Un modèle pré-entraîné prolongera volontiers n'importe quel texte, y compris un texte inutile ou nuisible. L'affinage lui apprend à se comporter comme un assistant, à partir d'exemples sélectionnés de bonnes réponses.

La troisième étape est l'alignement, souvent fondé sur le retour humain. Des personnes comparent les sorties du modèle et indiquent lesquelles sont meilleures. Le modèle est ensuite ajusté pour produire les réponses que les gens préfèrent : plus utiles, plus honnêtes, moins nuisibles. C'est là qu'un simple prédicteur de texte devient un interlocuteur réellement exploitable.

Pourquoi le transformeur a tout changé :

Presque tous les modèles actuels reposent sur une architecture appelée transformeur, introduite par des chercheurs de Google en 2017. Son mécanisme clé est l'attention, qui permet au modèle de pondérer la pertinence de chaque partie de l'entrée par rapport à toutes les autres.

Les approches antérieures traitaient le texte strictement dans l'ordre et peinaient à relier des idées éloignées. L'attention permet à un modèle de rattacher un pronom à un nom mentionné trois paragraphes plus haut, ou de relier la définition d'une fonction à son utilisation plus loin dans un fichier. Tout aussi important, les transformeurs s'entraînent efficacement sur le matériel parallèle moderne, ce qui a rendu praticable la montée en taille des modèles actuels.

La fenêtre de contexte, et pourquoi elle compte :

La fenêtre de contexte désigne la quantité de texte qu'un modèle peut prendre en compte simultanément, mesurée en jetons. Tout ce qui se trouve dans la fenêtre, votre question, la conversation en cours, les documents que vous collez, constitue ce que le modèle peut réellement voir.

Les premiers modèles traitaient quelques milliers de jetons, soit environ un long article. Les modèles actuels en traitent des centaines de milliers, l'équivalent de livres entiers ou de bases de code volumineuses. Une fenêtre plus large signifie que vous pouvez confier au modèle un contrat complet ou un dépôt entier plutôt que des fragments.

Tout ce qui se trouve hors de la fenêtre n'existe pas pour le modèle. C'est pourquoi les longues conversations perdent les détails antérieurs, et pourquoi les systèmes devant consulter de vastes archives doivent en extraire les passages pertinents et les placer dans la fenêtre plutôt que de compter sur une mémoire.

Pourquoi les modèles hallucinent :

L'hallucination, lorsqu'un modèle affirme une chose fausse avec une confiance totale, est la limitation la plus lourde de conséquences en pratique.

La cause est structurelle, ce n'est pas un défaut que l'on corrigera simplement par un correctif. Le modèle est entraîné à produire du texte plausible, et une réponse fluide, assurée et incorrecte est souvent statistiquement plus plausible qu'un aveu d'incertitude. Le modèle ne dispose d'aucun mécanisme intégré pour confronter une affirmation à la réalité. Il possède des régularités, pas de la connaissance au sens humain.

Le risque d'hallucination augmente fortement sur les faits obscurs, les chiffres précis, les citations, les références et les événements récents. Il diminue lorsqu'on fournit directement au modèle le matériau source, ce qui constitue toute la logique des systèmes de recherche documentaire.

La règle pratique : un LLM est fiable pour raisonner sur un texte que vous lui fournissez, et peu fiable comme substitut d'une base de données ou d'un moteur de recherche.

Les données d'entraînement ont une date limite :

La connaissance d'un modèle s'arrête au moment où s'achèvent ses données d'entraînement. Interrogez-le sur un événement postérieur à cette date et il dira soit qu'il l'ignore, soit, pire, il devinera. Les produits qui semblent connaître l'actualité récupèrent généralement des résultats de recherche en direct et les placent dans la fenêtre de contexte, ils ne s'en souviennent pas.

Ce pour quoi les LLM sont réellement bons :

La régularité observée dans les déploiements réussis est constante. Les LLM excellent à transformer du texte : résumer, réécrire, traduire, extraire des données structurées de documents non structurés, convertir des spécifications en code, rédiger et remettre en forme.

Ils sont performants là où un brouillon compétent fait gagner un temps substantiel et où un humain relit le résultat. Ils sont les plus faibles là où l'exactitude n'est pas négociable, là où la vérification est impossible, ou là où le coût d'une erreur assurée est élevé.

Ce qui vient ensuite :

La frontière avance dans trois directions. Des modèles qui raisonnent plus longtemps avant de répondre, échangeant du temps contre de la précision sur les problèmes difficiles. Des modèles multimodaux qui traitent images, audio et vidéo aussi naturellement que le texte. Et des agents qui accomplissent des actions dans des logiciels plutôt que de seulement produire du texte.

Aucune de ces évolutions ne change le tableau fondamental. En dessous, le système prédit toujours ce qui vient ensuite, extrêmement bien, à une échelle énorme. Comprendre cela fait toute la différence entre utiliser ces outils efficacement et en être surpris.