📚 Série · Les familles de modèles en IA

IA : LLM, VLM, OCR... le panorama des familles de modèles

IA : LLM, VLM, OCR... le panorama des familles de modèles

Quand on parle d’IA en 2026, presque tout le monde pense à la même chose : un chatbot textuel, ChatGPT, Claude ou Gemini. C’est le LLM (Large Language Model), et c’est devenu tellement dominant dans les usages grand public que le terme “IA” s’est réduit à cette seule famille dans le langage courant.

Sauf que le champ est beaucoup plus large. Un modèle qui lit un document scanné, un modèle qui génère une image, un modèle qui transcrit ta voix, un modèle qui retrouve un passage pertinent dans 10 000 pages : ce sont des familles différentes, avec des architectures différentes, des usages différents, et souvent des tailles très différentes (certaines tournent sur un téléphone).

Ce dossier fait le tour de ces familles, une par une. Cet article sert d’index : une vue d’ensemble rapide, puis un article dédié à chaque famille pour creuser.

Pourquoi cette confusion existe

Le succès public des LLM (ChatGPT fin 2022, puis la vague qui a suivi) a fait de ce terme un synonyme d’“IA générative” dans les médias et les conversations courantes. Mais un LLM classique ne voit pas les images, n’entend pas le son, et ne fait que produire du texte token par token. Tout le reste (vision, audio, génération d’image, recherche) repose sur d’autres architectures, parfois combinées avec un LLM, parfois totalement indépendantes.

Les familles au programme

LLM, les grands modèles de langage Le cœur du sujet : du texte en entrée, du texte en sortie. C’est ce qui fait tourner Claude, ChatGPT ou Mistral. Raisonnement, rédaction, code, résumé : tout part de là.

VLM, les modèles vision-langage Un LLM ne peut pas décrire une photo. Un VLM ajoute un encodeur visuel à l’architecture pour interpréter conjointement images et texte. C’est ce qui permet à Claude ou ChatGPT d’analyser une capture d’écran ou un graphique.

OCR, la reconnaissance de texte Souvent confondu avec le VLM parce que les deux “lisent” une image, l’OCR a un objectif plus étroit : extraire le texte brut d’un document (facture scannée, formulaire, plaque d’immatriculation). Les VLM modernes savent aussi faire de l’OCR, mais un moteur OCR dédié reste souvent plus rapide et plus précis sur ce cas précis.

Modèles de diffusion, la génération d’image Midjourney, Stable Diffusion, les générateurs d’image de Gemini ou GPT : tous reposent sur une architecture de diffusion, qui part de bruit aléatoire et le débruite progressivement jusqu’à obtenir une image cohérente avec le prompt.

Modèles audio, parole et voix Deux directions : la transcription (speech-to-text, type Whisper) qui transforme la voix en texte, et la synthèse (text-to-speech) qui fait l’inverse. Directement pertinent pour mon projet d’appli de contes narrés : c’est la brique TTS qui donne une voix expressive au texte généré.

Embeddings et reranking, la recherche sémantique La brique invisible derrière tout système de RAG. Un modèle d’embedding transforme un texte en vecteur numérique pour comparer des sens plutôt que des mots-clés ; un modèle de reranking affine ensuite l’ordre des résultats trouvés.

SLM, les petits modèles de langage Des LLM taillés pour tourner en local, sur un téléphone ou un mini-PC, sans dépendre du cloud. Gemma, Phi, ou les modèles que j’utilise dans mon appli Android de contes pour enfants entrent dans cette famille : moins puissants qu’un modèle frontière, mais suffisants pour un usage ciblé et hors-ligne.

Modèles vidéo et world models La famille la plus jeune et la plus disputée. D’un côté les générateurs vidéo type Sora ou Veo, qui produisent une séquence à partir d’un prompt. De l’autre, des systèmes comme Genie 3 de DeepMind, capables de simuler les règles d’un environnement et de prédire ce qui se passe quand on interagit avec ce monde, pas seulement de générer une vidéo linéaire. La frontière entre “générateur vidéo” et “vrai world model” fait d’ailleurs débat dans la recherche : action-conditionnement ou non, simulation ou simple rendu.

Vue d’ensemble

flowchart TD
    A[Modèles d'IA] --> B[LLM<br/>texte → texte]
    A --> C[VLM<br/>image+texte → texte]
    A --> D[OCR<br/>image → texte brut]
    A --> E[Diffusion<br/>texte → image]
    A --> F[Audio<br/>voix ↔ texte]
    A --> G[Embeddings/Reranking<br/>texte → vecteur]
    A --> H[SLM<br/>léger, on-device]
    A --> I[Vidéo / World models<br/>texte/image → vidéo ou monde simulé]

Comment lire la suite du dossier

Chaque famille a droit à son article dédié, avec les modèles marquants, le fonctionnement de base, et des cas d’usage concrets : LLM : comment fonctionnent les grands modèles de langage, VLM : quand un modèle d’IA sait lire une image, OCR : la reconnaissance de texte, entre pipelines classiques et VLM, Modèles de diffusion : comment l’IA génère une image à partir de bruit, Modèles audio : de la voix au texte, et retour, Embeddings et reranking : les briques invisibles derrière le RAG, SLM : les petits modèles de langage qui tournent sans le cloud et Modèles vidéo et world models : générer une séquence, simuler un monde.

Sources

  1. Vision-language model - Wikipediaen.wikipedia.org
  2. Genie 3: The world model that generates interactive 3D environmentsanthemcreation.com

← Tous les articles