📚 Série en 9 articles
Les familles de modèles en IA
Quand on dit "IA", on pense presque toujours "LLM" (ChatGPT, Claude...). Mais le champ est bien plus large : reconnaissance d'image, génération d'image, transcription audio, recherche sémantique, petits modèles embarqués, génération vidéo... Ce dossier fait le tour des grandes familles de modèles, ce qu'elles font, et où elles se croisent.
- IA : LLM, VLM, OCR... le panorama des familles de modèles IA ne veut pas dire que LLM. Panorama des 8 grandes familles de modèles : LLM, VLM, OCR, diffusion, audio, embeddings, SLM et world models, avec un schéma pour tout situer.
- LLM : comment fonctionnent les grands modèles de langage Comment fonctionne un LLM comme Claude ou ChatGPT : architecture transformer, auto-attention, paysage 2026 (labs propriétaires, open source, MoE) et limites à connaître.
- VLM : quand un modèle d'IA sait lire une image Qu'est-ce qu'un VLM (modèle vision-langage) : encodeur visuel, description d'image, question-réponse visuelle, différence avec l'OCR, et limites à connaître.
- OCR : la reconnaissance de texte, entre pipelines classiques et VLM L'OCR expliqué : du pipeline classique CRNN au tournant VLM (Mistral OCR, GLM-OCR). Comment choisir entre OCR spécialisé et LLM multimodal selon ton usage.
- Modèles de diffusion : comment l'IA génère une image à partir de bruit Comment fonctionne un modèle de diffusion type Stable Diffusion ou Midjourney : le débruitage, la diffusion latente, les Diffusion Transformers, et les limites (texte, cohérence, droit d'auteur).
- Modèles audio : de la voix au texte, et retour Whisper, Parakeet, Voxtral TTS : comment fonctionnent les modèles de transcription et de synthèse vocale en 2026, et comment choisir entre vitesse, qualité et usage hors-ligne.
- Embeddings et reranking : les briques invisibles derrière le RAG Comprendre les embeddings et le reranking, les briques du RAG : chunking, vecteurs, recherche hybride, cross-encoder, et modèles courants en 2026.
- SLM : les petits modèles de langage qui tournent sans le cloud Comment fonctionnent les SLM (Gemma 4, Phi-4, Qwen 3.5) : architecture, quantization, et pourquoi ils tournent sans cloud sur un téléphone ou un mini-PC en 2026.
- Modèles vidéo et world models : générer une séquence, simuler un monde Sora, Veo, Genie 3, JEPA : la différence entre un générateur vidéo et un vrai world model, les deux philosophies de recherche, et les usages en robotique et véhicules autonomes.