📚 Série · Les familles de modèles en IA

SLM : les petits modèles de langage qui tournent sans le cloud

SLM : les petits modèles de langage qui tournent sans le cloud

Septième famille du dossier sur IA : LLM, VLM, OCR... le panorama des familles de modèles : les SLM, ou petits modèles de langage. C’est la famille que j’utilise directement dans mon appli Android de contes narrés pour enfants, celle qui permet de faire tourner un modèle de langage sans connexion internet et sans dépendre d’un serveur distant.

La même architecture, en plus petit

Un SLM est construit sur la même base qu’un LLM : comment fonctionnent les grands modèles de langage, l’architecture transformer, mais avec un nombre de paramètres qui le rend exécutable sur du matériel grand public, un ordinateur portable, un mini-PC ou un téléphone récent, sans dépendance au cloud2. En pratique, la fourchette 2026 se situe autour de 1 à 10 milliards de paramètres1, contre plusieurs centaines de milliards, voire plus d’un trillion, pour les modèles frontière.

Techniquement, la réduction de taille passe par plusieurs leviers : moins de couches transformer, des dimensions internes plus petites, et des mécanismes d’attention optimisés comme le Grouped Query Attention, qui partage une même paire clé-valeur entre plusieurs têtes de requête pour réduire la mémoire nécessaire à l’inférence2.

flowchart TD
    A[LLM frontière<br/>100B+ paramètres] -->|réduction de taille,<br/>architecture optimisée| B[SLM<br/>1-10B paramètres]
    B --> C[Tourne en local<br/>téléphone, mini-PC]
    B --> D[Latence quasi nulle]
    B --> E[Pas de dépendance réseau]

Ce qui a changé en 2026 : la qualité par les données, pas la taille

Le vrai tournant, c’est que la qualité des données d’entraînement compte désormais plus que la taille brute du modèle. Microsoft a démontré ce principe avec sa famille Phi : Phi-4, avec 14 milliards de paramètres, dépasse des modèles bien plus gros sur le raisonnement mathématique et le code, entraîné principalement sur des données synthétiques de haute qualité plutôt que sur un simple aspirateur du web3. Résultat concret : en 2026, un modèle de 2,6 milliards de paramètres correctement affiné a battu DeepSeek-R1, un modèle de 671 milliards de paramètres, sur des tâches de raisonnement spécifiques à un domaine3.

Le paysage 2026

  • Phi-4 / Phi-4-mini (Microsoft) : le meilleur rapport raisonnement/taille, mais un point faible net en multilingue.
  • Gemma 3 et Gemma 4 (Google) : la référence pour le multimodal embarqué (texte, image, audio, vidéo sans encodeurs séparés pour Gemma 4) et pour la quantization agressive, avec un modèle E2B qui charge en moins d’1 Go pour un usage texte seul1.
  • Qwen 3 / 3.5 (Alibaba) : le choix multilingue et long contexte.
  • Llama 3.2 (Meta) : l’option la plus répandue côté écosystème communautaire.

Pourquoi c’est le bon choix pour un agent ou une appli embarquée

Une thèse de recherche NVIDIA de 2025 a posé le cadre : dans une boucle agentique, la plupart des tâches sont répétitives et étroites (analyser une entrée, appeler un outil, formater un résultat structuré), pas du raisonnement ouvert. Un SLM de 3 à 9 milliards de paramètres suffit largement à ce genre de travail, plus vite, moins cher et plus confidentiellement qu’un modèle frontière dans le cloud1.

Le cas concret de mon appli de contes

C’est exactement ce compromis que j’exploite : un SLM type Gemma 4 génère le texte de l’histoire directement sur le téléphone, sans connexion, puis un modèle Modèles audio : de la voix au texte, et retour lui donne une voix. Le point d’attention principal reste le prompt système : un SLM suit bien les premières instructions d’un prompt, puis dérive progressivement sur les suivantes si le prompt est trop long. Mieux vaut des instructions courtes et directes que la structure verbeuse qui fonctionne sur un modèle frontière.

La limite à garder en tête

Un SLM perd en profondeur sur le raisonnement complexe et l’analyse de documents longs. La bonne pratique en production consiste souvent à faire tourner le SLM par défaut, et à escalader vers un modèle plus gros seulement en cas de faible confiance ou d’échec sur une tâche donnée, plutôt que d’utiliser un modèle frontière pour tout, par défaut.

Sources

  1. Small Language Models for On-Device Agents in 2026 - Digital Applieddigitalapplied.com
  2. Small Language Models (SLMs): Comprehensive Guide 2026 - Cogitxcogitx.ai
  3. Small Language Models Business Guide: Gemma, Phi, Qwen - Digital Applieddigitalapplied.com

← Tous les articles