📚 Série · Traiter ses documents avec LlamaIndex
LlamaIndex : connecter un LLM à tes propres données
Un modèle de langage ne connaît pas tes documents. LlamaIndex existe précisément pour combler ce vide. C’est une bibliothèque Python open source, autrefois connue sous le nom de GPT Index, pensée pour relier un LLM à tes propres sources d’information.
L’idée : une couche entre le modèle et tes données
LlamaIndex se place comme une couche intermédiaire entre un modèle, par exemple GPT ou Llama, et des sources variées : des documents, une base SQL, des API ou des fichiers JSON. Son rôle est de construire des structures d’index sur tes données, pour que le modèle puisse y rechercher et récupérer efficacement l’information pertinente.
Concrètement, la bibliothèque s’organise autour de trois fonctions1 :
- L’indexation, qui crée des index adaptés à chaque type de données.
- La recherche contextuelle, qui injecte les bons passages dans le prompt pour une meilleure compréhension.
- Les extensions personnalisées, pour bâtir des workflows sur mesure selon ton cas d’usage.
Si ces idées te parlent, c’est normal : LlamaIndex est l’un des outils de référence pour mettre en place du RAG, cette technique qui ancre les réponses d’un modèle dans tes documents.
Ce qui a changé : du framework aux services
Voici le point à intégrer si tu repars d’un contenu de 2024. L’écosystème LlamaIndex a beaucoup évolué, et son centre de gravité s’est déplacé du simple framework vers des services managés, regroupés sous LlamaCloud2.
Deux évolutions méritent l’attention. D’un côté, Workflows 1.0 est sorti comme une bibliothèque d’orchestration légère et autonome, avec un état typé et de l’observabilité intégrée, pour enchaîner proprement les étapes d’une application3. De l’autre, l’offre s’est étoffée avec des briques prêtes à l’emploi pour déployer des agents et traiter des documents à grande échelle3. Le framework open source n’a pas disparu, mais il s’inscrit désormais dans une plateforme plus large.
Les deux compagnons à connaître
Tu ne feras pas grand-chose avec LlamaIndex sans d’abord transformer tes documents en quelque chose de propre. C’est là qu’interviennent ses deux outils phares, que je détaille dans cette série :
- LlamaParse pour convertir des PDF, présentations ou tableurs complexes en texte exploitable.
- LlamaExtract pour en tirer des données structurées, prêtes à entrer dans une base.
L’essentiel à retenir
LlamaIndex reste la couche qui relie un modèle à tes données, par l’indexation et la recherche contextuelle. Mais en 2026, ne le vois plus seulement comme une bibliothèque Python : c’est devenu un écosystème, avec des workflows autonomes et des services managés autour. Pour un projet concret, tu combineras presque toujours le framework avec LlamaParse et LlamaExtract.