Programme — RAG : de la théorie à la production
Construire un système RAG fiable : chunking, embeddings, bases vectorielles, retrieval, rerank, citations, évaluation, sécurité des données, coûts et architecture type prête pour la prod.
Objectifs de la formation
- Expliquer quand RAG bat le fine-tuning et le prompt seul
- Concevoir chunking, embeddings et retrieval adaptés au corpus
- Mesurer grounding, recall et qualité des citations
- Dimensionner coûts, latence et sécurité des données
Prérequis
- Bases LLM
- Notions d'API et de bases de données
Programme détaillé
Version flash
Reader's DigestL'essentiel de chaque chapitre en une phrase.
Comprendre les limites structurelles d'un modèle de langage seul — fenêtre de contexte finie, connaissances figées, absence de traçabilité — pour situer le RAG parmi les alternatives disponibles.
Les décisions de découpage, de chevauchement et de nettoyage qui conditionnent la qualité de tout ce qu'un système RAG pourra ensuite récupérer et générer.
Comment un texte devient un vecteur, pourquoi cette projection conditionne toute la qualité d'un système RAG, et quels pièges de production (métrique, multilingue, drift de modèle) guettent une architecture qui repose dessus.
Comment un index vectoriel retrouve les voisins les plus proches à grande échelle sans comparaison exhaustive, et ce qu'implique ce compromis en production : structure HNSW, filtrage par métadonnées, opérations courantes.
Comment un moteur RAG sélectionne effectivement les passages transmis au LLM : recherche lexicale BM25, recherche vectorielle dense, hybridation, réécriture de requête et reranking.
Comprendre pourquoi le retrieval initial ne suffit pas, comment les cross-encoders affinent le classement des passages, et comment fusionner plusieurs signaux de pertinence sans dégrader la latence du pipeline.
Comment vérifier qu'une réponse générée par un système RAG est réellement ancrée dans les passages récupérés, comment citer ses sources de façon fiable, et quand refuser de répondre plutôt que d'inventer.
Un pipeline RAG qui « a l'air de marcher » en démo peut échouer silencieusement en production. Ce chapitre présente les métriques et méthodes pour mesurer objectivement la qualité de la récupération et de la génération : faithfulness, context precision, context recall et answer relevancy.
Comment protéger un système RAG contre les fuites de données entre utilisateurs, gérer les informations personnelles à chaque étape du pipeline et bâtir une journalisation exploitable sans devenir elle-même un risque.
Comprendre où part l'argent et le temps dans un pipeline RAG en production, et comment dimensionner l'infrastructure — tokens, cache, batch, SLOs — pour tenir un engagement de service dans la durée.
Le blueprint complet d'un pipeline RAG de production : ingestion, chunking, retrieval, génération, observabilité et boucle d'itération assemblés en un seul schéma.
Vous préférez être accompagné ?
Un expert peut intervenir directement dans votre organisation après la formation.
Contactez un expertPrêt à maîtriser RAG : de la théorie à la production ?
Commencer le chapitre 1