Programme — LLM locaux — déploiement Ollama, vLLM et souveraineté
Déployer, sécuriser et industrialiser des modèles de langage en local ou on-prem : choix de modèles, Ollama, vLLM, GPU, RAG privé, gouvernance et souveraineté des données pour l'entreprise française et européenne.
Objectifs de la formation
- Choisir une architecture LLM locale adaptée au cas d'usage et aux contraintes de conformité
- Déployer Ollama et vLLM en environnement maîtrisé (GPU, mémoire, quantisation)
- Sécuriser l'accès, les données et les intégrations applicatives
- Mesurer coûts, latence et qualité pour piloter la production
- Argumenter la souveraineté et le positionnement face au SaaS cloud
Prérequis
- Bases Linux et réseau
- Notions de LLM / prompts
- Familiarité avec les API HTTP
Programme détaillé
Version flash
Reader's DigestL'essentiel de chaque chapitre en une phrase.
Panorama des motivations (confidentialité, latence, coûts, souveraineté, air-gap) et des architectures SaaS, on-premise et hybride pour décider quand déployer un LLM local en entreprise.
Panorama des grandes familles de modèles ouverts (Llama, Mistral, Qwen, Gemma, DeepSeek) et décryptage juridique des licences qui conditionnent leur usage commercial en France et en Europe.
Comprendre la relation entre taille de modèle, précision numérique et mémoire GPU pour dimensionner correctement une infrastructure de LLM local.
Installation et mise en service d'Ollama sur un serveur Linux : service systemd, gestion des modèles, API HTTP, paramétrage d'inférence et premières mesures de sécurisation réseau.
Quand et pourquoi remplacer Ollama par vLLM pour servir des LLM en production, avec PagedAttention, continuous batching et une API compatible OpenAI.
Comment placer un moteur d'inférence Ollama ou vLLM derrière un reverse proxy sécurisé, avec authentification, quotas par équipe et isolation réseau, pour un déploiement conforme aux exigences d'entreprise.
Concevoir un pipeline de retrieval-augmented generation entièrement on-prem, depuis l'ingestion documentaire jusqu'aux citations, sans jamais exposer les données à un service cloud.
Panorama des menaces propres aux modèles de langage auto-hébergés — prompt injection, exfiltration via les outils, vol de poids, chaîne d'approvisionnement — et des mesures de durcissement à mettre en œuvre côté OS, conteneurs et politiques applicatives.
Mettre en place les métriques, tableaux de bord et budgets qui permettent de piloter un déploiement de LLM local comme un service de production, et non comme une expérimentation.
Ce chapitre traite des obligations juridiques et organisationnelles qui encadrent un déploiement de LLM en entreprise : hébergement, transferts de données, RGPD, AI Act et répartition des responsabilités entre RSSI, DPO et métier.
Comment brancher un LLM local (Ollama, vLLM) sur des applications métier existantes sans réécrire toute la plateforme, en gérant les pannes et la dégradation de service.
Un atelier guidé pour transformer un pilote LLM local en service de production : checklist go-live 30/60/90 jours, matrice de risques, plan de capacité et runbook d'incident.
Vous préférez être accompagné ?
Un expert peut intervenir directement dans votre organisation après la formation.
Contactez un expertPrêt à maîtriser LLM locaux — déploiement Ollama, vLLM et souveraineté ?
Commencer le chapitre 1