Déployer des LLM en local : dimensionnement, fine-tuning, inférence et sécurité
Hébergez, spécialisez et sécurisez vos propres modèles de langage, sans envoyer vos données chez un fournisseur.
2 000 € HT la session
Vos collaborateurs rejoignent une session à date fixe, aux côtés de participants venus d'autres entreprises.
5 850 € HT la session
La formation est dispensée au sein de votre entreprise et réunit vos seuls collaborateurs, dans le cadre d'une session dédiée.
Algorythme Formation (SAS) — SIRET 101 916 674 00019 — NDA 75331851633 — 422 Avenue de Verdun, 33700 Mérignac — 05 54 54 24 84 — contact@algorythme-formation.fr
Ce que vous saurez faire
- Justifier l'hébergement local d'un LLM selon des critères de souveraineté, de coût et de confidentialité
- Dimensionner une infrastructure d'inférence à partir des besoins d'usage
- Déployer et comparer des modèles quantifiés avec Ollama et llama.cpp
- Choisir entre prompt, RAG et fine-tuning, puis mesurer l'effet de l'adaptation
- Spécialiser un modèle ouvert avec LoRA ou QLoRA
- Servir un modèle en production avec vLLM et en mesurer les performances
- Protéger une application LLM contre les injections de prompt et les fuites de données
Ce que ça change, concrètement
Utiliser l'IA sur des données sensibles
Aujourd'hui
Les projets s'arrêtent en revue de sécurité, car les données ne peuvent pas sortir de l'entreprise.
Après la formation
Un modèle ouvert tourne sur vos serveurs, derrière une passerelle qui filtre et masque les données sensibles.
Dimensionner l'infrastructure
Aujourd'hui
Les GPU sont achetés ou loués à l'estime, trop justes ou largement sous-utilisés.
Après la formation
Un dimensionnement chiffré à partir du modèle, de la quantification et du nombre d'utilisateurs.
Adapter le modèle au métier
Aujourd'hui
Le modèle généraliste ignore le vocabulaire et les formats maison, malgré des prompts à rallonge.
Après la formation
Un adaptateur LoRA entraîné sur vos exemples, avec une mesure objective du gain.
Le déroulé
JOUR 1 — Faire tourner un LLM sur ses propres machines 7 h
1 h Pourquoi héberger son modèle
- Souveraineté, confidentialité, coût à l'usage, dépendance à un fournisseur : poser le choix
- Modèles ouverts (Mistral, Llama, Qwen, Gemma) : licences et conditions d'usage commercial
- Présentation du projet fil rouge : un assistant interne hébergé sur les serveurs de l'entreprise
1 h 30 Dimensionner le matériel
- Estimer la mémoire GPU : poids du modèle, cache KV, longueur de contexte, utilisateurs simultanés
- GPU grand public, cartes datacenter, Apple Silicon, CPU : ce que chacun permet
- Quantification (GGUF, AWQ, GPTQ, FP8) : mémoire gagnée contre qualité perdue
- Atelier : établir une fiche de dimensionnement pour trois scénarios d'usage
2 h Inférence locale avec Ollama et llama.cpp
- Installation, conteneur Docker, API compatible OpenAI
- Mesurer : délai avant le premier token, débit, qualité sur un jeu de questions
- Versionner la configuration de déploiement avec Git
- Atelier : déployer un modèle de 7 à 8 milliards de paramètres en plusieurs quantifications et comparer
1 h Prompt, RAG ou fine-tuning : choisir
- Ce que chaque approche apporte : connaissances, style, format, comportement
- Coût, données nécessaires, maintenance : une grille de décision
- Constituer un jeu d'évaluation avant toute adaptation
1 h 30 Préparer les données d'entraînement
- Format instruction / réponse et gabarits de conversation (chat templates)
- La qualité avant le volume : nettoyage, dédoublonnage, équilibre des exemples
- Données synthétiques : intérêt et pièges
- Atelier : préparer un jeu d'entraînement métier pour le fil rouge
JOUR 2 — Spécialiser, servir à grande échelle, sécuriser 7 h
2 h Fine-tuning avec LoRA et QLoRA
- Principe des adaptateurs, choix du rang et des couches ciblées
- Taux d'apprentissage, taille de lot, nombre d'époques : repérer le surapprentissage
- Outillage : Hugging Face PEFT et TRL, Unsloth
- Atelier : entraîner l'adaptateur, fusionner les poids, comparer avant et après sur le jeu d'évaluation
2 h Servir le modèle en production
- vLLM, TGI, SGLang : fonctionnement et critères de choix
- Batching continu, PagedAttention, cache de préfixe : pourquoi le débit change d'échelle
- Plusieurs GPU : parallélisme de tenseurs et de pipeline
- Servir plusieurs adaptateurs LoRA sur un même modèle de base
- Atelier : déployer le modèle spécialisé sur vLLM, le tester en charge et le brancher à une application
2 h Sécuriser de bout en bout
- Menaces : injection de prompt, contournement des consignes, fuite de données (OWASP Top 10 pour les LLM)
- Filtrer entrées et sorties : Llama Guard, NeMo Guardrails, passerelle LiteLLM
- Détecter et masquer les données personnelles avant et après le modèle
- Contrôle d'accès par rôle, quotas, journalisation
- Atelier : placer une passerelle de sécurité devant le modèle, puis tenter de la contourner
1 h Exploiter dans la durée
- Supervision : charge GPU, latence, coûts, qualité des réponses
- Versionner modèles, adaptateurs et configurations
- Conformité : RGPD, AI Act, documentation du système
Programme de référence, adapté à votre cahier des charges
Le socle commun
- Les objectifs pédagogiques
- La durée et le découpage horaire
- Les prérequis
- Les modalités d'évaluation des acquis
Votre déclinaison
- Les travaux pratiques et les jeux de données
- L'environnement technique et les outils utilisés
- L'ordre et la pondération des séquences
- Les exemples tirés de vos projets
Le programme définitif est annexé à la convention de formation et constitue le seul document contractuel de référence.
Questions fréquentes
Nos collaborateurs n'ont pas tous le même niveau.
Un test de positionnement est adressé à chaque participant avant l'entrée en formation et le déroulé est ajusté aux niveaux réellement présents. Si l'écart est trop important pour une même session, nous vous le signalons avant l'établissement de la convention.
La formation peut-elle porter sur nos propres outils et projets ?
Oui. Les travaux pratiques portent sur votre environnement technique et sur des cas tirés de vos projets. Les objectifs et la durée, eux, restent ceux du programme de référence.
Cette formation est-elle finançable par notre OPCO ?
Oui, dans les conditions propres à votre branche. Algorythme Formation est certifié Qualiopi au titre de la catégorie d'action « Actions de formation ». Nous constituons les pièces du dossier avec vous.
La formation peut-elle se tenir à distance ?
Oui. Nos formations sont conduites dans vos locaux ou en classe virtuelle, avec partage d'écran et travaux pratiques encadrés. Le choix se fait au moment du cadrage, en fonction de la répartition de vos équipes.
Sous quel délai une session peut-elle démarrer ?
Comptez 5 jours ouvrés pour recevoir la proposition et le programme adaptés, puis 4 à 8 semaines avant l'entrée en formation. Un dossier OPCO demande 3 semaines supplémentaires au minimum.
Un de nos participants est en situation de handicap.
Signalez-le au moment du cadrage : les modalités, les supports et le rythme sont adaptés au cas par cas. Notre référent handicap, Mathieu Piron-Lafleur, étudie chaque situation avec vous (contact@algorythme-formation.fr).
Modalités et informations pratiques
- Public visé
-
- Développeurs backend et tech leads
- Ingénieurs IA et MLOps
- Architectes et ingénieurs infrastructure chargés d'héberger des modèles de langage
- Prérequis
-
- Développer en Python et utiliser Git au quotidien
- Connaître le fonctionnement des LLM et avoir déjà appelé une API de modèle
- Être à l'aise sous Linux, en ligne de commande et avec Docker
- Durée et organisation
- 14 heures, 2 jours, en présentiel, en distanciel ou les deux. De 2 à 12 participants, dans vos locaux ou en classe virtuelle.
- Évaluation et suivi
-
- À l'entrée : analyse du besoin, test de positionnement, auto-évaluation
- En cours : exercice validé à chaque séquence, point d'étape à mi-parcours
- En fin : mise en situation, auto-évaluation de sortie, certificat de réalisation
- À distance : satisfaction à chaud, questionnaire à froid à 90 jours, bilan au commanditaire
- Modalités et délais d'accès
-
Prise de contact, puis entretien d'analyse du besoin de 30 minutes.
Proposition et programme adaptés sous 5 jours ouvrés.
Entrée en formation sous 4 à 8 semaines après signature de la convention, et 3 semaines supplémentaires minimum en cas de dossier OPCO. - Tarif
-
-
Inter-entreprises
2 000 € HT la session
Vos collaborateurs rejoignent une session à date fixe, aux côtés de participants venus d'autres entreprises.
-
Intra-entreprise
5 850 € HT la session
La formation est dispensée au sein de votre entreprise et réunit vos seuls collaborateurs, dans le cadre d'une session dédiée.
Acompte de 50 % à la signature, solde à 30 jours. Frais de déplacement en sus hors Gironde. Action de formation finançable par votre OPCO.
-
- Accessibilité et handicap
-
Nos actions de formation sont ouvertes aux personnes en situation de
handicap, avec une adaptation au cas par cas des modalités, des supports
et du rythme.
Référent handicap : Mathieu Piron-Lafleur, contact@algorythme-formation.fr. - Contacts
-
Algorythme Formation,
05 54 54 24 84
contact@algorythme-formation.fr
Référent pédagogique : Alan Piron-Lafleur. Référent qualité : Mayana Elbaz.
Programme mis à jour le 24/09/2026.
Organiser cette formation dans votre entreprise
Trente minutes pour préciser votre besoin.
Demander une proposition