Intelligence Artificielle

Machine learning : les bases, de la donnée au modèle avec Python

Du tableau de données au modèle qui prédit : les algorithmes essentiels du machine learning, en pratique avec Python.

Durée
3 jours
Modalité
Présentiel, distanciel ou les deux
Effectif
De 2 à 12 participants
Formule de session

7 580 € HT la session

La formation est dispensée au sein de votre entreprise et réunit vos seuls collaborateurs, dans le cadre d'une session dédiée.

Algorythme Formation (SAS) — SIRET 101 916 674 00019 — NDA 75331851633 — 422 Avenue de Verdun, 33700 Mérignac — 05 54 54 24 84 — contact@algorythme-formation.fr

Ce que vous saurez faire

  • Traduire une question métier en problème de classification, de régression ou de clustering
  • Préparer un jeu de données sans fuite d'information, dans un pipeline reproductible
  • Entraîner et comparer les principaux algorithmes de machine learning avec scikit-learn
  • Évaluer un modèle avec les métriques adaptées et régler ses hyperparamètres
  • Améliorer les performances grâce aux méthodes d'ensemble
  • Expliquer les prédictions d'un modèle et en vérifier les biais
  • Segmenter des données avec les algorithmes de clustering

Ce que ça change, concrètement

Anticiper le départ des clients

Aujourd'hui

Les départs sont constatés après coup, dans les tableaux de bord du mois suivant.

Après la formation

Un modèle attribue un score de risque à chaque client, avec un seuil choisi selon le coût d'une action.

Choisir et défendre un modèle

Aujourd'hui

On garde le premier modèle qui obtient un bon score, sans savoir s'il tiendra sur de nouvelles données.

Après la formation

Une validation croisée, des métriques adaptées et des explications SHAP pour convaincre les métiers.

Segmenter une clientèle

Aujourd'hui

Les segments sont définis à la main, sur deux ou trois critères hérités.

Après la formation

Un clustering sur l'ensemble des données, avec un portrait lisible de chaque segment.

Le déroulé

JOUR 1 — Poser un problème de machine learning 7 h

1 h Ce que le machine learning sait faire

  • IA, data science, machine learning, deep learning : situer les notions
  • Apprentissage supervisé, non supervisé, par renforcement
  • Classification, régression, clustering : reconnaître le problème derrière une question métier
  • Test de positionnement en début de formation

2 h Environnement et exploration des données

  • Python, Jupyter, pandas, scikit-learn : mettre en place l'environnement de travail
  • Explorer un jeu de données : distributions, corrélations, valeurs manquantes
  • Atelier : explorer le jeu de données fil rouge, le désabonnement des clients d'un service par abonnement

2 h Comment un modèle apprend

  • Variables explicatives, cible, fonction de coût
  • La descente de gradient expliquée pas à pas
  • Sous-apprentissage, surapprentissage, compromis biais-variance
  • Régularisation : Ridge et Lasso
  • Atelier : coder une régression linéaire à la main, puis la comparer à scikit-learn

2 h La régression

  • Régression linéaire simple et multiple, régression polynomiale
  • Valeurs aberrantes et régression robuste (RANSAC)
  • Mesurer l'erreur : MAE, RMSE, R²
  • Atelier : estimer le prix de biens immobiliers à partir des données publiques DVF
JOUR 2 — Classer et fiabiliser 7 h

2 h Les algorithmes de classification

  • Régression logistique, k plus proches voisins, SVM et noyaux, arbres de décision
  • Forces, limites et cas d'usage de chacun
  • Atelier : premier modèle de prédiction du désabonnement

2 h Préparer les données

  • Données manquantes, encodage des variables catégorielles, mise à l'échelle
  • Créer et sélectionner les variables utiles
  • Réduction de dimension : ACP, ADL
  • Pipelines scikit-learn et fuite de données : éviter l'erreur la plus fréquente
  • Atelier : construire le pipeline de préparation complet du fil rouge

2 h Évaluer et régler un modèle

  • Jeux d'entraînement, de validation et de test ; validation croisée
  • Matrice de confusion, précision, rappel, F1, courbe ROC ; classes déséquilibrées
  • Recherche d'hyperparamètres : grille, tirage aléatoire, Optuna
  • Atelier : optimiser le modèle et fixer le seuil de décision selon le coût métier

1 h Classer des textes

  • Du texte aux nombres : sac de mots, TF-IDF
  • Un classifieur de texte simple, et ses limites face aux modèles de langage
  • Atelier : trier automatiquement des avis clients
JOUR 3 — Méthodes d'ensemble, clustering et mise en pratique 7 h

2 h Les méthodes d'ensemble

  • Vote, bagging, stacking
  • Forêts aléatoires
  • Boosting : AdaBoost, gradient boosting, XGBoost et LightGBM
  • Atelier : battre le meilleur modèle de la veille sur le fil rouge

1 h Expliquer les prédictions

  • Importance des variables et dépendance partielle
  • Valeurs SHAP : expliquer une prédiction individuelle
  • Biais et équité : vérifier que le modèle ne discrimine pas

2 h Le clustering

  • k-means et k-means++, choisir le nombre de groupes (méthode du coude, silhouette)
  • Clustering hiérarchique, DBSCAN, clustering flou
  • Atelier : segmenter une base clients et dresser le portrait de chaque segment

2 h Projet de synthèse

  • En binôme, mener un cas complet : question métier, données, modèle, évaluation, restitution
  • Sauvegarder et réutiliser un modèle ; aperçu du suivi d'expériences avec MLflow
  • Test de positionnement en fin de formation

Programme de référence, adapté à votre cahier des charges

Le socle commun

  • Les objectifs pédagogiques
  • La durée et le découpage horaire
  • Les prérequis
  • Les modalités d'évaluation des acquis

Votre déclinaison

  • Les travaux pratiques et les jeux de données
  • L'environnement technique et les outils utilisés
  • L'ordre et la pondération des séquences
  • Les exemples tirés de vos projets

Le programme définitif est annexé à la convention de formation et constitue le seul document contractuel de référence.

Questions fréquentes

Nos collaborateurs n'ont pas tous le même niveau.

Un test de positionnement est adressé à chaque participant avant l'entrée en formation et le déroulé est ajusté aux niveaux réellement présents. Si l'écart est trop important pour une même session, nous vous le signalons avant l'établissement de la convention.

La formation peut-elle porter sur nos propres outils et projets ?

Oui. Les travaux pratiques portent sur votre environnement technique et sur des cas tirés de vos projets. Les objectifs et la durée, eux, restent ceux du programme de référence.

Cette formation est-elle finançable par notre OPCO ?

Oui, dans les conditions propres à votre branche. Algorythme Formation est certifié Qualiopi au titre de la catégorie d'action « Actions de formation ». Nous constituons les pièces du dossier avec vous.

La formation peut-elle se tenir à distance ?

Oui. Nos formations sont conduites dans vos locaux ou en classe virtuelle, avec partage d'écran et travaux pratiques encadrés. Le choix se fait au moment du cadrage, en fonction de la répartition de vos équipes.

Sous quel délai une session peut-elle démarrer ?

Comptez 5 jours ouvrés pour recevoir la proposition et le programme adaptés, puis 4 à 8 semaines avant l'entrée en formation. Un dossier OPCO demande 3 semaines supplémentaires au minimum.

Un de nos participants est en situation de handicap.

Signalez-le au moment du cadrage : les modalités, les supports et le rythme sont adaptés au cas par cas. Notre référent handicap, Mathieu Piron-Lafleur, étudie chaque situation avec vous (contact@algorythme-formation.fr).

Modalités et informations pratiques

Public visé
  • Data analysts et data scientists débutants
  • Ingénieurs et développeurs qui veulent se lancer dans le machine learning
  • Analystes métier (marketing, finance, industrie) qui travaillent sur des données
Prérequis
  • Connaître les bases de Python : variables, fonctions, bibliothèques
  • Avoir des notions de statistiques descriptives : moyenne, écart-type, corrélation
  • Aucune connaissance préalable en machine learning n'est nécessaire
Durée et organisation
21 heures, 3 jours, en présentiel, en distanciel ou les deux. De 2 à 12 participants, dans vos locaux ou en classe virtuelle.
Évaluation et suivi
  • À l'entrée : analyse du besoin, test de positionnement, auto-évaluation
  • En cours : exercice validé à chaque séquence, point d'étape à mi-parcours
  • En fin : mise en situation, auto-évaluation de sortie, certificat de réalisation
  • À distance : satisfaction à chaud, questionnaire à froid à 90 jours, bilan au commanditaire
Modalités et délais d'accès
Prise de contact, puis entretien d'analyse du besoin de 30 minutes.
Proposition et programme adaptés sous 5 jours ouvrés.
Entrée en formation sous 4 à 8 semaines après signature de la convention, et 3 semaines supplémentaires minimum en cas de dossier OPCO.
Tarif
  • Intra-entreprise

    7 580 € HT la session

    La formation est dispensée au sein de votre entreprise et réunit vos seuls collaborateurs, dans le cadre d'une session dédiée.

  • Inter-entreprises

    2 350 € HT la session

    Vos collaborateurs rejoignent une session à date fixe, aux côtés de participants venus d'autres entreprises.

Acompte de 50 % à la signature, solde à 30 jours. Frais de déplacement en sus hors Gironde. Action de formation finançable par votre OPCO.

Accessibilité et handicap
Nos actions de formation sont ouvertes aux personnes en situation de handicap, avec une adaptation au cas par cas des modalités, des supports et du rythme.
Référent handicap : Mathieu Piron-Lafleur, contact@algorythme-formation.fr.
Contacts
Algorythme Formation,
05 54 54 24 84
contact@algorythme-formation.fr

Référent pédagogique : Alan Piron-Lafleur. Référent qualité : Mayana Elbaz.

Programme mis à jour le 24/09/2026.

Organiser cette formation dans votre entreprise

Trente minutes pour préciser votre besoin.

Demander une proposition

05 54 54 24 84
contact@algorythme-formation.fr