Big data et analytics

Google Cloud : ingénierie des données avec BigQuery, Dataflow et Vertex AI

Du data lake au temps réel : concevez des pipelines de données fiables et maîtrisés sur Google Cloud.

Durée
4 jours
Modalité
Présentiel, distanciel ou les deux
Effectif
De 2 à 12 participants
Formule de session

9 450 € HT la session

La formation est dispensée au sein de votre entreprise et réunit vos seuls collaborateurs, dans le cadre d'une session dédiée.

Algorythme Formation (SAS) — SIRET 101 916 674 00019 — NDA 75331851633 — 422 Avenue de Verdun, 33700 Mérignac — 05 54 54 24 84 — contact@algorythme-formation.fr

Ce que vous saurez faire

  • Concevoir une architecture de données sur Google Cloud : data lake, entrepôt, lakehouse
  • Modéliser et optimiser un entrepôt BigQuery en maîtrisant les coûts
  • Construire des pipelines par lots avec Dataform, Dataproc et Dataflow
  • Orchestrer et superviser des pipelines avec Cloud Composer
  • Traiter des flux de données en temps réel avec Pub/Sub et Dataflow
  • Gouverner et sécuriser les données avec Dataplex et les contrôles d'accès de BigQuery
  • Entraîner et exploiter des modèles de machine learning avec BigQuery ML et Vertex AI

Ce que ça change, concrètement

Alimenter l'entrepôt de données

Aujourd'hui

Des scripts lancés à la main ou par cron, qui échouent sans prévenir.

Après la formation

Des pipelines orchestrés par Airflow, avec tests de qualité, reprises automatiques et alertes.

Maîtriser la facture BigQuery

Aujourd'hui

Les requêtes lisent des tables entières et la facture grimpe sans qu'on sache pourquoi.

Après la formation

Des tables partitionnées, des requêtes optimisées et des coûts suivis projet par projet.

Passer au temps réel

Aujourd'hui

Les tableaux de bord sont rafraîchis une fois par nuit.

Après la formation

Un flux Pub/Sub et Dataflow met à jour les indicateurs en quelques secondes.

Le déroulé

JOUR 1 — Fondations : data lake, entrepôt et gouvernance 7 h

1 h 30 Le métier de data engineer sur Google Cloud

  • Rôle, responsabilités, attentes des équipes data et métier
  • Panorama des services de données de Google Cloud et architecture de référence
  • Data lake, entrepôt, lakehouse : quand utiliser quoi
  • Test de positionnement en début de formation
  • Atelier : premières requêtes sur les jeux de données publics de BigQuery

2 h Construire le data lake

  • Cloud Storage : classes de stockage, cycle de vie, organisation en zones (brute, nettoyée, exploitable)
  • Formats de fichiers : CSV, Parquet, Avro ; tables Apache Iceberg avec BigLake
  • Sécurité : IAM, chiffrement, périmètres VPC Service Controls
  • Atelier : déposer les données du fil rouge, un réseau de vélos en libre-service, et les interroger sans les charger

2 h Concevoir l'entrepôt BigQuery

  • Architecture de BigQuery : stockage et calcul séparés, tarification à la demande ou par capacité
  • Modélisation : schéma en étoile, dénormalisation, champs imbriqués et répétés
  • Partitionnement et clustering : réduire les volumes lus et la facture
  • Atelier : charger les données, concevoir le schéma et mesurer le gain du partitionnement

1 h 30 Gouverner les données

  • Dataplex : catalogue, qualité, lignage
  • Sécurité au niveau des lignes et des colonnes, masquage des données personnelles
  • Suivi des coûts et quotas
JOUR 2 — Pipelines par lots 7 h

1 h EL, ELT, ETL : choisir son approche

  • Critères : volume, fréquence, complexité des transformations, compétences de l'équipe
  • Faire entrer les données : BigQuery Data Transfer Service, Datastream pour la capture des changements

2 h Transformer dans BigQuery avec SQL

  • Dataform : transformations SQL versionnées, dépendances, tests
  • Contrôles de qualité : unicité, valeurs nulles, cohérence entre tables
  • Atelier : chaîne de transformation du fil rouge, des données brutes aux indicateurs

1 h 30 Spark sur Dataproc

  • Hadoop et Spark sur Google Cloud : clusters éphémères et Dataproc Serverless
  • Remplacer HDFS par Cloud Storage, optimiser les traitements
  • Atelier : exécuter un traitement PySpark

2 h 30 Apache Beam et Dataflow

  • Modèle de programmation Beam : PCollections, transformations, entrées secondaires
  • Exécution sans serveur, autoscaling, modèles Dataflow réutilisables
  • Choisir entre Dataform, Dataproc et Dataflow
  • Atelier : pipeline Dataflow en Python pour nettoyer et enrichir les trajets
JOUR 3 — Orchestration et temps réel 7 h

2 h Orchestrer les pipelines

  • Cloud Composer (Apache Airflow) : DAG, opérateurs, planification, reprise sur erreur
  • Cloud Data Fusion : pipelines visuels pour les équipes moins techniques
  • Workflows et déclenchement par événement
  • Atelier : orchestrer la chaîne quotidienne du fil rouge avec Airflow

1 h Les fondamentaux du streaming

  • Temps de l'événement et temps de traitement, données en retard
  • Fenêtres fixes, glissantes et de session ; déclencheurs

1 h 30 Ingestion avec Pub/Sub

  • Sujets, abonnements, ordre et dédoublonnage des messages
  • Abonnements directs vers BigQuery et Cloud Storage
  • Atelier : publier en continu l'état des stations de vélos

2 h 30 Traitement en continu

  • Pipelines Dataflow en streaming : fenêtrage, agrégations, gestion des retards
  • Écriture en continu dans BigQuery ; Bigtable pour les lectures à faible latence
  • Tableau de bord en temps réel avec Looker Studio
  • Atelier : afficher la disponibilité des stations en temps réel
JOUR 4 — Performance, analytique et machine learning 7 h

2 h BigQuery avancé

  • Fonctions de fenêtrage, requêtes WITH, fonctions géographiques
  • Lire un plan d'exécution et optimiser une requête
  • Vues matérialisées, cache et BI Engine
  • Atelier : optimiser les requêtes les plus coûteuses du fil rouge

1 h Du data engineering à l'IA

  • Machine learning sur Google Cloud : API prêtes à l'emploi, BigQuery ML, Vertex AI
  • Gemini dans BigQuery : aide à l'écriture SQL et fonctions d'IA générative sur les données
  • Enrichir des données textuelles avec l'API Natural Language

2 h Créer des modèles en SQL avec BigQuery ML

  • Créer, évaluer et utiliser un modèle sans quitter BigQuery
  • Régression, classification, séries temporelles, recommandation
  • Atelier : prévoir la demande par station

2 h Vertex AI et pipelines de ML

  • Notebooks Vertex AI Workbench avec BigQuery et pandas
  • AutoML : entraîner un modèle sans code
  • Vertex AI Pipelines : industrialiser l'entraînement et le déploiement
  • Démonstration : pipeline d'entraînement planifié
  • Bilan : repères pour la certification Google Cloud Professional Data Engineer
  • Test de positionnement en fin de formation

Programme de référence, adapté à votre cahier des charges

Le socle commun

  • Les objectifs pédagogiques
  • La durée et le découpage horaire
  • Les prérequis
  • Les modalités d'évaluation des acquis

Votre déclinaison

  • Les travaux pratiques et les jeux de données
  • L'environnement technique et les outils utilisés
  • L'ordre et la pondération des séquences
  • Les exemples tirés de vos projets

Le programme définitif est annexé à la convention de formation et constitue le seul document contractuel de référence.

Questions fréquentes

Nos collaborateurs n'ont pas tous le même niveau.

Un test de positionnement est adressé à chaque participant avant l'entrée en formation et le déroulé est ajusté aux niveaux réellement présents. Si l'écart est trop important pour une même session, nous vous le signalons avant l'établissement de la convention.

La formation peut-elle porter sur nos propres outils et projets ?

Oui. Les travaux pratiques portent sur votre environnement technique et sur des cas tirés de vos projets. Les objectifs et la durée, eux, restent ceux du programme de référence.

Cette formation est-elle finançable par notre OPCO ?

Oui, dans les conditions propres à votre branche. Algorythme Formation est certifié Qualiopi au titre de la catégorie d'action « Actions de formation ». Nous constituons les pièces du dossier avec vous.

La formation peut-elle se tenir à distance ?

Oui. Nos formations sont conduites dans vos locaux ou en classe virtuelle, avec partage d'écran et travaux pratiques encadrés. Le choix se fait au moment du cadrage, en fonction de la répartition de vos équipes.

Sous quel délai une session peut-elle démarrer ?

Comptez 5 jours ouvrés pour recevoir la proposition et le programme adaptés, puis 4 à 8 semaines avant l'entrée en formation. Un dossier OPCO demande 3 semaines supplémentaires au minimum.

Un de nos participants est en situation de handicap.

Signalez-le au moment du cadrage : les modalités, les supports et le rythme sont adaptés au cas par cas. Notre référent handicap, Mathieu Piron-Lafleur, étudie chaque situation avec vous (contact@algorythme-formation.fr).

Modalités et informations pratiques

Public visé
  • Data engineers et développeurs chargés des flux de données
  • Architectes data qui conçoivent une plateforme sur Google Cloud
  • Data analysts et data scientists qui veulent industrialiser leurs traitements
Prérequis
  • Écrire des requêtes SQL avec jointures et agrégations
  • Programmer en Python
  • Connaître les principes des chaînes ETL et de la modélisation de données
  • Des notions de machine learning sont utiles pour la dernière journée
Durée et organisation
28 heures, 4 jours, en présentiel, en distanciel ou les deux. De 2 à 12 participants, dans vos locaux ou en classe virtuelle.
Évaluation et suivi
  • À l'entrée : analyse du besoin, test de positionnement, auto-évaluation
  • En cours : exercice validé à chaque séquence, point d'étape à mi-parcours
  • En fin : mise en situation, auto-évaluation de sortie, certificat de réalisation
  • À distance : satisfaction à chaud, questionnaire à froid à 90 jours, bilan au commanditaire
Modalités et délais d'accès
Prise de contact, puis entretien d'analyse du besoin de 30 minutes.
Proposition et programme adaptés sous 5 jours ouvrés.
Entrée en formation sous 4 à 8 semaines après signature de la convention, et 3 semaines supplémentaires minimum en cas de dossier OPCO.
Tarif
  • Intra-entreprise

    9 450 € HT la session

    La formation est dispensée au sein de votre entreprise et réunit vos seuls collaborateurs, dans le cadre d'une session dédiée.

  • Inter-entreprises

    3 350 € HT la session

    Vos collaborateurs rejoignent une session à date fixe, aux côtés de participants venus d'autres entreprises.

Acompte de 50 % à la signature, solde à 30 jours. Frais de déplacement en sus hors Gironde. Action de formation finançable par votre OPCO.

Accessibilité et handicap
Nos actions de formation sont ouvertes aux personnes en situation de handicap, avec une adaptation au cas par cas des modalités, des supports et du rythme.
Référent handicap : Mathieu Piron-Lafleur, contact@algorythme-formation.fr.
Contacts
Algorythme Formation,
05 54 54 24 84
contact@algorythme-formation.fr

Référent pédagogique : Alan Piron-Lafleur. Référent qualité : Mayana Elbaz.

Programme mis à jour le 24/09/2026.

Organiser cette formation dans votre entreprise

Trente minutes pour préciser votre besoin.

Demander une proposition

05 54 54 24 84
contact@algorythme-formation.fr