Passer au contenu principal

MFE-IT

Infrastructure IT

Formation Azure Databricks (DP-750) : ingénierie des données

Formation Azure Databricks (DP-750) : ingénierie des données
Sessions garanties dès 1 inscrit  •  Pas de risque de report sauf cas de force majeure  •  60% de pratique
Informations clés
Durée4 jour(s) / 24 h
Tarif2490 € HT
FormatDistanciel, Présentiel sur votre site
NiveauIntermédiaire
CertifianteNon
Sur-mesureProgramme personnalisable

Prochaines sessions

7 janvier 2027
4 février 2027
4 mars 2027
8 avril 2027
13 mai 2027

Vous souhaitez planifier cette formation à une date spécifique ? Contactez-nous par email ou en remplissant le formulaire de contact.

Description de la formation Azure Databricks (DP-750) : ingénierie des données

Cette formation intensive vous outille pour concevoir, déployer et exploiter des solutions d’ingénierie des données sur Azure Databricks. Alignée sur le référentiel de l’examen Microsoft DP-750 (parcours Azure Data Engineer Associate), elle couvre l’ensemble de la chaîne : configuration de l’environnement, gouvernance avec Unity Catalog, ingestion et transformation des données, pipelines Lakeflow et optimisation des charges Spark. Elle prolonge naturellement les fondamentaux de la Formation Microsoft Azure DP-900 et s’appuie sur un socle Azure que vous pouvez consolider avec la Formation Microsoft Azure AZ-104.

Sur 4 jours à forte dominante pratique, vous construisez pas à pas un pipeline de données moderne : création de catalogues et de tables Delta, ingestion en streaming avec Auto Loader, transformation et contrôle qualité, orchestration via Lakeflow Jobs, puis surveillance et optimisation. Chaque notion est immédiatement mise en œuvre en atelier sur un espace Databricks. Pour élargir vers l’analytique et la BI, la Formation Microsoft Fabric constitue un complément idéal. Les sessions se déroulent en petit groupe de 1 à 3 participants.

Envie de comparer les parcours ? Découvrez l’ensemble de nos formations cloud computing, ou laissez-vous guider par notre article Quelle formation Cloud Computing choisir ?.

Bon à savoir

Nos sessions inter-entreprises sont garanties dès 1 seul inscrit (pas de risque de report sauf cas de force majeure). Un accompagnement de 30 jours suit la formation et une attestation de fin de formation est délivrée. Retrouvez l’ensemble de notre offre dans la catégorie Formations Cloud Computing.

Objectifs de la formation Azure Databricks (DP-750) : ingénierie des données

À l’issue de la formation, vous serez capable de :

  • Configurer un espace de travail Azure Databricks (compute, Photon, runtime) et organiser les objets Unity Catalog.
  • Sécuriser et gouverner les données : privilèges, contrôle d’accès aux tables, colonnes et lignes, lineage et audit.
  • Ingérer des données en batch et en streaming avec Lakeflow Connect, Auto Loader et Spark Structured Streaming.
  • Nettoyer, transformer et fiabiliser les données avec des contraintes de qualité et la gestion du schema drift.
  • Concevoir, planifier et déployer des pipelines Lakeflow (Jobs, pipelines déclaratifs, Asset Bundles, CI/CD Git).
  • Surveiller, dépanner et optimiser les charges Spark et les tables Delta (OPTIMIZE, VACUUM, Azure Monitor).
Prérequis de la formation Azure Databricks (DP-750) : ingénierie des données

Parce que chaque participant est unique, un entretien préalable ajuste le contenu. Une aisance de base avec SQL et Python ainsi que des notions de Git et de Data Lake sont recommandées. Une première expérience d’Azure est un plus, sans être indispensable.

Programme détaillé de la formation Azure Databricks (DP-750) : ingénierie des données

Télécharger le programme (PDF)

Module 1 — Configurer un environnement Azure Databricks
  • Choisir et configurer le compute (job, serverless, entrepôt SQL, classique, partagé) : autoscaling, Photon, runtime, pooling.
  • Installer des bibliothèques et gérer les permissions d’accès au compute.
  • Créer et organiser les objets Unity Catalog : catalogues, schémas, volumes, tables, vues et vues matérialisées.
  • Appliquer des conventions de nommage et implémenter des catalogues externes (foreign catalogs).
Module 2 — Sécuriser et gouverner Unity Catalog
  • Accorder des privilèges aux principaux (utilisateurs, groupes, principaux de service).
  • Mettre en place le contrôle d’accès au niveau des tables, des colonnes et des lignes (row-level security).
  • Accéder aux secrets Azure Key Vault et authentifier l’accès via des identités managées.
  • Gouverner : ABAC par tags, masques de colonnes, rétention, traçabilité (lineage), journaux d’audit et Delta Sharing.
Module 3 — Modéliser et ingérer les données
  • Concevoir la logique d’ingestion et choisir les outils (Lakeflow Connect, notebooks, Azure Data Factory).
  • Choisir les formats de tables (Delta, Parquet, Iceberg) et les stratégies de partitionnement et de clustering (liquid clustering, Z-ordering).
  • Ingérer en batch et en streaming : Auto Loader, Spark Structured Streaming, Azure Event Hubs, CDC, COPY INTO.
  • Gérer les dimensions à évolution lente (SCD) et les tables temporelles.
Module 4 — Nettoyer, transformer et fiabiliser les données
  • Profiler les données, choisir les types de colonnes, traiter doublons et valeurs manquantes.
  • Transformer : filtres, agrégations, jointures, unions, pivots et dénormalisation.
  • Charger via les opérations merge, insert et append.
  • Contraintes de qualité : validations, application de schéma, gestion du schema drift, attentes des pipelines (expectations).
Module 5 — Concevoir et déployer les pipelines
  • Concevoir l’ordre des opérations et la gestion des erreurs des pipelines.
  • Créer des pipelines avec notebooks et Lakeflow Spark Declarative Pipelines.
  • Implémenter les Lakeflow Jobs : déclencheurs, planification, alertes, redémarrages automatiques.
  • Cycle de vie : bonnes pratiques Git, tests, Databricks Asset Bundles, déploiement via CLI et API REST.
Module 6 — Surveiller, dépanner et optimiser
  • Surveiller la consommation des clusters pour la performance et le coût.
  • Dépanner les Lakeflow Jobs et les jobs Spark (goulots, redémarrage, tuning).
  • Résoudre caching, skew, spilling et shuffle via le Spark UI et le profil de requête.
  • Optimiser les tables Delta (OPTIMIZE, VACUUM) et le monitoring via Azure Monitor / Log Analytics.
Module 7 — Les plus de cette formation
  • Une pédagogie orientée cas réels : chaque compétence est ancrée dans un atelier Databricks concret.
  • Une prise en main de Unity Catalog, Lakeflow et Spark, préparant à la certification DP-750.
  • Un petit groupe (1 à 3 participants) et un accompagnement de 30 jours après la session.
FAQ
Qu'est-ce que la Formation Azure Databricks (DP-750) ?

Une formation d’ingénierie des données sur Azure Databricks, alignée sur le référentiel de l’examen Microsoft DP-750 (Azure Data Engineer Associate). Elle couvre Unity Catalog, l’ingestion, la transformation, les pipelines Lakeflow et l’optimisation des charges.

À qui s'adresse cette formation ?

Aux data engineers, développeurs et architectes data, analystes souhaitant industrialiser leurs traitements, et aux candidats à la certification DP-750.

Quels sont les prérequis ?

Des bases en SQL et Python et des notions de Git sont recommandées. Une première expérience d’Azure est un plus. Un entretien préalable ajuste le contenu.

Quelle est la durée et le format ?

4 jours (24 heures), en distanciel, en groupe de 1 à 3 participants, avec environ 60 % de travaux pratiques et 30 jours d’accompagnement.