Passer au contenu principal

MFE-IT

Infrastructure IT

Formation AWS Data Engineer – Construire et opérationnaliser des pipelines de données sur AWS

Formation AWS Data Engineer – Construire et opérationnaliser des pipelines de données sur AWS
Sessions garanties dès 1 inscrit  •  Pas de risque de report sauf cas de force majeure  •  60% de pratique
Informations clés
Durée3 jour(s) / 21 h
Tarif2220 € HT
NiveauIntermédiaire
CertifianteNon
Sur-mesureProgramme personnalisable

Prochaines sessions

13 Janv. 2027
10 Fév. 2027
10 Mars 2027
14 Avr. 2027
12 Mai 2027

Vous souhaitez planifier cette formation à une date spécifique ? Contactez-nous par email ou en remplissant le formulaire de contact.

Description de la formation AWS Data Engineer – Construire et opérationnaliser des pipelines de données sur AWS

La formation AWS Data Engineer s’attaque à ce qui se passe entre la donnée brute et le tableau de bord : l’ingestion, la transformation, le stockage, et surtout la partie dont personne ne parle — faire en sorte que le pipeline tourne encore dans six mois, qu’on sache d’où vient chaque chiffre et combien il a coûté.

Sur 3 jours, vous construisez une chaîne complète sur AWS : ingestion par lots et en flux avec Kinesis et DMS, stockage en lac de données sur S3 avec les formats colonnes qui changent tout (Parquet, partitionnement, Iceberg), transformation avec Glue et EMR, entrepôt avec Redshift, interrogation ad hoc avec Athena. L’orchestration, la qualité de données et la gouvernance des accès avec Lake Formation occupent une place à part entière, parce que c’est là que les projets data échouent — rarement sur la technique de transformation.

Le programme suit le référentiel de la certification AWS Certified Data Engineer – Associate (DEA-C01), qui remplace l’ancienne Data Analytics Specialty.

Si vous découvrez AWS, notre Formation AWS Cloud Practitioner pose les bases, et notre Formation AWS Services Essentiels couvre S3 et les services de calcul mobilisés ici. Sur le volet streaming, notre Formation Apache Kafka éclaire les concepts qu’on retrouve dans Kinesis. Pour comparer les écosystèmes, voyez notre Formation Azure Data Lake, Synapse, Data Factory et Spark, notre Formation Azure Databricks et notre Formation Snowflake. Enfin, l’exploitation des pipelines en production prolonge notre Formation AWS DevOps Engineer, et la maîtrise de la facture notre Formation AWS FinOps.

Envie de comparer les parcours ? Découvrez l’ensemble de nos formations cloud computing, ou laissez-vous guider par notre article Quelle formation Cloud Computing choisir ?.

Bon à savoir
  • Les sessions sont garanties dès 1 inscrit (sauf cas de force majeure).
  • Un entretien en amont a lieu entre le participant et/ou un référent de l’entreprise afin de bien prendre en compte le profil du participant.
  • Evaluation : QCM, mises en situation et travaux pratiques. Attestation de validation d’acquis délivrée à l’issue de la formation.
  • Cette formation prépare à la certification AWS Certified Data Engineer – Associate (DEA-C01) (examen non inclus).
  • Cette formation fait partie de notre catalogue Formations Cloud Computing. Découvrez nos autres formations cloud pour maîtriser les architectures, services et bonnes pratiques sur AWS, Azure et GCP.
  • Pour débuter sur AWS, nous recommandons en prérequis notre Formation AWS Cloud Practitioner qui pose les fondamentaux du Cloud Amazon.
Objectifs de la formation AWS Data Engineer – Construire et opérationnaliser des pipelines de données sur AWS

A l’issue de la formation le participant sera capable de :

  • Concevoir une architecture de données sur AWS : lac de données, entrepôt et modèle lakehouse.
  • Ingérer des données par lots et en flux continu (Kinesis, DMS, DataSync).
  • Transformer des données à grande échelle avec AWS Glue et Amazon EMR.
  • Choisir et optimiser les formats et le partitionnement du stockage sur S3 (Parquet, Iceberg).
  • Modéliser, charger et optimiser un entrepôt Amazon Redshift.
  • Orchestrer des pipelines et y intégrer des contrôles de qualité de données.
  • Gouverner les accès aux données avec Lake Formation et maîtriser le coût des traitements.
Prérequis de la formation AWS Data Engineer – Construire et opérationnaliser des pipelines de données sur AWS
  • Une pratique du SQL est indispensable : vous devez savoir écrire une jointure et une agrégation sans hésiter. Des notions de Python facilitent nettement les modules Glue et EMR, sans être formellement exigées.
  • Une première expérience d’AWS (S3, IAM, EC2) est attendue. Le niveau de la certification AWS Cloud Practitioner constitue une base suffisante.
  • Parce que chaque participant est unique, un entretien personnalisé avec notre expert nous permet de concevoir une formation parfaitement alignée avec ses objectifs.
Public visé par la formation AWS Data Engineer – Construire et opérationnaliser des pipelines de données sur AWS
  • Ingénieurs data et développeurs ETL construisant des pipelines sur AWS.
  • Analystes et développeurs BI amenés à alimenter eux-mêmes leurs sources de données.
  • Administrateurs de bases de données évoluant vers les architectures de lac de données.
  • Architectes et responsables techniques préparant la certification Data Engineer – Associate.
Financement

Cette formation est financée directement par l’entreprise (pas de CPF, pas d’OPCO).

Voir nos modalités de financement.

Programme détaillé de la formation AWS Data Engineer – Construire et opérationnaliser des pipelines de données sur AWS

Télécharger le programme (PDF)

Architectures de données sur AWS : lac, entrepôt, lakehouse
Ingestion : par lots et en flux continu
Stockage : le lac de données sur S3
Transformation : Glue et EMR
Entrepôt : Amazon Redshift
Interrogation, orchestration et qualité
Gouvernance, sécurité et coût
Les plus de cette formation
  • construit une chaîne data complète, de l’ingestion en flux jusqu’à la restitution, sur des volumes réalistes ;
  • suit le référentiel de la certification AWS Certified Data Engineer – Associate (DEA-C01), qui remplace la Data Analytics Specialty ;
  • traite frontalement le coût et la qualité des données, là où la plupart des projets data déraillent ;
  • se déroule en groupe de 1 à 3 participants, ce qui permet de travailler sur vos propres jeux de données.
FAQ
Faut-il savoir programmer en Python ?

Ce n’est pas bloquant, mais cela aide beaucoup sur les modules Glue et EMR, où les jobs Spark s’écrivent en Python. Le prérequis réellement indispensable est le SQL. Si Python vous est étranger, dites-le lors de l’entretien préalable : nous adaptons les labs pour rester sur l’approche visuelle de Glue Studio.

Quelle différence avec l'ancienne certification Data Analytics Specialty ?

AWS a retiré la Data Analytics Specialty et l’a remplacée par la Data Engineer – Associate (DEA-C01), plus centrée sur la construction et l’exploitation de pipelines que sur l’analyse. Cette formation suit le nouveau référentiel — c’est aussi pourquoi un intitulé comme « Data Warehousing », encore présent dans certains catalogues, correspond à une offre datée.

Redshift ou Athena : la formation aide-t-elle à trancher ?

Oui, et la réponse dépend surtout du profil des requêtes. Athena convient à l’ad hoc et au volume irrégulier, avec une facturation à la donnée scannée. Redshift s’impose sur des charges analytiques répétées et prévisibles. Les deux sont mis en oeuvre pendant la formation, sur les mêmes données, pour que la comparaison soit concrète.

Travaille-t-on sur nos propres données ?

C’est possible et souvent souhaitable, dans les limites de ce que vous pouvez sortir de votre environnement. L’entretien préalable sert notamment à cadrer ce point ; à défaut, nous fournissons des jeux de données réalistes.

Combien de temps dure la formation et quel est le format ?

3 jours, soit 21 heures, en distanciel avec sessions enregistrées. La formation peut aussi se dérouler sur votre site. Les sessions sont garanties dès un seul inscrit.