
Vous souhaitez planifier cette formation à une date spécifique ? Contactez-nous par email ou en remplissant le formulaire de contact.
La formation AWS Data Engineer s’attaque à ce qui se passe entre la donnée brute et le tableau de bord : l’ingestion, la transformation, le stockage, et surtout la partie dont personne ne parle — faire en sorte que le pipeline tourne encore dans six mois, qu’on sache d’où vient chaque chiffre et combien il a coûté.
Sur 3 jours, vous construisez une chaîne complète sur AWS : ingestion par lots et en flux avec Kinesis et DMS, stockage en lac de données sur S3 avec les formats colonnes qui changent tout (Parquet, partitionnement, Iceberg), transformation avec Glue et EMR, entrepôt avec Redshift, interrogation ad hoc avec Athena. L’orchestration, la qualité de données et la gouvernance des accès avec Lake Formation occupent une place à part entière, parce que c’est là que les projets data échouent — rarement sur la technique de transformation.
Le programme suit le référentiel de la certification AWS Certified Data Engineer – Associate (DEA-C01), qui remplace l’ancienne Data Analytics Specialty.
Si vous découvrez AWS, notre Formation AWS Cloud Practitioner pose les bases, et notre Formation AWS Services Essentiels couvre S3 et les services de calcul mobilisés ici. Sur le volet streaming, notre Formation Apache Kafka éclaire les concepts qu’on retrouve dans Kinesis. Pour comparer les écosystèmes, voyez notre Formation Azure Data Lake, Synapse, Data Factory et Spark, notre Formation Azure Databricks et notre Formation Snowflake. Enfin, l’exploitation des pipelines en production prolonge notre Formation AWS DevOps Engineer, et la maîtrise de la facture notre Formation AWS FinOps.
Envie de comparer les parcours ? Découvrez l’ensemble de nos formations cloud computing, ou laissez-vous guider par notre article Quelle formation Cloud Computing choisir ?.
A l’issue de la formation le participant sera capable de :
Cette formation est financée directement par l’entreprise (pas de CPF, pas d’OPCO).
Télécharger le programme (PDF)
Ce n’est pas bloquant, mais cela aide beaucoup sur les modules Glue et EMR, où les jobs Spark s’écrivent en Python. Le prérequis réellement indispensable est le SQL. Si Python vous est étranger, dites-le lors de l’entretien préalable : nous adaptons les labs pour rester sur l’approche visuelle de Glue Studio.
AWS a retiré la Data Analytics Specialty et l’a remplacée par la Data Engineer – Associate (DEA-C01), plus centrée sur la construction et l’exploitation de pipelines que sur l’analyse. Cette formation suit le nouveau référentiel — c’est aussi pourquoi un intitulé comme « Data Warehousing », encore présent dans certains catalogues, correspond à une offre datée.
Oui, et la réponse dépend surtout du profil des requêtes. Athena convient à l’ad hoc et au volume irrégulier, avec une facturation à la donnée scannée. Redshift s’impose sur des charges analytiques répétées et prévisibles. Les deux sont mis en oeuvre pendant la formation, sur les mêmes données, pour que la comparaison soit concrète.
C’est possible et souvent souhaitable, dans les limites de ce que vous pouvez sortir de votre environnement. L’entretien préalable sert notamment à cadrer ce point ; à défaut, nous fournissons des jeux de données réalistes.
3 jours, soit 21 heures, en distanciel avec sessions enregistrées. La formation peut aussi se dérouler sur votre site. Les sessions sont garanties dès un seul inscrit.