Développement
dbt : installer notre environnement local et découvrir les seeds
Installez dbt v2 avec DuckDB sous Windows, créez un premier projet local et chargez deux fichiers CSV avec dbt seed pour préparer la suite de la série.
Développement
Installez dbt v2 avec DuckDB sous Windows, créez un premier projet local et chargez deux fichiers CSV avec dbt seed pour préparer la suite de la série.
IA appliquée
Après l’effet waouh du code généré par l’IA, j’ai découvert une nouvelle dette technique : celle des décisions que je n’avais pas comprises. Retour d’expérience sur une façon de construire plus vite sans abandonner l’architecture.
Dans le monde de l'ingénierie des données moderne, Databricks est un nom très connu. Lorsque l'on gravite autour de Spark, on utilise très régulièrement des outils ou concept directement issue de Databricks. Dans cet article nous allons faire nos premiers pas directement sur la plateforme Databricks
Il y a quelque temps, Microsoft a annoncé un type de job particulier, les "Copy job". Dans de nombreux projets, pour des raisons d'impact sur les bases opérationnelles, nous faisons des copies des données sources pour travailler de façon autonome par la suite. Ce type de job est justement là pour tr
Microsoft a annoncé très récemment la "Public Preview" d'un provider Terraform pour Microsoft Fabric. Nous allons ici tester les basics de la mise en place d'une Infrastructure as Code (IaC) autour de Fabric !
Après avoir alimenté notre zone bronze : Paramétrer les Pipeline Azure Synapse Analytics sans ouvrir Synapse ! ; Après avoir alimenté notre zone sliver : Notre premier notebook Spark dans Synapse ; Nous allons maintenant alimenter notre zone gold et créer notre pipeline d'intégration complet de l'ingestion de nos données On-
Synapse nous permet d'utiliser Apache Spark en tant que Runtime de processing afin de travailler nos différents datasets. Dans cet article, nous allons créer notre premier notebook Spark (et le pool Spark nécessaire) pour transformer nos premières données de la zone bronze pour commencer à alimenter notre zone
Nous avons fait le choix de créer un compte de stockage (ou plusieurs) séparé de celui propre à Synapse pour notre datalake. Et donc, après avoir créé nos différentes ressources (workspace et stockage), il reste une étape importante qui est la "connexion" du stockage au workspace afin de
Architecture Data
Comme tout bon éditeur qui se respecte, Microsoft présente de bonnes pratiques d'implémentation. La documentation proposée est disponible ici : Zones et conteneurs de lac de données - Cloud Adoption Framework | Microsoft Learn Nous allons dans cet article créer les différentes zones de notre Datalake en respectant ces bonnes pratiques
Nous allons dans cette article "installer" la base d'exemple Wide Word Importer de Microsoft, la préparer et l'inspecter un minimum pour pouvoir débuter nos travaux de Datalake.
Dans un précédent article, nous avons installé un runtime d'intégration auto-hébergé permettant le transfert de données locales vers Azure. Nous avions évoqué dans les options avancées, la possibilité de faire de la haute disponibilité pour notre runtime. Nous allons dans cet article configurer la haute disponibilité sur
Notre DataLakeHouse contient physiquement des fichiers de données. Ceux-ci sont organisés, nettoyés, représentent un modèle de donnée défini sur la "dernière" couche et éventuellement de formats différents. Nous pouvons donc lire nos données depuis ces fichiers et travailler dessus pour faire ce que l'on en