dbt : installer notre environnement local et découvrir les seeds
Installez dbt v2 avec DuckDB sous Windows, créez un premier projet local et chargez deux fichiers CSV avec dbt seed pour préparer la suite de la série.
Installez dbt v2 avec DuckDB sous Windows, créez un premier projet local et chargez deux fichiers CSV avec dbt seed pour préparer la suite de la série.
Après l’effet waouh du code généré par l’IA, j’ai découvert une nouvelle dette technique : celle des décisions que je n’avais pas comprises. Retour d’expérience sur une façon de construire plus vite sans abandonner l’architecture.
Dans le monde de l'ingénierie des données moderne, Databricks est un nom très connu. Lorsque l'on gravite autour de Spark, on utilise très régulièrement des outils ou concept directement issue de Databricks. Dans cet article nous allons faire nos premiers pas directement sur la plateforme Databricks
Il y a quelque temps, Microsoft a annoncé un type de job particulier, les "Copy job". Dans de nombreux projets, pour des raisons d'impact sur les bases opérationnelles, nous faisons des copies des données sources pour travailler de façon autonome par la suite. Ce type de job est justement là pour tr
Microsoft a annoncé très récemment la "Public Preview" d'un provider Terraform pour Microsoft Fabric. Nous allons ici tester les basics de la mise en place d'une Infrastructure as Code (IaC) autour de Fabric !
Après avoir alimenté notre zone bronze : Paramétrer les Pipeline Azure Synapse Analytics sans ouvrir Synapse ! ; Après avoir alimenté notre zone sliver : Notre premier notebook Spark dans Synapse ; Nous allons maintenant alimenter notre zone gold et créer notre pipeline d'intégration complet de l'ingestion de nos données On-
Synapse nous permet d'utiliser Apache Spark en tant que Runtime de processing afin de travailler nos différents datasets. Dans cet article, nous allons créer notre premier notebook Spark (et le pool Spark nécessaire) pour transformer nos premières données de la zone bronze pour commencer à alimenter notre zone
Nous avons fait le choix de créer un compte de stockage (ou plusieurs) séparé de celui propre à Synapse pour notre datalake. Et donc, après avoir créé nos différentes ressources (workspace et stockage), il reste une étape importante qui est la "connexion" du stockage au workspace afin de
Comme tout bon éditeur qui se respecte, Microsoft présente de bonnes pratiques d'implémentation. La documentation proposée est disponible ici : Zones et conteneurs de lac de données - Cloud Adoption Framework | Microsoft Learn Nous allons dans cet article créer les différentes zones de notre Datalake en respectant ces bonnes pratiques
Nous allons dans cette article "installer" la base d'exemple Wide Word Importer de Microsoft, la préparer et l'inspecter un minimum pour pouvoir débuter nos travaux de Datalake.
Dans un précédent article, nous avons installé un runtime d'intégration auto-hébergé permettant le transfert de données locales vers Azure. Nous avions évoqué dans les options avancées, la possibilité de faire de la haute disponibilité pour notre runtime. Nous allons dans cet article configurer la haute disponibilité sur
Notre DataLakeHouse contient physiquement des fichiers de données. Ceux-ci sont organisés, nettoyés, représentent un modèle de donnée défini sur la "dernière" couche et éventuellement de formats différents. Nous pouvons donc lire nos données depuis ces fichiers et travailler dessus pour faire ce que l'on en
Nous allons présenter dans cet article comment mettre à jour notre Dataset Power BI directement depuis Azure Synapse Analytics via un pipeline.
Dans cet article, je vais procéder à l'installation d'un runtime d'intégration "simple" pour Synapse, il n'y a pas de scalabilité ni de haute dispo comme il pourrait être nécessaire en production pour des applications critiques.
Nous allons ici mettre en place la version de code source avec git pour nos développements synapse.
Cet article est le point de départ du projet global qui sera créé le long de plusieurs articles à venir. L'objectif est de créer un datalake autour de la solution intégrée de Microsoft : Synapse Analytiques et d'autres solutions Microsoft / Azures s'imbriquant dans notre besoin.
Pour rappel, nous travaillons à la mise en place d'un datalake/datalakehouse "dans" Azure Synapse Analytics. Ce scénario tourne autour de deux solutions que sont : * Storage account / Data Lake Storage --> le "datalake" * Synapse workspace --> L'environnement de développement et d'
Nous travaillons à la mise en place d’un datalake/datalakehouse « dans » Azure Synapse Analytics. Ce scénario tourne donc autour de deux solutions que sont : Storage account / Data Lake Storage pour le « datalake » Synapse workspace pour L’environnement de développement et d’intégration Cet article
Afin d'optimiser des les requêtes effectués sur des fichiers parquets depuis un pool serverless, on travail généralement avec des dataset partitionné. Cette article décrit comment générer un dataset partitionné via un data flow Azure Synapse Analystics.
Cet article était loin dans les cartons, mais l'article Alternative pipeline parametrization for Azure Synapse Analytics a motivé la priorisation de cet article. Merci @paul_eng pour le partage et la motivation d'écrire celui-ci !
Fear me not, what i mean is best written this way: "Scrum != Agile". Yes, Scrum is one of the most used frameworks used over the agile mindset. But it's definitely not THE ONLY way! I really enjoy the Agile way I'm proud to defend
Nowadays, everybody knows what an Open Space is and if you are working in tech you probably already worked (and still) in such office. I have several experiences in workplaces having used different types of office myself. I never had my word to say about the workplace but I'
Nowadays, when starting development, there is a lot of discussion around tooling, environments and managing all of it. Previously I was working with a standard python installer or a full anaconda installation. Things mainly worked but I was not comfortable using all of it. One of my colleagues, told me
Since I started my professional career, I've always tried to better organize my work. In my early days, I was just doing things as they came and never planned my work or at least time frame for it. I have to say that it worked! I had some