Azure Databriks - Introduction par la pratique

Partager
databricks & Azure logo

Dans le monde de l'ingénierie des données moderne, Databricks est un nom très connu. Lorsque l'on gravite autour de Spark, on utilise très régulièrement des outils ou concept directement issue de Databricks. Dans cet article nous allons faire nos premiers pas directement sur la plateforme Databricks grâce a ca déclinaison dans Azure.

Création des ressources

De la même façon que nous l'avons fait avec Azure Synapse ici : Création de l'environnement de travail : Azure Synapse Analytics - Workspace, nous allons commencer par créer un "Workspace" Databricks.

Nous allons créer une ressource de type "Azure Databricks" dans notre tenant Azure.

Recherche du service Databricks dans le marketplace Azure

Nous devons maintenant effectuer la configuration standard de notre ressource Azure. Attention lors de cette configuration initiale, car certains informations ne seront plus modifiable par la suite comme le nom du workspace.

Informations basiques de notre workspace Databricks

Nous allons utiliser les configurations par défaut pour notre introduction si ce n'est le "Princing tier" que j'ai mis à Standard. Il existe cependant une version d'essaie qui sera gratuite pendant quelques jours au besoin.

Revue de notre workspace avant création

Il ne nous reste plus qu'a patienter le temps que notre ressource se crée :

Si vous connaissez le monde Azure Synapse, vous ne serrez pas dépaysé une fois la ressource créée. Vous pourrez de la même manière accéder à a votre workspace en cliquant sur le bouton dédié.

Overview de la ressource Databricks

La première impression en arrivant sur notre workspace est très propre. Il n'y a rien de révolutionnaire avec un menu de navigation sur la droite et une page de travaille centrale.

Première ouverture d'un workspace Databricks

Création du "compute"

Dans Databricks, tout est Spark ! et qui dis Spark, dit cluster. Nous devons donc avant toute chose, créer un cluster Spark pour travailler. L'arborescence des menue est peut-être différente chez vous mais globalement il suffit de de faire "New" ... "Cluster".

Ajout d'un nouveau cluster

Plusieurs informations sont a renseigner dans la configuration de notre cluster. Tout d'abord la sélection du mode "Multi" ou "Single" mode pour la configuration globale du mode cluster, puis le mode d'accès. Pour débuter, étant donné que nous découvrons la plateforme, nous allons configurer un nœud simple et un accès simple user pour notre utilisateur.

Ensuite, afin de limiter les coûts, nous allons sélection une toute petite taille de nœud ainsi que régler le temps d'extinction pour inactivité au plus faible qui est de 10 minutes. Nous pourrons ensuite créer ce cluster / "compute".

Configuration d'un nouveau cluster

Exécution de code

Pour commencer à travailler, nous allons avoir besoin de données. Avant de nous lancer dans la création de jobs et autres flux de données, nous allons commencer par ajouter un fichier à la main sur la plateforme. Pour cette introduction, je vais utiliser un fichier fourni gracieusement par Microsoft ici : https://raw.githubusercontent.com/MicrosoftLearning/mslearn-databricks/main/data/products.csv.

Le bouton "+ New", est le raccourci principal. Nous allons donc l'utiliser pour ajouter une nouvelle donnée.

Dans le cas de l'ajout d'un fichier, nous allons choisi d'intégrer nos données dans une table databricks.

Interface d'ajout de fichier

En glissant déposant notre fichier directement via l'interface, databricks charge automatiquement notre fichier et nous montre l'aperçu de celui-ci.

Aperçu du fichier chargé avec interprétation automatique

Sur le haut de la page, nous pouvons définir comment notre fichier sera intégré dans notre environnement databricks. Nous pouvons définir le catalogue (si tant est que l'on en aurait plusieurs ... ?), le schéma et le nom de la table de destination.

Nous pouvons ensuite dans les attributs avancé définir le format de fichier. En effet, dans le cas présent, notre fichier possède l'extension ".txt", mais est en fait un fichier au format csv. Nous allons donc procéder à la configuration correcte de celui-ci.

Configuration du format de fichier

Notre fichier est maintenant reconnus correctement dans l'aperçu affiché et nous pouvons maintenant créer notre table définitivement.

Aperçu du fichier avec la bonne définition de format format

Notre table est maintenant crée dans notre catalogue de donnée databricks.

Notre table dans notre catalogue databricks

Nous pouvons directement créer un notebook à partir de la page de notre table.

Création d'un notebook depuis notre table créée

Databricks va automatiquement créer un notebook avec une cellule de code autogénéré faisant un simple "SELECT" sur notre table nouvellement créée. Nous pouvons de suite exécuter ce code en appuyant sur le bouton "play" pour vérifier que tout fonctionne correctement et démarrer notre analyse de donnée !

Notebook avec code auto généré

Après exécution du code, comme tout notebook, le résultat de notre cellule s'affiche à la suite de notre code.

Résultat d'exécution du code auto généré

Nous pouvons maintenant ajouter de nouvelles cellules en passant notre sourie sur l'espace juste en dessous de la cellule précédente pour faire apparaitre les boutons de création de cellules.

Création d'une nouvelle cellule de code

Nous pouvons maintenant écrire notre code spark comme sur n'importe quel environnement spark.

Exécution d'un code spark écrit dans une nouvelle cellule

Nous pouvons renommer notre notebook en double-cliquant deux fois sur son titre.

Renommage du notebook

Nous pouvons maintenant retrouver notre notebook dans notre workspace pour nos prochaines visites.

Conclusion

Lorsque nous avons fini avec nos expérimentation, nous pouvons aller directement arrêter notre cluster afin de tout de suite arrêter la facturation, ou attendre qu'il s'arrête de lui-même.

Arrêt manuelle d'un cluster