Databricks
La technologie
Databricks est une plateforme lakehouse construite sur Apache Spark et Delta Lake. Elle réunit ingénierie de données, analytique et machine learning sur un même stockage, avec Unity Catalog pour la gouvernance.
Databricks offre beaucoup de liberté. Sans conventions, les notebooks se multiplient, les tables se dupliquent et les coûts de clusters dérivent. La valeur vient de l'industrialisation : code versionné, jobs orchestrés, catalogue unique.
Interventions
Missions Visian sur Databricks
- Architecture lakehouse (bronze, silver, gold) et mise en place d'Unity Catalog
- Migration de Hadoop ou d'un data lake existant
- Industrialisation : CI/CD, jobs, tests de qualité, observabilité
- MLOps : suivi des modèles avec MLflow, mise en production
- Optimisation des coûts de calcul
Ces missions s'inscrivent dans l'expertise Plateforme data, au forfait, en régie ou en centre de service.
Questions fréquentes
Databricks : questions fréquentes
Faut-il Unity Catalog dès le départ ?
Oui, dans la plupart des cas : il centralise les droits, la traçabilité et la découverte des données. L'ajouter après coup impose une migration des tables et des permissions.
Databricks convient-il à la BI ?
Oui, via Databricks SQL et les connecteurs Power BI ou Tableau. Pour un usage exclusivement BI, un entrepôt SQL plus simple peut suffire.