Databricks

La technologie

Databricks est une plateforme lakehouse construite sur Apache Spark et Delta Lake. Elle réunit ingénierie de données, analytique et machine learning sur un même stockage, avec Unity Catalog pour la gouvernance.

Databricks offre beaucoup de liberté. Sans conventions, les notebooks se multiplient, les tables se dupliquent et les coûts de clusters dérivent. La valeur vient de l'industrialisation : code versionné, jobs orchestrés, catalogue unique.

Interventions

Missions Visian sur Databricks

  • Architecture lakehouse (bronze, silver, gold) et mise en place d'Unity Catalog
  • Migration de Hadoop ou d'un data lake existant
  • Industrialisation : CI/CD, jobs, tests de qualité, observabilité
  • MLOps : suivi des modèles avec MLflow, mise en production
  • Optimisation des coûts de calcul

Ces missions s'inscrivent dans l'expertise Plateforme data, au forfait, en régie ou en centre de service.

Questions fréquentes

Databricks : questions fréquentes

Faut-il Unity Catalog dès le départ ?

Oui, dans la plupart des cas : il centralise les droits, la traçabilité et la découverte des données. L'ajouter après coup impose une migration des tables et des permissions.

Databricks convient-il à la BI ?

Oui, via Databricks SQL et les connecteurs Power BI ou Tableau. Pour un usage exclusivement BI, un entrepôt SQL plus simple peut suffire.

Un projet Databricks ?

Un premier échange de 30 minutes pour cadrer le besoin et le mode d'intervention.

Échanger →