Databricks kondigt data lineage aan voor Unity Catalog, waarmee de mogelijkheden voor datagovernance voor het lakehouse aanzienlijk worden uitgebreid. Met deze nieuwe functie van Unity Catalog kunnen klanten inzicht krijgen in de herkomst van hun data in hun lakehouse, in wie de data heeft aangemaakt en wanneer, hoe de data in de loop der tijd is gewijzigd, hoe de data wordt gebruikt, en nog veel meer. Data lineage voor Unity Catalog is nu beschikbaar als preview op AWS en Microsoft Azure.
Organisaties hebben te maken met een toevloed aan data uit verschillende bronnen. Het is buitengewoon lastig om te overzien waar die data vandaan komt, hoe die beweegt en verandert, wie er toegang toe heeft, en hoe de data wordt gebruikt. Toch is dat inzicht van het grootste belang voor het vertrouwen en om risico’s goed te kunnen inschatten. Dankzij data lineage voor Unity Catalog hebben datateams alle toepassingen verderop in het proces in beeld die de gevolgen merken van datawijzigingen - applicaties, dashboards, machine learning-modellen of datasets, enz. - en krijgen ze eenvoudig inzicht in de ernst van de impact zodat ze snel de relevante betrokkenen op de hoogte kunnen stellen van wijzigingen.
Cruciaal belang
Data lineage stelt datagebruikers zoals data scientists, data-engineers en data-analisten, in staat om, rekening houdend met de context, analyses uit te voeren. Dat zorgt voor kwalitatief betere uitkomsten. Bovendien kunnen data-stewards zien welke datasets niet meer worden gebruikt of verouderd zijn, zodat overbodige data buiten gebruik kan worden gesteld. Dit vermindert risico's en zorgt er bovendien voor dat eindgebruikers alleen hoogwaardige data gebruiken. De nieuwe mogelijkheden binnen Unity Catalog geven bedrijven een compleet beeld van de totale levenscyclus van data. Daardoor hebben de verantwoordelijken voor de data inzicht in de manier waarop data wordt verzameld, of deze is bijgewerkt en welke processen zijn gebruikt.
"Governancefuncties zoals data lineage zijn van cruciaal belang bij het bouwen van een robuust lakehouse-platform op de markt", zegt Matei Zaharia, medeoprichter en Chief Technologist bij Databricks. "Zonder goede data lineage is het lastig om de bedrijfs- en verificatieprocessen te blijven volgen die datagedreven organisaties nodig hebben om succesvol te zijn. Wij willen ervoor zorgen dat onze klanten zich kunnen richten op inzichten, en over kunnen gaan op proactief datamanagement door middel van een eenduidig, transparant beeld van hun gehele data-ecosysteem."
Feautomatiseerde run-time lineage
De belangrijkste kenmerken van Unity Catalog zijn onder meer geautomatiseerde run-time lineage om alle in Databricks gegenereerde lineage vast te leggen. Dat biedt meer accuratesse en efficiëntie in vergelijking met het handmatig taggen van data. Deze informatie wordt vastgelegd voor tabellen, doorzichten en kolommen en geeft een gedetailleerd beeld van de upstream en downstream datastromen. Bovendien werkt lineage in alle workloads die door Databricks worden ondersteund, zoals SQL, Python, R en Scala en dat betekent dat alle data-persona's hun tools kunnen versterken met data-intelligentie en betere inzichten. Dit omvat ook het vastleggen van lineage voor invoer als notebooks, workflows en dashboards.
Data lineage helpt organisaties ook om beter te voldoen aan compliancenormen door het eenvoudiger te maken om datastromen bij te houden die onder de compliance-regelgeving vallen, zoals de AVG (of GDPR) of Amerikaanse regelgeving als de California Consumer Privacy Act (CCPA) of de Health Insurance Portability and Accountability Act (HIPAA). Juist de traceerbaarheid van data is een cruciaal element in een moderne data-architectuur waarmee klanten aan wettelijke vereisten kunnen voldoen.
2 april 2025 Schrijf in voor al weer de twaalfde editie van ons jaarlijkse congres met wederom een ijzersterke sprekers line-up. Op deze editie behandelen wij belangrijke thema’s als Moderne (Native-Cloud) Data Architecturen, Datawarehouse Desi...
3 april 2025 (halve dag)Praktische workshop met Alec Sharp [Halve dag] Deze workshop door Alec Sharp introduceert conceptmodellering vanuit een non-technisch perspectief. Alec geeft tips en richtlijnen voor de analist, en verkent datamodellering op c...
3 april 2025 Deze workshop met Winfried Etzel behandelt de centrale pijler van Data Mesh: Federated Data Governance. Hoe zorg je voor een goede balans tussen autonomie en centrale regie? Praktische workshop van een halve dag op 3 april in Utre...
3 april 2025 In de snel veranderende wereld van vandaag is het effectief benutten en beheren van gegevens een kritieke succesfactor voor organisaties. Deze cursus biedt een fundamenteel begrip van Master Data Management (MDM) en de centrale ro...
7 t/m 9 april 2025Praktische workshop met internationaal gerenommeerde spreker Alec Sharp over het modelleren met Entity-Relationship vanuit business perspectief. De workshop wordt ondersteund met praktijkvoorbeelden en duidelijke, herbruikbare richt...
10, 11 en 14 april 2025Praktische driedaagse workshop met internationaal gerenommeerde spreker Alec Sharp over herkennen, beschrijven en ontwerpen van business processen. De workshop wordt ondersteund met praktijkvoorbeelden en duidelijke, herbruikba...
15 april 2025 Praktische workshop Datavisualisatie - Dashboards en Data Storytelling. Hoe gaat u van data naar inzicht? En hoe gaat u om met grote hoeveelheden data, de noodzaak van storytelling en data science? Lex Pierik behandelt de stromingen in ...
14 en 15 mei 2025 Organisaties hebben behoefte aan data science, selfservice BI, embedded BI, edge analytics en klantgedreven BI. Vaak is het dan ook tijd voor een nieuwe, toekomstbestendige data-architectuur. Dit tweedaagse seminar geeft antwoord op...
Deel dit bericht