05-02-2019

Google stelt Kubernetes Operator voor Spark beschikbaar op Google Cloud Platform

Deel dit bericht

Google heeft de Spark operator for Kubernetes aangekondigd op Google Cloud Platform. Met deze software is het mogelijk om Apache Spark in te zetten op met Kubernetes beheerde clusters. Kubernetes stroomlijnt een groot deel van de technische problemen bij het beheren en schalen van op microservices gebaseerde applicaties.

Volgens Google worden dataverwerkingsworkloads, inclusief Spark-taken, uitgevoerd op speciale softwarestacks zoals Yarn of Mesos. Met toenemend gebruik van microservices en containers laten organisaties zien dat er behoefte is aan ondersteuning voor dataverwerking- en machine learning workloads in Kubernetes. De integratie van Kubernetes met Spark was een project van ontwikkelaars die aan Apache Spark werkten. De eerste aflevering van de integratie vond plaats met Spark 2.3.0 afgelopen april en de Kubernetes Scheduler werd afgelopen november verbeterd met Spark 2.4.0.

Aangepast Docker-bestand
De Spark Operator van Google is gebaseerd op de native Kubernetes-integratie voor het uitvoeren, bewaken en beheren van Spark-toepassingen in een Kubernetes-cluster op GCP. Hoewel het technisch een bèta is, meent Google dat de Spark-operator klaar is voor gebruik voor grootschalige dataverwerking, analytics en machine learning op op Google Cloud Platform. De operator ondersteunt Spark 2.4.0, waarmee het uitvoeren van PySpark- en SparkR-toepassingen in het Kubernetes-cluster wordt ondersteund. De operator kan worden geïntegreerd met andere GCP-producten en -services, waaronder Stackdriver voor logging en monitoring, met Cloud Storage en met BigQuery voor analyses. De software wordt geleverd met een aangepast Docker-bestand dat ondersteuning biedt voor cloudopslag, en met de Prometheus JMX-exporter voor monitoring.

De Spark-operator is volgens Google al in gebruik op GCP. Er is een Slack-kanaal gewijd aan de operator met meer dan 170 leden die betrokken zijn bij discussies hierover. Er is ook een GitHub-repository waar ontwikkelaars code delen en distribueren die gerelateerd is aan het project. Google heeft verdere plannen voor ondersteuning van de Spark-operator, onder andere voor verschillende Spark-versies (er is incompatibiliteit tussen Kubernetes-operators die worden gebruikt voor Spark 2.4 en Spark 2.3.x).

De Spark Operator is beschikbaar in de GCP Marketplace.

Tags:

Apache, Spark, Analytics, Cloud, Containers, Kubernetes, Docker

Company:

Google, Google Cloud

Nieuwsarchief

Google stelt Kubernetes Operator voor Spark beschikbaar op Google Cloud Platform

Deel dit bericht

Tags:

Company:

Adept Events

Agile Datawarehouse Design & Dimensional Modeling met Lawrence Corr

Knowledge Graphs & Large Language Models for Data Modeling & Analytics

Business-oriented Data Modelling Masterclass met Alec Sharp

Ontwerpen van een Nieuwe Data Architectuur met Rick van der Lans

Data Management Fundamentals door Winfried Etzel [Live en/of Online]

Data Governance Sprint ~ Setting up Data Governance in Weeks instead of Months

Generatieve AI in Business Analyse door Christian Gijsels

Working with Business Processes Masterclass door Alec Sharp

Partners

Google stelt Kubernetes Operator voor Spark beschikbaar op Google Cloud Platform

Deel dit bericht

Tags:

Company:

Gerelateerde Berichten

Adept Events

Agile Datawarehouse Design & Dimensional Modeling met Lawrence Corr

Knowledge Graphs & Large Language Models for Data Modeling & Analytics

Business-oriented Data Modelling Masterclass met Alec Sharp

Ontwerpen van een Nieuwe Data Architectuur met Rick van der Lans

Data Management Fundamentals door Winfried Etzel [Live en/of Online]

Data Governance Sprint ~ Setting up Data Governance in Weeks instead of Months

Generatieve AI in Business Analyse door Christian Gijsels

Working with Business Processes Masterclass door Alec Sharp

Partners