Google heeft de Spark operator for Kubernetes aangekondigd op Google Cloud Platform. Met deze software is het mogelijk om Apache Spark in te zetten op met Kubernetes beheerde clusters. Kubernetes stroomlijnt een groot deel van de technische problemen bij het beheren en schalen van op microservices gebaseerde applicaties.
Volgens Google worden dataverwerkingsworkloads, inclusief Spark-taken, uitgevoerd op speciale softwarestacks zoals Yarn of Mesos. Met toenemend gebruik van microservices en containers laten organisaties zien dat er behoefte is aan ondersteuning voor dataverwerking- en machine learning workloads in Kubernetes. De integratie van Kubernetes met Spark was een project van ontwikkelaars die aan Apache Spark werkten. De eerste aflevering van de integratie vond plaats met Spark 2.3.0 afgelopen april en de Kubernetes Scheduler werd afgelopen november verbeterd met Spark 2.4.0.
Aangepast Docker-bestand
De Spark Operator van Google is gebaseerd op de native Kubernetes-integratie voor het uitvoeren, bewaken en beheren van Spark-toepassingen in een Kubernetes-cluster op GCP. Hoewel het technisch een bèta is, meent Google dat de Spark-operator klaar is voor gebruik voor grootschalige dataverwerking, analytics en machine learning op op Google Cloud Platform. De operator ondersteunt Spark 2.4.0, waarmee het uitvoeren van PySpark- en SparkR-toepassingen in het Kubernetes-cluster wordt ondersteund. De operator kan worden geïntegreerd met andere GCP-producten en -services, waaronder Stackdriver voor logging en monitoring, met Cloud Storage en met BigQuery voor analyses. De software wordt geleverd met een aangepast Docker-bestand dat ondersteuning biedt voor cloudopslag, en met de Prometheus JMX-exporter voor monitoring.
De Spark-operator is volgens Google al in gebruik op GCP. Er is een Slack-kanaal gewijd aan de operator met meer dan 170 leden die betrokken zijn bij discussies hierover. Er is ook een GitHub-repository waar ontwikkelaars code delen en distribueren die gerelateerd is aan het project. Google heeft verdere plannen voor ondersteuning van de Spark-operator, onder andere voor verschillende Spark-versies (er is incompatibiliteit tussen Kubernetes-operators die worden gebruikt voor Spark 2.4 en Spark 2.3.x).
De Spark Operator is beschikbaar in de GCP Marketplace.
14 en 15 mei 2025 Organisaties hebben behoefte aan data science, selfservice BI, embedded BI, edge analytics en klantgedreven BI. Vaak is het dan ook tijd voor een nieuwe, toekomstbestendige data-architectuur. Dit tweedaagse seminar geeft antwoord op...
19 t/m 21 mei 2025Praktische driedaagse workshop met internationaal gerenommeerde trainer Lawrence Corr over het modelleren Datawarehouse / BI systemen op basis van dimensioneel modelleren. De workshop wordt ondersteund met vele oefeningen en praktij...
20 en 21 mei 2025 Deze 2-daagse cursus is ontworpen om dataprofessionals te voorzien van de kennis en praktische vaardigheden die nodig zijn om Knowledge Graphs en Large Language Models (LLM's) te integreren in hun workflows voor datamodelleri...
22 mei 2025 Workshop met BPM-specialist Christian Gijsels over AI-Gedreven Business Analyse met ChatGPT. Kunstmatige Intelligentie, ongetwijfeld een van de meest baanbrekende technologieën tot nu toe, opent nieuwe deuren voor analisten met innovatie...
17 t/m 19 november 2025 De DAMA DMBoK2 beschrijft 11 disciplines van Data Management, waarbij Data Governance centraal staat. De Certified Data Management Professional (CDMP) certificatie biedt een traject voor het inleidende niveau (Associate) tot...
Alleen als In-house beschikbaar Het Logical Data Warehouse, een door Gartner geïntroduceerde architectuur, is gebaseerd op een ontkoppeling van rapportage en analyse enerzijds en gegevensbronnen anderzijds. Een flexibelere architectuur waarbij snell...
Deel dit bericht