Cloudera versnelt Apache Spark met NVIDIA GPU’s
Cloudera heeft GPU-acceleratie voor Apache Spark 4.1 toegevoegd aan Cloudera Data Engineering. Hiervoor gebruikt het bedrijf de cuDF-bibliotheek van NVIDIA. Volgens een persbericht kunnen organisaties daarmee bestaande Spark-workloads versnellen zonder hun PySpark- of SQL-code aan te passen.
De uitbreiding maakt gebruik van de NVIDIA cuDF-plug-in voor Apache Spark en is onderdeel van Cloudera Anywhere Cloud. De technologie is bedoeld om vooral ETL-processen en de voorbereiding van data voor analytics en AI sneller uit te voeren.
Volgens Cloudera kan de verwerking van Spark-workloads met NVIDIA GPU’s tot vier keer sneller verlopen dan op traditionele infrastructuur met CPU’s. De daadwerkelijke prestatiewinst is afhankelijk van de workload en infrastructuur. Kortere verwerkingstijden moeten daarnaast leiden tot lagere kosten voor rekenkracht in de cloud.
Datavoorbereiding
Apache Spark wordt veel gebruikt voor het verwerken en transformeren van grote hoeveelheden data. Naarmate organisaties meer AI-toepassingen ontwikkelen, kan de tijd die nodig is om data voor deze toepassingen voor te bereiden een knelpunt worden.
Cloudera integreert de GPU-acceleratie daarom rechtstreeks in Data Engineering. Gebruikers hoeven geen drivers handmatig te configureren en bestaande workflows kunnen volgens het bedrijf behouden blijven. Ook de beveiliging en governance van Cloudera Unified Data Fabric blijven van toepassing.
De ondersteuning is niet beperkt tot één aanbieder van clouddiensten. Cloudera maakt de GPU-acceleratie beschikbaar voor Spark-workloads in publieke, private en soevereine clouds en in on-premises omgevingen.
Kosten AI
Cloudera wijst daarbij op de toenemende infrastructuurkosten van AI. Uit eigen onderzoek van het bedrijf blijkt dat 84 procent van de ondervraagde organisaties aangeeft dat workloads voor AI de infrastructuurkosten verhogen. Snellere verwerking van data moet zowel die kosten beperken als de tijd verkorten die data-engineering-, analytics- en AI-teams nodig hebben om bruikbare data beschikbaar te krijgen.
De GPU-acceleratie voor Apache Spark is beschikbaar in Cloudera Data Engineering als onderdeel van Cloudera Anywhere Cloud.
Bron: Cloudera





