首页
学习
活动
专区
圈层
工具
发布

Cloudera为Spark 4.1引入GPU加速,无需改代码速度提4倍

Cloudera宣布,通过与NVIDIA合作,已在Cloudera Data Engineering中为Apache Spark 4.1引入原生GPU加速功能。该功能将作为Cloudera Anywhere Cloud的一部分提供,旨在利用基于CUDA-X软件库的NVIDIA cuDF插件,帮助企业在不重写PySpark或SQL代码的前提下,显著提升Spark作业处理速度。

Apache Spark广泛应用于提取、转换和加载(ETL)流程及各类分析工作负载。在传统CPU基础设施上,此类作业往往耗时数小时,不仅推高计算成本,还延缓了从原始数据到机器学习及报告就绪数据集的转化进程。Cloudera表示,采用新配置的客户在NVIDIA GPU上获得的加速效果可达传统CPU系统的4倍。此外,该方案设计为无需手动配置驱动程序即可运行,并保留了Cloudera数据平台现有的治理与安全控制措施。

混合云环境与数据瓶颈

此次发布的核心亮点在于对混合环境的支持。组织可在公有云、私有云、主权云和本地系统之间运行加速后的Spark工作负载,同时保持一致的操作模式。这一策略特别吸引那些受法规、数据驻留要求或既有本地投资限制,无法将所有数据迁移至单一环境的大型企业。Cloudera希望通过将GPU加速与其数据工程服务绑定,减少跨不同环境的定制调优需求。

Cloudera首席产品官Leo Brunnick指出,许多组织在AI领域的瓶颈并非模型质量,而是数据处理的效率。“AI的限制往往在于将原始数据转化为可信、可用洞察的速度。”Brunnick表示,“加速Spark有助于消除这一瓶颈,使客户能更快从数据准备转向分析和AI,同时将治理、安全和运营一致性置于战略中心。”

缓解云支出压力

随着AI部署从试点走向常规业务应用,云计算支出成为企业关注焦点。Spark工作负载通常是数据资产中最大的经常性作业之一,即使运行时间适度缩短,也能显著降低每月基础设施账单。对于拥有大量PySpark和SQL代码库的公司而言,无需重写代码即可实现加速,比单纯的速度提升更具价值,因为它消除了迁移工作并降低了运营风险。

NVIDIA战略合作伙伴关系副总裁Pat Lee强调,加速AI部署的最快路径是与企业现有运作方式相一致。“随着NVIDIA AI基础设施和CUDA-X库成为Cloudera Data Engineering的原生部分,企业可以在不更改一行代码的情况下降低成本并大幅加快Apache Spark管道。”

此次更新不仅为Cloudera服务于混合云和本地资产客户增加了新功能,也将NVIDIA软件库的应用场景从AI模型训练和推理扩展至主流数据工程工作流中,使通过减少运行时间和降低计算使用来量化加速商业案例变得更加容易。

【星途科讯 图文丨伊贝 首发于ZAKER科技,转载请注明出处】

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OW5Zqu0BZ6DzqswW3GY173MA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券