首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >并行处理是否解决了R中由于数据集大而导致RAM不足的问题?

并行处理是否解决了R中由于数据集大而导致RAM不足的问题?
EN

Stack Overflow用户
提问于 2019-08-17 11:04:52
回答 1查看 215关注 0票数 0

我想在224 GB的数据集上做一些机器学习技术(logistic回归、SVM、随机forrest、神经网络),而我的RAM只有16 GB。我认为解决方案可能是在云中租用一台有256 GB内存的虚拟PC。例如,EC2 at AWS基于Louis:阿美投资/的这篇文章中的一个AMI

或者,我理解有几种并行处理方法和包。例如,Sparklyr,未来和ff。并行处理是我有限内存问题的解决方案吗?还是以运行代码为目标的并行处理更快?

如果我假设并行处理是一个解决方案,我假设我需要修改机器学习包中的进程。例如,逻辑回归是用这一行代码进行的:

模型<- glm (Y ~.,family=binomial ( link='logit‘),data=train )

虽然据我所知,我对glm-方法中的计算没有影响。

EN

回答 1

Stack Overflow用户

发布于 2019-08-17 12:39:35

您的问题是,不能同时将所有数据放入内存中,而标准的glm()函数需要这样做。幸运的是,可以使用批量数据计算线性和广义线性模型。问题是如何将各批之间的计算组合起来。

并行算法需要分解数据集以发送给工作人员,但是如果您只有一个工作人员,则需要对其进行串行处理,因此您需要的只是“分解”部分。R中的biglm包可以为您的模型类做到这一点。

票数 2
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/57535689

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档