首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >如何用并行Insert语句在MySQL表中插入大熊猫数据帧?

如何用并行Insert语句在MySQL表中插入大熊猫数据帧?
EN

Stack Overflow用户
提问于 2019-05-31 12:21:32
回答 1查看 2.2K关注 0票数 4

我在一个项目中工作,在这个项目中,我必须编写一个具有数百万行和大约25列的数据框,其中大部分是数值类型。我使用Pandas DataFrame to SQL Function将数据帧转储到Mysql表中。我发现这个函数创建了一个可以一次插入多行的Insert语句。这是一种很好的方法,但是MySQL对使用这种方法构建的查询的长度有限制。

有没有一种方法可以在同一个表中并行插入,这样我就可以加速这个过程?

EN

回答 1

Stack Overflow用户

回答已采纳

发布于 2019-07-29 16:11:23

您可以做一些事情来实现这一点。

一种方法是在写入sql时使用额外的参数。

代码语言:javascript
复制
df.to_sql(method = 'multi')

根据此documentation,将'multi‘传递给方法参数允许您大容量插入。

另一种解决方案是使用multiprocessing.dummy构造一个自定义插入函数。以下是文档的链接:https://docs.python.org/2/library/multiprocessing.html#module-multiprocessing.dummy

代码语言:javascript
复制
import math
from multiprocessing.dummy import Pool as ThreadPool

...

def insert_df(df, *args, **kwargs):
    nworkers = 4 # number of workers that executes insert in parallel fashion

    chunk = math.floor(df.shape[0] / nworkers) # number of chunks
    chunks = [(chunk * i, (chunk * i) + chunk) for i in range(nworkers)]
    chunks.append((chunk * nworkers, df.shape[0]))
    pool = ThreadPool(nworkers)

    def worker(chunk):
        i, j = chunk
        df.iloc[i:j, :].to_sql(*args, **kwargs)

    pool.map(worker, chunks)
    pool.close()
    pool.join()

....

insert_df(df, "foo_bar", engine, if_exists='append')

第二种方法是在https://stackoverflow.com/a/42164138/5614132上提出的。

票数 6
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/56388640

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档