RUN pip install pyarrow
RUN pip install "dask[complete]"

import pyarrow.parquet as pq
import dask.dataframe as dd
import pandas as pd

path = ""
dask_df = dd.read_parquet(path, columns=["col1", "col2"], engine="pyarrow")

dask_filter_df = dask_df[dask_df.col1 == "filter here"]

path = ""
parquet_pandas_df = pq.ParquetDataset(path).read_pandas().to_pandas()

pandas_filter_df = parquet_pandas_df[parquet_pandas_df.col1 == "filter here"]

票数 0

页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持

原文链接：

https://stackoverflow.com/questions/58333638

复制

相似问题

问Pandas和FastParquet读取单个分区
EN

回答 1

Stack Overflow用户

社区

活动

圈层

关于

腾讯云开发者

热门产品

热门推荐

更多推荐

问Pandas和FastParquet读取单个分区EN

回答 1

Stack Overflow用户

社区

活动

圈层

关于

腾讯云开发者

热门产品

热门推荐

更多推荐

问Pandas和FastParquet读取单个分区
EN