实际上,我要解决的问题是,获取PySpark数据的第一/最后N行,结果是数据。具体来说,我想做这样的事情:
my_df.head(20).toPandas()但是,因为head()返回一个行列表,所以我得到了以下错误:
AttributeError: 'list' object has no attribute 'toPandas'所以,我要么寻找将PySpark数据rows的前N行作为数据返回的方法,要么寻找将这些行列表转换为数据rows的方法。有什么想法吗?
发布于 2016-05-01 18:25:55
用limit
>>> df = sc.parallelize((("a", 1), ("b", 2))).toDF()
>>> df.limit(1).toPandas()
_1 _2
0 a 1用pd.DataFrame
>>> pd.DataFrame(df.head(1), columns=df.columns)
_1 _2
0 a 1https://stackoverflow.com/questions/36969047
复制相似问题