我需要通过对'ID‘进行分组来选择数据帧中的所有列。但是当我这样做的时候,我只能得到ID和'value‘。我需要所有的栏目
a=df.groupby(df['id']).agg({"date": "max"}
a.show()这只选择'id‘和'date’列。还有其他列。如何选择日期中最大值的所有列。
发布于 2018-09-07 03:07:34
在spark中,有两种方式可以将其与之前的数据帧连接起来,如下所示:
a=df.groupby(df['id']).agg({"date": "max"}
df = df.join(
a,
on = "id",
how = "inner"
)
df.show()或者像这样使用窗口分区:
from pyspark.sql import Window
import pyspark.sql.functions as F
window = Window.partitionBy("id")
a = df.withColumn(
"max",
(F.max(F.col("date")).over(window))
)
a.show() 我会说更喜欢第一个,因为即使在加入之后,它的成本也更低。
https://stackoverflow.com/questions/52206946
复制相似问题