我想使用pyspark DataFrame函数而不是SQL query来复制下面的代码。
spark.sql("select date from walmart_stock order by high desc limit 1").show()发布于 2021-11-23 14:21:37
以下是从链接的CSV文件开始的代码。您应该能够识别SQL函数。请注意,我们使用inferSchema选项,以便直接将数字解析为双精度,并获得正确的排序(对于默认字符串类型,它不会像预期的那样工作)。另一种方法是在读取CSV之后转换列。
spark.read
.option("header", "true")
.option("inferSchema", "true")
.csv("walmart_stock.csv")
.orderBy(f.col("High"), desc=True)
.limit(1)
.select("Date")
.show()哪一项会产生
+----------+
| Date|
+----------+
|2015-11-13|
+----------+https://stackoverflow.com/questions/70082175
复制相似问题