腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
如何
拼接
数据
框
列
pyspark
?
apache-spark
、
pyspark
、
apache-spark-sql
我已经使用以下代码创建了
数据
框
: df = spark.createDataFrame([("A", "20"), ("B", "30"), ("D", "80"),("A", "120"),("c"Let|Num|| A| 20|| D| 80|| c| 20|+----+
浏览 26
提问于2020-09-11
得票数 0
回答已采纳
1
回答
关于在
PySpark
中写入拼图的问题
csv
、
pyspark
、
parquet
在
PySpark
中将csv文件转换为parquet时遇到问题。当转换相同模式的多个文件时,它们不具有相同的模式,因为有时数字字符串将被读取为浮点型,其他字符串将被读取为整数,等等。
列
的顺序似乎也有问题。似乎当编写具有相同
列
的
数据
帧时,但是以不同的顺序排列以
拼接
,那么这些
拼接
就不能被加载到相同的语句中。
如何
将dataframe写入parquet,以使所有
列
都以字符串类型存储?
如何
处理
列
的顺序?在写入拼图之前,我是否应
浏览 23
提问于2021-01-20
得票数 0
3
回答
Python/
pyspark
数据
框
重新排列
列
python
、
pyspark
、
spark-dataframe
我有一个python/
pyspark
格式的
数据
框
,其中包含
列
id、time、city、zip等......我已经做了如下工作
浏览 0
提问于2017-03-21
得票数 46
回答已采纳
1
回答
使用map函数将Spark Dataframe转换为RDD
apache-spark
、
dataframe
、
pyspark
我正在尝试将spark
数据
框
中的
列
拆分为多个值。因此,我分隔了要拆分的
列
,并检查了其类型:O:
pyspark
.sql.dataframe.DataFrameO:
pyspark
.rdd.PipelinedRDD万分感谢
浏览 0
提问于2016-06-22
得票数 0
1
回答
如何
使用
Pyspark
的模式从
Pyspark
数据
帧创建hive表?
python
、
pyspark
我已经使用以下代码创建了
数据
框
: import
pyspark
spark =
pyspark
.sql.SparkSession(sc) data = [('A', 'B', 1), ('A', 'B', 2), ('A
浏览 12
提问于2020-06-15
得票数 0
1
回答
Spark 2.0.2 Data Frame -
如何
添加由现有
列
的前两个字符组成的新
列
?
python
、
apache-spark
、
pyspark
我来自熊猫的背景,在一个简单的操作上,我正在与Spark 2.0.2 (
PySpark
)作斗争。
如何
向现有
数据
框
添加新
列
,该
数据
框
包含现有
列
的前两个字符。Diana", 6, "Singapore", 4)], ["FirstName", "Sales", "State", "Cost"])尝试#1 from
py
浏览 3
提问于2016-11-20
得票数 0
3
回答
如何
在
Pyspark
中替换dataframe的所有空值
dataframe
、
null
、
pyspark
我在
pyspark
中有一个超过300
列
的
数据
框架。在这些
列
中,有一些
列
的值为null。现在,我想用空格替换
数据
框
所有
列
中的null。所以当我尝试对这些
列
求和时,我不会得到空值,但我会得到一个数值。 我们
如何
在
pyspark
中实现这一点呢?
浏览 1
提问于2017-02-18
得票数 56
回答已采纳
1
回答
spark中的lit()有什么用处?下面两段代码返回相同的输出,使用lit()的好处是什么?
dataframe
、
apache-spark
、
pyspark
我这里有两段代码 gooddata=gooddata.withColumn("Priority",when((gooddata.Years_left < 5) & (gooddata.Years_left >= 0
浏览 2
提问于2020-06-10
得票数 0
1
回答
忽略缺失值计算
pyspark
数据
框
列
的百分位数
pyspark
、
apache-spark-sql
我对
pyspark
是个新手。我有一个包含ID和BALANCE
列
的
pyspark
数据
框
。我尝试将
列
balance存储到100% (1-100%)的存储桶中,并计算每个存储桶中有多少个in。我不能使用任何与RDD相关的东西,我只能使用
Pyspark
语法。Window.orderBy(df.BALANCE)我希望得到一个新的<e
浏览 14
提问于2019-07-11
得票数 0
1
回答
在
pyspark
的现有dataframe中添加新
列
的方法是什么?
python
、
apache-spark
、
pyspark
、
pyspark-dataframes
我已经在现有的
数据
框
中添加了一个新
列
,但它没有反映在
数据
帧中。如果我们可以将
数据
帧分配给另一个
数据
帧,我们就可以看到结果test.show() 有没有办法向现有的dataframe添加一个新的
列
(不复制dataframe)?我们在
pyspark
浏览 4
提问于2021-01-26
得票数 0
1
回答
快速
拼接
:
如何
禁用rle编码
python
、
apache-spark
、
pyspark
、
parquet
我正在使用files parquet将pandas
数据
帧转换为parquet文件。这比我之前使用
pyspark
的方法要快得多。Unsupported encoding: RLE 有没有办法在使用快速
拼接
write方法时禁用RLE?
浏览 4
提问于2017-05-11
得票数 1
1
回答
如何
解决?(将列表添加到
列
dataframe
pyspark
)
python
、
list
、
dataframe
、
pyspark
如果我已经存在
数据
帧,且我想要向
数据
框
中添加新
列
sqlContext = SQLContext(sc)| 30| 12|+-------+--------+AssertionError: col should be Column
如何
解决向
列
dataframe
pysp
浏览 0
提问于2020-10-05
得票数 1
1
回答
Pyspark
数据
帧过滤语法错误
pyspark
、
pyspark-sql
我正在使用
Pyspark
版本1.6处理
Pyspark
数据
帧。在将此
数据
框
导出到.CSV文件之前,我需要根据特定条件对特定
列
使用LIKE和OR运算符过滤
数据
。为了向您介绍我到目前为止所做的工作,我从多个.JSON文件创建了初始
数据
帧。此
数据
框
已子集,因此仅包含所需的
列
。然后创建了一个sqlContext临时表。到目前为止,我已经尝试了两种不同的方法,使用sqlContext和使用
Pyspark
浏览 0
提问于2017-07-27
得票数 0
回答已采纳
1
回答
有没有什么方法可以找到
pyspark
数据
帧中有
数据
的
列
数
sql
、
pyspark
我有一个有7
列
的
pyspark
数据
框
,我必须添加一个名为" sum“的新
列
,并计算在sum
列
中包含
数据
(非null)的
列
的数量。
浏览 8
提问于2020-01-19
得票数 1
回答已采纳
1
回答
如何
选择
Pyspark
列
并将其作为新行添加到
数据
框
中?
apache-spark
、
pyspark
、
pyspark-sql
、
pyspark-dataframes
我想提取一
列
,并将其值作为新行附加到
数据
框
中。例如,如果我有一个这样的
数据
框
: -------------------------------------------------------------------------------------------------------------------------
如何
在
PySpark
中通过
浏览 18
提问于2019-12-29
得票数 0
回答已采纳
1
回答
Pyspark
dataframe
拼接
vs.增量:不同的行数
apache-spark
、
pyspark
、
parquet
、
delta-lake
我在HDFS上以Delta格式写入了
数据
。据我所知,Delta正在以
拼接
的形式存储
数据
,只是在它上面增加了一个具有高级功能的层。但是,当使用
Pyspark
读取
数据
时,如果使用spark.read.parquet()或spark.read.format('delta').load()读取dataframe,我会得到不同的结果 df
Pyspark
版本是2.4。
浏览 28
提问于2021-01-27
得票数 1
回答已采纳
1
回答
使用
PySpark
sql函数
python
、
pyspark
此函数:lg = F.log(5.2)返回: at java.lang.Thread.run(Thread.java:745) 文档指向在
数据
帧中使用函数
浏览 8
提问于2017-03-07
得票数 0
回答已采纳
4
回答
如何
使用
pyspark
collect_list函数检索所有
列
python
、
pyspark
我有一个
pyspark
2.0.1。我正在尝试按我的
数据
框
分组,并从我的
数据
框
中检索所有字段的值。我发现将给我的国家和名称的属性和名称属性的值,它将给出的
列
标题为collect_list但是对于我的工作,我有大约15
列
的
数据
帧&我会运行一个循环,每次在循环中改变groupby字段,需要所有剩
浏览 6
提问于2017-10-18
得票数 3
1
回答
如何
在不重命名列的情况下计算单行
数据
框
列
的平均值、最大值、最小值
pyspark
、
apache-spark-sql
、
databricks
、
aws-databricks
如何
在不使用
pyspark
重命名列的情况下,从单行
数据
框
列
中计算同一
列
的平均值、最大值、最小值 我使用了下面的命令,但它抛出了一个错误 df5=df5.agg(avg(col("Salaray")),
浏览 22
提问于2021-10-29
得票数 0
3
回答
Spark Data Frames -检查
列
是否为整型
python
、
pyspark
、
spark-dataframe
我正在尝试找出spark
数据
框
中的
列
是什么
数据
类型,并基于该定义操作
列
。这是我到目前为止所知道的:from
pyspark
.sql import SparkSession print(x+": inside if loop") print(x+": inside if
浏览 8
提问于2018-04-12
得票数 1
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券