腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
如
何在
spark
python
中
过滤
删除
空
值
python
、
pandas
、
spark-streaming
、
aws-glue
我试图
过滤
掉列
中
的null
值
,如果它大于1,则进行计数。col("_corrupt_record")), badRows = df.filter("_corrupt_record isNotnull") 如果_corrupt_record列中有数据,正确的
过滤
方法是什么
浏览 18
提问于2020-06-23
得票数 0
回答已采纳
1
回答
当空
值
不是预期
值
时,
Spark
filter函数会
过滤
它
scala
、
apache-spark
、
apache-spark-sql
spark
filter函数在不应该
过滤
空
值
的时候
过滤
空
值
。我的条件$"test" =!= "T"不应该
删除
空行。val seq = Seq((null, "T"),(null, "F"),(null, "F"),("F", "F"),("T", "C")) import
浏览 31
提问于2021-04-23
得票数 0
回答已采纳
1
回答
Java
Spark
删除
重复项/
空
值
并保留顺序
java
、
apache-spark
我有下面的Java
Spark
数据集/dataframe。 Col_1 Col_2 Col_3 ...如果第二个记录为NULL,则必须
删除
NULL (
如
COl_1 = A),如果有多个有效
值
(
如
Col_1 =B),则每次只应保留一个有效的Col_2 =2和Col_3 =2。如果只有一条记录为null,
如
Col_1 = C,则必须保留该记录 预期输出: Col_1 Col_2 Col_3 ...C 1 NULL 到目前为止,我尝试了以下内容: 我尝试将group
浏览 17
提问于2020-11-25
得票数 0
回答已采纳
1
回答
将
Spark
DataFrame
过滤
器与列名列表一起使用
scala
、
apache-spark
、
apache-spark-sql
我必须使用List[String]
过滤
Spark
DataFrame
中
的非
空
列
值
val keyList = List("columnA", "columnB", "columnC", "columnD对于名为key的单个列,语法应为: val nonNullDf = df.filter(col("key").isNotNull) 我的问题是如
何在
前面的
过滤
器中使用keyList?
浏览 16
提问于2021-04-19
得票数 1
回答已采纳
1
回答
当列名为
空
时,如何使用pyspark筛选器?
pyspark
、
pyspark-sql
我的吡火花数据框架有几个列,其中有几个列是
空
的,例如,入站交付(中间是便条空间)。当我试图使用.filter进行比较时,我得到了一个错误。我不想重新定义模式,
删除
空白,因为我有一个巨大的表,几乎所有的表都有相同的名称空间。是否有一种快速使用名称为
空
的筛选器的方法?dfjoin.where (‘入站Delivery=0090043373’).show()~\Deskto
浏览 0
提问于2019-06-12
得票数 1
1
回答
如何使用Pyspark从mongodb
中
仅提取特定行?
apache-spark
、
pyspark
、
apache-spark-sql
、
spark-streaming
我正在从mongodb集合中提取数据,并使用
Spark
python
代码将其写入bigquery表。下面是我的代码片段: .format("com.mongodb.
spark
.sql.DefaultSource")\ .option("uri","mongodb_url但我只想提取满足条件的文档(
如
sql查询
中
的where条件)。我发现的一种方法是读取dataframe
中
浏览 1
提问于2021-02-18
得票数 0
1
回答
在
Python
代码
中
获取Azure数据砖块的实例
apache-spark
、
azure-databricks
我正在开发一个
python
包,它将部署到databricks集群
中
。我们经常需要引用
python
代码
中
的"
spark
“和"dbutils”对象。我们可以使用“星星之火”(
如
spark
.sql())在笔记本
中
轻松地访问这些对象。如
何在
包
中
的
python
代码
中
获得
spark
实例?
浏览 0
提问于2019-03-22
得票数 1
回答已采纳
1
回答
如
何在
拼图文件中使用K-means
scala
、
apache-spark
、
k-means
、
parquet
我想学习如
何在
Spark
上使用K-Means算法。我有一个镶木文件,我想用k-means对它进行分析。如何让
spark
只分析特定的列?如何从行
中
删除
空
值
?有没有人能写一段简单的代码来教你怎么做呢?
浏览 0
提问于2019-09-16
得票数 1
1
回答
基于可用
值
的多列Scala
Spark
数据帧
过滤
器
scala
、
apache-spark
、
apache-spark-sql
我需要用下面的条件
过滤
一个数据帧。 我有2列4Wheels(斯巴鲁,丰田,通用,
空
/
空
)和2Wheels(雅马哈,哈雷,印度,
空
/
空
)。我必须
过滤
4Wheels的
值
(斯巴鲁,丰田),如果4Wheels包含
空
/
空
,那么
过滤
2Wheels的
值
(Yamaha,Harley) 我在不同的例子
中
找不到这种类型的
过滤
。我是
spark</e
浏览 12
提问于2021-08-19
得票数 0
1
回答
创建
空
的dataframe Java
Spark
java
、
dataframe
、
apache-spark
关于如何使用
Spark
Scala/
Python
创建
空
的dataframe/Dataset,有很多示例。但是我想知道如
何在
Java
Spark
中
创建一个
空
的dataframe/Dataset。我必须创建一个
空
的dataframe,其中只有一列,标题为Column_1,类型为String。
浏览 27
提问于2020-07-14
得票数 0
回答已采纳
1
回答
为什么filter默认
删除
spark
dataframe上的
空
值
?
sql
、
apache-spark
、
null
、
spark-dataframe
包含null
值
的基本scala集合上的filter具有以下(且相当直观的)行为:res0: List[String] = List(b, null)scala> val df = List= "d").sho
浏览 27
提问于2018-03-05
得票数 9
回答已采纳
5
回答
Spark
Dataframe验证拼接写入的列名
apache-spark
、
pyspark
、
apache-spark-sql
、
spark-streaming
、
parquet
但是,一些JSON事件在键
中
包含空格,我希望在将其转换为Parquet之前记录和
过滤
/
删除
数据帧
中
的此类事件,因为;{}()\n\t=在拼图方案(CatalystSchemaConverter)中被视为特殊字符,
如
中所列1下面因此不应允许在列名中使用。如
何在
Dataframe
中
对列名执行此类验证,并完全
删除
此类事件,而不会导致
Spark
Streaming作业出错。1
Spark
的CatalystSchema
浏览 188
提问于2016-07-05
得票数 17
1
回答
从
Spark
RDD
中
删除
空
分区
hadoop
、
apache-spark
、
pyspark
、
rdd
我正在从HDFS获取数据,并将其存储在
Spark
RDD
中
。
Spark
根据HDFS块的数量创建分区的数量。这会导致大量的
空
分区,这些分区也会在管道过程中被处理。为了消除这种开销,我想从RDD
中
过滤
出所有空分区。我知道合并和重新分区,但不能保证所有的
空
分区都会被
删除
。 有没有其他的办法来解决这个问题?
浏览 2
提问于2015-10-22
得票数 10
2
回答
Spark
2.0,DataFrame,筛选字符串列,不等运算符(!==)已弃用
apache-spark
、
spark-dataframe
我正在尝试
过滤
DataFrame,只保留那些具有特定字符串列的行不为
空
。df.filter($"stringColumn" !== "")如何检查
Spark
> 2.0
中
的字符串列
值
是否为
空
?
浏览 1
提问于2016-10-20
得票数 22
回答已采纳
2
回答
用null替换空字符串会导致数据帧大小增加吗?
apache-spark
、
spark-dataframe
我很难理解以下现象:在
Spark
2.2
中
,在Scala上,在将文字空字符串的
值
替换为DataFrame (Null)后,我发现持久化的空字符串大小有了显著的增加。这是我用来替换空字符串
值
的函数: var in = df for (e <- df.columns
浏览 2
提问于2017-11-20
得票数 3
1
回答
在使用PySpark时,如
何在
Spark
中
实现
Python
数据结构?
python
、
python-2.7
、
apache-spark
、
pyspark
我目前正在自学
Spark
programming,并试图用PySpark重新编写一个现有的
Python
应用程序。然而,我仍然对如
何在
PySpark中使用常规
Python
对象感到困惑。我了解
Spark
中
的分布式数据结构,
如
RDD、DataFrame、Datasets、vector等。
Spark
有自己的转换操作和动作操作,
如
.map()、.reduceByKey()来操作这些对象。但是,如果我在PySpark
中
创建传统的
浏览 34
提问于2017-03-01
得票数 1
回答已采纳
1
回答
PySpark DataFrames -使用不同类型列之间的比较进行
过滤
python
、
apache-spark
、
pyspark
、
apache-spark-sql
假设您有一个具有各种类型列(string,double.)的dataframe以及在字符串类型列中表示“缺失
值
”的特殊
值
“想念”。from pyspark.sql import SparkSession我正在尝试计算每一列的未丢失
值
的数量,使用如下
过滤
:df.filter(col.isNotNull
浏览 0
提问于2019-01-31
得票数 2
回答已采纳
2
回答
利用Scala实现星火数据的多重
过滤
scala
、
apache-spark
我正在尝试
过滤
这个txt文件。-06|Male||Car5000|1957-03-06|Female|3|Beauty我只想
过滤
每一个原始数据,如果一个列有一个
空
元素,就
删除
它。在我的样本数据集中,有三个是
空
的。import org.apache.
spark
浏览 0
提问于2018-12-26
得票数 0
回答已采纳
1
回答
如
何在
JavaScript
中
从数组
中
删除
null
javascript
、
arrays
、
null
我要
删除
数组
中
的
空
元素。Array], [Array] ] ] ]如果有任何对象是未定义/
空
的,
如
:我希望
删除
完整的元素[[Array],[]]。我尝试将
空
数组赋值为null,然后通过添加到新数组if != nu
浏览 0
提问于2019-04-10
得票数 0
回答已采纳
1
回答
Spark
中
的自定义dateFormat比较
scala
、
date
、
apache-spark
、
apache-spark-sql
如果输入数据的格式不同,我如
何在
Spark
中
按日期进行
过滤
。dataframe.filter(to_date(from_unixtime(unix_timestamp(col(columnName),"dd-M-yy"))).gt(lit(filteredDate))) 即使有数据,
过滤
后的数据也是
空
的
浏览 1
提问于2017-03-30
得票数 0
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券