首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >将pyspark dataframe写入Postgres,而不将列标记为非空

将pyspark dataframe写入Postgres,而不将列标记为非空
EN

Stack Overflow用户
提问于 2020-11-17 13:44:36
回答 1查看 218关注 0票数 0

我正在使用python中的以下代码将Dataframe写入Postgres:

代码语言:javascript
复制
df.write.format('jdbc') \
                .mode('append') \
                .option('url', url) \
                .option('dbtable', tn) \
                .option('user', un) \
                .option('password', pwd) \
                .option('driver', driver) \
                .save()

该代码创建一个新表,并按预期插入数据。问题是Postgres中的列被标记为not null。有没有办法让它们不是not null

EN

回答 1

Stack Overflow用户

回答已采纳

发布于 2020-11-17 17:34:43

作为基准,这应该继承自你的Spark DataFrame。您可以使用df.printSchema()检查可空性。

就Postgres中列的可空性而言,我认为您需要在Postgres中创建表时(如果写入现有表)或在Spark JDBC选项和属性中指定这一点。这样,您就可以在您的属性中设置一个自定义模式,例如

代码语言:javascript
复制
# Specifying create table column data types on write
jdbcDF.write \
    .option("createTableColumnTypes", "name CHAR(64), comments VARCHAR(1024)") \
    .jdbc("jdbc:postgresql:dbserver", "schema.tablename",
          properties={"user": "username", "password": "password"})

在这里,您可以指定(如果JDBC允许的话)可空性,例如

代码语言:javascript
复制
option("createTableColumnTypes", "name CHAR(64) default null")

或者,使用createSchema选项(不确定该选项是否适用于现有表,请查看您的append选项)-查看https://spark.apache.org/docs/latest/sql-data-sources-jdbc.html中的所有选项

或者,在Postgres中提前显式地创建具有特定模式(及其可空性)的表。

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/64869936

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档