我正在使用python中的以下代码将Dataframe写入Postgres:
df.write.format('jdbc') \
.mode('append') \
.option('url', url) \
.option('dbtable', tn) \
.option('user', un) \
.option('password', pwd) \
.option('driver', driver) \
.save()该代码创建一个新表,并按预期插入数据。问题是Postgres中的列被标记为not null。有没有办法让它们不是not null?
发布于 2020-11-17 17:34:43
作为基准,这应该继承自你的Spark DataFrame。您可以使用df.printSchema()检查可空性。
就Postgres中列的可空性而言,我认为您需要在Postgres中创建表时(如果写入现有表)或在Spark JDBC选项和属性中指定这一点。这样,您就可以在您的属性中设置一个自定义模式,例如
# Specifying create table column data types on write
jdbcDF.write \
.option("createTableColumnTypes", "name CHAR(64), comments VARCHAR(1024)") \
.jdbc("jdbc:postgresql:dbserver", "schema.tablename",
properties={"user": "username", "password": "password"})在这里,您可以指定(如果JDBC允许的话)可空性,例如
option("createTableColumnTypes", "name CHAR(64) default null")或者,使用createSchema选项(不确定该选项是否适用于现有表,请查看您的append选项)-查看https://spark.apache.org/docs/latest/sql-data-sources-jdbc.html中的所有选项
或者,在Postgres中提前显式地创建具有特定模式(及其可空性)的表。
https://stackoverflow.com/questions/64869936
复制相似问题