我正在尝试从sqlserver读取表,并在读取时应用分区。在读取数据之前,我希望获得lowerBound和upperBound的界限,如下所示。
boundsDF = spark.read.format('jdbc')
.option('url', 'url')
.option('driver', 'com.microsoft.sqlserver.jdbc.SQLServerDriver')
.option('user', username)
.option('password', password)
.option('dbtable', f'(select min(updated_datetime) as mint, max(updated_datetime) as maxt from tablename)
.load()我从boundsDF中提取了如下值:
maxdate = [x["maxt"] for x in boundsDF.rdd.collect()]
mindate = [x["mint"] for x in boundsDF.rdd.collect()]下面是我在读取时指定时间戳列的方式:
dataframe = spark.read.format('jdbc')
.option('url', url)
.option('driver', 'com.microsoft.sqlserver.jdbc.SQLServerDriver')
.option('user', user)
.option('password', password)
.option('dbtable', tablename)
.option('partitionColumn', timestamp_column)
.option('numPartitions', 3)
.option('lowerBound', mindate[0])
.option('upperBound', maxdate[0])
.option('fetchsize', 5000)
.load()如果我打印mindate和maxdate的值,如下所示:
mindate[0]: datetime.datetime(2010, 10, 4, 11, 54, 13, 543000)
maxdate[0]: datetime.datetime(2021, 3, 5, 17, 59, 45, 880000)当我打印dataframe.count()时,我看到一个异常消息,如下所示。例外:
org.apache.spark.SparkException: Job aborted due to stage failure: Task 2 in stage 18.0 failed 1 times, most recent failure: Lost task 2.0 in stage 18.0 (TID 21, executor driver): com.microsoft.sqlserver.jdbc.SQLServerException: Conversion failed when converting date and/or time from character string.自从我开始使用Spark以来,我一直使用整数列作为我的分区列。这是我第一次使用时间戳列对数据进行分区。
在我的read语句中,mindate和maxdate的格式是否正确?有人能让我知道我是否以正确的方式实现了代码吗?
发布于 2021-03-08 16:40:14
问题是在SQL表中使用什么数据类型?
的小数位数限制为0到7
下面是两句话:
DATETIME2比DATETIME更精确,因为DATETIME被限制为3毫秒,这会导致某些查询被错误地解释
https://stackoverflow.com/questions/66490720
复制相似问题