首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >KDD 2026 | SUPCON × 浙大提出统一时空Tokens,夯实可泛化交通预测基础

KDD 2026 | SUPCON × 浙大提出统一时空Tokens,夯实可泛化交通预测基础

作者头像
时空探索之旅
发布2026-07-27 21:32:10
发布2026-07-27 21:32:10
190
举报
文章被收录于专栏:时空探索之旅时空探索之旅

📃题目:Unified Spatio-Temporal Tokens are Bases for Generalizable Traffic Forecasting

🖊️作者陈宇俊*(浙江大学)与涂世豪*(SUPCON),丁文越(SUPCON)、卢钇成(浙江大学)、任清凯(浙江大学)、郑杨杰(浙江大学),杨洋†(浙江大学)。

* 为共同第一作者,为通讯作者。

🧾收录会议:KDD 2026

🔗论文链接http://yangy.org/works/timeseries/KDD26_STUNet.pdf

🏫代码链接https://github.com/JimmyChen6/STUNet

点击文末阅读原文跳转本文PDF链接

摘要

交通预测是智慧城市与智能交通系统的基石。然而,现有的时空预测模型在面临跨城市、跨路网的预测任务时,往往受限于时空耦合的训练机制而表现出较弱的泛化能力。来自浙江大学与SUPCON的团队提出 STUNet(Spatio-Temporal Unified Network)。该模型的核心思想在于:显式地将路网结构转化为空间 Token,将时间序列转化为时间 Token,解耦空间结构提取与时间动态学习,从而达到比现有方法更优的泛化表现。

研究背景及相关工作

研究背景

交通数据本质上是部署在复杂路网上的多变量时间序列,具有极强的空间依赖性。同时,尽管不同城市的宏观路网千差万别,但其底层物理组件(如 Y 形路口、环岛、立交桥)是高度通用的。这意味着,如果模型能够学习到这些基础空间组件的通用表示,理论上就能实现跨城市的泛化预测,极大降低新城市的部署成本。

然而,在实际应用中,实现这一目标面临两大核心挑战:

  1. 结构信息的无损映射:如何在不丢失拓扑细节的前提下,将非固定规模、非规则分布的传感器网络映射到统一的特征空间?
  2. 时空语义的深度融合:空间表示(源于路网结构)与时间表示(源于序列动态)在语义空间上是错位的,如何在融合时不产生相互干扰?

相关工作

围绕时空预测,现有方法主要分为以下两类范式:

  1. 隐式图空间建模:主要包含时空图神经网络(如 DCRNN, STGCN 等)和时空Transformer(如PatchTST, iTransformer等)两类,通过节点之间的关系强弱作为信息传播的依据,聚合信息后进行预测。这些方法能够很好地捕捉交通数据时空特性,但是受制于时空耦合的训练机制,在泛化性上效果不佳。
  2. 图无关空间建模:如STID, CMuST等,通过节点嵌入来建模空间关系。这类方法能够降低计算复杂的,但是在场景变化时需要重新训练节点嵌入,缺乏跨网络的泛化能力。

主要贡献

  1. 显式的空间 token 化策略:提出了一种交通预测中的空间信息显式 token 化策略,解决了空间信息建模中的泛化性挑战。空间编码器将邻接矩阵划分为块,从而将空间信息转换为统一表示。
  2. 查询-聚合注意力:设计了查询-聚合注意力机制,利用精心设计的位置编码确保信息融合过程中相对位置的有效性,实现了空间和时间信息的有效整合。
  3. 全面实验验证:7个公开交通数据集覆盖全球多个城市。实验证明 STUNet 在不同网络上均实现了更优的泛化性能,同时拥有与现有方法相当的预测精度。

研究方法

整体框架总览

图1:STUNet示意图
图1:STUNet示意图

图1:STUNet示意图

STUNet 主要分为三个阶段,通过四个核心组件协同完成:

  1. 时空编码阶段:原始输入数据被分别送入空间编码器和时间编码器。空间编码器将路网关系图转化为离散的空间 token,而时间编码器则将多变量时间序列切分为时间 token。
  2. 时空融合阶段:这是模型的主干部分,采用查询-聚合注意力机制。在该阶段,空间与时间 token 在统一的表示空间中进行交互,通过模拟查询与聚合操作,异步地提取并融合复杂的时空依赖特征。
  3. 预测输出阶段:融合后的时空表示被送入预测头,最终生成未来的交通预测值。

为了确保空间建模的纯粹性并增强泛化能力,整个框架采用了两阶段训练策略,实现了时空学习的解耦。

空间与时间编码器

空间编码器:显式建模关系图的结构。将邻接矩阵 划分为非重叠块 ,并利用 MLP 将其映射为空间 token 。这种分块处理有效地保留了邻接矩阵的结构信息,同时显著降低了点对点建模带来的计算复杂度。

时间编码器:将输入的多变量时间序列 分割为时间块 ,并映射为时间 token 。

查询-聚合注意力机制

为了融合源自不同模态、具有不同语义含义的时空 token,我们设计了查询-聚合注意力机制,将复杂的时空融合操作解耦为两个简单的步骤:

  1. 查询操作:通过识别对当前节点预测有益的节点位置来模拟查询过程。
  2. 聚合操作:在查询的基础上,聚合来自相关传感器的时空信息,完成一次时空依赖的交互。

为了在注意力机制中保持位置信息的有效性,我们设计了专门的旋转位置编码策略:

  1. 查询时间位置编码:
  2. 聚合时间位置编码:
  3. 空间位置编码:

训练策略

编码器的输出质量对模型性能至关重要。若采用传统的端到端训练,空间信息的学习往往会受到时间动态的干扰。因此,我们采用了两阶段训练方案:

  1. 第一阶段:利用自动编码器(autoencoder)分别独立预训练空间和时间编码器。
  2. 第二阶段:将预训练的编码器集成到主干网络进行联合训练,并冻结空间编码器的参数。

这种解耦训练策略确保了空间表示能够纯粹地反映空间结构,而不受时间波动的干扰,从而显著增强了模型的跨网络泛化能力。

实验验证与结果分析

数据集与实验设置

实验覆盖了 4 个交通流预测数据集(SD、GBA、GLA、CA)以及 3 个交通速度预测数据集(METR-LA、PEMS-BAY、SZ-TAXI),涵盖不同城市区域和交通场景。每个数据集的采样间隔均为15分钟。在数据划分方面,SD、GBA、GLA、CA 和 SZ-TAXI 采用 6:2:2 的划分比例,METR-LA 和 PEMS-BAY 采用 7:1:2 的划分比例。每个样本包含连续 24 个时间片,利用过去 12 个时间片的历史交通信息预测未来 12 个时间片的交通状态。预测性能采用 MAE、RMSE 和 MAPE 三项指标进行衡量。

图2:数据集信息
图2:数据集信息

图2:数据集信息

泛化能力比较

在 6 个跨城市交通数据集上进行 zero-shot 泛化实验:模型仅在单一数据集上训练收敛,随后直接迁移至未见数据集测试。结果表明,STUNet 在所有交通流与交通速度零样本预测场景中均取得最佳表现,相比现有方法展现出更强的跨场景泛化能力。STUNet的泛化能力来源于以下原因:

  1. 显式空间建模避免了时间动态对空间关系学习的干扰,使模型能够捕获更加稳定、可迁移的空间模式;
  2. 时空因素的有效解耦增强了模型鲁棒性,使 STUNet 在面对未知数据分布时仍保持领先性能。
图3:交通流量零样本预测能力对比
图3:交通流量零样本预测能力对比

图3:交通流量零样本预测能力对比

图4:交通速度零样本预测能力对比
图4:交通速度零样本预测能力对比

图4:交通速度零样本预测能力对比

预测性能

在 4 个真实交通预测数据集和多个预测时间跨度上,STUNet 与现有 SOTA 方法进行了全面比较。实验结果表明,STUNet 在整体预测精度上达到领先水平,并在所有数据集和预测基线上均取得最佳 RMSE 表现。这说明:

  1. STUNet 能够准确地捕获复杂交通时空变化规律,在不同预测尺度下保持稳定性能。
  2. RMSE 指标上的持续优势表明,STUNet 对大幅度交通波动具有更强的预测能力,尤其适用于早晚高峰等关键交通场景。
图5:预测能力对比
图5:预测能力对比

图5:预测能力对比

消融实验

在三个数据集上的消融实验验证了 STUNet 各核心设计的有效性。结果表明:

  1. 空间 token 与空间 tokenizer 的设计能够提供关键空间先验,避免时间动态干扰空间模式学习。
  2. Query-aggregate attention 有效解决了空间与时间 token 语义空间不一致的问题,实现高效时空交互。
  3. 矩阵增强提升了空间表示的丰富性,而与预测任务一致的预训练策略能够学习更具任务相关性的时间表示。
图6:消融实验
图6:消融实验

图6:消融实验

效率对比

与现有的方法相比, STUNet 的训练和推理效率较高。

图7:效率实验
图7:效率实验

图7:效率实验

超参数敏感性

  1. 模型的维度存在天花板效应,当维度足够用于表示时空信息时,增加维度无法带来明显的性能提升。
  2. 对于更大更复杂的交通网络,需要更大的层数来融合时空信息。
  3. 在模型维度足够的情况下,空间块的大小对于性能影响不显著。
图8:超参数实验
图8:超参数实验

图8:超参数实验

总结

本文提出 STUNet,一种面向交通预测的时空统一建模框架。通过空间 tokenizer 学习稳定的空间表示,并结合 query-aggregate attention 实现空间与时间信息的高效融合,STUNet 有效提升了模型的预测精度、zero-shot 泛化能力和计算效率。

这一显式时空解耦的建模范式,为构建更加鲁棒、可扩展的智能交通系统提供了新的思路。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-26,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 时空探索之旅 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 摘要
  • 研究背景及相关工作
    • 研究背景
    • 相关工作
    • 主要贡献
  • 研究方法
    • 整体框架总览
    • 空间与时间编码器
    • 查询-聚合注意力机制
    • 训练策略
  • 实验验证与结果分析
    • 数据集与实验设置
    • 泛化能力比较
    • 预测性能
    • 消融实验
    • 效率对比
    • 超参数敏感性
  • 总结
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档