📃题目:Unified Spatio-Temporal Tokens are Bases for Generalizable Traffic Forecasting
🖊️作者: 陈宇俊*(浙江大学)与涂世豪*(SUPCON),丁文越(SUPCON)、卢钇成(浙江大学)、任清凯(浙江大学)、郑杨杰(浙江大学),杨洋†(浙江大学)。
* 为共同第一作者,†为通讯作者。
🧾收录会议:KDD 2026
🔗论文链接:http://yangy.org/works/timeseries/KDD26_STUNet.pdf
🏫代码链接:https://github.com/JimmyChen6/STUNet

点击文末阅读原文跳转本文PDF链接
交通预测是智慧城市与智能交通系统的基石。然而,现有的时空预测模型在面临跨城市、跨路网的预测任务时,往往受限于时空耦合的训练机制而表现出较弱的泛化能力。来自浙江大学与SUPCON的团队提出 STUNet(Spatio-Temporal Unified Network)。该模型的核心思想在于:显式地将路网结构转化为空间 Token,将时间序列转化为时间 Token,解耦空间结构提取与时间动态学习,从而达到比现有方法更优的泛化表现。
交通数据本质上是部署在复杂路网上的多变量时间序列,具有极强的空间依赖性。同时,尽管不同城市的宏观路网千差万别,但其底层物理组件(如 Y 形路口、环岛、立交桥)是高度通用的。这意味着,如果模型能够学习到这些基础空间组件的通用表示,理论上就能实现跨城市的泛化预测,极大降低新城市的部署成本。
然而,在实际应用中,实现这一目标面临两大核心挑战:
围绕时空预测,现有方法主要分为以下两类范式:
图1:STUNet示意图
STUNet 主要分为三个阶段,通过四个核心组件协同完成:
为了确保空间建模的纯粹性并增强泛化能力,整个框架采用了两阶段训练策略,实现了时空学习的解耦。
空间编码器:显式建模关系图的结构。将邻接矩阵 划分为非重叠块 ,并利用 MLP 将其映射为空间 token 。这种分块处理有效地保留了邻接矩阵的结构信息,同时显著降低了点对点建模带来的计算复杂度。
时间编码器:将输入的多变量时间序列 分割为时间块 ,并映射为时间 token 。
为了融合源自不同模态、具有不同语义含义的时空 token,我们设计了查询-聚合注意力机制,将复杂的时空融合操作解耦为两个简单的步骤:
为了在注意力机制中保持位置信息的有效性,我们设计了专门的旋转位置编码策略:
编码器的输出质量对模型性能至关重要。若采用传统的端到端训练,空间信息的学习往往会受到时间动态的干扰。因此,我们采用了两阶段训练方案:
这种解耦训练策略确保了空间表示能够纯粹地反映空间结构,而不受时间波动的干扰,从而显著增强了模型的跨网络泛化能力。
实验覆盖了 4 个交通流预测数据集(SD、GBA、GLA、CA)以及 3 个交通速度预测数据集(METR-LA、PEMS-BAY、SZ-TAXI),涵盖不同城市区域和交通场景。每个数据集的采样间隔均为15分钟。在数据划分方面,SD、GBA、GLA、CA 和 SZ-TAXI 采用 6:2:2 的划分比例,METR-LA 和 PEMS-BAY 采用 7:1:2 的划分比例。每个样本包含连续 24 个时间片,利用过去 12 个时间片的历史交通信息预测未来 12 个时间片的交通状态。预测性能采用 MAE、RMSE 和 MAPE 三项指标进行衡量。

图2:数据集信息
在 6 个跨城市交通数据集上进行 zero-shot 泛化实验:模型仅在单一数据集上训练收敛,随后直接迁移至未见数据集测试。结果表明,STUNet 在所有交通流与交通速度零样本预测场景中均取得最佳表现,相比现有方法展现出更强的跨场景泛化能力。STUNet的泛化能力来源于以下原因:

图3:交通流量零样本预测能力对比

图4:交通速度零样本预测能力对比
在 4 个真实交通预测数据集和多个预测时间跨度上,STUNet 与现有 SOTA 方法进行了全面比较。实验结果表明,STUNet 在整体预测精度上达到领先水平,并在所有数据集和预测基线上均取得最佳 RMSE 表现。这说明:

图5:预测能力对比
在三个数据集上的消融实验验证了 STUNet 各核心设计的有效性。结果表明:

图6:消融实验
与现有的方法相比, STUNet 的训练和推理效率较高。

图7:效率实验

图8:超参数实验
本文提出 STUNet,一种面向交通预测的时空统一建模框架。通过空间 tokenizer 学习稳定的空间表示,并结合 query-aggregate attention 实现空间与时间信息的高效融合,STUNet 有效提升了模型的预测精度、zero-shot 泛化能力和计算效率。
这一显式时空解耦的建模范式,为构建更加鲁棒、可扩展的智能交通系统提供了新的思路。