论文中文索引:语音情感识别、情感语音合成、城市流量与 OD 需求预测、高光谱图像分类

每篇论文页面包含英文原题、中文摘要、要点、DOI/arXiv 链接、代码与可复制的 BibTeX 引用。

研究主题

2026 年

DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech
Xu Zhang, Longbing Cao, Zhangkai Wu · arXiv:2606.00066 (2026)

扩散与流匹配 TTS 往往缺乏显式情感控制。本文发现情感是冻结隐状态中的线性可解码方向,与说话人身份近乎正交。DUET 在每个去噪步结合隐状态操控与梅尔谱空间引导(梯度经可微分声码器反传),无需重训模型。在 5 个冻结骨干、3 个数据集上,4 个骨干平均情感准确率超过全部 10 个有监督基线(ESD 上 75.5% 对 46.8%);主观情感恰当性最高,自然度低于 Qwen3-TTS。

关键词:情感语音合成;扩散模型语音合成;流匹配语音合成;隐状态操控;梅尔谱空间引导;可微分声码器

PhysioSER: Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition
Xu Zhang, Longbing Cao, Runze Yang, Zhangkai Wu · arXiv:2602.13259 (2026)

PhysioSER 是生理信息引导的语音情感识别方法:基于嗓音解剖与生理(VAP)提取对数幅度、谱通量、瞬时频率与群时延,嵌入四元数域并用 Hamilton 结构四元数卷积建模交互,经对比投影与对齐(CPA)与冻结自监督骨干的特征对齐后融合分类。CREMA-D 上以冻结 WavLM 为骨干时,加权准确率由 69.69% 升至 75.20%;已在 Ameca 人形机器人上实时部署。

关键词:语音情感识别;生理信息引导的嗓音表示;四元数神经网络;自监督学习;幅度与相位;人形机器人

DSTCN: Exploiting dynamic spatio-temporal correlations for origin-destination demand prediction
Yongshun Gong, Piao Yu, Xu Zhang, Xinxin Zhang, Xiushan Nie, Haoliang Sun · Expert Systems with Applications, vol. 299, article 130095 (2026)

准确的起讫点(OD)需求预测是智能交通系统的基础。本文提出动态时空相关网络 DSTCN,包含三个模块:双向需求趋势建模模块 Glstm2D 从起点与终点两个视角联合学习需求演化;基于 Transformer 的空间相似性模块 Simformer 动态提取并整合 OD 矩阵中的区域间相关性;特征融合与时间建模模块 FF-TM 融合多源时空特征,完成下一步预测。在 NYC-TOD2018、NYC-TOD2019 和 HZMetro 三个真实数据集上,DSTCN 均优于最先进基线:NYC-TOD2018 上 MAE 为 1.469,较最优基线降低 3.04%;HZMetro 上 10/30/60 分钟预测的 MAE 较最优基线降低 9.61%–11.79%。

关键词:OD 需求预测;时空建模;动态时空相关性;Transformer;图神经网络;智能交通系统

URMDet-SimFire: Trustworthy multimodal detection with uncertainty and reliability modeling for fire and smoke analytics
Zhonghua Dang, Xu Zhang · Array, vol. 31, article 101124 (2026)

URMDet-SimFire 是面向火灾与烟雾的不确定性与可靠性感知多模态目标检测框架,结合 YOLOv8 风格视觉分支与热线索、环境传感器、烟雾扩散属性、文本场景先验四个非视觉模态。不确定性校准调整检测置信度,可靠性引导融合按噪声、缺失与跨模态一致性重加权各模态。实验仅在仿真器中完成:F1 由纯视觉基线 0.4348 升至 0.4638,ECE 未达最低。

关键词:火灾与烟雾检测;多模态融合;不确定性量化;可靠性学习;可信人工智能;目标检测

2025 年

S2CMEN: A Mutually Enhancement Network for Superpixel Segmentation and Classification of Hyperspectral Image
Mengxin Cao, Yongmin Li, Xu Zhang, Guixin Zhao, Guohua Lv, Aimei Dong, Jinyong Cheng, Wei Li, Xiangjun Dong · IEEE Transactions on Geoscience and Remote Sensing, vol. 63, article 5524714 (2025)

S2CMEN(S²CMEN)通过超像素分割与分类的互增强,将像素间的全局空间相关性与光谱信息结合,用于高光谱图像分类。全局空间自适应模块 GSAM 由自适应光谱-超像素网络 ASSN 与图卷积网络 GCN 组成,自适应地导出超像素以捕获全局空间关系;空间-光谱融合模块 SSFM 用 Spectral-Swin Transformer 提取长程光谱特征,并与全局空间特征融合;互增强策略 MES 在统一损失约束下使超像素分割损失与分类损失相互促进。在 Indian Pines、Pavia University、Houston 上总体分类精度分别为 97.38%、92.33%、91.38%。

关键词:高光谱图像分类;超像素分割;特征融合;Transformer;图卷积网络;互增强

MR-UFP: Enhancing urban flow prediction via mutual reinforcement with multi-scale regional information
Xu Zhang, Mengxin Cao, Yongshun Gong, Xiaoming Wu, Xiangjun Dong, Ying Guo, Long Zhao, Chengqi Zhang · Neural Networks, vol. 182, article 106900 (2025)

现有方法通常仅从城市流量中提取空间特征,数据量小或含噪时,空间特征敏感性成为瓶颈。MR-UFP先以时空随机掩码和时空对比学习预训练,挖掘时空异质性;再借助多尺度区域分类辅助任务,经联合损失使空间特征提取与流量预测互相增强,并以自适应环境融合和实时图处理关联区域与环境特征。在TaxiBJ和BikeNYC完整数据上优于13个基线(RMSE 14.32、4.45)。

关键词:城市流量预测;互增强学习;多尺度区域信息;多尺度区域分类;时空随机掩码预训练;时空对比学习

BiST-IF: Enhancing origin–destination flow prediction via bi-directional spatio-temporal inference and interconnected feature evolution
Piao Yu, Xu Zhang, Yongshun Gong, Jian Zhang, Haoliang Sun, Junjie Zhang, Xinxin Zhang, Yilong Yin · Expert Systems with Applications, vol. 264, article 125679 (2025)

BiST-IF 用于智能交通系统中的起讫点(OD)流量预测,针对以往方法忽略 OD 流延迟、未关注到达 OD 流(Out-OD)补充作用的问题:先基于周期延迟概率与实时流量特征校正 OD 流;再用双向注意力模块融合时空特征得到初步预测;随后以 Out-OD 与 OD 流的互信息模块结合新的门控算法增强周期特征;最后融合周期模式与短时波动的预测结果。相比最佳基线,MAE/RMSE 平均降低 7.55%/7.31%(HZMetro)与 5.77%/2.33%(NYC-TOD2018)。

关键词:OD 流量预测;时空数据;双向注意力机制;交通预测;智能交通系统;OD 延迟校正

2024 年

Automatic visual recognition for leaf disease based on enhanced attention mechanism
Yumeng Yao, Xiaodun Deng, Xu Zhang, Junming Li, Wenxuan Sun, Gechao Zhang · PeerJ Computer Science, vol. 10, article e2365 (2024)

复杂背景与光照变化等环境因素易导致番茄叶片病斑与背景混淆、小病斑信息难以提取。本文以 YOLOv4-tiny 为基础模型,在检测头中引入融合尺度、空间与任务感知注意力的 DyHead 模块,并以 Focaler-SIoU 替代默认的 CIoU 边框损失,加强对困难样本的学习。在 PlantDoc 番茄叶片数据(7 种病害加健康叶片)上,mAP 由基线的 83.31% 提升至 93.64%,单张图像检测耗时 0.0110 秒。

关键词:叶片病害识别;番茄病害检测;注意力机制;小目标检测;YOLOv4-tiny;DyHead

S3CFSL: Spatial-Spectral–Semantic Cross-Domain Few-Shot Learning for Hyperspectral Image Classification
Mengxin Cao, Xu Zhang, Jinyong Cheng, Guixin Zhao, Wei Li, Xiangjun Dong · IEEE Transactions on Geoscience and Remote Sensing, vol. 62, article 5525315 (2024)

S3CFSL 用于跨域小样本高光谱图像分类:以空间与光谱双通道和跨空间-光谱 Transformer 提取特征,高斯滤波去噪后与原特征相加,并以语义增强域对齐提升分布一致性。以 Chikusei 为源域、每类 5 个标注样本,在 Pavia Centre、Salinas、Houston 上总体精度为 98.52%、88.79%、77.63%,高于八种对比方法。

关键词:高光谱图像分类;跨域小样本学习;域适应;分布对齐;特征去噪;语义增强域对齐

2023 年

ST-FCL: Spatio-temporal fusion and contrastive learning for urban flow prediction
Xu Zhang, Yongshun Gong, Chengqi Zhang, Xiaoming Wu, Ying Guo, Wenpeng Lu, Long Zhao, Xiangjun Dong · Knowledge-Based Systems, vol. 282, article 111104 (2023)

城市流量预测对城市规划、管理与安全至关重要。现有方法对周期变化不敏感,也很少考虑相似功能区之间隐含的时空关联。ST-FCL(代码库名 ST-CSL)基于对比学习构建时间与空间视图提取模块:时间视图获取全局流量周期性的分布与变化,空间视图获取相似区域间隐含的流量变化关系;多视图融合与预测网络融合各视图表示及天气、节假日等外部因素。该方法在 TaxiBJ 与 BikeNYC 上取得最优预测性能,并在资源受限环境中有效。

关键词:城市流量预测;人群流量预测;对比学习;时空融合;多视图表示融合;多视图影响因素

MC-STL: Mask- and Contrast-Enhanced Spatio-Temporal Learning for Urban Flow Prediction
Xu Zhang, Yongshun Gong, Xinxin Zhang, Xiaoming Wu, Chengqi Zhang, Xiangjun Dong · CIKM 2023, pp. 3298–3307

现有城市流量预测方法大多未同时考虑空间与时间异质性。MC-STL 预训练两个编码器:ViT 编码器学习重建不同时刻被遮掩的区域,其注意力权重构成两层图卷积网络的邻接矩阵;全局-局部时空交叉注意力编码器学习时序对比任务。二者融合预测下一时刻流量,在 TaxiBJ 与 BikeNYC 六个评测集上均优于九个基线,完整 TaxiBJ 上 RMSE 为 14.53。

关键词:城市流量预测;时空预训练;时空随机遮掩;对比学习;图卷积网络(GCN);时空异质性