论文中文索引:语音情感识别、情感语音合成、城市流量与 OD 需求预测、高光谱图像分类
每篇论文页面包含英文原题、中文摘要、要点、DOI/arXiv 链接、代码与可复制的 BibTeX 引用。
研究主题
- 面向人形机器人的语音情感识别与情感语音合成:两篇 2026 年 arXiv 论文分别覆盖情感语音的两个方向:识别语音中的情感(PhysioSER)与生成带情感的语音(DUET)。两者都采用即插即用设计,保持预训练模型冻结,并都部署在人形机器人上。
- 基于掩码与对比预训练的城市流量预测:城市流量预测根据历史流量预测城市各区域未来的流量,服务于出行规划、拥堵控制与公共安全。三篇论文围绕自监督时空预训练展开:MC-STL(CIKM 2023)结合掩码重建预训练与基于全局-局部交叉注意力的对比预训练;ST-FCL(Knowledge-Based Systems 2023)在时间视图与空间视图上分别做对比学习;MR-UFP(Neural Networks 2025)将时空随机掩码、对比预训练与多尺度区域分类辅助任务结合,在训练数据减少时依然表现稳健。
- 面向地铁与出租车的起讫点(OD)流量与需求预测:OD 预测估计站点或区域之间的出行流量或需求,支撑智能交通中的实时交通管理、车辆调度与资源分配。BiST-IF(Expert Systems with Applications 2025)针对 OD 流延迟问题,并利用到达 OD(Out-OD)流作为补充信号;DSTCN(Expert Systems with Applications 2026,开放获取)通过 Glstm2D、Simformer 与 FF-TM 三个模块建模动态耦合的时空模式,在 NYC-TOD2018、NYC-TOD2019 与 HZMetro 上评测。
- 高光谱图像分类:跨域小样本学习与超像素互增强:IEEE TGRS 上的两篇论文(Cao 等,2024;Cao 等,2025)研究高光谱图像分类:S3CFSL(2024)面向跨域小样本分类,引入特征去噪与语义增强域对齐;S2CMEN(2025)让超像素分割与分类相互增强以利用全局空间上下文,在 Indian Pines、Pavia University 与 Houston 上的总体精度分别为 97.38%、92.33% 与 91.38%。两篇论文的评测设置不同(S3CFSL 以 Chikusei 为源域、目标域每类 5 个标注样本;S2CMEN 在各数据集内部划分训练集与测试集),Houston 上的精度不可直接比较。
2026 年
扩散与流匹配 TTS 往往缺乏显式情感控制。本文发现情感是冻结隐状态中的线性可解码方向,与说话人身份近乎正交。DUET 在每个去噪步结合隐状态操控与梅尔谱空间引导(梯度经可微分声码器反传),无需重训模型。在 5 个冻结骨干、3 个数据集上,4 个骨干平均情感准确率超过全部 10 个有监督基线(ESD 上 75.5% 对 46.8%);主观情感恰当性最高,自然度低于 Qwen3-TTS。
关键词:情感语音合成;扩散模型语音合成;流匹配语音合成;隐状态操控;梅尔谱空间引导;可微分声码器
PhysioSER 是生理信息引导的语音情感识别方法:基于嗓音解剖与生理(VAP)提取对数幅度、谱通量、瞬时频率与群时延,嵌入四元数域并用 Hamilton 结构四元数卷积建模交互,经对比投影与对齐(CPA)与冻结自监督骨干的特征对齐后融合分类。CREMA-D 上以冻结 WavLM 为骨干时,加权准确率由 69.69% 升至 75.20%;已在 Ameca 人形机器人上实时部署。
关键词:语音情感识别;生理信息引导的嗓音表示;四元数神经网络;自监督学习;幅度与相位;人形机器人
准确的起讫点(OD)需求预测是智能交通系统的基础。本文提出动态时空相关网络 DSTCN,包含三个模块:双向需求趋势建模模块 Glstm2D 从起点与终点两个视角联合学习需求演化;基于 Transformer 的空间相似性模块 Simformer 动态提取并整合 OD 矩阵中的区域间相关性;特征融合与时间建模模块 FF-TM 融合多源时空特征,完成下一步预测。在 NYC-TOD2018、NYC-TOD2019 和 HZMetro 三个真实数据集上,DSTCN 均优于最先进基线:NYC-TOD2018 上 MAE 为 1.469,较最优基线降低 3.04%;HZMetro 上 10/30/60 分钟预测的 MAE 较最优基线降低 9.61%–11.79%。
关键词:OD 需求预测;时空建模;动态时空相关性;Transformer;图神经网络;智能交通系统
URMDet-SimFire 是面向火灾与烟雾的不确定性与可靠性感知多模态目标检测框架,结合 YOLOv8 风格视觉分支与热线索、环境传感器、烟雾扩散属性、文本场景先验四个非视觉模态。不确定性校准调整检测置信度,可靠性引导融合按噪声、缺失与跨模态一致性重加权各模态。实验仅在仿真器中完成:F1 由纯视觉基线 0.4348 升至 0.4638,ECE 未达最低。
关键词:火灾与烟雾检测;多模态融合;不确定性量化;可靠性学习;可信人工智能;目标检测
2025 年
S2CMEN(S²CMEN)通过超像素分割与分类的互增强,将像素间的全局空间相关性与光谱信息结合,用于高光谱图像分类。全局空间自适应模块 GSAM 由自适应光谱-超像素网络 ASSN 与图卷积网络 GCN 组成,自适应地导出超像素以捕获全局空间关系;空间-光谱融合模块 SSFM 用 Spectral-Swin Transformer 提取长程光谱特征,并与全局空间特征融合;互增强策略 MES 在统一损失约束下使超像素分割损失与分类损失相互促进。在 Indian Pines、Pavia University、Houston 上总体分类精度分别为 97.38%、92.33%、91.38%。
关键词:高光谱图像分类;超像素分割;特征融合;Transformer;图卷积网络;互增强
现有方法通常仅从城市流量中提取空间特征,数据量小或含噪时,空间特征敏感性成为瓶颈。MR-UFP先以时空随机掩码和时空对比学习预训练,挖掘时空异质性;再借助多尺度区域分类辅助任务,经联合损失使空间特征提取与流量预测互相增强,并以自适应环境融合和实时图处理关联区域与环境特征。在TaxiBJ和BikeNYC完整数据上优于13个基线(RMSE 14.32、4.45)。
关键词:城市流量预测;互增强学习;多尺度区域信息;多尺度区域分类;时空随机掩码预训练;时空对比学习
BiST-IF 用于智能交通系统中的起讫点(OD)流量预测,针对以往方法忽略 OD 流延迟、未关注到达 OD 流(Out-OD)补充作用的问题:先基于周期延迟概率与实时流量特征校正 OD 流;再用双向注意力模块融合时空特征得到初步预测;随后以 Out-OD 与 OD 流的互信息模块结合新的门控算法增强周期特征;最后融合周期模式与短时波动的预测结果。相比最佳基线,MAE/RMSE 平均降低 7.55%/7.31%(HZMetro)与 5.77%/2.33%(NYC-TOD2018)。
关键词:OD 流量预测;时空数据;双向注意力机制;交通预测;智能交通系统;OD 延迟校正
2024 年
复杂背景与光照变化等环境因素易导致番茄叶片病斑与背景混淆、小病斑信息难以提取。本文以 YOLOv4-tiny 为基础模型,在检测头中引入融合尺度、空间与任务感知注意力的 DyHead 模块,并以 Focaler-SIoU 替代默认的 CIoU 边框损失,加强对困难样本的学习。在 PlantDoc 番茄叶片数据(7 种病害加健康叶片)上,mAP 由基线的 83.31% 提升至 93.64%,单张图像检测耗时 0.0110 秒。
关键词:叶片病害识别;番茄病害检测;注意力机制;小目标检测;YOLOv4-tiny;DyHead
S3CFSL 用于跨域小样本高光谱图像分类:以空间与光谱双通道和跨空间-光谱 Transformer 提取特征,高斯滤波去噪后与原特征相加,并以语义增强域对齐提升分布一致性。以 Chikusei 为源域、每类 5 个标注样本,在 Pavia Centre、Salinas、Houston 上总体精度为 98.52%、88.79%、77.63%,高于八种对比方法。
关键词:高光谱图像分类;跨域小样本学习;域适应;分布对齐;特征去噪;语义增强域对齐
2023 年
城市流量预测对城市规划、管理与安全至关重要。现有方法对周期变化不敏感,也很少考虑相似功能区之间隐含的时空关联。ST-FCL(代码库名 ST-CSL)基于对比学习构建时间与空间视图提取模块:时间视图获取全局流量周期性的分布与变化,空间视图获取相似区域间隐含的流量变化关系;多视图融合与预测网络融合各视图表示及天气、节假日等外部因素。该方法在 TaxiBJ 与 BikeNYC 上取得最优预测性能,并在资源受限环境中有效。
关键词:城市流量预测;人群流量预测;对比学习;时空融合;多视图表示融合;多视图影响因素
现有城市流量预测方法大多未同时考虑空间与时间异质性。MC-STL 预训练两个编码器:ViT 编码器学习重建不同时刻被遮掩的区域,其注意力权重构成两层图卷积网络的邻接矩阵;全局-局部时空交叉注意力编码器学习时序对比任务。二者融合预测下一时刻流量,在 TaxiBJ 与 BikeNYC 六个评测集上均优于九个基线,完整 TaxiBJ 上 RMSE 为 14.53。
关键词:城市流量预测;时空预训练;时空随机遮掩;对比学习;图卷积网络(GCN);时空异质性