ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Multi-Modal Time Series Prediction via Mixture of Modulated Experts——通过调制专家混合实现多模态时间序列预测

2026/9/25 18:01:01 拓冰建站 浏览量
Multi-Modal Time Series Prediction via Mixture of Modulated Experts——通过调制专家混合实现多模态时间序列预测 《Multi-Modal Time Series Prediction via Mixture of Modulated Experts》提出了一种名为MoMEMixture of Modulated Experts调制专家混合的新框架用于多模态时间序列预测MMTSP。其核心思想是用文本等辅助模态信号直接调制时间序列MoE模型中专家的路由和计算而不是在词元层面进行跨模态融合。以下是对全文主要研究内容的全面总结概括一、研究背景与问题1. 时间序列预测的挑战现实世界的时间序列如股票价格、空气质量、天气等具有复杂、动态、非平稳的特性仅靠历史数值序列往往不足以准确预测未来变化。外部文本信息如新闻报道、财务报告能提供额外的预测线索。2. 现有多模态时间序列预测MMTSP的局限大多数MMTSP方法采用词元级融合token-fusion将时间片段temporal patches与语言词元投影到共享嵌入空间后进行融合再输入预训练LLM主干。但已有研究发现这类方法并不总能优于单模态基线。作者认为原因有三高质量时间-文本配对稀缺文本常含噪声或与时间信号无关文本描述区分度不足难以捕捉相似时间序列间的细微差异时间序列词元高度异质值域无界、强非平稳、样本间差异大导致跨模态对齐困难。3. MoE的潜力与不足专家混合MoE在时间序列建模和多模态学习中已展现效果但现有基于MoE的多模态集成方法仍依赖词元级融合未充分发挥MoE在专家层面的选择性控制能力。二、核心贡献论文的主要贡献可概括为三点提出专家调制Expert Modulation机制一种新的MMTSP集成方式通过调制MoE框架内的专家路由和专家计算来整合时间与文本信号替代传统的词元融合。建立MoE分解视角并给出理论分析从理论上刻画了专家调制在多模态集成中的表达能力证明其严格强于聚合后特征调制。验证方法的通用性与有效性在多种主干架构和多个数据集上取得稳健提升优于代表性基线。三、方法MoME框架1. 理论基础引理4.1MLP分解任意单层MLP可等价分解为多个子MLP专家之和建立了稠密MLP与MoE之间的联系。定理4.2稀疏MoE的选择性截断Top-K稀疏路由可视为对专家贡献的选择性截断截断误差有界。该定理说明稀疏路由并非简单丢弃无信息专家而是有选择地抑制部分专家贡献。定理4.3专家调制的表达能力聚合后特征调制只能变换已混合的表示而专家调制保留对单个专家分量的访问可在聚合前对不同专家施加不同上下文相关变换。因此专家调制诱导的函数类严格包含聚合后特征调制。2. MoME的三个组件步骤1上下文词元蒸馏用LLM编码文本通过线性投影得到文本表示H。采用受BLIP-2启发的基于查询的交叉注意力用m个可训练查询向量从H中蒸馏出紧凑的上下文词元Z。池化得到单一条件向量z用于后续调制。步骤2路由器调制Router Modulation, RM在时间路由器初始分数g(x)上注入上下文相关偏移g(x|z) g(x) κ·σ(W_G z)文本信号改变专家选择和混合权重κ控制调制强度。在Top-K专家上重新归一化路由系数。步骤3专家独立线性调制EiLM为每个专家生成专家特定的缩放和偏置I_i^γ(z) w_i^T zI_i^β(z) W_i z调制专家输出f_i(x|z) I_i^γ(z)·f_i(x) I_i^β(z)最终输出MoME(x|z) Σ λ_i g_i(x|z) f_i(x|z)关键特点文本信号不直接与时间词元交互而是通过调制专家行为进入MoE避免了在共享嵌入空间中对齐时间与文本词元的困难。3. 复杂度分析MoME的LLM后总体复杂度为O((Mm)d² mMd NEd NKd\bar{d} Ed²)对于小固定m简化为O(Md² NEd NKd\bar{d} Ed²)。由于m≪N且E较小额外计算成本适中远低于直接时间-文本交叉注意力的O((NM)d² NMd)。4. 不同主干上的实例化MoME基于MLP的主实例时间序列分片专家为MLP。MMLinear轻量级线性变体直接处理全序列。MiTransformeriTransformer的多模态扩展用MoME模块替换FFN块。四、实验设计与结果1. 实验设置主要基准MT-Bench天气、金融领域文本与时间序列对齐较好。补充数据集Time-IMMILINet、EPA-Air、GDELT、Time-MMD半合成。单模态基准7个UMTSP数据集ETT、Electricity、Traffic等。基线不使用外部文本PatchTST、iTransformer、TS-Mixer、DLinear、Time-MoE、GPT4TS、Time-LLM。使用外部文本MLP(MoE)LM、TimeMoELM、DLinearPLM词元融合基线。LLMQwenMoE_A2.7B最大文本长度2048。硬件单张NVIDIA RTX A6000 (48GB)。2. 主要结果1单通道预测MoME在金融趋势预测上提升尤为显著如3-way准确率从48.9%提升至66.8%提升17.5%。在多数预测任务上具有竞争力或更优。文本信息对趋势/方向性信号的帮助大于精确数值预测因为文本报告通常是粗粒度的更适合粗分辨率目标。2多通道设置采用通道独立策略文本信息跨通道共享。MoME持续优于大多数基线但提升幅度较温和因为部分预测信号已通过通道间交互捕获。3消融实验比较三种主干MoME、MMLinear、MiTransformer在三种设置下w/o EM纯单模态基线无文本输入w/EiLM仅通过专家独立线性调制引入文本w/EM完整专家调制EiLM RM。结果显示EiLM在大多数单模态基线上持续提升加入RM后在67%的场景中进一步提升。MoME尽管使用简单时间序列主干常优于MiTransformer说明有效的跨模态集成可显著提升预测性能无需高度复杂的时间序列架构。4超参数分析稀疏专家激活较小K通常优于稠密激活与定理4.2的选择性计算动机一致。中等数量的上下文词元表现最佳需在保留语义线索和避免冗余之间权衡。5不同LLM主干跨不同LLM主干MoME始终优于PatchTST基线。性能不随模型规模单调增长最小模型Qwen3.5-4B在金融预测上最佳中等模型在天气预测和金融趋势上最佳最大模型在天气趋势上最佳。说明MoME对LLM选择稳健效果并非简单由模型规模驱动。6与词元融合策略比较比较5种词元融合变体早期融合拼接、交叉注意力晚期融合加法、拼接、交叉注意力。MoME在8个任务中的7个取得最佳性能训练每迭代速度显著更快内存消耗与简单融合方法相当远小于基于交叉注意力的基线。3. 路由模式分析MoME保留了MoE的专家专业化特性相似幅度的时间词元路由到相似专家子集形态模式如V形、下降形也决定专家选择。专家调制不破坏MoE的内在专业化优势而是与之互补。4. 多模态的作用案例研究成功案例财务报告负面信号时单模态MoE错误预测上涨启用专家调制后正确预测下跌趋势MAPE降低近50%。另一案例中报告暗示短期动量与中期稳定专家调制模型预测近乎平坦轨迹与报告解读一致。失败案例当报告过度乐观但实际未来下跌时所有模型均受误导预测上涨当报告信号矛盾时模型预测不确定。说明当前框架在强误导性或矛盾文本信号下仍有局限。五、结论与未来工作结论提出MoME将跨模态交互从传统词元融合转向专家调制。在广泛预测和趋势任务上优于强单模态和多模态基线。专家调制是集成模态信息的有效机制。局限与未来方向单向调制限制当前仅允许LLM文本信号调制时间序列专家未来可扩展到反向允许时间信号影响LLM专家实现时间序列推理和问答。多模态扩展专家调制原则不限于时间序列和文本可通过引入额外调制路径和联合条件化专家行为自然推广到多于两种模态的场景。更广泛的多模态学习系统专家调制有望成为未来多模态学习系统的基础构建模块。六、核心创新点总结维度传统词元融合MoME专家调制交互层面表示层词元级函数层专家级跨模态对齐要求需在共享嵌入空间对齐无需对齐直接调制专家结构聚合后丢失聚合前保留可独立调制表达能力较弱定理4.3严格更强计算效率交叉注意力成本高成本适中训练更快文本作用混合表示调控路由专家计算MoME通过让文本信号直接调制时间序列MoE模型中的专家路由和专家计算绕开了词元级融合的对齐难题在理论和实验上均证明其表达能力和预测性能优于传统融合方法为多模态时间序列预测提供了新范式。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要现实世界的时间序列呈现出复杂且不断演变的动态特征这使得准确预测极具挑战性。近期的多模态预测方法利用新闻报告等文本信息来改进预测但大多数方法依赖于词元级融合token-level fusion即在共享嵌入空间中将时间片段与语言词元混合。然而当高质量的时间-文本配对稀缺且时间序列在特征上表现出显著差异时这种融合可能并不适用从而使跨模态对齐变得复杂。与此同时专家混合MoE架构已被证明在时间序列建模和多模态学习中均有效但许多现有的基于MoE的模态集成方法仍然依赖词元级融合。为解决这一问题我们提出了专家调制Expert Modulation这是一种用于多模态时间序列预测的新机制它以文本信号为条件来同时调控路由routing和专家计算expert computation从而实现对专家行为的直接且高效的跨模态控制。通过理论分析和实验我们提出的方法在多模态时间序列预测中展现出显著改进。1 引言时间序列预测在众多领域中发挥着关键作用包括能源Koprinska等2018Obst等2021、交通Alghamdi等2019Ji等2023、天气Freeman等2018Lam等2023、金融Yin等2021Ni Xu2023以及许多其他领域。传统的时间序列模型从ARIMAZhang2003等统计方法到深度学习架构包括MLPZeng等2023Chen等2023、基于CNN的网络Wu等2023LIU等2022、RNN风格的网络Rangapuram等2018Hewamalage等2021以及TransformerLiu等2022Zhou等2022Liu等2024b已在不同领域取得了成功。最近受专家混合MoE架构在大语言模型LLM中有效性的启发DeepSeek-AI等2025Yang等2025若干研究Shi等2025Liu等2025c将MoE引入时间序列建模并取得了有前景的性能提升。上述方法的一个共同特征是它们仅使用历史序列进行预测。为此它们在建模现实场景中的时间序列时通常表现不佳例如股票价格Ariyo等2014Mehtab Sen2020和空气质量Zaini等2022在这些场景中仅靠时间序列信号可能不足以充分捕捉未来变化。在实践中外部文本信息源如新闻报道提供了时间历史本身所不具备的额外预测线索Wang等2024。这激发了将辅助模态纳入时间序列模型的日益增长的兴趣这一任务被称为多模态时间序列预测MMTSP。大多数MMTSP模型构建在常见的多模态学习框架内Alayrac等2022Li等2023Liu等2023它们在联合潜在空间中融合文本词元和时间序列词元通常是时间片段并将融合后的嵌入输入预训练的LLM主干随后接下游回归或分类头进行预测Jin等2024ab我们将这一机制称为词元融合token-fusion。然而最近的一项工作Zhang等2025b系统评估了多种常见融合策略包括在不同融合位置早期、中期和晚期融合的聚合加法、拼接和投影MLP、残差发现基于这些方案构建的MMTSP模型并不能始终优于其单模态基线。这表明传统的跨模态交互方法并未充分利用文本信号中的互补信息。为了更好地理解这一局限性我们借鉴先前研究Liu等2013Neubauer Filzmoser2024认为有三个可能的原因解释了这一观察结果。第一高质量的时间-文本配对有限文本对应物通常带有噪声或包含与底层时间信号大量无关的信息。第二文本描述可能不足以区分相似时间序列之间的细微差异导致融合模糊或不准确。第三时间序列词元本身表现出高度异质性无界的值域、强非平稳性以及样本间的显著差异使得时间词元和文本词元的融合极具挑战性。这些观察结果对词元级融合在MMTSP中的适用性提出了质疑引出了这样一个问题这种方法能否充分建模跨模态交互还是时间序列和文本需要不同的集成机制为回答这一问题我们从现实世界的决策系统中汲取灵感在这些系统中专业专家会根据历史观测之外的辅助信息调整其行为例如流行病学家结合感染轨迹和疫苗接种报告来做出预测。受此原则启发我们提出了调制专家混合Mixture-of-Modulated-Experts, MoME这是一个通过专家调制实现跨模态交互的框架其中非时间信号直接调制时间专家的计算。与在表示层面集成模态的词元级融合方法不同MoME直接将辅助信息注入专家计算中如图1所示。图1大语言模型生成调制信号这些信号同时调控时间序列MoE模型中的路由和专家计算从而实现对时间专家的跨模态控制。我们总结主要贡献如下(i) 我们提出了专家调制Expert Modulation这是一种用于MMTSP的新机制通过在MoE框架内调制专家路由和计算来集成时间信号和文本信号为多模态学习提供了一种有原则的词元融合替代方案。(ii) 我们发展了MoE的分解视角并从理论上刻画了专家调制在多模态集成中的表达能力。(iii) 我们证明了我们的方法在不同主干架构上用于多模态时间序列预测的通用性和有效性相较于代表性基线取得了稳健的改进。2 相关工作基于MoE的时间序列预测。MoEJacobs等1991已成为深度学习模型中的关键架构设计Lepikhin等2021Fedus等2022在现代LLM中展现出强大的性能和效率DeepSeek-AI等2025Yang等2025。近期研究探索了MoE在时间序列模型中的应用成功开发了小规模全样本模型Ni等2024Sun等2025和大规模零样本基础模型Shi等2025Liu等2025c。然而大多数研究主要关注MoE在单模态时间序列预测UMTSP中的潜力。多模态时间序列预测。根据Zhang等2026现有的MMTSP研究可大致分为两个方向。(i)自衍生视图其中额外模态从时间序列本身构建例如将数值序列转换为图像Liu等2025bZhang等2025aShen等2025Zhong等2025或从时间观测生成文本描述和提示Yu等2023Liu等2025a随后与语言或视觉-语言模型进行跨模态学习。(ii)外部信息视图其中纳入自然可用的文本信息如新闻报道以提供互补预测信号Jin等2024aJiang等2025。后一类中的大多数方法依赖词元融合如拼接或交叉注意力来建立时间表示和文本表示之间的交互Sun等2024wang等2025Quinlan等2026Zhang等2025bWu等2026Lee等2026。另一条工作线主要将预训练LLM用作时间序列的表达性序列编码器Zhou等2023Chang等2025Tan等2024而未明确纳入辅助模态进行多模态集成。基于MoE的多模态学习。MoE已被广泛探索用于多模态学习Bao等2022Shen等2023。一种常见设计为不同模态分配独立的、模态特定的参数例如模态特定专家这已被证明有利于深层架构Wang等2023。更近期的方法引入模态感知路由或在每个MoE层内将专家组织为模态特定的池Han等2024Lin等2024Lei等2025。这些方法中的跨模态交互仍然在词元表示层面进行然而我们的方法在专家函数层面操作。3 预备知识3.1 多模态时间序列3.2 专家混合4 调制专家混合基于上述内容我们首先发展MoE的分解视角。在此基础上我们引入核心思想多模态交互可以通过允许外部信号直接调制MoE框架内的专家行为来实现。然后我们提出MoME一个通过多个组件实例化这一原则的统一框架。4.1 专家分解与选择性聚合为激发我们提出的多模态交互我们首先重新审视MoE模型的结构。我们表明标准前馈变换自然允许专家级分解而MoE在此基础上通过选择性控制单个专家的贡献来构建。这一性质与时间序列建模特别相关。现实世界的时间序列通常表现出异质的局部动态和观测噪声因此并非每个计算分量对每个输入信号都同等有用。因此稀疏专家选择提供了一种架构机制用于使活跃变换集合适应当前时间模式。受此启发我们考察稀疏专家激活是否对时间序列预测有用。如图2所示详见附录B纳入稀疏MoE通常能在不同稠密主干和预测设置中提升性能。这一观察激发了多模态设置中的一个自然问题如果选择性控制专家贡献对时间序列建模有益那么辅助信息能否进一步指导哪些专家分量应对预测做出贡献我们通过专家调制来回答这一问题。图2将稀疏MoE纳入不同时间序列预测主干后的相对改进。正值表示相对于原始稠密主干的性能提升。4.2 从选择性专家聚合到专家调制这正是稀疏MoE所建议保留的结构。如果在聚合之前专家级选择性是有用的那么辅助信息可以自然地与模型交互同时这种分解仍然可访问而不仅仅是在单个专家贡献被混合之后。因此我们引入专家调制Expert Modulation它以MoE计算的两个互补方面为条件哪些专家做出贡献路由以及每个专家如何贡献专家计算。图3(a)词元融合方法其中Fuse(1)和Fuse(2)表示可能执行融合的位置。(b)专家调制方法。(c)EiLM和RM的几何直觉。其中 A(z) 表示上下文条件的Top-K专家集。这一公式将选择性专家聚合的原则从单模态扩展到多模态设置。在这一公式下时间信号和文本词元共同决定一个专家是否贡献以及被激活的专家如何贡献。这种方法的一个好处是辅助模态可以直接影响专家级计算而不需要时间词元和文本词元在共享嵌入空间中对齐。辅助信息进入MoE计算的位置差异也导致了模型表达能力的差异。聚合后特征调制只能变换已经混合的表示而专家调制保留对单个专家分量的访问并可以在聚合前对它们进行不同条件化。因此专家调制可以表示聚合后特征调制无法访问的跨模态交互如下所述。4.3 调制专家混合我们现在将专家调制原则集成到基于MoE的时间序列模型中。所得模型MoME由三个组件组成。第一交叉注意力用于将原始文本词元蒸馏为紧凑的上下文词元。第二路由器调制Router Modulation, RM使用蒸馏信息调整时间路由器的分数从而改变专家选择和混合权重。第三专家独立线性调制Expert-independent Linear Modulation, EiLM使用相同的上下文通过专家特定的仿射变换调制每个选定的专家输出。图3(a)描述了传统的词元融合方法(b)展示了所提出的MoME框架(c)提供了RM和EiLM的几何解释。在这一设计中文本信号不直接与时间词元交互。相反它们通过逐专家的仿射变换和上下文条件路由调制专家行为来进入MoE。相比之下大多数现有方法依赖词元融合其中时间词元被投影并与文本词元在共享嵌入空间中融合。4.4 复杂度分析4.5 不同主干上的专家调制专家调制为多模态时间序列建模定义了一个通用的、主干无关的原则。为展示其灵活性我们在三种具有递增建模复杂度的代表性架构中实例化这一框架线性模型MMLinear、基于MLP的模型MoME和基于Transformer的模型MiTransformer。(i)MoME是我们框架的主要实例。输入时间序列被分割为片段。专家实现为应用了专家调制的MLP。(ii)MMLinear是一个轻量级变体直接在整个序列上操作其中每个专家简化为应用了专家调制的线性变换。(iii)MiTransformer是iTransformer的多模态扩展将FFN块替换为MoME模块。它也在整个序列上操作无需分片。5 实验5.1 实验设置数据集。我们的主要评估聚焦于MMTSP以MT-BenchChen等2025作为主要基准因为其文本信息与相应时间序列相对良好对齐为评估跨模态集成提供了理想设置。我们在其天气和金融领域评估MoME。为评估这一主要设置之外的通用性我们纳入来自Time-IMMChang等2026以及Time-MMD基准Liu等2024a的额外真实世界数据集的补充实验。此外为检验MoE的理论见解定理4.2及其在时间序列建模中的作用我们在七个UMTSP基准Lai等2018Zhou等2021Wu等2021上进行支持性实验见附录B.3。最后我们使用MT-Bench和Time-IMM基准将评估扩展到多通道多模态场景。详细数据集描述见附录C.2。基线。我们考虑两类基线(a) 不利用外部文本的基线(b) 利用外部文本进行预测的基线。对于类型(a)我们包括四个监督时间序列预测模型PatchTSTNie等2023、iTransformerLiu等2024b、TS-MixerChen等2023、DLinearZeng等2023以及一个预训练时间序列基础模型TSFMTimeMoEShi等2025。我们还纳入GPT4TSZhou等2023和Time-LLMJin等2024a它们采用预训练语言模型作为时间序列编码器。对于预训练模型主干参数被冻结仅训练下游预测头。对于类型(b)许多现有的多模态时间序列模型可能无法直接比较因为它们遵循不同的建模范式如代理预测Jiang等2025Wang等2024或时间推理Quinlan等2026wang等2025Zhang等2025a。因此我们遵循Zhang等2025b并实现三个词元融合基线MLP (MoE) LM、TimeMoE LM和DLinearP LM其中 LM表示在词元级别纳入外部文本。MLP (MoE) 使用MLP专家而DLinearP是DLinear的分片变体。这些基线为专家调制和传统词元融合策略之间提供了受控比较。设置。为确保公平比较我们标准化关键超参数例如隐藏维度和层数并在所有实验中统一训练配置。所有模型在PyTorch中实现并在单个NVIDIA RTX A600048GBGPU上训练。对于主实验中的文本处理我们使用预训练LLM QwenMoE_A2.7B并将输入文本截断为最大长度2048个词元。详细实验设置见附录D.1。5.2 预测有效性我们在单通道和多通道设置下评估MoME。真实世界数据集MT-Bench和Time-IMM上的主要结果报告在表1中。Time-MMD上的额外结果见附录D.3。表1MT-Bench和Time-IMM上的模型性能。红色粗体表示最佳结果粗体表示次佳结果。Imp. (%) 相对于最强基线计算。单通道结果使用去归一化指标多通道结果使用归一化指标。单通道。MoME在数据集上实现了强劲的总体性能在金融趋势预测上改进尤为明显在大多数预测任务上具有竞争力或有所改进。这表明文本信息在帮助时间序列模型捕捉方向性或趋势级信号方面特别有效相比之下对精确数值的帮助较小。一种可能的解释是文本报告本质上是粗粒度的通常总结高层动态如市场情绪或宏观趋势使其更好地与趋势预测等粗分辨率目标对齐。总体而言这些结果表明MoME能够有效地从复杂文本例如图6所示的财务报告中提取有用信息并改进预测。多通道设置。为实现多模态、多通道预测我们采用通道独立策略其中每个变量单独建模文本信息在通道间共享。MoME始终优于大多数基线尽管增益更为温和。这可能是因为部分预测信号已经可以通过时间序列模态本身的跨通道交互捕获这降低了文本信息的边际增益。尽管如此结果表明专家调制与多通道场景无缝集成并实现了强劲性能。5.3 消融研究组件效果。为评估专家调制的有效性我们通过逐步引入其两个组件同时保持所有其他超参数相同来进行组件级消融研究。具体而言我们评估框架的三个主干变体MoME、MMLinear和MiTransformer。对于每个主干我们考虑三种设置纯单模态基线无文本输入记为 (w/oEM)仅通过专家独立线性调制引入文本信息的多模态变体 (w/EiLM)以及完整专家调制变体 (w/EM)其中EM由EiLM和路由器调制RM组成。因此从 w/oEM 到 w/EiLM 的比较直接衡量了通过专家计算纳入文本信息的收益而从 w/EiLM 到 w/EM 的比较隔离了文本条件路由的额外贡献。表2中的结果表明在所有主干家族中纳入EiLM始终优于大多数单模态基线而添加RM在 67% 的场景中进一步提升性能。值得注意的是尽管MoME使用简单的时间序列主干但通常优于MiTransformer。这表明在我们研究的场景中有效的跨模态集成可以显著增强预测性能即使没有高度复杂的时间序列架构。表2跨主干和任务的专家调制消融。粗体数字表示每个主干家族中的最佳结果。Avg. Imp. (%)(%) 表示最佳调制变体相对于相应单模态情况 (w/o EM) 的平均相对改进。图4(a)词元融合与专家调制的对比排名。(b)超参数分析。用于生成这些图的详细指标数字见附录D.4和附录D.6。超参数。我们对框架中的关键设计选择进行超参数分析包括激活专家数量 K、总专家数量 E 和上下文词元数量。结果总结在图4(b)中更多细节见附录D.6。我们观察到稀疏专家激活通常比更密集的替代方案取得更强性能。这一经验趋势也与定理4.2所隐含的选择性计算动机定性一致。由于时间序列通常包含噪声并非所有专家贡献对每个输入都同等有用选择性截断一个子集可能有助于抑制不太相关的计算。此外适量的上下文词元通常表现最佳表明在保留有信息的语义线索和避免不必要冗余之间存在权衡。不同LLM。我们进一步使用不同的LLM主干评估MoME以评估所提出框架的通用性。通过在MT-Bench上进行实验我们得到图5所示的两个结果。第一在不同LLM主干上MoME在所有评估任务上始终优于PatchTST基线。对于预测改进在不同模型间相对稳定而趋势预测的增益更为显著。这表明通过LLM引入的语义信息对于超越纯数值预测的高层趋势分析特别有益。第二我们观察到模型性能并不随模型规模单调扩展。最小的主干Qwen3.5-4B在金融预测上表现最佳而中型模型如DeepSeek-16B和Qwen3-14B分别在天气预测和金融趋势预测上取得最佳结果。最大的模型Qwen3.6-35B-A3B在天气趋势预测上表现最佳。总体而言这些结果表明MoME对LLM主干的选择具有鲁棒性其有效性并非仅仅由模型规模增加驱动。图5使用不同LLM主干的MoME与PatchTST基线的比较。每个单元格报告模型性能及其相对于PatchTST的改进。用于生成这些图的详细指标数字见附录D.6。5.4 与词元融合策略的比较我们进一步将我们的模型与一系列词元融合变体进行比较。为确保公平比较我们仅改变注入多模态信息的方式同时保持其他设置相同。具体而言我们首先禁用专家调制以获得单模态变体记为MoMEw/o EM。然后我们使用该模型作为主干并附加不同的词元融合模块包括图4(a)中所示的早期和晚期融合策略以在词元级别将文本信息与时间序列输入集成实现细节见附录D.4。我们从多个角度比较这些模型包括预测性能、内存消耗和推理速度。我们发现所提出的专家调制方法相比词元融合变体取得了更好的性能并保持了良好的效率。5.5 路由模式近期研究Chen等2022Sun等2025Guo等2026表明MoE模型倾向于将相似的词元路由到相似的专家子集导致专家专业化。我们观察到MoME在集成多模态信息时保持了这一性质。如图6(b上部)所示具有相似幅度的时间词元通常被路由到相似的专家集。除了幅度之外我们还发现时间序列的形态模式在专家选择中起决定性作用图6(b下部)。更多示例见附录D.7。这种专业化行为是MoE有效性的关键因素因为它使不同专家能够专注于输入空间的不同区域并更有效地捕捉异质模式。MoME中这种结构的保留表明专家调制不会破坏而是补充了MoE的内在优势。图6(a) 带专家调制(EM)的MoME与其单模态变体(w/o EM)的案例研究比较。(b) 激活EM时的路由模式。5.6 多模态的作用为研究文本信息如何影响时间序列模型我们在股票价格预测上进行案例研究图6(a)。历史价格呈现整体下降趋势最近一段时期有明显放缓。因此单模态变体MoME (w/o EM)外推近期模式并预测未来价格将保持相对稳定。相比之下近期财务报告提供了强烈信号多个不利市场因素表明价格可能进一步下跌。通过纳入这些外部文本信号完整MoME模型可以更准确地预测即将到来的下降趋势。这带来了显著的准确率提升相对于单模态预测将MAPE降低了近50%。重要的是在外部文本具有误导性或与后续发展不一致的检查案例中MoME仍然产生合理的预测相对于其单模态变体没有显著退化。这些例子表明模型在不完美文本信号下可以保持相对稳定。更多案例研究见附录E。6 结论与未来工作我们提出了MoME一种基于MoE的多模态集成视角将跨模态交互的观点从传统的词元融合转向专家调制。在广泛的预测和趋势预测任务中MoME改进了强大的单模态和多模态基线表明专家调制是集成模态信息的有效机制。当前设计的一个关键限制是其单向调制的限制即仅允许LLM衍生的文本信号调制时间序列专家将此扩展到相反方向允许时间信号也影响LLM专家可能实现更高级的能力如时间序列推理和问答。此外虽然我们的研究聚焦于时间序列和文本模态专家调制原则并不限于此设置可以通过引入额外的调制路径并联合条件化专家行为自然地推广到涉及两个以上模态的场景。我们相信这些方向指向专家调制作为未来多模态学习系统构建块的更广泛作用。