ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

MLLMRec: Exploring the Potential of Multimodal Large Language Models in Recommender Systems

2026/9/1 8:06:47 拓冰建站 浏览量
MLLMRec: Exploring the Potential of Multimodal Large Language Models in Recommender Systems MLLMRec论文总结与关键部分翻译一、论文主要内容总结本文聚焦多模态推荐系统(MMRS)现存的两大核心问题,提出了一种由多模态大型语言模型(MLLM)驱动的推荐框架MLLMRec,具体内容如下:1. 研究背景与现存问题研究背景:多模态推荐系统通过融合用户行为数据与物品的多模态特征(文本、图像等)缓解数据稀疏问题、捕捉用户偏好,但现有方法仍有不足。现存问题:用户多模态表示初始化缺陷:要么未考虑用户历史行为中的偏好信号(如随机初始化),加剧冷启动问题;要么未过滤预训练模型中的无关特征,导致噪声混入(如用户的偏见偏好),且无法捕捉用户决策过程中的交互动机。物品-物品图(KNN-based)质量低:存在低相似度的“假阳性边”(如Baby数据集上约12%边的相似度低于0.5),且忽略用户-物品交互中隐含的“受众共现关系”,导致“假阴性边”(如篮球与护膝这类特征空间距离远但受众高度重合的物品未连接),干扰图卷积过程,引发物品表示语义偏移。2. MLLMRec框架核心设计用户偏好推理策略:利用MLLM将物品图像转换为高质量语义描述,与物品文本元数据融合,得到