A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models 文章主要内容与创新点总结一、主要内容研究背景:字谜游戏(Rebus Puzzles)通过图像、符号和字母创造性表达单词或短语,需融合图像识别、常识推理、多步推理等多种能力,对现有视觉语言模型(VLMs)构成挑战。现有相关研究缺乏多样化、多难度级别的基准数据集,且无适用于开源和闭源模型的通用优化方案。核心贡献构建了大型多模态基准数据集||,包含1333个英文字谜游戏样本,覆盖18个类别(如食物、成语、体育等),附带详细标注元数据(提示、难度、属性重要性等)。利用ControlNet技术为部分样本添加干扰性背景,提升谜题难度,增强数据集多样性。提出通用框架RebusDescProgICE,结合非结构化图像描述与结构化代码推理,搭配基于相似性的上下文示例选择策略,无需大量训练即可适配各类模型。实验结果闭源模型(如GPT-4o)在字谜求解任务上显著优于开源模型,GPT-4o的词级F1值最高达0.536。RebusDescProgICE框架使闭源模型性能提升2.1%-4.1%,开源模型提升20%-30%(如Qwen2-VL-7B的F1值从0.2提升至0.264)。带干扰背景的增强数据集对所有模型构成挑战,即使GPT-4o的最高F1值也仅为0.402,验证了数据集的有效性。