
1. 学术速递类内容的价值定位与选题逻辑做学术速递这件事我从最早手动翻arXiv每天刷几十篇摘要到后来用脚本抓取、人工筛选、再压缩成几百字的速览前后折腾了快两年。很多人觉得速递就是“把论文标题翻译一遍”但真正做过的人知道这里面最值钱的部分恰恰不是翻译而是筛选逻辑和关联判断——你得知道哪篇论文值得展开、哪篇只是增量改进、哪篇背后可能藏着一个新方向。“计算机视觉与模式识别学术速递[2.11]”这个标题本质上是一个日期切片式的领域动态汇总。2.11代表2月11日前后集中发布的一批工作覆盖的核心方向从热搜词就能看出来计算机视觉、模式识别、大模型、视觉语言模型、合成图像检测。这几个词不是随便凑的它们之间有明确的层次关系——计算机视觉和模式识别是传统底盘大模型和视觉语言模型是当前最活跃的增量层合成图像检测则是被生成式模型倒逼出来的防御性方向。这类速递适合谁看三类人。第一类是刚入门计算机视觉的学生需要快速建立“这个领域现在在关心什么”的感知而不是一头扎进2015年的老教材里。第二类是做工程落地的开发者想知道最近有没有可以直接拿来用的模型或方法。第三类是准备开题或写综述的研究者需要判断哪些方向正在升温、哪些已经卷到头了。我自己的做法是每天固定花40分钟做速递前15分钟粗筛标题和摘要中间15分钟精读3到5篇的Method部分最后10分钟记录关键词和可复现性判断。这套流程跑下来一个月能积累出一份相当扎实的领域动态图谱。1.1 为什么速递不能只做“标题搬运”我见过太多速递号就是把arXiv的标题和作者列一遍加一句“值得关注”就完事了。这种内容没有任何信息增量读者看完跟没看一样。真正有价值的速递至少要做到三件事说清楚这篇工作解决了什么问题、它的方法和已有工作比新在哪里、对读者来说有没有可操作的价值。举个例子同样是视觉语言模型方向的一篇论文如果只说“提出了一种新的对齐方法”那等于没说。你得告诉读者它是做图文检索的对齐还是做VQA的对齐用的是对比学习还是生成式对齐训练数据规模是百万级还是十亿级这些细节决定了读者要不要花时间去看原文。1.2 日期切片速递的独特优势按日期做速递而不是按主题做综述有一个被低估的好处你能看到同一天里不同方向的工作在关心什么共同问题。比如2月11日这批工作里视觉语言模型和合成图像检测两个方向可能都在处理“分布外泛化”的问题只是一个从生成侧切入一个从判别侧切入。这种跨方向的关联是按主题综述很难呈现的。另外日期切片天然适合做趋势追踪。你连续做两周速递就能看出某个方向是突然爆发还是持续升温。我自己的记录表里有一个简单的统计每天统计各方向论文数量占比两周下来画个折线图趋势一目了然。2. 计算机视觉与模式识别的核心方向拆解2.1 传统底盘检测、分割、识别还在卷什么计算机视觉的经典三件套——目标检测、语义分割、图像分类——到今天依然是论文产出的大头。但如果你仔细看2月11日这批工作会发现一个明显变化纯精度提升的论文越来越难发大家开始卷效率、卷鲁棒性、卷开放场景。目标检测方向最近比较集中的思路是开放词汇检测和少样本检测。传统检测器只能检测训练集里定义好的类别但实际场景里你永远会遇到没见过的物体。开放词汇检测的思路是用视觉语言模型的文本编码器来替代传统的分类头这样模型就能通过文本描述来检测新类别。这个思路的代表工作是Grounding DINO系列2月11日前后有几篇在它的基础上做效率优化的。语义分割方向SAMSegment Anything Model的后续影响还在持续。SAM把分割变成了一个提示驱动的任务你给一个点、一个框或者一段文字它就能分割出对应区域。但SAM的问题也很明显模型太大、推理太慢、对细粒度类别不敏感。所以最近的工作集中在三个方向轻量化SAM、给SAM加语义标签、把SAM用到特定领域医学影像、遥感、工业质检。图像分类方向纯分类的论文已经很少了更多是作为自监督学习或多模态预训练的评测任务出现。如果你现在还在做纯分类的精度提升建议尽早换方向。2.2 增量层大模型和视觉语言模型在CV里怎么用大模型进入计算机视觉领域最直接的方式就是视觉语言模型VLM。VLM的核心思路是用一个视觉编码器把图像变成特征再用一个语言模型来理解和生成文本中间通过某种对齐机制把两个模态连起来。这个框架最早是CLIP打下的基础后来BLIP、LLaVA、Qwen-VL等一系列工作把它推向了生成式。2月11日这批工作里VLM方向有几个值得注意的趋势。第一是视频理解从静态图像扩展到视频需要处理时序信息和长上下文。第二是细粒度理解比如识别图像里的具体物体属性、空间关系、文字内容。第三是高效推理VLM的参数量动辄几十亿怎么在消费级显卡上跑起来是个大问题。大模型在CV里的另一个用法是作为数据引擎。传统CV模型需要大量标注数据但标注成本很高。现在可以用大模型来自动生成标注比如用VLM给图像打标签、用扩散模型生成合成数据。这就引出了下一个方向合成图像检测。2.3 防御层合成图像检测为什么突然火了合成图像检测火起来的原因很简单生成式模型太强了。扩散模型生成的图像已经很难用肉眼分辨真假这对内容安全、学术诚信、司法取证都构成了直接威胁。所以检测合成图像成了一个刚需方向。这个方向的技术路线大致分三类。第一类是基于伪影的检测扩散模型生成的图像在频域或像素层面会留下特定痕迹比如上采样伪影、频谱异常。第二类是基于语义的检测生成图像在物理一致性、光照逻辑、文本渲染上往往有破绽。第三类是基于水印的检测在生成时嵌入不可见水印检测时提取水印来判断来源。2月11日前后有几篇工作在做跨生成器的泛化检测也就是说在一个生成器上训练的检测器能不能检测另一个生成器生成的图像。这个问题的难点在于不同生成器的伪影特征不一样过拟合到某一个生成器就废了。3. 视觉语言模型的技术细节与实操要点3.1 VLM的基本架构和训练流程视觉语言模型的架构可以拆成三块视觉编码器、模态对齐模块、语言模型。视觉编码器通常用ViT或者其变体把图像切成patch后编码成特征序列。模态对齐模块负责把视觉特征映射到语言模型的嵌入空间早期用简单的线性层现在更多用Q-Former或Perceiver Resampler这类注意力机制。语言模型就是标准的Transformer解码器负责生成文本。训练流程一般分两阶段。第一阶段是预训练对齐用大规模图文对比如LAION-5B训练视觉编码器和对齐模块让模型学会把图像和文本关联起来。这个阶段通常冻结语言模型只训练视觉侧。第二阶段是指令微调用图文指令数据训练整个模型让它学会按照人类指令来回答问题。这个阶段的数据质量比数量更重要LLaVA用的就是GPT-4生成的指令数据。实操中有一个关键选择视觉编码器是冻结还是微调。冻结的好处是训练成本低、不容易过拟合缺点是视觉特征可能不适应下游任务。微调的好处是能适配特定领域缺点是计算量大、需要更多数据。我的经验是如果你的领域和预训练数据差异大比如医学影像、遥感图像最好微调如果差异不大冻结就够了。3.2 本地部署VLM的显存计算和量化方案很多人想在本地跑VLM但显存总是不够。这里给一个粗略的显存估算公式显存需求 ≈ 参数量 × 精度字节数 × 1.2。比如一个7B参数的模型用FP16精度显存需求大约是7 × 2 × 1.2 16.8GB。这还没算上KV Cache和中间激活值实际跑起来可能要20GB以上。量化是解决显存问题的核心手段。常见的量化方案有量化方案精度显存节省质量损失适用场景FP1616bit基准无有充足显存INT88bit约50%很小显存紧张但要求高质量INT44bit约75%中等消费级显卡GPTQ4bit约75%较小需要快速推理AWQ4bit约75%较小需要快速推理我实测下来7B模型用INT4量化后显存占用能压到6GB左右在RTX 306012GB上跑得很稳。但要注意量化会带来一定的质量损失尤其是对细粒度识别任务。如果你的任务对精度要求高建议用INT8而不是INT4。3.3 VLM微调的数据准备和训练技巧微调VLM最头疼的不是模型是数据。你需要准备图文指令对格式通常是image 问题 答案。数据来源有三个公开数据集如VQAv2、COCO Caption、自己标注、用大模型生成。自己标注成本太高用大模型生成是更现实的选择。具体做法是拿一批图像用GPT-4V或者Qwen-VL生成问题和答案然后人工筛选一遍。筛选的标准是答案必须准确、问题必须有意义、不能有幻觉。我试过用这个方法生成5000条指令数据人工筛选后剩下3000条左右质量足够做一次LoRA微调。训练技巧方面有几个点值得注意。第一是学习率要小VLM微调的学习率通常在1e-5到5e-5之间太大容易灾难性遗忘。第二是用LoRA而不是全量微调LoRA只训练低秩矩阵显存占用小、训练速度快效果也不差。第三是数据配比要均衡如果你的任务数据只有几百条最好混入一些通用指令数据防止过拟合。注意VLM微调时视觉编码器通常冻结只训练对齐模块和语言模型。如果你要微调视觉编码器学习率要设得更小1e-6级别否则容易破坏预训练特征。4. 合成图像检测的实操方案与避坑指南4.1 基于频域特征的检测方法扩散模型生成的图像在频域有一个很明显的特征高频信息异常。这是因为扩散模型的去噪过程本质上是一个低通滤波高频细节会被平滑掉。所以你可以对图像做傅里叶变换看高频部分的能量分布。具体操作步骤把图像转成灰度图做二维FFT然后计算频谱的径向功率谱。真实图像的径向功率谱通常服从幂律分布而生成图像的功率谱在高频段会偏离这个分布。你可以用这个偏离程度作为检测特征。这个方法的优点是计算快、不需要训练缺点是对JPEG压缩很敏感。如果图像被压缩过高频信息会被破坏检测效果大打折扣。所以实际用的时候最好结合其他特征一起判断。4.2 基于语义一致性的检测方法语义一致性检测的思路是生成图像在物理逻辑上往往有破绽。比如光照方向不一致、阴影位置不对、物体接触关系不合理、文本渲染乱码。这些破绽可以用VLM来检测。具体做法是用VLM对图像提问比如“这张图里的光源方向是什么”“这个物体的阴影应该朝哪个方向”“图中的文字内容是什么”如果VLM的回答和图像内容矛盾就说明图像可能是合成的。这个方法的优点是可解释性强你能明确知道为什么判断它是假的。缺点是依赖VLM的能力如果VLM本身不够强检测效果就不好。另外这个方法对高质量生成图像比如Midjourney v6效果有限因为它们的语义一致性已经做得很好了。4.3 跨生成器泛化检测的训练策略跨生成器泛化是合成图像检测里最难的问题。你在Stable Diffusion上训练的检测器放到Midjourney上可能就失效了。解决思路有几个第一是数据增强。在训练时对图像做各种变换JPEG压缩、缩放、裁剪、加噪声让模型学到更鲁棒的特征。第二是多生成器训练。用多个生成器的数据一起训练让模型学到跨生成器的共性特征。第三是域适应。在测试时用少量目标生成器的数据做微调。我自己的经验是多生成器训练强数据增强是最稳的方案。具体配置用3到5个不同生成器的数据每个生成器至少5000张图真实图像用COCO或ImageNet。数据增强包括随机JPEG压缩质量30到90、随机缩放0.5到1.5倍、随机裁剪50%到100%面积。训练用ResNet-50或ViT-Base学习率1e-4训练20个epoch左右。提示跨生成器检测的评测集一定要包含训练时没见过的生成器否则指标会虚高。我见过太多论文在训练集同分布的测试集上刷到99%换个生成器就掉到60%。4.4 合成图像检测的常见问题速查问题可能原因排查方法解决方案检测器在真实图像上误报率高过拟合到生成器伪影在真实图像测试集上评估增加真实图像训练数据降低模型复杂度换生成器后指标暴跌泛化能力差跨生成器评测多生成器训练数据增强JPEG压缩后检测失效频域特征被破坏压缩前后对比测试训练时加入JPEG增强推理速度太慢模型太大测推理耗时用轻量 backbone 或蒸馏对高质量生成图像检测效果差伪影太弱可视化频域特征结合语义检测方法5. 计算机视觉学习路线与实操建议5.1 入门阶段该学什么、不该学什么计算机视觉入门最大的坑是一上来就啃深度学习。我见过太多人直接看《深度学习》花书看了三个月还在反向传播然后放弃了。正确的路径应该是先学传统图像处理滤波、边缘检测、特征点再学经典机器学习SVM、随机森林最后才进深度学习。传统图像处理看起来过时但它能帮你建立对图像的基本直觉。比如你知道高斯滤波是低通滤波就能理解为什么卷积神经网络的低层卷积核长得像高斯。你知道SIFT特征点的原理就能理解为什么现在的位置编码要用正弦函数。入门阶段推荐的学习资源OpenCV官方教程动手写代码、CS231n斯坦福视觉课程、动手学深度学习李沐。不要一上来就看论文先把代码跑通再去看论文里的方法。5.2 进阶阶段的方向选择和项目积累进阶阶段最纠结的是选哪个方向。我的建议是先广后深。花一个月时间把检测、分割、分类、生成、多模态都跑一遍demo然后选一个你最感兴趣的方向深入。项目积累方面不要做MNIST和CIFAR-10这些项目写在简历上没人看。要做就做有实际场景的项目比如用YOLO做交通标志检测、用SAM做医学图像分割、用VLM做图文检索、用扩散模型做图像修复。项目不在多在精。一个完整的项目应该包含数据收集和清洗、模型训练和调参、推理部署和优化、效果评估和bad case分析。我自己的经验是参加一次Kaggle比赛比做十个玩具项目有用。Kaggle比赛有真实的评测标准、有公开的讨论区、有可对比的baseline。你可以在比赛里学到怎么处理脏数据、怎么做特征工程、怎么调参、怎么ensemble。5.3 大模型时代CV工程师的技能树更新大模型时代CV工程师的技能树需要更新。以前你会训ResNet、会调YOLO就够了现在还需要会部署大模型知道怎么用量化、怎么用vLLM做推理加速、怎么用Ollama做本地部署会微调大模型知道LoRA、QLoRA、Adapter的区别和适用场景会做多模态知道怎么把视觉编码器和语言模型接起来、怎么准备图文指令数据会做数据工程知道怎么用大模型生成数据、怎么清洗和筛选数据会做评测知道怎么设计评测集、怎么分析bad case、怎么做消融实验这些技能不是要你全部精通但至少要有一个方向能拿得出手。我的建议是传统CV能力保底大模型能力加分。你先把检测或分割做到能落地的水平然后再去补大模型的能力。5.4 本地部署大模型的硬件配置建议本地部署大模型硬件是绕不过去的坎。根据我的实测经验给几个配置建议预算档位GPU显存能跑的模型适用场景入门RTX 306012GB7B INT4学习、demo中端RTX 4070 Ti16GB13B INT4开发、小规模部署高端RTX 409024GB34B INT4生产、多任务专业A600048GB70B INT4大规模部署如果预算有限优先加显存而不是加算力。大模型推理是显存瓶颈不是算力瓶颈。另外Mac Studio的M系列芯片统一内存架构对大模型推理很友好64GB内存的Mac Studio能跑70B INT4模型性价比很高。注意本地部署大模型时一定要留出足够的系统内存。模型加载时会先读到内存再传到显存如果系统内存不够会直接OOM。建议系统内存至少是显存的2倍。6. 学术速递的持续运营与信息筛选心得6.1 信息源的选择和过滤规则做学术速递信息源的质量决定了内容的质量。我的信息源分三层核心层是arXiv的cs.CV和cs.CL板块每天必刷扩展层是Twitter上的领域大V和几个高质量的邮件列表补充层是顶会CVPR、ICCV、NeurIPS的录用列表和OpenReview上的讨论。过滤规则方面我设了几条硬标准第一没有代码的不看除非是特别重要的理论工作第二纯增量改进的不看比如把ResNet的某个模块换个位置然后涨了0.5个点第三实验不充分的不看只在单个数据集上跑、没有和强baseline对比的直接跳过。这套规则帮我省了大量时间。我算过arXiv每天cs.CV的新论文大概200到300篇经过过滤后值得精读的不到10篇值得写进速递的3到5篇。6.2 速递内容的组织结构和写作节奏速递的内容组织我习惯用**“总-分-总”**结构。开头用两三句话概括当天的主要趋势中间按方向分块展开每个方向选1到2篇代表性工作详细说最后用一句话点出值得关注的后续方向。写作节奏上不要平均用力。有的论文值得写500字有的只值得写50字。判断标准是如果这篇论文的方法你能用在自己的项目里就多写如果只是了解一下就少写。我自己的速递里通常有1篇是重点展开的2到3篇是简讯剩下的就是一句话带过。6.3 长期跟踪一个方向的方法论长期跟踪一个方向不能只看论文还要看代码仓库的更新、领域大V的讨论、工业界的落地案例。我跟踪VLM方向的做法是订阅LLaVA、Qwen-VL、InternVL这几个仓库的release关注几个活跃研究者的Twitter定期看HuggingFace上的模型排行榜。另外建立自己的知识库很重要。我用Notion建了一个论文库每篇论文记录标题、作者、核心方法、实验结果、代码链接、我的评价。时间长了这个库就是你的第二大脑。写综述、做开题、找idea的时候翻一翻就有灵感。6.4 从速递到深度内容的转化路径速递做久了自然会积累出一些值得深挖的方向。我的做法是每周选一个方向做深度拆解。比如这周VLM方向出了三篇相关论文我就把它们放在一起对比分析它们的共同点和差异点然后写一篇深度分析。深度内容的转化路径通常是速递里发现一个有趣的工作 → 精读原文和代码 → 复现核心实验 → 写深度分析。这个过程可能花两三天但产出的内容质量远高于速递。而且复现过程中你会有很多实操心得这些是看论文看不出来的。我自己的体会是速递是输入深度内容是输出。只输入不输出知识是散的只输出不输入内容会枯竭。两者结合才能持续产出高质量的内容。最后分享一个小技巧做速递的时候用语音输入代替打字。我每天早上刷论文的时候直接用语音把想法录下来然后转成文字整理。这样速度快很多而且口语化的表达更自然整理成文字后不用怎么改就能用。