ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

[JBHI 2025]Enhancing Trustworthiness of Semantic Segmentation in Cataract Surgery Videos via Intra-P

2026/9/8 19:35:28 拓冰建站 浏览量
[JBHI 2025]Enhancing Trustworthiness of Semantic Segmentation in Cataract Surgery Videos via Intra-P 论文网址Enhancing Trustworthiness of Semantic Segmentation in Cataract Surgery Videos via Intra-Phase Label Propagation | IEEE Journals Magazine | IEEE Xplore目录1. 心得2. 论文逐段精读2.1. Abstract2.2. Introduction2.3. Related Work2.3.1. Semantic Segmentation in Surgery Videos2.3.2. Label Propagation for Video Object Segmentation2.4. Methodology2.4.1. Memory-based Label Propagation Framework2.4.2. Pseudo-label Generation and Filtering Strategy2.4.3. Fixed-size Memory Bank with Adaptive Update2.4.4. Semantic Edge Perception Module2.4.5. Joint Loss Function2.5. Experiments2.5.1. Datasets2.5.2. Implementation Details2.5.3. Comparison with SOTA Methods2.5.4. Ablation Study2.5.5. Effectiveness Study of Addressing Challenges2.5.6. Computational Efficiency2.5.7. Comparison with SAM22.5.8. Visualization of Label Filtering2.6. Discussion and Conclusion1. 心得~2. 论文逐段精读2.1. Abstract①以前的模型没有考虑不同手术阶段下的实例分割②因此作者设计了一个标签传播框架利用阶段特异性器械使用每个阶段的初始帧就能预测后几帧的掩码2.2. Introduction①(a)相似的器械(b)器械-组织边缘模糊②作者引入了阶段信息、固定的记忆模块和边缘信息来实现更好的分割intraocular adj.眼内的 entail vt.需要涉及使必要牵涉 n.限定继承权预定继承人的顺序Cannula n.套管套管,插管 Cystotome n.膀胱刀截囊刀 viscous adj.粘性的黏的2.3. Related Work2.3.1. Semantic Segmentation in Surgery Videos①只用2D图像没有时间信息的分割会不能应付突然的遮挡②有时间信息的视频分割不太能区分相似器械2.3.2. Label Propagation for Video Object Segmentation①现在已经有很多传播办法但都没有用在手术视频里2.4. Methodology①整体框架②把一个视频切分成个不同阶段的子视频对于其中第阶段的子视频为其第一帧视频生成伪标签这个阶段的所有帧会和伪标签一起送进标签传播网络整合阶段内时间特征和阶段内帧语义边缘特征去预测剩余的掩码。2.4.1. Memory-based Label Propagation Framework①把图像使用Key Encoder (ResNet-50)处理后得到帧特征把图像和掩码使用Value Encoder (ResNet-18)处理后得到②某一帧的前面帧会有Memory Key和Memory Value很多帧③当前帧的Query要去计算和所有记忆帧的每帧和帧之间特征的欧式距离算完后然后Softmax归一化为(我猜应该就是每一行归一化这样是对当前帧归一化不过我也不确定④得到相似度矩阵后拿来作为Memory Value的权重得到最终时间特征2.4.2. Pseudo-label Generation and Filtering Strategy①使用预训练的分割器LSKANet来得到初始帧的伪标签②将预训练模型预测的帧的每个像素点计算掩码熵熵小则模型很确定结果熵大则模型不确定结果每个类别概率差不多并归一化discernible adj.看得清的觉察得出的③对于每个预测掩码只留下熵小于某个阈值的2.4.3. Fixed-size Memory Bank with Adaptive Update①不能像(a)一样一直扩展记忆库作者设计了parameter-free adaptive update module (AUM)。当记忆库满的时候每加入一个都要丢弃一个索引中最相似的2.4.4. Semantic Edge Perception Module①提出语义边缘感知模块semantic edge perception moduleSEP)其输入是Key Encoder的第二层和第四层特征其中是拉普拉斯卷积是高斯卷积camouflage n.迷彩2.4.5. Joint Loss Function①将语义边缘特征与时间特征加总其中是ReLU和3×3卷积组合的预测头②分割损失③边缘损失④总损失2.5. Experiments2.5.1. Datasets1CaDIS①阶段14②视频数量25③视频被缩放为960×540大小每个像素均有标注④作者只选择了一个背景类别十个器械类别三个解剖类别共计十四个类别⑤训练集包含19个视频共3550帧验证集包含3个视频534帧测试集包含3个视频586帧2PCS-8①内部数据集②帧个数5053③总视频个数8④分辨率960×540⑤三个被眼科手术专家训练过的标注者标注⑥类别一个背景类两个解剖类九个器械类⑦训练集包含5个视频的3053帧测试集包含3个视频的2000帧incision n.(尤指手术的)切口切开割口viscous adj.粘性的黏稠的黏滞的hydrodissection 水分离皮质分离已变厚的晶状体的核膜水分离术tonify vt.(通过锻炼或涂特殊的护肤霜等)改善(身体部位)状况2.5.2. Implementation Details①设备4090 GPU②输入图像大小被reshape成384×384③数据增强随机颜色抖动随机仿射变换随机灰度缩放随机垂直翻转随机裁剪④优化器Adam其中动量为学习率为1e-5权重衰减是1e-7⑤迭代次数40,000⑥批次4jitter n.振跳颤晃动传真接受图像的不稳定移动信号的不稳定性速度偏差歧离起伏散开疏散破碎 vt.抖动[电子] 跳动战战兢兢使…惶恐不安2.5.3. Comparison with SOTA Methods①CaDIS数据集上和传统分割方法以及基于标记传播的分割方法的定性比较类别Pupil, Iris, Cornea, Micromanipulator (Mm), Ph. Handpiece (PH), Cannula, I/A Handpiece (I/A H), Cap. Cystotome (CC), Primary Knife (PK), Lens Injector (LI), and Cap. Forceps (CF)②PCS-数据集上和传统分割方法以及基于标记传播的分割方法的定性比较③定量比较2.5.4. Ablation Study①模块消融②滤波阈值和内存大小参数消融2.5.5. Effectiveness Study of Addressing Challenges①对于相似器械外观和组织挑战下的分割②边界分割精度对比2.5.6. Computational Efficiency①比较不同标签传播方法中最大分配内存MAM和帧每秒FPS2.5.7. Comparison with SAM2①和通用模型的对比2.5.8. Visualization of Label Filtering①不确定性图2.6. Discussion and Conclusion~