1. 引言:当“分割一切”遇上“标注稀缺”的医学图像
大家好,我是老张,在AI和医学影像这个行当里摸爬滚打了十来年。最近几年,Meta的Segment Anything Model(SAM)横空出世,那句“分割一切”的口号确实让人热血沸腾。我第一时间就上手试了,拿它去分割自然图像里的猫猫狗狗、桌椅板凳,效果确实惊艳,点哪分哪,交互体验丝滑。但当我兴冲冲地把SAM搬到我们实验室的CT、MRI医学图像上时,情况就有点尴尬了。你会发现,它经常把胰腺和周围的脂肪组织搞混,或者对脑室这种结构复杂、对比度不高的区域“视而不见”。问题出在哪?根本原因在于,SAM是在海量自然图像上训练出来的“通才”,而医学图像是一个高度专业化、领域差异巨大的“特长生”赛场。这里的器官边界模糊、组织纹理相似,还常常伴有病变和个体差异,没有深厚的医学知识储备,光靠通用视觉模型很难玩得转。
更头疼的是,获取医学图像的精准标注成本极高。一张CT切片上十几个器官,让经验丰富的放射科医生手动勾画轮廓,可能就得花上半小时。想训练一个靠谱的模型,动辄需要成千上万张这样的标注数据,这在实际临床和研究中几乎是不可承受之重。所以,我们一直追求的,就是如何用极少量的标注样本,让SAM这样的强大模型快速“学懂”医学图像里的门道,实现精准的自动化分割。这就是“少样本学习”要解决的核心难题。今天要跟大家深入聊的PGP-SAM,就是在这个方向上的一次非常漂亮的突破。它没有选择蛮力——去微调SAM庞大的图像编码器所有参数,而是巧妙地引入了“原型”这个核心概念,像给模型配备了一个可以举一反三的“医学知识小抄”,仅用10%的数据就实现了性能的显著提升。下面,我就带大家一层层拆解,看它是怎么做到的。
2. PGP-SAM的核心思想:用“原型”举一反三
要理解PGP-SAM,首先得搞明白“原型”是什么。你可以把它想象成我们大脑中的“概念模板”。比如,你只见过几只不同品种的猫,但你大脑里会抽象出一个关于“猫”的原型:有尖耳朵、胡须、长尾巴。下次见到一只从未见过的猫,你也能立刻认出来,因为你把新看到的特征和你大脑里的“猫原型”进行了比对。PGP-SAM做的就是类似的事情,但它更精细,设计了两类原型。


853

被折叠的 条评论
为什么被折叠?



