← 返回知识库

综述:计算机视觉

SAM 1/2 想做的是SAM3想做的是

而上下文分割分为广义的和狭义的,

两者的关系为:PCS(文本 + 视觉) ⊃ ICS (仅视觉),ICS连概念名字都不用给、给个示例就行

FSS:更强调“换新类别————先在 base classes 上专门训练一个“如何用 support 样例分割 novel class”的模型,然后测试时仍然做固定粒度的类别级分割

ICS: 更强调“推理时用上下文重新定义要分割的概念,包括改变概念粒度”————同一个通用模型在推理阶段,由当前的 reference image + mask 来临时定义“这次到底要分什么

ICS与FSS的差别:推理时仅靠上下文样例来定义当前要分割的概念和粒度,实验时通过分数据集来评估————INSID3 本身算法不换,换的是 reference-target 的任务定义和对应 GT。

ICS 的代表工作:INSID3:想借助一个免训练冻结 VFM➕一个上下文实例对进行分割, 并不是给“物体 / 部分 / 个性化实例”分别设计三个分割头,而是让来决定当前要分割的语义粒度, .

ICS 任务数据集数据基本信息模型分割目标
SemanticCOCO-20ᵢ通用物体图像,80 个物体类别某个类别的所有实例,如“所有狗”
SemanticLVIS-92ᵢ通用物体图像,920 个类别,明显长尾分布某个类别的所有实例
SemanticISIC2018医学图像,皮肤镜下的皮肤病灶对应的病灶区域
SemanticChest X-Ray医学 X 光图像,肺部筛查对应的肺部区域
SemanticiSAID-5ᵢ遥感/航拍图像,15 类某类遥感目标,如建筑、车辆等
SemanticSUIM水下图像,8 类某类水下目标
PartPASCAL-Part物体的部件标注,15 个物体类别、56 种部件同一种物体部件,如“狗耳朵”
PartPACO-Part更细粒度的部件数据,75 类物体、303 种部件同一种具体部件
PersonalizedPerMIS个性化实例分割数据集,16 个类别与参考图中同一个具体实例,如“我的这只狗”
方法本文采用/不采用的原因
K-meansICS 是开放任务、目标粒度也变化
不适合事先指定聚类个数 (K)
DBSCAN在 DINOv3 提取的高维特征空间里
“密度”本身会变得不可靠,且通常还得先做降维
Agglomerative
Clustering
从局部相似 patch 开始自底向上逐步合并
不需要预先指定簇数量,而且和 DINOv3 特征的空间平滑性很契合

todo

名词解释:开放概念分割