
论文题目
Explainable Melanoma Diagnosis with Contrastive Learning and LLM-based
Report Generation
期刊/会议:AAAI (Association for the Advancement of Artificial Intelligence) 2026
核心思想
提出针对黑素瘤(Melanoma)跨模态可解释性框架CEFM,利用对比学习和黑素瘤的临床诊断标准将临床语义和视觉特征对齐,在公开数据集上的AUC和准确度分别为96.1%和92.79%,量化分析进一步表明了该视觉transformer学习到的空间分布对齐了ABC临床规则。这种可解释性AI(XAI)的方法提升了黑箱模型用于临床决策的可信度。
三项贡献
- (1) 由粗到细的临床背景的特征提取通道,利用VM-UNet和SAM2提取基于ABCD规则的皮肤特征。
- (2) 跨模态的对比式对齐方法,将视觉表示和临床特征进行对齐。
- (3) 混合的诊断报告生成,整合CLIP和deepseek使报告结构化、更准确。
相关工作
- (1) 黑素瘤自动分类
- (2) TODO皮肤病诊断中的多模态学习
- (3) 黑素瘤诊断的XAI:文本解释比视觉注意力图对临床决策更有益
- (4) 基于LLM的报告生成

方法学
- 组件一:DNN分类网络.
从图像中提取高层语义特征,助于黑素瘤分类和后续对齐临床衍生特征. 特征提取器使用ViT,将空间和纹理特征编码为一个固定维度的隐表示,经由一个多层感知器头将其转换进一个合适的空间,用于分类和与临床ABC特征进行对比式对齐. -
组件二:临床解释机制.
分为病变分割和临床特征提取,基于分割后的图像特征计算其中ABC特征,随后与上述DNN特征进行对齐,保证内部一致性。(1)分割网络基于UltraLight VM-UNet和SAM2双阶段提炼,取最高IoU结果得到高精度的病变轮廓. (2) 基于对称性、边界和颜色三项可靠规则计算临床特征,评估皮肤病变的恶性风险,下表设计了可量化的特征描述子.
可量化的ABC特征描述子 -
组件三:对比学习模块.
对齐机制将抽象图像嵌入到皮肤病学概念中,提高了模型的透明度和鲁棒性。图像表示和临床特征之间的跨模态交互过程如下图所示. 这里有图像特征和临床特征两个分支,每个分支都将对应模态的特征映射到一个共享隐空间中,该空间通过对比式目标进行语义对齐.
跨模态对比学习过程
图像(v)-临床(c)损失及双向对比损失为:
模态对损失
双向对比损失
训练过程中,跨模态对齐时图像编码器的参数固定,优化投射头;对齐结束后固定投射头,再训练图像分类分支。以此保证预测的准确性和模型的可解释性. -
组件四:医疗报告生成
使用CLIP-ViT-B/16 寻找高置信度的黑素瘤描述子,CLIP是一种在多模态空间中通过对比学习对齐文本和图像的一种视觉语言模型(VLM). 随后上述量化的语义线索输入到deepseek中,生成精简的医学诊断报告.
下表分别是对CLIP的总结和代表性报告:
CLIP描述
代表性诊断报告
量化评估模型性能
- 数据集
International Skin Imaging Collaboration (ISIC) 2018 用于训练,ISIC 2020 用于验证/测试. -
分割性能
在ISIC2018上验证 UltraLight VM-UNet 模型的分割性能,其 Dice Similarity Coefficient (DSC, 度量预测结果和真实标签相似性的指标)、准确度、特异性分别达0.8909、95.56%和0.9746.
DSC系数,X、Y分别为预测集和真实集 - 特征对齐后的分类
兼容了CLIP可解释性模块、基于ViT的诊断模型,其准确度和AUC分别达92.79%、0.961. -
基于对比学习的特征对齐
图像-临床特征正样本对的相似度集中在0.8附近,负对则分布在0附近.
正负对相似性分布 - LLM报告生成模型对比
对比Claude, Gemini Base, and DeepSeek等模型,使用BERTScore衡量各模型输出,并统计精度、召回率和F1,结果表明deepseek语义表现与其他模型相当,其性价比更高. -
消融实验
组件消融后的风险评估对比
皮肤科专家的使用反馈与结论

一句话概括
不足之处,欢迎指正。
参考文献
[1] Zheng J , Xu X , Wang L R ,et al.Explainable Melanoma Diagnosis with Contrastive Learning and LLM-based Report Generation[J]. AAAI. 2025.








