TextSLIP: Text Self-Supervised CLIP for Medical Report Generation 文章

ArXiv CS.CV2026-07-27PAPERen作者: Haoyu Jiang, Ziping Cong

详细信息

来源站点
ArXiv CS.CV
作者
Haoyu Jiang, Ziping Cong
文章类型
PAPER
语言
en
发布日期
2026-07-27

摘要

arXiv:2607.21970v1 Announce Type: new Abstract: Automating radiology report generation is important for improving reporting consistency and clinical workflows . While Contrastive Language--Image Pretraining (CLIP) has advanced medical vision language modeling, existing CLIP-style approaches may still provide insufficient fine-grained semantic supervision for complex report generation. Standard CLIP primarily optimizes cross-modal alignment, without explicitly structuring the textual embedding space that guides visual representation learning. To address this limitation, we propose TextSLIP, a general medical vision-language pretraining framework that augments CLIP with intra-modal text contrastive learning. By improving textual embedding discriminability through self-supervised augmented text pairs, TextSLIP is designed to provide finer-grained linguistic supervision to the visual encoder.

相关事件

暂无数据

相关公司

暂无数据

相关人物

暂无数据