Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting 文章

ArXiv CS.CV2026-07-31PAPERen作者: Yuyang Liu, Qiuhe Hong, Linlan Huang, Alexandra Gomez-Villa, Dipam Goswami, Tiantian Peng, Xialei Liu, Joost van de Weijer, Yonghong Tian

详细信息

来源站点
ArXiv CS.CV
作者
Yuyang Liu, Qiuhe Hong, Linlan Huang, Alexandra Gomez-Villa, Dipam Goswami, Tiantian Peng, Xialei Liu, Joost van de Weijer, Yonghong Tian
文章类型
PAPER
语言
en
发布日期
2026-07-31

摘要

arXiv:2508.04227v3 Announce Type: replace Abstract: Vision-language models (VLMs), spanning predictive architectures to generative Multimodal Large Language Models (MLLMs), have revolutionized artificial intelligence through powerful cross-modal alignment and zero-shot generalization. However, enabling them to learn continually from non-stationary data remains a major challenge, as their cross-modal alignment and generalization capabilities are particularly vulnerable to catastrophic forgetting. Unlike traditional unimodal continual learning (CL), VLMs face unique challenges such as cross-modal feature drift, parameter interference due to shared architectures, and zero-shot capability erosion. Furthermore, generative MLLMs exhibit a unique "alignment tax," where catastrophic forgetting manifests not merely as factual amnesia, but as a systemic collapse of deep Chain-of-Thought (CoT) reasoning.

相关事件

暂无数据

相关公司查看全部 (4)

A
ANICOMPANY
A
ActuaNONPROFIT
A
Advanced Photon SourceRESEARCH_INSTITUTE

相关人物

暂无数据