DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering 文章

ArXiv CS.CV2026-07-28PAPERen作者: Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou

DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering · 相关公司

A
AMI团队RESEARCH_INSTITUTE