麻省理工/IBM提出迄今为止最大的合成图表数据集ChartNet,生成150万个多样化图表样本 文章

36kr 资讯2026-06-11NEWSzh作者: 超神经HyperAI

详细信息

来源站点
36kr 资讯
作者
超神经HyperAI
文章类型
NEWS
语言
zh
发布日期
2026-06-11

摘要

来自麻省理工学院、麻省理工学院-IBM 计算研究实验室和 IBM 研究院的众多专家提出了ChartNet——一个面向图表理解的百万级高质量多模态数据集,旨在推动图表理解与推理能力的发展。 过去两年,多模态大模型的发展速度远超预期。从识别图片内容,到理解复杂文档,再到解析视频信息,视觉语言模型(VLM)不断突破能力边界。然而,有一种看似简单却极具挑战性的视觉对象,至今仍让许多先进模型频频「翻车」——图表(Chart)。 对于人类而言,一张柱状图、折线图或散点图往往能够快速传递趋势、对比关系和关键结论。但对于 AI 来说,图表远不只是图片。模型不仅需要识别视觉元素,还要理解坐标轴、数据点、图例和标签之间的关系,并进一步完成数值提取、趋势分析甚至因果推理。换句话说,图表理解本质上是一项跨越视觉、数值与语言三种认知能力的复杂任务,而当前的 VLM 仅能部分实现这一能力。 近年来,一些数据集推动了相关研究发展,但普遍存在三个问题:规模较小、图表类型有限,以及缺乏完整的多模态信息。许多数据集仅关注单一任务(如问答或图表描述),或缺乏关键模态,因此开源模型在复杂图表推理任务中仍落后于专有系统。 为弥补这一空白,来自麻省理工学院、麻省理工学院-IBM 计算研究实验室和 IBM 研究院的众多专家提出了ChartNet——一个面向图表理解的百万级高质量多模态数据集,旨在推动图表理解与推理能力的发展。 这是迄今为止最大的合成图表数据集,其采用一种新颖的代码引导式合成(code-guided synthesis)流程,生成了 150 万个多样化图表样本,涵盖 24 种图表类型和 6 种绘图库。通过全面实验验证 ChartNet 的实用性,结果显示,其最优微调模型在所有任务上均超过规模大得多的模型及 GPT-4o。 在线使用数据集:https://go.hyper.ai/lGPsc 相关研究成果以「ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding」为题,将在 IEEE 计算机视觉与模式识别会议上发表。 研究亮点:…

摘要可能不完整,可查看原文

相关事件

暂无数据

相关公司查看全部 (3)

I
IBM 研究院RESEARCH_INSTITUTE

相关人物

暂无数据