首页 > 人工智能 >MIT开发图表理解AI训练数据集ChartNet

MIT开发图表理解AI训练数据集ChartNet

来源:互联网 2026-06-04 06:16:07

MIT等机构开发了ChartNet图表理解训练数据集,包含超百万张图表图像及配套代码、描述、表格和问答对。采用两步式合成数据生成流程,小型开源模型经训练后在图表重建、数据提取等任务上超越大型商业模型,降低AI应用门槛。

企业在激烈的市场竞争中抢占先机,决策速度与质量至关重要。而决策背后,往往依赖堆积如山的市场报告与财务文件中的图表。因此,越来越多企业开始借助生成式AI,让模型解读图表、提取信息。然而问题随之而来:即使是目前最先进的视觉语言模型(VLM),在面对这些图表时也常出现错误——因为任务要求模型同时理解图像、数字以及语言逻辑,三重能力叠加,难度显著提升。换句话说,企业投入重金采购顶级模型,最终获取的仍可能是不准确、不完整的信息。

MIT开发图表理解AI训练数据集ChartNet

长期稳定更新的攒劲资源: >>>点此立即查看<<<

麻省理工学院(MIT)与MIT-IBM计算研究实验室的研究人员瞄准了这一短板,专门开发了一套针对视觉语言模型的训练资源,目标明确:让模型真正看懂图表。

研究团队走了一条新路——不再依赖从网络抓取的零散图片,而是自主生成数据。最终产出的数据集名为ChartNet,包含超过一百万张高质量图表图像,每张图均配有生成代码、文字描述以及带数值的数据表格。更为关键的是,每条数据还附有问答对,相当于手把手指导模型如何回答图表相关问题。如此一来,模型不仅能看,还能综合理解视觉、语言与数值三者之间的关联。

研究团队利用ChartNet训练了一系列开源视觉语言模型。测试结果令人瞩目:许多参数量远小于商业模型的模型,在数据提取与图表摘要等任务上,表现竟然超越了体型大出数倍的商业模型。这意味着预算有限的中小企业也有机会获得可靠的图表理解能力,不再被高价商用模型所制约。

“我们将ChartNet打造成一个‘一站式图表理解解决方案’——几乎覆盖了训练过程中可能用到的所有资源。”论文第一作者、MIT电气工程与计算机科学系研究生Jovana Kondic表示,“希望这项研究能激励更多人探索如何用更小的模型、更低的算力达到顶尖性能。”

论文合作者还包括来自MIT、MIT-IBM计算研究实验室与IBM Research的多位研究者:Pengyuan Li、Dhiraj Joshi、Isaac Sanchez、Aude Oliva和Rogerio Feris。相关成果将在IEEE计算机视觉与模式识别大会(CVPR)上正式发布。

数据瓶颈制约发展

自然语言处理与自然图像推理近年来进展显著,但图表理解始终是一块硬骨头。图表理解几乎是所有行业——尤其是金融行业——的刚性需求。金融行业对图表的依赖程度极高,几乎每一个决策环节都离不开它。若能自动从图表中提取趋势、识别数据,下游业务流程的效率将大幅提升。

问题在于高质量训练数据极度稀缺。现有数据集要么图表数量有限,要么来自互联网抓取,规模与质量均不足,模型难以从中真正学习。正如Kondic所说:“与人类不同,VLM可能需要观察几千个折线图示例,才能可靠地识别出什么是折线图。”研究团队选择用合成数据破局——算法生成的数据虽然是人造的,但能够模拟真实数据的统计特征。

ChartNet数据集包含超过一百万张高质量图表图像,每张图均配有生成代码、文字描述和数值表格。另有问答对用于训练模型正确回答问题。部分数据还带有专家标注,提供额外的图表类型与可靠性保证,可用于微调并提升特定场景下的模型性能。

Kondic表示:“这些额外的数据模态,其实是在引导模型将图表图像中分散的信息片段一一对应地关联起来。”

两步式合成数据生成流程

ChartNet的构建依赖一套两步式合成数据生成流水线。第一步,自动化系统将已有图表图像转译成代码;第二步,系统对代码进行迭代增强——更改图表类型、数据值、主题、颜色等属性,从一张种子图表出发即可生成数百种不同变体。正是这种“以一变百”的操作,支撑起上百万张多样化图像的规模。

当然,数量并非唯一追求。研究团队还嵌入了自动化质量审核流程,验证代码能否运行、渲染出的图像是否准确清晰。正如Kondic所说:“不仅要多样性,信息本身也要有意义地呈现。”

经过ChartNet训练后,研究团队在多项图表解读任务上展开系统评估,包括图表重建、数据提取、图表摘要与图表问答。结果一致表明:数据集全面提升了所有模型的准确率,小型开源模型在各项指标上持续优于体量更大的商业模型。

“很多以往的训练数据集只关注让模型回答图表相关的简单问题。我们想做的是超越这个局限,让数据支撑起全方位的图表理解。”Kondic说。

未来,研究团队计划继续扩充ChartNet,纳入更高复杂度的数据,同时积极吸收研究社区的反馈。本研究获得了MIT-IBM计算研究实验室的部分资助支持。

常见问题速览

Q1:ChartNet数据集包含哪些内容?

A:ChartNet数据集包含超过一百万张高质量图表图像,每张图均配有生成代码、文字描述和数值表格。此外还有问答对,部分数据带有人类专家标注,提供额外的图表类型与可靠性保证。

Q2:ChartNet是如何生成合成数据的?

A:采用两步式流水线:先自动化将现有图表图像转译成代码,再对代码进行迭代增强——修改类型、数据值、主题、颜色等属性,从一张种子图表可生成数百种变体。同时嵌入自动化质量审核,确保代码可执行、图像准确清晰。

Q3:用ChartNet训练的小型开源模型,真的能比大型商业模型效果更好吗?

A:根据测试结果,用ChartNet训练的小型开源模型在图表重建、数据提取、图表摘要与图表问答等任务上,确实显著超越了体量大出数个量级的商业模型。这意味着中小企业也能以较低成本,借助开源模型实现高质量的图表理解能力,降低AI应用门槛。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。