高质量数据集已成为驱动人工智能发展的关键变量。全国已建成12万个高质量数据集,总体量超1565PB。下一步将实施六大行动构建服务AI的高质量数据供给体系,推动竞争从卷算法算力转向卷数据。
高质量数据集,眼下已经成了AI发展的“硬通货”。
在7月18日举行的2026世界人工智能大会“语料筑基、智生时代”语料创新论坛上,国家数据局局长刘烈宏给出了一个明确判断:随着人工智能从通用基础大模型向行业大模型纵深拓展、从数字模拟向物理交互跃迁、从感知认知向自主决策执行演进,高质量数据集的重要性正在急剧上升——它已经不再是辅助变量,而是驱动AI发展的关键变量。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
刘烈宏在论坛上分享了一组硬核数据:截至今年6月底,全国已建成高质量数据集12万个,总体量超过1565PB;七个数据标注先行先试城市的标注规模超过119PB,服务了425个大模型研发。下一步,国家数据局将深入实施强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放六大行动,进一步构建服务人工智能的高质量数据供给体系。同时,刘烈宏特别提到,希望上海继续发挥排头兵作用,积极推进“模数共振”,为全国的人工智能高质量数据集建设提供示范。

上海信投副总裁、库帕思科技董事长山栋明则从产业视角补充道,AI 2.0时代的模型正在发生深刻变革——大参数、多模态模型依然是行业竞争的焦点,但一个不容忽视的趋势是,面向行业落地的小参数生产力模型正在成为重要方向。换句话说,模型的发展不再一味追求“大”,而是开始向细分赛道延伸,往更实用、更落地的方向走。
山栋明进一步指出,无论是模型持续攀高还是应用落地,竞争焦点都在从“卷算法、卷算力”转向“卷数据”。而这一转变的核心在于,数据必须紧扣AI-Ready标准。在应用层面,AI正从简单的“你问我答”向复杂的“任务执行”演进,这背后,底层的工程方法论也在被重塑——不只是数据量的问题,更是数据质量和可用性的问题。
论坛上,语料运营公共服务平台2.0正式发布。这个平台首创了“筛选-转换-合成”三层十级数据进化路线,集成了Kupas Camp语料FDE工程平台、老师傅语料工程化平台和“语匠”专家众包网络,形成了从规划咨询、产品设计到数据工程实施的体系化能力。它的核心价值在于,把行业专家的潜知识(那些藏在经验里的隐性知识)转化为可用、可调用、可评测的显知识,重新定义了数据新基建的内涵。
与此同时,大会新增发布了15项团体标准和2项行业标准,覆盖高端装备、消防、医疗专病、艺术人才培养、国际物流供应链、文物、钢铁、合成数据和大模型数据集开发管理等方向,贯穿语料采集、清洗、标注、评测、应用和运营管理全流程。可以说,这是真正做到了“一业一方法、一业一指引”,让语料建设有章可循。

面向AI4S(人工智能驱动科学发现)发展,科学数据服务AI4S可持续发展倡议正式发起。倡议明确指出,高置信、过程型、全样本的科学数据是AI重塑科学计算和科学发现的重要基石。未来,将围绕流程重塑、标准引领、价值对齐和平台创新四个方面协同发力,推动科学数据从采集、预处理、标注、对齐到流通、使用的全流程贯通,让科学智能数据向AI-Ready迈进,并向Agent-Ready演化。
大会还同步进行了CICC语料数据智能创意大赛和语料风云榜的颁奖仪式,并正式启动了“DARE GO达·高”跨领域高价值语料数据征集计划。可以说,整个论坛不仅释放了政策信号,也展示了从平台、标准到实践的全链条布局——高质量数据集建设的时代,真的来了。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述