7月17日,2026世界人工智能大会期间,中国科学院文献情报中心牵头发布“敖仓·科技语料库”。该国家级基础设施整合超320PB科学数据、1.5亿篇论文等,采用“1+7+N”总分库模式,覆盖多学科,支撑科研及商业航天、生物医药等上百个场景。
7月17日,2026世界人工智能大会期间,中国科学院文献情报中心牵头建设的“敖仓·科技语料库”正式亮相。这一国家级科技语料基础设施的发布,标志着我国在支撑人工智能高质量发展的新型基础设施上,终于迈出了关键一步。
高质量科技语料如今已成为驱动科研范式变革的战略性稀缺资源。它并非简单的数据堆砌,而是通过对多模态科学数据和科技文献进行深度加工、关联融合,形成高知识密度的“智能就绪”数据——直接决定AI能为科研带来多大助力。中国科学院文献情报中心主任曲建升指出,中科院本身拥有国内最大的科学数据产出与储备体系、最全的科技文献保障体系,加上跨学科的专业化加工能力,为国家级语料库建设打下了扎实基础。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
目前,“敖仓”的数据来源相当可观:超过320PB的科学数据、1.5亿篇科技论文、1.2亿件发明专利、500万本科技图书,涵盖文本、图像、公式、化学式等各种形态。整个语料库采用“1+7+N”总分库模式——一个全学科数据知识融合的国家级总库,七个专业化深度提炼的领域分库,加上N个场景化关联的应用子库,覆盖数学物理、化学化工、天文空间等多个学科,形成完整的科技语料供给体系。
除科研场景外,该语料库还瞄准商业航天、低空经济、智能制造、生物医药等热门领域,提供语料加工服务。下一步,它要支撑的行业应用包括元器件选型、超微病理诊断、高速列车外形设计等,至少上百个场景。
“敖仓·科技语料库”将坚持“共建、共享、共用”的原则,持续强化高质量语料加工能力,培育科技语料生态,为国内乃至全球的科技创新出一份力。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述