首页 > 科技数码 >阿里开源首个统一科学大模型LOGOS

阿里开源首个统一科学大模型LOGOS

来源:互联网 2026-08-03 10:26:14

阿里与中国人民大学联合开源首个统一科学大模型LOGOS,仅1B参数便在六大科学任务上超越微软8×7B模型。通过构建44.87B多模态语料库和共享词表,将蛋白质、小分子等异构对象编码为统一序列,实现跨领域通用,并创新采用文字描述法处理3D空间互作。

大模型如何重塑科学研究底层逻辑

科学研究的底层逻辑正在被大模型悄然改写。过去几年,AI在各个细分科学领域虽然屡有突破,但一个尴尬的现实是:模型往往是“专才”,换一个分子、换一个研究环节,就得重新训练一套系统。这种各自为战的局面,终于迎来了一个潜在的破局者。

LOGOS:基于统一科学语法的多领域基础模型

阿里 ATH-Token Foundry 与中国人民大学高瓴人工智能学院联合推出的 LOGOS——全称 Language Of Generative Objects in Science,正是冲着这个痛点而来。这个被定位为“基于统一科学语法”的多领域基础模型,今天正式开源,并在六大代表性科学任务上,以纯序列建模范式一致性地匹配甚至超越了那些领域专用方法。

长期稳定更新的攒劲资源: >>>点此立即查看<<<

阿里开源首个统一科学大模型LOGOS

1B参数击败8×7B:参数效率才是硬指标

LOGOS 在六大任务上展现了出人意料的通用能力。这里的“出人意料”,很大程度上源于它极低的参数量——仅 1B 的模型,就在多个任务上超越了拥有 8×7B 参数的微软 NatureLM。换句话说,参数量只有后者的 1/56,效果却能打平甚至反超。这种参数效率,才是真正值得关注的硬核指标。

44.87B token多模态语料库:覆盖七大科学模态

那么,LOGOS 是怎么做到的?

首先,它在训练阶段构建了一个庞大的多模态语料库,共计 44.87B token,横跨7类模态——从蛋白质(28.9B token)、抗体(3.0B token)、小分子(2.1B token),到化学反应与 MOF 材料(0.47B token),再到蛋白质口袋(5.8B token)以及蛋白口袋-配体复合物(4.6B token)。这意味着模型在预训练阶段就同时“阅读”了生物、化学、材料三大领域的核心语言。

阿里开源首个统一科学大模型LOGOS

共享词表:让蛋白质、小分子、晶体说同一种“科学语法”

但存储量大只是一方面。最关键的设计在于,它建立了一套共享词表——把蛋白质序列、小分子 SMILES 结构、材料晶体参数这些原本“鸡同鸭讲”的异构对象,全部编码成统一的离散 Token 序列。这种方案的好处是,所有科学对象可以在同一个生成空间中,被大模型以自回归的方式理解和生成。本质上,它们说的不再是各自的行话,而是同一种“科学语法”。

3D空间互作“语法化”:无需坐标,仅凭文字描述建模

更妙的是对3D空间互作的处理。传统的做法,要让模型理解蛋白质与小分子如何结合,必须依赖显式的3D坐标和复杂的几何神经网络。而 LOGOS 发明了一种“文字描述法”。它将3D空间的接触模式直接“语法化”为离散 Token,模型根本不需要输入3D坐标。它只需要“读文字”——也就是进行序列预测——就能在内部构建出复杂的3D互作规律。这就好比用自然语言描述一幅立体画,不再需要你拥有立体视觉,描述本身就暗含了空间结构。

阿里开源首个统一科学大模型LOGOS

形式-目标对齐:抹平预训练与下游应用的鸿沟

传统科学AI存在两个绕不开的障碍:一是“专病专药”,从一个研究环节切换至另一个环节,比如从结构预测换到分子生成,就得换模型、换假设;二是“学用脱节”,预训练目标和实际应用之间隔着一条鸿沟,模型落地时免不了大量微调。 LOGOS 的科学语法设计恰好把这两点同时解决了。

在形式上,预训练数据的序列形式就等于下游任务的输入输出形式;在目标上,预训练阶段的 next-token prediction 与下游的条件生成任务完全对齐。这种 form-objective alignment 意味着,模型在预训练时学什么,下游就用在什么地方,两者之间的 gap 几乎被抹平,复杂的适配层或大量微调也就变得不再必要。

知识共享能力:模型学会“翻译”而非“背诵”

统一语法带来的另一个深层好处是知识共享。举个直观的例子:模型在看到蛋白质的“方言”——比如某个氨基酸口袋序列时,可以直接“翻译”出对应小分子的“方言”,也就是 SMILES 结构。这证明它真的不是在机械对比表面特征,而是在底层学会了两类科学对象之间的对应关系。它掌握了“翻译”能力,而不仅仅是“背诵”。

全面开源:模型权重、推理代码与技术报告现已发布

目前,LOGOS 的模型权重、推理代码与技术报告已经全部开源,访问 HuggingFace、GitHub 或阅读 arXiv 论文即可获取全部资料。如果你正在构思大模型如何科学化落地,这个项目值得仔细推敲一番。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备2026025700号-3 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。