OpenAI发布o1模型,在博士级别测试中物理得分高达92.8,但生物学和化学表现较弱。三位博士测试认为,o1在物理问答上达到高年级博士水平,但缺乏创造性,回答偏科普,且存在编造文献问题。
今天凌晨,OpenAI 毫无预兆地放出了大家期待已久的新模型。此前,外界从 CEO 奥特曼的推文里猜测,这个模型会叫“草莓”。结果,最终登场的名字是 OpenAI o1 模型。

长期稳定更新的攒劲资源: >>>点此立即查看<<<

奥特曼的评价很高——这是他们迄今为止最强、最一致的模型。

从官方给出的数据图看,o1 模型在国际数学奥林匹克竞赛、编程竞赛,以及博士级别的科学问题上,提升非常明显。图中最左侧是 GPT-4o,中间是已经开放预览的 o1,最右边高高的红色柱子则是满血版 o1。几乎每项指标,o1 对比前辈都有接近 8 倍的提升。

更让人感到可怕的是:OpenAI 说自己专门请了博士专家一起答题,结果在博士级别的测试中,o1 得分 78,人类得分 69.7——AI 超过了人类专家。

那么,人类一败涂地了?
为了摸清 o1 预览版的真实能力,编辑部请来了三位不同领域的博士,分别是生物学、物理学和材料化学方向,让他们向 o1 提问并给出打分。
先说结果:南京大学物理学博士崔博士,对 o1 的评价最高,认为它已经达到了 60-80 分的水平(满分 100 分),有些问题甚至能打到 90 分。
崔博士的研究方向是量子光学。他问的第一个问题是:远距离纠缠光子分发,有什么克服白噪声的办法?思考 9 秒后,o1 给出了 10 点可行措施。

崔博士评价:“答案列举全面,符合现有最新研究进展,对知识储备不足的人有调研方向价值。但对高级别专业人员来说,属于科普级别,没有提供真正有用的信息。”
评分 80 分。值得注意,o1 回答中提到的“自适应光学”方向,是今年最新的 Science 成果,这说明 o1 的回答具有先进性。
崔博士接着追问:“是否可以扩展到量子自适应光学?”o1 思考 19 秒后作答。

这次,崔博士给了 90 分:“这个回答对我也有提示性。虽然不具体,但对我们只需要指个可能的方向,剩下的我们自己来调研思考。”他还提到,o1 的回答触及了他的知识薄弱区,有些概念他只是简单理解,但 o1 说的内容他认为是有道理的。
对比之下,对于老版本模型相同问题的作答,崔博士的评价是不及格或 60 分。
不过,在涉及实验细节的问题上——比如基于非线性相互作用产生的高纯度解关联单光子的自关联函数,在连续泵浦和脉冲泵浦下如何测量?——崔博士认为 o1 的回答中规中矩,只能给 75 分。
总体来说,在物理方面,o1 相比老版本提升约 20 分。
再看看北京大学材料化学博士 K 博士的评价。K 博士围绕 Fe-N4 材料问了一系列问题,o1 给出了很长的回答。

整体测试后,K 博士的评价也差不多:可能有研究生水平,但深入认知和给方案的能力比较弱,主要针对已知内容作答。比如问你如何调节 Fe-N4,o1 能说出基于电子态调节,但具体怎么调节就卡壳了。相比 GPT-4o,o1 没那么胡说八道,但在具体问题上两者都给不了太多建议——老版本是丧失细节乱编,新版本则是能力有限就会词穷。
最后是清华大学生物学博士信博士的测试。他问的是:“如何从质谱数据集中区分赖氨酸残基的乳酰化和羧乙基修饰?”o1 给了一段非常长的回答,有些像综述,后面还贴了参考文献。

但出乎意料的是,信博士发现参考文献是编的——那篇论文根本不存在。不过,总体而言,信博士还是觉得 o1 比之前的 AI 强了不少,理解能力明显增长,编的时候也编得很像样子。

这个结果并不意外。根据官方数据,o1 在物理上的得分高达 92.8,远超其他两门学科,或许这就是崔博士对它如此看好的原因。

综合来看,要说 o1 已经超越专业博士水平,三位博士都认为还得缓缓。
崔博士直言:现实科研工作中,多数时候学者们还得自己动手,AI 只能提供大致方向,花钱买这种细致的 AI 意义不大。他更推荐本科生使用这个 AI;如果是硕博阶段,o1 的回答并不符合导师标准,组会上肯定要挨批。
信博士也持同样看法。抛开幻觉编造文献的问题,就专业程度而言,o1 的回答只能糊弄大同行——同一大学科里方向不同的人。在小同行,专业研究这个方向的人眼里,o1 的毛病非常明显。
K 博士则谈得更深入:AI 在认知上有了硕士生水平,但只是个缝补匠,谈不上创造性成果。创造性这一点,AI 远远比不上硕博的水平,这也是 AI 需要解决的重要问题。
从博士们的评价中,我们似乎抓住了一个重点:o1 之所以更强,是因为它有了更高维的认知和思考模式。
这正是本次更新的核心。OpenAI 在解释 o1 原理的文章中表示,o1 变强主要是用上了长思维链(Chain of Thought, CoT),而不是传统的提示链(Prompt chain)。
说人话就是:它改变了以往那种你问我答的思考方式。
以前的大模型,就像下意识出答案——你问天是什么颜色,它想都不想,秒答蓝色。这需要它本来就知道这个知识点,然后直接反应。而长思维链的意思是,它不仅知道蓝色,还能自己推一遍为什么是蓝色——什么大气散射、光谱波长都要考虑进去。

这要求 AI 得有实打实的构建逻辑、推理论证的能力。换句话说,它不仅要长脑子,还要动脑子。
思维链这个概念是 2022 年谷歌提出的,但 OpenAI 这次是第一个实现的。现在,你与 o1 对话,除了收获答案,还可以展开查看它解答问题时的思维逻辑——它的思考是具象化的,不是黑盒。
以崔博士提问的那个问题为例,o1 的思考过程如下:

当我们询问崔博士这个思考过程是否合理时,他表示:“合理,达到了博士级别,还是高年级博士级别。”
所以,o1 模型在物理学问答上表现更出色,就是因为它的思维链达到了博士水准,会像博士一样思考物理问题。同理,它在生物学、化学上表现相对不佳,很可能是思维链还没训练到最佳状态。但从物理学的表现来看,等训练愈发成熟,o1 会变得更强。可以期待一下正式版的发布。
最后放一个小彩蛋。
思维链虽然让 o1 能像博士一样思考,但在基础问题上似乎训练得还不够全面。我们发现,它在简单问题上依然会犯低级错误。

它思考了 12 秒之后,自信地告诉我们:8.11 比 8.9 大。
怎么说呢,博士也会犯错,没毛病。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述