OpenAI发布o1模型,在数学和编程能力上大幅提升,采用思维链和强化学习技术,实现推理阶段的ScalingLaw。但成本高昂、技术壁垒不高,更像依赖模式匹配的“小镇做题家”。其核心价值在于推理能力与知识解耦,预示AI能力稀疏化趋势。
拖了快一年,从Q*到草莓,再到AGI和GPT5的传闻满天飞,核心团队都快被熬走了,OpenAI终于在9月12日推出了o1。预览版o1-preview和小尺寸的o1-mini同时开放,这个被寄予厚望的产品,注定不只是个版本更新——它带来的影响,需要从多个维度去观察。

免费动漫立即观看: >>>点此进入<<<
这波能力提升确实比较显著。与GPT-4o相比,o1-preview在数学和编程上的能力直接提升了5倍以上,尚未完全放出的o1更是超过了8倍。在博士级别的科学题目上,其正确率已经超过了人类专家水平。在国际数学奥林匹克资格考试中,GPT-4o只解决了13%的问题,而推理模型一口气拿到了83%。编程方面,在Codeforces竞赛中超过了89%的人类选手。看到这些数字,就不难理解奥特曼之前对实现AGI的那股自信了。
实际操作中,新模型的推理过程与以往明显不同。界面上多了一个可开关的“显示思路”(Show chain of thought)框,里面是整个思考过程。这就像人类面对难题时会先深思熟虑一样——o1会把问题拆开,一步一步地推敲,每一步都反复检查,发现错了就换条路继续。这种“慢思考”的方式,极大提升了推理能力。


在这些激动人心的数字背后,一系列被猜测了很久的技术进展也终于被验证了。
思维链(Chain of Thought,CoT)这项技术,两年前就已经在几篇经典论文里展现过威力了。简单说,就是在问大模型问题前,先在提示词里放几个包含思考过程的问答示例(Manual CoT),模型就能在推理任务上大幅提升。

后来《Large language models are zero-shot reasoners》这篇论文提出,直接先来一句“Let's think step by step.”(也就是后来大家说的“一步一步慢慢来”这咒语),就能让模型自己生成推理过程(Zero-shot CoT)。

再后来,《Automatic Chain of Thought Prompting》把两者结合了:先用咒语生成推理过程,再把这些过程塞进提示词里当示例,既省事又靠谱。

这之后CoT又经历了各种变种,但核心思路都是通过提示词去诱导模型分步思考。于是人们自然就会想:能不能让大模型自己学会这种方法?
这就要提到强化学习了——就像当年的Alpha-Zero,强化学习就是让机器通过跟环境交互、观察结果来调整自己的行为策略。但之前这招很难用在语言模型上。直到2022年斯坦福大学提出了“自学推理”(STaR)方法:先给模型一些例题的详细解法,再让它学着解更多题,做对了就把方法补充到例题里,形成数据集,再对原模型微调。

后来在此基础上又进化出了“安静的自学推理”(Quiet-STaR),也就是传说中的Q*。核心是:在每个输入token后面插入一个“思考”步骤,让模型生成内部推理,然后系统评估这些推理对预测后续文本有没有帮助,并相应调整模型参数。这样模型在处理各种文本时都能进行隐含的推理,不只是回答问题。

用通俗的话讲,就是在大模型训练时就教它一些套路——当然这些套路也是模型自己生成并优选的。思考时直接按题型选套路、分解问题、按步骤执行、反复审核,不行就换个套路。这跟教小学生奥数那套思路很像。不过这种自学习机制,因为奖励模型比较复杂,通常只在数学和代码领域表现比较好。
以上技术结合的结果就是:预训练阶段没什么变化,但推理阶段的计算量大大增加了。原来追求“快思考”,现在故意放慢速度,以求更准确的结果。

OpenAI提到,他们训练中发现一个现象:随着更多的强化学习(训练时计算)和更多的思考时间(推理时计算),o1的性能能持续提高。

英伟达AI领导者Jim Fan在X上点评说:模型不再只有训练时的scaling law,还拥有了推理层面的scaling law。双曲线共同增长,将突破之前大模型能力的瓶颈。他感叹:“之前,没人能将AlphaGo的成功复制到大模型上——使用更多的计算让模型走向超人能力。目前,我们已经翻过这一页了。”
可以预见,在预训练边际成本递减的背景下,基于强化学习的推理增强会越来越受到重视,也会有更多的算力被投入到推理阶段。全球人工智能芯片和算力的需求还会继续增加。
不可否认,o1代表了人工智能领域的一次重要进步。但回头看看过去一年奥特曼的言行,以及OpenAI的组织架构和核心团队变化,不免让人有些疑虑:这个故事会不会有些夸大其词?有没有可能借助一系列小技巧,来维持公司估值的增长和资源的获取?
无论是Sora还是o1,其实都是基于已有科研成果的工程创新,并没有多高的技术壁垒。OpenAI最大的贡献还是坚定而不计成本地率先实践。跟Sora一样,一旦方向明确,工程复现大概率只是时间问题。而OAI在所有方向上卷赢全球,几乎是不可能完成的任务。更何况,以这几周全网的测试情况来看,模型效果只能说差强人意,很多场景下还不如其他工程手段下的思维链结果(比如Claude3.5),甚至经常只是概率稍大的抽卡,实用价值还很难说。另外,也许是为了避免友商窥探抄袭,或者是因为开放的思维过程存在安全性问题,OpenAI并未向用户开放整个思维链细节。但已经有研究者在很短时间内宣称复现了类似的推理能力。
可以想象,后面各大厂商都会开始卷推理,陆续推出“深思熟虑”版的模型,快速拉齐水平。如果OpenAI后面再没有拿得出手的底牌,仍然难以扭转本轮模型竞赛到顶的困境。
去年已经基本完成的模型拖了这么久才面世,除了众所周知的安全原因外,很可能是因为o1和Sora一样,算力消耗过大,并不具备大规模商用的可行性。面对这一挑战,奥特曼团队一直在尝试寻找解决方案。他们等了很长时间,希望算力成本能随技术进步下降,同时在全球四处融资,购买或租赁更多的计算资源。然而即使这样,推出的产品单次推理动辄需要数分钟甚至数十分钟,单价高出4o数倍,token消耗也经常提升数倍。
这导致了一个尴尬的局面:科研贡献暂时远大于商业价值。在这样的背景下,OpenAI的行业地位和估值能否维持,变得相当不确定。高昂的研发和运营成本,加上商业化受阻,可能会影响投资者的信心和市场预期。
如果说前面两点商业视角的质疑对一路引领的OAI有些不公平,那么这个方法是不是真的如其所说,能达到甚至超过各STEM领域的“博士水平”?其实也值得进一步讨论。从原理上看,这种思路还是在“大力出奇迹”的Scaling Law基础上继续叠加buff——引入类似蒙特卡洛树搜索这样的暴力方法多路径尝试推理,某种意义上是用文科方法解决理科问题。类似于之前的AutoGPT类应用,面向复杂问题,如果不对思维链的搜索空间进行严格限制和引导,可能会陷入漫无边际的发散,消耗大量算力仍然得不到结果。
正如前面提到的,这种方法有点像面向普通学生的“普奥”中常用的套路式教学——更多依赖记忆和模式匹配,而非对问题本质的深刻理解和创造性思维。就拿9.11和9.8谁大这种问题来说,它还要琢磨半天,还有相当大概率答错。这种方法培养出的AI,恐怕更像一个只会刷题刷分的“小镇做题家”,而非真正具有洞见和创新能力的“博士”——毕竟只有“做题”过程的训练数据好找。
诚然,现实中大量科研工作确实涉及重复性、机械性的任务,这部分如果由AI承担,能极大提高效率。但科研的核心在于创新,在于对未知问题的探索和新知识的发现。这需要灵感、创造力和逻辑推理能力,而不是单纯的计算能力。
正如《Large Language Monkeys: Scaling Inference Compute》一文所指出的:仅仅通过增加生成样本来扩展推理计算,本质上并没有改变大型语言模型的基本属性——它仍然是一个基于统计概率“打字”的“猴子”。要实现真正的通用人工智能,实现在科学领域的突破性进展,我们可能需要在算法和架构上寻求更加本质的创新,而不是简单地堆砌算力。

前面夸也夸了,踩也踩了。但从更深层面看,这些都不是o1最重要的价值。虽然OpenAI官方可能没重点强调,但在材料中多次提到一个关键点:o1更适用于科学、编码、数学这类复杂问题中的繁琐工作,尤其是多步归纳或演绎推理。比如,“医疗保健研究人员可以用o1注释细胞测序数据,物理学家可以用o1生成量子光学所需的复杂数学公式,所有领域的开发人员可以用o1构建和执行多步骤工作流程。”
以前我们对人工智能的期待,往往是一个模型既有知识,又有智力,甚至还要有情感和创意——结果就是模型参数量和算力不断攀升。但也许这些目标需要用不同的方法去解决,有些还可能是非技术方法。o1的未来也许确实会以某种方式提升多模态模型的世界理解能力,但其核心价值,恰恰是一个与世界知识大幅解耦的推理模型。这一点在o1-mini上体现得更彻底:作为低成本小模型,它尤其擅长编程这种不需要太多世界知识的多步严谨推理。
人类学习的过程,是先大量学习知识,通过神经元大量激活和连接形成智力,而具体知识往往会被忘记——有点像张无忌学太极拳的过程。解决不同问题时,除了语言理解和逻辑推理能力,还需要可信知识的查阅引用、灵感创意的涌现、情感的人际连接和感应……人工智能也不会只是一个大模型,而会变得越来越“稀疏”、灵活,甚至是一套人机协同的新机制。“做题”能力肯定是必要的,但学会了做题,离解决实际问题还有相当长的距离。
o1的出现,或许预示着这样一个“能力稀疏化”的趋势。未来的人工智能,会从单一的大模型,逐渐演化为知识、推理、创意、情感等不同能力模块的灵活组合,并与人类形成更加紧密和高效的协作。o1只是一个开始,期待百花齐放的未来。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述