首页 > AI教程 >谷歌8月论文揭秘o1:大模型软件无护城河

谷歌8月论文揭秘o1:大模型软件无护城河

来源:互联网 2026-07-20 06:18:15

谷歌DeepMind研究揭示,优化大模型测试时计算比扩大参数规模更高效,通过自我修订和搜索策略,计算最优扩展可在特定条件下节省四倍资源。问题难度决定方法有效性。该发现与OpenAIo1原理一致,表明软件层面难有护城河,硬件或成关键壁垒。

有人由此感慨:

谷歌8月论文揭秘o1:大模型软件无护城河

长期稳定更新的攒劲资源: >>>点此立即查看<<<

就在刚刚,OpenAI 将 o1-mini 的推理速度提升了 7 倍,每日可用 50 条;o1-preview 则提升至每周 50 条。

谷歌8月论文揭秘o1:大模型软件无护城河

计算量节省 4 倍

谷歌 DeepMind 这篇论文的标题直截了当:优化 LLM 测试时计算,比扩大模型参数规模更高效。

这一思路值得关注。人类面对复杂问题时,会花更长时间思考以改善决策,那么大语言模型是否也能借鉴这一方式?换言之,面对复杂任务时,能否让 LLM 更有效地利用测试时的额外计算资源,从而提升准确性?

此前已有研究论证过该方向可行,但效果有限。因此,本次研究希望明确:在仅动用较少额外推理计算的情况下,模型性能究竟能提升多少?

研究团队设计了一组实验,使用 PaLM2-S* 在 MATH 数据集上进行测试。主要分析了两种方法:一种是迭代自我修订——让模型多次尝试回答一个问题,每次尝试后自动修订,以获取更优答案;另一种是搜索——模型生成多个候选答案,然后从中择优。

谷歌8月论文揭秘o1:大模型软件无护城河

从结果来看,使用自我修订方法时,随着测试时计算量增加,标准最佳 N 策略(Best-of-N)与计算最优扩展策略之间的差距逐渐拉大。而使用搜索方法时,计算最优扩展策略在初期优势明显,并且在特定条件下,能达到与最佳 N 策略相同的效果,但计算量仅为前者的四分之一。

接下来,研究团队还进行了 FLOPs 匹配评估:将采用计算最优策略的 PaLM 2-S* 与一个 14 倍大的预训练模型(不进行额外推理)进行对比。结果发现,使用自我修订方法时,当推理 token 数量远小于预训练 token 数量,测试时计算策略的效果优于纯预训练。但随着比例增加或问题难度上升,预训练的优势又会重新显现。

简而言之,问题难度是决定不同测试时计算扩展方法是否有效的关键因素。

研究进一步比较了不同的 PRM 搜索方法,结果显示,前向搜索(图中最右侧)所需的计算量更大。

谷歌8月论文揭秘o1:大模型软件无护城河

在计算量较少的情况下,使用计算最优策略最多可节省 4 倍的资源。

谷歌8月论文揭秘o1:大模型软件无护城河

与 OpenAI 的 o1 模型相比,该研究得出的结论几乎一致。o1 模型学会了完善自己的思维过程,尝试不同策略,并识别自身错误。而且随着更多的强化学习(训练时计算)和更长的思考时间(测试时计算),o1 的性能持续提升。唯一的区别在于,OpenAI 抢先一步发布了模型,而谷歌使用的是 PaLM2,在 Gemini2 上尚未有更新的发布。

网友:护城河只剩下硬件了?

这一新发现不禁让人回想起去年谷歌内部文件中提出的观点:各家研究速度都很快,谁也无法确保永远领先。唯一的护城河,或许只剩下硬件了。

谷歌8月论文揭秘o1:大模型软件无护城河

(所以马斯克在大力建设算力中心?)

有人表示,目前英伟达直接掌控着谁能拥有更多算力。但如果谷歌或微软开发出效果更好的定制芯片,局面又将如何演变?

谷歌8月论文揭秘o1:大模型软件无护城河

值得一提的是,近期 OpenAI 首颗芯片曝光,将采用台积电最先进的 A16 埃米级工艺,专为 Sora 视频应用打造。显然,大模型这场竞争,单靠优化模型本身已经不够了。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。