谷歌DeepMind研究揭示,优化大模型测试时计算比扩大参数规模更高效,通过自我修订和搜索策略,计算最优扩展可在特定条件下节省四倍资源。问题难度决定方法有效性。该发现与OpenAIo1原理一致,表明软件层面难有护城河,硬件或成关键壁垒。
有人由此感慨:

长期稳定更新的攒劲资源: >>>点此立即查看<<<
就在刚刚,OpenAI 将 o1-mini 的推理速度提升了 7 倍,每日可用 50 条;o1-preview 则提升至每周 50 条。

谷歌 DeepMind 这篇论文的标题直截了当:优化 LLM 测试时计算,比扩大模型参数规模更高效。
这一思路值得关注。人类面对复杂问题时,会花更长时间思考以改善决策,那么大语言模型是否也能借鉴这一方式?换言之,面对复杂任务时,能否让 LLM 更有效地利用测试时的额外计算资源,从而提升准确性?
此前已有研究论证过该方向可行,但效果有限。因此,本次研究希望明确:在仅动用较少额外推理计算的情况下,模型性能究竟能提升多少?
研究团队设计了一组实验,使用 PaLM2-S* 在 MATH 数据集上进行测试。主要分析了两种方法:一种是迭代自我修订——让模型多次尝试回答一个问题,每次尝试后自动修订,以获取更优答案;另一种是搜索——模型生成多个候选答案,然后从中择优。

从结果来看,使用自我修订方法时,随着测试时计算量增加,标准最佳 N 策略(Best-of-N)与计算最优扩展策略之间的差距逐渐拉大。而使用搜索方法时,计算最优扩展策略在初期优势明显,并且在特定条件下,能达到与最佳 N 策略相同的效果,但计算量仅为前者的四分之一。
接下来,研究团队还进行了 FLOPs 匹配评估:将采用计算最优策略的 PaLM 2-S* 与一个 14 倍大的预训练模型(不进行额外推理)进行对比。结果发现,使用自我修订方法时,当推理 token 数量远小于预训练 token 数量,测试时计算策略的效果优于纯预训练。但随着比例增加或问题难度上升,预训练的优势又会重新显现。
简而言之,问题难度是决定不同测试时计算扩展方法是否有效的关键因素。
研究进一步比较了不同的 PRM 搜索方法,结果显示,前向搜索(图中最右侧)所需的计算量更大。

在计算量较少的情况下,使用计算最优策略最多可节省 4 倍的资源。

与 OpenAI 的 o1 模型相比,该研究得出的结论几乎一致。o1 模型学会了完善自己的思维过程,尝试不同策略,并识别自身错误。而且随着更多的强化学习(训练时计算)和更长的思考时间(测试时计算),o1 的性能持续提升。唯一的区别在于,OpenAI 抢先一步发布了模型,而谷歌使用的是 PaLM2,在 Gemini2 上尚未有更新的发布。
这一新发现不禁让人回想起去年谷歌内部文件中提出的观点:各家研究速度都很快,谁也无法确保永远领先。唯一的护城河,或许只剩下硬件了。

(所以马斯克在大力建设算力中心?)
有人表示,目前英伟达直接掌控着谁能拥有更多算力。但如果谷歌或微软开发出效果更好的定制芯片,局面又将如何演变?

值得一提的是,近期 OpenAI 首颗芯片曝光,将采用台积电最先进的 A16 埃米级工艺,专为 Sora 视频应用打造。显然,大模型这场竞争,单靠优化模型本身已经不够了。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述