美团技术团队在ACL'26上精选6篇论文,涵盖大模型评测、复杂流程推理、数学竞赛优化、过度思考检测、强化学习优化及生成式推荐。CoreCodeBench、SOP-Maze、AMO-Bench等基准揭示了模型在编程、业务操作、数学推理中的短板;RCP检测器减少冗余思考;MASPO提升训练稳定性;FLR实现多维隐式推理。
ACL(Annual Meeting of the Association for Computational Linguistics)是计算语言学和自然语言处理(NLP)领域公认的国际顶级学术会议。自1962年创办以来,它始终是全球NLP研究者心中的标杆,汇聚了学术界与工业界最顶尖的智慧与最新成果。
今年,美团技术团队有多篇论文被ACL、SIGIR、ICML、KDD等顶级会议收录。我们从这些论文中精选了32篇,计划分5大专场进行解读。今天首先带来ACL收录的6篇论文,技术方向涵盖大模型评测、复杂流程推理、竞赛级数学思维优化、强化学习优化以及生成式推荐等。下面进入正文。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
CoreCodeBench:通过细粒度仓库级任务解耦代码智能
论文下载:PDF
这篇论文提出了一套名为CoreCodeBench的评测基准,专门用于评估大语言模型的编程能力。其核心思路是利用COREPIPE框架,从12个Python开源库中自动生成1,524个结构化编程任务。这些任务不仅涉及函数编写,还涵盖开发、修复、测试驱动开发等多种真实软件工程场景。关键亮点在于,该基准能够有效区分不同认知负载的任务,并动态调整任务复杂度。实验结果显示,其有效性达到78.55%,显著优于现有方法,并揭示出模型在不同任务类型上存在明显的“能力错配”现象。简而言之,模型可能在编写简单脚本时表现出色,但在修复复杂仓库级代码问题时就会暴露不足。CoreCodeBench还支持多任务组合评测,更贴近真实开发环境,为代码智能评估提供了更全面、更精准的度量标准。
SOP-Maze:评估大语言模型在复杂业务标准操作流程上的表现
论文下载:PDF
当前大模型被广泛用作各类智能体,但多数评测仍停留在“下指令、做决策”这类单一任务上。真实业务场景通常伴随复杂、严谨的标准操作流程(SOP)。模型能否严格遵循“说明书”执行任务?为回答这一问题,研究者基于真实业务数据构建了SOP-Maze测试集,包含来自23个复杂SOP场景的397个实例和3422个子任务。
论文将SOP任务分为两类:“侧根系统”(LRS)代表选项众多、需精准选择的“广”型任务;“主根系统”(HRS)则强调带有复杂分支、需深度逻辑推理的“深”型任务。测试结果表明,几乎所有先进模型在SOP-Maze上表现不佳。作者归纳出三类典型失败场景:一是“路线盲区”,模型难以完全遵循流程;二是“对话脆弱性”,无法处理真实对话中的细微偏差;三是“计算错误”,在复杂上下文中时间或算术推理经常出错。简单来说,这项工作对模型提出了“按复杂流程办事”的综合能力考试,暴露了当前模型在广度与深度兼顾方面的明显短板。
AMO-Bench:大语言模型在高中数学竞赛中仍面临挑战
论文下载:PDF
这是一个极其严格的评测。当顶尖大模型在AIME等数学竞赛上性能趋于饱和时,许多人认为AI距离“奥数金牌”已不远。但事实并非如此。这篇论文提出了更严苛的测试基准——AMO-Bench,包含50道人工命题、极高难度的数学推理题。三个设计原则确保了其“含金量”:第一,经专家验证,题目难度达到或超过国际奥数(IMO)水平;第二,所有题目完全原创,杜绝数据污染;第三,只要求最终答案,支持自动评测。结果令人深思:在26款大模型的评测中,表现最好的模型准确率仅为52.4%,绝大多数模型甚至不足40%。这一结果直观表明,尽管通过增加“测试时计算”展现了一定扩展潜力,但大模型在真正数学推理上仍有巨大提升空间,远未达到“毕业”水平。
思维的进化:通过推理动态分析追踪大语言模型的过度思考
论文下载:PDF
使用推理模型时,常会遇到模型在答案已明确后仍在“自言自语”,生成大量冗余思考过程的情况。这篇论文聚焦于这一“过度思考”现象。作者从两类推理动态入手分析:一是思维长度与答案内容之间的补偿关系,二是语义表示从探索到收敛的轨迹变化。基于这些发现,他们提出了关键概念——实例级推理完成点(RCP),用于区分答案形成前的有效探索与答案稳定后的冗余延伸。更实用的是,他们设计了一个RCP检测器,能够在AIME、GPQA等任务上有效减少生成token数量,同时基本保持模型准确率。这意味着,我们或许可以帮助模型“戒掉”不必要的思考,使其更快、更果断地给出答案。
MASPO:统一梯度利用、概率质量和信号可靠性以实现鲁棒且样本高效的大语言模型推理
论文下载:PDF
这篇论文针对大模型推理后训练中的强化学习优化问题。在可验证奖励的强化学习(RLVR)场景下,现有GRPO等方法在训练稳定性和样本效率上存在不足。问题的根源在于,它们依赖固定、对称的硬截断信任域,与token的长尾分布、稀疏奖励以及正负样本的可靠性差异不匹配。
针对这些问题,MASPO提出三大创新:
实验证明,在多个数学推理基准和不同模型规模上,MASPO相比基线获得了更优的Avg@32与Pass@32表现。这意味着训练过程更鲁棒,模型面对复杂推理任务时上限更高。
基于分解式隐式推理的生成式推荐
论文下载:PDF
最后一篇论文关注生成式推荐。在推荐任务中,现有隐式推理方法通常使用单一隐向量表征用户意图。但用户偏好往往是多维的——例如,用户可能既喜欢科幻片,又偏爱喜剧片,还对某位导演的作品情有独钟,这些偏好很难用一个“小盒子”完全装下。
本文提出的FLR方法将隐式推理分解为多个语义解耦的偏好因子,并引入轻量级多因子注意力模块,在隐式思维空间中进行多维推理。为避免训练不稳定,他们还提出了FLR-GRPO,利用噪声注入与无噪声组内对比实现稳定对齐。在Amazon数据集上,FLR相比最强基线LatentR3平均提升3.2%,其中Games子集提升高达10.26%。该方案使隐式推理变得语义透明,推荐效果更佳。
识别图上二维码或点击报名
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述