首页 > AI教程 >开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

来源:互联网 2026-07-15 18:41:14

开源模型Reflection70B通过反思调优技术自我纠正推理错误,在GSM8K数学测试中取得99.2分,超越GPT-4o。其权重已公开,由小团队开发并获Meta算力支援,下周将发布405B版本,该技术使模型具备自我反思能力,大幅提升数学推理准确性。

模型一上线,网友的试玩请求就把服务器挤爆了,Meta甚至主动支援了更多算力来应对这股热潮。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

长期稳定更新的攒劲资源: >>>点此立即查看<<<

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

有网友测试发现,Reflection 70B居然能答对GSM8K数据集中那些本身答案就标错的问题:

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

数字母r这种小把戏更是不在话下,连"drirrrngrrrrrnnn"这种生造词里有多少个r,它都能数得清清楚楚。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

不少网友都惊叹:一个小团队做出来的开源模型,居然能超越顶流闭源?现在最强开源模型已经可以在本地运行了。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

关键是70B版本还只是个开始,官方表示下周会发布更大的Reflection 405B。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

Reflection 70B的权重已经公开,API访问今天晚些时候将由Hyperbolic Labs提供。

模型能自我反思纠正错误

关于Reflection 70B,更多细节是这样的。

它能力提升的关键,在于一种叫Reflection-Tuning的训练方法——让模型在最终确定回答前,先反思自己生成的文本,检测并纠正推理中的错误。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

训练数据来自GlaiveAI平台生成的合成数据。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

Reflection 70B基于Llama 3.1 70B Instruct,可以用与Llama模型相同的代码和pipeline进行采样,甚至直接用了标准的Llama 3.1聊天格式。

不过,它引入了一些特殊tokens来结构化输出过程。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

看下面这个例子,规划过程被拆成独立步骤,这样既提升了CoT效果,又保持了输出精炼:

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

模型会先在标签内输出推理过程,一旦对推理结果满意,再在标签内输出最终答案。这样一来,内部思考和最终答案就能彻底分离。

部分,模型可能会输出一个或多个标签,这意味着它发现了推理中的错误,会在给出最终答案前尝试纠正。

系统提示如下:

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

另外值得一提的是,基准测试中,所有基准都通过LMSys的LLM Decontaminator检查了污染,隔离了部分,并单独对这一部分进行测试。

使用Reflection 70B时,官方还分享了一些小技巧:

· 初步建议参数:temperature设为0.7,top_p设为0.95

· 为提高准确性,最好在Prompt末尾加上"Think carefully."

官方还表示,下周会发布一份报告,详细介绍模型训练过程和发现。

Agent创业团队打造

Reflection 70B的背后是一支小团队,由HyperWriteAI的CEO Matt Shumer带领。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

领英资料显示,Matt Shumer是一位连续创业者,毕业于美国锡拉丘兹大学,现任OthersideAI的联合创始人兼CEO。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

OthersideAI是一家AI应用公司,致力于通过大规模AI系统开发全球最先进的自动补全工具,也是HyperWrite的幕后公司。

HyperWrite是一个浏览器操作agent,可以像人一样操作谷歌浏览器来完成一系列任务,比如订披萨:

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

和gpt-llm-trainer一样,你只需要用文字描述目标,它就会一边列步骤,一边执行。刚推出时号称"比AutoGPT强"。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

HyperWrite还可以在谷歌扩展程序中安装。

另外,Matt Shumer高中时期就创立了Visos,致力于开发用于医疗用途的下一代虚拟现实软件。还创立了FURI,这家公司旨在通过创造高性能产品并以公平价格销售来碘伏体育用品行业。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

虽然有Meta支持,但目前打开试玩页面,还是暂时无法访问。

开源大模型新王超越GPT-4o,新技术纠正幻觉,数学99.2分

感兴趣的朋友可以先关注起来,等后续版本上线再试试看。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。