近日,英伟达正式开源了Llama-3.1-Nemotron-70B-Instruct模型,其性能表现仅落后于OpenAIo1,并超越了GPT-4o和Claude3.5Sonnet。此外还开源了HelpSteer2数据集及奖励模型。该模型在多个自动对齐基准测试中排名第一,优化了通用领域性能,但数学专业尚未进行专门调优。
今天,英伟达再次重磅开源——Llama-3.1-Nemotron-70B-Instruct。该模型在多项基准测试中超越OpenAI的GPT-4o和Anthropic的Claude-3.5 Sonnet。从名称可以看出,它基于Llama-3.1-70B打造。

长期稳定更新的攒劲资源: >>>点此立即查看<<<
翻看大模型排行榜,Llama-3.1-Nemotron-70B-Instruct的排名仅次于OpenAI最新推出的o1模型,成绩相当亮眼。

目前该模型已开放在线体验。像"Strawberry里有几个r"这类经典难题,对它来说不在话下。

当然,它偶尔也会一本正经地胡说八道——例如在"2.11和2.9哪个大"这种问题上翻车。

英伟达方面表示,本次优化重点在于提升模型在通用领域的性能,数学等专业方向尚未进行专门调优。相信再过一段时间,它应该能分清楚2.11和2.9谁大。
除了模型本身,英伟达还一并开源了训练数据集HelpSteer2,内容相当扎实:

更值得关注的是,英伟达同时还开源了另一个模型——Llama-3.1-Nemotron-70B-Reward。

Llama-3.1-Nemotron-70B-Instruct是英伟达定制的大型语言模型,核心目标在于提升LLM生成响应的有用性。具体成绩单如下:Arena Hard基准得分85.0,AlpacaEval 2 LC基准得分57.6,GPT-4-Turbo MT-Bench基准得分8.98。

截至2024年10月1日,该模型在三个自动对齐基准中全部排名第一,将GPT-4o和Claude 3.5 Sonnet等顶尖模型甩在身后。
有网友评价,一个70B的模型能在Arena Hard上拿到85.0分,确实是一件大事。

还有人做了对比测试:用同样的提示词分别询问GPT-4o和英伟达模型,结果英伟达的答案全面胜出,且优势明显。

"就算加大题目难度,它照样答得漂亮。"

训练方面,该模型基于Llama-3.1-70B-Instruct,采用RLHF技术(主要是REINFORCE算法)训练而成,初始训练策略则用到了Llama-3.1-Nemotron-70B-Reward和HelpSteer2偏好提示。
值得一提的是,Llama-3.1-Nemotron-70B-Reward本身也是一项重要成果。它基于Llama-3.1-70B-Instruct Base训练,结合了Bradley Terry和SteerLM回归奖励模型方法,专门用于预测LLM响应的质量。在RewardBench榜单的Overall排名中表现最佳,在Chat、Safety和Reasoning几个子项上也同样出色。

最后说一下部署门槛:至少需要一台带4块40GB或2块80GB NVIDIA GPU的机器,外加150GB的可用磁盘空间。硬件到位后,按照官方指引操作即可。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述