HermesAgent是由NousResearch开源的自主AI智能体,采用MIT许可证。其核心创新在于闭环学习回路机制,可自动生成可复用技能文档、建立跨会话索引并持续构建用户心理模型。项目发布四周内GitHub星标破万,五周迭代六个版本,已发展为具备多平台生产能力的智能体运行时。
Hermes Agent,一个由Nous Research在2026年2月底开源发布的自主AI智能体,最近在圈子里热度挺高。它用MIT许可证,核心是用Python写成的。有趣的是,它诞生的初衷是为了解决一个被其创造者称为“AI失忆症”的麻烦——也就是大语言模型驱动的助手,每次对话结束就忘得一干二净。
那么,它到底靠什么来解决这个问题?核心创新在于一个叫作闭环学习回路的机制。简单说,就是智能体每次做完一项复杂任务后,会自己动手写一份可复用的“技能文档”,为之前的对话建立跨会话的索引,并且不断构建一个持续演进的用户心理模型。这个项目发布后仅四周,GitHub星标就破万了,到2026年3月下旬已经飙到17,400,成了Nous Research有史以来最受欢迎的开源项目。而且,它在五周内迭代了六个主要版本,从最初的概念验证,已经快变成一个具备多平台生产能力的智能体运行时了。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
Nous Research这家实验室,主攻大语言模型的后训练和微调。他们的拳头产品就是Hermes模型系列——基于Meta的Llama架构进行深度微调,尤其擅长指令遵循、智能体函数调用和复杂推理。Hermes Agent运行时本身是个独立但又互补的项目:它可以在任何兼容OpenAI接口的端点上运行,而Hermes模型系列,恰恰就是为这种高级智能体任务量身打造的。
先说说模型技术栈,这能帮我们更好地理解整套体系。
Hermes 3(2024年8月发布)是基于Llama 3.1的三个规模(8B、70B、405B)进行微调的。它用了大约3.9亿tokens的合成数据来训练,而不是人类反馈。训练分两步走:先做监督微调,然后做直接偏好优化。它通过Flash Attention 2实现了96%的样本打包效率,序列长度是8,192 tokens。模型采用了ChatML分隔符来兼容OpenAI API,并在特定数据集上训练以提升工具调用的可靠性。它的前代Hermes 2 Pro已经有90%的函数调用准确率,而Hermes 3把这个差距又拉大了一些。
Hermes 4(2025年8月发布)则带来了两个重大创新:
Hermes 4的技术报告通过实证验证了混合推理的有效性:在AIME'24数学基准上,过度冗长推理减少了78.4%,而准确率只损失了4.7%。在MATH-500上,405B模型在混合模式下达到了96.3%的准确率,而标准模式是93.1%。
特别值得一提的是Hermes 4.3(36B)。它是在字节跳动的Seed 36B上微调的,而不是Llama。这打破了“所有Hermes模型都基于Llama”的假设,标志着Nous Research正朝着模型无关的后训练方法论迈进。
所有Hermes模型都是通过Atropos训练的,这是Nous Research开源的一个分布式强化学习框架。Atropos不是标准的RLHF——它是一个Rollout处理器,负责管理可能上千个分布式工作节点之间的异步协调,专门用来处理LLM输出生成时间不稳定这个难题。在Hermes 4的训练中,Atropos驱动了拒绝采样,通过大约1,000个任务特定的验证器,筛选出高质量的推理轨迹。有意思的是,同一个Atropos集成也出现在Agent运行时中,用于强化学习训练和轨迹捕获——这就构成了从Agent使用直接回流到模型训练的完整数据管道。
Hermes Agent实现了经典的ReAct模式:观察(读取终端输出、文件内容、工具结果)→ 推理(对照目标分析当前状态)→ 行动(执行命令、调用工具)→ 循环。这个核心循环在代码里是作为AIAgent类实现的,负责处理Provider选择、提示词构建、工具执行、重试与回退、回调、上下文压缩以及持久化同步。不过,真正让它与众不同的,并不是这个循环本身有什么魔法,而是围绕它精心设计的五层记忆系统、技能架构和用户建模。
Hermes Agent维护了五个截然不同的持久化层,从临时性到永久性依次递进:
Honcho把用户和AI智能体看成是具有持久状态的对等端点。有四个工具在运行时向Agent暴露这个能力:
| 工具 | 功能 |
|---|---|
honcho_profile | 快速对等卡片检索(无LLM调用),返回精选的关键事实 |
honcho_search | 语义记忆搜索,返回按相关性排序的原始摘录 |
honcho_context | 由Honcho的LLM驱动的辩证式问答,从历史中综合答案 |
honcho_conclude | 当用户陈述偏好或更正时,将持久化事实写入Honcho |
用户和智能体的表征在会话启动时就注入系统提示词,让Hermes既清楚对话对象是谁,也明白自己知道什么。
闭环学习回路把所有记忆层串联成一个复合循环:
实战数据(来自Nous Research黑客松)表明:技能辅助任务相比冷启动执行,Token消耗能降低30%到85%。有独立从业者报告说,在三份自主生成的技能文档辅助下,类似的研究任务完成速度加快了40%。
Hermes Agent通过三层人格系统,把“它了解你的内容”和“它如何与你对话”分离开了:
~/.hermes/SOUL.md:全局人格文件,每次会话启动时逐字注入系统提示词。它控制所有交互中的沟通语调、直接程度和风格——如果某种行为应该在所有部署中保持一致,就该放在这里。六种终端后端。Hermes Agent通过`BaseEnvironment`接口把Agent运行时与执行环境分离,提供了六种实现:
| 后端 | 适用场景 | 特性 |
|---|---|---|
| Local | 开发、个人使用 | 直接系统执行,无隔离 |
| Docker | 生产环境、安全敏感 | 只读根文件系统、能力降级、PID限制、命名空间隔离 |
| SSH | 远程服务器 | 跨会话持久化环境 |
| Daytona | 云端开发 | 无服务器开发环境 |
| Singularity | HPC、研究集群 | 面向计算密集型工作负载的容器编排 |
| Modal | 无服务器生产 | 空闲时休眠,按需唤醒,会话间近乎零成本 |
配置只需要在`~/.hermes/config.yaml`里改一行——切换后端时Agent代码不需要任何改动。
多平台消息网关也很实用。单一网关进程同时路由所有已连接平台间的交互。截至v0.6.0,已经支持Telegram(含Webhook模式)、Discord、Slack(多工作区OAuth)、WhatsApp、Signal、IMAP/SMTP电子邮件、飞书/Lark和企业微信。语音备忘录转录和跨平台对话连续性都已经包含在内。这意味着,你可以从手机上的消息应用跟Agent聊天,同时它在远程云虚拟机上帮你干活。
模型Provider灵活性方面,Agent是Provider无关的——这是Nous Research的明确设计选择。支持的端点包括:Nous Portal(400+个模型)、OpenRouter(200+个模型)、任何OpenAI兼容API,以及通过Ollama、vLLM或llama.cpp进行的本地推理。截至2026年3月,Hugging Face已经被添加为一级推理Provider,提供了按用例组织的28个精选模型。v0.6.0版本还增加了有序回退Provider链:当主Provider返回错误或不可达时,Hermes会自动尝试配置的备用方案。
Hermes Agent中的MCP集成是双向的:
技能遵循agentskills.io开放标准:一个包含`SKILL.md`文件的目录,文件带有YAML前置元数据和Markdown指令。标准规定了最少的必填字段(`name`、`description`)和不受限制的Markdown正文(建议5,000 tokens以下)。可选的子目录(`scripts/`、`references/`、`assets/`)支持更复杂的程序性技能,包含辅助脚本和补充文件。技能实现了渐进式披露:元数据先加载到Agent的上下文索引里;完整内容等技能被激活时才按需加载。这样既保持了技能库的可发现性,又最小化了Token消耗。
技能系统最厉害的地方,或许是它的可移植性。截至2026年3月,超过11款工具已经采用了这个标准:Claude Code、Cursor、GitHub Copilot、Gemini CLI、VS Code、Amp、Goose、Roo Code、Kiro、Codex和OpenCode。为Hermes Agent编写的技能可以直接用在Claude Code上。为Cursor编写的技能也可以直接用回Hermes Agent。这种跨框架兼容性在智能体生态里相当罕见——大多数技能/插件系统都是绑死在自家框架上的。
技能还能根据当前会话中的工具可用性,通过前置元数据字段自动显示或隐藏自己:
fallback_for_toolsets:当高级工具可用时技能隐藏,只在不可用时作为免费/本地替代方案显示。requires_toolsets:除非特定工具集存在,否则技能隐藏。这实现了一种优雅降级——Agent会根据当前部署环境中可用的资源,呈现出不同的技能选项。
Hermes Agent不仅是一个终端用户工具,更是未来模型训练的数据生成引擎:
这形成了一个飞轮:Hermes Agent使用后生成训练数据 → Atropos处理 → 训练出更好的Hermes模型 → Hermes Agent变得更强大。
Hermes Agent把子智能体委派作为原生能力来支持。子智能体拥有自己独立的对话、终端和Python RPC脚本,支持零上下文成本的并行管线。自v0.5.0起,子智能体还有独立的迭代预算——它们不再消耗父智能体的预算,防止了复杂嵌套工作流中的过早终止。通过`execute_code`进行的程序化工具调用,会把多步管线折叠成单次推理调用:在后台运行RPC调用的子智能体直接执行代码,父智能体只需要评估最终输出,极大降低了LLM调用开销。
| 维度 | Hermes Agent | Claude Code | CrewAI | LangGraph | AutoGen |
|---|---|---|---|---|---|
| 架构 | 单一持久化智能体 | IDE嵌入式CLI | 多角色智能体 | 状态机图 | 对话式多智能体 |
| 记忆机制 | 5级持久化存储 | 基于会话 | 基础任务记忆 | 有限 | 有限 |
| 技能自我进化 | 自主创建+精炼 | agentskills.io(手动) | 无 | 无 | 无 |
| GitHub星标数 | ~17,400 | 不适用(专有) | ~47,600 | 极高 | 高 |
| 开发语言 | Python | TypeScript | Python | Python | Python |
| 本地推理支持 | Ollama, vLLM, llama.cpp | 不支持 | 不支持 | 不支持 | 不支持 |
| 消息平台集成 | 8(统一网关) | 不适用 | 不支持 | 不支持 | 不支持 |
| 多智能体协作 | 子智能体委派 | 不支持 | 核心特性 | 核心特性 | 核心特性 |
| 开源协议 | MIT | 专有 | MIT | MIT | MIT |
| 资金背景 | 社区 / Nous Research | Anthropic | $1800万(Insight Partners, Andrew Ng) | LangChain Inc | Microsoft |
如果问Hermes Agent最打动人的点是什么,那一定是它的复合价值主张——运行时间越长,它对操作员和运行环境的了解就越深入。对于那种希望智能体在数月内积累上下文信息的单个高杠杆操作员(而不是由团队向多样化最终用户部署智能体的场景),Hermes的记忆架构在开源替代方案里确实没有能直接对标的对手。
有一个经常被引用的基准测试很有说服力:同一个底层模型(Opus 4.5),仅仅因为智能体脚手架不同,在SWE-bench上就产生了17道题的得分差距。这说明了一个关键问题:架构比模型选型更重要。这也印证了Hermes在记忆与技能系统上的投入是走对了方向,而不只是提供一个裸模型访问。
当然,任何技术方案都不可能是全然的掌声。一份详细的技术审查提出了几个实质性的质疑:
根据实践者和社区文档的反馈,Hermes Agent在下面这些场景里回报最明显:
有几个未决问题,将决定Hermes Agent的长期发展走向:
总的来说,Hermes Agent可以说是2026年发布的开源Agent框架中,架构最具雄心者。它的闭环学习——五层记忆、自主技能创建、辩证式用户建模和FTS5会话搜索——代表了一个真正的架构押注:持久化、复合增长的上下文,将比无状态算力更具价值。快速的发布节奏(五周六个主要版本)和社区采纳(17,400 Stars),都验证了这一设计方向上确实有真实需求。
客观地评价,Hermes目前处于pre-1.0的高潜力架构论证阶段。“伴你成长”这个定位,部分已经实现了(技能确实能降低Token开销;会话搜索提供了真实的跨会话召回),但部分还属于愿景(Honcho的用户建模缺乏实证验证;技能累积还没有剪枝机制)。对于那些运行数月而不是数天的开发者和团队,复合优势在架构层面是真实存在的。但对于那些需要经过实战检验的可靠性、企业级访问控制或原生多智能体编排的组织,这个框架尚未就绪。不过,考虑到Nous Research在模型训练方面的专长,以及连接Agent使用与模型改进的Atropos飞轮,它的发展轨迹指向了一个不仅能跨会话、甚至能跨模型代际持续优化的系统。这一点,尤其值得持续关注。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述