首页 > AI教程 >Harness Engineering:Agent工程新范式

Harness Engineering:Agent工程新范式

来源:互联网 2026-07-05 06:34:01

OpenAI实验显示,3至7名工程师借助HarnessEngineering,五个月内通过Agent自动提交1500个PR生成近100万行无人工编写的代码。该方法通过设计环境降低Agent犯错概率,核心包括结构化文档、机械约束、可观测性及CI/CD集成等组件,将工程师角色从编码转向系统设计。

OpenAI内部最近搞了个实验,结果挺有意思:3到7个人,5个月时间,搞出了一个接近100万行代码的beta产品。关键不在于规模,而在于这100万行代码,没有一行是人手写的——全部来自Codex Agent自动提交的1500个PR。支撑这个实验的方法论,OpenAI称之为Harness Engineering。它教的不是怎么把prompt写得更好,而是怎么设计一个环境,让Agent压根儿没机会出错。

一、不写代码的工程师,到底在干什么

工程师和AI的协作方式,这两年的变化速度相当快。最早是Copilot模式,AI在旁边帮你补全,你主导整个流程。后来到了Chat模式,你把需求丢给AI,它吐出一堆代码,你挑能用的复制粘贴。现在则进入Agent模式:你给AI一个目标,它自己规划、写代码、跑测试、开PR,而你只在关键节点上拍板决策。

长期稳定更新的攒劲资源: >>>点此立即查看<<<

核心洞察:Harness Engineering的本质不是提升Agent的代码能力,而是降低Agent出错的可能性。OpenAI工程师Ryan Lopopolo的原话说得直白:“Agents aren't hard; the Harness is hard.”

在这种模式下,工程师的核心工作被压缩成了三件事:设计环境、明确意图、建立反馈循环。变量命名和函数实现交给Agent,人的精力被释放出来,投入到写文档、定规则、搭测试、铺流水线上。Agent负责执行,而你负责确保执行不跑偏。

Harness Engineering:Agent工程新范式

听起来有点理想化?但OpenAI的内部数据相当实在:3到7名工程师,5个月,100万行代码,1500个PR,平均每人每天合并3到5个Agent提交的PR。这不是演示Demo,是真刀真枪的生产交付。

二、Harness的五根支柱

OpenAI把这套方法论拆解成了五个可以直接落地的组件,一个一个来看。

Harness Engineering:Agent工程新范式

结构化文档

项目里维护一个docs目录,作为Agent的“单一事实来源”。系统架构图、执行计划、设计规格书都放在里面。Agent动手写代码之前,会先读这些文档来理解上下文。这套文档不是写给人看的,而是写给Agent看的。结构越清晰,Agent的输出越精准。

AGENTS.md

这个概念是HashiCorp创始人Mitchell Hashimoto在2026年初推开的。它是一个配置文件,编码了项目规则、代码规范,以及Agent过去犯过的错和修正方式。说白了就是Agent的错题本。每次开干之前读一遍,避免重复踩坑。这样一来,项目经验就从人的记忆里抽了出来,变成了可执行的约束条件。

机械约束

再聪明的Agent也会出错,所以OpenAI用linters和结构测试来建硬性边界。比如依赖流向必须遵守“Types → Config → Repo → Service → Runtime → UI”的层级,任何违反直接就被CI拒绝。Agent绕不过这些规则,就像人绕不过编译器。约束不是为了限制创造力,是为了防止Agent在架构层面搞破坏。

可观测性

Agent的工作过程必须被完整记录:日志、指标、调用链。OpenAI的Agent会自己写日志、上报指标、生成追踪span。出问题的时候,工程师可以通过观测数据回溯Agent的决策路径,而不是在黑盒里猜它到底干了什么。这个对企业落地尤为关键——你看不见的系统,是没法信任的。

CI/CD深度集成

Agent不是独立脚本,而是直接操作开发工具链。自己开PR、跑测试、根据失败信息迭代修改,直到通过。人的角色从“写代码的”变成了“审PR的”。在某些成熟模块上,连PR审批也能自动完成。

关键提醒:五样东西缺一不可。缺了文档,Agent会迷路;缺了AGENTS.md,Agent会重复犯错;缺了机械约束,Agent会突破架构边界;缺了可观测性,出了问题没法定位;缺了CI/CD集成,Agent无法自主迭代。

三、为什么偏偏是2026年

Harness Engineering不是凭空冒出来的。它依赖的前提是Agent能力在2025年底到2026年初的质变。GPT-4o级别的模型在代码理解和长上下文上的突破,让Agent第一次具备了处理复杂工程任务的基础能力。

但能力不等于可靠性。大模型仍然会幻觉,会遗漏边界条件,会在长会话里跑偏。Harness Engineering解决的不是“Agent能不能写代码”,而是“Agent能不能稳定、可预期地写代码”。

它的行业价值在于,把AI编程从“个人效率工具”升级成了“团队协作基础设施”。Copilot时代,AI帮你写得更快;Harness时代,AI替你写完整个模块,你负责验收。这中间的杠杆差了一个数量级。

Harness Engineering:Agent工程新范式

HashiCorp、Anthropic、Cursor都在2026年跟进这个方向。Hashimoto在2月的文章里总结得很直白:花时间去工程化一个解决方案,让Agent永不再犯同一个错误。不是什么高深理论,就是工程纪律在Agent时代的自然延伸。

四、Harness不是银弹

它目前最适合的是边界清晰、规范明确的工程任务。API开发、数据处理管道、测试用例生成、文档维护——这些活儿的特点是输入输出可验证、有明确的通过标准、变更范围相对独立。

不适合的场景也很明确:需求模糊的产品原型设计、需要深度领域知识的算法调优、涉及复杂利益权衡的架构决策。这些任务的核心难点不在于“写出来”,而在于“想清楚”。想清楚这件事,目前还是人类的领地。

Harness Engineering:Agent工程新范式

OpenAI的实验也有代价。1500个PR背后是大量的自动化测试基础设施、精细化的文档维护成本,以及工程师角色转型的时间投入。一个团队从传统模式切到Harness模式,前期需要一到两个月搭建和磨合。不是装个插件就能用,是一整套需要重新设计的工作流。


结语

Harness Engineering真正改变的东西,是工程师这个职业的分工。Agent能写百万行代码之后,人的价值不再体现在敲键盘的速度上,而是体现在系统设计的质量上。环境搭得好,Agent产出就稳;环境搭得糙,Agent就会不停地给你带来惊喜——多半是不好的那种。

以前工程师是搬砖的,后来是开挖掘机的,现在是设计挖掘机的。Harness Engineering就是那张设计图纸。图纸越细,挖掘机干活越靠谱。

2026年,Agent会写代码已经不是新闻了。接下来要比的,是谁更擅长让Agent把代码写对。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。