AI Agent Harness 是什么:Hermes vs Claude Code vs Codex 的三种实现思路

发布于 2026-08-24 14:12

AI Agent Harness 是什么:Hermes vs Claude Code vs Codex 的三种实现思路

用同一个模型,套上不同的 agent 框架,产出质量差别很大。差别不在模型,在 harness。这篇文章讲清楚 harness 到底是什么,以及三个主流产品各自怎么实现它。

Harness 是什么

Harness 直译是"马具",套在马身上让马能拉车干活。放到 AI 领域,harness 就是"模型周围的执行环境"。

LLM 本身只会做一件事:根据输入生成文本。它无状态、不会动手、没有眼睛和手。而真实任务是长流程、多步骤、需要读写文件跑命令的。中间的鸿沟就是 harness 来填的。

一个完整的 harness 通常包含五个部分:

  1. 系统提示注入:身份、行为规则、项目约定
  2. 工具层:读写文件、执行命令、搜索网页,把模型输出的文本解析成真实调用
  3. Agent 循环:模型输出 → 执行工具 → 结果回填 → 再输出,循环到任务完成
  4. 上下文管理:历史压缩、截断、持久记忆,防止撑爆上下文窗口
  5. 安全边界:权限确认、沙箱、危险操作拦截

没有 harness 时,你要手动复制粘贴模型的每一段回答;有了 harness,模型在一个受控循环里自主完成整个任务。

三家的实现思路

骨架三家都一样,差异在侧重。

Hermes Agent v0.20.5:个人助理型 harness

Python 实现,定位不是纯编码工具,而是能连接外部世界的个人 agent。

  • 工具面广:终端、文件、web 搜索、邮件、日历、智能家居等几十个工具集,按需加载
  • 持久记忆:用户说过的事实存进 memory 存储,每次新会话自动注入系统提示。跨会话不用重复自我介绍
  • Skills 系统:可复用的程序性知识(某个任务的标准流程),触发时动态加载进上下文
  • 定时任务:内置 cron,可以每天定时唤起一个全新会话去抓数据、写摘要、推送消息,全程无人发起对话
  • 多网关接入:同一个 agent 可以通过 Telegram、微信等平台对话

举例:你某天告诉它服务器的 SSH 地址和账号,它存入记忆。一个月后你开新会话问"查下服务器磁盘占用",这条信息已经自动在它的系统提示里,直接就能执行。

Claude Code v2.1.241:工程纪律写进提示

Anthropic 官方出品,围绕编码场景深度特化,把工程最佳实践硬编码进系统提示和行为规范。

  • 先读后改:系统提示明确要求改代码前必须先用搜索定位、读文件确认符号存在,禁止凭空猜函数名
  • 工具设计为编码优化:Edit 带模糊匹配的 patch、Read 带行号分页、大文件截断保护
  • 上下文压缩(compaction):长任务接近窗口上限时,自动把历史压缩成"已完成什么、当前状态、剩余工作"的摘要,任务不中断继续跑
  • 项目约定注入:CLAUDE.md / AGENTS.md 文件自动加载进每轮对话
  • 权限模式:Bash 和文件编辑默认要人审批,可分级放行

举例:让它修一个 bug,它不会直接猜着改,而是先搜代码定位 → 读实现确认签名 → 再动手 patch → 跑测试验证后才报告完成。

Codex CLI v0.145.0:安全沙箱做成默认

OpenAI 官方出品,Rust 实现,同样面向编码但风格更收敛,安全边界做得最重。

  • OS 级沙箱:命令默认在内核层隔离的环境里执行——macOS 用 Seatbelt,Linux 用 Landlock + seccomp,不是靠容器模拟
  • 分级审批:只读 / 自动 / 全权三种模式,需要联网或写项目外文件时暂停向用户请求提权
  • AGENTS.md 规范:标准化的项目上下文文件就是这个产品推动的,现在 Hermes 等框架也兼容读取
  • 多入口共享同一大脑:CLI、桌面应用、IDE 插件、云端任务共用一套配置和沙箱模型

举例:让它装一个依赖,npm install 默认跑在断网的沙箱里;真需要联网下载时它会停下来问你。即使模型判断失误要执行危险命令,沙箱也兜底。

同一个问题,三种解法

拿"如何防止 agent 执行危险命令"这一件事对比:

产品 解法 类型
Claude Code 权限确认弹窗,人来审 人审
Codex CLI OS 级沙箱隔离 机审
Hermes Agent 行为规则写入提示词 提示约束

再看上下文管理:

产品 手段
Claude Code 会话内 compaction 自动压缩历史
Codex CLI 版本化的记忆摘要,长期任务保持上下文精简
Hermes Agent 跨会话持久记忆 + skills 动态加载

结论

三家 harness 的骨架一样:agent 循环加工具加上下文管理。差异在侧重:

  • Claude Code 把工程最佳实践写进提示和行为规范,是仓库里的结对编程专家
  • Codex 把安全沙箱做成默认,适合对执行安全要求高的场景
  • Hermes 把外围能力做成平台:记忆、定时、多平台接入、技能系统,更像一个长期运行的个人助理

这也是判断一个 agent 产品是否只是"套壳"的关键:套壳产品只有一个聊天窗口转发 API,真正的 agent 产品在 harness 这一层有大量自己的工程。同样的模型,换不同的 harness,完成任务的成功率、安全性、上下文利用效率都不同。选型时看模型不如看 harness 怎么做的。

(版本信息核实于 2026 年 8 月 24 日:Hermes Agent v0.20.5 为本机实测,Claude Code 与 Codex CLI 版本来自官方 changelog。)


如果你觉得本文有用,请点赞,收藏,转发

你有什么问题,请留言,我来帮你解答。


← 返回博客列表