外观
Harness(智能体执行框架)
Harness 是 Agent 时代的核心词条:本专题的领域锚点。所有工具、对比词条均回链此处。
定义
一个有能力的大模型 ≠ 一个能干活 Agent。模型需要被"包裹"在一套执行系统里,这套系统负责:
- 理解任务、维护多轮上下文
- 调用工具、暴露执行进度
- 处理失败、在必要时请求人工审批
- 在配置好的安全边界内推进工作
- 跨轮次续跑,把活干完
这套外围执行系统就是 Harness。业界共识:Agent = Model + Harness。
为什么 Harness 比模型还重要
一项针对 10 个 coding agent harness 的对比研究发现:仅更换 harness,SWE-bench Pro 的 pass@1 可以从 23% 摆动到 52%(GLM-5.2)或 15% 到 36%(Gemma-4),最大差距 29 个百分点,超过绝大多数模型迭代的提升。
更反直觉的是:厂商自家 harness 往往过度适配自家模型 —— Codex Harness 在 GLM-5.2 上排名第 2,换到 Gemma-4 直接跌到第 9。
Harness 设计已从"模型的配件"变成"决定 Agent 能力的第一性要素"。竞争焦点正从"模型中心化"转向"Harness 中心化"。
两大工程路线
| 路线 | 代表 | 哲学 |
|---|---|---|
| 成品发行版 | Codex Harness | 强意见的"Agent 操作系统",开箱即用 |
| 可替换平台 | DeepSeek Harness、Pi | "一切皆插件"/极简核心,自己组装 |
核心机制要点
- Turn/Step 状态机:step = 一次模型请求 + 工具调用;turn = 零到多个 step
- 会话持久化:事件溯源(append-only 日志)或 JSONL 树 + 分支
- 安全边界:沙箱 + 审批策略(框架内建 vs 外部容器化)
- 扩展点:插件树 / capability seam / 函数式 hook
关联词条
- Cordis 与时空可组合性:dsh 的内核范式(concept)
- [[OpenAI 全面开源 Codex Harness]](tool)
- [[Pi:极简、开源的终端 AI 编程 Agent]](tool)
- [[DeepSeek Harness 与 Pi 的架构拆解对比]](comparison)
- [[DeepSeek Harness vs Codex Harness:发动机之争]](comparison)
- [[Agent 核心技术概念与范式演变]](concept)