Skip to content

Harness(智能体执行框架)

Harness 是 Agent 时代的核心词条:本专题的领域锚点。所有工具、对比词条均回链此处。

定义

一个有能力的大模型 ≠ 一个能干活 Agent。模型需要被"包裹"在一套执行系统里,这套系统负责:

  • 理解任务、维护多轮上下文
  • 调用工具、暴露执行进度
  • 处理失败、在必要时请求人工审批
  • 在配置好的安全边界内推进工作
  • 跨轮次续跑,把活干完

这套外围执行系统就是 Harness。业界共识:Agent = Model + Harness

为什么 Harness 比模型还重要

一项针对 10 个 coding agent harness 的对比研究发现:仅更换 harness,SWE-bench Pro 的 pass@1 可以从 23% 摆动到 52%(GLM-5.2)或 15% 到 36%(Gemma-4),最大差距 29 个百分点,超过绝大多数模型迭代的提升。

更反直觉的是:厂商自家 harness 往往过度适配自家模型 —— Codex Harness 在 GLM-5.2 上排名第 2,换到 Gemma-4 直接跌到第 9。

Harness 设计已从"模型的配件"变成"决定 Agent 能力的第一性要素"。竞争焦点正从"模型中心化"转向"Harness 中心化"。

两大工程路线

路线代表哲学
成品发行版Codex Harness强意见的"Agent 操作系统",开箱即用
可替换平台DeepSeek Harness、Pi"一切皆插件"/极简核心,自己组装

核心机制要点

  • Turn/Step 状态机:step = 一次模型请求 + 工具调用;turn = 零到多个 step
  • 会话持久化:事件溯源(append-only 日志)或 JSONL 树 + 分支
  • 安全边界:沙箱 + 审批策略(框架内建 vs 外部容器化)
  • 扩展点:插件树 / capability seam / 函数式 hook

关联词条

  • Cordis 与时空可组合性:dsh 的内核范式(concept)
  • [[OpenAI 全面开源 Codex Harness]](tool)
  • [[Pi:极简、开源的终端 AI 编程 Agent]](tool)
  • [[DeepSeek Harness 与 Pi 的架构拆解对比]](comparison)
  • [[DeepSeek Harness vs Codex Harness:发动机之争]](comparison)
  • [[Agent 核心技术概念与范式演变]](concept)