2026.08.14Agent Harness 全景盘点:从 Claude Code、Codex 到昨日开源的 DeepSeek Harness,一张地图看懂「Model + Harness」时代
2026 Agent Harness 全景盘点:从 Claude Code、Codex 到昨日开源的 DeepSeek Harness,一张地图看懂「Model + Harness」时代
更新时间:2026-08-14(北京时间)
信息截止:2026-08-14 10:50 CST
标签:Agent HarnessHarness EngineeringDeepSeek HarnessClaude CodeCodexOpenClawHermes AgentDeep Agents
适用读者:AI 工程师、架构师、技术选型决策者、Agent 方向研究者
TL;DR(核心要点)
- 2026 年 AI 工程的第一公式是
Agent = Model + Harness。模型负责推理与生成,Harness 负责把模型能力落到真实环境:工具调用、上下文管理、沙箱执行、记忆持久化、错误恢复与任务闭环。这一术语由 OpenAI 与 LangChain 在 2026 年初共同确立,现已成为行业共识。 - 工程范式完成了三级跳:Prompt Engineering(2023)→ Context Engineering(2025)→ Harness Engineering(2026)。模型层的竞争边际收益递减,Harness 层成为新的护城河。
- 昨天(2026-08-13)晚上,DeepSeek 发布了 Harness 开发者预览版 v0.1,MIT 协议开源,主打「一切皆插件」:模型、工具、技能、会话、沙箱、存储、循环、调度、UI 全部是基于 Cordis 元框架的可替换插件,并提供标准 / PTC / 极简 / 创造四种运行模式。这是 DeepSeek 首款 Agent 产品,也是首个由头部模型厂商开源的「全栈可组装」Harness。
- 当前主流 Harness 工具可分为五大阵营:模型厂商旗舰(Claude Code、OpenAI Codex、DeepSeek Harness)、开源社区(OpenCode、OpenClaw、Hermes Agent)、IDE 内嵌(Cursor、Trae)、框架自建(LangChain Deep Agents、Open SWE、各家 Agents SDK)、通用任务型(Manus、WorkBuddy、Trae Work、Kimi Work)。
- 选型没有全局最优,只有场景最优:重型代码工程看 Claude Code / Codex;私有化与可组装性看 DeepSeek Harness;个人全能助理看 OpenClaw / Hermes;企业自建看 Deep Agents / Open SWE;IDE 重度用户看 Cursor / Trae。
目录
- 概念正名:Harness 到底是什么
- 简史:Harness 如何在 9 个月内成为行业主词
- 解剖学:成熟 Harness 的六层参考架构
- 全景盘点:五大阵营、十四款主流工具
- 焦点深潜:DeepSeek Harness v0.1 逐层拆解
- 横向对比与选型矩阵
- 趋势研判:关于 Harness 的七个判断
- FAQ:高频问题速答
- 参考资料
一、概念正名:Harness 到底是什么
1.1 定义:模型之外的一切
Harness 原意为「马具」——缰绳、马鞍、挽具的总称。在 AI Agent 语境下,它指包裹在大模型外部的全部运行时基础设施。用一个被广泛引用的公式表达:
Agent = Model + Harness
- Model:无状态的推理引擎。只接收 token、输出 token;读不了你的代码库、写不了文件、跑不了测试,也不记得上一次会话做过什么。
- Harness:除模型权重以外的所有代码、配置与执行逻辑——上下文管理、工具调用、沙箱、记忆、调度、权限、验证回路、可观测性。
一个更锋利的操作性定义是:如果你没在做模型训练或推理服务本身,那你干的活多半都属于 Harness 范畴。
一个流传甚广的类比:模型是一位被绑住手脚的天才顾问,Harness 是给它配备的整间办公室——电话、电脑、秘书、日历与会议室。Model + Harness 才构成一个能真正交付工作的 Agent。
1.2 术语消歧:此 Harness 非彼 Harness
为避免检索与讨论中的混淆,需要区分三个同名概念:
| 术语 | 含义 | 代表 |
|---|---|---|
| Agent Harness(本文主题) | 模型外部的运行时基础设施,让 Agent 可靠干活 | Claude Code、Codex、DeepSeek Harness |
| Evaluation Harness | 模型能力评测的执行框架,是另一个独立领域 | EleutherAI lm-evaluation-harness、HELM、Inspect AI |
| CI/CD 平台 Harness | 一家持续交付软件公司的商标名 | Harness.io |
2025 年 11 月底 Anthropic 的一场内部实验成为分水岭:他们让 Claude Code 在一条高级指令下「克隆 claude.ai」,结果即便是 Opus 4.5 这样的前沿模型也无法稳定完成——上下文窗口耗尽、半成品无人接手、过早宣布完工。结论直指要害:不是模型不够聪明,而是缺少一个让它持续、可靠工作的 Harness。
1.3 为什么「模型决定上限,Harness 决定下限」
中金研究在 2026 年 6 月的报告《Agent Harness:模型之外、智能之内》中的概括最为精炼:Agent Harness 是在模型外围构建一套可控、可编排、可验证的系统层,使 Agent 稳定完成复杂长程任务。CMU、耶鲁等机构在 2026 年 6 月发布的 Harness 工程综述进一步给出了实证:在不改模型权重的情况下,仅调整 Harness 层本身,就可能显著改变 Agent 在 coding 与 terminal benchmark 上的表现。
二、简史:Harness 如何在 9 个月内成为行业主词
Harness 的爆火是一场「连环事件驱动的完美风暴」。以下是关键时间线:
| 时间 | 事件 | 意义 |
|---|---|---|
| 2025 年 | OpenClaw(「龙虾」)发布 | MIT 开源 Agent 执行网关,插件生态先行 |
| 2025-11 下旬 | Anthropic 发布《Effective harnesses for long-running agents》 | 提出长时 Agent 双智能体架构(初始化 Agent + 编码 Agent) |
| 2026-01 | LangChain 发布 Deep Agents(伴随 LangChain 1.0) | 把 Claude Code 式设计抽象为开箱即用的开源 harness |
| 2026-02-05 | Mitchell Hashimoto(HashiCorp 联创)发文喊出「Engineer the Harness」 | 「Harness 工程师」角色首次被命名 |
| 2026-02-11 | OpenAI 发布《Harness engineering: leveraging Codex in an agent-first world》 | 披露 3 名工程师 + Codex、5 个月、近 100 万行生产代码、0 行人工手写、约 1500 个自动 PR 的实验;Harness Engineering 正式成为方法论 |
| 2026-02 | Nous Research 开源 Hermes Agent | 「自进化」路线登场,2 个月 5.1 万 Star |
| 2026-03 | DeepSeek 组建 Harness 团队(崔添翼负责) | 头部模型厂商下场做独立 Harness 产品线 |
| 2026-04 | Claude Code 源码泄露事件(约 57MB) | 全球开发者「狂欢式学习」,Claude Code 成为 Harness 设计的事实教科书 |
| 2026-06 | CMU/耶鲁等发布 Harness 工程综述;中金发布 Agent Harness 研究报告 | 学术与金融研究同时入场,概念完成正名 |
| 2026-08-01 | 崔添翼在 X 发帖招募 DeepSeek Harness 内测 | 招募帖变成开源 Agent 生态大摸底 |
| 2026-08-12 | DeepSeek Harness 公众号注册(「黑鲸」头像),内测口碑刷屏 | 有内测用户称愿称其为「宇宙最强」 |
| 2026-08-13 | DeepSeek Harness v0.1 开发者预览版发布,MIT 开源 | 首个头部模型厂商开源的全栈可组装 Agent Harness |
| 2026-08-14 | DeepSeek V4 Pro 正式上线 | 「模型 + Harness」双线齐发 |
一条隐藏主线值得注意:OpenAI 产品负责人 Thibault Sottiaux 在 2026 年 8 月初公开表示,「再过 2–3 个月,Codex 这样的 Harness 就是个原始工具了」——Harness 正在从单机工具向云原生 Agent 基础设施演进。
三、解剖学:成熟 Harness 的六层参考架构
对比 Claude Code、Codex、DeepSeek Harness、Deep Agents 等头部项目,可以归纳出一套「六层 + 事件流」的参考架构。这也是后文盘点每一款工具时的统一分析框架:
| 层 | 职责 | 典型机制 |
|---|---|---|
| L1 上下文工程层 | 管好模型的「注意力」 | 项目指令文件(CLAUDE.md / AGENTS.md)、静态底座 + 动态模块的缓存优先 Prompt 组装、渐进式上下文压缩 |
| L2 记忆层 | 跨会话的「经验」 | 追加式会话日志、FTS5 全文检索 + LLM 记忆、向量存储、进度日志(progress log) |
| L3 工具与环境层 | 给模型「手脚」 | Bash/Shell、文件编辑(str_replace_editor)、联网检索、沙箱隔离、MCP 工具接入 |
| L4 编排层 | 任务的拆解与调度 | Plan→Work→Review 闭环、子 Agent / Agent Teams、Cron 定时、后台任务 |
| L5 验证与恢复层 | 让错误「出不了门」 | Verification Agent、闭环测试、hooks 生命周期钩子、错误恢复、断点续跑/分叉/回放 |
| L6 治理与安全层 | 让系统「可审计」 | 权限门控、Human-in-the-loop 审批、审计日志、策略约束(guardrails) |
| 横切:事件流 | 一切行为可追溯 | append-only 事件日志(DeepSeek Harness 的 Trajectory 视图即此层产品化) |
一个判断 Harness 成熟度的简单标准:看它如何对待失败。初级 harness 把错误抛给用户;成熟 harness 把错误转化为反馈回路——自动重试、测试闭环、日志回放、架构护栏。
四、全景盘点:五大阵营、十四款主流工具
4.0 总览表(2026-08-14 快照)
| 工具 | 阵营 | 开源 | 一句话定位 |
|---|---|---|---|
| Claude Code | 模型厂商旗舰 | 闭源(源码曾泄露) | 终端工程级 Coding Agent 的行业标杆 |
| OpenAI Codex | 模型厂商旗舰 | 闭源 | Harness Engineering 的发源地,云端全自主 |
| DeepSeek Harness | 模型厂商旗舰 | MIT 开源(v0.1) | 一切皆插件的可组装 Harness,昨日发布 |
| OpenCode | 开源社区 | 完全开源(Go+JS) | 多模型、可定制、隐私优先的终端 harness |
| OpenClaw | 开源社区 | MIT | 50+ 平台接入的个人 Agent 执行网关 |
| Hermes Agent | 开源社区 | 开源 | 会「自我进化」的通用 Agent |
| Cursor | IDE 内嵌 | 闭源 | IDE 内实时协作的 Agent Harness |
| Trae / Trae Work | IDE 内嵌 | 闭源 | 字节系的 AI IDE 与本地 Agent |
| Deep Agents | 框架自建 | 开源 | LangChain 出品的开箱即用 harness |
| Open SWE | 框架自建 | 开源 | 企业内部 Coding Agent 的收敛架构 |
| OpenAI Agents SDK / Google ADK / MS Agent Framework / CrewAI / Mastra | 框架自建 | 开源 | 各家厂商的 Agent 开发底座 |
| Manus | 通用任务型 | 闭源 | 长程通用任务的自主 Agent |
| WorkBuddy / Kimi Work | 通用任务型 | 闭源 | 国产本地办公 Agent |
4.1 模型厂商旗舰 Harness
① Claude Code(Anthropic)——「行业标杆教科书」
- 定位:终端 Coding Agent,深度重构与大型代码库场景的事实标准。
- Harness 设计亮点(2026-04 源码泄露后被社区系统性拆解,公认是学习 Harness 设计的最佳教材):
- 三层架构:技能层(Skill,封装代码审查等任务流程)→ 工作流层(Workflow,编排执行顺序)→ 配置层(Profile,全局规则),核心是 Plan→Work→Review 闭环;
- 8 类基础工具(bash、read、edit 等)+ 子代理机制;
- 缓存优先的 Prompt 组装:「静态底座 + 动态模块」,静态在前、动态在后,最大化 KV 缓存命中,显著降低成本与延迟;
- 三层渐进式上下文压缩对抗长任务上下文腐烂;
- 六大内置 Agent,其中 Verification Agent 充当「代码质检官」;
- hooks 机制实现编辑后自动触发测试等流程自动化;CLAUDE.md 作为项目级「说明书」。
- 战绩:据第三方评测数据(2026-07),Claude Code 以 80.9% 通过率位居 SWE-bench Verified 榜首;在至顶 AI 实验室的六维评测中总分 82.5。
- 适合谁:中大型代码库的深度重构、需要严谨工程闭环的专业开发者。
② OpenAI Codex(CLI / Cloud / IDE)——「Harness Engineering 发源地」
- 定位:OpenAI 生态的 Agent 全家桶,本地 CLI + 云端全自主双形态。
- 关键事实:
- 2026-02 官方文章披露的「百万行实验」:小团队用 5 个月、约 1500 个自动 PR、0 行人工手写代码做出内部 beta 产品。工程师的角色从写代码变为设计环境、指定意图、建立反馈回路;
- Codex App Server 进一步明确了 harness 的完整边界:不止「用户—模型—工具」核心 loop,还包括线程生命周期与持久化、配置与鉴权、工具执行扩展、客户端与运行时之间的协议层;
- 至顶 AI 实验室六维评测中,Codex 以 91.6 分排名第一(Manus 86.4、Claude Code 82.5、OpenClaw 79.9);SWE-bench Verified 77.3%。
- 适合谁:OpenAI 生态用户;希望把整条任务「扔进云端异步跑完」的团队。
③ DeepSeek Harness——「昨日发布的开源全栈工作台」(详见第五章深潜)
4.2 开源社区 Harness
④ OpenCode——「社区之王」
- 完全开源(Go + JS),由开源社区(Anomaly 团队)维护,截至 2026-05 GitHub Star 约 158k,是终端类 harness 中 Star 数最高的开源项目之一。
- 卖点:多模型任意切换、隐私优先、可深度定制,国内可用性在终端类工具中最好。
- 适合谁:不愿绑定任何一家模型厂商、重视数据隐私、喜欢折腾的开发者。
⑤ OpenClaw(「龙虾」)——「个人 Agent 的调度中心」
- MIT 开源,2025 年发布,定位为 AI Agent 执行网关 / 多渠道消息路由器:接入 50+ 消息平台,把各种模型与能力「调度」起来。
- Harness 特征:MEMORY.md 记忆约定、沙盒隔离执行、内置 Cron 定时任务、庞大插件生态。
- 2026 年初成为开源史上增速最快的项目之一,催生了「养龙虾」式的个人 Agent 文化。
- 适合谁:想要一个「常驻的、跨平台的个人 AI 管家」的用户。
⑥ Hermes Agent(「爱马仕」)——「自进化路线旗手」
- Nous Research 于 2026-02 开源,主打越用越聪明:
- Skills 自动创建(对比 OpenClaw 的手动创建);
- 跨会话记忆:FTS5 全文索引 + LLM 提炼;
- RL 轨迹导出——把 Agent 运行轨迹变成训练数据,形成「使用 → 进化」闭环;
- 6 种执行环境、内置 Cron、支持任意模型。
- 开源不到 2 个月 Star 破 5.1 万、贡献者 300+,迭代至 v0.8.0。
- 与 OpenClaw 的本质差异:OpenClaw 是「管理 AI 资源的调度中心」,Hermes 是「会自主学习的 AI 员工」。
- 适合谁:关注 Agent 自我进化与 RL 数据飞轮的研究型用户。
4.3 IDE 内嵌 Harness
⑦ Cursor——「IDE 里的 Harness」
- 把 Agent Harness 直接嵌进编辑器:上下文采集与 IDE 状态深度耦合,实时辅助体验最顺滑。
- 短板:离开 IDE 的长程自主任务能力弱于终端类 harness。
- 适合谁:以编辑器为第一现场的日常开发。
⑧ Trae / Trae Work(字节跳动)
- Trae 是 AI IDE,Trae Work 是面向本地办公场景的 Agent。在「同一项目跑多 harness」的对照实验中,Trae 的 Harness 差异主要体现在上下文组织与工具权限策略上。
- 适合谁:国内环境、追求开箱即用与中文生态的开发者。
4.4 框架自建型 Harness(给「造马具的人」)
⑨ Deep Agents(LangChain)
- 2026-01 随 LangChain 1.0 发布,官方定位非常直白:「不是框架,是 harness」——一匹已经套好缰绳的马。
- 逆向分析了 Claude Code / Deep Research / Manus 的共性,固化三件套:任务规划(planning)+ 虚拟文件系统(长任务外存)+ 子 Agent(上下文隔离),底层跑在 LangGraph 有状态运行时之上,可接入 LangGraph Store 获得跨会话持久记忆。
- 适合谁:要在自家产品里嵌入「Claude Code 式能力」、又要完全可控的企业团队。
⑩ Open SWE(LangChain 生态)
- 2026 年发布的开源框架,源于一个重要观察:Stripe、Ramp、Coinbase 三家独立开发内部 Coding Agent,最终收敛到相同的五大架构模式。Open SWE 把这种收敛直接产品化,是「Harness 解剖学」的第一个大规模生产验证。
⑪ 厂商 SDK 矩阵
- OpenAI Agents SDK、Google ADK、Microsoft Agent Framework、CrewAI、Mastra、LlamaIndex Workflows:这些属于「给你积木自己拼」的 DSL / Runtime 层,与 Deep Agents、DeepSeek Harness 这类「成品 harness」构成上下游关系。选型原则:简单任务用 SDK 直连,长程自治任务用成品 harness 或在其上做二次封装。
4.5 通用任务型 Harness
⑫ Manus
- 通用长程任务 Agent(调研、PPT、网站生成等),至顶评测总分 86.4、仅次于 Codex。
- 其创始人 Peak Ji 的上下文工程实践(KV-cache 优先、todo.md 外存、文件系统当记忆)被 Google DeepMind 工程师 Philipp Schmid 专文总结,已成为 Harness 设计的经典案例。
⑬ WorkBuddy / ⑭ Kimi Work
- 国产本地办公 Agent 代表(另有 Trae Work),主打「把 Agent 装进自己的电脑」,在国内网络与工作流环境下可用性最好。DeepSeek Harness 的「Agent 预设」能力,正是对标这类现成工具的个性化方向。
五、焦点深潜:DeepSeek Harness v0.1 逐层拆解
发布时间:2026-08-13 晚间 | 版本:v0.1 开发者预览版 | 协议:MIT | 仓库:
deepseek-ai/deepseek-harness(CLI 名dsh)
这是昨天刚发布、也是本文时效性最强的部分。DeepSeek Harness 是 DeepSeek 的首款 Agent 产品,由 2026 年 3 月成立、崔添翼负责的 Harness 团队打造,从招募内测到开源发布仅用约两周。
5.1 设计哲学:一切皆插件
DeepSeek Harness 基于 Cordis 插件元框架构建。Cordis 负责插件的加载、卸载与依赖管理;Agent Harness 中的一切能力都是插件:
模型 / 工具 / 技能(Skill) / 会话 / 沙箱 / 存储 / 循环 / 调度 / UI
└────────────── 全部是可独立加载、卸载、替换的 Cordis 插件 ──────────────┘
插件之间通过服务与事件协作,在配置层自由组合——开发者不改源码即可替换、扩展任一能力。这把 Agent 构建从「黑盒」变成了「可组装」,企业可以无缝私有化部署,也天然支持换用 OpenAI、Anthropic 等第三方模型:框架先行,不绑定特定模型。
5.2 四种运行模式:一套底座,四种人格
四种模式本质是预设的插件集合快照,共享同一 Cordis 底座,实现「一次开发、多态运行」:
| 模式 | 加载策略 | 适用场景 |
|---|---|---|
| 标准模式 | 完整工具组合:文件编辑、Shell、联网检索、Skill 调用、多 Agent 编排 | 日常全功能开发,从零构建项目 |
| PTC 模式(Programmatic Tool Calling) | 模型生成 TypeScript 程序来组合多轮工具调用 | 需要确定性、精细化控制工具链的场景,兼顾效率与可解释性 |
| 极简模式 | 仅持久 bash + str_replace_editor 双工具 |
轻量任务;更是基准测试的「纯模型能力」对照组 |
| 创造模式 | 支持内存内调试、自定义 Agent preset 生成 | 打造专属 Agent(写代码、写作等预设),孵化新模式 |
极简模式的存在尤其体现「懂行」:它给评测社区提供了一个标准化的低干预环境,用来度量模型本身的 Agent 能力,剥离 harness 加成——这正是 Harness 综述论文强调的「控制变量」思路。
5.3 事件流:一切有迹可循
DeepSeek Harness 把「可追溯」做成了第一公民:
- 模型看到的一切都写入仅追加(append-only)会话日志;
- Trajectory 视图按来源查看每条信息;
- 恢复、分叉、检索、回放共享同一份事件流——调试一个失败任务可以像 git 一样 fork 出多个分支重新尝试。
5.4 能力清单与快速上手
官方能力面:项目管理、长任务执行、多 Agent 协同、Skill 集成、联网搜索、上下文管理。
上手门槛压到极低——npx 一行命令即可拉起 Web UI;完整部署则克隆 deepseek-ai/deepseek-harness 仓库,在配置层选择模式与插件组合即可。
5.5 冷静评价
- 优势:①头部模型厂商背书 + MIT 协议,是「可组装 harness」路线的第一个大厂开源样本;②PTC 与事件流回放的设计在工程先进性上对标甚至局部超越了闭源竞品;③与同日上线的 V4 Pro / 登顶调用榜的 V4-Flash 形成「模型 + Harness」闭环。
- 风险提示:官方明确 v0.1 为早期预览版,「核心插件与基础接口将持续快速迭代」——意味着 API 尚不稳定,生产引入需锁定版本、做好跟进升级的准备。
六、横向对比与选型矩阵
6.1 核心维度对比(截至 2026-08-14)
| 维度 | Claude Code | Codex | DeepSeek Harness v0.1 | OpenCode | OpenClaw | Hermes Agent | Deep Agents |
|---|---|---|---|---|---|---|---|
| 开源/协议 | 闭源 | 闭源 | MIT | 开源 | MIT | 开源 | 开源 |
| 模型绑定 | Claude 系 | GPT 系 | 不绑定(框架先行) | 多模型 | 多模型 | 任意模型 | 多模型 |
| 扩展机制 | Skill/hooks/子代理 | 声明式提示词+协议层 | 全插件化(Cordis) | 配置+插件 | 插件生态 | 自进化 Skills | 规划+文件系统+子Agent |
| 记忆/可追溯 | 三层压缩+CLAUDE.md | 线程持久化 | append-only 日志+分叉回放 | 会话管理 | MEMORY.md | FTS5+LLM、RL 轨迹导出 | LangGraph Store |
| 多 Agent | 子代理/Agent Teams | 云端并行 | 多 Agent 编排插件 | 子代理 | 网关调度 | 支持 | 原生支持 |
| 私有化部署 | 受限 | 受限 | 原生支持 | 原生支持 | 原生支持 | 原生支持 | 原生支持 |
| 成熟度 | 高 | 高 | 预览版(快速迭代) | 高 | 高 | 中(快速迭代) | 中高 |
6.2 场景选型速查
| 你的场景 | 首选 | 备选 |
|---|---|---|
| 10 万行级代码库深度重构 | Claude Code | Codex |
| 云端异步批量任务、零手写代码流水线 | Codex | Claude Code(后台任务) |
| 私有化部署 / 必须可审计可组装 / 国产合规 | DeepSeek Harness | OpenCode |
| 多模型自由切换、隐私敏感 | OpenCode | Hermes Agent |
| 跨平台个人 AI 管家 | OpenClaw | Kimi Work / WorkBuddy |
| 研究型:自进化与 RL 数据回流 | Hermes Agent | — |
| 把 harness 嵌入自家产品 | Deep Agents / Open SWE | DeepSeek Harness 插件化二开 |
| IDE 重度用户、实时协作 | Cursor | Trae |
| 非代码长程任务(调研/文档/网站) | Manus | Trae Work |
七、趋势研判:关于 Harness 的七个判断
- 竞争焦点已经换挡。 模型跑分的边际收益在递减,「Model + Harness」的协同落地能力成为新赛点——DeepSeek 资深研究员陈德里在 V4 Pro 发布日的表述也印证了这一点。
- 开源可组装路线将倒逼闭源阵营。 DeepSeek Harness 用 MIT + 全插件化把「黑盒 harness」变成公共基础设施,类似当年 DeepSeek 对模型价格的冲击。
- Harness 正在云原生化。 OpenAI 高管已明言本地 harness「再火俩月」就是原始工具;线程持久化、协议层、远程执行将成为标配。
- 事件流与可回放成为分水岭。 append-only 轨迹、分叉、回放从调试特性升级为 harness 的核心架构(DeepSeek Harness、Codex App Server 殊途同归)。
- PTC(程序化工具调用)会普及。 用代码而非逐次 JSON 调用编排工具,是确定性、效率与可解释性的三重优化,预计半年内被主流 harness 跟进。
- 「Harness 工程师」岗位化。 从 Mitchell Hashimoto 命名该角色,到 883 实体、1590 条关系的 Harness 知识图谱出现,这已是一门有方法论、有综述论文、有产业报告的正式学科。
- 评测将被 harness 重塑。 极简模式这类「纯模型对照环境」会催生新的基准范式:先量模型裸能力,再量 harness 加成,二者分开报价。
八、FAQ:高频问题速答
Q1:Agent Harness 和 Agent 框架(如 LangChain)是一回事吗?
A:不是。框架给你积木让你自己拼;harness 是已经套好缰绳的完整运行系统。二者是上下游关系——例如 Deep Agents 就是「用 LangGraph 运行时实现的成品 harness」。
Q2:DeepSeek Harness 和 Claude Code 谁更强?
A:截至发布日(2026-08-14)无法直接对比:前者是 v0.1 预览版,后者是经过一年打磨的闭源成熟产品。DeepSeek Harness 的差异化在于开源、可组装、不绑定模型;能力上限需等正式版与第三方基准验证。内测用户的「宇宙最强」评价仅供参考。
Q3:Harness Engineering 和 Context Engineering 是什么关系?
A:包含关系:Prompt ⊂ Context ⊂ Harness。上下文工程管「喂什么」,Harness 工程还包括工具与环境、编排、验证、治理,是给模型搭出完整工作环境。
Q4:个人开发者现在该上车哪一款?
A:编码为主选 Claude Code 或 Codex;想折腾、重隐私选 OpenCode;想要全能个人助理选 OpenClaw;想体验最新的可组装范式,npx 一行命令试试 DeepSeek Harness。
Q5:「evaluation harness」(如 lm-evaluation-harness)也是这个概念吗?
A:不是。那是模型评测执行框架,属于另一个领域;但二者正在交汇——如 DeepSeek Harness 的极简模式就是为基准评测设计的。
九、参考资料
- DeepSeek Harness 团队:《DeepSeek Harness 开发者预览版发布:一切皆插件》,2026-08-13(腾讯网/每日经济新闻/PingWest 品玩同日报道)
- OpenAI:《Harness engineering: leveraging Codex in an agent-first world》,2026-02-11(InfoQ 中文报道,2026-02-27)
- Anthropic:《Effective harnesses for long-running agents》,2025-11
- 中金研究:《Agent Harness:模型之外、智能之内》,2026-06-04
- 智源社区:《全网最详细 Agent Harness 综述》(CMU/耶鲁/杜兰/亚马逊联合论文解读),2026-06-02
- 智东西:《120 万星!开发者排队"投简历",DeepSeek 一条内测帖变成了 Agent 开源大摸底》,2026-08-04
- 界面新闻:《黄仁勋押注,DeepSeek 内测,详解 Harness 到底是什么?》,2026-08-03
- 36kr:《OpenAI 高管:Codex 这样的 Harness,也就再火俩月》,2026-08-09
- SegmentFault 思否:《Hermes、Codex、Claude Code、OpenClaw 深度对比:四大终端 AI Agent 完整选型指南》,2026-05-11
- 稀土掘金:《2026 终端 AI 编码 Agent 六大工具深度横评》,2026-05-14
- 今日头条(至顶 AI 实验室):《Codex、Manus、Claude Code、OpenClaw 谁才是最强的 Agent》,2026-06-25
- 博客园:《DeepSeek Harness 2026:一切皆插件 — 开发者预览版完全指南》,2026-08-13
- 腾讯云开发者社区:《Agent = Model + Harness:模型决定上限,Harness 决定下限》,2026-05-20
- 中国计算机学会(CCF):《驾驭工程崛起:大模型智能体 Harness 技术体系与前沿进展》,2026-04
结语:如果说 2025 年的问题是「哪个模型更聪明」,那么 2026 年的问题已经变成「谁给模型配了更好的办公室」。DeepSeek Harness 昨天以 MIT 协议把整间「办公室」的图纸开源了出来——无论它最终能否成为事实标准,「Model + Harness」的公式都已经写进了这个时代的工程基因里。下一步,轮到你了:选好你的马具,或者,亲手打造一副。
本文事实性信息均基于截至 2026-08-14 的公开报道与官方发布;评测分数为对应来源在各自测试条件下的结果,不构成绝对排名。欢迎在评论区聊聊你现在的主力 Harness 是哪一款。
更多推荐
所有评论(0)