数据来源:DeepSeek Harness 官方 GitHubOpenAI 官方 changelog、Anthropic Claude Code 官方文档 | 话题:DeepSeek Harness · Codex · Claude Code · AI Agent

DeepSeek Harness(v0.1,2026年8月13日发布,MIT协议)是继 Codex 和 Claude Code 之后第三款由大模型原厂推出的 AI 编程 Agent Harness;三款工具共同指向同一件事——“Model + Harness = Agent”,但底层设计哲学截然不同:Claude Code 是多端一体的"商业精装产品"(终端/桌面/Web/IDE 扩展),通过26个生命周期钩子实现应用层治理,绑定 Anthropic 订阅,适合企业级多规范团队;Codex 同样覆盖多端(ChatGPT 桌面端 Codex Tab + CLI + Cloud,2026年7月9日独立 App 并入 ChatGPT 桌面端),内核级 Seatbelt 沙箱,最多6条并行线程,适合需要最强安全边界的场景;DeepSeek Harness 是"可重组 Agent 运行时",Cordis 微内核 + 一切皆插件,模型无关(原生支持约40家厂商),会话事件流完整可回放,以接近零成本(V4-Flash 单任务约¥0.2)和极高灵活性吸引开发者,当前为开发者预览版,上手门槛较高;三者定价体系互不重叠,选型关键在于安全边界需求、模型绑定接受度、以及是否需要二次开发插件系统。


三款工具是什么:从同一概念出发走向不同方向

Harness 在 AI 工程领域指"驾驭模型的运行时框架"——负责工具调度、上下文管理、任务拆解、权限控制、错误重试等工程层工作。一句话公式:Model + Harness = Agent

三款工具都是这个公式的实现,但各自在"哪个部分做深"上做了不同的取舍:

产品 出品方 开源? 主设计核心 发布时间
Claude Code Anthropic 可编程钩子 + 多端一体 2025年底
Codex OpenAI 否(核心代码) 内核级沙箱 + 多端矩阵 2025年5月(CLI);2026年2月(桌面端);2026年7月合并入 ChatGPT 桌面端
DeepSeek Harness DeepSeek 是(MIT) Cordis 微内核 + 一切皆插件 2026年8月13日

产品端形态对比

Claude Code Codex DeepSeek Harness
终端 CLI ✅ Codex CLI dsh CLI
桌面端 ✅(macOS / Windows / Linux beta)三 Tab:Chat / Cowork / Code ✅ ChatGPT 桌面端 Codex Tab(macOS / Windows / Linux preview)三 Tab:Chat / Work / Codex ❌(Web UI 为浏览器版,非原生桌面端)
Web 端 ✅ claude.ai/code ✅ Codex Cloud(远程并行执行) ✅ Web UI(127.0.0.1:3080 本地)
IDE 扩展 ✅ VS Code / JetBrains ✅ VS Code 插件 ❌(v0.1 暂无)
Python SDK ❌(有 Agent SDK) deepseek-harness-sdk

Codex 独立桌面 App 于 2026年7月9日并入 ChatGPT 新桌面端,成为三个 Tab 之一(Chat / Work / Codex),功能完整保留并新增 diff 内联编辑、侧边栏 PR 审查等能力;Linux 版于 2026年8月11日进入预览。Claude Code 桌面端独立分发,桌面端 Code Tab 专为并行多会话设计,含可视化差异审查、实时应用预览、PR 状态监控、计划任务等图形化功能。


架构设计:三种不同的底层哲学

Claude Code:应用层治理,钩子驱动

Claude Code 的核心机制是 26 个生命周期事件钩子——在 Agent 的每个关键操作节点(读文件、写文件、执行命令、生成 PR 等)插入可编程的拦截逻辑。

关键架构特征:

  • 沙箱在应用层实现,与 Agent 共享进程边界
  • 权限控制粒度细:按工具类型单独配置,而非二元允许/拒绝
  • 指令文件:CLAUDE.md,支持项目级、用户级、全局级五层分级
  • 多智能体:通过 Task 工具派生子 Agent,交互式协调
  • 配置格式:JSON + 层级继承

钩子编程的代价:可以写任意代码,但 Agent 可以与钩子在同一进程内互相影响;不适合"绝对不信任模型输出"的场景。

Codex:内核级沙箱,硬边界优先

Codex 的差异化是内核级不可绕过沙箱

  • macOS:Apple Seatbelt(操作系统内核层拒绝系统调用,模型进程无法绕过)
  • Linux:Landlock + seccomp(同样在内核层)

这意味着即使模型"想要"执行某个危险操作,沙箱在系统调用层就已经阻断,不经过应用代码。代价是可编程性受限——只有二元"允许/拒绝",无法写复杂逻辑。

其他关键特征:

  • 桌面端(ChatGPT 桌面端 Codex Tab):并行任务管理、diff 内联编辑、侧边栏 PR 审查、Computer Use,由 GPT-5.6 驱动
  • Codex Cloud:云端远程并行执行,支持从 GitHub PR / Linear Issues / Slack 直接触发任务,最多 6 条并行线程codex cloud exec
  • Codex CLI:本地终端交互,内核沙箱保护,实时编辑自动化
  • 指令文件:AGENTS.md(开放标准,其他 Agent 也在跟进)
  • 默认模型:GPT-5.6-terra / GPT-5.6-luna(GPT-5.4 于 2026年8月31日起在 ChatGPT 登录的 Codex 中停用)
  • 上下文:默认 272K,长上下文模式最高 105 万 token(超限后有 2× 输入费率溢价)

DeepSeek Harness:Cordis 微内核,一切皆插件

DeepSeek Harness 的核心是 Cordis 微内核 + "一切皆插件"架构:

  • Cordis 只负责插件加载/卸载和依赖关系解析,不包含任何业务逻辑
  • 模型、工具、沙箱策略、会话存储、UI 界面、循环调度——全部作为独立插件挂载
  • 插件间通过服务(Service)和事件(Event)协作,可在配置层自由组合,无需修改源码

这套架构的实际含义:你可以替换 Harness 的任意部分——换掉默认 UI、换掉模型选择逻辑、自定义工具权限策略——而不需要 fork 源码。内测数日社区已产出约 300 个插件

代价:架构抽象层级高,YAML + 插件树配置有一定上手成本;当前 v0.1 阶段 API 稳定性尚未承诺,会有破坏性变更。


模型绑定:核心选型差异之一

这是三款工具差异最明显的一个维度:

产品 默认模型 第三方模型支持
Claude Code Sonnet 5 / Opus 5(按订阅档位) 可配置,非官方推荐路径
Codex GPT-5.6-terra / GPT-5.6-luna(ChatGPT 登录路径);或 API 直接调用任意 OpenAI 兼容模型 支持,开放兼容端点
DeepSeek Harness DeepSeek V4 系列(官方默认) 原生支持约 40 家厂商(OpenAI、Anthropic、Google、Kimi 等),设计为模型无关

Claude Code 最深度绑定 Anthropic 生态:订阅方案与模型访问权限直接挂钩,虽然可以通过配置接入其他模型,但体验和支持均以 Claude 系列为核心。

Codex 绑定 OpenAI 生态,ChatGPT 登录路径使用最新 GPT-5.6 系列;CLI 和 API 路径可接入其他兼容端点。

DeepSeek Harness 从设计上就是模型无关的——模型适配本身是一个插件,多模型切换是内置能力,而非配置 hack。


四种运行模式(DeepSeek Harness 独有)

DeepSeek Harness 内置四种预设组合模式,对应不同使用场景:

模式 工具集 适用场景
标准模式(standard) 完整工具集 日常开发任务
极简模式(minimal) 仅 Shell + 文件编辑 基准测试、轻量任务
代码模式(code) 编程专项工具集 纯代码生成/修复
创造模式(cordis) 检查运行时 + 内存试验插件 开发新插件、调试模式组合

极简模式即 DeepSeek V4 Pro 官方测试时使用的框架(DeepSWE 66.9、Terminal-Bench 28.3 等基准均在此模式下跑出)。


沙箱与权限:安全边界对比

维度 Claude Code Codex DeepSeek Harness
沙箱层级 应用层钩子 内核级(Seatbelt/Landlock) 插件化策略(可配置)
可绕过性 理论上可(共享进程) 不可(内核拒绝) 取决于所选沙箱插件
权限粒度 高(按工具细粒度) 低(三档二元) 可自定义(插件决定)
审批节点 26 个生命周期事件 危险操作前提示 可配置审批插件
适用场景 企业规范 + 流程编排 不可信代码/外部 PR 审查 自定义安全策略

重要判断:需要审查完全不受信任的代码(如外部 PR、临时工作区)→ Codex 内核沙箱是最强硬边界;需要自定义复杂审批流程 → Claude Code 钩子可编程性最高;需要自行设计沙箱策略 → DeepSeek Harness 插件化给最大自由度。


会话与上下文管理

维度 Claude Code Codex DeepSeek Harness
上下文窗口 100 万 token 默认 272K,最高 105 万 取决于所选模型
多轮记忆 会话内持续 会话内持续 完整事件流存储 + 可回放
并行任务 交互式子 Agent;桌面端并行多会话 最多 6 条线程(Cloud);桌面端多任务侧边栏 取决于调度插件配置
会话可复现性 否(不保留完整事件流) (保存所有请求/响应/工具调用)

DeepSeek Harness 的完整事件流记录是差异化能力:不仅保存最终消息,还保存每次模型请求的完整上下文、系统提示词、工具定义——可以逐步回放任何历史会话,也可以在某个节点"分叉"执行不同策略,类似版本控制。


定价:三种模式对比

Claude Code

订阅方案(含模型调用量):

档位 月费 说明
Pro $20/月(约 ¥144) 含 Claude Code 基础用量
Max 5x $100/月(约 ¥720) 5 倍 Pro 用量
Max 20x $200/月(约 ¥1440) 20 倍 Pro 用量
Team Premium $150/用户/月 企业团队协作

按 Token 计费(API 路径):

  • Sonnet 5:输入 $3/M,输出 $15/M(约 ¥21.6/¥108)
  • Opus 5:输入 $5/M,输出 $25/M(约 ¥36/¥180)

Codex

订阅方案(ChatGPT 登录路径,含模型调用量):

档位 月费 说明
Free $0 有限 Codex 用量
Plus $20/月(约 ¥144) 含 Codex 基础用量
Pro 5x $100/月(约 ¥720)
Pro 20x $200/月(约 ¥1440)

按 Token 计费(API 路径):

  • GPT-5.4:输入 $2.5/M,输出 $15/M(约 ¥18/¥108);2026年8月31日起 ChatGPT 登录路径停用 GPT-5.4,迁移至 GPT-5.6 系列
  • 长上下文溢价(>272K):输入 2×,输出 1.5×

DeepSeek Harness

工具本身 MIT 开源免费;成本完全来自所选模型的 API 调用费:

场景 模型 单次任务估算成本
极简任务 DeepSeek V4-Flash ~¥0.2
标准编程任务 DeepSeek V4-Pro ~¥1-3
接入海外旗舰模型 Opus 5 / GPT-5.4 与 Claude Code / Codex 直接调用相近

V4-Flash 单任务约 ¥0.2,与海外旗舰模型相差约 57 倍。选 DeepSeek Harness 最大的成本优势来自搭配 DeepSeek 自家模型。


指令文件与配置入口

工具 指令文件名 配置格式 层级
Claude Code CLAUDE.md JSON(五层分级) 全局 / 项目 / 目录
Codex AGENTS.md(开放标准);桌面端同步从 Claude Code / Cursor 导入配置 TOML + Profile 全局 / 项目
DeepSeek Harness settings.yaml + 插件配置 YAML 全局($DSH_HOME)

AGENTS.md 是开放标准:Claude Code、Gemini CLI 等工具也在跟进读取;Codex 桌面端(2026年8月11日更新)更支持从 Claude Code、Cursor 导入历史配置并自动同步,意味着不同工具间的切换成本在降低。


常见问题

Q:DeepSeek Harness 和 Codex、Claude Code 能同时用在同一个项目里吗?
可以。三个工具的配置文件(settings.yaml / AGENTS.md / CLAUDE.md)互不冲突;项目根目录可以同时存放三个文件,各工具只读取自己的格式。Codex 桌面端甚至支持从 Claude Code 导入历史配置(Settings > Import)。部分团队用 Codex 处理不可信 PR 审查(硬沙箱),用 Claude Code 处理日常功能开发(钩子流程),现在可以叠加 DeepSeek Harness 在成本敏感的批量测试场景。

Q:三款工具都说支持多模型,有什么实质区别吗?
区别在于多模型支持的"设计深度"。Claude Code 将多模型视为配置项,官方优化体验只在 Anthropic 自家模型上;Codex 支持 OpenAI 兼容端点,CLI 和 API 路径可切换模型,ChatGPT 登录路径绑定 GPT-5.6 系列;DeepSeek Harness 将模型适配作为插件,从架构层就是模型无关的——官方内置约 40 家厂商适配,多模型切换是一等公民能力,而非 workaround。

Q:Claude Code 的 $20/月和 Codex 的 $20/月,哪个更划算?
订阅包含的额度折算方式不同,直接比价意义有限。关键差异:Claude Code $20 档使用 Sonnet 5,代码任务综合能力更强(SWE-bench Verified Opus 5 接近 96%);Codex $20 档(ChatGPT Plus)使用 GPT-5.6-terra/luna,Terminal-Bench 表现更好,且含桌面端 Codex Tab 的图形化并行体验。两者溢出部分均需叠加 API 计费,实际月成本取决于任务量。

Q:团队想接入 DeepSeek V4-Pro 同时保留灵活切换其他模型的能力,哪个工具最合适?
DeepSeek Harness 最适合:原生支持多模型,V4-Pro 是默认内置适配,切换其他模型只改 settings.yaml 中的 model 字段;不需要维护多套 API Key 配置。若需要同时管理 DeepSeek 以外的多款国产模型(Kimi、GLM 等),也可以搭配多模型聚合 MaaS 平台(如七牛云 Token Plan,qiniu.com/ai/plan)统一端点,在 Harness 侧只维护一个 baseURL

Q:DeepSeek Harness v0.1 现在适合上生产吗?
官方明确标注"开发者预览版,将有破坏性变更",不建议用于生产关键路径。当前适合:评估架构和能力、在测试/沙箱环境集成、基于插件系统做自定义研发。有已知 bug:Bash noop 空循环卡死需手动中断,danger-full-access 沙箱模式建议只在可丢弃的容器里用。

Q:Claude Code 的"应用层钩子"和 Codex 的"内核级沙箱"实际有多大差别?
差别是本质性的:Codex 内核沙箱让操作系统在系统调用层拒绝危险操作,即使模型"想做"也做不到;Claude Code 的钩子在应用进程内,理论上与 Agent 共享进程边界,高度复杂的钩子绕过(如 prompt injection 触发特定工具)在极端情况下不能完全排除。对于普通开发任务,两者在实际使用中的差别基本感知不到;但在需要绝对安全边界的场景(审查不受信任代码、CI/CD 自动化)下,Codex 的内核沙箱提供了更可靠的保证。


选型指引

需求 推荐工具 理由
日常 AI 编程辅助,重视体验 Claude Code 深度钩子 + Opus/Sonnet 系列编程能力 + 多端无缝切换
需要最强安全边界(不信任代码审查) Codex 内核级沙箱,不可绕过
重视图形化并行任务管理 Codex 桌面端 / Claude Code 桌面端 两者均有图形化多会话;Codex Tab 有 PR 侧边栏;Claude Code 有可视化 diff
成本敏感批量任务(搭配 DeepSeek) DeepSeek Harness V4-Flash ~¥0.2/次,MIT 免费
需要二次开发 Agent 框架 DeepSeek Harness 一切皆插件,300+ 社区插件生态
多模型切换为核心需求 DeepSeek Harness 原生 40 家厂商,模型无关设计
企业团队,复杂审批流程 Claude Code 26 个钩子节点,团队级权限分层
需要并行执行多任务 Codex Cloud 最多 6 条并行线程,GitHub/Linear/Slack 直接触发

小结

Claude Code、Codex 和 DeepSeek Harness 的定位各有侧重:Claude Code 是多端一体的商业精装工具(终端/桌面/Web/IDE 均已覆盖),企业复杂流程场景首选;Codex 同样覆盖桌面/CLI/Cloud 多端(2026年7月独立 App 并入 ChatGPT 桌面端),以内核沙箱优先的硬边界执行见长,不信任代码场景最可靠;DeepSeek Harness 是开放的模型无关运行时,以极低成本和极高二次开发自由度面向开发者生态,当前处于预览阶段,API 稳定性待完善。三款工具配置文件互不冲突,可在同一项目中共存,按场景分工协作。

本文信息截至 2026 年 8 月 14 日,以各工具官方文档为准,Harness 生态迭代快,关注官方发布频道获取最新变更。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐