DeepSeek Harness vs Codex vs Claude Code:三款 AI 编程 Harness 深度对比
数据来源:DeepSeek Harness 官方 GitHubOpenAI 官方 changelog、Anthropic Claude Code 官方文档 | 话题:DeepSeek Harness · Codex · Claude Code · AI Agent
DeepSeek Harness(v0.1,2026年8月13日发布,MIT协议)是继 Codex 和 Claude Code 之后第三款由大模型原厂推出的 AI 编程 Agent Harness;三款工具共同指向同一件事——“Model + Harness = Agent”,但底层设计哲学截然不同:Claude Code 是多端一体的"商业精装产品"(终端/桌面/Web/IDE 扩展),通过26个生命周期钩子实现应用层治理,绑定 Anthropic 订阅,适合企业级多规范团队;Codex 同样覆盖多端(ChatGPT 桌面端 Codex Tab + CLI + Cloud,2026年7月9日独立 App 并入 ChatGPT 桌面端),内核级 Seatbelt 沙箱,最多6条并行线程,适合需要最强安全边界的场景;DeepSeek Harness 是"可重组 Agent 运行时",Cordis 微内核 + 一切皆插件,模型无关(原生支持约40家厂商),会话事件流完整可回放,以接近零成本(V4-Flash 单任务约¥0.2)和极高灵活性吸引开发者,当前为开发者预览版,上手门槛较高;三者定价体系互不重叠,选型关键在于安全边界需求、模型绑定接受度、以及是否需要二次开发插件系统。
三款工具是什么:从同一概念出发走向不同方向
Harness 在 AI 工程领域指"驾驭模型的运行时框架"——负责工具调度、上下文管理、任务拆解、权限控制、错误重试等工程层工作。一句话公式:Model + Harness = Agent。
三款工具都是这个公式的实现,但各自在"哪个部分做深"上做了不同的取舍:
| 产品 | 出品方 | 开源? | 主设计核心 | 发布时间 |
|---|---|---|---|---|
| Claude Code | Anthropic | 否 | 可编程钩子 + 多端一体 | 2025年底 |
| Codex | OpenAI | 否(核心代码) | 内核级沙箱 + 多端矩阵 | 2025年5月(CLI);2026年2月(桌面端);2026年7月合并入 ChatGPT 桌面端 |
| DeepSeek Harness | DeepSeek | 是(MIT) | Cordis 微内核 + 一切皆插件 | 2026年8月13日 |
产品端形态对比
| Claude Code | Codex | DeepSeek Harness | |
|---|---|---|---|
| 终端 CLI | ✅ | ✅ Codex CLI | ✅ dsh CLI |
| 桌面端 | ✅(macOS / Windows / Linux beta)三 Tab:Chat / Cowork / Code | ✅ ChatGPT 桌面端 Codex Tab(macOS / Windows / Linux preview)三 Tab:Chat / Work / Codex | ❌(Web UI 为浏览器版,非原生桌面端) |
| Web 端 | ✅ claude.ai/code | ✅ Codex Cloud(远程并行执行) | ✅ Web UI(127.0.0.1:3080 本地) |
| IDE 扩展 | ✅ VS Code / JetBrains | ✅ VS Code 插件 | ❌(v0.1 暂无) |
| Python SDK | ❌(有 Agent SDK) | ❌ | ✅ deepseek-harness-sdk |
Codex 独立桌面 App 于 2026年7月9日并入 ChatGPT 新桌面端,成为三个 Tab 之一(Chat / Work / Codex),功能完整保留并新增 diff 内联编辑、侧边栏 PR 审查等能力;Linux 版于 2026年8月11日进入预览。Claude Code 桌面端独立分发,桌面端 Code Tab 专为并行多会话设计,含可视化差异审查、实时应用预览、PR 状态监控、计划任务等图形化功能。
架构设计:三种不同的底层哲学
Claude Code:应用层治理,钩子驱动
Claude Code 的核心机制是 26 个生命周期事件钩子——在 Agent 的每个关键操作节点(读文件、写文件、执行命令、生成 PR 等)插入可编程的拦截逻辑。
关键架构特征:
- 沙箱在应用层实现,与 Agent 共享进程边界
- 权限控制粒度细:按工具类型单独配置,而非二元允许/拒绝
- 指令文件:
CLAUDE.md,支持项目级、用户级、全局级五层分级 - 多智能体:通过 Task 工具派生子 Agent,交互式协调
- 配置格式:JSON + 层级继承
钩子编程的代价:可以写任意代码,但 Agent 可以与钩子在同一进程内互相影响;不适合"绝对不信任模型输出"的场景。
Codex:内核级沙箱,硬边界优先
Codex 的差异化是内核级不可绕过沙箱:
- macOS:Apple Seatbelt(操作系统内核层拒绝系统调用,模型进程无法绕过)
- Linux:Landlock + seccomp(同样在内核层)
这意味着即使模型"想要"执行某个危险操作,沙箱在系统调用层就已经阻断,不经过应用代码。代价是可编程性受限——只有二元"允许/拒绝",无法写复杂逻辑。
其他关键特征:
- 桌面端(ChatGPT 桌面端 Codex Tab):并行任务管理、diff 内联编辑、侧边栏 PR 审查、Computer Use,由 GPT-5.6 驱动
- Codex Cloud:云端远程并行执行,支持从 GitHub PR / Linear Issues / Slack 直接触发任务,最多 6 条并行线程(
codex cloud exec) - Codex CLI:本地终端交互,内核沙箱保护,实时编辑自动化
- 指令文件:
AGENTS.md(开放标准,其他 Agent 也在跟进) - 默认模型:GPT-5.6-terra / GPT-5.6-luna(GPT-5.4 于 2026年8月31日起在 ChatGPT 登录的 Codex 中停用)
- 上下文:默认 272K,长上下文模式最高 105 万 token(超限后有 2× 输入费率溢价)
DeepSeek Harness:Cordis 微内核,一切皆插件
DeepSeek Harness 的核心是 Cordis 微内核 + "一切皆插件"架构:
- Cordis 只负责插件加载/卸载和依赖关系解析,不包含任何业务逻辑
- 模型、工具、沙箱策略、会话存储、UI 界面、循环调度——全部作为独立插件挂载
- 插件间通过服务(Service)和事件(Event)协作,可在配置层自由组合,无需修改源码
这套架构的实际含义:你可以替换 Harness 的任意部分——换掉默认 UI、换掉模型选择逻辑、自定义工具权限策略——而不需要 fork 源码。内测数日社区已产出约 300 个插件。
代价:架构抽象层级高,YAML + 插件树配置有一定上手成本;当前 v0.1 阶段 API 稳定性尚未承诺,会有破坏性变更。
模型绑定:核心选型差异之一
这是三款工具差异最明显的一个维度:
| 产品 | 默认模型 | 第三方模型支持 |
|---|---|---|
| Claude Code | Sonnet 5 / Opus 5(按订阅档位) | 可配置,非官方推荐路径 |
| Codex | GPT-5.6-terra / GPT-5.6-luna(ChatGPT 登录路径);或 API 直接调用任意 OpenAI 兼容模型 | 支持,开放兼容端点 |
| DeepSeek Harness | DeepSeek V4 系列(官方默认) | 原生支持约 40 家厂商(OpenAI、Anthropic、Google、Kimi 等),设计为模型无关 |
Claude Code 最深度绑定 Anthropic 生态:订阅方案与模型访问权限直接挂钩,虽然可以通过配置接入其他模型,但体验和支持均以 Claude 系列为核心。
Codex 绑定 OpenAI 生态,ChatGPT 登录路径使用最新 GPT-5.6 系列;CLI 和 API 路径可接入其他兼容端点。
DeepSeek Harness 从设计上就是模型无关的——模型适配本身是一个插件,多模型切换是内置能力,而非配置 hack。
四种运行模式(DeepSeek Harness 独有)
DeepSeek Harness 内置四种预设组合模式,对应不同使用场景:
| 模式 | 工具集 | 适用场景 |
|---|---|---|
| 标准模式(standard) | 完整工具集 | 日常开发任务 |
| 极简模式(minimal) | 仅 Shell + 文件编辑 | 基准测试、轻量任务 |
| 代码模式(code) | 编程专项工具集 | 纯代码生成/修复 |
| 创造模式(cordis) | 检查运行时 + 内存试验插件 | 开发新插件、调试模式组合 |
极简模式即 DeepSeek V4 Pro 官方测试时使用的框架(DeepSWE 66.9、Terminal-Bench 28.3 等基准均在此模式下跑出)。
沙箱与权限:安全边界对比
| 维度 | Claude Code | Codex | DeepSeek Harness |
|---|---|---|---|
| 沙箱层级 | 应用层钩子 | 内核级(Seatbelt/Landlock) | 插件化策略(可配置) |
| 可绕过性 | 理论上可(共享进程) | 不可(内核拒绝) | 取决于所选沙箱插件 |
| 权限粒度 | 高(按工具细粒度) | 低(三档二元) | 可自定义(插件决定) |
| 审批节点 | 26 个生命周期事件 | 危险操作前提示 | 可配置审批插件 |
| 适用场景 | 企业规范 + 流程编排 | 不可信代码/外部 PR 审查 | 自定义安全策略 |
重要判断:需要审查完全不受信任的代码(如外部 PR、临时工作区)→ Codex 内核沙箱是最强硬边界;需要自定义复杂审批流程 → Claude Code 钩子可编程性最高;需要自行设计沙箱策略 → DeepSeek Harness 插件化给最大自由度。
会话与上下文管理
| 维度 | Claude Code | Codex | DeepSeek Harness |
|---|---|---|---|
| 上下文窗口 | 100 万 token | 默认 272K,最高 105 万 | 取决于所选模型 |
| 多轮记忆 | 会话内持续 | 会话内持续 | 完整事件流存储 + 可回放 |
| 并行任务 | 交互式子 Agent;桌面端并行多会话 | 最多 6 条线程(Cloud);桌面端多任务侧边栏 | 取决于调度插件配置 |
| 会话可复现性 | 否(不保留完整事件流) | 否 | 是(保存所有请求/响应/工具调用) |
DeepSeek Harness 的完整事件流记录是差异化能力:不仅保存最终消息,还保存每次模型请求的完整上下文、系统提示词、工具定义——可以逐步回放任何历史会话,也可以在某个节点"分叉"执行不同策略,类似版本控制。
定价:三种模式对比
Claude Code
订阅方案(含模型调用量):
| 档位 | 月费 | 说明 |
|---|---|---|
| Pro | $20/月(约 ¥144) | 含 Claude Code 基础用量 |
| Max 5x | $100/月(约 ¥720) | 5 倍 Pro 用量 |
| Max 20x | $200/月(约 ¥1440) | 20 倍 Pro 用量 |
| Team Premium | $150/用户/月 | 企业团队协作 |
按 Token 计费(API 路径):
- Sonnet 5:输入 $3/M,输出 $15/M(约 ¥21.6/¥108)
- Opus 5:输入 $5/M,输出 $25/M(约 ¥36/¥180)
Codex
订阅方案(ChatGPT 登录路径,含模型调用量):
| 档位 | 月费 | 说明 |
|---|---|---|
| Free | $0 | 有限 Codex 用量 |
| Plus | $20/月(约 ¥144) | 含 Codex 基础用量 |
| Pro 5x | $100/月(约 ¥720) | — |
| Pro 20x | $200/月(约 ¥1440) | — |
按 Token 计费(API 路径):
- GPT-5.4:输入 $2.5/M,输出 $15/M(约 ¥18/¥108);2026年8月31日起 ChatGPT 登录路径停用 GPT-5.4,迁移至 GPT-5.6 系列
- 长上下文溢价(>272K):输入 2×,输出 1.5×
DeepSeek Harness
工具本身 MIT 开源免费;成本完全来自所选模型的 API 调用费:
| 场景 | 模型 | 单次任务估算成本 |
|---|---|---|
| 极简任务 | DeepSeek V4-Flash | ~¥0.2 |
| 标准编程任务 | DeepSeek V4-Pro | ~¥1-3 |
| 接入海外旗舰模型 | Opus 5 / GPT-5.4 | 与 Claude Code / Codex 直接调用相近 |
V4-Flash 单任务约 ¥0.2,与海外旗舰模型相差约 57 倍。选 DeepSeek Harness 最大的成本优势来自搭配 DeepSeek 自家模型。
指令文件与配置入口
| 工具 | 指令文件名 | 配置格式 | 层级 |
|---|---|---|---|
| Claude Code | CLAUDE.md |
JSON(五层分级) | 全局 / 项目 / 目录 |
| Codex | AGENTS.md(开放标准);桌面端同步从 Claude Code / Cursor 导入配置 |
TOML + Profile | 全局 / 项目 |
| DeepSeek Harness | settings.yaml + 插件配置 |
YAML | 全局($DSH_HOME) |
AGENTS.md 是开放标准:Claude Code、Gemini CLI 等工具也在跟进读取;Codex 桌面端(2026年8月11日更新)更支持从 Claude Code、Cursor 导入历史配置并自动同步,意味着不同工具间的切换成本在降低。
常见问题
Q:DeepSeek Harness 和 Codex、Claude Code 能同时用在同一个项目里吗?
可以。三个工具的配置文件(settings.yaml / AGENTS.md / CLAUDE.md)互不冲突;项目根目录可以同时存放三个文件,各工具只读取自己的格式。Codex 桌面端甚至支持从 Claude Code 导入历史配置(Settings > Import)。部分团队用 Codex 处理不可信 PR 审查(硬沙箱),用 Claude Code 处理日常功能开发(钩子流程),现在可以叠加 DeepSeek Harness 在成本敏感的批量测试场景。
Q:三款工具都说支持多模型,有什么实质区别吗?
区别在于多模型支持的"设计深度"。Claude Code 将多模型视为配置项,官方优化体验只在 Anthropic 自家模型上;Codex 支持 OpenAI 兼容端点,CLI 和 API 路径可切换模型,ChatGPT 登录路径绑定 GPT-5.6 系列;DeepSeek Harness 将模型适配作为插件,从架构层就是模型无关的——官方内置约 40 家厂商适配,多模型切换是一等公民能力,而非 workaround。
Q:Claude Code 的 $20/月和 Codex 的 $20/月,哪个更划算?
订阅包含的额度折算方式不同,直接比价意义有限。关键差异:Claude Code $20 档使用 Sonnet 5,代码任务综合能力更强(SWE-bench Verified Opus 5 接近 96%);Codex $20 档(ChatGPT Plus)使用 GPT-5.6-terra/luna,Terminal-Bench 表现更好,且含桌面端 Codex Tab 的图形化并行体验。两者溢出部分均需叠加 API 计费,实际月成本取决于任务量。
Q:团队想接入 DeepSeek V4-Pro 同时保留灵活切换其他模型的能力,哪个工具最合适?
DeepSeek Harness 最适合:原生支持多模型,V4-Pro 是默认内置适配,切换其他模型只改 settings.yaml 中的 model 字段;不需要维护多套 API Key 配置。若需要同时管理 DeepSeek 以外的多款国产模型(Kimi、GLM 等),也可以搭配多模型聚合 MaaS 平台(如七牛云 Token Plan,qiniu.com/ai/plan)统一端点,在 Harness 侧只维护一个 baseURL。
Q:DeepSeek Harness v0.1 现在适合上生产吗?
官方明确标注"开发者预览版,将有破坏性变更",不建议用于生产关键路径。当前适合:评估架构和能力、在测试/沙箱环境集成、基于插件系统做自定义研发。有已知 bug:Bash noop 空循环卡死需手动中断,danger-full-access 沙箱模式建议只在可丢弃的容器里用。
Q:Claude Code 的"应用层钩子"和 Codex 的"内核级沙箱"实际有多大差别?
差别是本质性的:Codex 内核沙箱让操作系统在系统调用层拒绝危险操作,即使模型"想做"也做不到;Claude Code 的钩子在应用进程内,理论上与 Agent 共享进程边界,高度复杂的钩子绕过(如 prompt injection 触发特定工具)在极端情况下不能完全排除。对于普通开发任务,两者在实际使用中的差别基本感知不到;但在需要绝对安全边界的场景(审查不受信任代码、CI/CD 自动化)下,Codex 的内核沙箱提供了更可靠的保证。
选型指引
| 需求 | 推荐工具 | 理由 |
|---|---|---|
| 日常 AI 编程辅助,重视体验 | Claude Code | 深度钩子 + Opus/Sonnet 系列编程能力 + 多端无缝切换 |
| 需要最强安全边界(不信任代码审查) | Codex | 内核级沙箱,不可绕过 |
| 重视图形化并行任务管理 | Codex 桌面端 / Claude Code 桌面端 | 两者均有图形化多会话;Codex Tab 有 PR 侧边栏;Claude Code 有可视化 diff |
| 成本敏感批量任务(搭配 DeepSeek) | DeepSeek Harness | V4-Flash ~¥0.2/次,MIT 免费 |
| 需要二次开发 Agent 框架 | DeepSeek Harness | 一切皆插件,300+ 社区插件生态 |
| 多模型切换为核心需求 | DeepSeek Harness | 原生 40 家厂商,模型无关设计 |
| 企业团队,复杂审批流程 | Claude Code | 26 个钩子节点,团队级权限分层 |
| 需要并行执行多任务 | Codex Cloud | 最多 6 条并行线程,GitHub/Linear/Slack 直接触发 |
小结
Claude Code、Codex 和 DeepSeek Harness 的定位各有侧重:Claude Code 是多端一体的商业精装工具(终端/桌面/Web/IDE 均已覆盖),企业复杂流程场景首选;Codex 同样覆盖桌面/CLI/Cloud 多端(2026年7月独立 App 并入 ChatGPT 桌面端),以内核沙箱优先的硬边界执行见长,不信任代码场景最可靠;DeepSeek Harness 是开放的模型无关运行时,以极低成本和极高二次开发自由度面向开发者生态,当前处于预览阶段,API 稳定性待完善。三款工具配置文件互不冲突,可在同一项目中共存,按场景分工协作。
本文信息截至 2026 年 8 月 14 日,以各工具官方文档为准,Harness 生态迭代快,关注官方发布频道获取最新变更。
更多推荐



所有评论(0)