claw-code 与 Codex 相比的优劣
两个工具都能"让 agent 动你的代码",但哲学完全不同:一个是开源标本,一个是官方产品。读完本页约 10 分钟。
一张表说清差异
下表依据两个仓库的公开 README 与文档整理(claw-code 见 01 页;Codex 见 GitHub 与 官方文档):
| 维度 | claw-code | Codex CLI(OpenAI) |
|---|---|---|
| 一句话定位 | 开源"博物馆展品" + 教学性 agent harness | OpenAI 官方生产级编码 agent |
| 开源与安装 | MIT;仅源码构建(crates.io 桩不可用,官方禁止 cargo install) | Apache-2.0;npm / brew / 官方脚本可装 |
| 实现语言 | Rust,11 crates,二进制 claw | Rust,单二进制 codex |
| 模型支持 | 多后端:Anthropic / OpenAI 兼容 / xAI / Ollama / DashScope | OpenAI 系(GPT-5.6 家族:Sol / Terra / Luna);ChatGPT 计划或 API key |
| 认证 | ANTHROPIC_API_KEY / bearer / 各 provider 环境变量 | ChatGPT 账号登录,或 OpenAI API key |
| 权限模型 | 三模式 + --allowedTools 白名单 + 前置拦截 | sandbox 三模式 + approval_policy(default / on-request / no-approvals)+ suggest |
| 项目记忆 | CLAUDE.md → CLAW.md → AGENTS.md 优先级 | AGENTS.md(兼容 CLAUDE.md) |
| 工具与扩展 | 55 工具、120+ slash、hooks、plugins、MCP | 内置工具 + MCP 支持 + skills + slash 命令 |
| 会话与上下文 | 会话 JSONL、--resume、compaction、token 统计 | 会话保存/恢复、自动压缩、Codex Cloud 同步 |
| 生态形态 | 纯本地 / 自托管 | CLI + IDE 扩展 + 桌面 App + Web + Cloud |
| 验证文化 | 极端文档化:账本 / verification-map / 质量门 / anti-slop | 常规工程实践(测试 / CI 由项目承担) |
| 维护方 | 社区 + agent 自主维护(展品姿态) | OpenAI + 大型社区 |
注:Codex 的权限、记忆、云同步等细节以 官方文档 为准;模型信息按 OpenAI 官方公告《GPT-5.6》(2026-07-08)更新为 Sol / Terra / Luna 三层级:openai.com/index/gpt-5-6;表中其余为 2026-08 时点的公开信息。
各自的最强项
可读性与多后端
全开源 Rust,想读就读;一个 CLI 能接 Anthropic / OpenAI 兼容 / Ollama / DashScope,适合做"模型无关"的实验与教学。过程可审计(账本 + 验证 map)是独一份。
开箱即用与生态
官方维护、安装即用;ChatGPT 计划直接登录,IDE 扩展、桌面 App、Web、Cloud 同步一整套。日常生产开发的上手成本最低。
同一个问题
两者都在解决同一件事:让 agent 安全地操作你的终端与代码——权限模式、项目记忆、MCP 扩展、会话恢复,概念一一对应。
什么时候选谁
- 选 claw-code:想学习 agent 架构(多后端对照最清晰)、需要接本地/多模型、想读源码、做教学演示、或对"过程可审计"有执念。
- 选 Codex:日常生产开发、已深度使用 ChatGPT 生态、需要官方支持与云同步 / IDE 集成、追求开箱即用。
- 两者不互斥:可以把 claw-code 当"解剖标本",把 Codex 当"日常工具"。用 Codex 干活,用 claw-code 学习。
对照 · Codex CLI 官方 README 引言github.com/openai/codex▶
思考题
Q1 · 假如你是老师,想让学生理解"agent 怎么工作",你会用哪个工具做演示?理由是什么?
提示:可读性 vs 演示效果;能否展示"过程"而不只是"结果"。
Q2 · "验证文化"是 claw-code 相对 Codex 最明显的差异。为什么一个"展品"项目反而比官方产品更重视过程留痕?这说明了什么?
提示:产品追求结果体验,标本追求证据可查;但生产项目的验证其实藏在 CI 与测试里,只是不拿出来展览。
Q3 · 如果让你给这个对比加一个"成本"维度,你会怎么量化两边的一次任务开销?
提示:API 计费、上下文长度、模型价格、调试时间、学习成本。