AI Engineering Skills Map: Using coding agents

原文地址:https://x.com/AndrewYNg/status/2095890279865721217

AI 工程里最关键的能力之一就是会使用 coding agents。你要能让它们不仅负责写代码,也能处理非代码任务,比如数据分析、系统运维。这样你能把更多工作交给 agent,同时保留正确的把控。

随着 coding agents 的演进速度,相关能力也在快速变化,甚至比其他顶层 AI 工程技能变化还快。Claude Code、Codex、Cursor 这类商用代理,以及 OpenCode、Pi 这类开源代理,都在 harness 与模型能力上快速进步。要跟上如何使用 coding agents,必须持续做“实验—实践—学习”的循环。

我与多位顶级 AI 工程师访谈并结合团队实践后,发现一套稳定的高层工作流:

  1. 规划(Planning)
  2. 执行(Execution)
  3. 部署与监控(Deployment and monitoring)

这套流程和传统软件开发很像,只是把重心从“写代码”转到“决定做什么、设计架构、写清 spec、验证结果”。

1. 规划

规划通常包括:

  • 发散想法:可以包含调研、实验,以及快速理解现有代码库(如果有)
  • 写清晰的 spec:把需求、技术设计和架构写清楚
  • 生成执行计划:确认实现路径,安排里程碑

你还需要回看计划,检查关键假设,确认是否有安全问题、过度设计,或其他缺失。

2. 执行

执行是“构建、测试、验证”的过程,关键是在人机协作之间找到合适平衡。包括:

  • 让代理按合适自治程度去写代码
  • 通过自动化和人工校验输出是否满足要求

3. 部署与监控

部署通常需要先通过 CI/CD 或人工门禁。上线后可让代理监控日志、发现问题、提建议,并协助修复和再次部署。

工作流是迭代的

每一步的耗时不同,项目不同会有所变化,甚至某一步可以省略。比如一个 Greenfield 原型可能只用一段 prompt 来快速定义 spec;而有大量用户的 Brownfield 项目,往往需要更完整的 spec 编写和验证。

在这个循环里,后续环节常常会让你回到前面。比如验证失败时,要知道如何引导代理重构修复;监控发现问题后,也要知道如何让代理更新系统并重新发布。

要在这套流程里真正把 coding agents 用好,核心是五类能力:

  • 引导工作流
  • 赋予代理适当自治
  • 复核与评审
  • 自定义 agent 与其环境
  • 掌握 coding agent 基础

引导工作流

你要能在上述三步中切换得当:在哪一步花多少人力,何时需要加速迭代、何时需要回到前面的阶段。

这要求你对速度、成本、技术风险和人工投入的权衡非常清楚。于是你才能决定:

  • 前置研究和规划要做多少
  • 哪些关键动作必须由人类决策
  • 架构如何选型
  • 规划文档(比如 spec)要写到什么细节
  • 如何把大任务分解为可验证的小步骤

赋予代理自治

对每一步,你要决定代理自治度:

  • 你是实时对话式地盯着 agent 做?
  • 还是交给它更大块任务自己执行?

你需要管理上下文,保证关键学习、用户反馈和假设变化能够被传递。

当构建跨阶段时,要判断:

  • 什么时候要让多个代理并行处理任务
  • 是由你还是更高层代理来协调
  • 如何分配人类注意力,避免并行失控

你还要设置权限和安全闸门,让开发更快但不放任:避免泄露、数据丢失等风险。

复核输出

代理输出是有不确定性的,不能“交给它就完事”。你的复核流程决定最终结果。

你要按任务特征设计验证,包括行为验证和功能验证;有些场景也要跑用户流程。为了证据清晰,可以让代理输出截图。

对于定性/行为评估,可用 eval 集合配合 LLM-as-a-judge。

你还要决策哪些测试自动化。某些流程可全自动化,让代理自检并确认完成;但你也要确认测试是否真的和目标一致。

另外,你要做 agentic code review,并用 AI 的安全与架构审计补位。AI 评审不够时,再插入人工复查(包括代码行为复查,必要时做小范围代码复审),并持续评估如何把这类复查进一步自动化。

最后,你要把部署后的验证、监控和事件处理也纳入代理协作。

自定义 agent 与其环境

你不仅要会用现成代理,还要能持续改造 agent 和上下文环境:

  • 集成技能、插件、MCP 服务;
  • 在不需要时及时移除冗余能力;
  • 用 hook 自动化重复流程(如触发 review 或 CI/CD)。

你还要维护 agent 工作环境:更新 AGENTS.md / CLAUDE.md,保留代码库关键背景、关键架构假设、代码风格、数据访问模式等信息。

你要能跨多会话、跨并行代理保持上下文连续,积累经验教训。比如每次运行后复盘,记录哪些决策有效、哪些路径失败。

在团队场景,还要解决不同开发者的代理上下文一致性问题。

coding agent 基础

最后,做出高质量决策,必须懂代理机制:

  • 代理如何检索和搜索代码库
  • 上下文窗口怎么管理
  • 工具调用、MCP、子代理等操作对上下文和表现的影响
  • 代理如何通过 LLM + harness 形成

这会让你不把代理当黑箱,从而更快识别失败模式:

  • 过度工程化简单问题
  • 缺失验证导致的结论偏差
  • 过早收敛导致的目标偏离
  • 可能破坏文件或生产数据的危险动作

理解这些原理后,你能更清楚地给代理“正确的处方和上下文”。当你监控一轮运行时,也更容易判断它偏离目标并及时介入。

社交平台常把“用 coding agents”简化为一句:让它长时间自动运行、烧掉几千万 token。现实中,这种超长任务很容易失真,成本和产出并不总成正比。

目前更有效的是高度迭代、可干预的使用方式。高水平判断介入,往往比纯粹放任要更靠谱。

会用 coding agents 的人,会成为更有效率的 builder,也更容易进一步“驾驶整体构建过程”。