三个 SDD 工具,三个不同的计算器 —— 应用产物深度对比HTML
同一作者用同一款老人计算器想法,分别以 OpenSpec、matt-skills、Spec Kit 三种规格驱动工具开发,逐行对比产物:流程文档最重达 1005 行、是最轻版本的 3.3 倍,代码只多 22%。以功能矩阵与五条洞察揭示工具如何反向塑造需求。
同一作者用同一款老人计算器想法,分别以 OpenSpec、matt-skills、Spec Kit 三种规格驱动工具开发,逐行对比产物:流程文档最重达 1005 行、是最轻版本的 3.3 倍,代码只多 22%。以功能矩阵与五条洞察揭示工具如何反向塑造需求。
借 Claude Code 与 mattpocock-skills 开发 macOS「长辈计算器」,复盘访谈、规格、拆票、TDD、双轴评审五环节流水线:4 轮访谈落定 25 个决策点,36 条故事切为 12 张曳光弹切片,23 个测试全绿,关键在上下文工程。
这是一份可以照着做的 AI 原生软件开发工作流指南。我用 Claude Code 加 mattpocock/skills 技能集,从零开发了一款 macOS 原生应用「长辈计算器」,并在交付后走完了完整的架构演进循环。本文拆解这条工作流的每一个环节——为什么这样设计(所以然)、具体怎么做(操作步骤)、实战中长什么样(真实证据)——让没有经验的开发者也能照着走完全程。完整对话实录见实践实录,速读版见上一篇实践总结。
一、为什么需要「AI 原生」工作流
大多数人的 AI 编码方式是:打开编辑器,描述一个需求,AI 吐出代码,人肉检查。这是 AI 辅助——AI 是打字快的初级程序员,工程过程还是人的那套。
AI 原生的含义不同:整个软件工程过程——需求澄清、规格化、任务拆解、实现、测试、评审、演进——都围绕 AI 的特性重新设计。
1.1 四个经典失败模式
mattpocock/skills 的作者 Matt Pocock 在仓库 README 里总结了他观察到的四个 AI 编码失败模式,这套技能集就是对着这四个失败模式设计的。理解它们,就理解了整条工作流的"所以然":
失败模式 #1:智能体做的不是我要的(misalignment)
"No-one knows exactly what they want" —— 《程序员修炼之道》
一份可以照着做的 AI 原生软件开发工作流实战指南。作者用 Claude Code 从零开发一款适老化计算器应用,完整走通需求访谈、规格化、拆票、测试驱动实现、双轴评审与架构演进全流程,并给出团队落地路径,附四轮二十七问、三十六条故事与七十六个测试的真实数据。
以 mattpocock/skills 技能库为蓝本,梳理AI原生软件开发生命周期的完整实践:先剖析它反对的四类失败模式与设计哲学,再走通从想法拷问、原型验证、规格化、拆票到实现与双轴评审的完整环节,并附上三条汇入通道与上下文卫生等要点,附录逐一详解全部技能。
实践记录:我用 Claude Code 加 mattpocock/skills 技能集,从零开发了一款 macOS 原生应用「长辈计算器」。本文以这次真实开发为主线,拆解这套"AI 原生"软件工程流水线的每个环节、它背后的设计哲学,以及实战中暴露的问题。原始对话实录见前一篇。
一、为什么是"AI 原生"而不是"AI 辅助"
大多数人的 AI 编码方式是:打开编辑器,描述一个需求,AI 吐出代码,人肉检查。这是 AI 辅助——AI 是打字快的初级程序员,工程过程还是人的那套。
AI 原生的含义不同:整个软件工程过程——需求澄清、规格化、任务拆解、实现、测试、评审——都围绕 AI 的特性重新设计。AI 的特性是什么?
| AI 的特性 | 对工程过程的要求 |
|---|---|
| 上下文窗口有限,塞满后质量衰减 | 任务必须切成"单个上下文能装下"的批次 |
| 每次会话开始时最"清醒" | 频繁开新会话,而不是一条会话干到底 |
| 不会主动追问,猜错了就错到底 | 需求阶段强制访谈,分歧在写代码前解决 |
| 产出无限、判断有限 | 人只做检查点决策,不做中间执行 |
| 记不住上一次的对话 | 共识必须落盘为文件,而不是留在脑子里 |
mattpocock/skills 就是围绕这张表设计的。
用 Claude 技能集从零开发「长辈计算器」,完整拆解 AI 原生开发流水线:需求访谈逐轮实时落盘、测试接缝先行、曳光弹式垂直切票、红绿循环与双轴代码评审。36 条用户故事拆成 12 张票,23 个行为测试全绿,共识归文件系统而非对话,并复盘关键踩坑。
安装
npx skills add mattpocock/skills
初始化(/setup-matt-pocock-skills)
/setup-matt-pocock-skills
在你的 agent 中,每个仓库运行一次。它会:
/triage 会用到标签)目录结构
.
├── CLAUDE.md
└── docs
└── agents
├── domain.md
├── issue-tracker.md
└── triage-labels.md
软件开发工作流程
grill-with-docs → to-spec → to-tickets → implement (tdd → code-review) → code-review
/grill-with-docs
description
一场为锐化计划或设计而不留情面的访谈,过程中还会同步创建文档(ADR 与术语表)。调用 Skill 工具两次,分别传入 "grilling" 和 "domain-modeling"。
详细介绍
grill-with-docs 就一个方案或设计对你进行访谈,直到你和 ag
在 AI 辅助编程风靡的今天,许多开发者沉浸于 Vibe Coding(氛围感编码)——直接抛出几句自然语言需求,交由 AI 自动生成代码。然而,这种“野蛮生长”的方式往往会导致需求理解偏差、架构快速腐化(Ball of Mud)、上下文遗忘以及越改 Bug 越多的困境。
Matt Pocock 的开源项目 mattpocock/skills 正是为了解决这一痛点而生。它不是一堆零散的 Prompt 集合,而是一套为 Claude Code、Codex 等 AI 编程智能体设计的系统化软件工程最佳实践。
官方体系将技能划分为两大类:
/grill-with-docs、/to-spec),用于任务编排与流程推进。/tdd、/codebase-design)。工作流全景链路 (The Engineering Harness)
核心开发主流程遵循着从“模糊想法”到“高质量交付”的递进逻辑:
没有找到匹配的文章