
上个月,一个朋友跟我吐槽他们团队踩的坑。
他们花了三个月,把几十个 Agent 的 Prompt 写得像法律条文——每一条边界条件、每一种异常处理、每一个输出格式规范,都写进了 Prompt。团队还专门建了一个 Wiki 来维护这些 Prompt 模板,版本号从 v1 一路迭代到 v17。
结果呢?模型一升级,v17 的 Prompt 直接失效了三分之一。更离谱的是,Agent 在某个边缘场景里,翻出了一条两个月前废弃的旧规则,硬生生塞进了生产代码。
『我们不是在写 Prompt,是在给 AI 当保姆。』他说。
这不是个例。我观察到,很多团队在落地 AI Agent 时,
都卡在同一个坑里——Spec 驱动(规范驱动) 的思路。
说白了,就是试图用文字把 AI 管得服服帖帖。但这套路,越来越走不通了。
先聊聊 Spec 驱动到底有什么问题。不是它不好,而是它太脆弱。
第一个陷阱:Prompt 极难维护。
你写一个 2000 字的长 Prompt,里面塞了角色设定、流程规范、输出约束、边界条件、风格指南。模型跑得挺好,但业务一变,需要改第三条规则。你改了,可第四条规则和第三条有隐含依赖,第八条又引用了一条旧版本的定义。你改完第三条,第四条和第八条全乱了。
没有版本依赖树,没有继承关系,甚至没有一个像样的 diff 工具。纯靠人脑记忆对齐,这在工程上简直是噩梦。
第二个陷阱:历史 Spec 堆积,产生「规范噪声」。
为了保留完整上下文,团队习惯把所有历史规则、旧实现方式不断叠加到 Prompt 里。你想着「多写点总不会错吧」,结果恰恰相反——AI 没有能力判断哪些规则已经废弃。它只会忠实地把所有规则都考虑进去,把早已过时的旧逻辑翻出来,像僵尸一样复活在你的代码里。
这就是我朋友遇到的场景:两个月前废弃的旧规则,被 Agent 当成圣经一样执行。
再加上那个老生常谈的问题:模型迭代一次,大量精心调优的文本约束直接失效。 你花几周时间调出来的 Prompt 魔法,在下一个模型版本里可能完全不管用。
结论很清楚:只靠文本 Spec 驱动 AI,走不远。
行业正在发生一场静悄悄的范式切换。
如果说 AI 工程化 1.0 的核心思路是「说服 AI」——用精美的 Prompt 文本让 AI 自觉遵守规则,那 AI 工程化 2.0 的核心思路就是「约束 AI」——改造运行环境,让 AI 想违规都做不到。
我们来看两种模式的根本差异。
Spec 驱动(1.0): 把所有约束、流程、规范写成文本,塞进 Prompt 里交给 AI。 - ✅ 上手快,灵活,能留存全部历史信息 - ❌ 维护成本高,历史规则互相干扰,旧逻辑容易「复活」,依赖模型自觉遵守,模型升级后大量工作作废
环境与验证驱动(2.0): 不再试图用文字说服 AI。而是改造内部的研发基础设施——DevOps 工具链、知识库、权限体系、CI/CD 管道——让 AI 在一个受约束、可校验的环境里自主执行,实时获取反馈。 - ✅ 约束下沉到系统层,不受模型迭代影响;资产有明确版本、继承、弃用机制;系统自动校验结果,拦截错误行为 - ❌ 前期改造投入更大,需要软件工程治理能力
关键一句话:传统 DevOps 是给人用的;新一代 DevOps,必须同时服务人 + AI Agent。
这意味着,你的 CI/CD 管道、工单系统、代码仓库、监控平台,都要做一轮 AI 易用性改造。不是让 AI 接入你的工具,而是让你的工具理解 AI 的行为模式。
从「环境与验证驱动」的完整落地视角看,要真正跑通这套模式,必须补齐四块配套能力。这四块,恰恰是 Spec 模式最容易漏掉的。
1. 自动化验证闭环
不用再靠人主观判断 AI 输出是否正确。环境里内置校验规则,AI 执行后自动拿到客观反馈——测试通过还是不通过?格式符合还是不符合?性能达标还是不达标?AI 拿到反馈后自主修正。
从根源上减少对长 Spec 的依赖。 你不需要在 Prompt 里写满各种边界情况,因为系统会在执行后自动验证。
2. 工具调用容错与自愈
不用在 Prompt 里反复叮嘱「不要传错参数」——实际上叮嘱了也没用。在工具网关层增加参数校验、重试、降级、异常拦截,从系统层面限制非法调用。Agent 传错了参数?网关自动拦截并返回标准化错误信息,Agent 自己重试。
3. 权限与安全硬隔离
权限管控和敏感操作管控,下沉到基础设施层面,而不是写在 Prompt 里提醒。操作全程审计溯源,越权行为在系统层面就被拦截,Agent 压根没有机会碰到它不该碰的东西。
4. 资产生命周期管理
这是最容易被忽视、也最关键的配套。
你的 Prompt 模板、技能集(Skills)、工具集(Tools)、知识库、长短记忆——这些 AI 资产必须拥有完整的生命周期:新增、变更、灰度、归档、弃用、删除。
旧 Spec、过期技能、废弃记忆,必须显式归档隔离,不再参与 Agent 推理。废弃的规则不能只放在文档归档里,要在资产体系里显式标记弃用,从 AI 可检索的活跃上下文里彻底移除。 只有这样,才能杜绝旧逻辑复活的问题。
如果你只记住一件事,那就是这个:
AI 工程化 1.0:调 Prompt、堆文本 Spec,规则越积越多,维护难,模型一变全部重来。AI 工程化 2.0:构建可管控的运行环境,规范固化到系统资产,明确生命周期与边界约束,依靠自动化验证形成闭环。
Prompt 可以保留,但它应该作为表层配置,而不是唯一的约束载体。
未来企业 AI 的壁垒,不是谁的话术更精妙,而是谁能为自己的团队,构建一个适配自身、可治理、可验证、可演进的 AI 运行环境。
这条路的前期投入确实不小,但一旦走通,你就不再是给 AI 当保姆了——你是给 AI 建了一座它自己会遵守规则的城市。