首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Sourcegraph 让编排层先写脚本:能确定的活不给模型,agent 才敢按结果收费

Sourcegraph 让编排层先写脚本:能确定的活不给模型,agent 才敢按结果收费

作者头像
海风自语
发布于 2026-09-16 08:54:28
发布于 2026-09-16 08:54:28
1490
举报

做储能电站 EMS 的那段时间,我给自己划过一条线:该由规则判断的事,不交给模型。

不是不信任它的判断力。是控制回路这个位置容不下概率性输出,它错一半,代价是设备。知道哪些活不该给模型干,比选一个更强的模型值钱。

所以昨天看到 Sourcegraph 那个发布时,我第一反应是愣了一下——它让 AI 自己学会了这条线。

「确定性优先」不是降级方案,是编排层的第一性原理

09-14,代码平台 Sourcegraph 把它跨仓库批量改造的产品 Agentic Batch Changes 转正式可用。做法是给一个外层编排 agent 同时握两条路:自己写确定性脚本执行,或者把活派给 Claude Code、Codex 这类编码 agent。官方自述的结果有点反常识,500 个仓库的同类改动,常常由一个外层线程加零个编码 agent 就干完了。agent 主动为可预测的部分写脚本,因为脚本让它对结果更有控制力;只有遇到脚本真搞不定的边界情况,才把编码 agent 拉进来。

分量最大的不是这个数字,是选择权在 agent 手里,不是人写死的规则。团队原本以为它会偏好派活给编码 agent,结果是它自己算出了哪条路更稳。

这件事我太熟了。我们过去做多 agent,默认逻辑是「活越复杂,越该交给模型」,于是每一层都乘上一个不确定性。电力那边是反过来的做法:动作层永远由确定性代码执行,模型只在它真正擅长的地方出场,判断该做什么、以及脚本搞不定时怎么办。

一个多 agent 系统如果把所有动作都过一遍模型,它承担的不确定性是乘法,不是加法。

顺着这条思路,能直接落到工程上的判断是:多 agent 编排里,「能不能写脚本」应该是 agent 的一等能力,而不是「把活丢给编码 agent」的兜底出口。判断标准就一条,可预测的交给代码,不可预测的才交给模型。前者便宜、可重复、不需要人审;后者贵、会漂、必须审。今天大部分 agent 系统的成本高、可靠性差,根因往往是这条线没划,而不是模型选错了。

敢按结果收费的人,是因为他先把「结果」定义清楚了

Sourcegraph 同一天还改了定价:按合入代码库的变更数量计费,不按字符量,不按席位,也不按尝试次数。官方原话是,如果它开了合并请求而你的团队决定不合并,这笔钱不收。

同一个日子,Andon Labs 开放了它的 Pion 平台,研究预览期不收推理费用,改成从 agent 帮你赚到的业务收入里分成。

两家公司在同一天说了同一件事:计费单位是供应商给自己那部分不确定性定的价。按用量卖,不确定性在买方;按结果卖,不确定性在卖方。

但这里有个前提,而且是我们能控的那一半。按结果计费的前提,是你能自动判定结果。所以这条消息对架构师的含义是反过来的:不是等它变便宜,而是问你自己能不能定义并且自动判定「什么算完成」。

我在电力项目上做验收,第一步从来不是对着功能清单打勾,而是先把「什么算通过」写成能自动跑的判据。这一步做不出来,按结果的报价你根本没法核对,最后还是会退回按用量付费。能被自动判定的完成,才卖得出按结果计价的价格。

这套先定判据再谈交付的做法,我在自建日报流水线上也一样用。AI 一天能写多少字不重要,能不能自动判定它有没有写歪,才决定这条流水线敢不敢无人值守。

今晚可以动手的三件事

第一件,挑一件「每个仓库或每个环境都要重做一遍、结果可预测」的改动,改成让 agent 生成脚本执行,而不是逐个派给编码 agent。依赖升级、配置字段补齐、废弃接口替换这类最合适,先拿一件试。

第二件,给你 agent 的交付物写一条能自动跑的「完成」判据。如果现在只有「人看一眼觉得行」,那这就是你该补的第一步,也是将来能不能按结果采购的前提。

第三件,统计一次真实任务里「可预测步骤」和「必须判断步骤」的比例。这个比例就是你剩下的降本与降风险空间。先有数,再谈换模型。

今日其他信号速览

  • 微软发布 37 页《人文主义 AI 行为准则》草案:写明违反准则时模型应当在该任务上失败、不得抵抗关停、不得篡改或隐藏推理与操作痕迹,并公开表示愿意在通用性、自主性、能力上让步。目前是征求意见稿,年底出修订版。
  • 智谱同日披露:GLM-5.3 与上一代架构、总参数、激活参数完全相同,端到端任务完成率提升超 50% 全部来自后训练规模放大(厂商业绩沟通口径,未独立复现)。同架构模型之间能差出五成,选型的锚点该从参数挪到自己的任务集。
  • 主力编码工具 claude-code 发 v2.1.271:企业托管的工具链配置解析失败时改成保持独占控制并告警,不再静默忽略;网络权限也下沉到单条命令级白名单。
  • 一篇 EMNLP 2026 收录的论文量化了「过度编辑」:一个小 bug 被修成删 5 行加 60 行,这 60 行没有任何测试要求,仍全套通过。通过率与「改动是否最小」基本不相关,而审查成本从没进过任何一张榜单。
  • GitHub 今日榜单里的 Agent-Reach(8.1 万星):一个命令行工具,让 agent 能读 Twitter、Reddit、YouTube、GitHub、B 站、小红书,不收接口费。agent 的外部数据摄取,正在从「每个源装一个插件」收敛成「一个命令行」。

数据说明:Sourcegraph 与 Andon Labs 的产品及定价信息来自双方官方发布(09-14),「500 个改动零内层编码 agent」为其团队自述经验,非受控实验;智谱性能数字为厂商业绩沟通口径,未独立复现。

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2026-09-15,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 「确定性优先」不是降级方案,是编排层的第一性原理
  • 敢按结果收费的人,是因为他先把「结果」定义清楚了
  • 今晚可以动手的三件事
  • 今日其他信号速览
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档