最近把几个 Agent Demo 往线上推,反复撞上同一个现象:模型换强了,任务成功率却不怎么动;反过来,把权限边界、状态落盘和失败接管这三层补齐之后,弱一点的模型也能稳住。我想请教已经做过生产 Harness 的朋友:如果预算只够认真做一层,你们会优先补“动作权限与能力清单”、“检查点与可恢复状态”,还是“评测隔离与晋升闸门”?判断优先级时,你们通常看任务链路长度、工具副作用,还是单位失败成本?
相似问题