
有一个在AI工程师圈子里越来越被体感证实、却很少被清楚说出来的现象:
当你把同一个基础模型套上不同的"脚手架",它能完成的任务质量会产生巨大差异。精心设计的记忆检索、规范的工具调用协议、可复用的执行流程——这些围绕模型搭建的"外部结构",有时比换一个更大的模型影响更深远。

这不是偶然。上海交通大学等机构联合发布的一篇综述论文,从认知科学的视角给出了一个统一的解释框架:LLM Agent的进步,本质上是一场认知外部化(Externalization)的过程。它把那些原本需要模型在"内部"完成的认知负担,逐步转移到模型外部的显式结构中。
这篇论文最有意思的地方,是它借用了认知科学家唐纳德·诺曼(Donald Norman)的"认知制品(Cognitive Artifacts)"理论来组织整个叙事。

诺曼的核心观点是:人类不靠变聪明来应对复杂世界,而靠重新安排认知任务的结构。一个购物清单不会让你记忆力更好,但它把"回忆还差什么没买"这个难题,变成了"看一眼清单确认"——任务本身被改造了。
人类文明的认知外部化历程走过了几个阶段:语言把私人思维变成可共享的符号;书写把脆弱的生物记忆变成持久的物质记录;印刷机让知识大规模复制;数字计算把算术和符号操作从神经劳动迁移到可编程机器。

论文认为,LLM Agent正在走一条结构上高度相似的路——只不过时间轴从几千年压缩到了几年。
论文把LLM Agent的认知外部化分解为三个相互独立又彼此耦合的维度:

记忆(Memory):把状态外部化
一个裸模型是无状态的生成器——每次调用都从空白上下文开始,连续性要靠在提示词里重建。任务一旦跨越多个会话、涉及中断与恢复,这种方式就会崩溃。

外部化的记忆系统把这个负担转移出去。论文将Agent的记忆需求细分为四类:当前任务的工作上下文、历史运行的情节经验、抽象的语义知识,以及针对特定用户的个性化记忆。每类记忆有不同的时效性和检索需求,需要分层管理。
关键洞察在于:外部化记忆的价值不在于存了多少,而在于能否把"需要从参数中回忆"的任务,变成"从外部结构中识别和检索"的任务。检索质量比存储容量更重要。

技能(Skills):把程序性专长外部化
模型调用工具是一回事,知道"面对这类任务该按什么流程走"是另一回事。论文把后者定义为技能——它不是孤立的动作接口,而是包含操作流程、决策启发规则和规范约束的可复用能力包。

技能外部化的演化路径清晰:先是稳定的原子工具调用,再是大规模工具选择,最终到达"把如何完成一类任务的专长打包为可复用制品"这一阶段。现在工程实践中已经出现的SKILL.md、AGENTS.md等指令文件,就是这种外部化的具体形态。Anthropic的Claude Code中,技能系统还支持"渐进式披露"——先只暴露技能名称,只有在任务需要时才加载完整的执行细节,避免上下文过载。

技能的本质是:把每次运行都要从零重新"发明"流程这件事,变成从外部加载、识别、适配和执行已有流程。模型从即兴发挥者,变成了规程的解读者和执行者。
协议(Protocols):把交互结构外部化
没有协议,模型每次调用工具或与其他Agent协作,都要自行猜测消息格式、参数结构、权限边界和故障处理方式——这是一个隐藏的巨大认知负担,也是系统不稳定的主要来源。

论文梳理了当前主要协议家族:MCP负责标准化Agent与工具的发现和调用;A2A、ACP、ANP解决多Agent之间的任务委托与状态交换;A2UI和AG-UI规范Agent与用户界面之间的结构化交互;UCP、AP2等领域协议则承载了商业流程中的权限和审计需求。
协议外部化的核心价值是:把"靠模型推断格式和权限"的脆弱逻辑,变成"遵循显式契约"的可治理执行。

光有独立的记忆、技能和协议还不够——它们需要一个协调层来让它们共同工作。论文把这个层称为Harness,可以理解为"执行框架"或"智能体运行时"。

Harness并不是一种新的外部化形式,它是承载前三者并使其可靠运转的运行环境。它负责:

OpenAI的Codex和Anthropic的Claude Code尽管产品形态和技术路线不同,却在Harness设计上高度收敛——论文认为这本身就是一个信号,说明这些设计维度是外部化Agent的结构性需求,而非偶然的工程选择。
从"权重层"到"上下文层"再到"Harness层",这条路径描述了一个明确的趋势:AI Agent的核心竞争力,越来越不只是模型参数本身,而是围绕模型构建的认知基础设施质量。
这带来几个值得关注的推论:
其一,参数化能力与外部化能力之间的边界不是固定的。模型变得更强,可以把某些外部化的负担重新收回内部;但更丰富的Harness也会对模型提出新要求——配合权限检查、遵循分阶段上下文注入、响应结构化约束。这个边界会持续双向移动。

其二,评测方式需要升级。当前主流基准测试以模型为中心,但如果Agent的大量能力来自Harness设计,而非模型权重,那么好的评测必须把外部化基础设施纳入视野,而不是在相同Harness下做单纯的模型对比。

其三,安全和治理有了新的着力点。论文指出,与其依赖对模型行为的概率塑造(如RLHF),不如在协议和Harness层面构建确定性约束——它们是可检查、可审计、可回滚的。这在高风险部署场景中具有实质性优势。
论文也诚实地指出了几个尚未解决的挑战。自动化技能蒸馏(从历史轨迹中提炼可复用流程)目前仍依赖大量人工干预;多个Agent共享外部化状态时的读写权限、冲突解决和访问配额管理,还缺乏成熟方案;多模态记忆和技能的设计假设与纯文本场景有本质差异,尚待系统性探索。

更深层的挑战是评估本身:如何衡量"外部化做得好"这件事?如何分离模型贡献和基础设施贡献?这不仅是学术问题,也是工程实践中分配优化资源时必须面对的判断。

把这篇综述放在一个更长的时间尺度上看,它做的事情其实很朴素:它说,智能不是存在于某个孤立的主体之内的,而是分布在主体与它所处的认知环境之间的。对于人类,这个环境是语言、文字、制度和工具;对于LLM Agent,这个环境正在快速成形——记忆、技能、协议,以及把它们协调起来的Harness。
更好的Agent,不只是更强的推理引擎,而是更好组织的认知系统。 这句话,可能比任何一个基准测试分数都更值得记住。