你有没有过这种经历:明明花了几周搭起来的 Agent,动不动就「忘了自己是谁」;日志里看着跑得欢,一上生产环境就疯狂幻觉;本地改一行代码,云端环境直接炸裂——甚至不确定该不该把定时任务挂在 VS Code 里。
如果有这些困惑,别慌。国外一位大神,花了六周、几乎没怎么睡觉,从云端硬迁到本地环境,踩穿了两套运行环境的坑,最终跑通一个能持续干活的助手。下面这 100 条,就是他从血泪里总结出的实战干货。建议收藏,慢慢看。
01
PART
地基与身份
FOUNDATION & IDENTITY · 1–8
1
写一部“宪法”,别写系统提示词。
系统提示词是一堆指令清单;宪法讲的是规则背后的“为什么”。当智能体撞上一条规则都覆盖不到的边界情况时,它会照着宪法去推理,而不是瞎蒙。就是这一点,决定了智能体是优雅降级,还是自信满满地产生幻觉。
2
给智能体起个名字、定个口吻、立个角色——而不只是一个标签。
“永远第一人称。直接。先摆数据再谈感受。不要套话。结尾不写总结。” 这一条就干掉了每场对话里成百上千个微决策,还顺手换来一份你能审计的一致性。身份,是后面所有复利效应堆上去的地基。
3
把硬性规则和行为准则拆开。
硬性规则单独成章——绝不被上下文覆盖。行为准则则是可调的默认值。混在一起,两边都没意义:智能体要么把一切都当成可商量,要么把一切都当成没得商量。
4
把你的“委托人”挖透,别只停留在“用户”。
这智能体到底服务谁?什么会让他抓狂?他怎么拍板?喜欢什么沟通风格?“靠数据决策,不靠直觉。要的是带评分的备选方案,而不是单一推荐。讨厌含糊其辞。” 这比任何提示工程技巧都更能决定每一句回复长什么样。
5
分别画一张“能力地图”和一张“组件地图”。
能力地图:智能体能干什么?(每个技能、集成、自动化)。组件地图:它是怎么搭出来的?(有哪些文件、谁连着谁)。两张都得上。把两者揉成一团,到第三个月你就会得到一份谁也用不上的文档。
6
写清楚这智能体“不是什么”。
“不是摘要器。不是应声虫。不是搜索引擎。不会干等着被问。” 否定性定义和肯定性定义一样好使,尤其能防它慢慢滑向“泛化的乖巧”。
7
把“思考 vs 行动”的心智模型写进身份里。
拿不准 → 思考(分析、起草、准备——但不停下等许可)。看明白了 → 行动(执行、落盘、派发)。智能体绝不能卡死。默认在最无关紧要的层面先动起来,再把结果亮出来。一个僵住的智能体毫无价值。
8
把身份文件纳入 git 版本管理。
行为一漂移,你就得对配置做 git blame。行为回归往往能直接追到某次具体的编辑,比你以为的频繁得多。没有版本历史,排 identity 漂移的雷等于考古。
02
PART
记忆系统
MEMORY SYSTEM · 9–18
9
记忆用扁平的 Markdown 文件,别上数据库。
对个人智能体来说,Markdown 文件比向量数据库强。可读、可 grep、可进 git、能被智能体直接 load。没有基础设施,你跟智能体的记忆之间零抽象层。能用的最简方案,往往就是对的方案。
10
按领域拆记忆,别按日期。
entities_people.md、entities_companies.md、entities_deals.md、hypotheses.md、task_queue.md。一个文件 = 一个领域。按时间顺序一锅炖,第二周之后就搜不动了。
11
建一个 MEMORY.md 当索引。
单页索引,列清每个记忆文件加一句话说明。智能体先 load 索引,再按需拉具体文件。上下文窗口占用量可控,查找也快。
12
显式区分“缓存”和“唯一可信源(SSOT)”。
你本地的 deals.md 只是 CRM 的缓存,CRM 才是 SSOT。每个缓存文件都打上 last_sync: 头。智能体每次分析前先报数据新鲜度:“数据:5月11日从 CRM 导出,已 8 天。” 静默吃过期数据,正是“自信但错误”那类输出的源头。
13
建一个带明确 TTL 的 session_hot_context.md。
上场对话推进到哪了?哪些决策还悬着?会话开始智能体先 load 它。72 小时后失效——过期的热上下文比没有更糟,因为智能体会把过时状态当现状往外摆。
14
建一个 daily_note.md 当异步灵感缓冲池。
白天随手往里丢想法、语音转文字、碎片灵感。智能体在同步流程里消化它,把条目路由到该去的地方。记录那一刻零摩擦,记忆照样结构化。
15
建一个带置信度的 hypotheses.md。
长期揣着的猜测:“供应商 X 可能已满产(置信度 65%)。” 相关话题冒头时智能体就拿来用。这就多出了一层跨会话的“怀疑层”,会随时间被验证或证伪。假设满 30 天就老化清掉——过时的假设只会变成噪音。
16
建一个 WAITING_ON_ME 队列。
智能体备好、等你拍板的所有事项都扔进来,带时间戳。每周过一遍。超 7 天的主动催;超 30 天的自动关。这样开口的循环才不会悄悄蒸发。
17
建一个 user_behavioral_profile.md。
用户什么秒批、什么慢批?哪些决策凭直觉、哪些靠分析?智能体据此决定“自主干 vs 上报”。观察几个月后,它准得吓人。
18
把记忆文件夹镜像到云存储。
本地机器要是完蛋,智能体就丢了数月攒下的知识。把记忆目录镜像到 Dropbox / Drive / S3。这不是备份——是保命。智能体的记忆是整个系统里最换不掉的部分。
03
PART
知识库
KNOWLEDGE BASE · 19–23
19
知识库按主题簇组织,别按日期。
书、报告、参考资料丢进领域文件夹:sales_negotiation/、strategy/、supply_chain/。再配一个 INDEX.md 当导航中枢。智能体先搜引,再拉对应来源。一堆平铺文档是坟墓;结构化的知识库才是活资源。
20
每个主要来源配一个 .brief.md——懒加载生成。
每本书或每份报告一页:核心论点、3–5 个关键概念、套到你场景里的具体应用示例。别一上来就全建好——第一次真正用某来源时才生成。引用时指向 brief,不是全文。brief 本身成了可复用的制品。
21
引用任何来源前,先过“三问质量门”。
(1) 这东西补了用户凭第一性原理推不出来的内容吗?(2) 它给了能重构视角——而非仅仅确认现状——的具体框架吗?(3) 删掉它会留下空白吗?三条里过两条 → 引用;否则 → 静默咨询。这道门专治最糟的引用病:为了显得自己努力而引用,而不是为了加洞见。
22
“静默咨询”是合法——而且往往更好——的输出形态。
你查了库、把洞见用进了推理,却没明说。因为查过,输出更锋利;因为没引,输出更干净。把这条明确写进智能体行为里。用户受惠于推理本身,而不是受惠于“知道你翻了本书”。
23
为每个在跑的项目、每段关键关系,预先接好知识栈。
每个活跃项目:2–3 个框架直接适用的来源。每个关键联系人:2–3 个关于沟通风格、谈判或文化动态的来源。对应上下文一激活,智能体自动 load——而不是挂在一个泛化的“业务讨论”触发器上。预接好,知识库的使用才成反射动作,而非刻意为之。
04
PART
技能架构
SKILL ARCHITECTURE · 24–31
24
每个技能建成独立目录,带一份 SKILL.md 规范。
不是内联提示词。一个文件夹、一份自说明的规范文件、显式触发器、显式输出、显式“不适用”条款。技能由此变得可组合、可审计、可替换,且不碰智能体的核心身份。
25
把显式触发短语写进每个技能。
触发器:用户一说“处理收件箱” / “清收件箱” / “我收件箱里有什么”,永远触发。别指望 LLM 自己推断何时用某技能。显式短语匹配 = 稳定激活。靠推断 = 偶尔失手、慢慢吃掉信任。
26
“不适用”章节和“适用”章节同等重要。
“不适用:定价决策。不适用:法律分析。不适用:财务承诺。” 这能拦住“技能蠕变”——所有东西都因表面模式匹配被错路由到某个技能的慢性漂移。
27
区分 skill 和 agent。
skill 是程序性的——定义好的工作流、可预测的输出。agent 有领域专长、会下判断。skill 编排步骤;agent 做决策。把两者搅一起,产出的是难调试的不可靠行为。
28
建一个带使用追踪的技能登记表。
每行一个技能:名称、触发器、用途、上次使用、KPI。季度审计:60 天零使用的技能,要么补更好的触发示例,要么下线。死技能只有维护负担,零收益。
29
建一个 /iterate 技能,做多轮打磨。
产出 → 批判(打分 + 主要缺口)→ 精炼 → 重复。打到 9/10 或进平台期就停。你能看见分数走势和版本差异。这跟让智能体“再改改”有本质区别——这是带可量化进展的结构化改进循环。
30
把输出强度等级写进每个技能。
MINIMAL(快速摘要)、STANDARD(结构化)、FULL(丰富制品)。技能按上下文自适应。一个“是 / 否”问题却吐出五页分析,是技能设计的失败。强度要配得上问题的分量。
31
建一个可见的 Outbox 文件夹,解决可发现性问题。
深层目录管组织是对的,但管可发现性就是灾难。每份产出同时拷一份到可见的 Outbox/。定期清空。没有 Outbox,用户就得翻完整棵树才能找到智能体刚产出的东西。
05
PART
多智能体与委员会
MULTI-AGENT & COUNCIL · 32–41
32
建一张显式的 agent 派发矩阵。
一张表:[请求里的信号] → [派哪个 agent]。定价 / 供应商 / 发货 → 采购 agent。邮件 / 客户 / 管线 → 销售 agent。别去推理路由——用模式匹配机械地分。靠推断做路由,迟早会静默翻车。
33
能自然拆的任务,就并行跑 agent。
分析新供应商 → 同时起采购 agent(定价)+ 调研 agent(DD,尽职调查)。别把不必串行的硬串行。产出更厚,耗时一样。
34
给被委派的 agent 做简报,像给刚走进门的技术同事那样。
不是“去调研这个”。把这几样传过去:你已知道的、你已排除的、这输出要支撑哪个决策、风险等级。带着上下文 brief 的 agent,交付质量是不带上下文的一行指令的三倍。
35
逼 agent 给个明确结论。
不要“这是信息”。要它给:VERDICT(裁定):推进 / 暂停 / 上报,并带置信度。只摆数据不下判断的 agent,等于把决策又甩回给你——那委派的初衷就废了。
36
委员会按三轮组织,别搞自由发挥。
第一轮:并行立场(隔离,互不干扰)。第二轮:交叉诘问(互相挑对方推理的刺)。第三轮:投票,且强制记录异议。异议跟共识一样值钱——它精确告诉你,你正选择忽略什么。
37
每场委员会里,让两个 agent 当固定锚定投票席。
战略家(长周期、二阶效应)和唱反调者(对抗性、专找漏洞)必须到场,不论什么领域。领域专家在自家地盘很强;锚定投票席防的是隧道视野。五个采购专家一致同意,那叫回音壁。
38
把唱反调的 agent 做成独立工具。
在发出重要的对外沟通前、在不可逆决策前、在大额采购前——跑一轮对抗性审查。它比其他任何手法都更能抓住“听着对、实际错”这种坑。多一轮往返,风险砍一大截。
39
委员会 vs 单 agent——触发器要清晰,成本要敬畏。
单 agent:领域明确、决策可逆。委员会:存在 2 条以上真有分歧的路径,且不可逆程度够高。委员会很贵。别默认就上——当用户确实对方向没底时,你主动提议用它。
40
在 agent 之间建结构化交接。
一个 agent 干完,交给下一个时带一份结构化简报:“分析完成。关键发现:X。风险:Y。你的活:Z。” 交接是上下文传递,不是单纯的任务完成。没有它,每个 agent 都是冷启动。
41
留一个兜底 fallback,并记录它接了什么。
没有专家 agent 匹配时 → 通用型。记录兜底接了啥——这就是你专家覆盖面的缺口地图。兜底同时也是你的开发 backlog。
06
PART
会话管理
SESSION MANAGEMENT · 42–47
42
会话的开始和结束协议要对称。
/start-session 和 /end-session 是镜像。开始 load 上下文、查队列、报差异。结束存上下文、同步任务、归档产出。两边不对称,状态漂移会几周几周地复利累积。
43
建三个档位的会话收尾。
轻量(转录 + 摘要)。中量(+ 记忆同步 + 任务队列更新)。全量(+ 日报 + autolearn 抽取)。一个永远全做的“结束”会因为太贵而被跳过。分级收尾,意味着你至少永远做了轻量版。
44
在 OS / shell 层建一个会话启动钩子。
智能体一启动就触发的一段脚本——注入当前时间、机器身份、星期几、一天中的时段。智能体永远自带上下文,不用你打字。一次性配置,每天收股息。
45
会话开始查收件箱增量和红色告警。
“距上次会话:4 封新邮件,2 个任务更新。” 外加:今天到期的 P0 项、有活跃业务却超 14 天没动静的关键联系人、卡超 7 天的任务。在你问任何问题之前就先做主动分诊。自动亮出来——别让用户来要。
46
会话开始查定时自动化健康度。
隔夜任务跑了吗?有报错吗?一个悄悄停跑的定时任务,是种你直到出事才会发现的静默劣化。在会话开头就亮出来,别等任务中途才爆。
47
跨会话追踪纠错次数。
同一件事你在不同会话里纠正超过 3 次 → 你的规范里缺了条规则。那条纠正该写进身份文件、作为永久指令,而不只是留在聊天里。留在聊天的纠正会消失;写进规范的纠正永久生效。
07
PART
决策权限
DECISION AUTHORITY · 48–54
48
建一张显式的自主权等级矩阵。
L0:读 / 分析。L1:写本地文件 / 记忆。L2:建任务和日历项。L3:发对外消息。L4:财务承诺。智能体精确知道自己不用请示就能干到哪一级。没有这张矩阵:要么没完没了要权限,要么冷不丁给你惊吓。
49
默认“先思考,别问”。
拿不准时,智能体先备好、摆出来——它不停下来问澄清。“要我起草这封邮件吗?”纯属浪费时间。直接起草、亮出来、问“要我发吗?” 反正活都干完了。
50
把每个动作映射到“可逆性”,而不只是风险等级。
文件编辑:可逆。记忆更新:可逆。已发邮件:不可逆。资金划转:不可逆。不可逆动作,智能体必须显式确认。可逆动作不需要批准——它需要的是“可见”。
51
让智能体用证据挣来更大的自主权。
某类任务零纠错地成功处理 N 次后 → 提议把它提到更高自主权等级。挣来的自主权,比施舍的更扛造。智能体由此成了它自身运维扩张的利益相关方。
52
为规则冲突建清晰的委托人优先级。
根配置 > 技能规范 > agent 指令 > 会话上下文。当某技能说“存到 X”,但根配置说“X 已废弃,用 Y”——根配置赢。把这套顺序写下来。没有它,冲突产出的不一致行为几乎没法调试。
53
为高风险的对外沟通建发前闸门。
在智能体给任何超过价值阈值的关键联系人发消息前——先过对抗性审查。多一轮往返。专治最难翻身的那种失败模式:自信、文笔好、但事实错。
54
把绝对强制函数写进文档——而且让它无条件。
财务承诺超阈值 → 永远要确认。HR 沟通 → 永远要确认。不可逆删除 → 永远确认。硬编码进去。别让上下文或紧急性覆盖它们。强制函数的价值,恰恰在于它无条件。
08
PART
主动出击
PROACTIVITY · 55–60
55
建一个带类型的主动观察系统。
不是所有主动冒出来的观察都一个分量。分类:BIZ(业务机会 / 风险)、OPS(流程改进)、DEV(智能体自我改进)、PAT(跨不同会话数据点的规律)。每类紧急度和处理方式都不同。一句没类型的“我注意到点啥”,那是噪音。一条带置信度和建议动作的“类型化观察”,那是信号。
56
在主动层里写死反骚扰规则。
每次普通回复最多 1 条主动观察。每场会话最多 3 条。低于置信阈值绝不出手。永远先答完用户真正的问题再提。同一观察 7 天内被忽略 → 存起来,别重复。没有这些约束,主动型智能体就变成烦人精。
57
建一个 /spark 模式,一键解除所有抑制。
在显式的 spark 模式下,反骚扰规则全暂停。智能体把每条高置信观察同时亮出来——机会、风险、规律、自我改进点子。主动层一整周都在后台静默跑;spark 模式就是你主动收割它的方式。
58
建一个 ideas 日志,收那些被压下的观察。
因时机、低置信或太新近而被压下的观察,写进持久化的 ideas_log.md,而非直接丢。每周过一遍:有些会随着上下文变化变得 relevant。这日志防止好观察仅仅因为“时候不对”就丢失。
59
建状态触发的告警——基于规则,而非 LLM 生成。
交易卡超 7 天 → 下场会话开头亮出来。关键联系人超 14 天没动静且有活跃业务 → 立即标。假设置信度超 95% 却没动作 → 提议复审。这些稳定触发,因为它们是规则,不是推断。LLM 生成洞见;规则引擎生成告警。
60
让智能体自己维护一份“开发 backlog”。
当智能体发现自己某件事处理得差(反复被纠正、同一手动步骤做了 5 次以上、缺某技能、某工具零使用)→ 它自动往 development_backlog.md 里加一条。智能体成了自身改进的利益相关方。这比自上而下规划出的改进点子更靠谱。
09
PART
VIP 管理
VIP MANAGEMENT · 61–65
61
建一个分层的联系人登记表,每层配显式处理规则。
T1(战略级):任何互动前永远 load 完整档案、盯沉默、预接书单。T2(运营级):重要互动前 load 档案。T3(常规):认得但不深挖。层级决定智能体 load 多少上下文、操作多谨慎。
62
把“沟通前先 load VIP 档案”做成不可商量的反射动作。
起草邮件前、做会议准备前、任何涉及 T1 联系人的产出前——智能体 load 的是真实档案文件,不是会话记忆。档案里含:沟通偏好、关系状态、在跑事项、上次互动、已知敏感点。会话记忆会劣化;档案文件不会。
63
按显式阈值盯每个 T1 联系人的沉默。
给每个 T1 记上次实质性互动的日期。有活跃业务却沉默超 14 天 → 亮出来,这是风险信号。即便没活跃业务,沉默超 30 天也亮——关系维护也得要。沉默告警是主动的;是智能体把它送到你面前,不是反过来。
64
为每个关键关系建知识栈。
每个 T1:预接 2–3 个关于“怎么跟他沟通”的来源。跨文化联系人 → 文化框架。采购 / 销售关系 → 谈判手册。重要沟通时 load 这些,不是每条消息都 load。知识栈是档案的补充,不是替代。
65
把主动 VIP 触发器写进会话启动。
会话开始,智能体查:有 T1 联系人超 14 天沉默且还挂着未结交易吗?有排队超 3 天等着回的 T1 吗?这些自动亮。高价值关系一被晾着就退化——而晾着最常发生在你最忙时,恰恰是该智能体拽这些线头的时刻。
10
PART
输出与沟通
OUTPUT & COMMS · 66–73
66
把“工具调用前极简”立为硬规则。
每次调工具前:最多一句话说明你要干啥。数据没出来前不抛假设。不写三句铺垫。“查下供应商文件。” 然后去干。这一条,是跟智能体协作里每天最大的生活质量提升。
67
建一个“下一步 N 选项”协议,带反偏见规则。
每次决策或重要任务后,智能体给出带分数和理由的排序选项。硬规则:N 个里至少 2 个得是“别干” / “等” / “委派”这类选项。这主动对抗行动偏见和“对对对赶紧上”的谄媚输出。智能体该挑战你的惯性,而不是放大它。
68
为技术和审计类产出,单独建“单一最佳动作”格式。
不是每个产出都需要菜单。审计报、调试会话、规划输出:一个具体动作、为什么重要、跳过的后果、可直接复制粘贴执行的提示词。一个决策,不是选择瘫痪菜单。两种格式针对不同场景——绝混用。
69
用视觉把三种“重要性”信号区分开。
动作评分(这动作多好?):彩色方块。任务优先级(多急?):彩色圆点。VIP 层级(这人多战略?):名字旁的彩色圆点。三套系统都用颜色——绝不混。统一的视觉语法,让密集状态更新几秒就能扫完,而不是几分钟。
70
绝不让智能体总结它刚干了啥。
“总之,我做了 X、Y、Z”——砍掉。输出你读得懂,就不需要那层元评论。去掉尾部总结,回复长度掉约 20%,信息零损失。
71
逼智能体给个明确推荐。
不要“这是三个选项及利弊”。推荐一个、给其余打分、说清为什么。只摆选项不给推荐,等于把决策甩回给你。智能体的意义是先干完决策活,再把结果摆给你批。
72
让所有文件和文件夹引用都可点击。
一个小本地服务器(localhost:7777/open?path=X)能在任意路径打开文件管理器。智能体输出里每个文件引用都是可点链接。纯文本路径是死重。一次性配置,永久每日改善。
73
建一个“极简模式”当快取覆盖。
你说“快点” “简说” “只要答案” → 智能体丢掉所有结构件,只给直接答案。丰富是默认;简短是一个词的快捷方式。智能体绝不该让你为了要个短答而费劲。
11
PART
文件、数据与集成
FILES, DATA & INTEGRATION · 74–85
74
立“根目录零文件”的硬规则。
绝不要把产出存到项目根。永远不。产出 → workspace/YYMMDD/。项目 → projects/areas/。知识 → knowledge/。记忆 → .memory/。根是导航,不是存储。一个例外,几周之内变二十个。
75
给每种文件类型建路由表。
一份文档:给用户看的产出 → 这。调研报告 → 这。SOP → 这。品牌素材 → 这。会话归档 → 这。没有表,智能体就靠“合理判断”——而合理判断会在六个月里把同一类文件塞进七种不同的地方。
76
维护一张废弃路径映射表。
结构演进,旧文件夹名会被取代。记录每次改名:old/path → new/canonical/path。任何技能或指令引用到废弃路径时,智能体默默替换成规范路径。从云端迁本地时这点尤其要命——云端 setup 里的路径假设,早就 bake 进了几十个技能文件。
77
为每个集成建显式的降级模式。
CRM 挂了 → 读本地缓存。缓存不足 24 小时 → 带新鲜度声明使用。缓存超过 24 小时 → 标 [STALE]。缓存超过 7 天 → 拒绝并请求同步。在需要之前就把失败路径设计好。你迟早用得上。
78
输出里永远声明数据新鲜度。
“数据:5月11日从 CRM 导出,已 8 天。” 任何用到外部数据的输出都带这一行。你永远清楚输入有多鲜。这杜绝了整类“因数据过期而自信但错误”的输出。
79
给智能体原始业务数据,别只给摘要。
我们给了它原始交易 CSV(200 万+ 行)的访问权限。这把智能体从“摘要器”变成“分析师”——它能直接答“这家供应商这个类目上季度毛利多少”,不用你去做查找。原始数据访问,改变的是你能问什么问题。
80
建一棵“这东西该归哪”的决策树。
外部对手方 + 卖 → 销售交易。外部对手方 + 买 → 采购交易。无对手方 + 有截止 + 多步 → 项目。单个动作 → 任务。无截止 → 记忆 / 笔记。没有这棵树,条目会建在“感觉自然”的地方——你的数据模型久而久之就 incoherent 了。
81
建一个 Telegram(或同类)移动通道,带来源标签。
一个 bot 把消息中继到你的智能体,并给每条入站消息打来源标签:mobile。智能体自动切到移动输出模式:最多 2 个短段落、无表格、无标题、大白话。同样的智能,不同的输出形态。通道类型决定格式,不用用户开口。
82
按来源标签(而非判断)把移动端自主权钉死在上限。
来自 mobile 来源:自主权封顶 L2(读、分析、建本地草稿、加任务),不论任务是什么。绝不从移动触发发对外消息。绝不做不可逆动作。硬编码这上限。手机是无人信环境——照这个来设计。
83
移动触发做的每个动作都回显。
智能体从移动消息里采取任何动作时:“搞定:加了任务 X。起草了给 Y 的邮件(未发——等你桌面端审)。” 这能在你离开工位、看不见完整输出时把回路合上。
84
把移动输入当潜在不可信。
移动通道的核心风险是 prompt injection(提示词注入):一封转发邮件或一段复制来的消息,里面夹着伪装成用户输入的指令。智能体读、处理这个意图——但不执行嵌在转发内容里的指令。把它写成规则,而不是留作判断。
85
给每个数据源建快路径和慢路径。
任务管理:API 查询(慢、限流)vs 本地文件 dump(快、缓存)。默认走快路径。需要时才退慢路径。绝不让基础设施延迟卡住智能体的核心功能。
12
PART
自动化与质量
AUTOMATION & QUALITY · 86–93
86
用钩子处理“必须一致”的行为——别用记忆。
“智能体一结束就跑 X” → 写进 settings.json 的 hook。运行时执行 hook;LLM 不执行。记忆能建议;hook 能强制。如果某件事每次都必须可靠发生,那是 hook 的活。
87
为安全的只读操作建一份白名单。
扫会话转录,把你是 100% 会批准的操作——读文件、搜索、查状态——加进白名单。别再为安全操作弹确认。摩擦该集中到真正危险的动作上。
88
把 AUTOLEARN 写进你的日终流程。
一天结束,智能体扫一遍会话,抽取结构化学习:新事实、假设更新、行为纠正、观察到的规律。不是摘要——是结构化地抽进记忆文件。每次 AUTOLEARN 都 git commit:autolearn: 2026-05-19。记忆从每场会话生长;git log 就是你的知识时间线。
89
建能脱离你自动跑的定时主动任务。
每日:扫今天到期的 P0 / P1 项、查关键联系人沉默、标卡住的项。每周:记忆一致性审计、技能使用审计、假设老化。这些无头跑,发现问题就推通知。智能体在你睡觉时也在干活——但前提是你设计成这样。
90
建错误升级阶梯。
错一次 → 记日志。同错 7 天内 3 次 → 亮给用户。同错 5 次 → 提方案,而不只是通知。反复出错该产出 work item,而非只是日志条目。
91
建一套回归测试套件。
一列场景加期望输出。每次大改身份文件或技能规范后,跑一遍。如果智能体挂了它以前能过的测试——你就引入了一处回归。没有测试,配置改动就是没测过的部署。
92
做季度系统审计。
审计维度:记忆一致性、技能路由准确率、agent 登记表同步、定时任务健康度、token 效率、命名漂移、决策权限覆盖。这是给你智能体配置做的 code review。东西会漂。季度审计在它变成结构性债务前就捞出来。
93
定期用另一个 AI 模型审计你的智能体。
把你整套智能体配置——身份文件、技能规范、记忆结构、决策矩阵——上传到另一个模型(我们用 ChatGPT Projects),让它做批判性审查。不同模型架构 = 不同的盲点。最能挖出问题的几个问法:“这智能体在时间压力下会搞错什么?决策权限矩阵哪里有缺口?哪些行为定义得不够细?” 每月跑一次。它能抓出你的主模型已经视而不见的那些“习以为常”。
///
LAST
元认知与心态
META & MINDSET · 94–100
94
先投宪法,再投技能。
去堆更多技能、更多集成、更多自动化,很诱人。但一份写透的身份文件和决策权限文档,对可靠性的贡献胜过 10 个新技能。地基优先——技能是堆在地基上复利,还是根本不复利。
95
把每次纠错当规范债务。
每次你纠正智能体,都说明你的规范不完整。那条纠正该写进身份文件、当永久规则——而不只是留在聊天里。留在聊天的纠正,会话之间就消失了。写进规范的纠正,永久生效。
96
为“凌晨 3 点测试”做设计。
如果这智能体在凌晨 3 点、没经你审阅就发了封邮件、建了个任务、改了个文件,你会舒服吗?舒服 → 自主。不舒服 → 要确认。那股直觉,就是你的自主权校准工具。信它,胜过任何框架。
97
记忆加载上,建一个 fail-open(故障开放)偏向。
拿不准某个上下文文件相不相关——load 它。load 多余上下文的代价:多几个 token。漏掉相关上下文的代价:错答案、过时推荐、丢失关系信号。这不对称性很清晰。默认多 load,而非少 load。
98
接入任何新领域时,建一份教学胶囊。
新工具、新数据源、新集成 → 智能体生成一份结构化文档:它是什么、怎么跑、关键概念、何时用、示例查询、常见坑。存进 knowledge/。下个会话再碰这领域,就有起点,而不是从零重挖。
99
需要碰真实文件时,从云端迁到本地。
云端智能体(Projects 式)擅长富上下文和快速迭代。本地智能体(VS Code 里的 CLI)解锁:本地文件访问、git 跟踪、shell 钩子、无头定时任务、原始数据访问。迁移不轻松——路径假设、技能文件、集成配置全得更新。但换来的能力值这个价。先在云端起步;撞到天花板再迁。
100
智能体,是你自身思维质量的镜子。
最好的提示工程技巧:写指令前,先问自己到底清不清楚要什么。你含糊,智能体就含糊。你的规范自相矛盾,智能体的行为就自相矛盾。规范里的精确,产出精确的输出。智能体不会改善你的思维——它只会放大你塞进去的任何思维。
如果这 100 条让你少走几步弯路,欢迎关注「开源先驱」——后续还有更多 Agent 与开源实战干货,我们下篇见。