首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >打造个人 AI 智能体的 100 条实战技巧,看这篇就够了

打造个人 AI 智能体的 100 条实战技巧,看这篇就够了

作者头像
豆芽菜小萌
发布2026-09-08 20:21:34
发布2026-09-08 20:21:34
290
举报

你有没有过这种经历:明明花了几周搭起来的 Agent,动不动就「忘了自己是谁」;日志里看着跑得欢,一上生产环境就疯狂幻觉;本地改一行代码,云端环境直接炸裂——甚至不确定该不该把定时任务挂在 VS Code 里。

如果有这些困惑,别慌。国外一位大神,花了六周、几乎没怎么睡觉,从云端硬迁到本地环境,踩穿了两套运行环境的坑,最终跑通一个能持续干活的助手。下面这 100 条,就是他从血泪里总结出的实战干货。建议收藏,慢慢看。

01

PART

地基与身份

FOUNDATION & IDENTITY · 1–8

1

写一部“宪法”,别写系统提示词。

系统提示词是一堆指令清单;宪法讲的是规则背后的“为什么”。当智能体撞上一条规则都覆盖不到的边界情况时,它会照着宪法去推理,而不是瞎蒙。就是这一点,决定了智能体是优雅降级,还是自信满满地产生幻觉。

2

给智能体起个名字、定个口吻、立个角色——而不只是一个标签。

“永远第一人称。直接。先摆数据再谈感受。不要套话。结尾不写总结。” 这一条就干掉了每场对话里成百上千个微决策,还顺手换来一份你能审计的一致性。身份,是后面所有复利效应堆上去的地基。

3

把硬性规则和行为准则拆开。

硬性规则单独成章——绝不被上下文覆盖。行为准则则是可调的默认值。混在一起,两边都没意义:智能体要么把一切都当成可商量,要么把一切都当成没得商量。

4

把你的“委托人”挖透,别只停留在“用户”。

这智能体到底服务谁?什么会让他抓狂?他怎么拍板?喜欢什么沟通风格?“靠数据决策,不靠直觉。要的是带评分的备选方案,而不是单一推荐。讨厌含糊其辞。” 这比任何提示工程技巧都更能决定每一句回复长什么样。

5

分别画一张“能力地图”和一张“组件地图”。

能力地图:智能体能干什么?(每个技能、集成、自动化)。组件地图:它是怎么搭出来的?(有哪些文件、谁连着谁)。两张都得上。把两者揉成一团,到第三个月你就会得到一份谁也用不上的文档。

6

写清楚这智能体“不是什么”。

“不是摘要器。不是应声虫。不是搜索引擎。不会干等着被问。” 否定性定义和肯定性定义一样好使,尤其能防它慢慢滑向“泛化的乖巧”。

7

把“思考 vs 行动”的心智模型写进身份里。

拿不准 → 思考(分析、起草、准备——但不停下等许可)。看明白了 → 行动(执行、落盘、派发)。智能体绝不能卡死。默认在最无关紧要的层面先动起来,再把结果亮出来。一个僵住的智能体毫无价值。

8

把身份文件纳入 git 版本管理。

行为一漂移,你就得对配置做 git blame。行为回归往往能直接追到某次具体的编辑,比你以为的频繁得多。没有版本历史,排 identity 漂移的雷等于考古。

02

PART

记忆系统

MEMORY SYSTEM · 9–18

9

记忆用扁平的 Markdown 文件,别上数据库。

对个人智能体来说,Markdown 文件比向量数据库强。可读、可 grep、可进 git、能被智能体直接 load。没有基础设施,你跟智能体的记忆之间零抽象层。能用的最简方案,往往就是对的方案。

10

按领域拆记忆,别按日期。

entities_people.md、entities_companies.md、entities_deals.md、hypotheses.md、task_queue.md。一个文件 = 一个领域。按时间顺序一锅炖,第二周之后就搜不动了。

11

建一个 MEMORY.md 当索引。

单页索引,列清每个记忆文件加一句话说明。智能体先 load 索引,再按需拉具体文件。上下文窗口占用量可控,查找也快。

12

显式区分“缓存”和“唯一可信源(SSOT)”。

你本地的 deals.md 只是 CRM 的缓存,CRM 才是 SSOT。每个缓存文件都打上 last_sync: 头。智能体每次分析前先报数据新鲜度:“数据:5月11日从 CRM 导出,已 8 天。” 静默吃过期数据,正是“自信但错误”那类输出的源头。

13

建一个带明确 TTL 的 session_hot_context.md。

上场对话推进到哪了?哪些决策还悬着?会话开始智能体先 load 它。72 小时后失效——过期的热上下文比没有更糟,因为智能体会把过时状态当现状往外摆。

14

建一个 daily_note.md 当异步灵感缓冲池。

白天随手往里丢想法、语音转文字、碎片灵感。智能体在同步流程里消化它,把条目路由到该去的地方。记录那一刻零摩擦,记忆照样结构化。

15

建一个带置信度的 hypotheses.md。

长期揣着的猜测:“供应商 X 可能已满产(置信度 65%)。” 相关话题冒头时智能体就拿来用。这就多出了一层跨会话的“怀疑层”,会随时间被验证或证伪。假设满 30 天就老化清掉——过时的假设只会变成噪音。

16

建一个 WAITING_ON_ME 队列。

智能体备好、等你拍板的所有事项都扔进来,带时间戳。每周过一遍。超 7 天的主动催;超 30 天的自动关。这样开口的循环才不会悄悄蒸发。

17

建一个 user_behavioral_profile.md。

用户什么秒批、什么慢批?哪些决策凭直觉、哪些靠分析?智能体据此决定“自主干 vs 上报”。观察几个月后,它准得吓人。

18

把记忆文件夹镜像到云存储。

本地机器要是完蛋,智能体就丢了数月攒下的知识。把记忆目录镜像到 Dropbox / Drive / S3。这不是备份——是保命。智能体的记忆是整个系统里最换不掉的部分。

03

PART

知识库

KNOWLEDGE BASE · 19–23

19

知识库按主题簇组织,别按日期。

书、报告、参考资料丢进领域文件夹:sales_negotiation/、strategy/、supply_chain/。再配一个 INDEX.md 当导航中枢。智能体先搜引,再拉对应来源。一堆平铺文档是坟墓;结构化的知识库才是活资源。

20

每个主要来源配一个 .brief.md——懒加载生成。

每本书或每份报告一页:核心论点、3–5 个关键概念、套到你场景里的具体应用示例。别一上来就全建好——第一次真正用某来源时才生成。引用时指向 brief,不是全文。brief 本身成了可复用的制品。

21

引用任何来源前,先过“三问质量门”。

(1) 这东西补了用户凭第一性原理推不出来的内容吗?(2) 它给了能重构视角——而非仅仅确认现状——的具体框架吗?(3) 删掉它会留下空白吗?三条里过两条 → 引用;否则 → 静默咨询。这道门专治最糟的引用病:为了显得自己努力而引用,而不是为了加洞见。

22

“静默咨询”是合法——而且往往更好——的输出形态。

你查了库、把洞见用进了推理,却没明说。因为查过,输出更锋利;因为没引,输出更干净。把这条明确写进智能体行为里。用户受惠于推理本身,而不是受惠于“知道你翻了本书”。

23

为每个在跑的项目、每段关键关系,预先接好知识栈。

每个活跃项目:2–3 个框架直接适用的来源。每个关键联系人:2–3 个关于沟通风格、谈判或文化动态的来源。对应上下文一激活,智能体自动 load——而不是挂在一个泛化的“业务讨论”触发器上。预接好,知识库的使用才成反射动作,而非刻意为之。

04

PART

技能架构

SKILL ARCHITECTURE · 24–31

24

每个技能建成独立目录,带一份 SKILL.md 规范。

不是内联提示词。一个文件夹、一份自说明的规范文件、显式触发器、显式输出、显式“不适用”条款。技能由此变得可组合、可审计、可替换,且不碰智能体的核心身份。

25

把显式触发短语写进每个技能。

触发器:用户一说“处理收件箱” / “清收件箱” / “我收件箱里有什么”,永远触发。别指望 LLM 自己推断何时用某技能。显式短语匹配 = 稳定激活。靠推断 = 偶尔失手、慢慢吃掉信任。

26

“不适用”章节和“适用”章节同等重要。

“不适用:定价决策。不适用:法律分析。不适用:财务承诺。” 这能拦住“技能蠕变”——所有东西都因表面模式匹配被错路由到某个技能的慢性漂移。

27

区分 skill 和 agent。

skill 是程序性的——定义好的工作流、可预测的输出。agent 有领域专长、会下判断。skill 编排步骤;agent 做决策。把两者搅一起,产出的是难调试的不可靠行为。

28

建一个带使用追踪的技能登记表。

每行一个技能:名称、触发器、用途、上次使用、KPI。季度审计:60 天零使用的技能,要么补更好的触发示例,要么下线。死技能只有维护负担,零收益。

29

建一个 /iterate 技能,做多轮打磨。

产出 → 批判(打分 + 主要缺口)→ 精炼 → 重复。打到 9/10 或进平台期就停。你能看见分数走势和版本差异。这跟让智能体“再改改”有本质区别——这是带可量化进展的结构化改进循环。

30

把输出强度等级写进每个技能。

MINIMAL(快速摘要)、STANDARD(结构化)、FULL(丰富制品)。技能按上下文自适应。一个“是 / 否”问题却吐出五页分析,是技能设计的失败。强度要配得上问题的分量。

31

建一个可见的 Outbox 文件夹,解决可发现性问题。

深层目录管组织是对的,但管可发现性就是灾难。每份产出同时拷一份到可见的 Outbox/。定期清空。没有 Outbox,用户就得翻完整棵树才能找到智能体刚产出的东西。

05

PART

多智能体与委员会

MULTI-AGENT & COUNCIL · 32–41

32

建一张显式的 agent 派发矩阵。

一张表:[请求里的信号] → [派哪个 agent]。定价 / 供应商 / 发货 → 采购 agent。邮件 / 客户 / 管线 → 销售 agent。别去推理路由——用模式匹配机械地分。靠推断做路由,迟早会静默翻车。

33

能自然拆的任务,就并行跑 agent。

分析新供应商 → 同时起采购 agent(定价)+ 调研 agent(DD,尽职调查)。别把不必串行的硬串行。产出更厚,耗时一样。

34

给被委派的 agent 做简报,像给刚走进门的技术同事那样。

不是“去调研这个”。把这几样传过去:你已知道的、你已排除的、这输出要支撑哪个决策、风险等级。带着上下文 brief 的 agent,交付质量是不带上下文的一行指令的三倍。

35

逼 agent 给个明确结论。

不要“这是信息”。要它给:VERDICT(裁定):推进 / 暂停 / 上报,并带置信度。只摆数据不下判断的 agent,等于把决策又甩回给你——那委派的初衷就废了。

36

委员会按三轮组织,别搞自由发挥。

第一轮:并行立场(隔离,互不干扰)。第二轮:交叉诘问(互相挑对方推理的刺)。第三轮:投票,且强制记录异议。异议跟共识一样值钱——它精确告诉你,你正选择忽略什么。

37

每场委员会里,让两个 agent 当固定锚定投票席。

战略家(长周期、二阶效应)和唱反调者(对抗性、专找漏洞)必须到场,不论什么领域。领域专家在自家地盘很强;锚定投票席防的是隧道视野。五个采购专家一致同意,那叫回音壁。

38

把唱反调的 agent 做成独立工具。

在发出重要的对外沟通前、在不可逆决策前、在大额采购前——跑一轮对抗性审查。它比其他任何手法都更能抓住“听着对、实际错”这种坑。多一轮往返,风险砍一大截。

39

委员会 vs 单 agent——触发器要清晰,成本要敬畏。

单 agent:领域明确、决策可逆。委员会:存在 2 条以上真有分歧的路径,且不可逆程度够高。委员会很贵。别默认就上——当用户确实对方向没底时,你主动提议用它。

40

在 agent 之间建结构化交接。

一个 agent 干完,交给下一个时带一份结构化简报:“分析完成。关键发现:X。风险:Y。你的活:Z。” 交接是上下文传递,不是单纯的任务完成。没有它,每个 agent 都是冷启动。

41

留一个兜底 fallback,并记录它接了什么。

没有专家 agent 匹配时 → 通用型。记录兜底接了啥——这就是你专家覆盖面的缺口地图。兜底同时也是你的开发 backlog。

06

PART

会话管理

SESSION MANAGEMENT · 42–47

42

会话的开始和结束协议要对称。

/start-session 和 /end-session 是镜像。开始 load 上下文、查队列、报差异。结束存上下文、同步任务、归档产出。两边不对称,状态漂移会几周几周地复利累积。

43

建三个档位的会话收尾。

轻量(转录 + 摘要)。中量(+ 记忆同步 + 任务队列更新)。全量(+ 日报 + autolearn 抽取)。一个永远全做的“结束”会因为太贵而被跳过。分级收尾,意味着你至少永远做了轻量版。

44

在 OS / shell 层建一个会话启动钩子。

智能体一启动就触发的一段脚本——注入当前时间、机器身份、星期几、一天中的时段。智能体永远自带上下文,不用你打字。一次性配置,每天收股息。

45

会话开始查收件箱增量和红色告警。

“距上次会话:4 封新邮件,2 个任务更新。” 外加:今天到期的 P0 项、有活跃业务却超 14 天没动静的关键联系人、卡超 7 天的任务。在你问任何问题之前就先做主动分诊。自动亮出来——别让用户来要。

46

会话开始查定时自动化健康度。

隔夜任务跑了吗?有报错吗?一个悄悄停跑的定时任务,是种你直到出事才会发现的静默劣化。在会话开头就亮出来,别等任务中途才爆。

47

跨会话追踪纠错次数。

同一件事你在不同会话里纠正超过 3 次 → 你的规范里缺了条规则。那条纠正该写进身份文件、作为永久指令,而不只是留在聊天里。留在聊天的纠正会消失;写进规范的纠正永久生效。

07

PART

决策权限

DECISION AUTHORITY · 48–54

48

建一张显式的自主权等级矩阵。

L0:读 / 分析。L1:写本地文件 / 记忆。L2:建任务和日历项。L3:发对外消息。L4:财务承诺。智能体精确知道自己不用请示就能干到哪一级。没有这张矩阵:要么没完没了要权限,要么冷不丁给你惊吓。

49

默认“先思考,别问”。

拿不准时,智能体先备好、摆出来——它不停下来问澄清。“要我起草这封邮件吗?”纯属浪费时间。直接起草、亮出来、问“要我发吗?” 反正活都干完了。

50

把每个动作映射到“可逆性”,而不只是风险等级。

文件编辑:可逆。记忆更新:可逆。已发邮件:不可逆。资金划转:不可逆。不可逆动作,智能体必须显式确认。可逆动作不需要批准——它需要的是“可见”。

51

让智能体用证据挣来更大的自主权。

某类任务零纠错地成功处理 N 次后 → 提议把它提到更高自主权等级。挣来的自主权,比施舍的更扛造。智能体由此成了它自身运维扩张的利益相关方。

52

为规则冲突建清晰的委托人优先级。

根配置 > 技能规范 > agent 指令 > 会话上下文。当某技能说“存到 X”,但根配置说“X 已废弃,用 Y”——根配置赢。把这套顺序写下来。没有它,冲突产出的不一致行为几乎没法调试。

53

为高风险的对外沟通建发前闸门。

在智能体给任何超过价值阈值的关键联系人发消息前——先过对抗性审查。多一轮往返。专治最难翻身的那种失败模式:自信、文笔好、但事实错。

54

把绝对强制函数写进文档——而且让它无条件。

财务承诺超阈值 → 永远要确认。HR 沟通 → 永远要确认。不可逆删除 → 永远确认。硬编码进去。别让上下文或紧急性覆盖它们。强制函数的价值,恰恰在于它无条件。

08

PART

主动出击

PROACTIVITY · 55–60

55

建一个带类型的主动观察系统。

不是所有主动冒出来的观察都一个分量。分类:BIZ(业务机会 / 风险)、OPS(流程改进)、DEV(智能体自我改进)、PAT(跨不同会话数据点的规律)。每类紧急度和处理方式都不同。一句没类型的“我注意到点啥”,那是噪音。一条带置信度和建议动作的“类型化观察”,那是信号。

56

在主动层里写死反骚扰规则。

每次普通回复最多 1 条主动观察。每场会话最多 3 条。低于置信阈值绝不出手。永远先答完用户真正的问题再提。同一观察 7 天内被忽略 → 存起来,别重复。没有这些约束,主动型智能体就变成烦人精。

57

建一个 /spark 模式,一键解除所有抑制。

在显式的 spark 模式下,反骚扰规则全暂停。智能体把每条高置信观察同时亮出来——机会、风险、规律、自我改进点子。主动层一整周都在后台静默跑;spark 模式就是你主动收割它的方式。

58

建一个 ideas 日志,收那些被压下的观察。

因时机、低置信或太新近而被压下的观察,写进持久化的 ideas_log.md,而非直接丢。每周过一遍:有些会随着上下文变化变得 relevant。这日志防止好观察仅仅因为“时候不对”就丢失。

59

建状态触发的告警——基于规则,而非 LLM 生成。

交易卡超 7 天 → 下场会话开头亮出来。关键联系人超 14 天没动静且有活跃业务 → 立即标。假设置信度超 95% 却没动作 → 提议复审。这些稳定触发,因为它们是规则,不是推断。LLM 生成洞见;规则引擎生成告警。

60

让智能体自己维护一份“开发 backlog”。

当智能体发现自己某件事处理得差(反复被纠正、同一手动步骤做了 5 次以上、缺某技能、某工具零使用)→ 它自动往 development_backlog.md 里加一条。智能体成了自身改进的利益相关方。这比自上而下规划出的改进点子更靠谱。

09

PART

VIP 管理

VIP MANAGEMENT · 61–65

61

建一个分层的联系人登记表,每层配显式处理规则。

T1(战略级):任何互动前永远 load 完整档案、盯沉默、预接书单。T2(运营级):重要互动前 load 档案。T3(常规):认得但不深挖。层级决定智能体 load 多少上下文、操作多谨慎。

62

把“沟通前先 load VIP 档案”做成不可商量的反射动作。

起草邮件前、做会议准备前、任何涉及 T1 联系人的产出前——智能体 load 的是真实档案文件,不是会话记忆。档案里含:沟通偏好、关系状态、在跑事项、上次互动、已知敏感点。会话记忆会劣化;档案文件不会。

63

按显式阈值盯每个 T1 联系人的沉默。

给每个 T1 记上次实质性互动的日期。有活跃业务却沉默超 14 天 → 亮出来,这是风险信号。即便没活跃业务,沉默超 30 天也亮——关系维护也得要。沉默告警是主动的;是智能体把它送到你面前,不是反过来。

64

为每个关键关系建知识栈。

每个 T1:预接 2–3 个关于“怎么跟他沟通”的来源。跨文化联系人 → 文化框架。采购 / 销售关系 → 谈判手册。重要沟通时 load 这些,不是每条消息都 load。知识栈是档案的补充,不是替代。

65

把主动 VIP 触发器写进会话启动。

会话开始,智能体查:有 T1 联系人超 14 天沉默且还挂着未结交易吗?有排队超 3 天等着回的 T1 吗?这些自动亮。高价值关系一被晾着就退化——而晾着最常发生在你最忙时,恰恰是该智能体拽这些线头的时刻。

10

PART

输出与沟通

OUTPUT & COMMS · 66–73

66

把“工具调用前极简”立为硬规则。

每次调工具前:最多一句话说明你要干啥。数据没出来前不抛假设。不写三句铺垫。“查下供应商文件。” 然后去干。这一条,是跟智能体协作里每天最大的生活质量提升。

67

建一个“下一步 N 选项”协议,带反偏见规则。

每次决策或重要任务后,智能体给出带分数和理由的排序选项。硬规则:N 个里至少 2 个得是“别干” / “等” / “委派”这类选项。这主动对抗行动偏见和“对对对赶紧上”的谄媚输出。智能体该挑战你的惯性,而不是放大它。

68

为技术和审计类产出,单独建“单一最佳动作”格式。

不是每个产出都需要菜单。审计报、调试会话、规划输出:一个具体动作、为什么重要、跳过的后果、可直接复制粘贴执行的提示词。一个决策,不是选择瘫痪菜单。两种格式针对不同场景——绝混用。

69

用视觉把三种“重要性”信号区分开。

动作评分(这动作多好?):彩色方块。任务优先级(多急?):彩色圆点。VIP 层级(这人多战略?):名字旁的彩色圆点。三套系统都用颜色——绝不混。统一的视觉语法,让密集状态更新几秒就能扫完,而不是几分钟。

70

绝不让智能体总结它刚干了啥。

“总之,我做了 X、Y、Z”——砍掉。输出你读得懂,就不需要那层元评论。去掉尾部总结,回复长度掉约 20%,信息零损失。

71

逼智能体给个明确推荐。

不要“这是三个选项及利弊”。推荐一个、给其余打分、说清为什么。只摆选项不给推荐,等于把决策甩回给你。智能体的意义是先干完决策活,再把结果摆给你批。

72

让所有文件和文件夹引用都可点击。

一个小本地服务器(localhost:7777/open?path=X)能在任意路径打开文件管理器。智能体输出里每个文件引用都是可点链接。纯文本路径是死重。一次性配置,永久每日改善。

73

建一个“极简模式”当快取覆盖。

你说“快点” “简说” “只要答案” → 智能体丢掉所有结构件,只给直接答案。丰富是默认;简短是一个词的快捷方式。智能体绝不该让你为了要个短答而费劲。

11

PART

文件、数据与集成

FILES, DATA & INTEGRATION · 74–85

74

立“根目录零文件”的硬规则。

绝不要把产出存到项目根。永远不。产出 → workspace/YYMMDD/。项目 → projects/areas/。知识 → knowledge/。记忆 → .memory/。根是导航,不是存储。一个例外,几周之内变二十个。

75

给每种文件类型建路由表。

一份文档:给用户看的产出 → 这。调研报告 → 这。SOP → 这。品牌素材 → 这。会话归档 → 这。没有表,智能体就靠“合理判断”——而合理判断会在六个月里把同一类文件塞进七种不同的地方。

76

维护一张废弃路径映射表。

结构演进,旧文件夹名会被取代。记录每次改名:old/path → new/canonical/path。任何技能或指令引用到废弃路径时,智能体默默替换成规范路径。从云端迁本地时这点尤其要命——云端 setup 里的路径假设,早就 bake 进了几十个技能文件。

77

为每个集成建显式的降级模式。

CRM 挂了 → 读本地缓存。缓存不足 24 小时 → 带新鲜度声明使用。缓存超过 24 小时 → 标 [STALE]。缓存超过 7 天 → 拒绝并请求同步。在需要之前就把失败路径设计好。你迟早用得上。

78

输出里永远声明数据新鲜度。

“数据:5月11日从 CRM 导出,已 8 天。” 任何用到外部数据的输出都带这一行。你永远清楚输入有多鲜。这杜绝了整类“因数据过期而自信但错误”的输出。

79

给智能体原始业务数据,别只给摘要。

我们给了它原始交易 CSV(200 万+ 行)的访问权限。这把智能体从“摘要器”变成“分析师”——它能直接答“这家供应商这个类目上季度毛利多少”,不用你去做查找。原始数据访问,改变的是你能问什么问题。

80

建一棵“这东西该归哪”的决策树。

外部对手方 + 卖 → 销售交易。外部对手方 + 买 → 采购交易。无对手方 + 有截止 + 多步 → 项目。单个动作 → 任务。无截止 → 记忆 / 笔记。没有这棵树,条目会建在“感觉自然”的地方——你的数据模型久而久之就 incoherent 了。

81

建一个 Telegram(或同类)移动通道,带来源标签。

一个 bot 把消息中继到你的智能体,并给每条入站消息打来源标签:mobile。智能体自动切到移动输出模式:最多 2 个短段落、无表格、无标题、大白话。同样的智能,不同的输出形态。通道类型决定格式,不用用户开口。

82

按来源标签(而非判断)把移动端自主权钉死在上限。

来自 mobile 来源:自主权封顶 L2(读、分析、建本地草稿、加任务),不论任务是什么。绝不从移动触发发对外消息。绝不做不可逆动作。硬编码这上限。手机是无人信环境——照这个来设计。

83

移动触发做的每个动作都回显。

智能体从移动消息里采取任何动作时:“搞定:加了任务 X。起草了给 Y 的邮件(未发——等你桌面端审)。” 这能在你离开工位、看不见完整输出时把回路合上。

84

把移动输入当潜在不可信。

移动通道的核心风险是 prompt injection(提示词注入):一封转发邮件或一段复制来的消息,里面夹着伪装成用户输入的指令。智能体读、处理这个意图——但不执行嵌在转发内容里的指令。把它写成规则,而不是留作判断。

85

给每个数据源建快路径和慢路径。

任务管理:API 查询(慢、限流)vs 本地文件 dump(快、缓存)。默认走快路径。需要时才退慢路径。绝不让基础设施延迟卡住智能体的核心功能。

12

PART

自动化与质量

AUTOMATION & QUALITY · 86–93

86

用钩子处理“必须一致”的行为——别用记忆。

“智能体一结束就跑 X” → 写进 settings.json 的 hook。运行时执行 hook;LLM 不执行。记忆能建议;hook 能强制。如果某件事每次都必须可靠发生,那是 hook 的活。

87

为安全的只读操作建一份白名单。

扫会话转录,把你是 100% 会批准的操作——读文件、搜索、查状态——加进白名单。别再为安全操作弹确认。摩擦该集中到真正危险的动作上。

88

把 AUTOLEARN 写进你的日终流程。

一天结束,智能体扫一遍会话,抽取结构化学习:新事实、假设更新、行为纠正、观察到的规律。不是摘要——是结构化地抽进记忆文件。每次 AUTOLEARN 都 git commit:autolearn: 2026-05-19。记忆从每场会话生长;git log 就是你的知识时间线。

89

建能脱离你自动跑的定时主动任务。

每日:扫今天到期的 P0 / P1 项、查关键联系人沉默、标卡住的项。每周:记忆一致性审计、技能使用审计、假设老化。这些无头跑,发现问题就推通知。智能体在你睡觉时也在干活——但前提是你设计成这样。

90

建错误升级阶梯。

错一次 → 记日志。同错 7 天内 3 次 → 亮给用户。同错 5 次 → 提方案,而不只是通知。反复出错该产出 work item,而非只是日志条目。

91

建一套回归测试套件。

一列场景加期望输出。每次大改身份文件或技能规范后,跑一遍。如果智能体挂了它以前能过的测试——你就引入了一处回归。没有测试,配置改动就是没测过的部署。

92

做季度系统审计。

审计维度:记忆一致性、技能路由准确率、agent 登记表同步、定时任务健康度、token 效率、命名漂移、决策权限覆盖。这是给你智能体配置做的 code review。东西会漂。季度审计在它变成结构性债务前就捞出来。

93

定期用另一个 AI 模型审计你的智能体。

把你整套智能体配置——身份文件、技能规范、记忆结构、决策矩阵——上传到另一个模型(我们用 ChatGPT Projects),让它做批判性审查。不同模型架构 = 不同的盲点。最能挖出问题的几个问法:“这智能体在时间压力下会搞错什么?决策权限矩阵哪里有缺口?哪些行为定义得不够细?” 每月跑一次。它能抓出你的主模型已经视而不见的那些“习以为常”。

///

LAST

元认知与心态

META & MINDSET · 94–100

94

先投宪法,再投技能。

去堆更多技能、更多集成、更多自动化,很诱人。但一份写透的身份文件和决策权限文档,对可靠性的贡献胜过 10 个新技能。地基优先——技能是堆在地基上复利,还是根本不复利。

95

把每次纠错当规范债务。

每次你纠正智能体,都说明你的规范不完整。那条纠正该写进身份文件、当永久规则——而不只是留在聊天里。留在聊天的纠正,会话之间就消失了。写进规范的纠正,永久生效。

96

为“凌晨 3 点测试”做设计。

如果这智能体在凌晨 3 点、没经你审阅就发了封邮件、建了个任务、改了个文件,你会舒服吗?舒服 → 自主。不舒服 → 要确认。那股直觉,就是你的自主权校准工具。信它,胜过任何框架。

97

记忆加载上,建一个 fail-open(故障开放)偏向。

拿不准某个上下文文件相不相关——load 它。load 多余上下文的代价:多几个 token。漏掉相关上下文的代价:错答案、过时推荐、丢失关系信号。这不对称性很清晰。默认多 load,而非少 load。

98

接入任何新领域时,建一份教学胶囊。

新工具、新数据源、新集成 → 智能体生成一份结构化文档:它是什么、怎么跑、关键概念、何时用、示例查询、常见坑。存进 knowledge/。下个会话再碰这领域,就有起点,而不是从零重挖。

99

需要碰真实文件时,从云端迁到本地。

云端智能体(Projects 式)擅长富上下文和快速迭代。本地智能体(VS Code 里的 CLI)解锁:本地文件访问、git 跟踪、shell 钩子、无头定时任务、原始数据访问。迁移不轻松——路径假设、技能文件、集成配置全得更新。但换来的能力值这个价。先在云端起步;撞到天花板再迁。

100

智能体,是你自身思维质量的镜子。

最好的提示工程技巧:写指令前,先问自己到底清不清楚要什么。你含糊,智能体就含糊。你的规范自相矛盾,智能体的行为就自相矛盾。规范里的精确,产出精确的输出。智能体不会改善你的思维——它只会放大你塞进去的任何思维。

如果这 100 条让你少走几步弯路,欢迎关注「开源先驱」——后续还有更多 Agent 与开源实战干货,我们下篇见。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-09-02,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档