用 Hermes 聊了半小时,它突然忘了前面说过的话?换个对话,它完全不认识你了?这不是 bug——是你没搞懂 Hermes 的三个核心概念。
不懂这三个概念,你用 Hermes(以及所有 AI 助手)就像开手动挡的车却不知道离合器是干嘛的——能开,但经常熄火。
一句话解释:上下文窗口就是 AI 每次对话能"看到"的最大文字量。上一篇我们查过这个数字,现在来深入理解它怎么影响你的日常使用。
你可以把上下文窗口想象成一张固定大小的桌子。你跟 AI 聊天,每条消息、每个工具的返回结果,都像往桌上放纸。纸越来越多,桌子放不下了怎么办?
上下文窗口就像一张固定大小的桌子 📋 上下文窗口(桌子) 系统提示 技能列表 聊天记录 工具结果 ⚠️ 放不下 的部分 → 被压缩或丢弃 💡 实操技巧 • 聊太久 AI 变笨?/reset • 手动压缩:/compress • 查看用量:/usage • 新话题开新会话
Hermes 会自动处理这个问题——当对话接近上下文窗口上限时,它会自动压缩之前的对话内容,保留关键信息,丢弃细节。这个功能叫 context compression(上下文压缩)。
实操:查看压缩设置
运行以下命令:
hermes config | grep compression
你会看到类似:
compression: enabled: true threshold: 0.50 target_ratio: 0.20
意思是:当上下文使用了 50% 以上时触发压缩,压缩到原来的 20%。默认配置不用改,知道有这个机制就行。
上下文窗口是"短时记忆",关掉对话就没了。记忆(Memory)是"笔记本"——AI 把重要信息写下来,下次对话还能翻到。
短时记忆 vs 笔记本 📝 上下文窗口(短时记忆) • 只存在于当前对话 • 关掉就忘了 • 容量有限,会被压缩 📓 记忆(笔记本) • 跨对话持久保存 • 下次对话还在 • 容量小但很关键
Hermes 有两种记忆:
1. 用户画像(User Profile):你是谁、喜欢什么、工作是什么。比如你在一次对话中告诉 AI"我是个后端开发,主要用 Python",AI 会记下来。下次对话它就不再给你推荐 Java 方案了,这些你可以告诉Hermes更新到SOUL.md。
2. 个人笔记(Memory):AI 在使用过程中发现的环境信息、踩过的坑、工具的使用技巧。比如"这台机器内存只有 2G,跑不了大模型"——这种事实值得记下来,你可以明确告诉它,记下来。
实操:查看 AI 记住了什么
hermes memory status
你也可以直接在对话中告诉 AI"记住这个"或者"忘了那个",它会自动调用记忆工具。
⚠️ 记忆 ≠ 聊天记录
聊天记录存在 ~/.hermes/sessions/ 里,你可以用 hermes sessions list 查看历史会话。但记忆是 AI 主动提取和保存的关键信息,不是聊天记录本身。
简单说:聊天记录是流水账,记忆是 AI 自己做的摘要。
每次你和 AI 对话,背后有一份你看不到的"工作手册"先送到 AI 面前。这份手册叫系统提示词(System Prompt)。
它包含这些内容:
系统提示词的构成(从上到下依次加载) ① 角色设定(soul.md)— AI 是谁、怎么说话 ② 记忆(Memory)— AI 记住的用户信息和笔记 ③ 技能索引(Skills)— 可用技能的名字和描述 ④ 工具列表(Tools)— 可调用的工具清单 ⑤ 环境信息(Env)— 操作系统、硬件、工作目录 ⑥ 安全规则(Security)— 哪些操作需要用户确认
这些内容每次对话都会发送,都要占用上下文窗口。所以你装的技能越多、记忆越多,留给实际对话的空间就越少。
上一篇说的"删除用不到的技能",就是这个道理——技能索引也是系统提示词的一部分,几十个技能的索引列表就能吃掉几千个 token。
实操:查看你的系统提示词有多大
在对话中输入:
/usage
你会看到类似:
System prompt: ~3500 tokens Conversation: ~1200 tokens Tools: ~800 tokens ───────────── Total: ~5500 / 8000 tokens (68%)
如果 System prompt 占比太高(超过 60%),说明你的技能或记忆太多了,该清理了。
三者关系 上下文窗口 AI 的桌子 记忆 AI 的笔记本 系统提示词 AI 的工作手册 记入 注入 记忆(笔记本)每次对话时自动注入系统提示词(工作手册) 系统提示词 + 对话内容 = 占用上下文窗口(桌子) 桌子满了 → 压缩旧内容 → 记住关键信息到笔记本
理解了这三者的关系,你就能:
• AI 突然变笨 → 检查 /usage,看是不是上下文快满了 • AI 忘了你之前说的 → 看是不是被压缩掉了,让 AI "记住这个" • AI 回复变慢/变贵 → 看是不是系统提示词太大了,清理技能和记忆
下一篇,我们来讲怎么定制你的 AI 灵魂——通过 SOUL.md 文件让 AI 变成你想要的样子。
问题一:聊着聊着 AI 开始胡说八道
这是典型的上下文被压缩后的表现。AI 丢掉了前面的关键信息,只能"猜"。
解决:
• 先输入 /usage 查看当前用量
• 如果已超过 80%,输入 /reset 开新会话
• 开新会话前,让 AI "把当前任务的进度记到记忆里",这样新会话还能接上
问题二:AI 总是忘记我的偏好
每次都跟 AI 说"我喜欢简洁的回复",但它下次又忘了。
解决:直接说"记住:我偏好简洁的回复,不要加多余的客套话"。AI 会把这个写入记忆,以后每次对话都会读到。
你也可以手动编辑记忆文件。记忆保存在 ~/.hermes/memory/ 目录下,直接用文本编辑器打开就能修改。
问题三:换了模型后行为完全不同
用 DeepSeek V4 回答很详细,换成 GLM-4-Air 就变简短了。
原因:系统提示词(工作手册)虽然一样,但不同模型对同一份手册的"理解程度"不同。能力强的模型能更好地遵循指令,小模型可能忽略一些细节。
解决:如果换模型后行为不对,在提示词里更明确地说明你的要求。比如把"简洁回复"改成"每条回复不超过 3 句话,不要加总结"。
今天就试试——打开 Hermes,输入
/usage看看你的上下文用了多少、系统提示词占了多大。如果系统提示词超过 60%,立刻清理用不到的技能。做完来评论区告诉我你的数据,我帮你判断要不要优化。