一边,是面向开发者的开源图记忆库 Engram Memory SDK;一边,是 Claude Code 对长期任务记忆架构的极简重构;另一边,则是 OpenBMB 在 EdgeClaw 2.0 中把多级记忆能力正式产品化 先说结论:记忆系统开始从功能点走向架构层 过去很多 Agent 的“记忆”,本质上还是向量库加检索片段。 Claude Code 直接把记忆写进工作流纪律,EdgeClaw 把记忆做成多级组件,Engram 则把记忆抽象成开发基础设施。 2. /EdgeClaw[2] •Claude Code 新型记忆系统架构:基于用户提供信息整理 本文由山行整理自网络,如果对您有帮助,请帮忙点赞、关注、收藏,谢谢~ 参考链接 [1] https://github.com /hackdavid/engram-memory: https://github.com/hackdavid/engram-memory [2] https://github.com/OpenBMB/EdgeClaw
而 DeepSeek 这次 Engram 的“条件记忆”技术将模型的"记忆"与"计算"能力解耦,实现了"查算分离"的全新架构范式。 国内视其为重要的架构创新方向,产业界则看到了其在金融等领域实现“经营级智能”的落地潜力,推动AI从对话走向决策。 2. mHC 与 Engram 的结合是“动态计算”与“静态记忆”的双重优化,旨在实现“1+1>2”的效果:mHC 提升 MoE 通信效率,Engram 解决计算资源竞争。 八、结语:条件记忆将是下一代大模型的核心构件 Engram 架构的出现,本质上是对大模型“任务分工”的重新定义,通过条件记忆与条件计算的互补,让模型的不同部分各司其职,实现了“性能、效率和可扩展性”的三重突破 系统突破:确定性寻址实现计算与内存解耦,突破 GPU 内存墙,让万亿级参数的记忆表可低成本部署。 Engram 技术标志着大模型架构设计进入了一个新的里程碑。
这篇文章会带你从V3的技术遗产出发,逐层拆解V4的三张核心技术底牌——mHC流形约束超连接、Engram条件记忆架构、以及新一代MoE稀疏计算,看看DeepSeek凭什么用更少的芯片做到了更猛的性能。 MoE架构的稀疏激活让模型推理时的实际计算量远小于参数规模暗示的值——大约带来了4倍以上的效率提升。整个模型中MoE模块权重占比高达98%,剩下MLP与MLA模块仅占2%。 维度二:MLA+Engram减少KVCache压力(约2-3倍)MLA通过低秩压缩减少了KVCache的大小。 2.长上下文处理预研V4的百万token上下文窗口会打开很多新的应用场景——完整代码仓库分析、长篇小说创作、全量日志诊断等。但现在就可以用V3的128K上下文做一些预研和架构设计。 展开代码语言:TXTAI代码解释graphLRA[DeepSeekV4发布]-->B[技术层面]A-->C[产业层面]A-->D[生态层面]B-->B1[架构范式转换:mHC+Engram]B-->B2
对于传统的transformers架构来说,模型看到这句话时,其实要经历一串“隐式重建”的过程:逐字读入「美国、总统、现在、是谁」在多层网络里慢慢组合出:这是一个国家相关实体、这是一个职位;然后把“美国总统 比如输入一句话“今天天气不错”那么1-gram的表示方式为:今|天|天|气|不|错2-gram的表示为:今天|天天|天气|气不|不错而Engram的核心流程很像“现代版N-gramembedding”: 第一步是切片:从输入里提取2-gram、3-gram等局部片段(常用的是后缀形式)。 Engram的“门控(gating)”确实学会了:只在“这是一个稳定、固定的局部模式”时才强力介入,而不是对所有token都乱用记忆。 目前DeepSeek在走极致化的“稀疏”路线:MoE:计算的稀疏化Engram:存储的稀疏化如果这条路跑通,未来可能出现一种很有代表性的架构形态:小而精的推理核心+可扩展、可更新的超大记忆库。
其核心创新在于一套名为“双轴稀疏架构”的系统性设计,该架构由两大引擎驱动:“Engram条件记忆引擎”与“MoE混合专家计算引擎”。 其根源在于,传统Transformer架构将“记忆”(存储事实知识)与“计算”(进行逻辑推理)混杂在同一套权重参数中。模型被迫用昂贵的、易错的计算过程去“模拟”对静态知识的检索。 DeepSeek-V4的“双引擎”架构正是对这一生物机制的工程化复现:Engram条件记忆引擎≈海马体:高效、无损地存储和检索静态知识。MoE混合专家计算引擎≈新皮层:动态、灵活地处理复杂的推理任务。 第二章:第一引擎——Engram条件记忆:为大模型装上“海马体”2.1设计动机:为什么需要一个独立的记忆模块?在传统模型中,所有知识都内化于神经网络的权重之中。当用户询问“巴黎是哪个国家的首都?” 其“记忆+专家”双引擎架构,不仅是对现有技术瓶颈的巧妙破解,更是对未来通用人工智能(AGI)形态的一次深刻探索。
」从神经网络里拆出来的架构实验。 二、Engram 在做什么?一句话:该查的,别算“Engram” 是神经科学中的术语,意为 记忆痕迹。在这篇论文里,它被实现为一个可扩展、可学习、可条件触发的记忆模块。 可以这样理解:模块在干什么Engram快速回忆“我以前见过什么”MoE / Transformer认真思考“现在该怎么推理”在架构上,Engram 被放在较早的层级,用于模式重构与事实补全; 而深层网络 但 DeepSeek 做的,是把它们重新放回现代 LLM 架构的正确位置。五、V4 会用吗?没人官宣,但信号已经很明显DeepSeek 并没有说 Engram 会直接进入 V4。 如果说 V2 / V3 的关键词是 MoE 扩展效率, 那么 Engram 暗示的,是下一阶段的主题:记忆与推理的结构性分离。
2)关键不是“记得更多”,而是“让前几层不再做无聊体力活” Engram 最惊艳的地方,在于它对性能提升的解释: 很多模型的早期层在干“静态模式重建”(背诵型工作),Engram 把这些模式交给查表,等于释放了有效深度 2)软件生态:RAG 不会死,但会被“内查表”重构位置 传统 RAG:外部向量检索→拼 prompt→模型再推理。 结果就是: 高频、模板化、可结构化的知识:走 Engram/lookup 低频、长文本、强语义推理:继续走 RAG + 主干推理 这会让企业知识系统的架构重新洗牌:从“全靠 RAG”走向“记忆层 + 检索层 预测 2:小模型主干 + 巨记忆外挂,会成为私有化主流形态 企业将更愿意买“聪明但不大”的主干,把“公司知识”放进可更新的记忆层,而不是反复微调大模型。 这就是 Engram 的长期主义: 它没有用更贵的算力去压缩问题,而是用更朴素的结构把问题拆开——让“计算”去做计算,让“记忆”去做记忆。
3.2Engram(条件记忆)模块:根治“幻觉魔咒”这是DeepSeek团队于2026年初提出的革命性创新,旨在解决大模型“记不住硬核知识”的根本问题。 工作流程:在推理时,模型首先通过其神经网络进行动态推理,同时并行地查询Engram记忆库。如果查询命中,就直接使用精确的事实;如果未命中,则依赖神经网络的泛化能力。 一种新的稀疏维度:Engram被视为继MoE之后,大模型稀疏化的“新轴心”,为模型轻量化和持续学习提供了新路径。Engram的技术细节与创新Engram模块的设计灵感来源于人类大脑的记忆机制。 研究发现,MoE与Engram之间存在一条“U形scalinglaw”,意味着未来需要在计算与静态记忆之间找到最优资源配比。这个思路可能成为稀疏架构的下一条主流路线。 它通过将MoE的规模、Engram的记忆、mHC的稳定、DSA的效率四者有机结合,成功构建了一个既能“装得下”海量知识,又能“跑得快”且“用得起”的新一代大模型。
在人工智能领域,尤其是基于大语言模型(LLM)的智能体(Agent)系统中,记忆机制是实现持续、连贯和个性化交互的核心基石。记忆系统模拟了人类的认知结构,通常划分为短期记忆和长期记忆。 第一章:短期记忆——智能体的工作记忆与意识流1.1定义与本质短期记忆是智能体用于处理当前任务或单次会话的临时信息存储区。 注意力机制:短期记忆的有效性依赖于Transformer架构的核心——注意力机制。 检索长期记忆:系统将当前查询与短期记忆的上下文结合,作为“检索键”,在长期记忆库中进行向量相似性搜索,找出相关记忆。 结论与展望短期记忆和长期记忆是构成智能体认知架构的两大支柱。
V4的三大技术突破,分别针对当前大模型面临的三大核心挑战:幻觉魔咒(HallucinationCurse):事实性错误频发→Engram条件记忆。 2.2Engram的设计哲学:为大模型装上“海马体”Engram模块的设计灵感直接来源于人类大脑的海马体(Hippocampus),后者负责快速、精准地检索长期记忆中的事实性知识。 Engram旨在为大模型提供一个独立的、外部的、可即时访问的“活字典”,实现条件记忆(ConditionalMemory)。 整体架构:这三大技术共同支撑起了V4的“双轴稀疏架构”——Engram代表“记忆”轴的稀疏(只检索相关知识),MoE代表“计算”轴的稀疏(只激活相关专家),而DSA则是让这两者能在超长上下文中高效协同的 结论DeepSeek-V4的三大技术突破——Engram条件记忆、mHC流形约束超连接和DSA稀疏注意力——共同构成了一场深刻的架构革命。
(V32)作为不同的模型架构出现 关键技术突破 统一回归512标准维度:优化了模型的核心参数配置 首创"值向量位置感知":在注意力机制上的重要创新 引入Engram机制:条件记忆通过可扩展查找实现,解决 Transformer缺乏原生查表记忆的缺陷 DSA(DeepSeek Sparse Attention)机制:实现显存效率与推理精度的双重跨越 内存优化技术 代码差异主要体现在: KV缓存布局优化 稀疏性处理改进 FP8解码优化 技术架构对比 特性 MODEL1 V3.2 架构类型 全新架构 现有架构 硬件支持 SM90 + SM100 主要SM90 核心创新 值向量位置感知 + Engram 传统MLA 内存优化 FP8 + 稀疏处理 标准优化 性能优势 MODEL1通过引入Engram机制,实现了: O(1)查表取向量:让模型直接获取知识而非逐层计算 条件记忆机制:将20-25%参数用于记忆存储,效果最佳 显存效率提升:显著降低内存占用 推理精度优化:在保持高性能的同时提升准确性 发布计划 据消息透露,DeepSeek计划在2月中旬春节前后发布下一代旗舰模型,MODEL1很可能就是这次发布的核心产品。
窗口只是表象,真正藏在更新里的,是mHC流形约束与Engram条件记忆两项底层架构落地。” 业内猜测,这次模型的更新,应该把之前论文提到的两项核心底层技术:mHC(流形约束超连接)与 Engram (条件记忆模块)也应用在新模型上了,只是没有公布出来。 03 — 条件记忆模块(Engram) 核心定义: Engram 是 DeepSeek 提出的“条件记忆”技术,核心目标是为大模型植入类似人类的“深层速记能力”。 2、N-gram 哈希嵌入: 使用 N-gram 切片和多头哈希映射技术,将短语存储到可扩展的静态记忆表中,实现 O(1) 的秒级检索。 Engram 关注的是“如何让模型想得更省力”,通过记忆检索解决算力浪费和显存限制。
再举个例子,我们比较 Mistral 和 Llama 模型的好坏之时,到底是他们的模型架构不同导致的区别,还是他们训练数据的制备不同导致的? 同时,作者使用不同大小和架构的 LLM 在人工合成数据上进行训练,并给出数学定理,来精确计算训练好的模型从数据中学到了多少比特的知识。 作者重点研究了基于 GPT2、LlaMA、Mistral 的语言模型架构,其中 GPT2 采用了更新的 Rotary Position Embedding (RoPE) 技术。 如果训练时间充足,作者发现,不论使用何种模型架构,GPT2 或 LlaMA/Mistral,模型的存储效率均可以达到 2bit/param—— 即平均每个模型参数可以存储 2 比特的信息。 作者通过在 LlaMA 模型上进行架构调整,将模型与 GPT2 的每个差异进行增减,最终发现是 GatedMLP 导致了这 30% 的损失。
V4并非简单的参数堆砌,而是通过一场深刻的架构革命——双轴稀疏架构,从根本上重构了大模型的“记忆”与“计算”范式。 知识与推理混淆:传统Transformer架构将“记忆”(存储事实知识)和“计算”(进行逻辑推理)混杂在同一套参数中。模型被迫用昂贵的计算过程去“模拟”对静态知识的检索,效率低下且极易出错。 这构成了其双轴稀疏架构的核心:第一轴:MoE-条件计算:负责动态的、复杂的逻辑推理和创造性任务。第二轴:Engram-条件记忆:负责高效、精准地存储和检索静态的、确定性的事实知识。 3.1Engram条件记忆模块:打造大模型的“活字典外挂”3.1.1设计动机传统模型将所有知识都编码在神经网络的权重中。 通过将“记忆”与“计算”分离,V4巧妙地绕开了传统架构的根本性缺陷,在降低成本的同时,反而提升了模型的准确性和可靠性,特别是有效遏制了长期困扰行业的“幻觉”问题。
从 N-gram 到 Over-Encoding,再到 Engram,优化「记忆范式」 与模型的信息骨架并行的,是关于模型如何「记忆」的探索。 DeepSeek 的 Engram 模块,正是在 Over-Encoding 等工作的基础上,将「静态记忆增强」升级为了「动态条件记忆」。 Engram 的核心观点是,大模型的工作负载可以分为两部分: 1. 组合推理:需要消耗算力,由 MoE 等「条件计算」模块负责。 2. 2. DeepSeek 通过实验发现了「计算」与「记忆」资源分配的 U 型定律:无论是纯粹的计算(100% MoE)还是纯粹的记忆(100% Engram),都非最优解。
作为继 R1 推理模型之后的又一里程碑,DeepSeek-V4 通过架构级创新,试图打破算力瓶颈,在更低成本下实现性能跃迁。 核心技术突破:从计算密集转向“记忆”优化DeepSeek-V4 的核心创新在于其革命性的 Engram(条件存储)架构。该技术将大模型的“静态知识记忆”与“动态逻辑计算”进行了有效分离。 Engram 架构允许模型将庞大的知识索引表存储在成本更低的 CPU 系统内存(DRAM) 甚至 NVMe SSD 中,仅在需要时进行高效检索。 实验表明,Engram 能精准识别如“亚历山大大帝”或“四大发明”等固化语言模式,减轻 Transformer 主干的负担,为万亿级参数规模的平价扩展铺平了道路。 通过利用空闲网卡资源分摊 KV-Cache 加载压力,新系统的在线服务吞吐量有望提升近 2 倍。
记忆架构的结合,构建高效的多模态记忆系统。 通过这种多模态记忆架构,显著提升AI系统的知识管理和推理能力。 目录 1. 本节为你提供的核心技术价值 2. 传统记忆系统的局限性 3. Multimodal Memory系统的核心优势 4. 核心技术架构 4.1 系统架构 4.2 核心组件 5. 2. 增强推理能力:基于记忆结构支持复杂推理 高效更新机制:支持记忆的动态更新和维护 多模态融合:实现不同模态信息的有效融合 12.2 建议 技术选型:根据应用场景选择合适的记忆组件和工具 架构设计:根据业务需求设计合理的记忆架构
我们假设海马体存储记忆大脑架构为r,而这个r有可能受到自心脏频率和大脑架构的量子纠缠的作用[25]。 只有角应变 ,第2层记忆架构就是 ,因为湍流扩散第n层记忆架构 ,对数螺旋线n-1阶导数就是记忆印记形状近似,只是记忆印记的图像质量进行了压缩,取w<1就是记忆传输到上游脑区逐渐减弱,w就是突触连接和范围权重 下游第一皮层的记忆架构是 ,那上游第n皮层的记忆架构可能近似是 的n-1阶导数。 给出了记忆印记的公式并进行了n阶求导。 of the derivation of memory engram. 2. 研究基于湍流给出了记忆从下游脑区向上游脑区流动可能是架构变化率的传递,并且下游第一皮层的记忆架构是 ,那上游第n皮层的记忆架构可能近似是 的n-1阶导数,我们的记忆可能是二维对数螺旋线,这样 的n
1月21日,环球网援引ITPro报道称,DeepSeek计划于2月中旬农历新年期间推出这款旗舰模型。 ●代码层面: 与此同时,代码层面也给出了呼应。 焦点二:核心技术——全新架构+记忆模块,多方拆解代码细节 ● 技术层面:的猜测最为密集,核心围绕“MODEL1”架构与Engram记忆模块两大方向,均源自开发者对开源代码和论文的拆解分析。 FlashMLA作为DeepSeek独创工具,针对英伟达硬件做了深度优化,可在架构层面减少内存占用、提升计算效率。 ● 记忆模块:Engram记忆模块则因1月13日曝光的论文引发热议。 ● 成本方面:Engram模块带来的降本效果成为核心话题。 同时,“查算分离”架构让80%静态数据存储于内存,文本模型综合调用成本或下降40%-50%。
真正值得深挖的是它在底层架构上动了三处手术:流形约束超连接(mHC)、Engram印迹条件记忆、DualPath推理加速。 技术创新解决的核心问题作用阶段mHC流形约束超连接MoE超深网络训练不稳定训练阶段Engram印迹条件记忆长上下文中信息检索效率低架构层面DualPath推理框架KV-CacheIO瓶颈,推理成本高推理阶段下面我逐一展开 三、Engram印迹条件记忆:让模型学会"翻字典"3.1长上下文处理的真实困境100万token的上下文窗口,这个数字听起来很震撼。 3.2Engram的设计哲学DeepSeek的Engram架构灵感来自神经科学中的"印迹"(Engram)概念——人脑并不是把所有记忆都平等存储的,而是根据信息的关联性建立条件性的检索路径。 这不是简单的"把数字改大"——背后是Engram架构在支撑。没有条件记忆机制,100万token的KV-Cache在当前硬件条件下根本跑不起来。第三,原生多模态的加入。