研究论文

使用 Mandol 消除碎片化内存:一个开源…

核心结论:本文介绍了中国科学院软件研究所与合著者提出的开源Agent记忆系统Mandol,旨在解决大语言模型(LLM)智能体在长期、多任务协作中面临的记忆碎片化和跨库查询延迟高的问题。传统系统依赖向量数据库、图数据库和关系型数据库的异构组合,导致信息表示割裂、检索噪声大且不稳定。Mandol的核心创新在于通过凝聚式的内存原生架构,将异构存储坍缩为统一设计。其三大关键技术包括:1) 层次化记忆模型,通过基础记忆层和高阶抽象记忆层并建立双向链接,确保推理可追溯至原始对话;2) 内存原生语义数据结构SemanticMap和SemanticGraph,融合键值存储、向量索引和图遍历,提供原子混合检索算子,消除跨库通信开销;3) 智能量化检索,在不调用大模型的情况下,通过自适应路由和内部量化在限定Token预算内生成高质量上下文。在LoCoMo和LongMemEval基准评测中,Mandol使用GPT-4.1-mini和GPT-4o-mini分别取得92.21%和88.40%的最高准确率。使用Qwen3-Embedding-0.6B等轻量级后端时,性能仍超越大模型基线,且Token消耗降低17.4%-20.0%。性能方面,在NVIDIA H800服务器上,平均检索延迟仅82.2ms,插入延迟39.7ms,比最快基线快约5倍。在消费级NVIDIA RTX 5090笔记本上也实现了低延迟,总处理时间降至竞争系统的1/4至1/10,展示了强大的边缘部署能力。

核心要点
  1. LLM Agent记忆系统面临信息碎片化、跨数据库查询开销大和被动式检索质量不稳定的问题。
  2. Mandol由中国科学院软件研究所和合作者提出,是一个凝聚式的、内存原生的层次化Agent记忆系统。
  3. 核心架构包括基础记忆层和高阶抽象记忆层,通过双向链接确保推理可追溯到原始对话证据。
  4. 通过内存原生语义数据结构,Mandol用统一的SemanticMap和SemanticGraph替代了异构数据库组合。
  5. 智能量化检索通过自适应路由和内部量化去噪,在不依赖大模型下生成紧凑且高质量的检索上下文。
  6. 在LoCoMo和LongMemEval基准上,Mandol以92.21%和88.40%的准确率领先开源记忆系统,且Token消耗降低了17.4%–20.0%。
  7. 在NVIDIA H800服务器和RTX 5090消费级笔记本上,Mandol的检索和插入延迟均远低于基线系统,展现了强大的边缘部署潜力。
建不建议在一线部署FDE的工程师和架构师密切关注这篇文章?当然建议。尽管它打着学术论文的旗号,但Mandol解决的问题十分接地气:多数据库带来的记忆碎片化和查询延迟。这篇文章的核心贡献在于用一个统一的、原生的内存架构替代了向量库+图库+关系库的“大杂烩”,并在消费级GPU上验证了低延迟的边缘部署潜力。它为长期对话、个性化推荐等需要可靠Agent记忆的场景,提供了一个低时延、可溯源的新范式,实战参考价值颇高。

LLM Agent记忆系统面临信息碎片化、跨数据库查询开销大和被动式检索质量不稳定的问题。

—— 络石智能编辑部 · 编辑推荐

使用 Mandol 消除碎片化内存:一个开源…

问题陈述

LLM 智能体正在从单轮问答扩展到长期、多任务协作,涉及智能客服、个人助手和医疗支持等领域。它们的记忆模块必须存储跨会话、多类型的信息,并以低延迟和可追溯的证据回答复杂查询。现有的记忆系统依赖于向量数据库、图数据库和关系存储的异构组合,导致表示碎片化、跨数据库查询开销高,以及嘈杂的 RAG 式被动相似性匹配,浪费 token 预算并产生不稳定的检索质量。

Mandol 概述

中国科学院软件研究所及其合作者提出了 Mandol,一种凝聚式、记忆原生、层次化的智能体记忆系统。核心思想是将碎片化的记忆表示和异构存储统一为一种内存内架构。

论文:"Mandol: An Agglomerative Agent Memory System for Long‑Term Conversations" (arXiv:2606.29778)。项目仓库:https://github.com/AgentCombo/Mandol

三个核心设计

1. 层次化记忆模型

Mandol 将记忆组织成两层:

基础记忆层:以记忆单元(包含原始信息和语义向量)、记忆空间(提供逻辑隔离)和显式关系(时间、引用、状态更新)以及隐式语义关系存储原始交互数据,形成一个统一的结构化语义图。

高阶抽象记忆层:大模型从基础层自动提取事件链、实体关系图和偏好演化链,创建抽象知识,同时保留指向原始单元的链接。

两层之间的双向链接确保任何抽象推理都可以追溯到原始对话证据。

示例:简短话语“在巷子里订了一间小屋”成为一个带有时间和空间上下文的事件节点,链接到其他旅行事件(例如“航班延误”、“参观了故宫”),并隐式连接到先前的意图“计划在王府井订酒店”。一个状态更新边记录了从“王府井酒店”到“巷子里的小屋”的偏好转移,从而实现精确检索。

2. 记忆原生语义数据结构

为了消除跨数据库延迟,Mandol 引入了一种基于语义数据结构的统一内存内存储架构,包括 SemanticMap 和 SemanticGraph:

SemanticMap 将键值存储与向量索引相结合,通过记忆空间标签支持多模态记忆单元和上下文感知隔离。

SemanticGraph 直接在图中管理显式边,并使用 SemanticMap 中的向量索引按需解析隐式语义边,避免了所有可能语义链接的预枚举。

原子混合检索操作符统一了单元、空间、关系和多跳查询,将向量匹配和图遍历封装为高效的内存内执行单元。活跃记忆层异步地将冷数据或长期数据分页到嵌入的 DuckDB 后端。

3. 智能量化检索

Mandol 将检索重新定义为“在有限的 token 预算内构建高质量的上下文”,并实现了一个无需大模型参与的量化检索管道:

自适应路由根据查询特征分配 token 预算,并从相关的高阶和基础记忆源中并行召回。

内部量化对每个源进行去噪,并解决跨源冲突,去除噪声和冗余。

最终上下文被压缩以满足 token 预算,同时保持相关性和多样性。

这个过程在受控的 token 消耗下产生密集的证据上下文。

实验评估

Mandol 在两个长对话记忆基准 LoCoMo 和 LongMemEval 上进行了评估,使用 GPT‑4.1‑mini 作为答案生成器,GPT‑4o‑mini 作为评估器。

总体准确率:LoCoMo 上 92.21%,LongMemEval 上 88.40%,在代表性的开源记忆系统中最高。

对于复杂查询类型,如多跳推理、时间推理和知识更新,Mandol 显示出明显优势。

使用更轻量的检索后端(Qwen3‑Embedding‑0.6B 和 bge‑reranker‑v2‑m3)仍然优于更大的模型基线,同时将 token 消耗降低了 17.4%–20.0%。

在配备 NVIDIA H800 GPU 的服务器上,负载(10 QPS)下的性能:

平均检索延迟:82.2 毫秒(≈比最快的基线快 5.4 倍)。

平均插入延迟:39.7 毫秒(≈比最快的基线快 4.8 倍)。

在消费级笔记本电脑(NVIDIA RTX 5090)上,延迟仍然低于现有系统,显示出强大的边缘部署潜力。内存使用适中,消除外部数据库通信使总处理时间降低到竞争系统的 1/4.2–1/9.9。

结论

Mandol 的三项创新——层次化记忆建模、记忆原生统一存储和智能量化检索——为需要可靠长期记忆的智能体提供了高精度、低延迟和轻量级部署。开源发布使研究人员和工程师能够复现、实验并扩展该系统,用于对话、推荐或陪伴智能体。

Written by Machine Heart

标签

相关主题

专家点评

本文由编辑团队收录整理,内容来源于公开信息,仅供参考。

常见问题

Mandol 是如何解决LLM Agent中记忆碎片化和跨库查询延迟高的问题的?
Mandol 提出了三大核心创新来解决这一问题:一是层次化记忆模型,将原始交互数据与自动提取的抽象知识分层存储,并通过双向链接实现跨层溯源;二是内存原生统一存储架构,通过SemanticMap和SemanticGraph将键值存储、向量索引和图遍历融合为统一的混合检索算子,消除了跨数据库通信开销;三是智能量化检索,根据查询自适应分配Token预算并进行去噪和压缩,确保在有限预算内生成高质量证据上下文。
Mandol 在实验评测中的准确率和延迟表现具体如何?
在长对话记忆基准测试中,Mandol 的整体准确率达到了 LoCoMo 的 92.21% 和 LongMemEval 的 88.40%,均领先于其他开源记忆系统。在性能方面,NVIDIA H800服务器上的平均检索延迟为82.2毫秒,比最快基线快约5.4倍;插入延迟为39.7毫秒,快约4.8倍。即使在消费级的NVIDIA RTX 5090笔记本上,其延迟也显著低于现有系统,总处理时间仅为同类系统的四分之一到十分之一。
Mandol 是否适合在边缘设备或消费级硬件上进行私有化部署?
Mandol 的设计特别考虑了轻量化部署。实验显示,它在消费级笔记本(NVIDIA RTX 5090)上的检索和插入延迟均低于现有基线系统,且内存使用量保持适中。重要的是,通过消除对外部数据库的依赖和通信,其端到端处理时间缩减至竞争系统的几分之一,这表明它具备在资源受限的边缘或客户端设备上私有部署的潜力。

相关文章

前線部署工程師 FDE 是什麼?AWS、OpenAI、Anthropic 為何掀起 AI 搶人大戰

前線部署工程師(Forward Deployed Engineer,FDE)是直接与客户合作、将AI模型、数据与既有工作流程整合为可正式运行系统的工程职位。随着企业从关注模型能力转向要求AI投资产生报酬,FDE迅速成为AI产业争抢的人才。高阶猎头公司Christian & Timbers研究显示,美国企业对FDE的需求预计在2026年底前增长2100%,计划聘用FDE的公司比例从年初的5-10%升至第二季末的70%;全美约1.7万名FDE中,同时具备产业知识、企业沟通能力和应用AI经验、能持续创造投资报酬的顶尖人才仅约2000人。为抢占部署能力,AWS投入10亿美元成立全球前線部署工程组织,派遣数千名工程师进驻客户现场开发代理式AI系统;OpenAI于5月成立OpenAI Deployment Company,并通过收购AI顾问公司Tomoro直接获得约150名部署人才;Anthropic则与Blackstone、Hellman & Friedman、Goldman Sachs合作成立企业AI服务公司,瞄准缺乏内部AI团队的中型企业。FDE的价值体现在缩短作业时间、提高产品采用率、加快AI项目从原型到正式环境的速度,但未来AI代理可能逐步接手部分开发部署工作,人才稀缺的竞争格局正重塑AI公司的商业前景。

阅读全文

前沿部署工程师是AI重塑的辅助轮

本文深入分析了前沿部署工程师(FDE)如何从 Palantir 推广的模式演变为 AI 行业突破企业增长瓶颈的关键角色,被比喻为 AI 转型的‘训练轮’。文章核心指出,自 2025 年 12 月德勤命名该实践后,行业迎来投资高潮:Anthropic 斥资 15 亿美元与 Blackstone 等成立 Ode 公司,OpenAI 投入 40 亿美元成立 Deployment Company,亚马逊 AWS 在 6 月 30 日承诺投入 10 亿美元组建 FDE 组织,微软紧随其后斥资 25 亿美元成立拥有 6000 人的 Frontier Company,Google Cloud 也投入 7.5 亿美元。这些资金全部指向组织就绪度而非模型性能。FDE 的三大转变是:工作风险从客户侧转向供应商侧,重点从按需求文档配置软件转向编码企业的隐性决策逻辑(如 AWS 的知识图谱建设),以及将前线洞察反馈至产品路线图。市场正分化为平台商(追求粘性)、模型商(追求效果)和服务集成商(追求规模)三层生态。但文章强调,FDE 的未来在于企业将其内化为自有的、对业务结果负责的跨职能永久团队,并以 Uber 内部部署 30 名工程师使财务报告时间从 2 天降至 10 分钟的案例证明其长期价值,预示这将成为未来十年企业 AI 能力的定义性特征。

阅读全文

什么是前向部署工程师?科技界最热门的新职位及如何准备

2026 年,前线部署工程师(Forward Deployed Engineer, FDE)被公认为科技界增长最快、薪酬最高的岗位之一。这一概念由大数据分析公司 Palantir 首创,指直接嵌入客户现场、从代码编写到系统架构全链路负责的复合型高级软件工程师。文章指出,2026 年 6 月,亚马逊云 AWS 宣布重大投资 10 亿美元组建专门 FDE 组织;紧随其后,微软在 7 月 2 日成立 Microsoft Frontier Company,砸下 25 亿美元扩充约 6000 名专家派驻客户,用于 AI 系统的联合设计与持续优化。硅谷风向标 a16z 发表报告称 FDE 是初创企业最热门的职位,认为愿意投入重服务实施工作是 AI 公司建立长期“护城河”的关键。文章深入对比了 FDE 与解决方案工程师的区别,并引用了 OpenAI 工程师亲赴农场服务农业巨头 John Deere、优化 Realtime API 的实例。此外,文章援引了 MIT 2025 研究,指出约 95% 的企业 AI 试点因数据孤岛问题而失败,这正是 FDE 弥合技术鸿沟的价值所在。在薪酬方面,美国劳工统计局数据显示相关计算机科学家薪酬中位数达 14.5 万美元,FDE 因直接贴近营收端而通常享有更高浮薪。文章还重点结合伊利诺伊理工的教育模式,详述成为 FDE 所必需的 AI 工程、全栈开发、快速原型构建等硬实力,以及共情、商业意识和系统思维等软技能。

阅读全文

什么是前部署工程师?

前线部署工程师(FDE)是一种嵌入客户或操作环境的软件工程师,负责从工作流范围确定、代码构建、系统集成、部署到稳定移交的全过程,并对生产环境结果拥有直接所有权,而非仅提供咨询。文章引用 Alvarez & Marsal 2026 年报告,指出每月 FDE 职位发布量从 2020 年 9 月的不足 10 个增至 2025 年 9 月的近 50 个,反映了企业在 AI 采纳中从模型访问转向实际部署的需求。文章详细区分了 FDE 与软件工程师、解决方案架构师的差异:FDE 在客户环境中构建并维护系统,成功标准是客户工作流改善和可移交性,而非仅满足内部规格。2026 年 FDE 基本工资中位数约 18 万美元(范围 13.5 万至 21.5 万美元),85% 的职位包含股权。核心技能涵盖工程基础、客户现场执行、集成部署判断以及 AI 时代的安全与治理纪律。文章提供了完整的招聘方法,包括定义部署环境、筛选交付证明、实践任务设计以及 19 个面试问题,并介绍了 GoGloby 如何通过嵌入资深 AI 解决方案架构师、安装 Agentic SDLC 和 AI 开发智能层,帮助成熟软件公司安全采用 AI 并完成生产级部署。FDE 角色源于 Palantir,现已被 OpenAI、Google、AWS 等主流企业采纳,其增长的根源在于弥合生成式 AI 巨额投资与 95% 组织未获回报之间的执行差距。

阅读全文

AI工程师 vs 前向部署工程师:价值框架

本文为 AI 技术决策者和工程师提供了一个关于 AI 工程师与前线部署工程师的价值判断框架。文章指出,当前企业 AI 的核心挑战已从技术新颖性转向交付问题,并援引 Tomasz Tunguz 的数据:过去 12 个月,OpenAI、Microsoft、Anthropic 等公司已投入 97.5 亿美元用于 FDE 项目,但 MIT 的“GenAI 鸿沟”报告显示,95% 的企业 GenAI 试点未能产生可衡量的 P&L 影响。文章核心论述了两种角色的不同价值逻辑:AI 工程师通过构建模型、数据管道和推理基础设施等可复用能力,创造长期平台价值,但容易在真空中建设;FDE 则嵌入客户环境,端到端负责部署落地,解决 AI 在真实组织中的存活问题,但若缺乏产品化反馈闭环,极易沦为高成本定制化咨询。Netguru 的 NewGlobe 案例展示了理想 FDE 模式可将教师指南创建时间从 4 小时降至 45 秒。Perspective AI 和 And Vijay Says 的分析进一步强调了将 FDE 激励机制从“利用率”转向“产品化”的关键性。最终,文章提出决策框架:瓶颈在构建时选 AI 工程师,瓶颈在部署时选 FDE;最优解是两者顺序协作,FDE 发现一线问题,AI 工程师将其转化为平台能力。

阅读全文