研究论文

使用 Mandol 消除碎片化内存:一个开源…

www.besthub.dev··由 络石智能 收录整理

核心结论:本文介绍了中国科学院软件研究所与合著者提出的开源Agent记忆系统Mandol,旨在解决大语言模型(LLM)智能体在长期、多任务协作中面临的记忆碎片化和跨库查询延迟高的问题。传统系统依赖向量数据库、图数据库和关系型数据库的异构组合,导致信息表示割裂、检索噪声大且不稳定。Mandol的核心创新在于通过凝聚式的内存原生架构,将异构存储坍缩为统一设计。其三大关键技术包括:1) 层次化记忆模型,通过基础记忆层和高阶抽象记忆层并建立双向链接,确保推理可追溯至原始对话;2) 内存原生语义数据结构SemanticMap和SemanticGraph,融合键值存储、向量索引和图遍历,提供原子混合检索算子,消除跨库通信开销;3) 智能量化检索,在不调用大模型的情况下,通过自适应路由和内部量化在限定Token预算内生成高质量上下文。在LoCoMo和LongMemEval基准评测中,Mandol使用GPT-4.1-mini和GPT-4o-mini分别取得92.21%和88.40%的最高准确率。使用Qwen3-Embedding-0.6B等轻量级后端时,性能仍超越大模型基线,且Token消耗降低17.4%-20.0%。性能方面,在NVIDIA H800服务器上,平均检索延迟仅82.2ms,插入延迟39.7ms,比最快基线快约5倍。在消费级NVIDIA RTX 5090笔记本上也实现了低延迟,总处理时间降至竞争系统的1/4至1/10,展示了强大的边缘部署能力。

核心要点
  1. LLM Agent记忆系统面临信息碎片化、跨数据库查询开销大和被动式检索质量不稳定的问题。
  2. Mandol由中国科学院软件研究所和合作者提出,是一个凝聚式的、内存原生的层次化Agent记忆系统。
  3. 核心架构包括基础记忆层和高阶抽象记忆层,通过双向链接确保推理可追溯到原始对话证据。
  4. 通过内存原生语义数据结构,Mandol用统一的SemanticMap和SemanticGraph替代了异构数据库组合。
  5. 智能量化检索通过自适应路由和内部量化去噪,在不依赖大模型下生成紧凑且高质量的检索上下文。
  6. 在LoCoMo和LongMemEval基准上,Mandol以92.21%和88.40%的准确率领先开源记忆系统,且Token消耗降低了17.4%–20.0%。
  7. 在NVIDIA H800服务器和RTX 5090消费级笔记本上,Mandol的检索和插入延迟均远低于基线系统,展现了强大的边缘部署潜力。
建不建议在一线部署FDE的工程师和架构师密切关注这篇文章?当然建议。尽管它打着学术论文的旗号,但Mandol解决的问题十分接地气:多数据库带来的记忆碎片化和查询延迟。这篇文章的核心贡献在于用一个统一的、原生的内存架构替代了向量库+图库+关系库的“大杂烩”,并在消费级GPU上验证了低延迟的边缘部署潜力。它为长期对话、个性化推荐等需要可靠Agent记忆的场景,提供了一个低时延、可溯源的新范式,实战参考价值颇高。

LLM Agent记忆系统面临信息碎片化、跨数据库查询开销大和被动式检索质量不稳定的问题。

—— 络石智能编辑部 · 编辑推荐

使用 Mandol 消除碎片化内存:一个开源…

问题陈述

LLM 智能体正在从单轮问答扩展到长期、多任务协作,涉及智能客服、个人助手和医疗支持等领域。它们的记忆模块必须存储跨会话、多类型的信息,并以低延迟和可追溯的证据回答复杂查询。现有的记忆系统依赖于向量数据库、图数据库和关系存储的异构组合,导致表示碎片化、跨数据库查询开销高,以及嘈杂的 RAG 式被动相似性匹配,浪费 token 预算并产生不稳定的检索质量。

Mandol 概述

中国科学院软件研究所及其合作者提出了 Mandol,一种凝聚式、记忆原生、层次化的智能体记忆系统。核心思想是将碎片化的记忆表示和异构存储统一为一种内存内架构。

论文:"Mandol: An Agglomerative Agent Memory System for Long‑Term Conversations" (arXiv:2606.29778)。项目仓库:https://github.com/AgentCombo/Mandol

三个核心设计

1. 层次化记忆模型

Mandol 将记忆组织成两层:

基础记忆层:以记忆单元(包含原始信息和语义向量)、记忆空间(提供逻辑隔离)和显式关系(时间、引用、状态更新)以及隐式语义关系存储原始交互数据,形成一个统一的结构化语义图。

高阶抽象记忆层:大模型从基础层自动提取事件链、实体关系图和偏好演化链,创建抽象知识,同时保留指向原始单元的链接。

两层之间的双向链接确保任何抽象推理都可以追溯到原始对话证据。

示例:简短话语“在巷子里订了一间小屋”成为一个带有时间和空间上下文的事件节点,链接到其他旅行事件(例如“航班延误”、“参观了故宫”),并隐式连接到先前的意图“计划在王府井订酒店”。一个状态更新边记录了从“王府井酒店”到“巷子里的小屋”的偏好转移,从而实现精确检索。

2. 记忆原生语义数据结构

为了消除跨数据库延迟,Mandol 引入了一种基于语义数据结构的统一内存内存储架构,包括 SemanticMap 和 SemanticGraph:

SemanticMap 将键值存储与向量索引相结合,通过记忆空间标签支持多模态记忆单元和上下文感知隔离。

SemanticGraph 直接在图中管理显式边,并使用 SemanticMap 中的向量索引按需解析隐式语义边,避免了所有可能语义链接的预枚举。

原子混合检索操作符统一了单元、空间、关系和多跳查询,将向量匹配和图遍历封装为高效的内存内执行单元。活跃记忆层异步地将冷数据或长期数据分页到嵌入的 DuckDB 后端。

3. 智能量化检索

Mandol 将检索重新定义为“在有限的 token 预算内构建高质量的上下文”,并实现了一个无需大模型参与的量化检索管道:

自适应路由根据查询特征分配 token 预算,并从相关的高阶和基础记忆源中并行召回。

内部量化对每个源进行去噪,并解决跨源冲突,去除噪声和冗余。

最终上下文被压缩以满足 token 预算,同时保持相关性和多样性。

这个过程在受控的 token 消耗下产生密集的证据上下文。

实验评估

Mandol 在两个长对话记忆基准 LoCoMo 和 LongMemEval 上进行了评估,使用 GPT‑4.1‑mini 作为答案生成器,GPT‑4o‑mini 作为评估器。

总体准确率:LoCoMo 上 92.21%,LongMemEval 上 88.40%,在代表性的开源记忆系统中最高。

对于复杂查询类型,如多跳推理、时间推理和知识更新,Mandol 显示出明显优势。

使用更轻量的检索后端(Qwen3‑Embedding‑0.6B 和 bge‑reranker‑v2‑m3)仍然优于更大的模型基线,同时将 token 消耗降低了 17.4%–20.0%。

在配备 NVIDIA H800 GPU 的服务器上,负载(10 QPS)下的性能:

平均检索延迟:82.2 毫秒(≈比最快的基线快 5.4 倍)。

平均插入延迟:39.7 毫秒(≈比最快的基线快 4.8 倍)。

在消费级笔记本电脑(NVIDIA RTX 5090)上,延迟仍然低于现有系统,显示出强大的边缘部署潜力。内存使用适中,消除外部数据库通信使总处理时间降低到竞争系统的 1/4.2–1/9.9。

结论

Mandol 的三项创新——层次化记忆建模、记忆原生统一存储和智能量化检索——为需要可靠长期记忆的智能体提供了高精度、低延迟和轻量级部署。开源发布使研究人员和工程师能够复现、实验并扩展该系统,用于对话、推荐或陪伴智能体。

Written by Machine Heart

来源归因
由 络石智能 收录整理原文来源:www.besthub.dev发布于

标签

相关主题

专家点评

本文由编辑团队收录整理,内容来源于公开信息,仅供参考。

常见问题

Mandol 是如何解决LLM Agent中记忆碎片化和跨库查询延迟高的问题的?
Mandol 提出了三大核心创新来解决这一问题:一是层次化记忆模型,将原始交互数据与自动提取的抽象知识分层存储,并通过双向链接实现跨层溯源;二是内存原生统一存储架构,通过SemanticMap和SemanticGraph将键值存储、向量索引和图遍历融合为统一的混合检索算子,消除了跨数据库通信开销;三是智能量化检索,根据查询自适应分配Token预算并进行去噪和压缩,确保在有限预算内生成高质量证据上下文。
Mandol 在实验评测中的准确率和延迟表现具体如何?
在长对话记忆基准测试中,Mandol 的整体准确率达到了 LoCoMo 的 92.21% 和 LongMemEval 的 88.40%,均领先于其他开源记忆系统。在性能方面,NVIDIA H800服务器上的平均检索延迟为82.2毫秒,比最快基线快约5.4倍;插入延迟为39.7毫秒,快约4.8倍。即使在消费级的NVIDIA RTX 5090笔记本上,其延迟也显著低于现有系统,总处理时间仅为同类系统的四分之一到十分之一。
Mandol 是否适合在边缘设备或消费级硬件上进行私有化部署?
Mandol 的设计特别考虑了轻量化部署。实验显示,它在消费级笔记本(NVIDIA RTX 5090)上的检索和插入延迟均低于现有基线系统,且内存使用量保持适中。重要的是,通过消除对外部数据库的依赖和通信,其端到端处理时间缩减至竞争系统的几分之一,这表明它具备在资源受限的边缘或客户端设备上私有部署的潜力。

相关文章

www.sapling.com

AI工程师 vs 前向部署工程师:价值框架

本文为 AI 技术决策者和工程师提供了一个关于 AI 工程师与前线部署工程师的价值判断框架。文章指出,当前企业 AI 的核心挑战已从技术新颖性转向交付问题,并援引 Tomasz Tunguz 的数据:过去 12 个月,OpenAI、Microsoft、Anthropic 等公司已投入 97.5 亿美元用于 FDE 项目,但 MIT 的“GenAI 鸿沟”报告显示,95% 的企业 GenAI 试点未能产生可衡量的 P&L 影响。文章核心论述了两种角色的不同价值逻辑:AI 工程师通过构建模型、数据管道和推理基础设施等可复用能力,创造长期平台价值,但容易在真空中建设;FDE 则嵌入客户环境,端到端负责部署落地,解决 AI 在真实组织中的存活问题,但若缺乏产品化反馈闭环,极易沦为高成本定制化咨询。Netguru 的 NewGlobe 案例展示了理想 FDE 模式可将教师指南创建时间从 4 小时降至 45 秒。Perspective AI 和 And Vijay Says 的分析进一步强调了将 FDE 激励机制从“利用率”转向“产品化”的关键性。最终,文章提出决策框架:瓶颈在构建时选 AI 工程师,瓶颈在部署时选 FDE;最优解是两者顺序协作,FDE 发现一线问题,AI 工程师将其转化为平台能力。

www.newsbytesapp.com

前向部署工程师帮助企业在各行业应用AI

2026年,前方部署工程师(FDE)成为科技行业最热门的新角色之一。OpenAI、Palantir、Cognizant等公司正在大规模招募FDE,帮助医院、银行等传统企业将人工智能真正落地。FDE不仅需要扎实的编程能力(Python、API、云平台)和AI技术知识,还必须具备出色的沟通与需求理解能力,为客户构建定制化AI工具并确保其稳定运行。与证书相比,企业更看重实际构建AI产品的经验。顶尖FDE的年薪接近100万美元,这一高薪使得该角色的需求远超硅谷,蔓延至全球各行各业。文章指出,FDE是连接AI技术与真实业务场景的关键桥梁,标志着AI应用从实验走向规模化部署的新阶段。

www.appliedaicourse.com

前锋部署工程师 vs 软件工程师:关键区别、技能与职业指南(2026)

本文详细对比了前线部署工程师与软件工程师在职责、技能要求、工作环境、职业发展路径等方面的核心区别。前线部署工程师由Palantir等公司推广,是一种融合软件开发、客户实施与技术咨询的混合角色,工作重点在于直接与客户合作,在真实生产环境中部署、定制和集成软件解决方案,解决特定客户的业务问题,而软件工程师则侧重于为广泛用户构建可扩展的核心产品功能。两者的工作环境差异显著:前线部署工程师日常面向客户,以项目为导向,技术栈广泛且随客户需求变化;软件工程师主要在内部团队按照敏捷或Scrum方法进行产品研发,技术专精。两者共享编程、调试、系统架构等基础工程技能,且可相互转型。随着企业AI的兴起和复杂解决方案部署需求的增长,前线部署工程师的需求显著上升,其职业路径可通向解决方案架构师、产品经理或技术顾问等方向。文章为读者提供了根据个人兴趣和职业目标选择合适路径的指导。

36kr.com

OpenAI放大招:企业级AI平台Frontier上线,专治各种智能体

OpenAI于2026年2月5日正式推出企业级AI平台Frontier,定位为帮助企业统一构建、部署和管理AI智能体的系统,旨在解决企业AI部署中的“碎片化”和“AI孤岛”问题。Frontier通过连接企业数据仓库、CRM、工单工具等孤立系统,为AI智能体提供共享业务背景、执行环境、记忆与质量优化机制,并内置严格的身份、权限与边界管控,可适用于金融和医疗等受监管领域。平台具有高度开放性,不仅支持OpenAI自建智能体,还兼容来自Google、Microsoft及直接竞争对手Anthropic的第三方智能体,采用开放标准避免供应商锁定。OpenAI应用业务CEO Fidji Simo将智能体视为“AI同事”,预测到2026年底领先企业的大部分数字化工作将由人类指挥的智能体舰队执行。企业业务总经理Barret Zoph指出Frontier创建了“语义层”以打通工作流程。商业层面,OpenAI企业客户约占业务40%,CFO Sarah Friar预计年底接近50%,全球有超过100万家商业客户。平台已面向惠普、Intuit、甲骨文、State Farm、Thermo Fisher和优步等有限客户开放,BBVA、思科和T-Mobile等也在试点。发布前后PayPal、Expedia等软件股大跌,市值蒸发超3000亿美元。OpenAI通过前向部署工程师与客户并肩工作,将实施经验产品化。Frontier的推出标志着AI企业应用从单点工具迈向系统化数字员工管理的新阶段。

jobs-radar.com

Mercura 前端部署工程师 (FDE)

本文是 Mercura 公司(YC W25 批次)发布的 Forward Deployed Engineer (FDE) 招聘信息。Mercura 是一家帮助建筑、医院、学校等实体行业通过 AI 自动化后端流程的初创公司,已实现 200 万美元 ARR,团队 16 人,目标在 2026 年底达到 1000 万美元 ARR 并向美国扩张。该 FDE 岗位的工作地点在德国慕尼黑,要求具备全栈工程能力(Python, React, TypeScript, SQL, API)、企业系统集成经验(如 SAP)、数据分析整理能力以及大模型、智能体和提示工程的实践经验。主要职责包括:负责客户软件部署的全技术落地、AI 模型适配与微调、搭建原型产品、与客户高层和用户日常对接并将客户需求反馈给核心工程团队。公司提供股权、陡峭的学习曲线、由前 Google、Bain、MIT 和哈佛等背景的同事组成的团队,以及由 Nubank AI 高管 Rohan Ramanath 和 Daniel Ribeiro Silva 担任导师的机会。三位联合创始人 Lukas、Stefan 和 Sean 分别具有 Google 数据科学家、Bain 咨询顾问和国际物理奥赛银牌得主等背景。申请流程包括创始人介绍电话、技术作业、技术面试和现场面试。该招聘体现了 AI 初创公司对既懂工程又懂客户的复合型 FDE 人才的高度需求。