今天跟大家分享一篇来自中国科学技术大学、香港城市大学、华为诺亚方舟实验室、大连理工大学的论文已被 ICLR 2026 接收。针对传统单粒度记忆建模难以建立跨会话、多层次关联且容易出现关键信息检索不完整与冗余噪声干扰的问题该工作提出一种面向对话智能体长期记忆的多粒度增强框架。它一方面将历史交互组织为会话级、轮次级、摘要级和关键词级等多种记忆粒度并动态建立跨粒度关联另一方面针对不同查询利用基于熵的路由机制自适应选择最合适的记忆粒度从分散、冗长的多会话历史中定位并整合关键信息。相比依赖单一粒度的传统方法MemGAS 能更好地兼顾信息完整性与噪声抑制从而显著提升长期对话场景下的检索与问答性能。论文标题:From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational Agents论文链接:https://openreview.net/pdf?idi2yIvZARnG代码链接:https://github.com/Applied-Machine-Learning-Lab/ICLR2026_MemGAS核心问题大语言模型LLMs近年来被广泛应用于对话智能体Conversational Agents在客服、软件开发、个性化助手等场景中展现了出色的对话能力。然而随着用户与智能体之间的交互日益增多对话历史不断累积LLM 在维护长期对话记忆方面面临严峻挑战上下文窗口有限LLM 的上下文长度受限难以完整保留用户在多个会话中的交互记录和偏好信息导致无法生成连贯且个性化的回复。单一粒度记忆的局限现有基于检索增强的记忆系统大多依赖单一粒度如会话级或轮次级进行记忆分割和检索无法捕捉深层次的记忆关联。这导致两个问题只能检索到部分相关信息遗漏关键上下文检索结果中混入大量无关信息干扰模型推理。〓 图1. 多会话查询示例如上图所示当用户问我总共完成了多少门在线课程时答案分散在两段不同的对话中Conversation 1 中完成了3门 Coursera 课程Conversation 2 中完成了2门 edX 课程。单一粒度检索往往只能找到其中一段对话导致回答不完整。而通过多粒度信息如摘要和关键词建立跨会话的语义连接才能实现完整检索。现有方法的具体不足体现在两个方面多粒度记忆关联不足虽然已有方法尝试用知识图谱或树结构组织记忆但它们主要聚焦于单一粒度层面如实体或会话摘要缺乏跨粒度的交互建模。缺乏自适应粒度选择现有方法依赖固定的粒度策略无法根据不同查询动态选择最优粒度导致信息完整性与噪声之间难以平衡。方法与框架为了解决上述问题我们提出了 MemGASMemory with multi-Granularity Association and Selection一个通过多粒度关联构建和自适应选择来增强长期记忆的框架。MemGAS 包含两个核心阶段〓 图2. 多会话查询示例阶段一多粒度关联构建多粒度记忆元数据生成对于每段会话利用 LLM 生成四种粒度的记忆单元会话级Session-level原始完整对话轮次级Turn-level对话按轮次分割摘要级Summary-levelLLM 生成的会话摘要关键词级Keyword-levelLLM 提取的关键词基于高斯混合模型GMM的动态记忆关联当新记忆加入时将所有粒度的记忆编码为稠密向量计算新记忆与历史记忆之间的成对相似度。通过 GMM 聚类将相似度分为两组接受集Accept Set与新记忆高度相关的历史记忆建立直接关联拒绝集Reject Set无关记忆不建立连接这一过程模拟了人类的记忆巩固机制选择性地强化上下文相关的记忆连接。理论分析Proposition 1表明在合理的分布假设下GMM 的错误关联率以指数速度衰减。阶段二多粒度路由-检索-过滤基于熵的自适应粒度选择对于每个查询计算其与各粒度记忆的相似度分布并通过 Shannon 熵衡量匹配的确定性低熵意味着高置信度查询与该粒度的记忆有明确对应高熵则表示匹配模糊。通过逆熵加权自动为置信度高的粒度分配更大权重无需人工干预基于 PPR 的图检索利用路由权重初始化各粒度节点的相关性分数在多粒度关联图上运行 PPR 算法。PPR 通过图结构传播相关性能够发现那些嵌入相似度较低但上下文高度相关的记忆。LLM 冗余过滤对检索到的 Top-K 记忆进行 LLM 过滤去除无关和重复内容确保最终提供给生成器的上下文精炼且高质量。实验与结果1. 实验设置我们在四个长期记忆基准数据集上进行了全面评估LoCoMo、Long-MT-Bench、LongMemEval-s 和 LongMemEval-m与包括 Full History、MPNet、Contriever、MPC、RecurSum、SeCom、HippoRAG 2、RAPTOR、A-Mem 等在内的多种基线方法进行对比。〓 表5. 数据集统计信息2. 主要结果问答性能MemGAS 在绝大多数数据集和评价指标上均优于所有基线方法。例如在 LongMemEval-s 数据集上MemGAS 的 F1 分数达到 20.38相比最强基线 HippoRAG 2 的 14.73 提升了 38.4%GPT4o-Judge 评分达到 60.20同样领先于所有对比方法。〓 表1. 问答性能对比检索性能MemGAS 在所有数据集上的 Recall 和 NDCG 指标均取得最高分。在 LongMemEval-s 上Recall3 达到78.51NDCG3 达到86.83显著超越其他方法。〓 表2. 检索性能对比3. 消融实验分别去除 GMM、PPR、记忆关联MA和粒度路由器Router后模型性能均出现下降。去除所有模块后F1 从 20.38 降至 13.78Recall3 从 78.51 降至 71.06验证了每个模块的必要性。值得注意的是这些模块引入的额外延迟极小最高仅 0.0191 秒LLM API 调用占据了超过 98% 的端到端延迟。〓 表3. 消融实验结果4. 不同查询类型的对比分析如下图所示MemGAS 在不同查询类型上均表现优异尤其在多会话查询和多跳检索上优势明显。这表明 MemGAS 的记忆关联机制能够有效识别高度相关的会话支持跨会话的知识整合与推理。〓 图3/图5. 不同查询类型的性能对比5. 不同 Top-K 检索的对比如下图随着 Top-K 从 1 增加到 10MemGAS 在 F1 和 RougeL 上始终保持领先。在 LongMemEval-s 上较高的 K 值会引入噪声导致性能下降而 MemGAS 的过滤机制有效缓解了这一问题。〓 图4. 不同 Top-K 检索的性能对比6. 单粒度 vs. 多粒度对比如下表所示多粒度方法在所有数据集上均优于单粒度方法。而 MemGAS 进一步超越了简单的多粒度拼接Combination证明其自适应关联和选择机制的有效性。〓 表6. 单粒度与多粒度性能对比例如在 LongMemEval-s 上MemGASF120.38远超简单拼接F114.59和最佳单粒度Turn-levelF114.94。7. 错误分析如下图所示我们将结果分为检索正确/错误 × 生成正确/错误四类。在 LongMemEval-s 上检索正确生成正确占比达 56.0%。MemGAS 能有效识别语料中无相关信息的情况并主动拒答而非生成幻觉内容提升了系统可信度。〓 图7. 错误分析案例展示我们对比了多种方法在三个典型问题上的表现。MemGAS 能够正确整合分散在不同会话中的信息给出准确答案而基线方法要么只检索到部分信息要么无法定位相关上下文。〓 图13. QA 案例对比贡献总结1. 多粒度关联框架首次在长期对话记忆任务中通过 GMM 聚类构建跨粒度的动态记忆关联模拟人类记忆巩固过程有效连接语义相关的记忆片段。2. 自适应粒度选择提出基于熵的多粒度路由器根据查询自动分配粒度权重在信息完整性与噪声过滤之间取得最优平衡。3. 全面的性能提升在四个长期记忆基准上MemGAS 在问答和检索任务上均显著超越现有 SOTA 方法在不同查询类型、Top-K 设置和生成器/检索器配置下表现出色且计算效率高。更多阅读#投 稿 通 道#让你的文字被更多人看到如何才能让更多的优质内容以更短路径到达读者群体缩短读者寻找优质内容的成本呢答案就是你不认识的人。总有一些你不认识的人知道你想知道的东西。PaperWeekly 或许可以成为一座桥梁促使不同背景、不同方向的学者和学术灵感相互碰撞迸发出更多的可能性。PaperWeekly 鼓励高校实验室或个人在我们的平台上分享各类优质内容可以是最新论文解读也可以是学术热点剖析、科研心得或竞赛经验讲解等。我们的目的只有一个让知识真正流动起来。稿件基本要求• 文章确系个人原创作品未曾在公开渠道发表如为其他平台已发表或待发表的文章请明确标注• 稿件建议以markdown格式撰写文中配图以附件形式发送要求图片清晰无版权问题• PaperWeekly 尊重原作者署名权并将为每篇被采纳的原创首发稿件提供业内具有竞争力稿酬具体依据文章阅读量和文章质量阶梯制结算投稿通道• 投稿邮箱hrpaperweekly.site• 来稿请备注即时联系方式微信以便我们在稿件选用的第一时间联系作者• 您也可以直接添加小编微信pwbot02快速投稿备注姓名-投稿△长按添加PaperWeekly小编现在在「知乎」也能找到我们了进入知乎首页搜索「PaperWeekly」点击「关注」订阅我们的专栏吧·