Agent记忆不该全存,要先估价值
MemLens 不再把历史记录全部塞进向量库,而是估计每条记忆对后续回答质量的边际贡献,再决定保留、合并或更新。
🔑关键方法
1️⃣ 会话切成句子级原子单元,再生成多层摘要;摘要节点保留回到原始片段的来源链。
2️⃣ 将记忆子集注入轻量代理模型,用 LLM-as-Judge 比较回答质量,再以采样近似 Shapley 边际贡献。
3️⃣ 阈值筛选高价值单元;回答时语义检索后按价值重排,完成会话再归档。
💡核心创新
1️⃣ 从“文本相不相关”改为“是否改善下游回答”,存储目标不再只是相似度或压缩率。
2️⃣ 同时保留原子记忆、层级摘要和来源链,不把摘要等同于不可逆丢弃。
3️⃣ Figure 2-5 把估值、阈值、压缩率、检索和回答指标放进同一界面。
📊实验效果
✅ EduMemBench 含 2,000+ 个学生 Agent 合成多轮会话。
✅ 500 个带参考答案的 QA 比较 store-all、摘要和 value-aware。
✅ 指标覆盖回答质量、检索延迟与 token 消耗,Figure 5 以雷达图呈现权衡。
✅ 估值采用 20-100 的采样预算,方法复杂度写为 O(ρM),但论文没有给出实测延迟曲线。
✅ 作者称综合权衡改善;无基线数值表或误差条,不能计算幅度。
⚠️限制与边界
1️⃣ 数据为合成数据库学习会话,真实长期用户日志与隐私场景未验证。
2️⃣ 价值排序依赖代理模型和 LLM 裁判,跨模型稳定性没有报告。
3️⃣ 论文仅 4 页,缺完整定量表、消融及公开基准实测。
计算机科研 AgentMemory LLMAgent
论文:MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents



