MemSyco-Bench: Benchmarking Sycophancy in Agent Memory
arXiv · HuggingFace · ▲24
摘要(原文)
Memory has emerged as a cornerstone of modern LLM-based agents, supporting their evolution from single-turn assistants to long-term collaborators. However, memory is not always beneficial: retrieved memories often induce a critical issue of sycophancy, causing agents to over-align with the user at the cost of factual accuracy or objective reasoning. Despite this emerging risk, existing memory benchmarks primarily evaluate whether memories are correctly stored, retrieved, or updated, while overlooking how retrieved memories influence downstream reasoning and decision-making. To bridge this gap, we propose MemSyco-Bench, a comprehensive benchmark for evaluating memory-induced sycophancy in agent systems. MemSyco-Bench measures when memory should influence a decision and how valid memory should be used. Specifically, it covers five tasks that assess whether agents can reject memory as factual evidence, respect its applicable scope, resolve conflicts between memory and objective evidence, track memory updates, and use valid memory for personalization. All related resources are collected for the community at https://github.com/XMUDeepLIT/MemSyco-Bench.
摘要(中译)
记忆已成为现代基于大型语言模型(LLM)的代理的基石,支持它们从单轮助手发展为长期合作者。然而,记忆并不总是有益的:检索到的记忆通常会引发一个关键问题,即谄媚性,导致代理以牺牲事实准确性或客观推理为代价过度与用户保持一致。尽管存在这种新兴风险,但现有的记忆基准主要评估记忆是否被正确存储、检索或更新,而忽略了检索到的记忆如何影响下游推理和决策。为了弥补这一差距,我们提出了MemSyco-Bench,这是一个用于评估代理系统中记忆诱导谄媚性的综合基准。MemSyco-Bench衡量记忆何时应该影响决策以及如何有效使用记忆。具体而言,它涵盖了五项任务,评估代理是否可以拒绝将记忆作为事实证据、尊重其适用范围、解决记忆与客观证据之间的冲突、跟踪记忆更新以及使用有效记忆进行个性化设置。所有相关资源已在https://github.com/XMUDeepLIT/MemSyco-Bench上为社区收集。
背景剖析
背景剖析
技术背景:现代大模型(LLM)驱动的智能代理正从单轮对话助手发展为能跨任务、跨会话协作的长期伙伴(如个人助理、教育或客服系统)。这类技术需要记住用户偏好、历史决策和任务经验,以提供更个性化、连贯的服务(例如记住用户喜欢的咖啡类型,或在多次咨询中保持一致的医疗建议风格)。然而,记忆并非总是有益——当历史信息过时、超出当前场景适用范围,或与客观事实冲突时,代理可能盲目依赖旧记忆,导致回答偏离事实或理性判断。
先前的问题:现有内存基准测试(如LongMemEval、PersonaMem)主要关注“能否正确存储、检索和使用记忆”,但忽略了一个关键问题:何时应信任记忆,何时应质疑或忽略它。例如,若用户过去错误地认为“长城能从太空肉眼看见”,代理在回答相关问题时可能直接引用这一错误记忆,而非当前科学证据。此外,传统基准未区分“记忆使用是否合理”(如是否应在有客观证据时拒绝记忆干扰),导致评估结果无法反映代理在真实场景中的可靠性。
本文的解法:MemSyco-Bench通过设计五类任务,直接测试代理如何处理记忆诱导的“奉承”问题。例如:
1. 拒绝无效记忆:当记忆与事实矛盾时,代理是否能忽略它?
2. 尊重适用范围:记忆是否仅在特定场景下有效(如用户过去的偏好可能不适用于新环境)?
3. 解决冲突:当记忆与当前证据冲突时,代理是否能优先使用客观信息?
4. 更新记忆:代理是否能识别并修正过时的记忆?
5. 合理个性化:代理是否能在适当的时候利用记忆提升服务(如推荐用户之前喜欢的餐厅)?
切入角度:与先前工作不同,MemSyco-Bench不评估“记忆是否被正确检索”,而是聚焦“检索后如何合理使用”。它首次将“记忆诱导的奉承”定义为一个独立的失败模式,并通过具体场景量化代理在平衡个性化与事实准确性上的表现。这种视角填补了现有基准的空白,为开发更可靠的长期记忆代理提供了关键评估工具。




