LightMem-Ego: Your AI Memory for Everyday Life
arXiv · HuggingFace · ▲47
摘要(原文)
Personal AI assistants on mobile and wearable devices continuously perceive users' daily lives through visual and audio streams. However, answering queries about past experiences requires lightweight multimodal memory that can continuously accumulate, organize, and retrieve long-term experiences, which remains challenging. To address this challenge, we present LightMem-Ego, a lightweight streaming multimodal memory system for everyday-life assistance. The system continuously captures egocentric visual and audio streams, aligns them on a shared timeline, and organizes them into a hierarchical memory consisting of current, short-term, and long-term memory. Given a user query, LightMem-Ego dynamically routes retrieval to the appropriate memory level and generates answers grounded in multimodal evidence. The demonstration can be deployed on smartphones and AI glasses, supporting object finding, conversation recall, life summarization, routine discovery, and personalized assistance. Code is available at https://github.com/zjunlp/LightMem-Ego.
摘要(中译)
移动和可穿戴设备上的个人人工智能助手通过视觉和音频流持续感知用户的日常生活。然而,回答有关过去经历的问题需要一种轻量级的多模态记忆,它能够持续积累、组织和检索长期经历,这仍然是一个挑战。为应对这一挑战,我们提出了LightMem - Ego,这是一个用于日常生活辅助的轻量级流式多模态记忆系统。该系统持续捕获以自我为中心的视觉和音频流,在共享时间线上对齐它们,并将它们组织成一个由当前记忆、短期记忆和长期记忆组成的分层记忆。给定用户查询,LightMem - Ego会动态地将检索路由到合适的内存级别,并基于多模态证据生成答案。该演示可以部署在智能手机和智能眼镜上,支持物体查找、对话回忆、生活总结、日常发现和个性化辅助。代码可在https://github.com/zjunlp/LightMem - Ego获取。
背景剖析
随着智能手机和智能眼镜等可穿戴设备的普及,个人AI助手正逐渐成为我们日常生活中不可或缺的一部分。这些设备能够持续捕捉用户的视觉和音频信息,为AI助手提供了丰富的日常经验数据。然而,现有的AI助手在处理与用户过去经验相关的问题时仍面临挑战。
技术背景方面,这类技术主要应用于日常生活中的个人记忆辅助。例如,帮助用户找到丢失的物品、回忆最近的对话、总结每日活动以及分析长期习惯和例行公事。这些功能可以显著提高用户的生活质量和效率。
之前的问题主要集中在三个方面:首先,日常经验以连续的视觉-音频流形式出现,没有明确的事件边界,这使得AI助手难以将这些原始观察转化为连贯的事件级经验。其次,如何将不断积累的经验有效地组织成当前、短期、情景和语义记忆,同时保持长期部署的效率,也是一个难题。最后,用户查询通常跨越多个时间范围,需要跨不同记忆级别进行动态路由,而不是依赖于单一的上下文窗口或平面检索存储。
为了解决这些问题,本文提出了LightMem-Ego系统。该系统通过将轻量级的智能手机或智能眼镜客户端与后端连接起来,接收以自我为中心的视觉-音频流,将最近的观察划分为事件,并将其组织成三级记忆层次结构:当前记忆用于正在进行的上下文,短期记忆用于最近的微事件,长期记忆用于整合的事件和语义事实。在回答问题时,记忆路由器根据查询的时间范围和意图选择证据,使系统能够在统一的界面中提供关于现在、最近过去和长期例行公事的可靠回答。
与前人工作的关键差异在于,LightMem-Ego采用了流式多模态记忆系统的方法,能够持续捕获、组织、检索和推理日常生活经验。这使得系统能够更好地适应用户的实际需求,并在各种任务中提供更准确和高效的帮助。




