RecGPT-V3 Technical Report
arXiv · HuggingFace · ▲19
摘要(原文)
Large language models (LLMs) are transforming recommender systems from matching co-occurrence patterns in historical behavior toward reasoning about the intent that drives it. RecGPT-V1 pioneered this paradigm on Taobao by centering user understanding, and RecGPT-V2 scaled it via coordinated multi-agent reasoning; both are deployed in production with consistent gains in user experience and commercial outcomes. However, operating RecGPT at scale reveals three challenges: (1) stateless behavior modeling, where each request reprocesses full user history, wasting computation and discarding prior analysis; (2) a tag-to-item information bottleneck, where natural-language tags form a lossy channel between user understanding and item grounding; and (3) inefficient explicit reasoning, whose lengthy chain-of-thought incurs untenable latency and compute overhead. We present RecGPT-V3, a stateful, hybrid-modal recommender that reasons over natural language for open-world knowledge and Semantic IDs (SIDs) for concrete item grounding. A Memory Hub maintains structured, continually evolving user memory that distills long-horizon behavior into condensed units, cutting user-modeling computation by 55.8%. A Hybrid-modal Foundation Model allows the LLM jointly reason over text tags and SIDs, opening a high-bandwidth channel into the item space. Latent Intent Reasoning internalizes verbose rationales into compact learnable latent tokens that remain decodable into readable explanations, lowering output token cost by 200x. Deployed in Taobao's "Guess What You Like" feed, RecGPT-V3 achieves consistent gains in large-scale online A/B tests: IPV +1.28%, CTR +1.00%, TC +1.97%, GMV +3.97%, while cutting end-to-end serving resource consumption by 52.4%.
摘要(中译)
大型语言模型(LLMs)正在将推荐系统从匹配历史行为中的共现模式转变为对驱动它的意图进行推理。RecGPT - V1通过在淘宝上以用户理解为核心开创了这种范式,RecGPT - V2通过协调的多智能体推理对其进行了扩展;两者都已投入生产,并且在用户体验和商业成果方面都有持续的提升。然而,在大规模运行RecGPT时揭示了三个挑战:(1)无状态行为建模,其中每个请求都重新处理完整的用户历史,浪费计算资源并丢弃先前的分析;(2)标签到项目的信息瓶颈,其中自然语言标签在用户理解和项目定位之间形成了一个有损通道;(3)低效的显式推理,其冗长的思维链会导致不可接受的延迟和计算开销。 我们提出了RecGPT - V3,这是一种有状态的、混合模式的推荐器,它针对自然语言进行开放世界知识的推理,并针对语义ID(SIDs)进行具体项目的定位。记忆中心维护一个结构化的、不断演变的用户记忆,该记忆将长周期行为提炼成浓缩单元,将用户建模的计算量减少了55.8%。混合模式基础模型允许大型语言模型同时对文本标签和SIDs进行推理,从而打开了进入项目空间的高带宽通道。潜在意图推理将冗长的理由内化为紧凑的可学习的潜在标记,这些标记仍然可以解码为可读的解释,将输出标记成本降低了200倍。RecGPT - V3部署在淘宝的“猜你喜欢”推送中,在大规模在线A/B测试中取得了持续的收益:IPV + 1.28%,CTR + 1.00%,TC + 1.97%,GMV + 3.97%,同时将端到端服务资源消耗减少了52.4%。
背景剖析
背景剖析
1. 技术背景与真实需求
推荐系统是电商、内容平台等互联网服务的核心引擎,其目标是理解用户需求并精准匹配商品或信息。传统方法依赖历史行为数据中的统计规律(如协同过滤、序列模型),通过预测“下一个可能点击的物品”来驱动推荐。然而,这种“相关性匹配”存在根本局限:它无法理解用户行为背后的真实意图(例如,用户购买羽毛球拍可能是因为“运动需求”而非单纯“历史购买记录”)。随着用户对个性化体验的要求提升,推荐系统需要从“机械匹配”转向“意图推理”——不仅要预测行为,更要理解行为背后的动机(如兴趣、需求、场景),从而提供更符合长期偏好的服务。
2. 先前方法的瓶颈
尽管大语言模型(LLM)为意图推理提供了新可能,但现有LLM-based推荐系统仍面临三大挑战:
- 无状态行为建模:每次请求都重新处理完整用户历史,导致计算冗余且无法积累长期认知(例如,用户半年前的兴趣被重复分析,而近期行为未被优先考虑)。
- 标签到物品的信息瓶颈:LLM通过自然语言标签(如“羽毛球拍”)推断意图,但标签与具体物品之间存在语义鸿沟(例如,“羽毛球拍”可能对应成千上万种商品,无法精准匹配用户需求)。
- 低效的显式推理:LLM生成长链推理(Chain-of-Thought)以解释意图,但冗长的文本推理导致高延迟和高计算成本,难以支撑大规模实时服务。
3. 本文的解决方案
RecGPT-V3针对上述问题提出三方面创新:
- 记忆增强用户建模:引入“记忆中枢”(Memory Hub),将用户长期行为压缩为结构化记忆单元(如“运动爱好者”“近期关注摄影”),避免重复计算,同时保留关键上下文。
- 混合模态推理:结合自然语言(表达开放意图)和语义ID(SIDs,编码物品语义),让LLM直接基于物品的语义特征推理,消除标签与物品间的信息损失。
- 潜在意图推理:将冗长的推理过程压缩为紧凑的“潜在token”,既降低计算成本(减少200倍token量),又保留可解释性(按需还原为人类可读的推理链)。
4. 与前人工作的关键差异
RecGPT-V3的核心突破在于从“无状态、单模态、显式推理”转向“有状态、混合模态、潜在推理”:
- 与RecGPT-V1/V2相比,它不再逐次处理完整历史,而是通过记忆中枢累积用户认知;
- 与纯文本推理的LLM系统相比,它引入语义ID作为第二模态,实现意图与物品的精准映射;
- 与传统的显式长链推理相比,它通过潜在token平衡效率与可解释性,首次在工业级推荐系统中实现低成本的高质量推理。
这一设计使RecGPT-V3在淘宝“猜你喜欢”场景中同时提升用户体验(如点击率+1.00%)和商业价值(如GMV+3.97%),并显著降低计算资源消耗(-52.4%),标志着LLM从实验室走向工业级推荐系统的关键一步。








