告别 Item ID:TRM 框架重塑排序模型的 Scaling Law

Farewell to Item IDs: Unlocking the Scaling Potential of Large Ranking Models via Semantic Tokens

2026-01-01
Zhen Zhao, Tong Zhang, Jie Xu, Qingliang Cai, Qile Zhang, Leyuan Yang, Daorui Xiao, Xiaojia Chang
总结
问题
方法
结果
要点
摘要

本文提出了 TRM (Token-based Recommendation Model),一个旨在取代传统 Item ID 的语义 Token 化排序框架。通过引入协同感知的多模态表示、混合 Token 机制(平衡泛化与记忆)以及判别与生成联合优化,TRM 在大型搜索排序任务中实现了 AUC +0.85% 的提升,并减少了 33% 的稀疏存储开销。

TL;DR

在推荐系统和搜索排序领域,Item ID 就像是模型的“身份标签”,但这一标签正成为阻碍模型规模化(Scaling)的桎梏。本文介绍的 TRM (Token-based Recommendation Model) 框架,提出了一套完整的“去 ID 化”方案。它不仅将存储开销降低了 33%,更在字节跳动的大规模搜索场景中显著提升了用户指标。更重要的是,它向我们展示了:语义 Token 比传统 ID 具有更强的 Scaling 潜力。


1. 痛点:为什么 ID 阻碍了模型的 Scaling?

当前的排序模型(如 DCN-v2, RankMixer)虽然在稠密参数上不断加深加宽,但其底层逻辑仍依赖于庞大的 ID Embedding 表。

  • 知识孤岛:每个 ID 是独立的,新老 ID 之间无法共享特征,这导致模型在处理冷启动和长尾内容时表现拙劣。
  • 分布不稳:随着流量和内容的快速迭代,ID 空间极度不稳定。研究发现,随着模型参数增大,ID 嵌入的范数方差(Norm Variance)剧烈波动,这会破坏稠密网络(Tower)的梯度学习效率。

ID 与语义 Token 的稳定性对比 图 1:语义 Token 在模型规模增加时展现出比 Item ID 更好的分布稳定性


2. 核心技术:TRM 的“三板斧”

为了彻底解决语义 Token 的局限性(如记忆力不足),TRM 提出了三项核心改进方案:

2.1 协同感知的多模态表示

单纯基于内容语义(如标题、视觉分析)的 Token 往往忽略了用户的行为意图。TRM 采用两阶段训练:

  1. 多模态对齐:使用 MLLM 生成视频描述,注入领域语义。
  2. 行为对齐:通过对比学习,将 Query-Item 和 Item-Item 的点击协同信号注入 Embedding,确保生成的 Token 既懂“内容”又懂“人”。

2.2 混合 Token 化 (Hybrid Tokenization):平衡博弈

普通的语义 Token(基于 RQ-Kmeans)虽然泛化性好,但容易丢失“细粒度特征”,导致模型“记不住”高效的老视频。

  • Gen-tokens (泛化):保留粗粒度的语义结构。
  • Mem-tokens (记忆):使用 BPE (Byte Pair Encoding) 算法提取高频的 Token 组合,赋予模型对特定特征组合的深度记忆能力。

TRM 架构图 图 2:TRM 整体框架,包含多模态对齐、混合 Token 化及联合训练流

2.3 生成式辅助任务

TRM 不仅仅做分类预测(CTR),还引入了 NTP (Next Token Prediction)。通过预测下一个语义 Token,模型被逼迫去学习 Token 序列背后的层级结构信息,这大大增强了长尾内容的表征鲁棒性。


3. 实验结果:Scaling Law 的胜利

TRM 在字节跳动真实数据上的测试结果令人振奋:

  • 更陡峭的 Scaling 曲线:如图 4 所示,随着稠密参数(Dense Params)增加,TRM 的精度提升斜率显著高于传统的 ID 模型。
  • 存储效率:稀疏存储空间大幅压缩 33%,为部署超大规模模型腾出了空间。

实验结果对比 表 1:TRM 与行业 SOTA ID 模型及 Token 模型的性能与效率对比


4. 深度洞察

TRM 的成功揭示了一个深刻的学术直觉:模型的 Scaling 能力不仅取决于“参数量”,更取决于“输入空间(Representation Space)的平滑度”

Item ID 本质上是一个离散、噪声大、无结构的集合,其有效维度 极高,导致 Scaling Law 的指数 较低。而语义 Token 通过量化(Quantization)将 Item 投影到一个低维、平滑且具备结构化的流形(Manifold)上,从而显著提升了神经网络的逼近效率。

总结

TRM 的工作证明了,通过引入语义 Token 代替符号 ID,我们不仅能解决冷启动问题,更能在 Scaling 竞赛中获得更大的领先优势。未来的大规模排序系统,或许将彻底摆脱对 ID Embedding 表的依赖,步入全 Token 化的新时代。

发现相似论文

试试这些示例

  • 查找最近一年关于去 ID 化推荐系统 (ID-free Recommendation) 且在工业级规模部署的最新研究成果。
  • 哪篇论文最早探讨了 Scaling Law 在推荐模型中的表现,TRM 提出的语义 Token 模型是如何在数学层面改变 Scaling 指数 Beta 的?
  • 探索在大模型检索增强 (RAG) 或多模态推荐中,利用 BPE 算法融合多模态语义与行为特征的其他应用案例。
目录
告别 Item ID:TRM 框架重塑排序模型的 Scaling Law
1. TL;DR
2. 1. 痛点:为什么 ID 阻碍了模型的 Scaling?
3. 2. 核心技术:TRM 的“三板斧”
3.1. 2.1 协同感知的多模态表示
3.2. 2.2 混合 Token 化 (Hybrid Tokenization):平衡博弈
3.3. 2.3 生成式辅助任务
4. 3. 实验结果:Scaling Law 的胜利
5. 4. 深度洞察
6. 总结