身份锚定究竟是什么,为什么它如此重要?
身份锚定意味着模型不仅仅知道“画面里有三个人”——它清楚哪张参考人脸对应哪个人,以及这个人在图像中的位置。没有这一机制,文生图模型常常会生成重复的面孔、把两个身份混成一个人,或者数错人数。2025年的一项研究将这种现象称为“身份危机”,并指出即便是最先进的模型在处理多人场景时也力不从心[2]。身份锚定通过将每个参考身份明确关联到图像中的特定区域或标记来解决这一问题,从而让模型不会混淆它们。
2026年的WithEveryone框架是最清晰的例证:它将每个选中的身份作为“寻址令牌”注入,并在渲染图像之前预测一个结构化的身份布局方案[1]。这一显式的规划步骤使其能够同时处理多达十个参考身份——这一规模此前并不可靠。其关键创新在于一种训练目标,它利用标注的人脸区域直接监督预期身份,从而避免了在多张人脸场景下常常失效的不稳定嵌入人脸匹配方法[1]。
群像画质究竟能提升多少?
最强研究的数据令人鼓舞,但并非奇迹。WithEveryone将人脸相似度从0.462提升至0.499——仅8%的温和增长——但这是在原本相似度就已不错的基准上取得的[1]。更大的收获在于减少复制粘贴伪影:从0.169降至0.055,降幅达67%[1]。这意味着模型远不那么容易重复克隆同一张脸,而这是群体生成中常见的缺陷。此外,它覆盖了97.3%的请求身份,重复率仅为2.8%,因此你更有可能得到每一个你要求的人,且每个人都各不相同[1]。
另一项2025年的研究DisCo则另辟蹊径,采用带多样性约束的强化学习,在专用测试集上实现了98.6%的独脸准确率[2]。就避免重复面孔而言,这已接近完美,但它并不保证身份保真度(即与参考面孔的匹配度)。这两种方法互为补充:WithEveryone侧重于将身份绑定到具体位置,而DisCo则专注于让面孔彼此区分。两者结合表明,未来两年将出现既能保持身份一致性、又能避免“克隆军团”效应的模型。
有什么陷阱吗?有限制吗?
主要问题在于,这些结果来自受控基准测试,而非真实世界的混乱场景。以往的基准测试都是“身份不相交”的,即测试身份在训练期间从未出现过——这虽然是对泛化能力的良好检验,但仍属于精心设计的设置[1]。DisCo的测试集同样是合成的,且不需要真实数据,这在可扩展性方面是个优势,但可能无法涵盖所有真实世界的变化[2]。因此,尽管改进是实实在在的,但未必能完美适用于每个用户的相册。
另一个限制是规模:WithEveryone最多能处理十个身份,但真实的集体照中可能有几十个人。论文没有展示超过十人时的情况,作者也指出,在训练过程中,当人脸数量较多时,身份信息的损失会变得不稳定[1]。UniPortrait是2024年提出的一个框架,也支持多个身份,但其重点在于可编辑性和布局多样性,而非极端规模[3]。因此,在未来两年内,可以期待中小规模群体(最多十人)的可靠生成,但暂时还别指望能完美处理五十人的婚礼合影。
关于这些资料来源
这个回答基于3项研究(均为预印本)——发表于2024年至2026年间,其中3项为2024年或之后发表——这些研究是从3项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的33篇文献。
本文引用的文献
WithEveryone:面向群体图像生成的统一规划与身份锚定
WithEveryone(2026)是一个统一的框架,用于生成包含多达十个参考身份的群组图像,采用寻址令牌和基于布局的身份损失;在一个身份不相交的基准测试中,它将人脸相似度从0.462提升至0.499,并将复制粘贴伪影从0.169降至0.055,覆盖了97.3%的请求身份,重复率为2.8%。
解决文生图生成中的身份危机
DisCo(2025)是一个利用组合奖励来优化身份多样性的强化学习框架;在DiverseHumans测试集上,它实现了98.6%的独特人脸准确率和近乎完美的全局身份分布,在不依赖真实数据的情况下超越了开源和专有模型。
UniPortrait:用于保持身份一致性的单人与多人图像个性化统一框架
UniPortrait(2024)是一个用于单人和多人个性化的统一框架,通过ID嵌入模块和ID路由模块将身份嵌入组合并分配到相应区域;它在单ID和多ID定制中均展现出优越性能,并且与现有的生成式控制工具兼容。
