[Tencent 2026] HY-WU:释放参数潜力,开启“功能性内存”适配新范式
HY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image Editing
本文提出了 HY-WU(Weight Unleashing),一种基于功能性内存(Functional Memory)的插件化神经架构,用于实现基础模型的大规模在线适配。该方法通过一个参数生成器(Neural Network Transformer)根据实例条件动态合成 LoRA 权重,在文本引导的图像编辑任务中实现了 SOTA 性能,超越了 GPT-4o(Image) 和 FLUX.2 等强力基线。
TL;DR
腾讯 HY 团队近日发布了 HY-WU (Weight Unleashing)。它不再强求模型通过一组固定的、死板的共享权重来满足所有用户,而是引入了一个高效的“参数生成器”。每当你输入一个新的编辑指令,它都能“临场发挥”,现写一组专门针对该指令的 LoRA 参数。这种从“静态点存储”到“动态流形映射”的转变,让图像编辑的准确度与一致性大幅超越了 GPT-4o 和 FLUX 等顶级模型。
痛点深挖:为什么共享权重注定会发生“折衷”?
在适配(Adaptation)领域,我们习惯了学习一个固定的 。但作者指出,这在数学上是一个可行性危机。
- 冲突(Conflict):比如“让照片变老”和“照片修复”是两个相反的物理过程。在一个共享参数点上同时优化这两个目标,模型只能找个折中点,导致两头都做不好。
- 过拟合(Over-specialization):如果为每个任务训练独立 Adapter,内存会爆炸,且任务间无法迁移。
HY-WU 的直觉是:既然模型基座(Backbone)已经具备了丰富的知识,我们不应该去重写它,而是应该根据输入条件 动态生成一个算子 。
核心方法:如何优雅地生成十几亿个参数?
直接生成庞大的权重矩阵在计算上是不可能的。HY-WU 提出了 Neural Network Transformer (NNT),通过三个精巧的设计解决了扩展性问题:
-
Rank-anchored 2D Tokenization: 由于 LoRA 的秩 是固定的,作者将不同层、不同形状的参数矩阵统一以 为锚点切分成 Token。这种设计保留了参数的结构局部性(Architectural Locality)。
-
因子化注意力机制 (Factorized Attention): 为了处理超长的参数序列,NNT 分别在“层内(Intra-layer)”和“层间(Inter-layer)”进行注意力计算,大大降低了显存压力。
-
在线端到端训练: 不同于以往需要搜集大量微调好的 Checkpoints 跑蒸馏的方法,HY-WU 直接通过下游编辑的 Denoising Loss 进行训练。
图 1:HY-WU 整体管线:提取图像-指令特征,送入 NNT 生成参数 Token,最后注入冻结的基座模型。
实验战绩:不只是“又一个训练 LoRA 的方法”
在多轮“压力测试”中,HY-WU 展示了惊人的柔性。
- 人类偏好:在 GSB 测试中,对比目前开源最强的模型(如 Qwen, FLUX.2),HY-WU 的胜率基本在 70% 以上。
- 结构保真度:通过动态生成权重,模型能精准区分“哪里该改,哪里不该动”,在保持原图身份(Identity)和结构(Structure)上显著优于静态方法。
图 2:HY-WU 与各大主流闭源、开源模型的 GSB 人类胜率对比。
深度洞察:参数空间里长出了“语义”
最令人兴奋的发现是:生成的参数空间本身是具备语义结构的(图 10)。 作者对生成的 LoRA 权重进行 t-SNE 降维发现,相似的任务(如“物体移除”、“风格转换”)在参数空间里会自动聚在一起。这证明了 HY-WU 学习到的不是杂乱无章的扰动,而是一个结构化的更新流形(Update Manifold)。
图 3:参数空间的涌现结构:语义相似的编辑任务在生成的参数流形上自然聚类。
总结与启示
HY-WU(第一部分)成功证明了:适配本质上是一个路由问题。
- 价值:它为 Meta-learning 和 Continual Learning 提供了一个极其高效的工程路径。
- 局限性:目前主要验证了图像编辑任务,未来在 Agent 长期记忆、跨模态个性化领域仍需进一步探索。
这篇论文告诉我们,别再卷“如何寻找那组完美的静态权重”了,去卷“如何更好地路由参数”吧。
