[ICML 2025] 1MB 载荷定义一个数据集?PLADA 开启无像素通信的新范式
A Dataset is Worth 1 MB
本文提出了 Pseudo-Labels as Data (PLADA),一种针对超低带宽环境的分类任务传输方法。该方法不再传输原始图像像素,而是利用客户端预存的大规模无标签引用数据集(如 ImageNet-21K),仅传输针对该数据集的精选伪标签,实现了在 1MB 以内的载荷下完成高质量模型训练。
TL;DR
在传统的深度学习分发模式中,我们要么传数 GB 的原始图片,要么传数百 MB 的模型权重。本文提出的 PLADA (Pseudo-Labels as Data) 彻底颠覆了这一逻辑:既然图像像素太占空间,我们干脆一个像素都不传。通过在客户端预留一个超大的无标签“百科全书”(引用数据集),分发者只需发送一份不到 1 MB 的“书签索引+伪标签”,就能让客户端练出一个高性能的特定任务模型。
背景定位:这是对全链路数据集蒸馏(Dataset Distillation)的一次降维打击。它将学术界的“合成像素”思路转向了工程界更可行的“标签分发”思路。
痛点与动机:为什么“像素”是通信的敌人?
在深海潜航器、泰坦星探测器或者边缘物联网设备中,带宽往往只有几 kbps。传输一个 1GB 的 ImageNet 变体可能需要数月之久。
- 数据集蒸馏的局限:目前的 Dataset Distillation 虽然能压缩数据,但生成的“合成像素”是全精度的浮动点,压缩率遇到瓶颈,且计算开销极大,难以扩展到 ImageNet-21K 这种规模。
- 异构硬件的挑战:直接传模型(Model Serving)看似快,但客户端硬件五花八门,有的跑 PyTorch,有的跑 JAX,甚至是自研芯片,固定的权重无法适配。
作者的直觉(Insight):对于分类任务,标签蕴含的判别性信息远比像素本身重要。如果我们能共享一个“基础素材库”,那么任务的本质就变成了“如何从素材库里挑出对的图片并贴上对的标签”。
方法论详解:PLADA 的三板斧
PLADA 的流程高度精炼,分为三步:
1. 伪标签生成 (Labeling)
服务端首先在目标任务(Target Task)上训练一个强大的 Teacher 模型(如 ConvNeXt-V2)。然后用这个模型去给本地和客户端都预存好的“引用数据集”(Reference Dataset,如 ImageNet-21K)打分,生成 Hard Pseudo-Labels。
2. 语义剪枝与能量评分 (Pruning)
并不是所有引用集里的图片都有用。如果任务是“分类鸟类”,ImageNet 里的“汽车”图片就是噪声。 作者引入了 Energy-based Score 来评估样本的确定性: 只有能量值最低(即 Teacher 模型最笃定)的 Top 样本会被保留。

3. Safety-Net:防止类别塌陷
由于某些类别天然“难学”,简单的全局筛选会导致这些难类别的样本被全部滤掉。作者设计了 Safety-Net 机制,预留一部分带宽配额给各类别,利用幂律分布确保即使是长尾类别也能在训练集中有“一席之地”。
实验结果:以小搏大的胜利
1. 极低带宽下的霸榜
实验对比了 PLADA 与传统的随机采样(Random Subset)和核心集选择(Coreset Selection)。结果显示,在载荷限制在 1MB 以内时,传统方法因为只能传几十张图,准确率呈断崖式下跌;而 PLADA 因为只需传标签,可以有效利用数万张引用图,准确率依然坚挺。

2. 引用集的“去噪”奇迹
一个有趣的观察是:训练 100% 的引用集往往不如训练精选后的 10% 效果好。这证明了基于能量的剪枝不仅压缩了带宽,还起到了一种语义去噪的作用,剔除了那些模棱两可、容易误导 Student 模型的样本。
3. 医学影像的“逆向驱动” (OOD Stress Test)
当目标任务是医学影像(与 ImageNet 差异巨大)时,作者发现了一个“能量悖论”:此时应该选择能量最高(最不确定)的样本,因为这些异常样本可能包含了互补的低级纹理特征,反而能帮助模型理解医学组织结构。

深度洞察与总结
核心贡献 (Takeaway)
PLADA 提供了一套极具工程启发性的方案:在带宽受限的未来,**“存储换带宽”**将成为主流。只要终端设备存储足够大(预装数十GB的 ImageNet-21K),我们就能以近乎拨号上网的速度,下发成百上千个定制化的 AI 能力。
局限性与未来展望
- 存储冗余:客户端必须预留空间给引用数据集,这在手机端尚可,但在超微型传感器上仍有压力。
- 任务局限:目前仅验证了分类任务。对于回归(Regression)和生成(Generative)任务,由于输出空间不再是离散的类别 ID,如何高效压缩“标签强度”将是下一个战场。
这篇论文向我们展示了:有些时候,不传数据,反而是最高效的数据通信。
