[arXiv 2026] 频率排序分词:让传统压缩器在 LLM 时代焕发新生

Frequency-Ordered Tokenization for Better Text Compression

总结
问题
方法
结果
要点
摘要

本文提出了一种名为“频率排序分词”(Frequency-Ordered Tokenization)的预处理技术。该方法通过结合 Byte Pair Encoding (BPE) 分词、基于齐普夫定律(Zipf's law)的频率重排序以及变长整数编码(Varint),显著提升了 LZ 系列压缩算法(如 zlib, LZMA, zstd)在自然语言文本上的无损压缩比和推理速度。

TL;DR

在数据量爆炸的今天,如何更快、更小地存储文本?本文提出了一种极简的预处理方案:BPE 分词 + 频率重排 + 变长编码。这一组合不仅让经典压缩算法(如 zlib)的性能提升了 7% 以上,更让昂贵的 zstd-22 压缩速度飙升 3 倍。这不仅是一个模型改进,更是对文本压缩底层逻辑的一次重构。

背景定位:处于经典压缩与神经压缩的桥头堡

目前,文本压缩领域分为两个极端:

  1. 工业级工具:如 gzip, zstd, LZMA。速度快但对语言特性的感知有限。
  2. 神经压缩:如 DeepZip, NNCP。压缩比接近香农极限,但速度慢得无法在生产环境使用。

本文的方法通过一种轻量级的“学术级预处理”,在保持工业级速度的同时,大幅拉近了与尖端压缩器的距离。

痛点深挖:为什么传统压缩器处理文本不够快、不够小?

传统 LZ 系列算法的核心是寻找“滑动窗口”内的重复模式。然而,自然语言的复杂性在于:

  • 形态多变:字符串 "compress", "compression", "compressing" 虽然语义相近,但在字节层面差异极大,LZ 算法难以将其统一处理。
  • 编码冗余:标准的 UTF-8 编码或 BPE ID 并没有根据词频进行优化。一个出现 100 万次的词和出现 1 次的词,在原始 Token 序列中可能占用同样长的空间。

核心方案:频率排序分词 (Methodology)

作者的 Insight 非常直观:既然自然语言遵循齐普夫定律(Zipf's Law),我们就应该让最高频的“符号”占用最少的空间。

算法流程

  1. BPE 分词:使用 OpenAI 的 cl100k_base 等分词器,将文本切分为子词 Token。
  2. 频率排名 (Reordering):统计当前语料中所有 Token 的出现次数,重新分配 ID,将 Rank 1 的 Token 赋予 ID 0。
  3. 变长整数编码 (Varint):使用 LEB128 编码将 ID 转为字节。这样,高频 Token 只占 1 字节(ID 0-127)。

模型总架构与频率转换可视化

图 1:通过频率重排,原本随机分布的 ID 集中到了低数值区间,极大地提高了变长编码的效率。

实验与结果:不仅是更小,而且是更快

作者在 Wikipedia (enwik8) 及代码、多语言语料上进行了测试。实验结果揭示了一个反直觉的现象:预处理不仅缩小了文件,还加速了压缩过程。

实验结果对比表

表 1:在 zstd-22 下,开启预处理后,总耗时(包含 Tokenization 耗时)仅为原始方法的 1/3。

深度洞察:为什么会提速?

通常预处理会增加额外开销。但在此案例中:

  • 输入量减小:预处理后的 Varint 流大小仅为原始文本的约 42%。
  • 匹配难度降低:由于字节集中在 0-127 范围内,LZ 算法的匹配器(Matcher)在查找重复序列时,缓存命中率更高,查找更高效。

不同算法的获益程度

  • zlib (提升 7.08 pp):效果最明显,因为 zlib 本身缺乏对复杂频率分布的建模能力。
  • PPMd (负提升):统计型压缩器由于内置了上下文概率模型,预处理反而破坏了其优化的天然上下文。

压缩率随文件大小变化图 图 2:该方法在各种尺度下都展现了稳健的提升,特别是在处理较小文件时,弥补了压缩器“冷启动”时统计信息不足的缺陷。

局限性与挑战 (Limitations)

  1. 字典开销:由于进行了词频率重排,解压时需要对应的映射表。虽然文中有优化方案,但对于极小文件的单文件压缩不具优势。
  2. 解压延迟:目前 Python 实现的变长编码解码较慢(~5s),需要 C++ 等底层语言重构以适配实时流处理。
  3. 非流式处理:频率重排需要先通读全文,这限制了它在某些单次通扫描(Single-pass)流式场景的应用。

总结与启示 (Takeaway)

这项研究最迷人的地方在于其简洁性。作者仅用不到 50 行代码,就通过“让常用字段更短”这一古老的物理直觉,在统治了几十年的压缩领域找到了新的突破口。对于从事数据存储、LLM 训练语料清洗、以及边缘计算的工程师来说,这是一个极具实操价值的“工程黑科技”。

未来的压缩,可能不再是算法之间的孤立竞争,而是语言模型理解能力与传统编码效率的深度融合。

发现相似论文

试试这些示例

  • 查找最近其他结合大型语言模型(LLM)分词器(如 WordPiece 或 SentencePiece)与传统无损压缩算法的研究。
  • 哪篇论文最早探讨了齐普夫定律(Zipf's Law)在数据压缩编码中的数学理论界限,本文是如何应用这些理论的?
  • 有哪些研究探讨了将频率排序或变长编码预处理应用于日志文件、代码库或结构化 JSON 数据的压缩效果?
目录
[arXiv 2026] 频率排序分词:让传统压缩器在 LLM 时代焕发新生
1. TL;DR
2. 背景定位:处于经典压缩与神经压缩的桥头堡
3. 痛点深挖:为什么传统压缩器处理文本不够快、不够小?
4. 核心方案:频率排序分词 (Methodology)
4.1. 算法流程
5. 实验与结果:不仅是更小,而且是更快
5.1. 深度洞察:为什么会提速?
5.2. 不同算法的获益程度
6. 局限性与挑战 (Limitations)
7. 总结与启示 (Takeaway)