[Blockchain & AI] Covenant-72B:打破中心化霸权,在不可信互联网上训练 720 亿参数大模型
Covenant-72B: Pre-Training a 72B LLM with Trustless Peers Over-the-Internet
本文介绍了 Covenant-72B,这是目前规模最大的基于全球分布式、无许可(Permissionless)互联网环境预训练的 72B 大语言模型。该模型利用 SparseLoCo 优化器和基于区块链的 Gauntlet 激励机制,在约 1.1T token 上完成了训练,其性能足以媲美在中心化集群训练的同类模型(如 LLaMA-2-70B)。
TL;DR
长期以来,训练 70B 级别的大模型被认为是只有科技巨头才能玩的“烧钱游戏”,因为它需要昂贵的 InfiniBand 高带宽网络。Covenant-72B 的出现粉碎了这一固有认知。它是首个在**去中心化、无许可(Permissionless)**的互联网环境下,利用全球志愿者/矿工算力训练出的 72B 稠密模型。它不仅训练成了,而且在多个 benchmark 上硬刚 LLaMA-2-70B,证明了“互联网即超级计算机”的时代已经到来。
1. 痛点:被垄断的算力与“白名单”
目前大多数分布式训练(如 PrimeIntellect 的工作)虽然跨越了区域,但依然依赖于白名单节点——即你必须信任对方不会作弊、不会注入坏数据。此外,标准的分布式训练在普通宽带上会被通信吞吐量“拖死”。
Covenant AI 团队面临的问题是:如何在全世界任何人都能随时加入或退出的不可信网络中,用低配的互联网带宽,完整训练出一个 72B 的庞然大物?
2. 核心武器:SparseLoCo + Gauntlet
架构解析
模型采用了类似 LLaMA-3 的结构(GQA、RoPE 等),但真正的魔法在于它的优化层。
- SparseLoCo (超高效通信优化器): 传统的梯度同步需要传输完整的权重更新,而 SparseLoCo 实现了超过 146 倍 的压缩率。它通过块状(Chunk-wise)的 Top-k 稀疏化和 2-bit 量化,只保留最重要的伪梯度更新。剩下的“误差”会保存在本地的 Error-feedback 缓冲区中,在下一轮补偿。
- Gauntlet (基于区块链的信任防线): 在无许可网络中,如何防止节点“出工不出力”?Gauntlet 引入了 LossScore。校验器会抽取一小部分数据,对比节点更新前后的模型 Loss。如果不降反升,或者在未分配任务的数据上表现异常,节点将被直接扣除奖励。
图1:Covenant-72B 的并行协议。每个节点内部使用 FSDP 节省显存,节点间则通过高度压缩的梯度进行全聚合。
3. 实验战绩:去中心化的力量
Covenant-72B 在 1.1T token 上进行了预训练。结果令人振奋:
- ARC-Challenge: 56.8(超过了 LLM360 K2 的 53.8)。
- MMLU: 67.1(与 LLaMA-2-70B 的 65.6 旗鼓相当)。
- 计算利用率: 在 500 Mb/s 的平民带宽下,计算时间占比高达 94.5%,几乎没有被节点间的同步锁死。
图2:相比于 whitelisted(白名单)训练的 INTELLECT-1,Covenant-72B 规模更大、性能更强,且实现了真正的开放参与。
4. 动态性的挑战 (Participation Dynamics)
去中心化网络最怕“闪退”。实验记录显示,虽然由于激励机制的调节,活跃节点在 20 个左右波动(平均 16.9 个),但模型训练表现出极强的鲁棒性。这归功于算法对参与者加入/离开的平滑处理能力。
图3:训练过程中贡献节点的动态变化曲线。
5. 深度洞察与总结
Covenant-72B 不仅仅是一个模型,它是一个证明系统:
- 通信不再是瓶颈:146x 的压缩证明了即便在 100Mbps 的上行带宽下,也能跑 70B 分布式训练。
- 经济激励取代行政信任:通过代币激励和自动化 Validation,我们可以摆脱对“可信实体”的依赖。
- 未来的局限:目前的 8k 上下文长度仍有提升空间,且在更加极端的异构算力(显卡型号参差不齐)下的表现仍需观察。
结论:如果您还在担心拿不到 H100 集群,Covenant 的工作告诉我们:去互联网上捡算力,这条路通了。
