你的笔记本电脑或手机究竟会有哪些实际变化?
最大的变化是,你的个人设备将能运行比现在大得多的模型,而无需将数据发送到云端。FreeToken,一个2026年的边缘原生服务系统,证明了这一点:它在8GB显存的笔记本电脑GPU上运行了350亿参数的模型,在游戏台式机上运行了2840亿参数的模型,并在单个工作站GPU上运行了7530亿参数的模型[5]。这相比目前笔记本电脑能容纳的约70亿参数模型是一次飞跃,意味着你可以在本地运行前沿级别的智能——同时获得更好的隐私保护和离线可用性。
这是可行的,因为MoE(混合专家)模型并不会为每个词元激活其全部参数,它们只会使用少数几个“专家”子网络。边缘系统利用这种稀疏性,将非专家权重保留在内存中,仅在需要时从存储中加载专家权重。2023年的先驱项目EdgeMoE表明,这种方法能在保持计算成本低廉的同时大幅削减内存占用[6]。实际效果是,你设备的存储空间成为了模型内存的一部分,因此你可以运行比设备RAM通常所能容纳的大得多的模型。
它能变得多快、多小?
你可以期待显著的加速和内存节省,但具体数字取决于你的硬件和工作负载。D2MoE 是2025年的一套系统,与最新的端侧框架相比,推理吞吐量最高提升了1.39倍,峰值内存占用最高降低了53%,同时保持了与INT8量化相当的精度[1]。这意味着你的设备每秒能处理更多请求,并且可以运行更大的模型而不会崩溃。
CoMoE是另一个2025年的系统,与现有的专家卸载技术相比,其内存使用量减少了约70%,推理延迟降低了10.5%,并使得一个74亿参数的模型能够在以往只能运行更小模型的设备上运行[2]。这些收益源于根据实时设备状态和网络条件动态调整专家的聚合与卸载方式。然而,这些结果来自测试平台和模拟环境,因此实际性能可能有所差异,尤其是在较旧或性能较弱的硬件上。
有哪些局限和不足之处?
主要的难点在于,这些系统复杂且仍在不断演进;它们需要针对你的具体设备和负载进行精细调优。例如,D2MoE的动态位宽分配和调度算法旨在平衡质量与开销,但未必总能针对每个请求达到最佳平衡点[1]。同样,CoMoE的自适应调度依赖于网络条件和用户移动性,而这些在现实环境中可能难以预测[2]。
另一个局限在于可信度:边缘设备的安全性不如数据中心服务器,推理结果也可能不可靠。2025年提出的REMIS方案通过深度强化学习,将专家调度到负载较低、可靠性较高的设备上,从而同时改善延迟和推理可信度[3]。但这又增加了一层复杂性。最后,为你的任务找到合适的预训练MoE模型可能颇具挑战;2025年的框架MMEC通过从模型库中推荐合适模型来提供帮助,但仍需进行微调或筛选工作[4]。因此,尽管潜力巨大,未来两年这些系统很可能会逐步成熟,但过程中难免会有一些成长的阵痛。
关于这些来源
这个回答基于6项研究(2项经同行评审,4项为预印本)——发表于2023年至2026年间,其中5项为2024年或之后发表——这些研究是从6项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的52篇文献。
本文引用的文献
D$^{2}$MoE:面向高效端侧MoE大模型服务的双路由与动态调度
D2MoE是一种算法与系统协同设计,采用套娃式权重量化和最热专家位优先调度启发式方法,在真实边缘设备上将推理吞吐量提升最高达1.39倍,并将峰值内存降低最高达53%,同时保持与INT8相当的精度。
CoMoE:面向边缘场景下基于MoE的大语言模型的专家聚合与卸载协同优化
CoMoE联合优化了专家聚合与卸载,相比现有卸载技术实现了约70%的内存缩减和10.5%的推理延迟降低,使得74亿参数的模型能够在资源受限的移动边缘设备上运行(内存从15.6GB降至4.7GB)。
一种基于深度强化学习的边缘MoE可信高效推理调度方案
REMIS采用深度强化学习,在边缘设备上以更低的负载和更高的可靠性调度专家激活,与固定的Top-K路由不同,它在不可信条件下同时提升了服务延迟和推理可信度。
MMEC:高效利用MoE支持移动边缘计算
MMEC维护了一个包含微调模型和现成MoE模型的仓库,并基于少量采样查询推荐合适的模型,从而以较低的计算时间取得了优异的F1分数,并实现了可观的整体增益。
FreeToken:基于带宽自适应执行的高效边缘原生MoE服务
FreeToken,一个边缘原生的MoE(混合专家)服务系统,协同设计了完整的服务栈,支持超过20个MoE模型,可在8GB笔记本GPU上运行35B模型,在游戏台式机上运行284B模型,并在单个工作站GPU上运行753B模型。
EdgeMoE:在移动设备上赋能稀疏大语言模型
EdgeMoE将MoE模型分区存储于存储层级中,将非专家权重保留在内存中,仅在激活时才从外部存储获取专家权重,从而在移动设备上实现了显著的内存节省和速度提升。
