星火新闻
页面
文章正文
  1. 01标题与摘要
  2. 02完整正文
  3. 03延伸阅读
星火新闻 · 资料整理

腾讯混元 Hy4 preview 轻量版开源,实现模型权重大幅压缩与异构设备联合推理能力

腾讯混元团队发布了新一代 MoE 大语言模型 Hy4 preview 的轻量化版本。该版本将模型权重从接近 1.5TB 压缩至约 214GB,并开源支持主流框架。此外,通过与 prima.cpp 的合作,展示了在异构设备上联合推理的能力,使轻量版模型达到一定的推理速度。

星火新闻 · 资料整理

腾讯混元团队已完成 Hy4 preview 轻量版的发布和开源工作,该版本实现了将模型权重从接近 1.5TB 大幅压缩至约 214GB的里程碑式进展。这一系列技术成果表明了其在大型语言模型部署效率上的重要推进。

Hy4 preview 本身是腾讯于 8 月 28 日发布并开源的新一代 MoE(混合专家)大语言模型,其总参数量达到 770B(7700 亿),激活参数为 49B,并且具备高达 100 万 Token 的上下文长度。这奠定了该模型在处理超长文本任务上的基础能力。

实现如此大幅度的压缩,腾讯混元团队采用了包括 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略等先进技术。具体而言,这些压缩技术使得路由专家层的权重平均被压缩至 1.25 比特,这是模型体积减小的核心技术支撑。

在实际应用层面,腾讯混元与 prima.cpp 合作验证了一项关键的异构设备联合推理新方案。该方案展示了如何将 MoE 层拆分并分配到不同类型的计算资源上进行协同工作。

此次联合推理的测试环境非常具有代表性:它在一台配备单张 4090 的笔记本与一台四卡 A4000 服务器(这两部分设备合计拥有 80GB 显存和 64GB 内存,且分属两个局域网)上进行。通过 prima.cpp 的异构调度机制,成功地将 MoE 层进行了拆分分配。

这一系列优化带来的直接性能提升是显著的:使用 prima.cpp 的异构调度将 MoE 层拆分分配后,使 214GB 的轻量版模型达到了 1.02 token/s 的推理速度。这表明了理论上的压缩体积与实际运行效率之间的良好平衡。

从可访问性角度看,腾讯混元团队已将轻量版模型上线至 Hugging Face 和 GitHub 平台,极大地降低了社区的使用门槛。该轻量版模型明确支持 llama.cpp、vLLM、SGLang 等多个主流的推理框架,确保了其兼容性和广泛适用性。

背景分析方面,大型语言模型的参数规模持续增大,导致部署和推理成本急剧上升。腾讯混元 Hy4 preview 轻量版的发布,特别是结合异构设备联合推理的能力,直接回应了业界对“如何将超大模型落地到资源受限或分布式环境”这一核心痛点的需求。

读者提示:对于关注模型工程化、边缘计算部署的开发者而言,理解 Sherry 稀疏三值量化和 MoE 层拆分分配的原理,是掌握当前前沿 LLM 优化技术的重要切入点。同时,由于该轻量版已支持多个主流框架,用户可以根据自身现有基础设施选择最匹配的推理环境进行测试。

信息来源

本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。