凤凰网科技讯 9月1日,腾讯混元宣布推出Hy4 preview轻量版。该版本通过两项核心技术将模型权重从接近1.5TB压缩至约214GB:一是自研Sherry稀疏三值量化算法,将最激进一档权重压至平均1.25比特;二是MIX-STQ1_0混合精度策略,按敏感度逐层决定每层比特数,在同等平均比特预算下实现更低量化误差。

压缩后的模型在主流评测任务上能力保持稳定,长文理解、多轮长上下文检索与原始版本基本持平。

腾讯混元还验证了异构设备联合推理方案:在一台4090笔记本与一台四卡A4000服务器(显存合计80GB、内存64GB)上,通过调度将MoE层拆开分配,协同运行速度达1.02 token/s,较笔记本单机offload提升约6倍。量化GGUF库及相关代码已同步开源。腾讯方面表示,该方案为资源有限或手边已有异构设备的开发者提供了运行旗舰大模型的新路径。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8w3y02nFaFX