近日,腾讯混元团队公布了一项最新的技术成果,成功将旗下主打端侧的1.8B 翻译模型压缩至几百兆大小,不仅翻译质量几乎没有损失,并且已经成功落地哔哩哔哩(B站)的直播弹幕实时翻译中,实现了从实验室 Demo 到高并发真实业务场景的跨越。
作为基底的 Hy-MT2-1.8B 模型原本属于腾讯混元翻译模型族,原生支持33个语种互译。在同等尺寸中,其整体翻译质量在 FLORES-200通用翻译评测上已经优于多款商业翻译 API。然而,由于1.8B 模型在传统的 FP16精度下需要占用高达3.3GB 的内存,即便降到4-bit 量化也仍需1GB 以上,无法满足端侧多任务并发的内存管理需求。为此,腾讯推出了两档极低比特的量化方案。

第一档是面向中高端设备的2-bit 模型。该方案采用了拉伸弹性量化(SEQ)技术,将参数量化至特定的离散数值,并结合量化感知蒸馏(QAD)手段,在将模型体积压缩至574MB 的同时,实现了几近无损的翻译质量。
第二档则是面向全系设备的1.25-bit 极低比特方案。该方案基于腾讯自研的 Sherry 稀疏高效三值量化技术,该技术此前已被顶级学术会议 ACL2026选为 Oral。其核心策略是通过细粒度稀疏机制,使每4个参数中最重要的3个用特定数值存储,其余置零,平均每个参数仅占用1.25-bit。配合专为 CPU 设计的 STQ 内核,原始的3.3GB 模型被极致压缩至440MB。
为了让极低 bit 模型摆脱对特定移动端 ARM 架构的依赖,英特尔团队针对 x86生态进行了深度底座适配。通过对量化矩阵运算中的向量化、权重重排和 VNNI 指令融合环节进行优化,Hy-MT2的低比特量化格式在英特尔主流机型(包括最新第三代酷睿 Ultra 及酷睿处理器)上的 token 运行速率实现了显著提升,成功将极低比特方案从移动端扩展至 PC 和边缘设备。
在实际业务验证方面,哔哩哔哩已将该极低比特模型正式接入直播弹幕实时翻译。整套资源的下载大小约为600MB,运行时内存占用保持在500到700MB 之间,平均单条弹幕的翻译耗时在500到800毫秒左右,在常规弹幕频率下能够做到流畅的实时翻译,并能准确驾驭各类网络流行语。这种在设备本地独立运行的模式,既降低了云端服务器的调用成本与带宽开销,也在全流程中避免了数据上传,切实保障了用户的隐私安全。
VIP会员