DeepSpeed MoE and Model Compression

导言

MoE 和模型压缩看似方向相反:前者扩大总参数,后者缩小部署对象。它们实际都在重写“每个 token 访问哪些参数”。DeepSpeed-MoE/MoE Inference 管理稀疏路由和专家放置;Model Compression/MoQ 管理层、权重和精度的删减。

Read more