稀宇科技 MiniMax 宣布已开源了 MiniMax M3 的模型权重,并同步发布了 MSA(MiniMax Sparse Attention)技术论文。MSA 的架构设计让 M3 在长上下文下的计算成本大幅降低,论文中完整披露了架构与工程实现细节。
公告称,M3 是 MiniMax 的原生多模态旗舰模型,总参数 428B,激活参数 23B;也是第一个从 Step 0 开始做多模态混合训练的开源模型。
训练阶段,团队使用了大量文本、图像和其他模态交错排列的数据,让不同模态的语义空间从预训练阶段就深度融合。这种设计使模型在预训练阶段就建立起统一的跨模态语义空间,也为后续多模态理解、生成和复杂任务融合提供了底层基础。
此外,针对访问量激增带来的体验问题,经过优化后的 M3 输出速度已从上线时的约 30 TPS 提升至约 80 TPS,预计接下来还会继续提速 30-40%,模型响应将更加流畅。Token Plan 后台也上线了调用量看板,用户可以直观查看当前用量及剩余额度,方便合理规划用量与成本。
相关阅读:
评论删除后,数据将无法恢复
MiniMax M3 正式开源
稀宇科技 MiniMax 宣布已开源了 MiniMax M3 的模型权重,并同步发布了 MSA(MiniMax Sparse Attention)技术论文。MSA 的架构设计让 M3 在长上下文下的计算成本大幅降低,论文中完整披露了架构与工程实现细节。
公告称,M3 是 MiniMax 的原生多模态旗舰模型,总参数 428B,激活参数 23B;也是第一个从 Step 0 开始做多模态混合训练的开源模型。
训练阶段,团队使用了大量文本、图像和其他模态交错排列的数据,让不同模态的语义空间从预训练阶段就深度融合。这种设计使模型在预训练阶段就建立起统一的跨模态语义空间,也为后续多模态理解、生成和复杂任务融合提供了底层基础。
此外,针对访问量激增带来的体验问题,经过优化后的 M3 输出速度已从上线时的约 30 TPS 提升至约 80 TPS,预计接下来还会继续提速 30-40%,模型响应将更加流畅。Token Plan 后台也上线了调用量看板,用户可以直观查看当前用量及剩余额度,方便合理规划用量与成本。
相关阅读: