MiniMax发布新一代开源模型，创新架构打破全球输入天花板

1月15日，MiniMax发布并开源新一代01系列模型，包含基础语言大模型 MiniMax-Text-01 和视觉多模态大模型MiniMax-VL-01。该系列模型以大规模应用线性注意力机制打破Transformer传统架构记忆瓶颈，在综合性能比肩GPT-4o、Claude-3.5等海外领军模型的基础上，能够高效处理高达400万token的输入，可输入长度是GPT-4o的32倍，Claude-3.5-Sonnet的20倍。MiniMax-01系列模型首次将线性注意力机制扩展到商用模型的级别，并使其综合能力达到全球第一梯队。（全天候科技）

风险提示及免责条款

市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。

MiniMax-01系列模型首次将线性注意力机制扩展到商用模型的级别，并使其综合能力达到全球第一梯队。而受益于此次架构创新，该系列模型在处理长输入的时候具有非常高的效率，接近线性复杂度。从Scaling Law、与MoE的结合、结构设计、训练优化和推理优化等层面综合考虑，MiniMax选择模型参数量为4560亿，其中每次激活459亿，能够高效处理高达400万token的上下文，将有效替代Transformer传统架构并开启超长文本输入时代。相较于Gemini等一众全球顶级模型，MiniMax-01随着输入长度变长，性能衰减最慢，效果及其出众。（全天候科技）

风险提示及免责条款