Mistral于10月6日发布Mistral Large 4公开预览版,面向开发者和企业用户提供托管API。该模型采用大规模稀疏混合专家(MoE)架构,总参数规模约1.05万亿,单个Token实际激活参数约49B;同时支持原生图像输入和100万Token上下文。权重预计在10月底开放,但在权重、完整架构和部署文档发布前,企业目前能够验证的主要仍是API能力,而不是本地部署可行性。

已确认的预览信息
从公开资料看,Mistral Large 4的几个核心变化集中在模型规模、输入模态和上下文长度:
- 总参数规模为1.05万亿;
- 采用MoE架构,推理时只激活部分参数;
- 支持原生图像输入;
- 上下文窗口达到100万Token;
- API已经上线,权重预计于10月底开放;
- 训练数据覆盖160多种语言。
关于激活参数,公开报道中出现了49B和52B两种表述。49B更接近对外宣传中的概括数字,52B则出现在部分文档或媒体转述中。目前不宜将其理解为两个不同模型,更稳妥的做法是注明统计口径或四舍五入差异,并等待Mistral在权重发布时给出统一技术说明。
据公开报道,Mistral Large 4在Mistral位于欧洲的数据中心使用约3800块NVIDIA Grace Blackwell GPU训练。不过,这一训练规模、具体训练配置以及数据配比仍应以Mistral官方公告、技术报告或权重发布说明为准,不能仅凭媒体摘录推断模型的完整训练成本和性能水平。
预览API价格采用促销口径
公开页面显示,预览期前两周的API价格为:
| 项目 | 预览价格(美元/百万Token) | 常规价格(美元/百万Token) |
|---|---|---|
| 输入 | 0.68 | 1.36 |
| 缓存输入 | 0.07 | 0.14 |
| 输出 | 2.09 | 4.18 |
这些价格来自平台页面和媒体摘录,前两周的折扣不能直接视为长期商业条款。企业在预算测算时,应同时记录预览价和常规价,并把缓存命中率、输出长度、工具调用次数以及失败重试纳入成本模型。
对于长上下文和Agent任务,单次请求的Token价格并不能代表实际费用。反复读取大段上下文、调用工具后重新组织输入,以及较长的模型输出,都可能显著增加总消耗。因此,实际测试应以完整业务任务的平均成本为准,而不是只比较每百万Token的单价。
MoE的关键变化:总参数不等于每次推理成本
1.05万亿总参数容易给人“每次推理都要运行万亿参数”的印象,但MoE模型会根据输入内容选择部分专家参与计算。Mistral Large 4每个Token只激活约49B参数,意味着理论上的单Token计算量与总参数规模并不相同。
这种设计通常带来三方面影响。
首先,激活参数较少,有机会在保持更大模型容量的同时控制单次推理计算量。模型可以把不同类型的知识或任务能力分散到多个专家模块,再由路由机制选择部分专家处理当前输入。
其次,激活参数并不等于完整部署成本。即使每次只计算部分专家,服务端仍可能需要在显存中保存大量权重,并通过多卡并行管理专家模块。专家之间的通信、路由效率、批处理能力和显存容量,都会影响实际吞吐与延迟。
最后,MoE会提高本地部署评估的复杂度。企业不能只根据49B激活参数估算服务器需求,也不能直接把1.05万亿总参数当成本地部署所需的单一显存数字。权重精度、量化方案、并行策略、上下文长度和并发量,都需要等正式权重与部署文档发布后再核算。
因此,MoE的价值更适合表述为“在模型容量和单次计算之间寻找折中”,而不是简单等同于低成本或低门槛部署。
长上下文和多模态能力意味着什么
100万Token上下文对企业的吸引力主要在于,它能够承载更大的代码库、合同集合、产品文档、研究资料或多轮Agent轨迹。原生图像输入则可以让模型直接处理截图、图表、扫描文档和其他视觉信息,减少额外的图像转文字流程。
但上下文上限不等于有效利用长度。企业测试至少应关注以下问题:
- 模型能否准确找出位于长文档不同位置的关键信息;
- 输入内容增加后,回答质量和延迟如何变化;
- 图像、表格和扫描文档的识别是否稳定;
- 长上下文是否会放大输入成本和重复读取成本;
- 多轮工具调用中,模型能否持续保持任务状态;
- 发生上下文压缩后,关键信息是否会丢失。
对企业采购而言,100万Token更像是一项基础能力,而不是自动产生业务价值的保证。真正需要比较的是完成率、错误率、延迟、单位任务成本和数据治理条件。
权重开放前仍需核验什么
目前Mistral Large 4仍处于公开预览阶段,权重尚未开放。企业和开发者在决定是否采用前,至少应等待或核验以下信息:
权重与许可证
需要确认权重是否按预期开放、采用何种许可证,商业使用、再分发、微调和托管服务是否存在限制。所谓“开放权重”不必然等同于完全开放源代码,也不等同于没有商业条件。
完整架构与部署要求
正式资料应说明专家数量、路由机制、视觉编码器配置、权重格式、量化支持、并行方式和推荐硬件。只有这些信息齐全后,才能判断模型是否适合企业私有化部署。
独立性能评测
目前公开的性能数据主要来自平台页面、媒体报道或厂商材料,不能直接视为独立评测结论。企业应重点关注与自身任务相关的代码生成、文档问答、视觉理解、工具调用、长上下文检索和安全测试结果。
长期价格和服务条款
预览期价格可能在正式商业化后调整。除Token价格外,还需要确认速率限制、并发配额、数据保留政策、服务等级协议以及不同接口功能的收费方式。
实际总拥有成本
如果未来权重支持本地部署,企业仍需把GPU采购或租赁、存储、网络通信、运维、模型量化损失和升级成本纳入比较。API价格较低,并不意味着本地部署一定更便宜;本地部署也不意味着一定能获得更低延迟或更高稳定性。
总体来看,Mistral Large 4的预览版展示了欧洲模型厂商在超大规模MoE、长上下文和多模态方向上的推进,但现阶段更适合进行接口和任务验证。权重、部署条件、统一参数口径和独立性能数据尚未完整公布,企业不宜仅凭1.05万亿参数或预览期价格作出采购和基础设施决策,后续应以Mistral官方公告及正式权重发布信息为准。
文章版权归作者所有,未经允许请勿转载。