Mistral Large 4 首发测评:Le Chonk 如何让 Mistral 重回牌桌
一句话总结(TL;DR):Mistral 在 2026-10-06 发布旗舰模型 Mistral Large 4(代号「Le Chonk」),MoE 架构总参数 1 万亿、每次仅激活 490 亿,在自建 3800 块 NVIDIA Grace Blackwell 集群上训练,Artificial Analysis 综合分从上一代 Large 3 的 9 分跃升至 38 分,紧随 DeepSeek 4.1 Flash 之后;它还没追平最前沿的「frontier」模型,但已经足以让这家欧洲 AI 公司重新回到牌桌,开源权重承诺本月底放出。
这是什么 / 为什么值得关注
Mistral Large 4 是法国 AI 公司 Mistral 的新一代旗舰大模型,官方昵称「Le Chonk」——一个带点自嘲意味的「胖家伙」称呼,对应它 1 万亿总参数的量级。它目前处于公开预览阶段,经 Mistral 官方 API 即可调用;更关键的是,Mistral 承诺本月底放出开源权重。
放在行业版图里看,这个发布有两层意义。其一,它是欧洲 AI 阵营在开源方向上的又一次重要表态——Mistral 一直是「开源欧洲旗手」这个定位的代表,Large 4 若能兑现开源承诺,将是开源社区拿到的又一个重量级增量。其二,它的代号和「训练流水线没有停下」的表态,都传递出 Mistral 在算力与规模上真正押注的决心,而不只是做一次性的模型发布。
核心规格
Large 4 采用 Mixture of Experts(MoE) 架构:总参数 1 万亿(1T),每次推理仅激活 490 亿(49B)。这意味着它的「账面」体量巨大,但实际计算成本被稀疏激活压了下来,硬件效率是它反复强调的卖点。对于需要自己部署或做推理成本核算的团队,这一点比总参数更有参考价值。
训练方面,它在 Mistral 自建集群的 3800 块 NVIDIA Grace Blackwell GPU 上完成;强化学习阶段的 rollout 日产 330 亿 token。官方同时明确:训练流水线没有停下来,后续还会继续产出更大版本——也就是说 Large 4 更像一个阶段节点,而非终点。
语言支持 160+ 种语言。推理档位上,Mistral API 只提供 「none」和「high」两档推理强度,没有更多档位可选——对于喜欢精细调节「思考时长/推理深度」的用户,这是一个值得注意的限制。
性能怎么看
性能部分需要拆开看,因为 Large 4 在「综合分」和「细分项」上的表现并不完全一致。
综合维度,它在 Artificial Analysis(AA)榜单上拿到 38 分,紧跟 DeepSeek 4.1 Flash(552B 模型) 之后。作为对照,上一代 Mistral Large 3 在 AA 上只有 9 分——从 9 到 38 是数量级的跃升,这也是这次发布最「实」的进步。
在安全/漏洞方向,Large 4 的 AA Cyber Index(找漏洞/修漏洞)进入前五,其中「修复开源项目」环节拿到 82%,官方称领先开源对手——对把大模型用于代码审计、安全修复的团队,这是一个具体可用的信号。
视觉能力上,它在 Dense200(图中找目标物体的任务)上比 GPT-6 Astra 高 1%,属于单项上有亮点、可以拿出来说的成绩。
但短板同样明显:编码基准落后于 frontier 模型(如 Astra),只是优于开源对手 Qwen3.8 Max 和 DeepSeek V4 Pro。也就是说,在编码这个开发者最看重的场景里,Large 4 是「开源阵营里的强手」,但还没进入最顶尖那一档。此外,它在 AutomationBench 与 AA-Briefcase(知识工作)两个基准上高于 DeepSeek V4 Pro,说明在自动化与通用知识工作类任务上也有竞争力。
业内观察者 Simon Willison 的定性比较克制:综合看约落后 frontier 模型 6 个月,还不是「Fable 级」模型,但 Mistral 凭这个模型「回到了牌桌上」。这个评价基本公允——Large 4 的意义不在于登顶,而在于让 Mistral 重新进入「可认真比较」的范围。
强项与短板
强项:MoE 带来的推理效率(1T 总参、49B 激活);安全/漏洞方向的可比性成绩(Cyber Index 前五、修复开源项目 82%);视觉单项小胜;以及即将放出的开源权重,这是很多闭源模型给不了的东西。
短板:编码还没摸到 frontier 一线;综合分 38 与最前沿仍有明显差距;API 推理强度只有两档,灵活性不足;目前仍是公开预览,生产环境的稳定性与定价都还需「以官方为准」进一步确认。
怎么用 / 现在能干什么
现阶段能做的:通过 Mistral 官方 API 调用公开预览版,做效果评估和原型验证;对安全、自动化、通用知识工作类任务,可以用它和现有模型做横向对比。想拿权重做本地部署或二次微调的团队,需要等本月底的开源权重放出后再动手,具体的许可证、权重规模与部署要求,以官方发布为准。
谁适合用 / 谁可以等等
- 适合现在就用:已经在做漏洞挖掘/代码审计、看重「修复开源项目」这类能力的安全团队;需要多语言能力、或希望用 MoE 控制推理成本的工程团队;想第一时间把开源权重吃透、为后续微调做准备的团队。
- 可以等等:对编码能力有最高要求、需要对标最前沿闭源模型的开发者——Large 4 在这一项还没追上 Astra;对生产稳定性敏感的团队,也可以等它走出公开预览、定价和 SLA 明确后再做决策。
- 观望路线图的人:官方已明确以 Large 4 为底座做一系列垂直模型、且未来几个月会出更大版本——如果需求不是「通用旗舰」而是「特定用途」,等垂直版本或更大版本可能更划算。
结语
Mistral Large 4 最值得称道的,不是它已经追平了谁,而是它用一次「从 9 分到 38 分」的跃迁,证明了自己在算力和方法论上跟得住节奏,重新回到了可以和头部玩家对谈的位置。对开源生态而言,一个 1T 参数、即将开放权重的 MoE 模型,本身就是重要增量;对开发者而言,它提供了一个「效率优先、安全见长」的务实选项。它是不是下一个转折点,要等开源权重落地、以及后续更大版本兑现之后,才有更确切的答案——在那之前,把它当作「重新上桌的强竞争者」来看,是更稳妥的姿态。