Mistralは2026年10月6日、総パラメータ1兆・活性パラメータ490億のネイティブマルチモーダルモデル「Mistral Large 4」(ML4)の公開プレビューを開始し、Mistral StudioでプレビューAPIを当日から提供しています。重みは10月末までにオープンウェイトとして公開する予定です。
Mistral AIは、AIモデルから開発者向けツール、計算基盤までを提供し、モデルの公開と利用者による制御を重視する企業です。
何が新しいか
ML4はMistralにとって過去最大のモデルで、コーディング、エージェントワークフロー、画像理解、サイバーセキュリティ、金融、法務、科学・数学を対象としています。Mistralは欧州の自社データセンターで3,800基のNVIDIA Grace Blackwell GPUを使いゼロから学習させ、プレビューも同じ基盤で提供しています。学習データには160超の言語が含まれます。重みの公開までは、サイバーセキュリティリーダー、審査済みパートナー、国家機関とともに実環境でレッドチーミングを行い、これらの参加者にはモデレーションを縮小しサイバー機能を拡張した同一モデルを提供します。
ベンチマーク
| ベンチマーク | スコア |
|---|---|
| DeepSWE v1.1 | 61.7% |
| SWE-Atlas-QnA | 59.4% |
| Terminal-Bench 4 | 28.3% |
| Coding Agent Index | 49.8 |
| AutomationBench | 59.9% |
| AA-Briefcase | 1,393 Elo |
| Dense 200 | 42%(GPT-6-Astraは41%) |
| サイバー脆弱性の再現・修正テスト | 82% |
DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnAの数値は、Artificial Analysisがハーネス公開前に非公開で評価したもので、ハーネス公開後にArtificial Analysis Coding Agent Indexへ収録される予定です。Mistralによると、Coding Agent IndexのスコアはDeepSeek V4 Pro 0813とQwen3.8 Maxを上回ります。AutomationBenchはGmail、Google Sheets、Slack、Salesforceなどにまたがる657の業務ワークフローで構成されます。
Surge AIによるコーディング品質のブラインド人間評価(1〜5点)では、ML4 Previewが3.74で5モデル中2位となり、Claude Opus 5(4.22)に次ぎ、GLM-5.3(3.60)、Kimi K3(3.59)、GLM-5.2(3.40)を上回りました。サイバー分野では、Artificial Analysis Cyber Indexのテストの一つで、オープンソースソフトウェアの実在する脆弱性を再現してパッチを当てる課題で82%を記録し、Mistralはこれを最高スコアとしています。Cybench(40問)では93%を解いています。Claude Opus 5.5やGPT-6 Astraは同テストでタスクを拒否するため0%近くにとどまるとMistralは説明しています。法務・金融タスクでは、vals.aiの第三者評価でGPT-6-Astraを上回りました。
試し方・提供条件
- プレビューAPIはMistral Studioで利用できます。
- 重みは2026年10月末までに公開予定で、公開後は組織が自社環境でセルフデプロイできます。
- サイバーセキュリティ用途では、プライベートクラウドまたはオンプレミスで運用できるようになる予定です。
- 提供は世界の複数リージョンで行い、Mistralが他のデジタルサービス事業者から独立して欧州法のもとで運用する欧州デプロイも含みます。
Mistralは重み公開に向けて、アーキテクチャの詳細、追加ベンチマーク、事後学習の手法を順次共有するとしています。

まだコメントはありません。