Microsoftは2026年10月1日、同社初のストリーミング音声文字起こしモデル「MAI-Transcribe-2-Streaming」を公開し、Artificial Analysisで1位(no. 1)になったと発表しました。あわせて音声モデル「MAI‑Voice‑2.1」と高速版「MAI‑Voice‑2.1‑Flash」も発表しています。
Microsoftはソフトウェア、クラウドサービス、パソコンなどを提供する技術企業で、CopilotによるAI支援や開発者向けツールも提供しています。
発表された3モデル
| モデル | 種別 | 発表内容 |
|---|---|---|
MAI-Transcribe-2-Streaming |
ストリーミング音声文字起こし | Microsoft初のストリーミング文字起こしモデル。Artificial Analysisで1位 |
MAI‑Voice‑2.1 |
音声モデル | 新規発表 |
MAI‑Voice‑2.1‑Flash |
音声モデル(高速版) | MAI‑Voice‑2.1の高速版 |
用途
Microsoftは、これら3モデルを会話型音声エージェントの構築に使えると説明しています。原文ではMAI-TranscribeとMAI-Voiceのモデル群を、音声の理解と生成を担うものとして紹介しています。
位置付け
Microsoftはこれらのモデルを、正確性、速度、低コスト、音声品質を重視した会話体験向けの構成要素と位置付けています。原文では「正確性や音声品質を犠牲にせず、高速で滑らかな会話体験を作るための構成要素」と述べています。

まだコメントはありません。