Microsoft、初のストリーミング文字起こしモデルがArtificial Analysisで1位

Microsoftは2026年10月1日、同社初のストリーミング音声文字起こしモデル「MAI-Transcribe-2-Streaming」を公開し、Artificial Analysisで1位(no. 1)になったと発表しました。あわせて音声モデル「MAI‑Voice‑2.1」と高速版「MAI‑Voice‑2.1‑Flash」も発表しています。

Microsoftはソフトウェア、クラウドサービス、パソコンなどを提供する技術企業で、CopilotによるAI支援や開発者向けツールも提供しています。

発表された3モデル

モデル 種別 発表内容
MAI-Transcribe-2-Streaming ストリーミング音声文字起こし Microsoft初のストリーミング文字起こしモデル。Artificial Analysisで1位
MAI‑Voice‑2.1 音声モデル 新規発表
MAI‑Voice‑2.1‑Flash 音声モデル(高速版) MAI‑Voice‑2.1の高速版

用途

Microsoftは、これら3モデルを会話型音声エージェントの構築に使えると説明しています。原文ではMAI-TranscribeとMAI-Voiceのモデル群を、音声の理解と生成を担うものとして紹介しています。

位置付け

Microsoftはこれらのモデルを、正確性、速度、低コスト、音声品質を重視した会話体験向けの構成要素と位置付けています。原文では「正確性や音声品質を犠牲にせず、高速で滑らかな会話体験を作るための構成要素」と述べています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内