イレブンラボ、医療向け音声認識AI「Scribe v2 Medical」提供開始 医学用語に特化

AI(人工知能)音声サービスなどのイレブンラボジャパン(東京・千代田区)は10月1日、医療分野向け音声認識モデル「Scribe v2 Medical(スクライブ・ブイツー・メディカル)」の正式提供を開始したと発表した。薬剤名や解剖、病理、臨床の口述筆記など診療に関する音声の認識精度を高めた。バッチ処理のAPI(アプリケーション・プログラミング・インターフェース)「Speech to Text API」で提供する。

「Scribe v2 Medical」は、汎用(はんよう)音声認識モデル「Scribe v2」を医療向けに追加学習したモデル。診療中の会話の記録や医療スクライブ(診療記録の作成補助)、口述筆記、問診、医療機関間の連携に伴う通話などの音声をテキストに変換する。文字起こしした内容は医療従事者など権限を持つ利用者が確認・修正して使用する。2026年5月から先行提供していた。

医療AI企業は音声認識の基盤として、自社の記録作成サービスや診療支援製品に組み込める。同社ではモデル自体はカルテや診療記録などの文書を生成したり、診断・治療方針を判断したりするものではないとしている。

公開の医療ベンチマーク「Eka Medical ASR」の臨床音声3619件を使った評価では、文字起こしした単語のうち誤りが占める単語誤り率が7%だったという。ベースとなる「Scribe v2」は8.6%、前世代の「Scribe v1」は18.6%で、「Scribe v2」と比べて1.6ポイント低下した。

医療AI企業の仏ナブラによる第三者評価では、実際には話していない医療用語を文字起こしに加えるハルシネーション(幻覚)の発生率が0.4%となり、「Scribe v2」の0.7%から低下した。一般的な会話音声のテストでは単語誤り率が「Scribe v2」と同じ5.3%だった。

医師の口述筆記を対象にした評価では、単語誤り率が「Scribe v2」比で相対的に約36%低下した。精度検証は現在、英語、フランス語、ドイツ語で実施している。

セキュリティー面では、エンタープライズ契約でBAA(ビジネス・アソシエイト・アグリーメント)を締結。データを保持しない「Zero Retention Mode(ZRM、ゼロ・リテンション・モード)」を有効にすることで、米国のHIPAA(医療保険の携行性と責任に関する法律)に対応した形で利用できる。ZRMは処理完了直後に入力音声と出力テキストを削除する。文字起こしデータの保存・管理は利用企業側で行う。