arXiv研究(ベンガル手話認識)検索・リサーチ確認済み

arXiv論文:0.48MBの手話認識AIをスマホで実行——1万874枚を専門家確認、1画像3.98ミリ秒

ベンガル手話38種類の実写データと約30万パラメータの小型モデルを公開。一般的なスマホで高速動作した。

  • 2026-08-07
  • 最終確認日 2026-08-07
自分にどう関係する?

手話認識を端末内で動かす現実的な小型化例ですが、日本手話や連続会話への適用には別データと検証が必要です。

ニュースをやさしく解説

結論から言うと、一般的なスマートフォンでも動かせる0.48MBのベンガル手話認識AIと、専門家が確認した実写データが公開された。arXivの画像認識分野へ2026年8月6日に投稿された査読前論文は、バングラデシュの特別支援学校3校で実際の利用者を撮影し、38種類の手の形、ベンガル文字51字に対応する1万874枚の「RSBdSL38」を作成した。

提案モデルは29万8470パラメータで、既存の大規模な学習済み画像モデルを使わず一から訓練した。同じ条件の評価では正答率96.37%で、比較した最良の学習済みモデルとの差は1.08ポイントだった一方、パラメータ数は8.5分の1から68分の1、計算量は1.3分の1から21.7分の1だった。量子化版は市販スマホ上で1画像3.98ミリ秒、使用メモリ15.5MBで動いた。

教育や窓口の補助アプリを作る人には、高価なサーバーへ映像を送らず端末内で認識できる可能性が重要だ。ただし未学習の6人を除外して評価する、より現実的な条件では正答率85.18%まで下がった。現段階はarXivの査読前研究で、静止した手の形が中心であり、連続した会話、日本手話、照明や背景が大きく違う場面へそのまま使えるわけではない。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.CV / cs.AI、査読前論文)を開く