ビデオ通話でサイン言語を識別することを学びました

研究者らは、リアルタイム手話検出システムを発表しました。彼女はそれがいつなのかを知ることができる

対話者は何かを言おうとしている、または単に体、頭、腕を動かします。科学者らは、この作業は人にとって簡単に見えるかもしれないが、以前はそのようなシステムはどのビデオ通話サービスでも利用できなかったと指摘しています。これらのサービスはすべて、あらゆる音や人間のジェスチャーに反応します。

Googleの研究者による新しい開発は優れた効率と低遅延でそれを行います。研究者は、サイン言語の検出が遅延またはビデオ品質の低下につながることに注意していますが、この問題は解決でき、モデル自体は軽量で信頼性があります。

システムは最初に下のモデルを介してビデオを実行しますPoseNetと呼ばれ、各フレームの体と手足の位置を評価します。簡略化された視覚情報は、サイン言語を使用して人々のビデオからデータを配置するようにトレーニングされたモデルに送信され、画像を人々が通常特定の単語を表示する方法と比較します。

モデルは単語や表現を正しく識別します80%の精度で、追加の最適化により91.5%に達する可能性があります。ほとんどのサービスで「アクティブスピーカー」の検出が遅れて機能することを考えると、研究者はこれらが非常に多いと信じています。

また見なさい:

地球上に熱核反応器を作ることが可能です。結果はどうなりますか?

終末の氷河は、科学者が考えていたよりも危険であることが判明した。主なことを伝えます

病気の3日目、ほとんどのCOVID-19患者は嗅覚を失い、そしてしばしば鼻水に苦しむ