Μάθαμε να αναγνωρίζουμε τη νοηματική γλώσσα στις βιντεοκλήσεις

Οι ερευνητές παρουσίασαν ένα σύστημα ανίχνευσης της νοηματικής γλώσσας σε πραγματικό χρόνο. Μπορεί να πει πότε

ο συνομιλητής προσπαθεί να πει κάτι ή απλώςκινεί σώμα, κεφάλι, χέρια. Οι επιστήμονες σημειώνουν ότι αυτό το έργο μπορεί να φαίνεται εύκολο για ένα άτομο, αλλά προηγουμένως ένα τέτοιο σύστημα δεν ήταν διαθέσιμο σε καμία από τις υπηρεσίες βιντεοκλήσεων - όλες ανταποκρίνονται σε οποιοδήποτε ήχο ή ανθρώπινη χειρονομία.

Μια νέα ανάπτυξη από ερευνητές της Google είναι ικανήτο κάνουμε με μεγάλη απόδοση και χαμηλή καθυστέρηση. Ενώ οι ερευνητές σημειώνουν ότι η ανίχνευση της νοηματικής γλώσσας οδηγεί σε καθυστέρηση ή υποβαθμισμένη ποιότητα βίντεο, αυτό το πρόβλημα μπορεί να λυθεί και το ίδιο το μοντέλο παραμένει ελαφρύ και αξιόπιστο.

Το σύστημα εκτελεί πρώτα το βίντεο μέσω του μοντέλου κάτωονομάζεται PoseNet, το οποίο αξιολογεί τη θέση του σώματος και των άκρων σε κάθε πλαίσιο. Απλοποιημένες οπτικές πληροφορίες αποστέλλονται σε ένα μοντέλο εκπαιδευμένο για να τοποθετεί δεδομένα από βίντεο ατόμων που χρησιμοποιούν νοηματική γλώσσα και συγκρίνει την εικόνα με τον τρόπο με τον οποίο οι άνθρωποι εμφανίζουν συνήθως συγκεκριμένες λέξεις.

Το μοντέλο αναγνωρίζει σωστά τις λέξεις και τις εκφράσεις80% ακρίβεια και με επιπλέον βελτιστοποίηση μπορεί να φτάσει το 91,5%. Θεωρώντας ότι η ανίχνευση ενός «ενεργού ηχείου» στις περισσότερες υπηρεσίες λειτουργεί με καθυστερήσεις, οι ερευνητές πιστεύουν ότι πρόκειται για πολύ μεγάλο αριθμό.

Δείτε επίσης:

Είναι δυνατόν να δημιουργηθεί ένας θερμοπυρηνικός αντιδραστήρας στη Γη. Ποιες θα είναι οι συνέπειες;

Ο παγετώνας Doomsday αποδείχθηκε πιο επικίνδυνος από ό, τι πίστευαν οι επιστήμονες. Λέμε το κύριο πράγμα

Την 3η ημέρα της ασθένειας, οι περισσότεροι ασθενείς με COVID-19 χάνουν την αίσθηση της όσφρησης και συχνά υποφέρουν από ρινική καταρροή