Skip to content

Η Google δείχνει έναν εντελώς διαφορετικό τρόπο αναζήτησης

Baladis Koumpouras
Baladis Koumpouras
Κοινοποίηση:
Το λογότυπο της Google σε smartphone Android και η υπηρεσία Google One"

Η Google έχει αναπτύξει ένα νέο sign language translation μοντέλο, σύμφωνα με ανακοίνωση της Google DeepMind το οποίο μπορεί να μετατρέψει περίπλοκες κινήσεις σώματος σε κείμενο, έχοντας εκπαιδευτεί πάνω σε περισσότερες από 100.000 ώρες δεδομένων και σε 50 διαφορετικά είδη νοηματικής.

Η τεχνολογία αποκαλείται Sign Language to Text (SL2T) έχοντας περάσει και βγει από το στάδιο της έρευνας και αναμένεται σύντομα να φθάσει σε ακόμη περισσότερες consumer συσκευές, (βρίσκεται ήδη στα Pixel 11) αρχής γενομένης με την Αμερικανική νοηματική γλώσσα στα Google Pixel 11 smartphones.

Τι μπορεί να κάνει το Sign Language to Text (SL2T)

Το μοντέλο χρησιμοποιείται για τα νέα sign-to-text features του Gboard και του Live Transcribe. Δηλαδή, αντί να απαιτεί από το χρήστη να πληκτρολογήσει, μπορούν με νοήματα να πραγματοποιήσουν αναζήτηση στο διαδίκτυο, να γράψουν μηνύματα, να αλληλεπιδράσουν με το Gemini της Google ή ακόμη και να γράψουν έγγραφα και να τα επεξεργαστούν.

Σε αντίθεση με περιπτώσεις μεταγραφής της ομιλίας, η μετάφραση της νοηματικής γλώσσας είναι κάτι που δεν μπορεί απλώς να γίνει με αντιστοίχιση μιας ακολουθίας ήχων σε λέξεις. Οι νοηματικές γλώσσες είναι ανεξάρτητες γλώσσες με τη δική τους γραμματική και λεξιλόγιο, με την έννοια ότι μπορεί το νόημα να μεταδοθεί ταυτόχρονα μέσω των κινήσεων των χεριών, των εκφράσεων του προσώπου, της στάσης του κεφαλιού.

 

Παράλληλα, αντί να αποστέλλει το raw feed της κάμερας για μετάφραση, το σύστημα χρησιμοποιεί ένα άλλο μοντέλο της Google, το MediaPipe Holistic, για να προσδιορίσει τα σημεία αναφοράς της στάσης του ατόμου που χρησιμοποιεί τη νοηματική γλώσσα. Δηλαδή γεωμετρικές συντεταγμένες που αντιπροσωπεύουν τις κινήσεις των χεριών, του προσώπου και του σώματος. Μόνο αυτές οι συντεταγμένες αποστέλλονται στο σύστημα μετάφρασης, ενώ το αρχικό βίντεο διαγράφεται αμέσως.

Πρόκειται για μία προσέγγιση η οποία έχει σχεδιαστεί να μειώσει τον όγκο των ευαίσθητων οπτικών πληροφοριών που φεύγουν από τη συσκευή, παρέχοντας παράλληλα στο μοντέλο τις απαραίτητες πληροφορίες σχετικά με τον τρόπο με τον οποίο ένα άτομο χρησιμοποιεί τη νοηματική γλώσσα.

Η εικόνα παρουσιάζει τι ακριβώς βλέπει το SLDT της Google και είναι στιγμιότυπο από την παρουσίαση του χαρακτηριστικού στην επίσημη ιστοσελίδα της Google DeepMind.
Η εικόνα παρουσιάζει τι ακριβώς βλέπει το SL2T της Google και είναι στιγμιότυπο από την παρουσίαση του χαρακτηριστικού στην επίσημη ιστοσελίδα της Google DeepMind. Όπως βλέπουμε και στην εικόνα, χρησιμοποιεί γεωμετρικά στοιχεία από τις κινήσεις μας και μειώνει την εικόνα που καταγράφει για λόγους προστασίας της ιδιωτικότητας.

Το SL2Τ στη συνέχεια, μεταφράζει την ακολουθία αυτή σε κείμενο.

Αξίζει να σημειωθεί ότι αυτή τη στιγμή το συναντούμε στα ολοκαίνουργια τηλέφωνα της Google, τα Google Pixel 11 και για την αμερικανική νοηματική γλώσσα, ενώ στη συνέχεια θα ακολουθήσουν και άλλες γλώσσες και συσκευές.

Ακολουθήστε μας

Ακολουθήστε το Techmaniacs.gr στο Google News για να διαβάζετε πρώτοι όλα τα τεχνολογικά νέα, ή προσθέστε μας στον RSS feed reader και στα social media σας.

Baladis Koumpouras

Baladis Koumpouras

Editor in Chief @ techmaniacs.gr με μεγάλη αγάπη για τα κινητά τηλέφωνα και την επιστήμη. Ξεκίνησε το 2018 να εργάζεται στο techmaniacs.gr μετά από ένα σύντομο πέρασμα από myphone.gr και digitallife.gr. Από τότε συνεχίζει μέχρι και σήμερα να κάνει αυτό που αγαπάει. Περισσότερα στο https://baladiskoumpouras.link/

Tags: google
Loading comments...
Loading more stories...
Loading reviews...

Μείνε ενημερωμένος

Ακολούθησέ μας στα social media και πρόσθεσέ μας στις αγαπημένες σου πηγές για να μη χάνεις καμία είδηση.