Η Google αναβάθμισε το οικοσύστημα της τεχνητής νοημοσύνης της με την κυκλοφορία του Gemini 3.8 Live, μιας ενημέρωσης που εισάγει το «Live Avatar». Η νέα αυτή λειτουργία επιτρέπει στους χρήστες να διεξάγουν συνομιλίες με το μοντέλο AI ενώ παρακολουθούν μια ψηφιακή περσόνα να ανταποκρίνεται σε πραγματικό χρόνο, προσδίδοντας μια οπτική υπόσταση στην αλληλεπίδραση.

Οπτική Πιστότητα και Πολυμορφία

Το Live Avatar διαθέτει τη δυνατότητα συγχρονισμού των χειλιών (lip-sync) και την προβολή διαφορετικών εκφράσεων του προσώπου κατά τη διάρκεια της συνομιλίας. Σύμφωνα με την Google, η λειτουργία υποστηρίζει 97 γλώσσες και μπορεί να μεταβαίνει από τη μία στην άλλη χωρίς να υποβαθμίζεται η ποιότητα του βίντεο ή να παρατηρείται οπτική απόκλιση. Σε επίδειξη της εταιρείας, το άβαταρ φάνηκε να μιλά αγγλικά και ιαπωνικά με ακριβή κίνηση των χειλιών, ενώ ταυτόχρονα προέβαλλε πληροφορίες στην οθόνη.

Διαθεσιμότητα και Ασφάλεια

Προς το παρόν, η πρόσβαση στο Live Avatar περιορίζεται αποκλειστικά στους πελάτες του Gemini Enterprise. Οι οργανισμοί έχουν τη δυνατότητα να επιλέξουν από μια βιβλιοθήκη προκαθορισμένων άβαταρ ή να δημιουργήσουν τα δικά τους προσαρμοσμένα πρόσωπα. Για την αντιμετώπιση ζητημάτων δεοντολογίας και ταυτοποίησης, η Google ενσωμάτωσε το αόρατο υδατογράφημα SynthID και πρόσθετες δικλείδες ασφαλείας για τον σεβασμό της ταυτότητας.

Τεχνολογικό Υπόβαθρο

Η κίνηση αυτή ακολουθεί την παρουσίαση του μοντέλου Gemini 3.8 Live, το οποίο, σύμφωνα με την εταιρεία, επεξεργάζεται οπτικά δεδομένα σε σχεδόν πραγματικό χρόνο. Η εξέλιξη αυτή σηματοδοτεί τη μετάβαση από τις απλές φωνητικές εντολές σε μια πιο ολοκληρωμένη, οπτική εμπειρία επικοινωνίας με την τεχνητή νοημοσύνη.