گوگل یک قدم دیگر هوش مصنوعی را به مکالمه انسانی نزدیکتر کرده است. این شرکت قابلیت Live Avatar را برای Gemini 3.8 Live معرفی کرده؛ قابلیتی که به هوش مصنوعی یک چهره متحرک میدهد تا هنگام صحبتکردن، لبهایش با صدا هماهنگ شود و حالات چهره طبیعیتری نشان دهد. این قابلیت از ۲۴ سپتامبر ۲۰۲۶ در اختیار مشتریان Gemini Enterprise قرار گرفته است.
اما جذابترین بخش ماجرا، توانایی چندزبانه این آواتار است. گوگل میگوید Live Avatar میتواند بین ۹۷ زبان جابهجا شود و همزمان حرکات لب و حالات چهره را با زبان جدید هماهنگ کند؛ حتی اگر کاربر در میانه مکالمه زبان خود را تغییر دهد. به گفته گوگل، این تغییر زبان بدون افت کیفیت تصویر یا ایجاد ناهماهنگی قابل مشاهده در آواتار انجام میشود.
Live Avatar فقط یک تصویر متحرک روی صفحه نیست. این سیستم میتواند همزمان ورودیهای صوتی و تصویری را پردازش کند و در حین مکالمه، ابزارهای مختلف را نیز در پسزمینه فراخوانی کند. برای مثال، در یکی از نمونههای نمایشی گوگل، آواتار میتواند در حالی که به گفتوگو با کاربر ادامه میدهد، اطلاعات لازم برای پذیرش یک مهمان در هتل را دریافت و پردازش کند.
گوگل همچنین امکان انتخاب آواتارهای آماده را فراهم کرده است، اما شرکتها میتوانند آواتار اختصاصی خودشان را نیز بسازند. برای ساخت نسخه سفارشی، سازمان میتواند از یک تصویر مرجع استفاده کند تا ظاهر، سبک بصری یا هویت شخصیت موردنظر حفظ شود. البته ساخت آواتار سفارشی فعلاً مشمول فرایند تأیید و دسترسی محدود سازمانی است.
کاربرد اصلی این فناوری در حال حاضر بیشتر تجاری است تا سرگرمی. گوگل از مواردی مانند پشتیبانی مشتری، پذیرش مجازی، آموزش کارکنان و راهنمایی تعاملی نام برده است. بنابراین Live Avatar فعلاً قرار نیست جایگزین نسخه معمولی Gemini برای کاربران عادی شود؛ بلکه گوگل آن را بهعنوان یک ابزار برای ساخت دستیارهای ویدئویی سازمانی عرضه کرده است.
البته ورود چهرههای مصنوعی به مکالمات روزمره، بحث جعل هویت و انتشار محتوای گمراهکننده را هم جدیتر میکند. گوگل برای کاهش این نگرانی میگوید خروجی صوتی و تصویری Live Avatar به SynthID مجهز میشود؛ یک واترمارک نامرئی که برای قابلشناساییکردن محتوای تولیدشده توسط هوش مصنوعی طراحی شده است.
در حال حاضر، Gemini 3.8 Live با Live Avatar برای مشتریان سازمانی Gemini Enterprise در دسترس است و گوگل آن را از طریق API نیز برای توسعهدهندگان ارائه میکند. اگر این فناوری در آینده به سرویسهای عمومی راه پیدا کند، مرز میان «صحبت با یک هوش مصنوعی» و «صحبت با یک شخصیت دیجیتال» میتواند بیش از گذشته محو شود؛ مخصوصاً وقتی همان شخصیت بتواند به ۹۷ زبان صحبت کند و همزمان حرکات صورت و لبهایش را با گفتار هماهنگ نگه دارد.