گوگل نسل جدید هوش مصنوعی مکالمهای خود را با نام Gemini 3.8 Live معرفی کرد؛ مدلی که هدف اصلی آن تبدیل گفتوگو با هوش مصنوعی به تجربهای طبیعیتر، سریعتر و شبیه صحبت با یک انسان است. این مدل برای مکالمات صوتی لحظهای طراحی شده و میتواند همزمان صدا، تصویر، ویدئو و متن را پردازش کند.
برخلاف نسلهای قبلی که معمولاً ابتدا صحبت کاربر را تبدیل به متن کرده و سپس پاسخ تولید میکردند، Gemini 3.8 Live روی تعامل مستقیم صوت به صوت تمرکز دارد. نتیجه این رویکرد، کاهش تأخیر در پاسخها و ایجاد مکالمهای روانتر است؛ چیزی که گوگل آن را گامی مهم برای ساخت دستیارهای هوشمند نسل جدید میداند.
یکی از قابلیتهای مهم این نسخه، درک بهتر موقعیتهای پیچیده در مکالمه است. کاربر میتواند در حین صحبت، تصویر یا ویدئو ارسال کند و از Gemini بخواهد آنچه را میبیند تحلیل کند؛ قابلیتی که میتواند برای آموزش، کارهای روزمره، پشتیبانی فنی و حتی استفادههای حرفهای کاربرد داشته باشد.
گوگل همچنین نسخه دیگری با نام Gemini 3.8 Live Extended Thinking معرفی کرده که برای درخواستهای پیچیدهتر طراحی شده است. این نسخه میتواند قبل از پاسخ، مراحل بیشتری از تحلیل را انجام دهد و برای کارهایی که نیاز به برنامهریزی، استدلال چندمرحلهای یا استفاده از ابزارها دارند، عملکرد دقیقتری ارائه کند.
یکی از تغییرات مهم Gemini 3.8 Live، حرکت از یک «چتبات پاسخگو» به سمت یک «عامل هوشمند فعال» است. یعنی کاربر فقط سؤال نمیپرسد، بلکه میتواند از هوش مصنوعی برای انجام وظایف مختلف، دریافت راهنمایی لحظهای و همکاری در پروژهها استفاده کند.
این مدل در اختیار توسعهدهندگان از طریق Gemini API و Google AI Studio قرار گرفته و در برخی سرویسهای گوگل مانند اپلیکیشن Gemini و محصولات مرتبط نیز استفاده میشود.
ورود Gemini 3.8 Live نشان میدهد رقابت در بازار هوش مصنوعی دیگر فقط به قدرت تولید متن محدود نیست. شرکتهایی مانند گوگل، OpenAI و دیگر بازیگران این حوزه تلاش میکنند دستیارهایی بسازند که بتوانند مانند یک همراه دیجیتال دائماً با کاربر تعامل داشته باشند.
با این حال، مانند دیگر مدلهای هوش مصنوعی، Gemini 3.8 Live نیز محدودیتهایی دارد و ممکن است در برخی شرایط پاسخهای اشتباه تولید کند. گوگل اعلام کرده همچنان روی افزایش دقت، ایمنی و کاهش خطاهای این مدلها کار میکند.