گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده است؛ یک مدل هوش مصنوعی اختصاصی برای تبدیل گفتار به متن که قرار است تجربه تایپ صوتی را بسیار طبیعیتر و کاربردیتر کند. این مدل میتواند صحبتهای معمولی کاربر را دریافت کرده و آنها را به متنی مرتب، خوانا و قالببندیشده تبدیل کند.
یکی از قابلیتهای جالب Gemini 3.5 Transcribe، تشخیص اصلاحات حین صحبت کردن است. برای مثال اگر کاربر بگوید «جلسه سهشنبه، نه چهارشنبه»، مدل میتواند نسخه اصلاحشده را در متن نهایی ثبت کند و نیازی نیست کاربر بعداً متن را دستی ویرایش کند. همچنین کلمات پرکننده مانند «اِم» و «اوه» از متن نهایی حذف میشوند.
این مدل برای محیطهای شلوغ و مکالمات طبیعی نیز طراحی شده و میتواند واژگان تخصصی و کلمات سفارشی را بهتر تشخیص دهد. گوگل اعلام کرده Gemini 3.5 Transcribe از بیش از ۸۵ زبان پشتیبانی میکند و میتواند زبانهای مختلف را حتی در جریان یک مکالمه تشخیص دهد.
برای فایلهای صوتی از پیش ضبطشده، امکان تشخیص گویندگان، ثبت زمان دقیق کلمات و تبدیل جلسات و مکالمات به متن نیز وجود دارد. این قابلیت میتواند برای دانشجویان، خبرنگاران، تولیدکنندگان محتوا و افرادی که جلسات کاری زیادی دارند، کاربرد زیادی داشته باشد.
گوگل همچنین اعلام کرده Gemini 3.5 Transcribe در حال حاضر در قابلیت Rambler روی اندروید و برخی قابلیتهای صوتی اپلیکیشن Gemini در macOS استفاده میشود. توسعهدهندگان نیز میتوانند این مدل را از طریق Gemini API و Google AI Studio آزمایش کنند.
یکی از کاربردهای جذاب این فناوری، امکان استفاده از فرمانهای صوتی برای ویرایش متن است. گوگل قصد دارد این قابلیت را به مرور در بخشهای بیشتری از محصولات خود قرار دهد و پشتیبانی از تایپ صوتی در مرورگر Chrome نیز در آینده نزدیک ارائه خواهد شد؛ در این حالت کاربر میتواند در هر کادر متنی وب با صحبت کردن، متن خود را وارد کند.
از نظر سرعت نیز گوگل میگوید زمان رسیدن از صدای ورودی به متن نهایی نسبت به مدل قبلی حدود ۷۰ درصد کاهش یافته است. بر اساس ارزیابیهای منتشرشده، نرخ خطای کلمه برای حالت استریم حدود ۴ درصد و برای پردازش غیربرخط حدود ۲.۶ درصد گزارش شده است.
در مجموع، Gemini 3.5 Transcribe فقط یک ابزار ساده تبدیل صدا به متن نیست؛ هدف گوگل این است که هوش مصنوعی بتواند منظور کاربر را از صحبتهای طبیعی متوجه شود، اشتباهات و مکثها را اصلاح کند و خروجی نهایی را شبیه متنی آماده استفاده تحویل دهد. این قابلیت میتواند تایپ صوتی را برای استفاده روزمره بسیار کاربردیتر کند.
Gemini 3.5 Transcribe چه قابلیتهایی دارد؟
# | قابلیت | جزئیات |
| تبدیل صدا به متن | تبدیل گفتار طبیعی به متن مرتب و قالببندیشده |
| حذف کلمات اضافی | حذف عباراتی مانند «اِم» و «اوه» |
| اصلاح خودکار صحبت | تشخیص اصلاحات و تغییرات حین صحبت |
| زبانها | بیش از ۸۵ زبان |
| تشخیص گوینده | برای فایلهای صوتی از پیش ضبطشده |
| واژگان سفارشی | امکان تعریف اصطلاحات تخصصی |
| تایپ صوتی | پشتیبانی در برخی محصولات گوگل و قابلیتهای جدید |