جمنای ۳.۵ ترنسکرایب معرفی شد؛ تبدیل صدای شما به متن مرتب و هوشمند

گیزمکس
نویسنده: صادق محمدی
پنجنشبه 05 شهریور 1405
مدل هوش مصنوعی Gemini 3.5 Transcribe گوگل برای تبدیل صدا به متن
گوگل Gemini 3.5 Transcribe را با قابلیت تبدیل هوشمند گفتار به متن، حذف کلمات اضافی و تشخیص اصلاحات حین صحبت معرفی کرد.

گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده است؛ یک مدل هوش مصنوعی اختصاصی برای تبدیل گفتار به متن که قرار است تجربه تایپ صوتی را بسیار طبیعی‌تر و کاربردی‌تر کند. این مدل می‌تواند صحبت‌های معمولی کاربر را دریافت کرده و آن‌ها را به متنی مرتب، خوانا و قالب‌بندی‌شده تبدیل کند.

یکی از قابلیت‌های جالب Gemini 3.5 Transcribe، تشخیص اصلاحات حین صحبت کردن است. برای مثال اگر کاربر بگوید «جلسه سه‌شنبه، نه چهارشنبه»، مدل می‌تواند نسخه اصلاح‌شده را در متن نهایی ثبت کند و نیازی نیست کاربر بعداً متن را دستی ویرایش کند. همچنین کلمات پرکننده مانند «اِم» و «اوه» از متن نهایی حذف می‌شوند.

این مدل برای محیط‌های شلوغ و مکالمات طبیعی نیز طراحی شده و می‌تواند واژگان تخصصی و کلمات سفارشی را بهتر تشخیص دهد. گوگل اعلام کرده Gemini 3.5 Transcribe از بیش از ۸۵ زبان پشتیبانی می‌کند و می‌تواند زبان‌های مختلف را حتی در جریان یک مکالمه تشخیص دهد.

برای فایل‌های صوتی از پیش ضبط‌شده، امکان تشخیص گویندگان، ثبت زمان دقیق کلمات و تبدیل جلسات و مکالمات به متن نیز وجود دارد. این قابلیت می‌تواند برای دانشجویان، خبرنگاران، تولیدکنندگان محتوا و افرادی که جلسات کاری زیادی دارند، کاربرد زیادی داشته باشد.

تبلیغات

گوگل همچنین اعلام کرده Gemini 3.5 Transcribe در حال حاضر در قابلیت Rambler روی اندروید و برخی قابلیت‌های صوتی اپلیکیشن Gemini در macOS استفاده می‌شود. توسعه‌دهندگان نیز می‌توانند این مدل را از طریق Gemini API و Google AI Studio آزمایش کنند.

یکی از کاربردهای جذاب این فناوری، امکان استفاده از فرمان‌های صوتی برای ویرایش متن است. گوگل قصد دارد این قابلیت را به مرور در بخش‌های بیشتری از محصولات خود قرار دهد و پشتیبانی از تایپ صوتی در مرورگر Chrome نیز در آینده نزدیک ارائه خواهد شد؛ در این حالت کاربر می‌تواند در هر کادر متنی وب با صحبت کردن، متن خود را وارد کند.

از نظر سرعت نیز گوگل می‌گوید زمان رسیدن از صدای ورودی به متن نهایی نسبت به مدل قبلی حدود ۷۰ درصد کاهش یافته است. بر اساس ارزیابی‌های منتشرشده، نرخ خطای کلمه برای حالت استریم حدود ۴ درصد و برای پردازش غیربرخط حدود ۲.۶ درصد گزارش شده است.

در مجموع، Gemini 3.5 Transcribe فقط یک ابزار ساده تبدیل صدا به متن نیست؛ هدف گوگل این است که هوش مصنوعی بتواند منظور کاربر را از صحبت‌های طبیعی متوجه شود، اشتباهات و مکث‌ها را اصلاح کند و خروجی نهایی را شبیه متنی آماده استفاده تحویل دهد. این قابلیت می‌تواند تایپ صوتی را برای استفاده روزمره بسیار کاربردی‌تر کند.

Gemini 3.5 Transcribe چه قابلیت‌هایی دارد؟

قابلیت جزئیات
تبدیل صدا به متن تبدیل گفتار طبیعی به متن مرتب و قالب‌بندی‌شده
حذف کلمات اضافی حذف عباراتی مانند «اِم» و «اوه»
اصلاح خودکار صحبت تشخیص اصلاحات و تغییرات حین صحبت
زبان‌ها بیش از ۸۵ زبان
تشخیص گوینده برای فایل‌های صوتی از پیش ضبط‌شده
واژگان سفارشی امکان تعریف اصطلاحات تخصصی
تایپ صوتی پشتیبانی در برخی محصولات گوگل و قابلیت‌های جدید

نظرات کاربرانکپی متنکپی لینک