گراک Voice Transcribe 2.0 معرفی شد؛ دقت تبدیل گفتار به متن دو برابر شد

گیزمکس
نویسنده: فوائد مبینی
سه شنبه 31 شهریور 1405
Grok Voice Transcribe 2.0 مدل جدید xAI برای تبدیل گفتار به متن و پردازش صوتی
مدل هوش مصنوعی Grok Voice Transcribe 2.0 برای تبدیل گفتار به متن

شرکت xAI از مدل جدید Grok Voice Transcribe 2.0 رونمایی کرد؛ مدلی برای تبدیل گفتار به متن که به‌طور ویژه برای پردازش مکالمات واقعی، صداهای پرنویز و محتوای چندزبانه توسعه یافته است. xAI می‌گوید این مدل در مقایسه با نسل قبلی، Grok Voice Transcribe 1.0، دو برابر دقیق‌تر شده است.

یکی از تغییرات مهم نسخه جدید، بهبود تشخیص گفتار در شرایط دشوار است. این مدل برای پردازش تماس‌های تلفنی، مکالمات چندنفره، صداهای پس‌زمینه و حتی اطلاعاتی مانند شماره تلفن، ایمیل و آدرس بهینه شده است. xAI همچنین اعلام کرده Voice Transcribe 2.0 در رتبه‌بندی عمومی Artificial Analysis در میان ۳۲ مدل استریمینگ، بالاترین دقت را به دست آورده است.

پشتیبانی چندزبانه نیز یکی از تمرکزهای اصلی xAI در این مدل است. Voice Transcribe 2.0 می‌تواند زبان صحبت را به‌صورت خودکار تشخیص دهد و حتی در صورت تغییر زبان در میانه مکالمه، فرایند رونویسی را بدون نیاز به پردازش جداگانه ادامه دهد. طبق آزمایش xAI، نرخ خطای کلمه در فرمان‌های کوتاه صوتی چندزبانه از ۲۰.۶ درصد به ۶.۸ درصد کاهش یافته است.

این مدل امکاناتی مانند تشخیص گوینده، زمان‌بندی دقیق در سطح کلمه، پردازش چندکاناله تا هشت کانال، حذف کلمات پرکننده و تشخیص پایان صحبت گوینده را نیز ارائه می‌دهد. همچنین توسعه‌دهندگان می‌توانند تا ۱۰۰ اصطلاح تخصصی را برای بهبود تشخیص کلمات خاص به مدل معرفی کنند.

تبلیغات

Grok Voice Transcribe 2.0 از طریق API برای پردازش فایل‌های صوتی و استریم زنده در دسترس قرار گرفته و طبق اعلام xAI، قیمت آن نسبت به نسل قبلی تغییری نکرده است؛ هزینه پردازش دسته‌ای ۰.۱۰ دلار به ازای هر ساعت صوت و پردازش بلادرنگ ۰.۲۰ دلار به ازای هر ساعت تعیین شده است. xAI همچنین قصد دارد این مدل را به مدل پیش‌فرض سرویس Speech-to-Text تبدیل کند و پشتیبانی از نسخه 1.0 را در هفته‌های آینده متوقف کند.

نظرات کاربرانکپی متنکپی لینک