شرکت xAI از مدل جدید Grok Voice Transcribe 2.0 رونمایی کرد؛ مدلی برای تبدیل گفتار به متن که بهطور ویژه برای پردازش مکالمات واقعی، صداهای پرنویز و محتوای چندزبانه توسعه یافته است. xAI میگوید این مدل در مقایسه با نسل قبلی، Grok Voice Transcribe 1.0، دو برابر دقیقتر شده است.
یکی از تغییرات مهم نسخه جدید، بهبود تشخیص گفتار در شرایط دشوار است. این مدل برای پردازش تماسهای تلفنی، مکالمات چندنفره، صداهای پسزمینه و حتی اطلاعاتی مانند شماره تلفن، ایمیل و آدرس بهینه شده است. xAI همچنین اعلام کرده Voice Transcribe 2.0 در رتبهبندی عمومی Artificial Analysis در میان ۳۲ مدل استریمینگ، بالاترین دقت را به دست آورده است.
پشتیبانی چندزبانه نیز یکی از تمرکزهای اصلی xAI در این مدل است. Voice Transcribe 2.0 میتواند زبان صحبت را بهصورت خودکار تشخیص دهد و حتی در صورت تغییر زبان در میانه مکالمه، فرایند رونویسی را بدون نیاز به پردازش جداگانه ادامه دهد. طبق آزمایش xAI، نرخ خطای کلمه در فرمانهای کوتاه صوتی چندزبانه از ۲۰.۶ درصد به ۶.۸ درصد کاهش یافته است.
این مدل امکاناتی مانند تشخیص گوینده، زمانبندی دقیق در سطح کلمه، پردازش چندکاناله تا هشت کانال، حذف کلمات پرکننده و تشخیص پایان صحبت گوینده را نیز ارائه میدهد. همچنین توسعهدهندگان میتوانند تا ۱۰۰ اصطلاح تخصصی را برای بهبود تشخیص کلمات خاص به مدل معرفی کنند.
Grok Voice Transcribe 2.0 از طریق API برای پردازش فایلهای صوتی و استریم زنده در دسترس قرار گرفته و طبق اعلام xAI، قیمت آن نسبت به نسل قبلی تغییری نکرده است؛ هزینه پردازش دستهای ۰.۱۰ دلار به ازای هر ساعت صوت و پردازش بلادرنگ ۰.۲۰ دلار به ازای هر ساعت تعیین شده است. xAI همچنین قصد دارد این مدل را به مدل پیشفرض سرویس Speech-to-Text تبدیل کند و پشتیبانی از نسخه 1.0 را در هفتههای آینده متوقف کند.