Grok Voice Think Fast 2.0، مدل جدید هوش مصنوعی صوتی شرکت xAI، در یکی از مهمترین ارزیابیهای مربوط به عاملهای صوتی هوش مصنوعی به رتبه نخست رسیده است. این مدل با تمرکز بر مکالمه بلادرنگ، استدلال صوتی و اجرای وظایف چندمرحلهای طراحی شده و xAI آن را قدرتمندترین مدل صوتی خود معرفی میکند.
بر اساس دادههای Artificial Analysis که xAI نیز به آن استناد کرده، Grok Voice Think Fast 2.0 در شاخص Agentic Performance بنچمارک τ-voice امتیاز ۵۶.۵ درصد به دست آورده است. این رقم بالاتر از ۴۵.۷ درصد برای GPT-Realtime-2.1 و ۳۷.۷ درصد برای Gemini 3.1 Flash است.
یکی از نقاط قوت مهم این مدل، سرعت پاسخگویی آن است. زمان رسیدن Grok Voice Think Fast 2.0 به نخستین خروجی صوتی تنها ۰.۷ ثانیه اعلام شده؛ رقمی که برای کاربردهایی مانند پشتیبانی تلفنی، فروش، رزرو و دستیارهای صوتی تعاملی اهمیت زیادی دارد.
xAI همچنین میگوید دقت تشخیص گفتار این مدل در آزمایشهایی با هزاران عبارت کوتاه و ۲۴ زبان، نسبت به مدلهایی مانند Deepgram Nova 3 و ElevenLabs Scribe v2 بین ۱.۵ تا ۲ برابر بهتر بوده است. این شرکت همچنین روی عملکرد مدل در شرایط واقعی مانند صدای پسزمینه، کیفیت پایین تماس تلفنی و محیطهای پر سروصدا تمرکز کرده است.
Grok Voice Think Fast 2.0 علاوه بر شنیدن و پاسخگویی، میتواند هنگام صحبت کردن کاربر فرایند استدلال را نیز انجام دهد و در صورت نیاز از ابزارهای مختلف استفاده کند. xAI میگوید این ویژگی باعث میشود اجرای درخواستهای چندمرحلهای و فراخوانی ابزارها بدون ایجاد تأخیر محسوس انجام شود.
| مدل | Agentic Performance | زمان اولین صدای خروجی |
| Grok Voice Think Fast 2.0 | ۵۶.۵٪ | ۰.۷ ثانیه |
| GPT-Realtime-2.1 High | ۴۵.۷٪ | اعلام نشده |
| Gemini 3.1 Flash High | ۳۷.۷٪ | ۲.۹۸ ثانیه |