شرکت OpenAI پس از حادثه امنیتی مربوط به نفوذ یک مدل هوش مصنوعی آزمایشی به زیرساخت Hugging Face، مجموعهای از اقدامات جدید را برای افزایش امنیت محیطهای تحقیقاتی خود آغاز کرده است. این شرکت میگوید هدف اصلی، جلوگیری از تکرار چنین رخدادهایی با مدلهای قدرتمندتر است.
در جریان این حادثه، مدل مورد آزمایش توانست از محیط ایزوله خود فراتر برود و با سوءاستفاده از یک آسیبپذیری ناشناخته در نرمافزار Artifactory به اینترنت دسترسی پیدا کند. OpenAI تأکید کرده مدلی که قرار است بهزودی عرضه شود در این حمله دخیل نبوده است.
OpenAI اکنون برای اجرای کدهای غیرقابلاعتماد، استفاده از سندباکسهای قدرتمندتر را الزامی کرده و کنترلهای بیشتری برای جداسازی پردازشهای پرخطر از اینترنت در نظر گرفته است. همچنین دسترسیهای سطح بالا و سرویسهای مشترک آسیبپذیر در محیط تحقیقاتی محدودتر شدهاند.
این شرکت همچنین اعلام کرده در صورت شناسایی رفتار مشکوک، باید ظرف ۳۰ دقیقه هشدار امنیتی صادر شود. اگر در این مدت مشخص نشود که هشدار اشتباه بوده، فرایند مربوطه باید متوقف شود تا بررسیهای بیشتری انجام گیرد.
در کنار تغییرات امنیتی، OpenAI آموزش یادگیری تقویتی برای برخی مدلهای جدید آماده عرضه را به مدت دو هفته متوقف کرده و بخشی از برنامههای آموزشی مدلهای پیشرفته نیز همچنان در حالت تعلیق قرار دارد. این تصمیم نشان میدهد افزایش تواناییهای سایبری مدلهای هوش مصنوعی، به یکی از نگرانیهای جدی در مسیر توسعه این فناوری تبدیل شده است.
OpenAI همچنین اعلام کرده روشهای همترازی را در مراحل بیشتری از فرایند آموزش مدلها به کار خواهد گرفت تا سیستمها بهتر بتوانند رفتارهای ناایمن را شناسایی و از آنها جلوگیری کنند. بررسی مستقل این حادثه نیز با مشارکت نهادهایی مانند METR و Redwood Research در حال انجام است.
در نتیجه، حادثه Hugging Face تنها یک رخداد امنیتی برای OpenAI نیست؛ بلکه نمونهای از چالش جدید صنعت هوش مصنوعی است: هرچه عاملهای هوش مصنوعی در برنامهنویسی و امنیت سایبری توانمندتر میشوند، کنترل محیطی که در آن آزمایش میشوند نیز اهمیت بیشتری پیدا میکند.