شرکت انتروپیک به تازگی در جریان یک بررسی متوجه شده مدل هوش مصنوعی Claude هنگام انجام آزمایشهای امنیت سایبری توانسته از محیط آزمایشی خارج شود و به سیستمهای واقعی سه سازمان دسترسی غیرمجاز پیدا کند. این اطلاعات در حالی منتشر میشود که چند هفته پیش حادثه مشابهای برای OpenAI رخ داد و در آن یکی از مدلهای آزمایشی توانست به سیستمهای شرکت Hugging Face نفوذ کند.
بیشتر بخوانید: اشتباه انسانی در OpenAI، عامل حمله هوش مصنوعی به Hugging Face شد
درست چند هفته پس از اینکه یکی از مدلهای آزمایشی OpenAI توانست با خروج از محیط ایزوله و آزمایشگاهی خود، سرورهای شرکت Hugging Face را هک و به آن دسترسی غیرمجاز پیدا کند، این اتفاق از برای یکی از مدلهای آزمایشی شرکت انتروپیک نیز رخ داد. به گفته این شرکت در بررسیها مشخص شده که این مدل توانسته با اتصال به اینترنت از این محیط تست خارج شود به صورت غیرمجاز به سیستمهای سه سازمان مختلف دسترسی پیدا کند.
Anthropic در گزارش خود توضیح داده است که این دسترسی غیرمجاز زمانی صورت گرفته که مدل Claude در یک محیط آزمایشی ایزوله قرار داشت، اما به دلیل تعیین تنظیمات اشتباه، دسترسی به اینترنت برای آن فعال بوده است. این شرکت تاکید کرده که مدلها در حالت عادی نباید امکان ارتباط با اینترنت یا دسترسی به سیستمهای خارج از محیط تست را داشته باشند، اما یک اشتباه در تنظیمات زیرساخت آزمایش باعث شد این محدودیت وجود نداشته باشد.
براساس گزارش Techcrunch، انتروپیک اعلام کرده است از میان 141 هزار و 6 اجرای آزمایشی بررسی شده، در سه مورد Claude توانسته از طریق اینترنت به زیرساختهای واقعی دسترسی پیدا کند. این اتفاقها در همکاری با شرکت امنیت سایبری Irregular رخ داده و Anthropic اعلام کرده که دلیل اصلی این مشکل، بیتوجهی دو شرکت به فعال یا غیرفعال بودن دسترسی اینترنتی در محیط آزمایش بوده است.
انتروپیک همچنین اعلام کرده که قصد ندارد مسئولیت را متوجه شریک خود کند و هم اکنون مشغول بررسیهای لازم برای رفع این مشکل است. شرکت Irregular نیز اعلام کرده بررسی مستقلی درباره ابعاد این حادثه آغاز کرده است.
سه مدل Claude در این دسترسی غیرمجاز چگونه رفتار کردند؟
# این سه حادثه مربوط به سه مدل مختلف از Claude بوده است: Opus 4.7، Mythos 5 و یک مدل آزمایشی داخلی که هنوز به صورت عمومی عرضه نشده است. نکته جالب در بررسی Anthropic این است که هر سه مدل در ابتدای آزمایش به طور صریح در دستورهای خود اعلام کرده بودند که به اینترنت دسترسی ندارند. با این حال، زمانی که مدلها در جریان عملیات خود به سیستمهای واقعی رسیدند، رفتار متفاوتی از خود نشان دادند.
مدل Opus 4.7 در تمام چهار اجرای مربوط به این حادثه متوجه شد که وارد یک سیستم واقعی شده است. با این حال، در برخی موارد تصور کرد که احتمالاً این سیستم واقعی بخشی از آزمایش است و همچنان به فعالیت خود ادامه داد. این مدل حتی توانست اطلاعاتی حیاتی را استخراج کند و با پایگاه دادههای حاوی اطلاعات واقعی ارتباط برقرار کند.
مدل Mythos 5 نیز نشانههایی از اتصال به اینترنت واقعی مشاهده کرد، اما دوباره خود را متقاعد کرد که همچنان در یک محیط شبیهسازی شده قرار دارد. این مدل در ادامه یک بسته نرمافزاری مخرب را در PyPI منتشر کرد. بستهای که توسط برخی سیستمها دانلود و اجرا شد، اما در نهایت مورد شناسایی قرار گرفت.
در مقابل، مدل آزمایشی جدید Anthropic رفتار محتاطانهتری داشت. این مدل پس از اینکه متوجه شد هدف مورد نظر یک سیستم واقعی است، عملیات را متوقف کرد.
آیا دسترسی غیرمجاز مدلهای انتروپیک و OpenAI به یکدیگر شباهت دارند؟
# Anthropic تاکید کرده است که این اتفاقها به معنی آن نیست که Claude به صورت مستقل قصد حمله یا آسیبرسانی داشته است. طبق بررسی این شرکت، مدلها صرفاً تلاش میکردند دستوری را که دریافت کردهاند اجرا کنند و هیچ نشانهای از دنبال کردن یک هدف مستقل به صورت خودمختار مشاهده نشده است.
با این حال، این حادثه نشان میدهد که مدلهای پیشرفته هوش مصنوعی میتوانند خطرهای امنیتی جدی ایجاد کنند. انتروپیک اعلام کرده برای آزمایش مدلهای قدرتمند باید کنترلهای امنیتی سختگیرانهتری اعمال شود، زیرا حتی یک اشتباه کوچک در تنظیمات محیط آزمایش میتواند پیامدهای جبران ناپذیری داشته باشد.
با وجود شباهت ظاهری این اتفاق با دسترسی غیرمجاز مدل OpenAI که چند هفته پیش صورت گرفت، انتروپیک اعلام کرده که آنها تفاوت مهمی با یکدیگر دارند. در ماجرای OpenAI، مدل این شرکت از یک آسیبپذیری نرمافزاری ناشناخته برای خروج از محیط آزمایش استفاده کرده بود، اما مدلهای Claude به دلیل اشتباه در دسترسی به اینترنت توانستهاند به سیستمهای خارجی دسترسی پیدا کنند.