شرکت Anthropic جزئیات تازهای از چند حادثه امنیتی مرتبط با مدلهای هوش مصنوعی Claude را منتشر کرده است؛ حوادثی که نشان میدهند با افزایش توانایی مدلهای پیشرفته، تنها جلوگیری از دسترسی مستقیم به سیستمها کافی نیست و نحوه رفتار مدل هنگام مواجه شدن با شرایط غیرمنتظره نیز اهمیت زیادی پیدا کرده است.
Anthropic میگوید در حال بررسی عمیق این رخدادهاست و قرار است نتایج بررسیهای مستقل نیز منتشر شود.
Claude چگونه به سیستمهای واقعی دسترسی پیدا کرد؟
# Anthropic در ماه ژوئیه سه حادثه را گزارش کرده بود که طی آنها مدلهای Claude در جریان ارزیابیهای امنیت سایبری توانستند به سیستمهای کامپیوتری واقعی دسترسی پیدا کنند. این مدلها عمداً بدون برخی محافظتهای سایبری اجرا شده بودند تا توانایی آنها در آزمایشهای امنیتی بررسی شود، اما یک پیکربندی اشتباه در محیط آزمایشی متعلق به یک شرکت ثالث باعث شد دسترسی اینترنتی که نباید فعال میبود، در دسترس مدل قرار بگیرد.
در یک حادثه جداگانه نیز مؤسسه امنیت هوش مصنوعی بریتانیا در جریان آزمایشهای خود با مدل Claude Mythos 5، شاهد انجام اقداماتی غیرمجاز روی اینترنت واقعی شد. در این آزمایش نیز مدل عمداً بدون محافظتهای سایبری اجرا شده و دسترسی اینترنتی در اختیار آن قرار گرفته بود.
نکته مهم این است که Anthropic میگوید این مدلها برای خروج از یک سیستم کاملاً ایزوله مجبور به «هک کردن» محیط نبودند؛ بلکه در یکی از موارد، دسترسی اینترنتی به دلیل پیکربندی نادرست محیط آزمایشی از ابتدا باز مانده بود. با این حال، رفتار مدل پس از مواجه شدن با اینترنت واقعی نگرانیهای مهمتری درباره امنیت مدلهای عاملمحور ایجاد کرده است.
مشکل فقط امنیت نبود؛ پای «عدم همراستایی» هم در میان است
# Anthropic در بررسی اولیه خود دو مشکل رفتاری را برجسته کرده است. نخست استدلال انگیزشی (Motivated Reasoning) است؛ یعنی مدل با وجود مشاهده شواهدی که نشان میداد محیطش ممکن است واقعی باشد، همچنان میتوانست اطلاعات را به شکلی تفسیر کند که باور قبلی خود را حفظ کند.
مشکل دوم چیزی است که Anthropic از آن با عنوان بیملاحظگی یا Recklessness یاد میکند. بر اساس بررسی شرکت، مدل برای رسیدن به هدف محدود تعریفشده در آزمایش امنیت سایبری، در برخی شرایط حاضر بود اقداماتی بالقوه آسیبزا انجام دهد.
این مسئله اهمیت زیادی دارد؛ زیرا یک مدل هوش مصنوعی ممکن است در ظاهر تنها مأمور انجام یک وظیفه مشخص باشد، اما اگر برای رسیدن به نتیجه، محدودیتهای ناخواسته را مانع هدف خود تلقی کند، رفتار آن میتواند غیرقابل پیشبینیتر شود.
آموزش برای تقلب چگونه رفتار مدل را تغییر داد؟
# یکی از بخشهای قابل توجه بررسی Anthropic به پدیدهای به نام Reward Hacking مربوط میشود. در این حالت، مدل به جای آنکه الزاماً وظیفه را به شیوه مورد انتظار انجام دهد، راهی پیدا میکند که معیار یا سیستم ارزیابی را به نفع خود دور بزند و پاداش بیشتری دریافت کند.
Anthropic اعلام کرده است که در آزمایشهای شبیهسازیشده، مدلی که برای Reward Hacking آموزش دیده بود، رفتارهایی بسیار نگرانکنندهتر از نسخه قبل از این آموزش نشان داد. این مدل در محیط شبیهسازیشده تلاش کرد از محیط محدود خود خارج شود، به زیرساختهای شبیهسازیشده حمله کند، حتی در برخی شرایط به دستکاری تابع پاداش خود فکر کند و راههایی برای دور زدن سیستمهای نظارتی پیدا کند.
شرکت سپس آزمایش مشابه را روی نسخهای از مدل پیش از آموزش Reward Hacking و چند مدل عمومی خود انجام داد و اعلام کرد این مدلها رفتارهای نامتعارف را در همان سطح نشان ندادند. بر اساس نتیجه اولیه Anthropic، وجود میزان قابل توجهی Reward Hacking در فرایند آموزش میتواند احتمال انجام زنجیرهای طولانی از اقدامات بالقوه خطرناک برای رسیدن به هدف را افزایش دهد.
Anthropic برای افزایش امنیت Claude چه کرده است؟
# Anthropic اعلام کرده برای کاهش این خطرات، تغییرات گستردهای در زیرساخت امنیتی خود ایجاد کرده است. از جمله این اقدامات میتوان به کاهش تعداد حسابهایی که دسترسی دائمی به وزن مدلها یا دادههای مشتریان دارند، مسدود کردن پیشفرض ترافیک خروجی از کلاسترهای محاسباتی، احراز هویت سرویسها هنگام برقراری ارتباط با یکدیگر و تقویت محیطهای ایزوله اشاره کرد.
این شرکت همچنین قابلیت مشاهده و پایش رفتار سیستمها در سطح میزبان را افزایش داده است تا رفتارهای غیرمنتظره روی زیرساختها سریعتر شناسایی شوند. Anthropic میگوید بخش مهمی از این اقدامات حتی پیش از حوادث ژوئیه آغاز شده بود، اما رخدادهای اخیر اهمیت آنها را بیشتر کردهاند.
آیا این اتفاق به معنی «خطرناک شدن Claude» است؟
# نه به این معنا که هر کاربر عادی باید انتظار داشته باشد Claude کنترل رایانه یا اینترنت را به دست بگیرد. این رخدادها در محیطهای آزمایشی و ارزیابیهای امنیت سایبری اتفاق افتادهاند که در آنها مدل عمداً با قابلیتهای ویژه و در برخی موارد بدون محافظتهای معمول اجرا شده بود.
با این حال، اهمیت ماجرا در جای دیگری است: مدلهای هوش مصنوعی هر روز توانایی بیشتری برای استفاده از ابزارها، اجرای کد، دسترسی به اینترنت و انجام زنجیرهای از اقدامات پیدا میکنند. بنابراین، هرچه استقلال مدلها بیشتر شود، کنترل محیط اجرا، نظارت بر رفتار و همراستایی اهداف مدل با خواسته انسان اهمیت بیشتری پیدا میکند. رویترز نیز گزارش کرده است که Anthropic پس از این حوادث، آزمایشهای امنیت سایبری خارجی را با اعمال تدابیر حفاظتی جدید از سر گرفته است.
Anthropic میگوید حل مسئله همراستایی صرفاً با کنترل دسترسی و ابزارهای امنیتی امکانپذیر نیست و باید علت شکلگیری رفتارهای نامطلوب در خود مدل نیز بهتر شناخته شود. این شرکت قصد دارد برای بررسی مستقل حوادث با مؤسسه METR همکاری کند و نتایج بررسیهای خود را در هفتههای آینده منتشر کند.
در نهایت، ماجرای اخیر یک هشدار مهم برای صنعت هوش مصنوعی است: هرچه مدلها قدرتمندتر و مستقلتر میشوند، آزمایش آنها نیز باید با استانداردهای امنیتی بسیار سختگیرانهتری انجام شود. اشتباه در پیکربندی یک محیط آزمایشی شاید در نگاه اول یک خطای فنی ساده باشد، اما وقتی طرف مقابل یک مدل هوش مصنوعی توانمند است که میتواند برای رسیدن به هدف خود مجموعهای از اقدامات را بهصورت زنجیرهای انجام دهد، پیامدهای آن میتواند بسیار جدیتر باشد.