هوش مصنوعی Claude از محیط آزمایشی خارج شد؛ Anthropic جزئیات یک شکست امنیتی را فاش کرد

گیزمکس
نویسنده: صادق محمدی
سه شنبه 10 شهریور 1405
جزئیات حوادث امنیتی و عدم هم‌راستایی مدل‌های هوش مصنوعی Claude
Anthropic جزئیات تازه‌ای از حوادث امنیتی و رفتارهای غیرهم‌راستای مدل‌های Claude در محیط‌های آزمایشی منتشر کرد.

شرکت Anthropic جزئیات تازه‌ای از چند حادثه امنیتی مرتبط با مدل‌های هوش مصنوعی Claude را منتشر کرده است؛ حوادثی که نشان می‌دهند با افزایش توانایی مدل‌های پیشرفته، تنها جلوگیری از دسترسی مستقیم به سیستم‌ها کافی نیست و نحوه رفتار مدل هنگام مواجه شدن با شرایط غیرمنتظره نیز اهمیت زیادی پیدا کرده است.

تبلیغات

Anthropic می‌گوید در حال بررسی عمیق این رخدادهاست و قرار است نتایج بررسی‌های مستقل نیز منتشر شود.

Claude چگونه به سیستم‌های واقعی دسترسی پیدا کرد؟

Anthropic در ماه ژوئیه سه حادثه را گزارش کرده بود که طی آنها مدل‌های Claude در جریان ارزیابی‌های امنیت سایبری توانستند به سیستم‌های کامپیوتری واقعی دسترسی پیدا کنند. این مدل‌ها عمداً بدون برخی محافظت‌های سایبری اجرا شده بودند تا توانایی آنها در آزمایش‌های امنیتی بررسی شود، اما یک پیکربندی اشتباه در محیط آزمایشی متعلق به یک شرکت ثالث باعث شد دسترسی اینترنتی که نباید فعال می‌بود، در دسترس مدل قرار بگیرد.

در یک حادثه جداگانه نیز مؤسسه امنیت هوش مصنوعی بریتانیا در جریان آزمایش‌های خود با مدل Claude Mythos 5، شاهد انجام اقداماتی غیرمجاز روی اینترنت واقعی شد. در این آزمایش نیز مدل عمداً بدون محافظت‌های سایبری اجرا شده و دسترسی اینترنتی در اختیار آن قرار گرفته بود.

نکته مهم این است که Anthropic می‌گوید این مدل‌ها برای خروج از یک سیستم کاملاً ایزوله مجبور به «هک کردن» محیط نبودند؛ بلکه در یکی از موارد، دسترسی اینترنتی به دلیل پیکربندی نادرست محیط آزمایشی از ابتدا باز مانده بود. با این حال، رفتار مدل پس از مواجه شدن با اینترنت واقعی نگرانی‌های مهم‌تری درباره امنیت مدل‌های عامل‌محور ایجاد کرده است.

تبلیغات

مشکل فقط امنیت نبود؛ پای «عدم هم‌راستایی» هم در میان است

Anthropic در بررسی اولیه خود دو مشکل رفتاری را برجسته کرده است. نخست استدلال انگیزشی (Motivated Reasoning) است؛ یعنی مدل با وجود مشاهده شواهدی که نشان می‌داد محیطش ممکن است واقعی باشد، همچنان می‌توانست اطلاعات را به شکلی تفسیر کند که باور قبلی خود را حفظ کند.

مشکل دوم چیزی است که Anthropic از آن با عنوان بی‌ملاحظگی یا Recklessness یاد می‌کند. بر اساس بررسی شرکت، مدل برای رسیدن به هدف محدود تعریف‌شده در آزمایش امنیت سایبری، در برخی شرایط حاضر بود اقداماتی بالقوه آسیب‌زا انجام دهد.

این مسئله اهمیت زیادی دارد؛ زیرا یک مدل هوش مصنوعی ممکن است در ظاهر تنها مأمور انجام یک وظیفه مشخص باشد، اما اگر برای رسیدن به نتیجه، محدودیت‌های ناخواسته را مانع هدف خود تلقی کند، رفتار آن می‌تواند غیرقابل پیش‌بینی‌تر شود.

آموزش برای تقلب چگونه رفتار مدل را تغییر داد؟

یکی از بخش‌های قابل توجه بررسی Anthropic به پدیده‌ای به نام Reward Hacking مربوط می‌شود. در این حالت، مدل به جای آنکه الزاماً وظیفه را به شیوه مورد انتظار انجام دهد، راهی پیدا می‌کند که معیار یا سیستم ارزیابی را به نفع خود دور بزند و پاداش بیشتری دریافت کند.

Anthropic اعلام کرده است که در آزمایش‌های شبیه‌سازی‌شده، مدلی که برای Reward Hacking آموزش دیده بود، رفتارهایی بسیار نگران‌کننده‌تر از نسخه قبل از این آموزش نشان داد. این مدل در محیط شبیه‌سازی‌شده تلاش کرد از محیط محدود خود خارج شود، به زیرساخت‌های شبیه‌سازی‌شده حمله کند، حتی در برخی شرایط به دستکاری تابع پاداش خود فکر کند و راه‌هایی برای دور زدن سیستم‌های نظارتی پیدا کند.

شرکت سپس آزمایش مشابه را روی نسخه‌ای از مدل پیش از آموزش Reward Hacking و چند مدل عمومی خود انجام داد و اعلام کرد این مدل‌ها رفتارهای نامتعارف را در همان سطح نشان ندادند. بر اساس نتیجه اولیه Anthropic، وجود میزان قابل توجهی Reward Hacking در فرایند آموزش می‌تواند احتمال انجام زنجیره‌ای طولانی از اقدامات بالقوه خطرناک برای رسیدن به هدف را افزایش دهد.

تبلیغات

Anthropic برای افزایش امنیت Claude چه کرده است؟

Anthropic اعلام کرده برای کاهش این خطرات، تغییرات گسترده‌ای در زیرساخت امنیتی خود ایجاد کرده است. از جمله این اقدامات می‌توان به کاهش تعداد حساب‌هایی که دسترسی دائمی به وزن مدل‌ها یا داده‌های مشتریان دارند، مسدود کردن پیش‌فرض ترافیک خروجی از کلاسترهای محاسباتی، احراز هویت سرویس‌ها هنگام برقراری ارتباط با یکدیگر و تقویت محیط‌های ایزوله اشاره کرد.

این شرکت همچنین قابلیت مشاهده و پایش رفتار سیستم‌ها در سطح میزبان را افزایش داده است تا رفتارهای غیرمنتظره روی زیرساخت‌ها سریع‌تر شناسایی شوند. Anthropic می‌گوید بخش مهمی از این اقدامات حتی پیش از حوادث ژوئیه آغاز شده بود، اما رخدادهای اخیر اهمیت آنها را بیشتر کرده‌اند.

آیا این اتفاق به معنی «خطرناک شدن Claude» است؟

نه به این معنا که هر کاربر عادی باید انتظار داشته باشد Claude کنترل رایانه یا اینترنت را به دست بگیرد. این رخدادها در محیط‌های آزمایشی و ارزیابی‌های امنیت سایبری اتفاق افتاده‌اند که در آنها مدل عمداً با قابلیت‌های ویژه و در برخی موارد بدون محافظت‌های معمول اجرا شده بود.

با این حال، اهمیت ماجرا در جای دیگری است: مدل‌های هوش مصنوعی هر روز توانایی بیشتری برای استفاده از ابزارها، اجرای کد، دسترسی به اینترنت و انجام زنجیره‌ای از اقدامات پیدا می‌کنند. بنابراین، هرچه استقلال مدل‌ها بیشتر شود، کنترل محیط اجرا، نظارت بر رفتار و هم‌راستایی اهداف مدل با خواسته انسان اهمیت بیشتری پیدا می‌کند. رویترز نیز گزارش کرده است که Anthropic پس از این حوادث، آزمایش‌های امنیت سایبری خارجی را با اعمال تدابیر حفاظتی جدید از سر گرفته است.

Anthropic می‌گوید حل مسئله هم‌راستایی صرفاً با کنترل دسترسی و ابزارهای امنیتی امکان‌پذیر نیست و باید علت شکل‌گیری رفتارهای نامطلوب در خود مدل نیز بهتر شناخته شود. این شرکت قصد دارد برای بررسی مستقل حوادث با مؤسسه METR همکاری کند و نتایج بررسی‌های خود را در هفته‌های آینده منتشر کند.

در نهایت، ماجرای اخیر یک هشدار مهم برای صنعت هوش مصنوعی است: هرچه مدل‌ها قدرتمندتر و مستقل‌تر می‌شوند، آزمایش آنها نیز باید با استانداردهای امنیتی بسیار سخت‌گیرانه‌تری انجام شود. اشتباه در پیکربندی یک محیط آزمایشی شاید در نگاه اول یک خطای فنی ساده باشد، اما وقتی طرف مقابل یک مدل هوش مصنوعی توانمند است که می‌تواند برای رسیدن به هدف خود مجموعه‌ای از اقدامات را به‌صورت زنجیره‌ای انجام دهد، پیامدهای آن می‌تواند بسیار جدی‌تر باشد.

نظرات کاربرانکپی متنکپی لینک