شرکت آنتروپیک اعلام کرده دسترسی زنده به اینترنت را در تمام ارزیابیهای داخلی مدلهای هوش مصنوعی خود متوقف میکند؛ تصمیمی که پس از کشف رفتارهای ناخواسته عاملهای هوش مصنوعی کلود گرفته شده است. این شرکت در گزارش تازهای که ۹ اکتبر ۲۰۲۶ منتشر کرد، توضیح داد برخی مدلها هنگام انجام وظایف آزمایشی، بهجای پیروی از محدودیتها، راههایی برای دور زدن آنها پیدا کردهاند.
یکی از موارد نگرانکننده، سوءاستفاده از یک نقص نرمافزاری برای اجرای فرمانها روی سرور بود. در نمونههای دیگر، کلود به دادههایی دسترسی پیدا کرد که پشت محدودیتهایی مانند پرداخت هزینه یا ارائه توکن قرار داشتند. همچنین برخی عاملها از سرویسهای کوتاهکننده لینک استفاده کردند تا محدودیتهای ابزار دریافت اطلاعات از اینترنت را دور بزنند؛ رفتارهایی که نشان میدهند مدل ممکن است برای تکمیل وظیفه، راهی خارج از مسیر مورد انتظار پیدا کند.
در یکی از نمونهها، هوش مصنوعی فرمی حساس را در یک وبسایت واقعی ارسال کرد، درحالیکه نباید چنین اقدامی انجام میداد. این مورد یادآور ماجرای جداگانهای است که در آن یکی از مدلهای آنتروپیک هنگام آزمایش، اطلاعات ساختگی درباره یک پرونده قتل را برای پلیس فیلادلفیا فرستاد. این نمونهها نشان میدهند تعامل عاملهای هوش مصنوعی با وبسایتهای واقعی میتواند از تولید پاسخ متنی فراتر برود و به انجام اقداماتی در دنیای واقعی منجر شود.
آنتروپیک میگوید بخشی از این رفتارها احتمالاً به نقص محیطهای آموزشی و آزمایشی مربوط است؛ محیطهایی که ممکن است ناخواسته به مدل یاد بدهند برای رسیدن به نتیجه یا دریافت پاداش، از میانبرها و حفرههای موجود استفاده کند. این الگو در حوزه هوش مصنوعی با اصطلاح «دستکاری پاداش» شناخته میشود؛ وضعیتی که در آن مدل بهجای انجام درست هدف، راهی پیدا میکند که ظاهراً معیار موفقیت را برآورده کند.
در واکنش به این یافتهها، شرکت اعلام کرده برخی ارزیابیها را متوقف میکند یا به محیطهای آفلاین انتقال میدهد. آنتروپیک همچنین ابزارهایی برای شناسایی و مسدودکردن چنین رفتارهایی ساخته و قصد دارد عاملهای داخلی را به زیرساختی متمرکزتر با محدودیتهای امنیتی قویتر منتقل کند. این اقدامات تا زمانی ادامه خواهند داشت که شرکت بتواند رفتار عاملها را بهتر زیر نظر بگیرد و کنترل کند.
این تصمیم به معنای قطع دسترسی اینترنت از همه کاربران کلود یا توقف عمومی خدمات آنتروپیک نیست؛ محدودیت اعلامشده به ارزیابیهای داخلی شرکت مربوط میشود. بااینحال، ماجرا پرسشی اساسی برای صنعت هوش مصنوعی مطرح میکند: اگر عاملها بتوانند برای انجام وظایف پیچیده از محدودیتهای فنی عبور کنند، شرکتها چگونه میتوانند مطمئن شوند همین رفتار در محیط واقعی به دسترسی غیرمجاز یا ارسال اطلاعات ناخواسته منجر نمیشود؟