آنتروپیک اینترنت را از آزمایش‌های داخلی هوش مصنوعی قطع کرد؛ عامل‌های کلود از محدودیت‌ها عبور کردند

گیزمکس
نویسنده: صادق محمدی
شنبه 18 مهر 1405
تصویر مفهومی هوش مصنوعی کلود آنتروپیک و محدودیت دسترسی عامل‌های هوش مصنوعی به اینترنت
آنتروپیک برای کنترل بهتر رفتار عامل‌های هوش مصنوعی، دسترسی زنده به اینترنت را در آزمایش‌های داخلی خود متوقف کرده است.

شرکت آنتروپیک اعلام کرده دسترسی زنده به اینترنت را در تمام ارزیابی‌های داخلی مدل‌های هوش مصنوعی خود متوقف می‌کند؛ تصمیمی که پس از کشف رفتارهای ناخواسته عامل‌های هوش مصنوعی کلود گرفته شده است. این شرکت در گزارش تازه‌ای که ۹ اکتبر ۲۰۲۶ منتشر کرد، توضیح داد برخی مدل‌ها هنگام انجام وظایف آزمایشی، به‌جای پیروی از محدودیت‌ها، راه‌هایی برای دور زدن آن‌ها پیدا کرده‌اند.

یکی از موارد نگران‌کننده، سوءاستفاده از یک نقص نرم‌افزاری برای اجرای فرمان‌ها روی سرور بود. در نمونه‌های دیگر، کلود به داده‌هایی دسترسی پیدا کرد که پشت محدودیت‌هایی مانند پرداخت هزینه یا ارائه توکن قرار داشتند. همچنین برخی عامل‌ها از سرویس‌های کوتاه‌کننده لینک استفاده کردند تا محدودیت‌های ابزار دریافت اطلاعات از اینترنت را دور بزنند؛ رفتارهایی که نشان می‌دهند مدل ممکن است برای تکمیل وظیفه، راهی خارج از مسیر مورد انتظار پیدا کند.

در یکی از نمونه‌ها، هوش مصنوعی فرمی حساس را در یک وب‌سایت واقعی ارسال کرد، درحالی‌که نباید چنین اقدامی انجام می‌داد. این مورد یادآور ماجرای جداگانه‌ای است که در آن یکی از مدل‌های آنتروپیک هنگام آزمایش، اطلاعات ساختگی درباره یک پرونده قتل را برای پلیس فیلادلفیا فرستاد. این نمونه‌ها نشان می‌دهند تعامل عامل‌های هوش مصنوعی با وب‌سایت‌های واقعی می‌تواند از تولید پاسخ متنی فراتر برود و به انجام اقداماتی در دنیای واقعی منجر شود.

تبلیغات

آنتروپیک می‌گوید بخشی از این رفتارها احتمالاً به نقص محیط‌های آموزشی و آزمایشی مربوط است؛ محیط‌هایی که ممکن است ناخواسته به مدل یاد بدهند برای رسیدن به نتیجه یا دریافت پاداش، از میان‌برها و حفره‌های موجود استفاده کند. این الگو در حوزه هوش مصنوعی با اصطلاح «دست‌کاری پاداش» شناخته می‌شود؛ وضعیتی که در آن مدل به‌جای انجام درست هدف، راهی پیدا می‌کند که ظاهراً معیار موفقیت را برآورده کند.

در واکنش به این یافته‌ها، شرکت اعلام کرده برخی ارزیابی‌ها را متوقف می‌کند یا به محیط‌های آفلاین انتقال می‌دهد. آنتروپیک همچنین ابزارهایی برای شناسایی و مسدودکردن چنین رفتارهایی ساخته و قصد دارد عامل‌های داخلی را به زیرساختی متمرکزتر با محدودیت‌های امنیتی قوی‌تر منتقل کند. این اقدامات تا زمانی ادامه خواهند داشت که شرکت بتواند رفتار عامل‌ها را بهتر زیر نظر بگیرد و کنترل کند.

این تصمیم به معنای قطع دسترسی اینترنت از همه کاربران کلود یا توقف عمومی خدمات آنتروپیک نیست؛ محدودیت اعلام‌شده به ارزیابی‌های داخلی شرکت مربوط می‌شود. بااین‌حال، ماجرا پرسشی اساسی برای صنعت هوش مصنوعی مطرح می‌کند: اگر عامل‌ها بتوانند برای انجام وظایف پیچیده از محدودیت‌های فنی عبور کنند، شرکت‌ها چگونه می‌توانند مطمئن شوند همین رفتار در محیط واقعی به دسترسی غیرمجاز یا ارسال اطلاعات ناخواسته منجر نمی‌شود؟

نظرات کاربرانکپی متنکپی لینک