شرکت‌های هوش مصنوعی کتاب‌های فوق‌العاده نایاب را نابود می‌کنند تا هیچ‌کس دیگری نتواند آن‌ها را بخواند

تکفارس
نویسنده: عرفان بدری
دوشنبه 12 مرداد 1405
نابود کردن کتاب های نایاب توسط شرکت های هوش مصنوعی
شرکت‌های هوش مصنوعی کتاب‌های فوق‌العاده نایاب را نابود می‌کنند تا هیچ‌کس دیگری نتواند آن‌ها را بخواند

توسعه بی‌رویه هوش مصنوعی، اکنون به قیمت نابودی کتاب‌های چندصدساله‌ای تمام می‌شود که حتی از دل جنگ‌های ویرانگر تاریخ نیز جان سالم به در برده بودند.

شرکت‌های توسعه‌دهنده هوش مصنوعی، روزبه‌روز تمایل بیشتری به استفاده از کتاب‌های چاپی منتشرشده تا پیش از سال ۲۰۲۲ پیدا می‌کنند. دلیل این امر روشن است: این کتاب‌ها دقیقا قبل از دوران شکوفایی و استفاده‌ی گسترده از متون تولیدشده توسط خود هوش مصنوعی نوشته شده‌اند و به همین دلیل، بهترین خوراک برای آموزش سیستم‌های جدید محسوب می‌شوند.

تبلیغات

گزارش‌ها نشان می‌دهند که در جریان پروژه‌های عظیم اسکن کتاب‌ها، شیرازه آن‌ها با تیغ بریده شده و صفحاتشان تکه‌تکه می‌شوند تا در نهایت، نسخه فیزیکی کتاب به طور کامل نابود شود؛ این شرکت‌ها با نابود کردن این آثار، تنها یک هدف را دنبال می‌کنند: استخراج کلمات کتاب‌ها و تبدیل آن‌ها به بانک‌های اطلاعاتی دیجیتال، تا از این طریق مدل‌های زبانی بزرگ (LLM) خود را آموزش دهند. این رویه مخرب، موجی از انتقادات تند را به همراه داشته است؛ چرا که طبق بررسی‌ها، برخی از کتاب‌هایی که طعمه این فرآیند می‌شوند، به‌شدت نایاب هستند و از بین رفتن آن‌ها، زنگ خطر یک فاجعه و خسارت فرهنگی غیرقابل‌جبران را به صدا درآورده است.

کتاب‌های پیش از سال ۲۰۲۲؛ گنجینه‌ای بی‌بدیل برای آموزش هوش مصنوعی

بر اساس گزارش‌های منتشرشده از سوی رسانه ۴۰۴ مدیا، یک شرکت تأمین‌کننده داده به نام ISBNdb، کتاب‌های فیزیکی را به صورت فله‌ای و عمده به شرکت‌های توسعه‌دهنده هوش مصنوعی می‌فروشد. این شرکت‌ها به شدت تشنه متن‌هایی هستند که منحصرا توسط انسان نوشته شده باشند و هیچ ردی از نوشته‌های ماشینی و چت‌بات‌های امروزی در آن‌ها یافت نشود. شرکت ISBNdb مدعی است که کتاب‌های چاپ‌شده تا پیش از سال ۲۰۲۲، داده‌های پاک‌تری را فراهم می‌کنند، زیرا در آن زمان هنوز سر و کله متن‌های تولیدشده توسط هوش مصنوعی پیدا نشده بود.

این کتاب‌های قدیمی برخلاف محتوای امروز اینترنت که روزبه‌روز با متن‌های بی‌کیفیت ماشینی پر می‌شود، آثاری غنی، ویراستاری‌شده و کاملا معتبر به شمار می‌روند. از طرفی، استفاده از این کتاب‌ها جلوی یک پدیده خطرناک فنی به نام فروپاشی مدل (Model Collapse) را می‌گیرد. این پدیده زمانی رخ می‌دهد که یک سیستم هوش مصنوعی، برای یادگیری، مدام از متن‌هایی استفاده کند که قبلا توسط یک هوش مصنوعی دیگر تولید شده‌اند؛ چرخه باطلی که در نهایت باعث افت شدید کیفیت و به اصطلاح خنگ شدن مدل‌های زبانی می‌شود.

دلیل دیگری که شرکت ISBNdb برای توجیه کار خود می‌آورد، در امان بودن کتاب‌های چاپی قدیمی از پدیده مسموم‌سازی داده‌ها (Data Poisoning) است؛ ترفندی که این روزها بسیاری از نویسندگان با دستکاری عمدی متن‌های دیجیتال به کار می‌گیرند تا روند آموزش هوش مصنوعی را مختل کنند. با این وجود، گزارش‌ها نشان می‌دهد که فرآیند دیجیتالی کردن این گنجینه‌ها با بی‌رحمی تمام و توسط دستگاه‌های اسکن پرسرعت انجام می‌شود. کارگران برای استفاده از این دستگاه‌های خودکار، چاره‌ای ندارند جز اینکه ابتدا شیرازه کتاب را جدا کرده و صفحات را دانه‌دانه وارد دستگاه تصویربرداری کنند.

این رویه خشن، ساختار و جلد اصلی کتاب را برای همیشه نابود می‌کند. شرکت‌ها این روش را انتخاب می‌کنند چون اسکن سریع و مخرب، بسیار ارزان‌تر از روش‌های اصولی، کند و زمان‌بری است که با هدف حفظ سلامت فیزیکی و آرشیو کردن کتاب‌ها طراحی شده‌اند.

تبلیغات

پنهان‌کاری شرکت‌ها و احکام قضایی؛ هیزمی بر آتش نگرانی‌ها

شرکت ISBNdb به خوبی می‌داند که این کار از نظر اخلاقی و افکار عمومی تا چه حد بحث‌برانگیز است؛ به همین دلیل، قراردادهای عدم‌افشای (NDA) بسیار سفت‌وسختی با خریداران خود امضا می‌کند تا هویت شرکت‌های خریدار در طول تعاملات تجاری، کاملا محرمانه و مخفی بماند. نکته تلخ ماجرا اینجاست که طبق گزارش‌ها، در وب‌سایت این شرکت صراحتا نوشته شده: تیتر یک شرکت هوش مصنوعی دو میلیون کتاب را نابود کرد، چیزی نیست که باعث همدلی مردم شود! به همین خاطر، آن‌ها به مشتریان خود پیشنهاد می‌دهند که در مواجهه با رسانه‌ها، از این جنایت فرهنگی با نام فریبنده حفظ و نگهداری دیجیتالی یاد کنند.

ابعاد این تخریب سازمان‌یافته، به مراتب فاجعه‌بارتر از سوختن کتابخانه تاریخی اسکندریه است؛ با این تفاوت که این بار، همه‌چیز در سکوت و بدون خشم و اعتراض برخاسته از دل تاریخ رخ می‌دهد. کتاب‌فروشانی که با رسانه ۴۰۴ مدیا مصاحبه کرده‌اند، با حسرت می‌گویند برخی از کتاب‌هایی که زیر تیغ این دستگاه‌های اسکن می‌روند، آثاری هستند که از دل جنگ‌ها، آتش‌سوزی‌ها و قرن‌ها دست‌به‌دست شدن جان سالم به در برده بودند و امروز تنها چند نسخه انگشت‌شمار از آن‌ها در کل جهان باقی مانده است.

منتقدان هشدار می‌دهند که برخلاف وب‌سایت‌ها یا مجلات امروزی که در دسترس عموم قرار دارند، وقتی نسخه فیزیکی یک اثر تاریخی و به‌شدت نایاب برای همیشه از بین برود، دیگر نمی‌توان آن را به سادگی بازتولید کرد. با این حال، یک حکم قضایی در ایالات متحده در پرونده شرکت هوش مصنوعی آنتروپیک (Anthropic)، اوضاع را پیچیده‌تر کرده است. طبق این حکم، اسکن کردن کتاب‌هایی که به صورت قانونی خریداری شده‌اند (حتی با هدف آموزش هوش مصنوعی)، تحت شرایطی خاص، مشمول قانون استفاده منصفانه (Fair Use) می‌شود. استدلال عجیب دادگاه این بود که چون نسخه فیزیکی چاپ‌شده در طول فرآیند اسکن نابود می‌شود، در واقع صرفا یک نسخه قانونی (دیجیتال) جایگزین یک نسخه قانونی دیگر (چاپی) شده است و تکثیر غیرقانونی متعددی صورت نگرفته است!

این فاجعه واکنش‌های متفاوتی را در پی داشته است. برای مثال، ایلان ماسک در پاسخ به یکی از منتقدان این رویه در شبکه اجتماعی ایکس، رویکرد جایگزینی را پیشنهاد داد و نوشت:

من از تیم هوش مصنوعی شرکت اسپیس‌ایکس خواسته‌ام تا تمام کتاب‌های کمیاب را در یک کتابخانه ویژه حفظ کرده و آن‌ها را با روش‌های اصولی و سختگیرانه اسکن کنند.

در نهایت، اگر آگاهی‌بخشی گسترده‌ای در این زمینه صورت نگیرد، این روند خاموش برای محو کردن کتاب‌های بی‌بدیل و جایگزین‌ناپذیر، به بزرگ‌ترین جنایت و خسارت فرهنگی عصر ما تبدیل خواهد شد؛ فاجعه‌ای که متأسفانه زمانی از آن یاد خواهیم کرد که دیگر هیچ راهی برای بازگشت و جبران وجود نخواهد داشت.

نظرات کاربرانکپی متنکپی لینک