شرکتهای هوش مصنوعی میلیونها کتاب را برای آموزش مدلهای خود نابود میکنند
شرکتهای هوش مصنوعی که پیش از این به کمبود فزاینده حافظه و فضای ذخیرهسازی دامن زدهاند، ظاهراً هدف جدیدی را در نظر گرفتهاند: تاریخ ادبیات بشریت. یک گزارش تحقیقاتی اخیر از 404 Media نشان میدهد که این شرکتها میلیونها کتاب دستدوم را از طریق واسطهها خریداری میکنند تا دادههای آموزشی با کیفیت بالا برای مدلهای هوش مصنوعی خود تأمین کنند و از واکنش عمومی جلوگیری نمایند.
هوش مصنوعی برای پیشرفت به حجم عظیمی از دادهها نیاز دارد، اما نه هر دادهای. این دادهها باید با کیفیت بالا باشند. مشکل اینجاست که محتوای متوسط تولید شده توسط هوش مصنوعی، که معمولاً به آن «AI slop» گفته میشود، در سراسر اینترنت گسترش یافته است. این نوع محتوا، مجموعه دادهها را آلوده کرده و برای آموزش هوش مصنوعی نتیجه معکوس دارد. در نتیجه، شرکتهای پیشرو هوش مصنوعی برای کسب دانش به منابع انسانیتألیف روی آوردهاند، به ویژه منابع چاپی که قبل از سال ۲۰۲۲ منتشر شدهاند و احتمالاً حاوی محتوای اصلی و دستنخورده هستند.
سابقه استفاده شرکتهای هوش مصنوعی از کتابهای فیزیکی برای آموزش هوش مصنوعی وجود دارد. به عنوان مثال، Anthropic، یکی از شرکتهای پیشرو هوش مصنوعی که درگیر یک پرونده قضایی است، گزارش شده که میلیونها دلار برای استخراج اطلاعات از کتابهای چاپی بیشمار برای ساخت مدلهای هوش مصنوعی Claude خود و سپس نابودی آنها سرمایهگذاری کرده است. این شرکت کتابها را از Better World Books خریداری کرده بود. اگرچه حکم دادگاه تأیید کرد که استفاده از کتابها برای آموزش هوش مصنوعی تحت قانون کپیرایت، استفاده منصفانه محسوب میشود، اما Anthropic با جریمهای سرسامآور ۱.۵ میلیارد دلاری به دلیل نگهداری مخزنی از هفت میلیون کتاب دزدی که حق کپیرایت نویسندگان و ناشران را نقض کرده بود، مواجه شد. به همین ترتیب، ائتلافی از ناشران اخیراً شکایتی علیه گوگل تنظیم کرده و این غول فناوری را به استفاده ادعایی و غیرقانونی از میلیونها کتاب دارای حق کپیرایت برای توسعه مدلهای هوش مصنوعی Gemini خود متهم کردهاند.
ISBNdb، یک پایگاه داده آنلاین که گزارش شده بیش از ۱۱۱ میلیون کتاب فهرستبندی شده دارد، مدتهاست که پلتفرم مورد علاقه کتابفروشان، کتابخانهها و توزیعکنندگان برای فروش کتاب بوده است. با انفجار صنعت هوش مصنوعی، ISBNdb کسبوکار خود را تغییر داده تا خدمات تخصصی برای خرید عمده کتاب برای شرکتهای هوش مصنوعی ارائه دهد. طبق گزارش 404 Media، سفارشها از ۱۰۰۰ نسخه تا یک میلیون کتاب در یک معامله واحد متغیر است.
یک کتابفروش حرفهای که مایل به ناشناس ماندن بود، ظاهراً با 404 Media در مورد افزایش بیسابقه فروش کتابها که از آوریل سال جاری آغاز شده، صحبت کرده است. این فروشنده قبلاً در یک هفته خوب حدود ۲۰ کتاب میفروخت، اما در ماههای اخیر، فروش هفتگی به چند صد کتاب افزایش یافته است. این نشاندهنده افزایشی پنج برابری نسبت به حجم عادی است. سایر کتابفروشان در پلتفرمهایی مانند Alibris و Biblio نیز افزایش مشابهی در خریدهای عمده گزارش کردهاند.
در حالی که هیچ مدرک قطعی مبنی بر اینکه ISBNdb یا شرکت هوش مصنوعی دیگری در حال انجام این خریدها است وجود ندارد، اما برخی نشانههای هشداردهنده دیده میشود. به ویژه، خریدهای در مقیاس بزرگ فقط شامل کتابهایی با شماره استاندارد بینالمللی کتاب (ISBN) بود، که کد ۱۳ رقمی منحصر به فردی است که در سطح جهانی برای شناسایی کتابها استفاده میشود. هیچ الگویی از نظر موضوع، ژانر یا نویسنده وجود نداشت. همچنین به نظر میرسید که خریداران قیمتگذاری کتابها را نادیده گرفته و عناوین را به هر قیمتی، حتی اگر گرانقیمت بودند، خریداری میکردند.
در طول پرونده قضایی Anthropic، تام هاروی، که پیش از این در ایجاد Google Books مشارکت داشت و سپس پروژه دیجیتالیسازی «پروژه پاناما» Anthropic را رهبری میکرد، تأیید کرد که این شرکت هوش مصنوعی چندین شرکت اسکن اسناد را استخدام کرده است. Datamation Information Services، که خدمات اسکن کتاب با حجم بالا، غیرمخرب و مخرب را ارائه میدهد، یکی از آنها بود. روش اول از ابزارهای مختلفی مانند اسکنرهای سقفی، اسکنرهای تخت یا سیستمهای تصویربرداری V شکل استفاده میکند. از سوی دیگر، روش دوم شامل جدا کردن صفحات کتابها توسط پرسنل و تغذیه صفحات جداگانه به یک اسکنر صنعتی با سرعت بالا است. منطقاً، شرکتهای هوش مصنوعی مسیر مخرب را انتخاب میکنند زیرا کارآمدتر و کمهزینهتر است. نتیجه این کار، نابودی میلیونها کتاب است.
بدیهی است که کتابهای چاپی گنجینهای از اطلاعات برای هوش مصنوعی محسوب میشوند. با این حال، بسیاری در مورد اخلاقیات حذف کتابها از چرخه بحث میکنند، زیرا مشخص نیست که آیا شرکتهای هوش مصنوعی در طول دیجیتالیسازی، کتابهای کمیاب یا حتی نایاب را از عناوین رایج فیلتر میکنند یا خیر. مسئله اصلی دیگر این است که کتابهای اسکن شده مستقیماً وارد یک پایگاه داده خصوصی برای آموزش هوش مصنوعی میشوند که عموم مردم به آن دسترسی ندارند. درست است که ما هوش مصنوعی هوشمندتری خواهیم داشت، اما به قیمت عدم دسترسی نسلهای آینده به این اطلاعات.
- کولبات
- مرداد 6, 1405
- 13 بازدید






