AI companies are reportedly shredding millions of books after using them to train AI models — tech giants outsource to middlemen to secretly buy up books for training material | Tom's HardwareTom's Hardware

شرکت‌های هوش مصنوعی میلیون‌ها کتاب را برای آموزش مدل‌های خود نابود می‌کنند

شرکت‌های هوش مصنوعی که پیش از این به کمبود فزاینده حافظه و فضای ذخیره‌سازی دامن زده‌اند، ظاهراً هدف جدیدی را در نظر گرفته‌اند: تاریخ ادبیات بشریت. یک گزارش تحقیقاتی اخیر از 404 Media نشان می‌دهد که این شرکت‌ها میلیون‌ها کتاب دست‌دوم را از طریق واسطه‌ها خریداری می‌کنند تا داده‌های آموزشی با کیفیت بالا برای مدل‌های هوش مصنوعی خود تأمین کنند و از واکنش عمومی جلوگیری نمایند.

Nvidia

هوش مصنوعی برای پیشرفت به حجم عظیمی از داده‌ها نیاز دارد، اما نه هر داده‌ای. این داده‌ها باید با کیفیت بالا باشند. مشکل اینجاست که محتوای متوسط تولید شده توسط هوش مصنوعی، که معمولاً به آن «AI slop» گفته می‌شود، در سراسر اینترنت گسترش یافته است. این نوع محتوا، مجموعه داده‌ها را آلوده کرده و برای آموزش هوش مصنوعی نتیجه معکوس دارد. در نتیجه، شرکت‌های پیشرو هوش مصنوعی برای کسب دانش به منابع انسانی‌تألیف روی آورده‌اند، به ویژه منابع چاپی که قبل از سال ۲۰۲۲ منتشر شده‌اند و احتمالاً حاوی محتوای اصلی و دست‌نخورده هستند.

سابقه استفاده شرکت‌های هوش مصنوعی از کتاب‌های فیزیکی برای آموزش هوش مصنوعی وجود دارد. به عنوان مثال، Anthropic، یکی از شرکت‌های پیشرو هوش مصنوعی که درگیر یک پرونده قضایی است، گزارش شده که میلیون‌ها دلار برای استخراج اطلاعات از کتاب‌های چاپی بی‌شمار برای ساخت مدل‌های هوش مصنوعی Claude خود و سپس نابودی آن‌ها سرمایه‌گذاری کرده است. این شرکت کتاب‌ها را از Better World Books خریداری کرده بود. اگرچه حکم دادگاه تأیید کرد که استفاده از کتاب‌ها برای آموزش هوش مصنوعی تحت قانون کپی‌رایت، استفاده منصفانه محسوب می‌شود، اما Anthropic با جریمه‌ای سرسام‌آور ۱.۵ میلیارد دلاری به دلیل نگهداری مخزنی از هفت میلیون کتاب دزدی که حق کپی‌رایت نویسندگان و ناشران را نقض کرده بود، مواجه شد. به همین ترتیب، ائتلافی از ناشران اخیراً شکایتی علیه گوگل تنظیم کرده و این غول فناوری را به استفاده ادعایی و غیرقانونی از میلیون‌ها کتاب دارای حق کپی‌رایت برای توسعه مدل‌های هوش مصنوعی Gemini خود متهم کرده‌اند.

ISBNdb، یک پایگاه داده آنلاین که گزارش شده بیش از ۱۱۱ میلیون کتاب فهرست‌بندی شده دارد، مدت‌هاست که پلتفرم مورد علاقه کتاب‌فروشان، کتابخانه‌ها و توزیع‌کنندگان برای فروش کتاب بوده است. با انفجار صنعت هوش مصنوعی، ISBNdb کسب‌وکار خود را تغییر داده تا خدمات تخصصی برای خرید عمده کتاب برای شرکت‌های هوش مصنوعی ارائه دهد. طبق گزارش 404 Media، سفارش‌ها از ۱۰۰۰ نسخه تا یک میلیون کتاب در یک معامله واحد متغیر است.

یک کتاب‌فروش حرفه‌ای که مایل به ناشناس ماندن بود، ظاهراً با 404 Media در مورد افزایش بی‌سابقه فروش کتاب‌ها که از آوریل سال جاری آغاز شده، صحبت کرده است. این فروشنده قبلاً در یک هفته خوب حدود ۲۰ کتاب می‌فروخت، اما در ماه‌های اخیر، فروش هفتگی به چند صد کتاب افزایش یافته است. این نشان‌دهنده افزایشی پنج برابری نسبت به حجم عادی است. سایر کتاب‌فروشان در پلتفرم‌هایی مانند Alibris و Biblio نیز افزایش مشابهی در خریدهای عمده گزارش کرده‌اند.

در حالی که هیچ مدرک قطعی مبنی بر اینکه ISBNdb یا شرکت هوش مصنوعی دیگری در حال انجام این خریدها است وجود ندارد، اما برخی نشانه‌های هشداردهنده دیده می‌شود. به ویژه، خریدهای در مقیاس بزرگ فقط شامل کتاب‌هایی با شماره استاندارد بین‌المللی کتاب (ISBN) بود، که کد ۱۳ رقمی منحصر به فردی است که در سطح جهانی برای شناسایی کتاب‌ها استفاده می‌شود. هیچ الگویی از نظر موضوع، ژانر یا نویسنده وجود نداشت. همچنین به نظر می‌رسید که خریداران قیمت‌گذاری کتاب‌ها را نادیده گرفته و عناوین را به هر قیمتی، حتی اگر گران‌قیمت بودند، خریداری می‌کردند.

در طول پرونده قضایی Anthropic، تام هاروی، که پیش از این در ایجاد Google Books مشارکت داشت و سپس پروژه دیجیتالی‌سازی «پروژه پاناما» Anthropic را رهبری می‌کرد، تأیید کرد که این شرکت هوش مصنوعی چندین شرکت اسکن اسناد را استخدام کرده است. Datamation Information Services، که خدمات اسکن کتاب با حجم بالا، غیرمخرب و مخرب را ارائه می‌دهد، یکی از آنها بود. روش اول از ابزارهای مختلفی مانند اسکنرهای سقفی، اسکنرهای تخت یا سیستم‌های تصویربرداری V شکل استفاده می‌کند. از سوی دیگر، روش دوم شامل جدا کردن صفحات کتاب‌ها توسط پرسنل و تغذیه صفحات جداگانه به یک اسکنر صنعتی با سرعت بالا است. منطقاً، شرکت‌های هوش مصنوعی مسیر مخرب را انتخاب می‌کنند زیرا کارآمدتر و کم‌هزینه‌تر است. نتیجه این کار، نابودی میلیون‌ها کتاب است.

بدیهی است که کتاب‌های چاپی گنجینه‌ای از اطلاعات برای هوش مصنوعی محسوب می‌شوند. با این حال، بسیاری در مورد اخلاقیات حذف کتاب‌ها از چرخه بحث می‌کنند، زیرا مشخص نیست که آیا شرکت‌های هوش مصنوعی در طول دیجیتالی‌سازی، کتاب‌های کمیاب یا حتی نایاب را از عناوین رایج فیلتر می‌کنند یا خیر. مسئله اصلی دیگر این است که کتاب‌های اسکن شده مستقیماً وارد یک پایگاه داده خصوصی برای آموزش هوش مصنوعی می‌شوند که عموم مردم به آن دسترسی ندارند. درست است که ما هوش مصنوعی هوشمندتری خواهیم داشت، اما به قیمت عدم دسترسی نسل‌های آینده به این اطلاعات.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

جستجو در سایت

سبد خرید

درحال بارگذاری ...
بستن
مقایسه
مقایسه محصولات
لیست مقایسه محصولات شما خالی می باشد!