شماری از گزارش‌ها حاکی از آن است که شرکت‌های هوش مصنوعی در حال خرید کتاب‌های قدیمی، اسکن کردن محتوای آن‌ها برای آموزش مدل‌هایشان و سپس نابود کردن آن‌ها هستند.

به گزارش ایسنا، برای شرکت‌هایی که مدل‌های زبانی بزرگ (LLM) می‌سازند، کتاب‌ها چیزی جز خوراکی نیستند که باید به‌صورت انبوه بلعیده شوند و پس از استخراج اطلاعاتشان، مانند استخوان ماهی دور انداخته شوند. در بسیاری از موارد، آن‌ها ترجیح می‌دهند از نسخه‌های دیجیتالی کتاب‌ها استفاده کنند یا حتی بهتر از آن، از نسخه‌های دیجیتالی دزدی‌شده استفاده کنند. برای مثال، شرکت «متا» به استفاده از کتاب‌های دیجیتالی غیرقانونی متهم شده و شرکت «آنتروپیک» نیز به دلیل انجام اقدامی مشابه، مجبور شد ۱.۵ میلیارد دلار به نویسندگان غرامت بپردازد.

اما بسیاری از شرکت‌ها، از جمله «آنتروپیک»، به جای نسخه‌های دیجیتالی، به سراغ کتاب‌های چاپی رفته‌اند؛ چراکه می‌توانند تعداد زیادی نسخه دست‌دوم را با قیمت بسیار پایین خریداری کنند.

«فیوچریسم» نوشت: بر اساس اسناد مرتبط با همان پرونده حقوقی، «آنتروپیک» از یک دستگاه برش هیدرولیکی استفاده می‌کرد تا صفحات کتاب‌هایی را که از فروشندگان کتاب خریده بود، به‌طور مرتب از جلد جدا کند. سپس این صفحات با تجهیزات تصویربرداری صنعتی اسکن می‌شدند. به بیان دیگر، این شرکت واقعا کتاب‌های نویسندگان را تکه‌تکه می‌کرد تا هوش مصنوعی خود را آموزش دهد.

این فرایند از یک اصل حقوقی به نام (First-Sale Doctrine) بهره می‌برد که به خریدار اجازه می‌دهد پس از خرید یک کالا، بدون نیاز به اجازه صاحب حق نشر، هر کاری که می‌خواهد با نسخه خریداری‌شده انجام دهد.

از آنجا که شرکت «آنتروپیک» متن چاپی را به نسخه دیجیتال تبدیل می‌کرد، قاضی آن را استفاده منصفانه تشخیص داد.

اکنون، به گزارش «404 Media»، این شیوه آن‌قدر رایج شده که حتی فروشندگان باسابقه کتاب نیز به دنبال بهره‌برداری از رونق بازار هوش مصنوعی هستند.

یکی از این شرکت‌ها که «ISBNdb» است و خود را «بزرگ‌ترین پایگاه داده کتاب جهان» معرفی می‌کند،  اعلام کرده است: «بهترین داده‌های آموزشی جهان برای هوش مصنوعی، همین حالا روی یک قفسه کتاب قرار دارند.»

این شرکت تاکید می‌کند که کتاب‌های چاپی، برخلاف بسیاری از مطالب اینترنتی امروز، هنوز به نوشته‌های ضعیف تولیدشده توسط هوش مصنوعی که اکنون بخش بزرگی از فضای اینترنت و حتی برخی کتاب‌های جدید را فرا گرفته‌اند، آلوده نشده‌اند.

در مقاله‌ای که در وب‌سایت «ISBNdb» منتشر شده و «404 Media» آن را نقل کرده است، این‌طور آمده است: «کتاب‌های چاپی متعلق به دوران پیش از ظهور مدل‌های زبانی بزرگ (LLM)، تضمین می‌شوند که از نظر ساختاری عاری از این آلودگی هستند. همین موضوع به‌تنهایی یک مزیت بسیار مهم محسوب می‌شود.»

همچنین نوشته است: «کتاب‌های فیزیکی منتشرشده پیش از این دوره (پیش از سال ۲۰۲۲) از نظر ساختاری از آلودگی ناشی از ابزارهای مدرن تولید محتوا در امان مانده‌اند.»

شرکت «ISBNdb» که زمانی تمرکز اصلی‌اش کمک به کتابخانه‌ها، توزیع‌کنندگان و کتاب‌فروشی‌ها برای یافتن و فروش کتاب بود، اکنون طبق گزارش«404 Media» به شرکت‌های هوش مصنوعی کمک می‌کند تا در هر سفارش، بین ۱,۰۰۰ تا یک میلیون جلد کتاب را به‌صورت عمده خریداری کنند.

این شرکت، به‌عنوان یک مزیت دیگر، به مشتریان هوش مصنوعی خود وعده می‌دهد که هویتشان محرمانه باقی بماند، چرا که هیچ شرکتی نمی‌خواهد مانند «متا» یا «آنتروپیک» در مرکز توجه رسانه‌ها قرار بگیرد. در عین حال، واضح است که این وب‌سایت «ISBNdb» نشان می‌دهد که خود این شرکت نیز از بحث‌برانگیز بودن این فعالیت آگاه است.

یکی از کتاب‌فروشان مستقل نیز گفته است که در ماه آوریل، فروش هفتگی او ناگهان از حداکثر ۲۰ کتاب به صدها کتاب افزایش یافت و تقریبا مطمئن است که خریداران، آزمایشگاه‌های هوش مصنوعی هستند.

این کتاب‌فروش افزود که موجودی فروشگاهش شامل کتاب‌های کمیاب و چاپ‌نشده (Out of Print) است و بنابراین ممکن است، شرکت‌های هوش مصنوعی در حال نابود کردن برخی از آخرین نسخه‌های باقی‌مانده این آثار باشند.

این کتاب‌فروش به «404 Media» گفت: «از نظر شخصی، احساسات دوگانه‌ای نسبت به این موضوع دارم.

از یک طرف، از نظر مالی به نفع من است و باعث می‌شود موجودی قدیمی‌ای که احتمال فروشش کم بود، از انبار خارج شود. به‌خصوص که کتاب‌های خارجی زیادی در اختیار دارم و برای چنین فروش‌هایی مناسب هستند. اما از طرف دیگر، با کاربرد نهایی این کتاب‌ها موافق نیستم و خوشم نمی‌آید که کتاب‌های کمیاب خمیر شوند.»

به نظر می‌رسد کتاب‌های قدیمی بیشتری نیز در معرض خطر باشند.

«404 Media» گزارش داده است که کتاب‌فروشان آثار کمیاب در هلند نیز با موجی از سفارش‌های عمده روبه‌رو شده‌اند که گمان می‌کنند از سوی شرکت‌های هوش مصنوعی ثبت می‌شوند، هرچند راهی برای اطمینان قطعی از این موضوع ندارند.

هرچند نشانه‌های زیادی ممکن است حاکی از آن باشد که یک سفارش عمده متعلق به یک آزمایشگاه هوش مصنوعی است، اما در بیشتر موارد کتاب‌فروشان فقط می‌توانند حدس بزنند و هیچ راهی برای اثبات آن ندارند.