Tech 18 AGU 2026

Amazon dan Buku Langka: Data untuk Melatih Kecerdasan Buatan

Klaim bahwa Amazon, raksasa ritel yang dulunya hanya menjual buku fisik, kini terlibat dalam skema pengumpulan dan pemindaian teks langka untuk melatih model Artificial Intelligence (AI) adalah isu kontroversial. Laporan ini berasal dari investigasi 404 Media, pihak ketiga yang menemukan…

We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility

Klaim bahwa Amazon, raksasa ritel yang dulunya hanya menjual buku fisik, kini terlibat dalam skema pengumpulan dan pemindaian teks langka untuk melatih model Artificial Intelligence (AI) adalah isu kontroversial. Laporan ini berasal dari investigasi 404 Media, pihak ketiga yang menemukan perangkat pelacak pada salah satu buku langka yang tiba di fasilitas Amazon VGT3 di Las Vegas.

Amazon sendiri menyatakan bahwa pembelian buku dilakukan melalui jalur komersial biasa untuk meningkatkan produk dan layanan pelanggan mereka. Namun, data menunjukkan bahwa LLMs membutuhkan volume teks yang sangat besar. Mereka membutuhkan sumber data masif, dan bukunya adalah target utama.

Data Pelatihan Model Bahasa Besar

Fakta teknisnya cukup sederhana: semakin banyak data unik yang dimasukkan ke LLM, semakin baik output-nya—secara teori. Di sinilah buku langka berperan. Buku yang sudah out of print atau diterbitkan sebelum tahun 2022 sangat berharga, mengingat kecil kemungkinannya kontennya pernah dibuat oleh model AI lain.

Namun, ada risiko teknis yang perlu dipahami: melatih LLM dengan terlalu banyak konten buatan AI (AI-generated content) dapat memicu kondisi model collapse. Kondisi ini akan merusak kualitas dan akurasi output dari model itu sendiri karena ia hanya belajar pola sintetis.

EXPOSED: A 404 Media Investigation Used A Hidden AirTag To Track An Suspicious Anonymous Biblio Order Of 1,000 Rare Books To Amazon's Nevada “VGT3” Warehouse

Berdasarkan laporan 404 Media, proses yang terjadi di fasilitas VGT3 bukan sekadar penyimpanan. Mereka melaporkan pekerja melakukan pemindaian ISBN dan merobek sampul buku (stripping spines)—sebuah proses terstruktur untuk ekstraksi data murni. Proses ini menyoroti bagaimana kebutuhan akan dataset berkualitas tinggi dapat mendorong praktik bisnis dengan batas etis yang abu-abu.

Amazon, seperti banyak perusahaan teknologi raksasa lainnya, selalu mencari sumber daya input baru. Jika Anda tertarik mendalami isu teknologi serupa, berita Teknologi lainnya mungkin relevan. Untuk detail lengkap mengenai investigasi ini, kamu bisa membaca lebih lanjut di TechCrunch.

Northgate Distribution Center Building 3 - Amazon - VanTrust Real Estate

Secara teknis, buku langka adalah data historis dengan nilai informasi tinggi karena merepresentasikan penulis dan zaman tertentu. Trade-off di sini adalah antara kebutuhan industri akan volume data tanpa batas melawan nilai konservasi materi cetak fisik. Kalau Amazon benar menggunakan metode ini untuk melatih LLMs, maka biaya operasional akuisisi datanya jauh lebih rendah daripada jika mereka harus membangun model dari nol.

GameIndo