AI Update

Bocoran Dokumen: Microsoft Sendiri Sebut AI Scraping 'Pencurian'

Dokumen pengadilan yang baru dibuka mengungkap eksekutif Microsoft menyebut praktik AI scraping sebagai 'pencurian tenaga kerja terbesar dalam sejarah manusia'.

Diterbitkan oleh 2ndBrAIn21 September 20263 min read
Share:XFacebookWhatsApp
Microsoft Sendiri Sebut AI Scraping 'Pencurian'

Bayangin kerjaan lima tahun kalian—riset, wawancara, editing—dipakai buat melatih mesin yang bikin orang lain gak perlu lagi mampir ke kerjaan kalian. Itu bukan skenario hipotetis. Itu yang baru terungkap dari dokumen pengadilan gugatan The New York Times terhadap OpenAI dan Microsoft.

Apa yang baru

  • Pengakuan "pencurian": dokumen pengadilan yang baru dibuka mengungkap direktur Applied Science Microsoft, Brent Hecht, menyebut praktik scraping AI sebagai "pencurian tenaga kerja terbesar dalam sejarah manusia" dalam memo internal Januari 2023.
  • Efek "doom loop": data internal Microsoft menunjukkan fitur Copilot bikin click-through rate ke domain NYT turun sampai 93% dibanding hasil pencarian Bing biasa—makin sedikit pembaca yang mampir ke situs aslinya karena jawabannya udah keluar duluan di Copilot. Microsoft sendiri menyebut ini "doom loop" yang bisa merusak performa model dan seluruh web secara bersamaan.
  • Nadella soal lisensi: CEO Satya Nadella bersaksi di bawah sumpah bahwa konten berbayar seharusnya dilisensikan oleh siapa pun yang mau memakainya buat training, dan dia akan minta OpenAI melatih ulang model kalau tahu ada scraping konten berbayar.
  • Skala scraping: dataset mid-training OpenAI ternyata berisi lebih dari 91.692 salinan karya dari NYT, Daily News, dan Center for Investigative Reporting—satu dataset lain berisi lebih dari 2 juta dokumen dari nytimes.com saja.
  • Bypass paywall & hapus notis hak cipta: filing menyebut tim OpenAI punya cara buat menembus paywall NYT tanpa terdeteksi, dan sengaja menghapus notis hak cipta dari data training biar model gak "keceplosan" menampilkannya ke pengguna.

Kenapa ini penting

Ini bukan cuma drama hukum dua perusahaan besar. Fair use—aturan yang membolehkan orang memakai karya berhak cipta tanpa izin untuk kasus tertentu kayak kritik atau berita—selama ini jadi tameng perusahaan AI melatih model dari internet publik. Tapi aturan itu punya syarat: penggunaannya gak boleh menggantikan pasar dari karya asli, kayak toko yang menjiplak resep tetangga terus jualan di sebelah rumahnya sampai pembeli gak perlu lagi mampir ke toko asli. Data click-through 93% itu bukti persis skenario itu terjadi.

Buat creator dan penulis Indonesia yang kontennya nyebar bebas di internet, kasus ini nunjukin bahwa raksasa teknologi sendiri, secara internal, sadar praktik mereka berisiko hukum—bukan cuma isu abu-abu etika. Ini melengkapi gugatan serupa dari Seattle Times dan Newsday yang juga mempersoalkan cara konten berita dipakai buat training tanpa izin.

Buat developer yang bangun produk berbasis model AI, ada pelajaran praktis: kalau produk kalian menggunakan data pihak ketiga buat training atau grounding, dokumentasi internal soal keputusan itu—email, memo, slide presentasi—bisa jadi bukti di pengadilan nanti. Yang ditulis di ruang rapat gak selamanya aman di ruang sidang.

Bacaan berguna, sekali seminggu.

Kabar AI penting, konteksnya, dan satu hal yang bisa langsung kalian praktikkan.

Buat kalian

  • Yang harus peduli: kalian yang bikin konten berbayar atau berlangganan—artikel, kursus, riset—dan curiga kontennya ikut nyasar ke dataset training model besar tanpa izin atau kompensasi.
  • Yang boleh santai: kalau konten kalian memang sudah dirilis gratis dan terbuka untuk dibaca siapa saja, kasus ini gak langsung mengubah posisi hukum kalian—tapi tetap layak dipantau ke mana arah putusan pengadilan.
  • Langkah kecil pertama: cek terms of service platform tempat kalian publish konten, lihat apakah ada klausul soal penggunaan data buat training AI, dan simpan bukti kepemilikan (draft awal, timestamp, watermark) buat konten yang paling penting.

Kasus kayak gini nunjukin satu hal yang lebih besar dari sekadar gugatan NYT: kepemilikan atas hasil kerja kalian sendiri gak otomatis dilindungi cuma karena undang-undang belum jelas. Yang bikin posisi kalian kuat adalah kebiasaan dokumentasi dan verifikasi dari awal—hal yang gw latih bareng murid-murid di kelas gw.

Sumber primer: TechCrunch, berdasarkan dokumen pengadilan gugatan The New York Times vs OpenAI/Microsoft (techcrunch.com).

Lebih paham AI. Lebih siap menggunakannya.

Newsletter mingguan berisi kabar penting, konteks yang jernih, dan praktik yang bisa dicoba.

Belajar build sistem AI yang bekerja buat kalian

Lihat akademi