Modul 2 — Modul 2 — Dari Teks Mentah ke Data Bersih: Membangun Pipeline Pra-pemrosesan Teks Bahasa Indonesia

  • Menerapkan urutan pra-pemrosesan lengkap — normalisasi bentuk, penanganan entitas non-kata, normalisasi leksikal, tokenisasi, penanganan stopword, dan pemotongan imbuhan — pada korpus berbahasa Indonesia yang memuat bahasa gaul, singkatan media sosial, dan campur kode Indonesia–Inggris.
  • Membedakan hasil dan risiko stemming dibanding lemmatization pada kata berimbuhan bahasa Indonesia seperti 'pemberlakuan', 'pengaduan', dan 'mempertanggungjawabkan', termasuk mengenali gejala overstemming dan understemming beserta penyebab morfologisnya.
  • Menganalisis dampak tiap langkah pembersihan terhadap informasi yang tersisa, khususnya langkah yang menghapus sinyal penting seperti negasi, kapitalisasi, tanda baca ekspresif, dan emoji.
  • Mengevaluasi kelayakan sebuah pipeline terhadap tugas hilirnya dan merumuskan keputusan mempertahankan, mengubah urutan, atau membuang sebuah langkah beserta alasan yang dapat diuji.
pengantar · 10 menit

Grafik yang Membohongimu: Kenapa Teks Mentah Tidak Bisa Langsung Dipakai

kuliah · 25 menit

Normalisasi dan Tokenisasi: Memutuskan Apa yang Dianggap Sama dan Apa yang Dianggap Satu

kuliah · 25 menit

Membuang dan Memotong: Stopword, Stemming, dan Lemmatization sebagai Taruhan

contoh · 30 menit

Dikerjakan Bersama: Lima Komentar Berantakan, Delapan Langkah, Satu Bencana yang Ketahuan

miskonsepsi · 15 menit

Enam Salah Paham yang Paling Sering Merusak Pipeline

kuis · 20 menit

Kuis: Empat Keputusan Pipeline pada Kasus Baru

Kuis terbuka setelah kelas ini dimiliki.

rangkuman · 10 menit

Rangkuman dan Daftar Periksa Sebelum Lanjut

Isi modul ini belum terbuka

Modul 1 kelas ini bisa dicicipi tanpa membeli. Untuk modul lainnya, buka aksesnya dulu.

Lihat pilihan akses