Modul 2 — Modul 2 — Dari Teks Mentah ke Data Bersih: Membangun Pipeline Pra-pemrosesan Teks Bahasa Indonesia
- Menerapkan urutan pra-pemrosesan lengkap — normalisasi bentuk, penanganan entitas non-kata, normalisasi leksikal, tokenisasi, penanganan stopword, dan pemotongan imbuhan — pada korpus berbahasa Indonesia yang memuat bahasa gaul, singkatan media sosial, dan campur kode Indonesia–Inggris.
- Membedakan hasil dan risiko stemming dibanding lemmatization pada kata berimbuhan bahasa Indonesia seperti 'pemberlakuan', 'pengaduan', dan 'mempertanggungjawabkan', termasuk mengenali gejala overstemming dan understemming beserta penyebab morfologisnya.
- Menganalisis dampak tiap langkah pembersihan terhadap informasi yang tersisa, khususnya langkah yang menghapus sinyal penting seperti negasi, kapitalisasi, tanda baca ekspresif, dan emoji.
- Mengevaluasi kelayakan sebuah pipeline terhadap tugas hilirnya dan merumuskan keputusan mempertahankan, mengubah urutan, atau membuang sebuah langkah beserta alasan yang dapat diuji.
Normalisasi dan Tokenisasi: Memutuskan Apa yang Dianggap Sama dan Apa yang Dianggap Satu
Membuang dan Memotong: Stopword, Stemming, dan Lemmatization sebagai Taruhan
Dikerjakan Bersama: Lima Komentar Berantakan, Delapan Langkah, Satu Bencana yang Ketahuan
Enam Salah Paham yang Paling Sering Merusak Pipeline
Kuis: Empat Keputusan Pipeline pada Kasus Baru
Kuis terbuka setelah kelas ini dimiliki.
Rangkuman dan Daftar Periksa Sebelum Lanjut
Isi modul ini belum terbuka
Modul 1 kelas ini bisa dicicipi tanpa membeli. Untuk modul lainnya, buka aksesnya dulu.
Lihat pilihan akses