๐ŸŽฏ Tujuan ๐Ÿ”ก Pipeline Teks NLP ๐Ÿง  Sentiment & LLM ๐ŸŽฎ Sentiment Studio ๐Ÿ“ Evaluasi Formatif โœจ Rangkuman & Refleksi
Learn / KKA / Koding Kreatif Lanjutan / 02. Natural Language Processing
๐Ÿค– KKA ยท Unit 07 ยท Modul 02

Natural Language Processing (NLP): Cara AI Memahami Bahasa

Bagaimana komputer bisa mengerti ketikan teks manusia? Pelajari rahasia di balik NLP (Natural Language Processing): mulai dari tokenisasi kata, penyaringan stop words, ekstraksi fitur TF-IDF, analisis sentimen ulasan (Positif / Negatif / Netral), hingga cara kerja model bahasa raksasa Large Language Models (LLM).

โฑ๏ธ Waktu: 45 Menit ๐Ÿ”ก Fokus: Tokenisasi, Sentiment & LLM ๐Ÿ“ Evaluasi: 20 Soal (4 Bagian)
๐ŸŽฏ

Tujuan Pembelajaran

Kompetensi yang akan kamu kuasai setelah menyelesaikan modul ini

01.
Memahami Pipeline Preprocessing NLP

Menjelaskan alur Tokenisasi (pemecahan kata), Stop Words Removal, dan Stemming (pengembalian ke kata dasar).

02.
Menganalisis Sentimen Teks (Sentiment Analysis)

Mengklasifikasikan nada emosi ulasan opini (komentar positif, netral, atau keluhan negatif).

03.
Mengenal Vektorisasi Teks (Bag of Words & TF-IDF)

Memahami bagaimana teks kata dikonversi menjadi representasi vektor angka biner yang dapat dihitung komputer.

04.
Memahami Konsep Dasar Model Bahasa LLM

Mengetahui prinsip prediksi token berikutnya (Next-Token Prediction) dan batasan halusinasi fakta.

1

4 Tahap Utama Preprocessing Teks NLP

Membersihkan dan menyederhanakan kalimat agar siap dipahami algoritma matematika

โœ‚๏ธ 1. Tokenization

Memecah satu kalimat utuh menjadi potongan kata individual (token). Contoh: ["saya", "suka", "koding"].

๐Ÿงน 2. Stop Words Removal

Menghapus kata-kata penghubung umum yang tidak bermakna unik seperti: dan, yang, di, ke, dari, adalah.

๐ŸŒฑ 3. Stemming

Mengembalikan kata berimbuhan ke kata dasarnya. Contoh: "memprogramkan" $\rightarrow$ "program".

๐Ÿ”ข 4. Vektorisasi (TF-IDF)

Mengubah kata menjadi skor angka frekuensi sehingga model machine learning dapat menghitung probabilitasnya.

2

Ragam Penerapan Cerdas NLP di Dunia Nyata

Teknologi pemrosesan bahasa yang kita nikmati setiap hari

1. Sentiment Analysis & Spam

Mendeteksi otomatis apakah ulasan produk di e-commerce bernada puas atau kecewa, serta menyaring email penipuan ke folder Spam.

2. Machine Translation & NER

Menerjemahkan teks antar ratusan bahasa asing (Google Translate) dan mendeteksi entitas nama orang, tanggal, dan lokasi.

3. Conversational AI & LLM

Chatbot pintar seperti ChatGPT dan Gemini yang mampu menjawab pertanyaan kompleks dan membantu koding secara interaktif.

๐ŸŽฎ

Interactive NLP Sentiment Analyzer & Tokenizer Studio

Ketik kalimat ulasan opini dan saksikan proses pemecahan token serta penentuan sentimennya secara instan!

NLP Engine
๐Ÿ’ฌ Masukkan Kalimat Ulasan / Review:
NLP SENTIMENT PIPELINE SENTIMEN: POSITIF (95%)
HASIL TOKENISASI KATA:
['materi', 'koding', 'ini', 'sangat', 'seru', 'menyenangkan', 'dan', 'mudah', 'dipahami']
KATA BERPENGARUH SENTIMEN:
+ seru (+1), + menyenangkan (+1), + mudah (+1)
๐Ÿ’ก Analisis sentimen digunakan perusahaan untuk memantau kepuasan ribuan pelanggan secara otomatis.
๐Ÿ“

Evaluasi Formatif: Natural Language Processing

Uji pemahaman tokenisasi, stop words, analisis sentimen, dan konsep model LLM (Total Skor: 100)

Target Kelulusan Minimal 70 Poin
Bagian A

Pilihan Ganda (5 Soal ยท Bobot: 25 Poin)

1. Tahap pertama dalam preprocessing teks NLP yang bertugas memecah suatu paragraf atau kalimat menjadi potongan kata-kata individual disebut...

2. Kata-kata seperti 'dan', 'yang', 'di', 'ke', 'dari', dan 'adalah' sering disaring dan dihapus dalam NLP karena termasuk ke dalam kategori...

3. Aplikasi NLP yang bertugas mengidentifikasi apakah komentar review pembeli bernada senang (positif), biasa saja (netral), atau kecewa (negatif) adalah...

4. Prinsip kerja fundamental model AI generatif teks (Large Language Models / LLM) dalam menghasilkan karangan tulisan adalah...

5. Library Python paling populer untuk pemrosesan teks, korpus bahasa, dan tokenisasi adalah...

Bagian B

Benar atau Salah (5 Soal ยท Bobot: 25 Poin)

1. Komputer tidak dapat memproses kata teks secara langsung, melainkan harus diubah menjadi vektor angka numerik terlebih dahulu.
2. Stemming mengubah kata 'berlari', 'pelari', dan 'berlarian' kembali ke kata dasar aslinya yaitu 'lari'.
3. Model LLM seperti GPT dijamin 100% tidak pernah mengalami halusinasi atau mengarang informasi palsu.
4. Spam detector di layanan email memanfaatkan klasifikasi teks NLP untuk menyaring pesan berbahaya secara otomatis.
5. Word Cloud adalah visualisasi grafis di mana ukuran kata sebanding dengan frekuensi kemunculannya dalam dokumen teks.
Bagian C

Menjodohkan Istilah NLP & Penjelasannya (5 Pasangan ยท Bobot: 25 Poin)

Bagian D

Urutan Pipeline Pemrosesan Teks NLP (Bobot: 25 Poin)

Urutkan proses penanganan data teks mentah hingga analisis klasifikasi sentimen:

A. Memuat kumpulan teks ulasan pelanggan mentah dari database web
B. Melakukan tokenisasi memecah kalimat menjadi daftar token kata terpisah
C. Menyaring kata penghubung (Stop Words) dan melakukan stemming ke kata dasar
D. Mengubah teks bersih menjadi representasi vektor numerik angka dengan TF-IDF
E. Melatih model classifier untuk memprediksi kelas sentimen (Positif / Negatif)
โœจ

Rangkuman Materi & Refleksi Belajar

Tuliskan pemahaman dan pengalaman belajarmu pada materi ini

1. Jembatan Teks dan Angka: NLP menerjemahkan kerumitan bahasa manusia menjadi formula vektor probabilitas komputer.

2. Otomasi Analisis Sentimen: Memungkinkan kita mendengarkan suara publik dari jutaan ulasan opini secara cepat dan akurat.

3. Era Baru LLM: Generative AI membuka pintu komunikasi alami antara manusia dan mesin yang belum pernah terjadi sebelumnya.