ASAL AI

Embedding: Mengubah Makna Jadi Koordinat

Setiap teks jadi titik di ruang berdimensi ratusan. Teks yang maknanya mirip berdiri berdekatan — dan itulah kunci pencarian semantik.

LEVEL 02± 7 menit baca

Komputer menghitung angka, bukan makna. Embedding adalah jembatannya: sebuah model (biasanya Transformer kecil khusus) membaca teks dan mengeluarkan vektor — daftar angka, misal 1.536 buah.

Anggap tiap teks mendapat koordinat di sebuah peta raksasa berdimensi 1.536. Aturan peta itu satu: makna yang mirip = koordinat yang berdekatan.

  • "dokter" dan "medis" → berdekatan.
  • "dokter" dan "sepeda" → berjauhan.
  • "cuma notulen rapat" dan "ringkasan hasil meeting" → dekat, meski kata-katanya beda total. Inilah kekuatan sebenarnya: pencarian makna, bukan pencarian kata.

Fakta lucu soal aritmetika makna

Vektor embedding punya struktur yang aneh tapi konsisten: vektor(raja) − vektor(pria) + vektor(wanita) menghasilkan titik yang sangat dekat dengan vektor(ratu). Hubungan relasional (gender, waktu, ibu kota) benar-benar tersimpan sebagai arah di ruang itu.

Dipakai untuk apa

  • Pencarian semantik — cari "cara atasi laptop panas" dan dokumen bertajuk "mengatasi overheat" tetap ditemukan.
  • RAG — inti dari sistem tanya-jawab dokumen (materi berikutnya).
  • Rekomendasi — "pelanggan yang suka X dekat dengan produk Y di peta".
  • Deteksi duplikat/plagiarisme — teks ditulis ulang tetap tertangkap karena koordinatnya mirip.
  • Clustering — ribuan feedback pelanggan mengelompok sendiri jadi tema.

Cara membandingkan

Dua vektor dibandingkan dengan cosine similarity — ukuran sudut antar dua panah: 1 = arah sama persis, 0 = tidak berhubungan. Sederhana, cepat, dan bekerja sangat baik.

Batasan yang perlu kamu tahu

  • Embedding menangkap kemiripan makna, bukan kebenaran — dua klaim palsu yang mirip tetap berdekatan.
  • Kualitas tergantung model embeddernya; ada yang unggul untuk bahasa Indonesia, ada yang tidak.
  • Teks sangat panjang biasanya dipotong per chunk sebelum di-embed (biasanya 200–500 token per potongan).

Lihat sendiri

Di Playground Embeddings kamu menulis beberapa kalimat, sistem menghitung vektornya, lalu menampilkan matriks kemiripan — kamu bisa lihat kalimat mana yang "saling mengerti".