ASAL AI

Transformer: Arsitektur di Balik Semua Model AI Sekarang

Satu paper 2017 — 'Attention Is All You Need' — mengubah seluruh industri. Kuncinya: biarkan model memperhatikan kata mana yang penting, di mana pun posisinya.

LEVEL 01± 8 menit baca

Sebelum 2017, model bahasa membaca teks seperti kamu membaca lewat lubang kunci: kata demi kata, bergantian, sambil berusaha ingat apa yang sudah lewat. Makin panjang kalimatnya, makin banyak yang terlewat.

Paper tahun 2017 dari Google berjudul "Attention Is All You Need" membuang cara itu dan menggantinya dengan satu ide: attention — setiap kata boleh "melihat" semua kata lain sekaligus, lalu menimbang mana yang relevan.

Contoh kenapa attention penting

Kalimat: "Kucing mengejar tikus karena ia lapar."

Siapa yang lapar? "Ia" merujuk ke kucing, bukan tikus. Manusia langsung paham. Model lama sering salah. Dengan attention, kata "ia" langsung membentuk hubungan kuat ke "kucing" — hubungan itu dihitung, bukan ditulis manual.

Bagaimana secara teknis (versi manusiawi)

  1. Tokenisasi: teks dipecah jadi token (potongan kata).
  2. Embedding: tiap token jadi vektor angka — posisinya di "peta makna". Kata "raja" dan "ratu" berdekatan; "raja" dan "selimut" jauh.
  3. Self-attention: tiap token menghitung skor kepentingan terhadap semua token lain (tekniknya: tiga vektor per token bernama Query, Key, Value — gimana tiap token "bertanya" dan "menjawab").
  4. Multi-head: proses attention dijalankan berkali-kali dengan "sudut pandang" berbeda — satu kepala melihat hubungan tata bahasa, kepala lain melihat makna, dst.
  5. Stack: ulangi di puluhan lapisan. Tiap lapisan memperhalus pemahaman konteks.
  6. Prediksi: di akhir, model menghitung distribusi token berikutnya, lalu memilih satu.

Kenapa arsitektur ini menang

  • Paralel. Semua token diproses serentak — pas banget dengan GPU. Model lama (RNN) harus menunggu langkah demi langkah.
  • Skalabel. Tambah data, tambah parameter, tambah komputasi → kualitas naik bisa diprediksi. Ini yang bikin perusahaan berani menginvestasikan ratusan juta dolar untuk melatih.
  • General. Formula sama dipakai untuk teks, gambar, suara, bahkan protein (AlphaFold).

Intuisi terakhir

LLM pada dasarnya adalah mesin penebak token berikutnya yang sangat canggih, dan attention membuat tebakannya punya konteks panjang dan presisi tinggi. Semua keajaiban "AI paham kamu" — dibangun dari kombinasi: peta makna (embedding) + penimbangan relevansi (attention) + skala raksasa.

Berikutnya kita lihat hasil akhirnya: LLM.