Multimodal AI: Satu Model, Banyak Indera
Model sekarang bisa melihat gambar, mendengar suara, membaca dokumen, dan menjawab campuran semuanya. Prinsip di baliknya: semuanya jadi token.
Model teks murni itu buta dan tuli. Model multimodal memproses beberapa jenis data sekaligus — gambar, audio, video, teks — dalam satu percakapan.
Kamu sudah pernah memakainya: unggah foto struk belanja ke chatbot dan minta rincian pengeluarannya; rekam suara dan minta dirangkum; tunjuk diagram arsitektur dan minta diterangkan.
Cara membuatnya bisa "melihat"
Kuncinya elegan: ubah semua modalitas jadi token — benda yang sama dengan teks.
- Gambar dipecah jadi potongan-potongan kecil (patch), tiap patch di-embed jadi vektor — sekarang "potongan gambar" bisa duduk bersebelahan dengan token kata dalam context window.
- Audio dipecah per segmen waktu menjadi token suara.
- Model yang sama yang tadinya menebak token teks berikutnya kini bekerja di campuran token semua jenis.
Itulah kenapa kamu bisa bertanya "apa yang aneh di gambar ini?" — pertanyaanmu dan gambarnya sama-sama tinggal di meja kerja model.
Kemampuan praktis yang layak kamu bangun
- Ekstraksi dokumen. Faktur, KTP, formulir tulisan tangan — minta model mengeluarkan JSON terstruktur. (Kombinasikan dengan materi structured output.)
- QA visual. "Di slide ini, angka mana yang tidak konsisten?" — berguna untuk audit laporan dan UI.
- RAG multimodal. Pencarian gambar dengan teks ("cari screenshot halaman checkout yang error") — embed gambar dan teks ke ruang makna yang sama.
- Aksesibilitas. Menjelaskan gambar untuk pengguna tunanetra secara otomatis.
Batasannya
- Hitungan presisi tetap lemah. Model bisa salah membaca angka kecil di tabel padat — untuk data penting, tetap ekstrak dan validasi dengan kode.
- Konteks gambar mahal. Gambar memakan token jauh lebih besar daripada teks; unggah 50 gambar dan context window-mu habis.
- Halusinasi visual itu nyata. Ia bisa "melihat" detail yang tidak ada. Untuk keputusan berisiko, minta model mengutip lokasinya di gambar ("di baris ketiga kolom kedua") supaya bisa kamu cek.
Peta belajarmu sekarang
Level 02 selesai. Kamu kini paham semua bagian mesinnya: prompt, context, embedding, RAG, agent, tools, fine-tuning, multimodal.
Saatnya Level 03 — BIKIN: kamu akan membangun proyek sungguhan, mulai dari chatbot pertamamu. Buka halaman Project.