Text
Ekstraksi Informasi Dari Gambar Ke Teks Menggunakan Fine_Tuned Model Visual Transformers Dan Cahya (Studi Kasus Citra Kuliner Khas Makassar )
Di era digital saat ini, kemampuan komputer untuk memahami konten visual dan tekstual menjadi semakin krusial. Meskipun model AI
generatif telah menunjukkan kemampuan yang luar biasa dalam memahami dan menghasilkan konten berbasis teks, integrasi pemahaman
visual masih merupakan tantangan signifikan dan tetap menjadi area penelitian yang aktif. Oleh karena itu, penelitian ini berfokus pada pengembangan sistem Visual Question Answering (VQA), yang bertujuan untuk menje mbatani kesenjangan antara kedua modalitas tersebut. Secara khusus, penelitian ini membahas tantangan utama dalam melatih model agar mampu secara akurat mengidentifikasi objek-objek
tertentu dalam gambar (dalam hal ini, kuliner khas Makassar) serta menghasilkan jawaban yang relevan dan akurat. Dengan memanfaatkan
model pre-trained yang sudah ada—ViT untuk pemahaman visual dan Cahya_GPT-2 untuk pemahaman teks. Tantangan utamanya terletak
pada bagaimana mengintegrasikan keunggulan kedua model tersebut, mengingat keduanya dibangun dengan arsitektur yang berbeda.
Penelitian ini juga berupaya menunjukkan bahwa melalui proses fine-tuning yang strategis, sebuah sistem dapat dilatih untuk menyampaikan hasil pemahamannya terhadap informasi visual, sehingga mampu mengubah data mentah menjadi pengetahuan yang dapat diakses serta menghasilkan keluaran teks yang kontekstual dan relevan.
| T250050 | TESIS - TIR e | Perpustakaan Universitas Handayani Makassar | Tersedia |
Tidak tersedia versi lain