Baene, Listia and Renaldi, Dram and Edy, Edy (2026) EVALUASI KELAYAKAN JAWABAN LARGE LANGUAGE MODELS (LLMs) PADA BIDANG KESEHATAN MENGGUNAKAN METODE BERTSCORE. POTERS: Proceedings of Technology, Engineering and Computers, 2 (1). pp. 40-47. ISSN 3090 - 3602
|
Text
Evaluasi Kelayakan Jawaban Large Language Models (LLMs).pdf - Published Version Download (500kB) |
|
|
Text
Turnitin - Evaluasi Kelayakan Jawaban Large Language Models (LLMs) (1).pdf - Published Version Download (570kB) |
Abstract
Perkembangan pesat Large Language Models (LLMs) seperti ChatGPT menawarkan potensi besar dalam sistem tanya jawab medis otomatis, namun evaluasi akurasi jawaban sering kali tidak mampu jika hanya menggunakan metrik leksikal konvensional. Oleh karena itu, diperlukan pendekatan evaluasi berbasis semantik menggunakan BERTScore yang mampu menangkap kedekatan makna kontekstual secara lebih mendalam dibandingkan dengan kecocokan kata. Penelitian ini bertujuan untuk mengukur tingkat kelayakan jawaban ChatGPT di bidang kesehatan dengan membandingkannya terhadap jawaban referensi pakar menggunakan algoritma BERTScore, serta mengembangkan instrumen pengujian otomatis yang efisien berbasis Python pada platform cloud Google Colaboratory. Metode yang digunakan meliputi eksperimen komputasional dengan memproses dataset 100 pertanyaan medis yang mencakup 10 kategori spesifik. Pustaka Hugging Face Transformers digunakan untuk menghitung nilai Precision , Recall , dan F1-Score , sementara validasi sistem dilakukan oleh tiga pakar bidang perangkat lunak dan pemrograman. Analisis data menunjukkan skor F1 rata-rata yang tinggi pada kisaran 0,84–0,89. Namun, persentase jawaban berkualitas "Bagus" sangat bervariasi, di mana kategori anatomi dan nutrisi mencapai kinerja terbaik (80–90%), sedangkan bidang Farmakologi serta Etika kedokteran memiliki akurasi terendah (40–50%). Validasi pakar memberikan skor rata-rata 82,6%, konfirmasi alat. Implementasi BERTScore terbukti efektif sebagai metode evaluasi semantik otomatis untuk LLMs kesehatan. Dapat disimpulkan bahwa meskipun model bahasa mampu menghasilkan teks yang koheren secara semantik, akurasi substansi pada topik medis yang kompleks dan berisiko tinggi masih memerlukan verifikasi lebih lanjut, menjadikan instrumen ini penting untuk pengembangan AI medis yang aman.
| Item Type: | Article |
|---|---|
| Uncontrolled Keywords: | BERTScore, ChatGPT, Google Colab, LLMs, Python |
| Subjects: | 000 Karya Umum > 005 Pemograman > 005.5 Program Aplikasi dengan Kegunaan Khusus 000 Karya Umum > 006 Metode Komputer Tertentu > 006.242 Kode Bar > 006.3 Kecerdasan Buatan 000 Karya Umum > 006 Metode Komputer Tertentu > 006.3 Kecerdasan Buatan |
| Divisions: | Fakultas Sains & Teknologi > Sistem Informasi Fakultas Sains & Teknologi > Teknik Informatika Fakultas Sains & Teknologi > Teknik Perangkat Lunak |
| Depositing User: | Hariyanto Rie |
| Date Deposited: | 28 Aug 2026 07:05 |
| Last Modified: | 28 Aug 2026 07:05 |
| URI: | https://repositori.buddhidharma.ac.id//id/eprint/3450 |
Actions (login required)
![]() |
View Item |

