EVALUASI KELAYAKAN JAWABAN LARGE LANGUAGE MODELS (LLMs) PADA BIDANG KESEHATAN MENGGUNAKAN METODE BERTSCORE

Baene, Listia and Renaldi, Dram and Edy, Edy (2026) EVALUASI KELAYAKAN JAWABAN LARGE LANGUAGE MODELS (LLMs) PADA BIDANG KESEHATAN MENGGUNAKAN METODE BERTSCORE. POTERS: Proceedings of Technology, Engineering and Computers, 2 (1). pp. 40-47. ISSN 3090 - 3602

[img] Text
Evaluasi Kelayakan Jawaban Large Language Models (LLMs).pdf - Published Version

Download (500kB)
[img] Text
Turnitin - Evaluasi Kelayakan Jawaban Large Language Models (LLMs) (1).pdf - Published Version

Download (570kB)

Abstract

Perkembangan pesat Large Language Models (LLMs) seperti ChatGPT menawarkan potensi besar dalam sistem tanya jawab medis otomatis, namun evaluasi akurasi jawaban sering kali tidak mampu jika hanya menggunakan metrik leksikal konvensional. Oleh karena itu, diperlukan pendekatan evaluasi berbasis semantik menggunakan BERTScore yang mampu menangkap kedekatan makna kontekstual secara lebih mendalam dibandingkan dengan kecocokan kata. Penelitian ini bertujuan untuk mengukur tingkat kelayakan jawaban ChatGPT di bidang kesehatan dengan membandingkannya terhadap jawaban referensi pakar menggunakan algoritma BERTScore, serta mengembangkan instrumen pengujian otomatis yang efisien berbasis Python pada platform cloud Google Colaboratory. Metode yang digunakan meliputi eksperimen komputasional dengan memproses dataset 100 pertanyaan medis yang mencakup 10 kategori spesifik. Pustaka Hugging Face Transformers digunakan untuk menghitung nilai Precision , Recall , dan F1-Score , sementara validasi sistem dilakukan oleh tiga pakar bidang perangkat lunak dan pemrograman. Analisis data menunjukkan skor F1 rata-rata yang tinggi pada kisaran 0,84–0,89. Namun, persentase jawaban berkualitas "Bagus" sangat bervariasi, di mana kategori anatomi dan nutrisi mencapai kinerja terbaik (80–90%), sedangkan bidang Farmakologi serta Etika kedokteran memiliki akurasi terendah (40–50%). Validasi pakar memberikan skor rata-rata 82,6%, konfirmasi alat. Implementasi BERTScore terbukti efektif sebagai metode evaluasi semantik otomatis untuk LLMs kesehatan. Dapat disimpulkan bahwa meskipun model bahasa mampu menghasilkan teks yang koheren secara semantik, akurasi substansi pada topik medis yang kompleks dan berisiko tinggi masih memerlukan verifikasi lebih lanjut, menjadikan instrumen ini penting untuk pengembangan AI medis yang aman.

Item Type: Article
Uncontrolled Keywords: BERTScore, ChatGPT, Google Colab, LLMs, Python
Subjects: 000 Karya Umum > 005 Pemograman > 005.5 Program Aplikasi dengan Kegunaan Khusus
000 Karya Umum > 006 Metode Komputer Tertentu > 006.242 Kode Bar > 006.3 Kecerdasan Buatan
000 Karya Umum > 006 Metode Komputer Tertentu > 006.3 Kecerdasan Buatan
Divisions: Fakultas Sains & Teknologi > Sistem Informasi
Fakultas Sains & Teknologi > Teknik Informatika
Fakultas Sains & Teknologi > Teknik Perangkat Lunak
Depositing User: Hariyanto Rie
Date Deposited: 28 Aug 2026 07:05
Last Modified: 28 Aug 2026 07:05
URI: https://repositori.buddhidharma.ac.id//id/eprint/3450

Actions (login required)

View Item View Item