Implementasi Large Language Model Berbasis API Key untuk Rekomendasi Kode ICD di Rumah Sakit
“Pada penelitian ini kami membahas implementasi Large Language Model atau LLM berbasis API key yang digunakan untuk memberikan rekomendasi kode ICD di rumah sakit. Sistem ini dirancang sebagai alat bantu bagi Perekam Medis dan Informasi Kesehatan atau PMIK dalam proses pengodean, sehingga proses pencarian kode dapat dilakukan dengan lebih cepat dan efisien.”
SOROTAN RISET
Latar Belakang
Tantangan kompleksitas kodifikasi klinis manual dan potensi integrasi Large Language Model.
“Pengodean klinis merupakan salah satu proses penting dalam pelayanan rumah sakit. Kode yang dihasilkan berhubungan dengan klaim INA-CBGs, statistik kesehatan, dan pelaporan rumah sakit. Namun dalam praktiknya, proses pengodean masih banyak dilakukan secara manual. Koder harus memahami narasi diagnosis yang terkadang tidak terstruktur, menggunakan singkatan, atau memiliki lebih dari satu diagnosis. Kondisi ini membutuhkan waktu dan pengalaman, sehingga diperlukan teknologi yang dapat membantu koder dalam mencari kandidat kode secara lebih cepat.”
Research Gap & Kebaruan
Perbandingan pendekatan model konvensional dengan metode integrasi LLM berbasis API Key.
RESEARCH GAP
- ✕ Penelitian sebelumnya banyak menggunakan model yang di-training atau fine-tuning.
- ✕ Beberapa pendekatan membutuhkan infrastruktur komputasi dan dataset berlabel yang besar.
- ✕ Penggunaan LLM komersial melalui API key masih terbatas dalam konteks SIMRS di Indonesia.
- ✕ Integrasi dengan mekanisme human-in-the-loop masih perlu dikembangkan.
KEBARUAN PENELITIAN
- ✓ Penelitian ini mengintegrasikan LLM melalui API key ke modul pendukung pengodean.
- ✓ Sistem menggunakan knowledge prompt berbasis indeks ICD-10.
- ✓ Evaluasi dilakukan terhadap akurasi, kesepakatan ahli, dan usability.
“Berdasarkan penelitian terdahulu, sebagian besar pendekatan menggunakan model yang harus dilatih atau di-fine-tune terlebih dahulu. Pendekatan tersebut membutuhkan infrastruktur dan dataset yang cukup besar. Penelitian kami mencoba pendekatan yang lebih sederhana, yaitu menggunakan LLM komersial melalui API key tanpa melakukan pelatihan model dari awal. LLM kemudian diintegrasikan ke dalam SIMRS dan tetap menempatkan PMIK sebagai pengambil keputusan akhir melalui mekanisme human-in-the-loop.”
Tujuan Penelitian
Sasaran utama perancangan, integrasi sistem, dan evaluasi performa rekomendasi kode ICD.
1. Purwarupa
Merancang purwarupa rekomendasi kode ICD berbasis LLM.
2. Integrasi
Mengintegrasikan LLM melalui API key ke dalam SIMRS.
3. Akurasi
Mengukur akurasi rekomendasi kode ICD.
4. Kesepakatan
Mengukur tingkat kesepakatan dengan validator ahli.
5. Usability
Mengevaluasi usability sistem menggunakan SUS.
“Tujuan penelitian ini adalah merancang sebuah purwarupa yang dapat memberikan rekomendasi kode ICD menggunakan LLM. Selanjutnya, LLM diintegrasikan melalui API key ke dalam SIMRS. Kami kemudian mengevaluasi seberapa akurat rekomendasi yang diberikan dibandingkan dengan kode dari validator ahli. Selain akurasi, kami juga melihat tingkat kesepakatan dan bagaimana pengguna menilai kemudahan serta kegunaan sistem.”
Metodologi Penelitian
Desain penelitian, tahapan implementasi teknis, serta dataset dan responden evaluasi.
DESAIN PENELITIAN
TAHAPAN RISET
DATA PENELITIAN
- 25 narasi diagnosis sintesis (ICD-10 Bab I: A00–B99).
- Validator: dosen RMIK.
- Responden usability: 20 mahasiswa dan dosen RMIK.
“Penelitian ini menggunakan pendekatan kuantitatif dengan metode Research and Development. Penelitian dilakukan dalam tiga tahap, yaitu analisis kebutuhan dan perancangan arsitektur, pengembangan purwarupa, kemudian evaluasi akurasi dan usability. Data yang digunakan terdiri dari 25 narasi diagnosis sintesis yang mewakili Bab I ICD-10, yaitu penyakit infeksi dan parasit tertentu. Untuk evaluasi usability, digunakan 20 responden yang terdiri dari mahasiswa dan dosen RMIK.”
Alur Sistem
Skema alur data dari input narasi diagnosis hingga penetapan kode final oleh PMIK.
“Alur sistem dimulai ketika PMIK memasukkan atau memilih narasi diagnosis dari SIMRS. Data kemudian diproses oleh backend dan dikirimkan ke layanan LLM melalui API key dengan koneksi yang aman. Prompt yang diberikan kepada LLM dilengkapi dengan konteks dari indeks ICD-10. Selanjutnya, LLM menghasilkan tiga kandidat kode teratas beserta alasan dan tingkat keyakinannya. Hasil tersebut ditampilkan kepada PMIK untuk diverifikasi. PMIK tetap memiliki kewenangan untuk menerima, mengubah, atau menolak rekomendasi sebelum kode ditetapkan sebagai kode final.”
Hasil Performa Sistem
Hasil pengujian kuantitatif akurasi, metrik klasifikasi, dan kesepakatan Cohen’s Kappa.
| Metrik | Hasil |
|---|---|
| Akurasi Top-1 | 64,0% |
| Akurasi Top-3 | 76,0% |
| Precision | 0,66 |
| Recall | 0,64 |
| F1-Score | 0,65 |
| Cohen’s Kappa | 0,58 |
| Waktu Respons | 3,2 detik |
“Hasil penelitian menunjukkan bahwa akurasi Top-1 sistem adalah 64 persen, sedangkan akurasi Top-3 mencapai 76 persen. Artinya, dari 25 kasus yang diuji, sebanyak 16 kasus memiliki kode yang tepat pada rekomendasi pertama, sedangkan 19 kasus memiliki kode yang tepat di dalam tiga rekomendasi teratas. Nilai Cohen’s Kappa sebesar 0,58 menunjukkan tingkat kesepakatan yang moderat dengan validator ahli. Rata-rata waktu respons sistem adalah sekitar 3,2 detik per kasus.”
System Usability Scale (SUS)
Pengukuran kepuasan pengguna dengan instrumen System Usability Scale (SUS).
| Aspek | Skor |
|---|---|
| Kemudahan Penggunaan | 78,0 |
| Kepercayaan terhadap Rekomendasi | 70,5 |
| Efisiensi Waktu Kerja | 75,0 |
| SUS Total | 74,5 — Baik |
“Selain akurasi, kami juga melakukan evaluasi terhadap usability sistem menggunakan System Usability Scale. Hasilnya menunjukkan skor total sebesar 74,5 dan masuk dalam kategori baik. Kemudahan penggunaan memperoleh skor 78, efisiensi waktu kerja 75, sedangkan kepercayaan terhadap rekomendasi memperoleh skor 70,5. Hasil ini menunjukkan bahwa sistem cukup mudah digunakan dan dapat membantu pekerjaan, tetapi pengguna tetap merasa perlu melakukan verifikasi terhadap rekomendasi yang diberikan LLM.”
Pembahasan
Analisis temuan riset, implikasi klinis, dan positioning LLM dalam ekosistem SIMRS.
• LLM berbasis API key layak secara teknis sebagai alat bantu pengodean.
• Akurasi Top-3 lebih tinggi daripada Top-1.
• LLM lebih tepat digunakan sebagai penyaring kandidat kode.
• Sistem dapat membantu mempercepat proses pencarian kode.
• Tidak membutuhkan proses training model dari awal.
• Tidak membutuhkan dataset berlabel dalam jumlah besar.
• PMIK tetap berperan sebagai verifikator akhir.
• Keamanan dan privasi data harus menjadi perhatian utama.
“Dari hasil penelitian dapat dilihat bahwa LLM memiliki potensi sebagai alat bantu pengodean, tetapi belum tepat jika digunakan sebagai pengambil keputusan secara otomatis. Perbedaan antara akurasi Top-1 dan Top-3 menunjukkan bahwa sistem lebih bermanfaat ketika memberikan beberapa kandidat kode kepada koder. Dengan demikian, LLM dapat membantu mempersempit pencarian kode, sedangkan keputusan akhir tetap dilakukan oleh PMIK. Pendekatan API key juga lebih praktis karena tidak membutuhkan proses training dari awal dan tidak membutuhkan infrastruktur komputasi yang besar.”
Kesimpulan
Rangkuman pencapaian riset dan rekomendasi pengembangan penelitian di masa depan.
- ✔ Integrasi LLM berbasis API key ke dalam SIMRS dapat diimplementasikan secara teknis.
- ✔ Akurasi Top-1 mencapai 64,0%.
- ✔ Akurasi Top-3 mencapai 76,0%.
- ✔ Skor SUS mencapai 74,5 dengan kategori Baik.
- ✔ Sistem berpotensi meningkatkan efisiensi proses pengodean.
- ✔ Sistem belum dapat menggantikan keputusan koder.
- ✔ Pendekatan human-in-the-loop tetap diperlukan.
- ✔ Penelitian selanjutnya perlu menggunakan data klinis riil, sampel lebih besar, seluruh bab ICD-10, dan validator koder praktisi.
“Sebagai kesimpulan, penelitian ini menunjukkan bahwa integrasi Large Language Model melalui API key ke dalam SIMRS dapat dilakukan secara teknis dan memberikan hasil awal yang cukup menjanjikan. Akurasi Top-1 mencapai 64 persen, Top-3 mencapai 76 persen, dan usability memperoleh skor 74,5 dengan kategori baik. Namun, sistem belum dapat menggantikan peran koder karena masih terdapat kemungkinan kesalahan dan halusinasi dari model. Oleh karena itu, LLM sebaiknya digunakan sebagai asisten pengodean, sementara keputusan akhir tetap berada pada PMIK. Penelitian selanjutnya perlu dilakukan menggunakan data klinis riil, jumlah sampel yang lebih besar, cakupan seluruh bab ICD-10, serta melibatkan koder praktisi sebagai validator.”