AI untuk Rumah Sakit Harus Diuji pada Pasien Nyata, Bukan Hanya Dataset

Demo AI kesehatan selalu terlihat convincing. Model menunjukkan image. Sistem menandai area. Score akurasi tinggi. Slide berikutnya bilang: “Lebih cepat.” “Lebih akurat.” “Siap membantu clinician.” Masalahnya, rumah sakit bukan benchmark dataset.

FormatArtikel Undercover.id
Terbit7 September 2026
Waktu baca8 menit
KonteksHealthTech & Digital Health
Daftar isi
  1. Dataset performance adalah langkah awal
  2. Local validation bukan bonus
  3. Workflow performance sama penting dengan model performance
  4. False positive dan false negative punya biaya berbeda
  5. FDA bergerak ke lifecycle approach
  6. Post-deployment monitoring bukan nice-to-have
  7. Subgroup analysis penting
  8. Data rumah sakit sendiri juga imperfect
  9. Clinician harus paham kapan tidak mengikuti AI
  10. Patient juga berhak tahu pada situasi tertentu
  11. Pilot kecil lebih baik daripada rollout besar
  12. Vendor claim harus diverifikasi independen
  13. Rumah sakit bukan tempat beta testing diam-diam
  14. Bacaan terkait

Demo AI kesehatan selalu terlihat convincing.

Model menunjukkan image.

Sistem menandai area.

Score akurasi tinggi.

Slide berikutnya bilang:

“Lebih cepat.”

“Lebih akurat.”

“Siap membantu clinician.”

Masalahnya, rumah sakit bukan benchmark dataset.

Rumah sakit punya pasien real.

Data berantakan.

Perangkat berbeda.

Bahasa berbeda.

Workflow sibuk.

Population berbeda.

Clinical consequence nyata.

AI yang bagus di dataset belum tentu bagus ketika masuk ruang kerja dokter.

Karena itu clinical AI harus diuji di dunia nyata.

Bukan hanya di file test.

Dataset performance adalah langkah awal

Benchmark penting.

Sensitivity.

Specificity.

AUROC.

Calibration.

Error rate.

Semua memberi informasi.

Tanpa evaluation, kita bahkan tidak punya starting point.

Tapi retrospective dataset punya keterbatasan.

Data mungkin lebih bersih dari real deployment.

Case selection bisa berbeda.

Population mungkin sempit.

Prevalence berbeda.

Image quality bagus.

Label dibuat expert.

Workflow context tidak ada.

Model bisa terlihat superior dalam kondisi ideal.

Lalu performa berubah saat dipakai di rumah sakit dengan equipment dan population lain.

Ini dikenal sebagai distribution shift.

Healthcare sangat rentan karena clinical data dipengaruhi banyak faktor.

Local validation bukan bonus

Kalau AI dikembangkan dari dataset luar negeri, rumah sakit Indonesia harus bertanya:

Apakah population relevan?

Apakah disease pattern sama?

Apakah device sama?

Apakah protocol sama?

Apakah language sama?

Apakah clinician workflow sama?

Apakah prevalence sama?

Model yang calibrated di satu setting bisa overpredict atau underpredict di setting lain.

Ini bukan berarti semua AI asing buruk.

Artinya evidence harus cocok intended deployment.

WHO terus menekankan equity, bias, governance, dan context dalam AI health.

AI kesehatan Indonesia membutuhkan validation yang memperhatikan data lokal.

Bukan sekadar menerjemahkan interface.

“Pasien nyata” tidak berarti eksperimen tanpa perlindungan

Judulnya bukan ajakan melempar AI langsung ke patient care.

Justru sebaliknya.

Real-world testing perlu protokol.

Ethics.

Consent bila diperlukan.

Institutional review.

Safety monitoring.

Clear endpoint.

Human oversight.

Fallback.

Pilot scope.

Jangan deploy penuh lalu bilang “kita lihat nanti”.

Clinical implementation harus staged.

Salah satu pola aman adalah silent evaluation.

AI berjalan di belakang layar.

Tidak memengaruhi keputusan clinician dulu.

Bandingkan output dengan outcome atau expert assessment.

Lihat bias.

Lihat failure.

Baru kalau cukup evidence, masuk assisted workflow.

Pendekatan bisa berbeda tergantung device dan regulation.

Intinya: validate sebelum autonomy.

Workflow performance sama penting dengan model performance

AI bisa akurat tetapi mengganggu kerja.

Alert terlalu banyak.

Interface lambat.

Hasil muncul terlambat.

Clinician harus klik sepuluh menu.

Integration buruk.

False positive membanjiri.

Kalau workflow buruk, adoption gagal.

Clinical impact bukan hanya model metric.

Pertanyaan real:

Apakah decision lebih cepat?

Apakah error berkurang?

Apakah workload turun?

Apakah clinician memahami output?

Apakah patient outcome membaik?

Apakah ada unintended consequence?

AI yang menambah satu dashboard lagi belum tentu membantu.

Rumah sakit sudah punya alarm fatigue.

Tambahkan AI tanpa desain workflow bisa memperburuk.

Human factor testing wajib.

False positive dan false negative punya biaya berbeda

Akurasi 95 persen terdengar tinggi.

Tapi kita perlu tahu 5 persen yang salah apa.

Untuk screening, false negative bisa sangat serious karena kondisi terlewat.

False positive bisa memicu pemeriksaan tambahan.

Biaya.

Anxiety.

Resource load.

Trade-off berbeda per use case.

Jadi threshold AI harus dirancang berdasarkan clinical context.

Tidak ada angka akurasi tunggal yang menjawab “apakah aman”.

Model juga harus calibrated.

Confidence score harus meaningful.

Clinician perlu tahu kapan output kurang reliable.

Safety bukan leaderboard.

Ia risk management.

FDA bergerak ke lifecycle approach

Pada Januari 2025, FDA di Amerika Serikat mengeluarkan draft guidance komprehensif untuk AI-enabled medical devices yang menekankan total product lifecycle, transparency, bias, testing, documentation, dan ongoing monitoring.

Pada Januari 2026, FDA juga menerbitkan final guidance Clinical Decision Support Software.

Konteks regulasi Amerika Serikat tidak otomatis menjadi aturan Indonesia.

Tapi arah governance global penting.

Clinical AI tidak dinilai sekali lalu selesai.

Model, data, software, dan environment bisa berubah.

Lifecycle monitoring diperlukan.

Ini sangat relevan untuk AI.

Traditional medical device biasanya lebih statis.

Software bisa update cepat.

Model bisa drift.

Hospital data berubah.

Kinerja perlu dipantau setelah deployment.

Post-deployment monitoring bukan nice-to-have

AI bisa bekerja bagus enam bulan pertama.

Lalu imaging machine diganti.

Protocol berubah.

Patient population berubah.

Hospital membuka cabang.

Dataset input berubah.

Performance drift.

Tanpa monitoring, masalah tidak terlihat.

Rumah sakit perlu KPI.

Error rate.

Override.

False positive.

False negative.

Subgroup performance.

Downtime.

Escalation.

Clinician feedback.

Patient complaint.

Monitoring harus sesuai use case.

Jangan hanya lihat uptime.

System bisa online 99,9 persen dan tetap secara klinis buruk.

Clinical performance harus observable.

Subgroup analysis penting

Average performance bisa menyembunyikan harm.

Model akurat 92 persen overall.

Tapi hanya 75 persen pada subgroup tertentu.

Itu problem.

Subgroup bisa berdasarkan age, sex, comorbidity, device type, location, atau variable lain yang clinically relevant dan legally appropriate.

Analysis harus dirancang hati-hati.

Jangan membuat discriminatory profiling.

Tujuannya mencari performance gap.

Health AI yang dipakai massal harus tahu siapa yang paling mungkin dirugikan.

Equity tidak cukup ditulis di ethics statement.

Harus diukur.

Data rumah sakit sendiri juga imperfect

Ada temptation menganggap local data otomatis benar.

Tidak.

Medical record punya missingness.

Coding inconsistency.

Duplicate.

Label bias.

Documentation style berbeda antar dokter.

Historical inequality bisa masuk data.

Kalau AI dilatih dari historical decision, ia bisa belajar historical bias.

Jadi local dataset perlu governance.

Data quality review.

Label methodology.

Provenance.

Missing data handling.

Bias assessment.

Privacy.

Security.

Semua membentuk model quality.

“Punya data banyak” bukan cukup.

Butuh data yang appropriate.

Clinician harus paham kapan tidak mengikuti AI

Decision support yang bagus bukan yang selalu diikuti.

Kalau clinician tidak pernah override, mungkin system terlalu authoritative atau user takut melawan.

Kalau terlalu sering override, mungkin system tidak useful.

Rumah sakit harus memantau.

Dan clinician perlu psychological safety untuk bilang:

“AI salah.”

Automation bias adalah risk.

Manusia cenderung percaya recommendation dari sistem yang dianggap pintar.

Terutama ketika workload tinggi.

UI harus membantu critical thinking.

Tampilkan reason.

Source.

Confidence.

Limitations.

Jangan hanya tombol merah-hijau tanpa context.

Clinical autonomy manusia harus nyata, bukan formalitas.

Patient juga berhak tahu pada situasi tertentu

Transparency ke pasien tergantung use case, law, dan institutional policy.

Tapi pertanyaan etisnya penting.

Apakah pasien tahu AI terlibat?

Apakah AI hanya administratif?

Apakah memengaruhi diagnosis?

Apakah ada human review?

Siapa accountable?

Semakin besar role AI dalam keputusan klinis, semakin kuat argument untuk transparency.

Trust kesehatan tidak bisa dibangun diam-diam.

Hospital juga perlu consent dan communication framework yang jelas sesuai regulasi.

Jangan membuat semua interaksi penuh jargon AI.

Cukup berikan informasi yang meaningful.

Pilot kecil lebih baik daripada rollout besar

Hospital procurement sering suka big project.

Enterprise license.

Full integration.

Semua department.

AI lebih aman diuji use-case specific.

Satu workflow.

Satu department.

Clear success metric.

Clear stop condition.

Kalau berhasil, scale.

Kalau gagal, loss kecil.

WHO pada 2026 juga menerbitkan guidance untuk scaling health innovation yang menekankan eksplorasi, adaptasi, learning, dan country ownership.

Itu cocok dengan AI implementation.

Scale bukan hanya copy-paste technology.

Scale memerlukan adaptation.

Rumah sakit Jakarta berbeda dengan rumah sakit kabupaten.

Private hospital berbeda dengan public.

Specialist center berbeda dengan general hospital.

Context menentukan.

Vendor claim harus diverifikasi independen

“Model kami 98 persen akurat.”

Pertanyaan berikutnya:

Dataset mana?

Sample berapa?

Prospective atau retrospective?

External validation?

Peer-reviewed?

Performance per subgroup?

Comparator apa?

Clinical endpoint apa?

Vendor boleh bangga.

Hospital tetap harus due diligence.

Procurement health AI harus punya technical dan clinical evaluation.

Bukan hanya IT security dan harga.

Libatkan clinician.

Data scientist.

Risk.

Legal.

Privacy.

Patient safety.

Multidisciplinary review bukan birokrasi berlebihan.

AI clinical punya impact lintas fungsi.

Rumah sakit bukan tempat beta testing diam-diam

Startup culture suka “ship fast”.

Healthcare punya constraint berbeda.

Error bisa memengaruhi pasien.

Jadi iteration tetap bisa cepat, tapi safety gate tidak boleh hilang.

Sandbox.

Synthetic data.

Retrospective testing.

Silent trial.

Controlled pilot.

Prospective evaluation.

Baru scale.

Path seperti ini mungkin lebih lambat dibanding consumer app.

Memang harus.

Clinical innovation tidak dinilai dari kecepatan release semata.

Dinilai dari benefit yang aman.

AI untuk rumah sakit punya potensi besar.

Membantu deteksi.

Documentation.

Workflow.

Capacity planning.

Image analysis.

Clinical decision support.

Administrative automation.

Banyak bagian bisa jadi lebih efisien.

Tapi benchmark dataset hanya menjawab satu pertanyaan:

“Model bekerja pada data ini?”

Rumah sakit perlu menjawab pertanyaan yang jauh lebih penting:

“Apakah sistem ini membantu pasien dan clinician di setting kami tanpa menciptakan risiko baru yang tidak bisa diterima?”

Jawaban itu tidak ada di leaderboard.

Ia muncul ketika AI bertemu pasien nyata, workflow nyata, dan accountability nyata.

Implementation success juga harus memasukkan staff training. AI bagus tidak berguna kalau clinician tidak tahu kapan percaya, kapan override, dan bagaimana report error.

Training jangan hanya sekali saat launch.

Ada onboarding untuk staff baru.

Update ketika model berubah.

Feedback loop.

Clinical AI adalah socio-technical system.

Performance datang dari model plus manusia plus workflow.

Mengabaikan salah satu membuat evaluation terlalu sempit.

AI klinis yang berhasil bukan yang paling canggih di demo.

Ia yang tetap bekerja ketika shift malam sibuk, data tidak sempurna, clinician berbeda, dan pasien tidak menyerupai textbook.

Real-world reliability adalah produk akhirnya.

Hospital juga harus menguji failure recovery. Apa yang terjadi kalau AI down?

Apakah clinician masih bisa bekerja?

Apakah workflow manual tersedia?

Apakah data yang tertunda bisa diproses kembali?

Apakah staff tahu fallback?

Reliability health system bukan hanya model accuracy.

Operational resilience juga penting.

Tool yang sangat pintar tetapi membuat workflow lumpuh saat service unavailable bisa menjadi single point of failure.

Clinical deployment harus punya graceful degradation.

AI membantu ketika ada.

Care tetap jalan ketika tidak ada.

Bacaan terkait

Artikel ini berada dalam HealthTech & Digital Health dan mengikuti metodologi editorial Undercover.id. Format terkait tersedia di Explainer teknologi dan kebijakan digital.