AI untuk Screening Bisa Menjangkau Lebih Banyak Orang sekaligus Membawa Risiko Bias

Screening punya daya tarik yang sangat cocok dengan AI. Jumlah orang banyak. Waktu tenaga kesehatan terbatas. Data bisa berupa image, suara, questionnaire, atau signal digital. Model bisa membantu menandai siapa yang perlu perhatian lebih lanjut.

FormatArtikel Undercover.id
Terbit4 September 2026
Waktu baca7 menit
KonteksHealthTech & Digital Health
Daftar isi
  1. Screening bukan diagnosis
  2. Bias bisa masuk dari dataset
  3. Local validation penting sekali
  4. False positive tidak netral
  5. False negative lebih berbahaya karena memberi rasa aman
  6. Bias juga bisa muncul dari siapa yang mau memakai tool
  7. Data governance tetap penting
  8. Black-box screening punya masalah trust
  9. Model drift bisa mengubah bias
  10. AI bisa membantu area dengan specialist terbatas
  11. Community participation juga perlu
  12. AI screening harus diuji terhadap outcome, bukan cuma metric model
  13. Bacaan terkait

Screening punya daya tarik yang sangat cocok dengan AI.

Jumlah orang banyak.

Waktu tenaga kesehatan terbatas.

Data bisa berupa image, suara, questionnaire, atau signal digital.

Model bisa membantu menandai siapa yang perlu perhatian lebih lanjut.

Secara teori, AI membuat screening lebih scalable.

Lebih cepat.

Lebih murah.

Bisa menjangkau tempat yang tenaga ahlinya terbatas.

Tapi semakin besar scale, semakin besar juga konsekuensi kalau model punya bias.

Kalau sistem dipakai ke seratus orang dan salah 5 persen, dampaknya terbatas.

Kalau dipakai ke sepuluh juta orang, error kecil berubah menjadi masalah populasi.

Scale memperbesar benefit.

Scale juga memperbesar bias.

Screening bukan diagnosis

Ini distinction pertama.

Screening bertujuan mencari orang yang mungkin punya kondisi atau risiko tertentu sehingga perlu pemeriksaan lanjutan.

Bukan menentukan diagnosis final.

Karena itu metric screening berbeda.

Sensitivity sering sangat penting.

Kalau terlalu banyak false negative, kondisi terlewat.

Kalau false positive terlalu banyak, layanan lanjutan bisa penuh.

AI harus dioptimasi berdasarkan clinical goal.

Bukan hanya overall accuracy.

Angka “95 persen akurat” bisa menyesatkan.

95 persen dari apa?

Pada prevalence berapa?

False negative berapa?

False positive berapa?

Untuk subgroup mana?

AI screening harus dibaca seperti health program.

Bukan leaderboard model.

Bias bisa masuk dari dataset

Model belajar dari data.

Kalau data training tidak mewakili population deployment, performance bisa timpang.

Misalnya model dermatology lebih banyak melihat skin tone tertentu.

Model speech lebih banyak dilatih pada accent tertentu.

Model radiology menggunakan equipment dari hospital besar.

Model maternal risk dibangun dari population dengan access pattern berbeda.

Ketika dipakai ke population lain, error bisa naik.

Ini bukan selalu malicious bias.

Sering structural.

Data kesehatan memang tidak evenly distributed.

Population yang kurang punya akses healthcare juga bisa lebih sedikit muncul dalam dataset.

AI kemudian belajar paling baik dari orang yang sistem kesehatannya memang sudah paling terdokumentasi.

Kalau tidak hati-hati, teknologi yang katanya memperluas akses malah memperlebar gap.

WHO pada 2026 menyoroti equity dan bias sebagai risiko utama AI kesehatan.

Dalam publikasi tentang equity digital health, WHO/Europe juga menekankan perlunya equity-by-design, bias auditing, inclusive governance, dan metric yang lebih jelas sepanjang lifecycle.

Ini bukan catatan tambahan.

Untuk screening massal, equity harus jadi core requirement.

Local validation penting sekali

Model screening yang berhasil di Amerika belum tentu bekerja sama di Indonesia.

Bukan hanya karena ethnicity.

Ada banyak faktor.

Prevalence penyakit.

Device.

Quality image.

Language.

Literacy.

Referral pathway.

Infrastructure.

Clinical threshold.

Population age.

Environment.

Akses follow-up.

Semua bisa memengaruhi hasil program.

Indonesia juga sangat heterogen.

Model yang bagus di Jakarta belum tentu sama performanya di wilayah dengan perangkat dan workflow berbeda.

Local validation perlu lebih dari satu site kalau deployment nasional.

Jangan menganggap satu hospital pilot cukup mewakili negara.

AI screening bisa menjangkau lebih banyak orang, tapi program screening hanya berguna kalau follow-up tersedia

Ini point yang sering hilang.

Misalnya AI bisa screening 100.000 orang dan menandai 5.000 perlu pemeriksaan lanjutan.

Apakah health system punya kapasitas follow-up?

Kalau tidak, kita hanya membuat list baru.

Screening tanpa pathway bukan pelayanan.

Bisa malah meningkatkan anxiety.

Program harus punya:

referral, diagnostic confirmation, treatment access, tracking, communication.

AI cuma satu komponen.

Kalau bagian lain tidak siap, scale screening tidak menghasilkan outcome.

Healthtech bukan hanya model deployment.

Ia service design.

False positive tidak netral

Kalau screening salah menandai orang sehat sebagai berisiko, konsekuensinya bukan cuma “angka salah”.

Orang bisa cemas.

Perlu pemeriksaan tambahan.

Biaya.

Waktu.

Travel.

Potential invasive testing.

Health system workload.

Karena itu false positive harus dinilai dalam context.

Di area dengan specialist terbatas, threshold terlalu sensitif bisa membanjiri referral.

Di kondisi yang sangat berbahaya kalau terlewat, threshold mungkin memang harus sensitif.

Tidak ada setting universal.

Clinical governance menentukan trade-off.

AI tidak boleh membuat threshold sendiri tanpa objective yang jelas.

False negative lebih berbahaya karena memberi rasa aman

Kalau AI screening bilang risiko rendah tetapi sebenarnya ada kondisi, orang mungkin tidak mencari pertolongan.

Ini mirip risiko chatbot reassurance.

Screening result harus dikomunikasikan dengan benar.

“Tidak terdeteksi” bukan sama dengan “pasti tidak ada”.

Language matters.

Probability harus dijelaskan sesuai literacy user.

Jangan menampilkan green badge besar yang membuat user menganggap bebas risiko kalau sensitivity tidak sempurna.

UX bisa menciptakan overconfidence.

Bias juga bisa muncul dari siapa yang mau memakai tool

Bayangkan screening via smartphone.

Secara teori accessible.

Tapi siapa yang punya smartphone cukup bagus?

Internet?

Literacy digital?

Bahasa?

Siapa yang merasa nyaman upload foto?

Siapa yang khawatir privacy?

Adoption bias bisa terjadi sebelum model bekerja.

Program hanya menjangkau population tertentu.

Lalu hasil dianggap mewakili semua.

Ini problem public health.

AI screening harus melihat coverage.

Siapa yang tidak ikut?

Kenapa?

Equity bukan cuma accuracy per subgroup.

Juga access per subgroup.

Data governance tetap penting

Screening massal menghasilkan data sangat sensitif.

Image.

Health response.

Demography.

Location.

Risk score.

Semua perlu governance.

Purpose limitation.

Retention.

Consent.

Access.

Security.

Deletion.

Data untuk screening jangan otomatis dipakai training tambahan tanpa dasar yang jelas.

Population-scale data sangat valuable.

Justru itu perlu protection lebih kuat.

Health system harus transparan.

Orang perlu tahu apa yang dikumpulkan dan untuk apa.

Black-box screening punya masalah trust

Kalau AI menandai high risk, clinician perlu tahu dasar output setidaknya dalam bentuk yang useful.

Tidak semua model harus fully interpretable secara matematis ke user.

Tapi system harus punya evidence.

Performance.

Limitation.

Subgroup analysis.

Failure mode.

Clinician tidak boleh cuma menerima skor merah tanpa context.

FDA dan banyak regulator mendorong transparency untuk AI clinical tools karena decision support membutuhkan kemampuan human review.

Screening massal juga perlu auditability.

Kalau ada pattern harm, kita harus bisa investigate.

Tanpa log, tidak ada accountability.

Model drift bisa mengubah bias

Bias bukan sesuatu yang diuji sekali.

Data berubah.

Population berubah.

Device berubah.

Software update.

Hospital workflow berubah.

Model performance bisa drift.

Monitoring harus ongoing.

Kalau false negative naik pada subgroup tertentu, system harus mendeteksi.

Kalau device baru menghasilkan image quality berbeda, calibration bisa berubah.

Post-deployment monitoring sangat penting untuk clinical AI.

Scale membuat monitoring lebih complex.

Tapi justru lebih necessary.

AI bisa membantu area dengan specialist terbatas

Ini opportunity besar.

Image screening.

Retinal screening.

Chest imaging.

Pathology triage.

Maternal risk.

Banyak use case bisa membantu prioritas.

WHO/Europe pada 2025 dan 2026 menunjukkan AI-assisted diagnostics sudah digunakan di banyak negara dan ada contoh nyata image analysis membantu clinician mengidentifikasi disease lebih cepat.

Potensinya jelas.

AI bisa memperluas capacity.

Tapi jangan menjual narrative bahwa AI menggantikan specialist.

Ia bisa membantu mengarahkan specialist ke case yang paling membutuhkan.

Prioritization.

Triage.

Second read.

Itu lebih realistis.

Community participation juga perlu

Kalau program screening diterapkan ke population, masyarakat bukan sekadar dataset.

Mereka stakeholder.

Bagaimana hasil disampaikan?

Apa kekhawatiran privacy?

Apa cultural context?

Apakah bahasa bisa dipahami?

Apakah ada distrust terhadap AI?

Participatory design membantu.

WHO 2026 menekankan inclusive governance dalam digital health equity.

Ini penting.

Program yang technically bagus bisa gagal kalau community tidak percaya.

Trust tidak bisa dipaksa dengan poster “AI-powered”.

Kadang istilah AI malah bikin orang khawatir.

Jelaskan fungsi, benefit, dan batas secara konkret.

Jangan hype.

AI screening harus diuji terhadap outcome, bukan cuma metric model

Akhirnya pertanyaan utama bukan:

“Seberapa akurat model?”

Tapi:

“Apakah screening meningkatkan detection yang meaningful?”

“Apakah treatment lebih cepat?”

“Apakah outcome membaik?”

“Apakah access lebih merata?”

“Apakah workload masih manageable?”

“Apakah harm meningkat?”

Ini clinical effectiveness.

Model metric hanya bagian.

Sebuah AI bisa punya AUROC tinggi tetapi tidak memperbaiki outcome karena referral system buruk.

Atau karena clinician tidak percaya.

Atau karena population tidak mau ikut.

AI health adalah socio-technical system.

Manusia, workflow, policy, dan infrastructure sama pentingnya.

Potensi terbesar AI screening justru ada pada scale.

Membawa layanan awal ke lebih banyak orang.

Membantu health system melihat risiko lebih cepat.

Mengurangi bottleneck.

Tapi scale harus disertai fairness.

Kalau tidak, kita hanya mengotomatisasi ketimpangan.

AI yang dipakai untuk screening harus selalu ditanya dua hal.

Siapa yang berhasil dideteksi?

Dan siapa yang paling mungkin terlewat?

Pertanyaan kedua biasanya tidak tampil di demo.

Justru itu yang paling penting sebelum sistem dipakai luas.

Procurement juga perlu meminta subgroup evidence dari vendor. Jangan puas dengan satu angka headline.

Tanya dataset composition.

External validation.

Device variation.

Age distribution.

Sex distribution.

Relevant clinical subgroup.

Kalau vendor tidak punya jawaban, itu information gap.

Bukan otomatis berarti produk jelek.

Tapi hospital harus tahu gap sebelum deployment.

Bias auditing adalah bagian due diligence, bukan pekerjaan setelah complaint muncul.

AI screening yang adil bukan model yang punya angka rata-rata tinggi.

Ia system yang tahu siapa yang mungkin dirugikan, mengukur gap itu, dan punya mekanisme memperbaikinya sebelum scale memperbesar masalah.

Ada juga risiko bias dari label. Dataset bisa terlihat besar, tapi label yang dipakai sebagai “ground truth” berasal dari keputusan klinis lama yang sendiri tidak sempurna.

Kalau access ke specialist timpang, sebagian kelompok mungkin lebih jarang mendapat diagnosis formal. Model kemudian belajar bahwa mereka “lebih jarang sakit”, padahal mungkin hanya lebih jarang terdeteksi.

Ini contoh bagaimana historical inequality bisa masuk ke algorithm.

Karena itu audit dataset tidak cukup menghitung jumlah image.

Tanya bagaimana label dibuat.

Siapa yang memberi label?

Apakah ada second review?

Apakah diagnosis confirmed?

Apakah missing label dianggap negative?

Semua detail ini memengaruhi bias.

AI screening bukan shortcut untuk menghindari problem data health system. Kadang ia justru memaksa kita melihat problem lama dengan lebih jelas.

Bias harus diuji, bukan diasumsikan hilang hanya karena model modern.

Bacaan terkait

Artikel ini berada dalam HealthTech & Digital Health dan mengikuti metodologi editorial Undercover.id. Format terkait tersedia di Explainer teknologi dan kebijakan digital.