Masalah paling berbahaya dari AI kesehatan bukan selalu jawaban yang absurd.
Kalau chatbot bilang sesuatu yang jelas aneh, orang mudah curiga.
Yang lebih sulit adalah jawaban salah yang terdengar sangat masuk akal.
Bahasanya rapi.
Ada alasan.
Ada langkah-langkah.
Ada disclaimer.
Ada bullet point.
Semua membuat respons terasa authoritative.
Di kesehatan, format meyakinkan bisa menciptakan overtrust.
User tidak menilai model dari benchmark.
Mereka menilai dari cara jawabannya terdengar.
Dan manusia punya kecenderungan menganggap penjelasan yang fluent sebagai penjelasan yang benar.
Fluency bukan evidence
Generative AI dibangun untuk menghasilkan language yang probable dan coherent.
Itu tidak sama dengan clinical verification.
Model bisa menggabungkan fakta benar dengan inference salah.
Bisa memakai guideline lama.
Bisa kehilangan context.
Bisa salah membaca input.
Bisa mengarang source.
Bisa membuat recommendation terlalu spesifik.
Karena output-nya fluent, error tidak selalu terlihat.
Ini salah satu alasan health AI perlu source grounding, human oversight, dan risk-based limitation.
WHO pada 2026 kembali menekankan AI harus augment, bukan replace human judgement di kesehatan, serta menyoroti bias, opacity, data governance, equity, dan regulatory gap.
Clinical context terlalu high-stakes untuk menganggap language quality sebagai safety.
Saran kesehatan punya level risiko berbeda
Tidak semua advice sama.
“Minum cukup air secara umum” beda risiko dengan “ubah dosis obat.”
“Buat sleep diary” beda dengan “stop medication.”
“Bawa daftar gejala ke dokter” beda dengan “tidak perlu ke dokter.”
Product harus punya risk taxonomy.
Low-risk wellbeing information.
General education.
Navigation.
Clinical interpretation.
Medication.
Diagnosis.
Emergency advice.
Semakin tinggi risk, semakin ketat guardrail.
Jangan menggunakan satu policy untuk semua.
AI general-purpose sering punya satu conversational surface untuk semuanya.
Itu membuat risk boundary tidak terlihat.
Health product sebaiknya membuatnya explicit.
User harus skeptis terhadap specificity yang tidak punya context
Kalau AI memberi saran sangat spesifik, tanya:
Dari data apa?
Apakah tahu riwayat gue?
Apakah tahu obat lain?
Apakah tahu alergi?
Apakah tahu hasil pemeriksaan?
Apakah tahu diagnosis sebelumnya?
Kalau tidak, recommendation spesifik harus diperlakukan hati-hati.
Contoh paling obvious adalah medication.
Dosis dipengaruhi banyak faktor.
Obat lain.
Kidney function.
Liver function.
Age.
Pregnancy.
Indication.
Formulation.
Clinical target.
AI yang hanya punya satu paragraph user tidak punya full context.
Jangan ubah terapi hanya karena jawaban terdengar professional.
Source harus bisa diperiksa
Kalau AI mengutip guideline atau riset, cek.
Apakah sumber real?
Tanggal?
Organization?
Apakah recommendation berlaku untuk kondisi yang dibahas?
AI bisa membuat citation error.
Health information perlu verifiability.
Source resmi.
WHO.
Kementerian kesehatan.
Regulator.
Professional guideline.
Peer-reviewed review.
Hospital official education.
Tidak semua blog sama.
User tidak perlu menjadi researcher.
Tapi untuk keputusan penting, source quality matter.
Tool yang baik seharusnya membantu dengan source.
Bukan menyembunyikan semuanya di balik “AI says”.
FDA juga membedakan clinical decision support berdasarkan intended use
Pada Januari 2026, FDA menerbitkan final guidance Clinical Decision Support Software.
Dokumen itu memperjelas bagaimana regulator Amerika Serikat melihat berbagai fungsi CDS dan kapan software bisa masuk atau tidak masuk definisi medical device tertentu.
Detail hukum FDA tidak otomatis berlaku di Indonesia.
Tapi message yang relevan adalah intended use sangat penting.
Software yang memberi support untuk professional punya risk profile berbeda dari software yang dipakai pasien.
Tool yang memberi recommendation yang bisa independent-review oleh clinician berbeda dari black-box directive.
Health AI bukan satu kategori.
Saran yang diberikan menentukan regulatory dan safety requirement.
User harus tahu apakah tool memang didesain untuk fungsi itu.
Jangan pakai chatbot umum seperti medical device hanya karena jawabannya bagus.
Confidence score juga tidak selalu membantu
Beberapa system bisa memberi probability.
“80 persen kemungkinan…”
Angka membuat output terasa scientific.
Tapi probability hanya berguna kalau calibrated dan validated untuk task serta population yang relevan.
Kalau tidak, angka bisa memberi false precision.
User melihat 80 persen dan merasa hampir pasti.
Padahal basisnya mungkin lemah.
Health AI harus hati-hati menggunakan numeric confidence ke consumer.
Kadang qualitative uncertainty lebih appropriate.
“Informasi tidak cukup untuk menentukan.”
Itu lebih honest.
Kalau ada probability, jelaskan konteks.
Apa yang diukur?
Pada dataset apa?
Untuk siapa?
Tanpa itu, angka hanya decoration.
AI bisa salah membaca input gambar
User sering upload foto ruam, hasil lab, resep, X-ray screenshot, atau obat.
Multimodal model makin capable.
Tapi input image punya risk.
Blur.
Lighting.
Crop.
OCR salah.
Angle.
Compression.
AI bisa membaca nama obat salah.
Angka desimal salah.
Tanggal salah.
Kalau output kemudian dibangun dari transcription error, jawabannya terlihat rapi tetapi foundation salah.
User perlu verify extracted data.
Product bisa menunjukkan:
“Gue membaca ini sebagai 1,7. Benar?”
Confirmation step bisa mencegah error.
Safety sering datang dari interaction design sederhana.
Anchoring bisa terjadi setelah AI memberi diagnosis pertama
Kalau AI bilang “kemungkinan gastritis”, user mulai melihat semua gejala lewat frame itu.
Saat ke dokter, mereka mungkin hanya menyebut informasi yang mendukung.
Ini anchoring.
Clinician juga bisa terkena automation bias kalau melihat AI recommendation lebih dulu.
Clinical workflow perlu memikirkan urutan informasi.
Kadang lebih baik dokter membuat initial assessment dulu sebelum melihat AI output.
Atau AI output ditempatkan sebagai second opinion.
Design bisa mengurangi bias.
Jangan menganggap human oversight otomatis menyelesaikan.
Human bisa terlalu percaya machine.
Oversight harus meaningful.
Language lokal bisa membuat advice salah context
AI global mungkin memberi saran yang masuk akal di negara lain tetapi tidak sesuai Indonesia.
Obat OTC berbeda.
Referral pathway berbeda.
Emergency number berbeda.
Availability berbeda.
Regulation berbeda.
Insurance berbeda.
Cultural practice berbeda.
Kalau AI tidak tahu location context, jangan memberi detail local-specific.
User juga perlu menyebut negara jika bertanya tentang access atau regulation.
Untuk medical advice, general guideline masih perlu disesuaikan clinician.
Localization bukan sekadar translation.
Health system context matter.
Saran lifestyle pun bisa terlalu simplistik
AI sering bilang:
“Tidur cukup.”
“Kurangi stres.”
“Makan sehat.”
“Olahraga.”
Secara umum bagus.
Tapi advice bisa terasa menyalahkan kalau context tidak dipahami.
Shift worker.
Caregiver.
Orang dengan disability.
Low-income.
Orang yang tinggal jauh dari fasilitas olahraga.
Orang dengan kondisi medis tertentu.
Health recommendation harus realistis.
AI bisa membantu membuat small step.
Tapi jangan mengubah social determinant menjadi masalah discipline pribadi.
Ini juga bagian humanization.
Kesehatan bukan productivity challenge.
Doctor dan patient bisa memakai AI sebagai conversation aid
Daripada mempercayai advice langsung, user bisa membawa output ke consultation.
“AI bilang ini. Menurut dokter bagian mana yang benar?”
Ini sehat.
Clinician bisa correct.
AI menjadi draft hypothesis.
Bukan final answer.
Dokter juga bisa memakai AI untuk merangkum guideline atau literature lalu review.
Again, augment.
Not replace.
Model sangat bagus mengurangi cognitive overhead.
Clinical accountability tetap human.
Saran yang paling aman sering berbentuk pertanyaan
AI tidak harus selalu memberi action.
Kadang bisa memberi question.
“Apakah gejala memburuk?”
“Apakah ada obat baru?”
“Apakah pernah mengalami sebelumnya?”
“Apa yang perlu dibawa ke appointment?”
Question membantu user mengumpulkan data.
Ini lebih aman daripada memberi conclusion terlalu cepat.
Health chatbot yang matang tidak dinilai dari jumlah jawaban.
Dinilai dari kualitas decision support.
Kadang keputusan terbaik adalah mencari informasi tambahan.
Kita perlu belajar membaca AI seperti membaca junior assistant yang sangat fasih
Bayangkan ada assistant pintar, cepat, tapi tidak selalu benar.
Lo tetap check source.
Lo tidak membiarkan dia membuat keputusan high-stakes sendiri.
Lo pakai untuk draft.
Summary.
Idea.
Preparation.
AI kesehatan bisa diperlakukan seperti itu.
Bukan oracle.
Bukan authority terakhir.
Semakin bagus model, semakin penting mindset ini karena error menjadi lebih sulit terlihat.
User jangan takut memakai AI.
Tapi jangan menyerahkan judgement begitu saja.
Developer jangan cuma optimize helpfulness.
Optimize uncertainty communication.
Provider jangan cuma melihat efficiency.
Lihat harm.
Regulator jangan cuma melihat model.
Lihat system.
Ketika AI memberi saran kesehatan yang terlihat meyakinkan, pertanyaan terbaik bukan:
“Apakah kalimatnya terdengar pintar?”
Pertanyaan yang lebih penting:
“Apakah ada cukup evidence dan context untuk mempercayai saran ini?”
Kalau jawabannya tidak jelas, tampilannya boleh modern.
Bahasanya boleh smooth.
Responsnya boleh panjang.
Tetap belum cukup untuk keputusan medis yang high-stakes.
Provider juga perlu membuat policy untuk patient-provided AI advice. Jangan langsung memasukkan output chatbot ke rekam medis sebagai fakta.
Bedakan patient statement dan verified clinical information.
Misalnya catat bahwa pasien membawa informasi dari AI sebagai bagian conversation, lalu clinician melakukan assessment sendiri.
Data provenance penting.
Kalau beberapa tahun lagi AI-generated text bercampur dengan medical record tanpa label, source confusion bisa menjadi masalah baru.
Di health AI, skeptisisme sehat bukan anti-teknologi.
Ia bagian dari safety.
Model yang bagus tetap perlu user, clinician, dan institution yang tahu cara memeriksa, membatasi, dan mengoreksi outputnya.
Ada satu teknik sederhana untuk user: pisahkan fakta, inference, dan action.
Fakta: “hasil lab tertulis sekian.”
Inference: “nilai ini mungkin terkait kondisi tertentu.”
Action: “karena itu lakukan X.”
Semakin jauh dari fakta menuju action, semakin besar kebutuhan context dan verification.
AI sering melompat mulus dari satu layer ke layer berikutnya sehingga user tidak sadar ada asumsi di tengah.
Kalau kita melatih diri membedakan tiga layer itu, output jadi lebih mudah diperiksa.
Developer juga bisa mendesain answer dengan struktur serupa.
Apa yang diketahui.
Apa yang belum diketahui.
Apa kemungkinan umum.
Kapan perlu bantuan.
Clarity seperti ini mengurangi illusion of certainty.
Clinician juga perlu waspada terhadap cara AI framing pertanyaan. Kalau summary model menghilangkan satu detail penting, dokter bisa menerima frame yang salah sejak awal.
Karena itu AI-generated clinical summary harus bisa dilacak ke source.
Kalimat ini berasal dari note mana?
Angka ini dari pemeriksaan tanggal berapa?
Apakah ada conflict?
Traceability membantu human reviewer menemukan error.
Semakin meyakinkan summary, semakin penting kemampuan melihat bahan aslinya.
AI yang baik tidak hanya memberi jawaban.
Ia memudahkan jawaban itu diperiksa.
Bacaan terkait
Artikel ini berada dalam HealthTech & Digital Health dan mengikuti metodologi editorial Undercover.id. Format terkait tersedia di Explainer teknologi dan kebijakan digital.