진료 전 환자와 대화한 의료 AI, 98건 시험서 안전 중단 0건…의사가 전 과정 감독

미국 한 병원의 의료 AI 시험에서 진료 전 대화를 마친 98건은 안전 중단 없이 끝났다. 다만 의사가 전 과정을 지켜봤고 오류도 발견돼 단독 사용의 안전성을 입증한 결과는 아니다.

창가의 책상에 회색 대화창이 표시된 휴대전화와 수첩·펜이 놓여 있다. AI 생성 이미지 / 데이마크
창가의 책상에 회색 대화창이 표시된 휴대전화와 수첩·펜이 놓여 있다. AI 생성 이미지 / 데이마크. 사진은 기사 이해를 돕기 위한 자료 이미지입니다.

미국 베스이스라엘디코니스의료센터와 구글 연구진은 8일 학술지 《랜싯》에 환자 대상 대화형 AI 'AMIE'의 일차진료 적용 가능성을 평가한 연구를 발표했다. 진료를 앞둔 환자 114명을 등록했고, 98명이 AI 대화와 의사 진료를 모두 마쳤다.

안전 중단 없었지만 오류는 발견

환자는 한 가지 급성 증상으로 일차진료를 예약한 뒤 진료 최대 5일 전에 집에서 AI와 문자로 대화했다. AI는 증상과 병력을 묻고 기록을 요약했다. 모든 대화에는 안전감독 의사가 실시간으로 참여해 필요하면 개입할 수 있었다.

연구진이 미리 정한 안전 중단 기준에 걸려 대화를 멈춘 경우는 없었다. 다만 감독 의사는 AI가 사실과 다른 내용을 생성한 사례 1건을 발견했고, 대화 5건에서는 임상 정보를 보충했다. '중단 0건'을 '오류 0건'이나 감독 없는 사용의 안전성으로 바꿔 읽을 수 없는 이유다.

진료 담당 의사가 설문에 응한 사례는 완료된 98건 중 60건이었다. 그중 AI 대화록이나 요약을 진료 전에 본 44건에서 의사들은 33건이 준비에 도움이 됐고, 25건은 진료 방식에 영향을 줬을 수 있다고 답했다. 이는 의사들의 평가이지 진단 정확도나 환자 치료 결과가 좋아졌다는 수치는 아니다.

한 병원·단일군 시험…한국 진료로 일반화 어려워

이번 연구는 미국 한 의료기관에서 영어를 쓰는 성인을 대상으로 진행한 비교군 없는 전향적 적용 가능성 연구다. 임신 관련 또는 정신건강 문제로 내원한 환자는 등록 기준에서 제외됐다. 무작위 비교시험이 아니어서 기존 문진보다 더 안전하거나 효과적이라고 결론 낼 수 없다.

연구비는 구글의 모회사 알파벳이 댔다. 세계보건기구(WHO)는 의료용 생성형 AI가 부정확하거나 빠진 정보를 제시할 수 있고, 사람의 판단을 AI에 지나치게 맡기는 위험도 있다고 경고한다. 이 시험의 감독 체계와 결과를 한국에서 개인이 쓰는 의료 챗봇에 그대로 적용할 수 없다.

출처: 《랜싯》 연구 초록 https://research.google/pubs/a-prospective-clinical-feasibility-study-of-a-conversational-diagnostic-ai-in-an-ambulatory-primary-care-clinic/ ; 미국 ClinicalTrials.gov 등록정보 https://clinicaltrials.gov/study/NCT06911398 ; WHO 지침 발표 https://www.who.int/news/item/18-01-2024-who-releases-ai-ethics-and-governance-guidance-for-large-multi-modal-models

대표 이미지: AI 생성 이미지 / 데이마크

의학 정보 이용 안내

이 기사는 일반적인 정보 제공을 위한 콘텐츠이며 개인의 진단이나 치료를 대신하지 않습니다. 건강상 우려가 있다면 의료진과 상담하세요.