임상시험 신뢰도 21개 항목 점검…BMJ, 문헌고찰용 도구 공개

국제 연구진이 무작위 임상시험의 자료 신뢰성을 살피는 INSPECT-SR을 24일 공개했다. 철회·연구 수행·결과 등을 점검하지만 부정행위 확정이나 치료 효과 검증을 대신하지는 않는다.

햇빛 드는 책상 위 펼친 빈 노트와 인쇄물, 돋보기. AI 생성 이미지 / 데이마크
햇빛 드는 책상 위 펼친 빈 노트와 인쇄물, 돋보기. AI 생성 이미지 / 데이마크. 사진은 기사 이해를 돕기 위한 자료 이미지입니다.

국제 연구진이 무작위 임상시험의 자료와 결과를 체계적으로 점검하는 도구 ‘INSPECT-SR’을 24일 의학 학술지 BMJ에 공개했다. 연구를 모아 치료 효과를 판단하는 체계적 문헌고찰에서 부실한 시험을 걸러내기 위한 절차다.

점검 항목은 최대 21개다. 논문 철회나 우려 표명 등 게재 후 공지 3개, 연구 수행·관리·투명성 5개, 본문과 그림 2개, 연구 결과 11개로 나뉜다. 평가자는 각 영역의 우려 수준을 판단한 뒤 전체 시험의 신뢰도를 종합한다.

철회된 시험이 합산 결과를 바꾼 사례

별도 연구가 이런 점검의 필요성을 보여준다. 지난해 BMJ에 실린 Xu 등 연구진의 후향적 분석은 철회된 무작위 임상시험 1330건을 추적해 이를 정량 합성한 체계적 문헌고찰 847건을 찾았다. 재현할 수 있었던 메타분석은 3902건이었다.

연구진이 철회된 시험을 뺀 뒤 다시 계산하자 합산 효과의 방향이 바뀐 비율은 8.4%, 통계적 유의성 판단이 바뀐 비율은 16.0%였다. 이 수치는 철회된 시험이 포함된 분석에서 나온 결과다. 전체 임상시험 가운데 문제가 있는 비율로 읽어서는 안 된다.

의심 신호와 부정행위 판정은 다르다

INSPECT-SR 개발 논문은 점검표가 사기 판별기가 아니라고 명시했다. 자료 오류가 고의인지 실수인지 점검 결과만으로 가릴 수 없으며, 특정 항목에 문제가 표시됐다는 이유만으로 연구 부정행위를 단정해서도 안 된다. 비뚤림 위험, 다른 환자군에 대한 일반화 가능성, 이해충돌은 이 도구의 평가 범위 밖이다.

개발진은 기존 근거 검토, 전문가 합의와 사용자 시험을 거쳐 항목을 다듬었다. 사용자 의견 조사에 응한 40명이 도구를 써 본 뒤 보고한 시험 한 건의 평가 시간 중앙값은 45분이었다. 이는 사용자 시험의 소규모 경험치이지 도구가 오류를 얼마나 정확히 찾아내는지를 입증한 수치가 아니다.

개발에 참여한 코크란은 24일 이 도구가 코크란 리뷰의 연구 신뢰성 평가 자료로 채택됐다고 밝혔다. 다만 발표와 사용자 시험만으로 실제 문헌고찰의 오류 감소나 환자 치료 결과 개선까지 확인된 것은 아니다.

원문: BMJ INSPECT-SR(2026) https://www.bmj.com/content/394/bmj-2026-100611 ; BMJ VITALITY(2025) https://www.bmj.com/content/389/bmj-2024-082068 ; Cochrane 발표(2026) https://www.cochrane.org/about-us/news/new-tool-helps-researchers-spot-problematic-trials-they-distort-evidence

대표 이미지: AI 생성 이미지 / 데이마크

의학 정보 이용 안내

이 기사는 일반적인 정보 제공을 위한 콘텐츠이며 개인의 진단이나 치료를 대신하지 않습니다. 건강상 우려가 있다면 의료진과 상담하세요.