1. 서지정보
Li, B., Chen, H., Yu, W., Zhang, M., Lu, F., Ma, J., Hao, Y., Li, X., Hu, B., Shen, L., Mao, J., He, X., Wang, H., Ding, D., Li, X., & Chen, Y. (2024). The performance of a deep learning system in assisting junior ophthalmologists in diagnosing 13 major fundus diseases: a prospective multi-center clinical trial. npj Digital Medicine, 7, 8. https://doi.org/10.1038/s41746-023-00991-9
2. 연구문제
안저(眼底, fundus) 사진 한 장으로 13종의 주요 안저질환(당뇨망막병증·망막정맥폐쇄·망막동맥폐쇄·병적근시·망막박리·망막색소변성·황반변성 등)을 자동으로 찾아내는 딥러닝 시스템(DLS, deep learning system)이, 실제 임상 현장에서 경력이 짧은 안과 전공의(junior ophthalmologist)의 진단을 얼마나 도와줄 수 있는가를 전향적(prospective, 결과를 미리 정해두지 않고 앞으로 데이터를 모아가며 검증하는 방식) 다기관 임상시험으로 검증하는 것이 목적이다. 특히 “AI 단독 진단”이 아니라 “AI가 옆에서 제안을 주고 사람이 최종 판단하는” 협업 모델의 효과를 확인하려 했다.
3. 방법
중국 베이징협화의원(Peking Union Medical College Hospital) 등 5개 3차병원이 참여한 전향적 자기대조(self-controlled) 임상시험이다(ClinicalTrials.gov 등록번호 NCT04723160). 안저 사진 1장씩을 세 그룹으로 나눠 비교했다.
- 대조군(control group): 안과 전공의 9명이 AI 도움 없이 단독으로 판독
- 시험군(test group): 같은 전공의들이 1주일의 워시아웃(washout) 기간 후, 같은 사진을 순서를 무작위로 섞고 DLS의 제안을 함께 보면서 판독
- DLS군: DLS가 단독으로 낸 진단
정답지(“표준 주석”, standard annotation)는 5년 이상 경력의 망막 전문의 5명이 각자 라벨을 붙이고, 3명 이상이 일치하지 않으면 6번째 중재 전문의(arbitrator)가 포함된 전체 패널 토의로 확정했다.
DLS 자체는 CNN(합성곱신경망) 계열 모델인 seResNext50을 기본 구조로 쓰고, 이미지 화질을 먼저 판정하는 화질평가모델(ResNet-34 기반 회귀모델)과 질병을 판정하는 진단모델 두 단계로 구성했다. 진단모델은 seResNext50 세 개를 병렬로 학습시켜 늦은 융합(late fusion)으로 예측을 안정화했다.
평가지표로는 이 논문이 새로 제안한 “진단 일치도(diagnostic consistency)“를 1차 평가지표로 썼다. 기존의 정확도(accuracy, 라벨 전부가 정답과 일치해야 인정)와 달리, 진단 일치도는 여러 개 라벨 중 표준 진단과 일부라도 겹치면 일치로 인정하는 지표다(한 이미지에 최대 3개 질병까지 라벨을 붙일 수 있었기 때문). 통계 검정은 Cochran–Mantel–Haenszel(CMH-χ2) 검정을 썼고 P<0.05를 유의수준으로 삼았다.
4. 데이터
2020년 8월2021년 1월, 5개 병원에서 외래 환자 750명을 전향적으로 모집했고 748명이 전 과정을 완료했다. 표준 주석 과정에서 화질 불량 3장이 제외되어 최종 1493장의 안저 사진이 분석 대상이 되었다. 평균 연령 51.7±14.7세(1875세), 남성 43.3%, 전원 중국 한족(Han) 환자다. 정상 안저 477장(32.0%), 질병 있는 안저 1016장(68.1%, 그중 92.8%는 질병 1개만 라벨). DLS 모델 자체의 학습 데이터는 별도로 안저 사진 81,395장(학습 77,181 / 검증 1,087 / 테스트 3,127)이 쓰였고, 화질평가모델은 31,082장(학습 25,082 / 검증·테스트 각 3,000)으로 학습했다.
5. 결과
- 진단 일치도: 대조군 72.9%(95% CI 70.3
75.6%) → 시험군 84.9%(95% CI 83.086.9%)로 약 12%p 향상(95% CI 9.114.9%p, P<0.001). DLS 단독군은 85.5%(95% CI 83.587.4%)로 시험군과 비슷했다. - 민감도(sensitivity, 실제 질병을 놓치지 않고 잡아내는 능력): 13개 질환 각각에서 대조군 50.0
100.0%(중앙값 75.9%) → 시험군 72.2100.0%(중앙값 91.7%)로 유의하게 상승. 특이도(specificity, 정상을 정상으로 잘 가려내는 능력)는 대조군 96.799.7%, 시험군 90.898.7%로 비슷한 수준을 유지했다. - 반면 진단 정확도(accuracy, 라벨 전부 일치)는 대조군 60.5%가 시험군 44.2%보다 오히려 높았다. DLS가 라벨을 더 많이 붙이는 경향 때문으로 저자들은 해석했다(누락은 줄지만 과잉진단 여지는 생김).
- 사후분석(post hoc analysis)에서 전공의는 대조군 대비 888장(59.4%)에서 진단을 바꿨고, 이 중 801장(53.5%)이 AI 제안을 따른 변경이었다. AI 제안을 받아들여 오답을 정답으로 고친 경우가 정답을 오답으로 바꾼 경우보다 많았다.
- 2단계 프로토콜(DLS가 먼저 “정상”으로 거른 뒤에만 전공의가 판독)은 진단 일치도 86.9%, 주진단 정확도 74.6%로 시험군·DLS군보다도 우수해, 인력 부담을 줄이는 대안으로 제시됐다.
- DLS 자체 성능(테스트셋 3,127장 기준)은 평균 민감도 89.9%, 평균 특이도 95.3%였다.
6. 한계
저자가 밝힌 한계:
- 전원 중국 한족 환자만으로 구성되어 있고 일부 질환 범주는 이미지 수가 적어 결과가 편향될 수 있다.
- 망막박리(RD)·망막색소변성(RP)처럼 주변부 망막(peripheral retina)에서 시작하는 질환은 이번에 쓰인 표준 안저 사진(fovea-centered 55°)의 촬영 범위 밖이라, DLS가 초기 단계에서는 애초에 잡아낼 수 없는 구조적 한계가 있다.
- 전공의의 진단력이 DLS 도움으로 크게 향상된 점은 “교육 도구”로서의 활용 가능성을 시사하지만, 이 논문에서는 그 가능성을 본격적으로 검증하지 않았다(향후 과제로 남김).
읽으면서 느낀 한계:
- “진단 일치도”라는 지표 자체가 이 논문에서 새로 정의한 지표라, 다른 AI 안저 진단 연구와 직접 비교하기 어렵다. 실제로 저자들도 비교할 선행 다기관 임상시험이 없어 당뇨망막병증(DR) 단일 질환 AI 연구를 참고 기준으로 삼았다고 밝혔다.
- 진단 정확도(accuracy)는 대조군이 더 높았다는 결과는, “AI 보조가 늘 더 나은 결과를 낸다”는 통념에 반하는 중요한 반례인데, 논문 본문에서는 이를 상세히 다루지만 초록(abstract)에는 드러나지 않아 결과를 표면적으로만 보면 놓치기 쉽다.
- “전공의가 AI 제안을 따라가는 경향(신뢰 편향, trust bias)“을 관찰했다고 서술했지만, 이게 장기적으로 전공의의 독립적 판단력을 약화시키는지에 대한 후속 검증은 이 연구 범위 밖이다.
7. 원문 인용
The diagnostic consistency was 84.9% (95%CI, 83.0%~86.9%), 72.9% (95%CI, 70.3%~75.6%) and 85.5% (95%CI, 83.5%~87.4%) in the test group, control group and DLS group, respectively. — Abstract
With the help of the proposed DLS, the diagnostic consistency of junior ophthalmologists improved by approximately 12% (95% CI, 9.1%~14.9%) with statistical significance (P < 0.001). — Abstract
For the detection of 13 diseases, the test group achieved significant higher sensitivities (72.2%~100.0%) and comparable specificities (90.8%~98.7%) comparing with the control group (sensitivities, 50%~100%; specificities 96.7%~99.8%). — Abstract
The diagnostic model used in this system is an extension of the model in our previous work. The fundus disease diagnosis model is based on a CNN, seResNext50, as the main structure. — Methods, Autonomous AI diagnostic system
First, although the dataset represented the true spectrum of the selected fundus diseases, some of the categories contained a few images and might result in bias in the results. — Discussion, 한계 서술 부분
Second, some diseases selected in this study started from peripheral retinal area which is beyond the scope of the fundus image such as RD and RP. Therefore, the DLS could not detect them at the initial stage. — Discussion, 한계 서술 부분
관련 개념
[[fundus-image-diagnosis]] · [[clinical-ai-validation]]
(이 논문은 안저 사진을 딥러닝으로 진단하는 임상 AI 연구라, TEM 등 소재 관찰 개념과는 관찰 대상·스케일이 달라 연결하지 않았다. 위 두 개념은 아직 페이지가 없어 “나중에 쓸 것” 표시로만 남긴다.)