의학 교육에는 방대한 전문 지식과 이를 효과적으로 전달할 수 있는 양질의 교육 콘텐츠가 필요하다. 특히 교육 자료에 포함된 작은 오류도 잘못된 의학 지식으로 이어질 수 있는 만큼 세심한 검수가 중요하다. 최근에는 생성형 AI를 활용해 의학 교육 자료를 빠르고 대량으로 제작할 수 있게 됐지만 AI의 1차 자동 검증을 통과한 자료에서도 오류가 발견되는 등 전문가의 최종 검증이 필요하다는 연구 결과가 나왔다.
AI, 1차 검증 통과했지만 오류 1.0%
서울아산병원 융합의학과 김남국 교수 등 공동 연구팀은 인공지능(AI)이 1차 자동 검증에서 합격시킨 전문의 교육자료에서도 오류가 발견돼 전문가의 최종 감수가 필요하다는 연구 결과를 국제 학술지 ‘네이처 파트너 저널 디지털 메디신’에 최근 게재했다.
연구팀은 총 6단계로 구성된 생성형 AI 기반 교육 콘텐츠 제작 시스템을 개발하고 영상의학 전문의 시험 대비 플래시카드 6000개와 인포그래픽 833개를 제작했다.
연구팀은 자체 품질 검증을 통과한 교육자료라면 안전하게 활용할 수 있을 것으로 판단하고 다른 의료 분야의 오류 기준을 참고해 허용할 수 있는 오류 비율을 0.3% 이하로 엄격하게 설정했다. 즉, 1천 개의 자료 중 중대한 오류가 3개 미만이어야 한다는 것이다.
이 가운데 1284개의 플래시카드를 대상으로 영상의학 전공의 9명과 전문의 11명 등 총 20명의 의료진이 사실 정확성, 교육적 적절성, 오류 여부 등을 직접 평가한 결과, AI 자동검증을 1차로 통과한 자료에서도 약 1.0%의 오류가 발견됐다. 이는 연구팀이 미리 설정한 안전 기준을 웃도는 결과였다.
AI가 놓친 오류, 전문가가 잡는다
이번 연구는 생성형 AI가 전문적인 의료 교육 콘텐츠를 대량 생산할 수 있다는 가능성을 보여주는 동시에, 교육자료 생성과 배포를 모두 자동화하기보다는 전문가가 개입해 마지막 검증을 수행하는 ‘휴먼 인 더 루프’ 체계가 안전한 의료 AI 활용의 핵심이라는 점을 입증했다.
휴먼 인 더 루프는 신뢰도 높은 학습 모델을 도출하기 위해 AI 시스템 등에 사람이 개입하여 시스템과 사람이 상호작용하는 학습 구조를 의미한다.
또한, AI가 제시한 피드백을 평가자에게 함께 제공했을 때 평가자들이 더 많은 오류를 발견하고 교육 품질도 더욱 엄격하게 평가하는 경향을 보였다.
연구팀은 평가자들이 자신의 전문 지식과 AI의 피드백이 상충할 때 AI의 판단을 그대로 수용하기보다 비판적으로 재검토하며 오류 탐지 능력이 향상됐기 때문이라고 판단했다.
따라서 현재 수준의 생성형 AI를 활용할 때엔 완전히 자동화된 의료교육 콘텐츠 제작보다는 전문가가 최종 검증하는 체계가 필요하다고 분석했다.
김남국 서울아산병원 융합의학과 교수는 “사용 빈도가 높아진 생성형 AI를 실제 교육 현장에서 안전하게 활용하기 위해서는 전문가의 검증이 필요하다는 점을 대규모 연구를 통해 입증했다”고 의의를 밝혔다.
이어 “자동 검증이 놓치는 오류를 체계적으로 관리하고 안전 기준을 마련하는 연구를 지속해 의학 교육 현장에서 안심하고 활용할 수 있는 생성형 AI 환경을 구축할 필요가 있다”고 덧붙였다.
논문 1저자인 남유진 서울아산병원 융합의학과 연구원은 “이번 연구는 생성형 AI가 의료영상 교육자료를 대량으로 제작할 수 있다는 가능성을 확인한 동시에 생성형 AI가 만든 학습 자료를 그대로 사용하기보다 어느 단계에서 어떤 오류가 생기는지 체계적으로 분석하고 걸러내는 과정이 중요하다는 것을 보여준다”고 말했다.
박연정 기자 hello@sciencewave.kr
Science Wave에서 더 알아보기
구독을 신청하면 최신 게시물을 이메일로 받아볼 수 있습니다.

