2026년 10월 08일 (목)

AI가 망상 만들었나, 키웠나⋯환자 기록 보니 ‘증폭’ 사례 64%

밴더빌트대, 정신건강 진료 환자 21만여명 분석⋯‘AI 정신병’ 28명 중 17명은 첫 정신병적 삽화 때 AI와 상호작용

구글 검색 선호 출처로 추가
대화형 인공지능(AI)과 대화를 나누는 모습을 표현한 이미지. 최근 연구에서 AI가 새로운 정신병적 증상을 만들기보다 기존 망상이나 왜곡된 생각을 더 키운 사례가 많았던 것으로 조사됐다. AI 생성

챗봇형 인공지능(AI)이 정신병적 증상을 새로 만들어내기보다 이미 나타난 망상이나 왜곡된 생각을 더 키운 사례가 많았다는 연구 결과가 나왔다.

미국 밴더빌트대 메디컬센터 정신의학·행동과학과 재커리 버그슨 박사 등 연구팀은 정신건강 진료 환자 21만5712명의 의무기록을 분석한 결과를 7일(현지시간) 국제학술지 《JAMA 정신의학(JAMA Psychiatry)》에 발표했다.

연구진이 AI 챗봇을 사용하면서 정신병적 증상이 악화된 것으로 진료기록상 판단한 환자는 28명이었다. 이 가운데 18명(64.3%)은 이미 있거나 생기기 시작한 왜곡된 생각을 AI가 확인해주거나 더 키운 ‘증폭자(amplifier)’에 해당했다.

‘AI 정신병(AI psychosis)’은 정식 의학 진단명이 아니다. 대화형 AI 사용이 망상·환각 등 현실 판단이 흐려지는 정신병적 증상의 악화와 관련된 것으로 진료기록에 남은 사례를 연구 목적으로 묶어 부른 표현이다.

‘새 증상 촉발’은 3명⋯기존 증상 키운 경우 가장 많아

연구팀은 2022년 12월 1일부터 올해 4월 15일까지 밴더빌트대 메디컬센터의 정신건강 진료기록 57만8058건을 살폈다. AI 관련 단어가 들어간 자료를 먼저 추린 뒤 연구자들이 내용을 직접 검토했다. 최종 분석에는 환자 73명의 진료기록 187건이 들어갔다.

연구팀은 환자들을 세 집단으로 나눴다. AI 챗봇을 사용한 뒤 정신병적 증상이 악화된 것으로 판단한 ‘AI 정신병’군이 28명, 요리법 검색처럼 AI를 일상적으로 사용했지만 증상 악화와 관련이 없었던 집단이 17명이었다. 나머지 28명은 챗봇을 썼다는 기록은 없었지만 AI가 망상의 소재로 등장했다.

AI 정신병군은 다시 네 유형으로 나눴다. 이 분류는 매슈 플래더스·스펜서 루·존 토러스 연구팀이 2026년 《랜싯 디지털 헬스(The Lancet Digital Health)》에서 제안한 체계를 적용한 것이다.

가장 많았던 것은 ‘증폭자’로 18명(64.3%)이었다. AI 자체가 망상의 대상이 된 ‘대상’은 6명(21.4%), 이전에 정신병적 증상이 없던 사람에게 새로운 증상이 시작되는 데 촉발 요인으로 작용한 ‘촉매’는 3명(10.7%)이었다.

AI와 반복적으로 대화하면서 해로운 서사를 함께 발전시키는 ‘공동저자’ 유형은 없었다. 나머지 1명(3.6%)은 네 유형 가운데 어느 것에도 해당하지 않았다.

이 결과만 놓고 보면 AI가 정신병적 증상을 처음 만들어냈다기보다 기존 증상을 더 키운 사례가 많았다고 볼 수 있다.

AI 정신병군 가운데 15명(53.6%)은 사용한 제품이 챗GPT로 명시돼 있었다. 다만 최종 논문에는 나머지 환자가 어떤 제품을 사용했는지 구체적으로 나오지 않는다. 따라서 이번 결과를 ‘챗GPT가 망상을 키웠다’고 일반화할 수는 없다.

28명 중 17명, ‘첫 정신병적 삽화’ 때 AI와 상호작용

또 하나 눈에 띈 결과는 ‘첫 정신병적 삽화(first psychotic episode)’였다. 정신병적 증상이 처음 뚜렷하게 나타나는 발병 시기를 뜻한다.

AI 정신병군 28명 가운데 17명(60.7%)은 첫 정신병적 삽화 당시 AI와 상호작용한 사실이 확인됐다. 이 비율은 일상적으로 AI를 사용한 집단의 17.6%, AI가 망상의 소재로만 등장한 집단의 28.5%보다 높았다.

연구팀은 정신병적 질환이 시작되는 초기 단계의 환자가 대화형 AI와의 상호작용에 특히 취약할 수 있다고 판단했다. AI가 사용자의 생각을 그대로 확인하거나 동조하는 식으로 답하면 초기 망상이나 왜곡된 믿음이 더 강해질 수 있다고 설명했다.

다만 이번 연구만으로 AI가 정신병적 증상을 일으키거나 악화시켰다고 단정하기는 어렵다. 한 대학병원의 과거 전자의무기록을 분석한 연구인 데다, 환자와 AI가 실제로 어떤 대화를 주고받았는지 채팅 원문까지 확인한 것은 아니다. 연구에 적용한 분류체계 역시 임상적으로 검증된 진단도구가 아니다.

연구팀은 앞으로 실제 AI 대화기록까지 포함한 전향적 연구가 필요하다고 밝혔다. 정신과 진료에서도 환자가 대화형 AI를 어떻게 사용하고 있는지 함께 살펴볼 필요가 있다고 제안했다.

댓글 0
댓글 쓰기
많이 본 뉴스