리뷰 논문

감독 없는 디지털 인지 및 기능 평가 및 훈련: 인간 접촉 부족이 미칠 잠재적 영향이 있을까요?

DOI:

10.3791/70431

2026년 4월 21일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

디지털 전략은 감독 없는 원격 평가와 교육을 가능하게 하지만, 수집된 데이터의 타당성과 개입의 유용성을 보장하기 위해 여러 가지 고려사항이 필요합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

기술의 발전으로 인지 및 기능 평가와 훈련의 디지털 전달이 가능해졌습니다. 디지털 전략에는 크게 두 가지 유형이 있습니다: 디지털 전달을 위해 처음 개발된 전략과 이전의 전통적인 종이와 연필 평가에서 이전된 전략입니다. 감독 하에 있는 평가와 비감독 평가 및 교육에 관한 연구도 상당히 많았습니다. 인공지능(AI)과 같은 동시적인 디지털 발전으로 병행 평가 양식의 신속한 생성과 국제용 평가 자료의 번역이 가능해져 전 세계적으로 널리 접근 가능한 배포 가능성을 시사합니다. 번역이 검증을 보장하지는 않으며, 많은 평가 도구들이 번역되었으나 번역 후 노름화나 검증을 받지 못했습니다. 본 리뷰에서는 널리 도입된 대면 평가 사례를 활용하여 번역과 디지털 이전을 거친 디지털 평가 사례를 활용하고, 종이나 대면 제공되지 않은 디지털 전략과 비교하여 디지털 평가 및 교육 노력의 현황을 검토합니다. 감독 없는 수행의 유용성과 디지털 평가나 교육 프로그램을 자가 관리하는 개인에게 미치는 영향에 대한 의견이 제공됩니다. 접근성 높고 개인화된 디지털 전략을 원격으로 제공하려면 심리측정적 진실성, 언어적 타당성, 대면 인간 테스터가 제공하는 사회적 지원, 그리고 그 지원이 정량화되어 디지털 대안으로 보완될 수 있는지 여부 등이 포함됩니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

디지털 혁명은 노화 관련 및 정신과 질환에서 인지 및 기능 평가와 훈련의 지형을 변화시켰습니다. 오늘날 수행되는 평가의 상당 부분이 디지털 전달에 전적으로 또는 부분적으로 의존하고 있습니다. 디지털 평가는 인간테스터가 수행하는 기존 표준 신경심리학 검사에서 완전히 디지털 플랫폼으로 이전할 수 있습니다 3,4,5. 일부 전략에는 모바일 기기 6,7,8을 통한 전달이 있으며, 이는 순간의 기분, 위치, 환경 조건을 포착하기 위한 원격 평가와 함께 진행될 수 있습니다.

체계적인 디지털 마이그레이션은 절차의 디지털 버전과 기존 버전을 비교할 수 있게 합니다. 일부 작업의 경우, 광범위한 검증 정보가 수집되었으며, 레거시 절차와 체계적으로 비교되었습니다. 예를 들어, 정신분열증 인지 간략 평가(BACS)에서는 광범위하게 규범화된10 레거시 테스트가 디지털 전달11로 이전되었고, 비교 규범 연구12가 진행되었습니다. 유사한 예로는 Loewenstein-Acevedo Scales for Semantic Interference and Learning (LASSI-L)13의 디지털 마이그레이션이 있으며, 이는 세 가지 디지털 폼15를 가진 Avatar 가이드 원격 관리 가능한14 버전으로 이전되었습니다.

디지털 작업의 장점은 빠르고 일반적으로 자동화된 업데이트, 특히 테스트 자극이 매우 실현 가능하다는 점입니다. 여기에는 인공지능(AI) 전략을 활용한 언어 번역이 포함되며, 이를 통해 빠르게 대체 버전을 생성할 수 있습니다. AI 전략의 촉진으로는 치매 환자 집단에서도 허용할 수 없는 실천 효과를 피하기 위해 반복 검사, 특히 기억력이나 문제 해결 테스트에 필요한 병행 형태 개발이 촉진됩니다. 이 리뷰의 목표 중 하나는 이전 디지털 이주 및 AI 적응의 품질을 평가하는 것이며, 디지털 이주 이후의 동등성, 언어 번역, 병렬 형태 개발에 관한 데이터를 포함합니다.

디지털 평가의 또 다른 발전은 디지털 평가 또는 교육 절차의 원격 또는 감독 없는 자가 운영입니다. 상업용 컴퓨터 인지 훈련(CCT)에서는 수년간 표준 관행으로 사용되어 왔지만, 일부 연구에서는 감독 없는 인지 검사 자기 주행도 가능할 수 있다고 제안했습니다19, 20, 21. 감독 없는 자가 주행은 인터넷에 연결된 디지털 기기를 통해 집에서나, 여러 참가자가 최소한의 감독 하에 시험을 치르는 시험장에서 수행할 수 있습니다. 타당성 연구는 대체로 단기적이었으나, 일부는 표준 임상시험과 동일하거나 더 긴 기간을 보였습니다. 우리는 감독 없는 평가와 교육의 전반적인 현황을 검토하고, 도전 과제가 있거나 추가 정보가 필요한 부분에 대해 의견을 제시할 것입니다.

비감독 평가 및 교육에서 중요한 문제는 문화 간 적응과 실현 가능성입니다. 언어 차이 외에도, 모바일 폰, 태블릿 또는 노트북 컴퓨터, 가정용인터넷 접속 경험 등 디지털 접근성과 문해력에 영향을 미치는 상당한 경제적 차이가 있습니다. 전 세계적인 디지털 격차는 더 이상 나이와 관련된 것이 아니라 경제적인 문제입니다. 온라인 원격 디지털 활동 참여 동기는 참가자마다 크게 다를 수 있습니다. 감독 없는 평가의 타당성 지표에는 동의율, 평가 완료, 데이터 타당성, 기술 관리 능력 등이 포함됩니다. 대부분의 임상 비감독 평가는 예상 장애가 있는 개인을 대상으로 하며, 대면 포함20,21 평가 또는 교육 완료에 대해 상당한 교육을 받을 수 있습니다. 원격 학습에 등록한 개인의 타당성 데이터는 등록과 훈련이 완전히 독립적으로 이루어지는 경우, 디지털 기술 수준이 낮고, 자신의 능력에 대한 신뢰가 낮으며, 전반적인 인지 능력이 낮은 개인에게는 일반화되지 않을 수 있습니다. 여기에는 치매의 초기 징후가 의심되어 클리닉에서 감독 없이 평가를 수행하는 사람들도 포함됩니다.

두 디지털 평가 시스템이 기기 상주 컴퓨터 제공에서클라우드 기반 전달로 전환한 연구에서, 터치스크린 데이터 수집 속도에서 컴퓨터 마우스에 비해 체계적인 이점이 있었습니다. 기능적 역량 평가에서 흔히 발생하는 디지털 리터러시 도전 과제가 있습니다: 일부 참가자는 키보드 실력이 거의 없어 비밀번호25를 대문자로 입력하는 방법을 배워야 합니다. 미국에서 실시된 인지 및 기능 능력에 대한 다중 연구에서, 디지털 기능 역량 평가의 성과는 지역 교육 성취도와 소득을 추적하는 지리적 위치에 따라 1.0 SD 이상 차이를 보였습니다. 우리는 모든 가용 지표를 사용하여 비지도 평가 및 교육의 실현 가능성과 타당성을 평가할 것입니다.

아래에서 설명하듯, 감독 없는 기술 전달의 주요 과제는 디지털 결과가 표준 측정과 수렴하지 못하는 것이 아닙니다. 주요 과제는 자가 평가 및 교육에 필요한 기술의 광범위한 실현 가능성과, 인간 감독 부재 시 과도하게 변동적인 성과입니다. 표준 인지 과제 중에는 어려움을 겪는 참가자들에게 감독과 도움을 제공하는 본질적인 사회적 상호작용이 존재합니다. 중요한 질문으로는, 이러한 지원이 기존 인간 제공 평가 절차에서 참여자-테스터 상호작용을 시뮬레이션하는 AI 기반 상호작용을 통해 디지털로 제공될 수 있는지도 있습니다.

리뷰 및 관점

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

아래는 위에서 언급한 문제들에 대한 데이터 검토입니다. 여기에는 표준 평가와 디지털 평가 모두에 적용되는 성과 기반 검사 검증 표준이 포함됩니다; 레거시 평가의 디지털 마이그레이션 표준; 그리고 디지털 네이티브 작업의 검증 과정과 기존 종이/인간 전달 형식에서 이전된 작업들, 즉 대체 형식, 번역, 문화 간 적응 등을 비교하는 연구도 포함합니다. 또한 비감독 투여가 인간 제공 전략과 비교해 이러한 전략의 전반적인 실현 가능성과 전통적인 평가 및 교육 개입에서 인간 검사자의 역할을 고려하여 광범위한 논의가 이루어지고 있습니다. 이러한 평가 상황에서는 여러 기능이 수행되며, 이론상 일부는 AI 인지적 지원으로 수행할 수 있습니다. 보충 1편은 이 리뷰에서 다룬 문제들을 제시합니다.

인지 및 기능 평가 검증의 일반 원칙
잘 검증된 디지털 평가나 치료 전략을 개발할 때 여러 가지 고려사항이 필요합니다. 이 과정의 대표적인 예는 협력적이고 대규모 성과 평가 개발 프로그램인 정신분열증 인지 개선을 위한 측정 및 치료 연구(MATRICS)로, 이는 기존 테스터 제공 평가 대량의 검증 연구를 수행했습니다. 합의 회의에서 논의된 내용을 바탕으로, 이 맥락에서의 검사 선정은 다섯 가지 핵심 고려사항에 의해 결정되었습니다: 반복 투여 간 신뢰도, 종단 사용의 적절성, 기능적 결과와의 연관성, 치료 관련 변화에 대한 민감성, 그리고 전반적인 실현 가능성 및 내약성. 반복 투여 적합성은 실천에 의한 최소한의 성과 향상 또는 동등한 대체 형태의 가용성으로 정의되었습니다. 결과적으로 만들어진 MATRICS 합의 인지 검사(MCCB)28 은 이러한 기준을 충족하는 검사 세트를 선택했지만, 원격으로 시행하는 데 어려움이 있음을 보여주었습니다. 유사한 개발 과정이 조현병 인지 간략 평가(BACS)에도 적용되었습니다. BACS는 유사한 전략으로 개발되었으며, BACS의 6개 검사자 제공 하위 검사를 포함한 모든 특성에 대해 검토되었으며, 건강한 대조군(n = 404)8을 대상으로 한 대규모 검증 연구도 포함되었습니다.

논문 BACS는 국제적으로 널리 검증되었으며, 여러 연구가 그 사용을 조사했습니다(예: 30, 31, 32, 33, 34, 35). 흥미롭게도 MCCB는 여러 차례 번역되었으며, 개발자 웹사이트36에는 45가지 번역본이 나와 있습니다. 웹사이트에는 국제 임상시험에서 널리 사용되고 있음에도 불구하고 45개 버전 중 ~10개만이 공식 언어 규범을 가지고 있다고 언급되어 있습니다. 이 문제는 나중에 다룰 예정입니다.

BACS의 BAC-앱으로의 디지털 이전은 조현병 환자와 건강한 대조군을 포함한 비교 연구11에서 체계적으로 수행되었으며, 모두 기존 버전과 디지털 버전 모두에서 테스트되었습니다. 연구 시작 이전에는 Verbal Memory(7개 버전), Symbol Coding(8개 버전), Tower of London(8개 버전) 등 여러 BAC-App 하위 검사에 대한 대체 형태가 개발되었습니다. 따라서 작업의 디지털 마이그레이션은 두 버전의 직접 비교와 병렬 형태의 검증을 가능하게 하도록 설계되었습니다. 이후 건강한 대조군과 소수의 주관적 인지 저하 참가자를 대상으로 대규모 검증 연구(N = 55312)를 수행하여 BAC-App에서의 수행에 대한 표준적 정보를 제공하였습니다. 따라서 기존 버전에서는 규범 데이터가 수집된 후 디지털 버전에서 반복되었으며, 동등한 형태에 대한 평가도 포함되었습니다(현재까지 데이터는 공개되지 않았습니다). 결과적으로 만들어진 BAC-앱은 감독 없이 진행되는 것이 아니라는 점을 유념해야 합니다; 테스터가 반드시 참석해야 합니다.

유사한 디지털 마이그레이션 노력은 기존 논문 평가인 Loewenstein-Acevedo Scales for Semantic Interference and Learning (LASSI-L)13,14에 대해서도 수행되었다. 이 평가는 사전 의미 간섭(proactive semantic interference)의 탐지를 목표로 하며, 이는 인지 저하가 더 빠르고 ADRD 바이오마커의 존재를 예측하는 것으로 입증되었으며, 추가 장애가 거의 없는 경우에도15. LASSI-L에 대한 광범위한 규범 데이터가 제공되었고, 이후 비감독 평가를 위한 디지털 버전(LASSI-D)이 개발되었습니다. 개발 과정에서 이 도구들을 평가할 때, 투여 간 신뢰성, 반복 사용 적합성, 기능적 결과와의 관련성, 전반적인 실현 가능성 및 내약성에 중점을 두었습니다. BACS 마이그레이션에 비해 발전한 점은 LASSI-D의 스페인어와 영어 버전을 동시에 검증한 것으로, 유사한 LASSI-L 버전과 달리, AI 기반 전략을 활용한 마이그레이션 버전을 개발하여 감독 없는 자치의 실현 가능성과 타당성을 높였습니다. 구체적으로, 인간 아바타는 인간 테스터의 역할을 수행하여 지시를 전달하고 오류를 수정하며 참가자의 성과 최적화를 장려합니다. 참가자들로부터 수집된 질적 데이터는 아바타 제공 평가에 대한 높은 만족도를 보여주었으며, 인간 제공 평가보다 선호도 점수가 더 높았습니다.

디지털 네이티브 평가도 이러한 신뢰성과 타당도 원칙을 따라야 하며, 일부 프로그램에서는 이를 준수하고 있습니다. 예를 들어, 가상현실 기능 역량 평가 도구(VRFCAT)3,37와 기능적 기술 평가 및 훈련 프로그램(FUNSAT)25,38의 개발은 검증 연구에서 동일한 다섯 가지 원칙을 준수했습니다. VRFCAT과 FUNSAT은 모두 클라우드 기반 전달으로의 2 디지털 이전을 거쳤으며, 두 테스트 모두 유사한 대체 형태를 가지고 있습니다. FUNSAT의 이주 연구는 스페인어와 영어 화자의 세 가지 대안적 형태 수행도 고려했습니다.

VRFCAT과 FUNSAT 모두의 또 다른 특징은 전통적인 평가 전략과 디지털 평가 전략 모두와의 비교를 포함한 수렴 검증에 대한 광범위한 노력이었습니다. 예를 들어, 정신분열증에서 음성 증상과 VRFCAT의 상관관계가 조사되었고, 다른 종이와 연필 기능 능력 지수와의 상관관계도 조사되었습니다40. 대상 평가 인구41에 대한 수용성을 평가하기 위한 질적 연구가 수행되었습니다. FUNSAT의 경우, 인자 구조42, 치료 민감도43, BAC-app 상관관계44, 기타 기능적 역량측정 45, 자기보고적 기능과의 상관관계 연구도46에서 보고되었습니다.

비지도 평가 기술
종이와 연필로 이루어진 신경심리학적 평가는 사회적 상호작용, 감독, 지도, 문제 반응 방지 제안을 포함하는 감독 평가의 대표적인 사례입니다. 앞서 언급했듯이, 일부 디지털 인지 및 기능 측정은 검사관이 시행하도록 설계되어 있습니다. 예로는 MCCB의 동일 쌍 CPT47 , BAC-app, VRFCAT이 있습니다. 다른 평가는 평가 절차가 자동화되어 자체 진행되기 때문에 감독관 없이 감독 없이 진행될 수 있도록 설계되어있습니다. 이들 프로그램 중 일부는 일부 하위 검사에서48 점 누락이나49 점 무효 점수에 취약함을 보여주었으나, 무효 점수 사례의 비율은 낮았습니다. 이 점수는 시험 참여 부족을 반영할 수 있으며, 경우에 따라 심사관 피드백으로 교정할 수 있습니다. 현재 디지털 기술을 통해 테스트 중 응답 중단을 감지할 수 있고, 참가자가 계속 진행하라는 알림을 받으며 과정이 일시적으로 중단될 수 있습니다. 예를 들어, FUNSAT 평가 및 교육 모듈은 15초 내에 응답이 없으면 절차를 일시정지하고 팝업 창을 표시합니다. 이러한 내장 탐지 프로세스는 위에서 언급한 모든 전략에 존재하지 않습니다.

비감독 평가의 실현 가능성에 관한 데이터
심각한 정신질환과 ADRD에서 인지 수행에 대한 비감독 평가에 관한 많은 연구가 있습니다. 대규모 ADRD 검토 20에서는 최근 연구 보고서28 개와 23가지 서로 다른 무감독 평가 도구가 확인되었으며, 이는 사무실 방문 또는 원격으로 수행되었습니다. 수용 가능성 데이터는 매우 우수했으며, 사전 동의와 참여율이 85% 이상이었습니다. 많은 참가자들이 다시 참여할 의향이 있다고 보고했습니다.

평가 준수율은 8주 연구에서 63%에서 또 다른 8주 연구에서 94%까지 크게 차이가 났습니다. 사용 불가능한 데이터 발생률은 낮았으나, 특정 평가 전략은 평가 완료 시 어려움 발생률을 높였습니다. 가정 기반 증강현실 환경에서는 기술적 한계로 약 21%의 데이터가 손실되었고, 기기 호환성 문제로 인해 참가자의 약 32%가 원격 평가를 완료하지 못했습니다.

전통적인 평가 전략에서 신중하게 관리되는 심리측정적 고려사항은 충분히 고려되지 못했습니다. 예를 들어, 병렬 형태의 수렴성과 테스트-재테스트 신뢰도에 관한 23개 과제 중 2개만이 허용 범위의 하한선에 속했습니다. 하지만 일부 평가는 원격으로 또는 임시로 이루어졌기 때문에, 환경 요인이 성과에 영향을 미칠 수 있어 중요한 고려사항입니다. 따라서 낮은 검사-재검사 신뢰도가 오히려 환경 영향에 대한 민감성과 변화하는 환경 요인과 관련된 참가자 내 분산을 반영할 수 있습니다 9,50. 표준 인지 평가와의 수렴 타당도는 일관되게 허용되었으며, 상관관계는 r = 0.50에서 0.70 사이였다.

조현병 원격 인지 평가검토 21 도 비슷한 규모(34개 논문)였으며 유사한 문제들을 제기했으나, 실제로 진정한 비감독 평가를 수행한 연구는 일부에 불과했습니다. 대부분의 원격 시행 평가에서는 병행 양식에 대한 언급이 없었고, 대면 평가에 비해 원격 수업에 대한 기준에 대한 보고는 사실상 없었다. 실제로 34개 연구 중 단 한 편만이 원격 평가와 대면 평가, 감독 평가의 규범적 성과를 비교했습니다. Polk 등과 일치하는 추가 발견은, 인터넷 연결 문제, 기술 고장 보고, 기타 기술적 요인으로 인한 평가 완료 불가가 상당히 크며 거의 모든 비감독 연구에서 존재한다는 점이었습니다.

BAC-앱을 원격으로 운영하려는 시도에서 발생한 문제 중 하나는 참가자들이 대면과 BAC-app51로 원격으로 테스트받았기 때문에 데이터 무결성에 대한 우려였습니다. 그 연구에서 참가자들은 원격으로 실시된 단어 목록 학습 테스트에서 평균적으로 훨씬 더 좋은 성과를 보였으며, 이는 자극이 제시될 때 직접 작성하거나 기록했음을 시사합니다. 감독 없는 평가에 대한 고려사항 목록에 더해, 데이터 무결성을 유지하기 위한 보안 전략이 필요해 보입니다.

원격 제공 디지털 인지 및 기술 교육
조현병52와 경도 인지 장애53에서 원격 인지 및 기능적 기술 훈련에 관한 여러 연구가 수행되었습니다. 또한, 인지 훈련은 정신분열증54의 앱 기반 음성 증상 치료와 MCI25의 디지털 기능 기술 훈련과 같은 다른 중재의 효과를 높이기 위한 통합 중재로 추가되었습니다. 일반적인 연구 결과는 조현병부터 MCI, ADRD에 이르기까지 집과 사무실에서 순응률과 교육 성과가 매우 유사하다는 점입니다. 순응은 결코 완벽하지 않으며, 훈련 성과는 개인차에 따라 특성55,56. 적절한 성과와 준수를 이끌어낼 수 있는 한 가지 요인은 인지 훈련 절차가 사무실이든 원격이든 본질적으로 동일하다는 점입니다. 앞서 언급한 기술적 어려움과 프로그램 시작 불가능성 문제는 원격 교육과 원격 평가 모두에서 명백히 동일합니다. 참가자들이 감독 없이 소프트웨어 실행 및 운영을 용이하게 하기 위해 대면 교육을 받은 연구에서는 원격 준수율이 가장 높다고 보고되었습니다(예: 53).

디지털 평가 및 치료의 전 세계적 활용
앞서 언급했듯이, 기존 종이 평가의 여러 번역과 디지털 분야에서의 국제적 노력이 있었습니다. 예를 들어, 난독증57 과 수학 능력58 의 디지털 평가가 스페인에서 개발되었으나, 이 과제들이 다른 언어로 번역되었는지는 불분명합니다. 중국에서는 트레일 메이킹 테스트를 추가적인 운동 능력 측정59 를 포함시키는 전략이 개발되었고, 중국에서는 복잡한 문장 처리 과정을 조사하기 위한 이중 과제 간섭 절차를 개발했습니다. 싱가포르에서는 영어와 다른 아시아 언어로 훈련받은 이중언어 인재들이 참여하는 독특한 다국어 교육 프로그램이 진행되어 인지 능력 향상을 목표로61. 이 모든 연구는 성공적인 개발 노력과 수용성을 보고했으나, 문화 집단 내 언어 간 테스트의 유용성을 직접 비교한 연구는 단 한 곳뿐이었다.

번역 검정의 지역적 검증의 역할
MCCB와 BAC와 같은 가장 널리 사용되는 전통적인 대면 평가 전략은 위에서 언급한 다양한 언어와 문화 집단에서 광범위하게 검증되었습니다. 반면, 3세에서 85세 사이의 사람들을 대상으로 한 광범위한 평가인 NIH 툴박스는 영어로만 제공되며 단일 대면 디지털 플랫폼62에서 진행됩니다. 인지 및 기능 평가 과제와 교육 프로그램의 디지털 마이그레이션 버전 검증에 관한 지역 및 전 세계적 정보는 상당히 적습니다. 예를 들어, 루바다시스타트의 ERUDITE63연구에서는 BAC-app이 8개 언어로 시행되었고, 디지털 이전 이후 평가의 다른 언어 형태(즉, 스페인어)를 검증한 연구는 단 한 건뿐입니다. VRFCAT과 같은 일부 직접 디지털 평가는 30개 이상의 언어를 대상으로 한 연구에서 번역 변형으로 사용된 바있습니다. 역시 VRFCAT 언어 간 사용에 대한 실질적인 근거는 없으나, 평행 형태의 유사성에 대한 검증은 원래 영어 버전 평가가 개발될 때 제시되었습니다. 디지털 마이그레이션 작업의 레거시 버전으로 수집된 검증 정보는 마이그레이션이 테스트의 어떤 특징도 변경하지 않았다면 매우 관련성이 높을 수 있지만, 레거시 및 디지털 마이그레이션 등 결과 측정 지표가 심리측정 특성에 대해 연구되지 않은 여러 언어가 있습니다. 그러나 ADRD와 정신분열증에 관한 두 가지다른 리뷰에서 지적된 것처럼, 수정과 디지털 이주 이후 국제적 수준의 업무 특성에 대한 관심은 매우 적었습니다.

이 두 연구의 어려움은 VRFCAT이 예상보다 더 큰 변동성을 보였고, 상당수의 참가자가 매우 낮은 점수를 받았다는 점입니다. 번역이 성과에 부정적인 영향을 미쳤을 가능성도 있습니다. 경험이 부족한 시험자들과의 어려움이 평가 중 참가자 참여에 대한 부실한 감독으로 이어졌을 가능성도 똑같이 높습니다. 테스터의 도전 가능성이 명백하지만, 언어학적으로 검증된 번역이 심리측정학적으로 유사한 악기를 보장한다고 생각하는 것은 시기상조일 수 있습니다. 체계적인 디지털 이전 과정에서, 종이와 연필 기구가 디지털화된 버전과 유사한 점수를 생성하는지 검토해야 하지만, 위의 두 리뷰에서 언급했듯이 이는 흔한 일로 문서화되어 있지 않습니다. 위에서 설명한 LASSI-D 디지털 마이그레이션 전략은 세 가지 디지털 병렬 형태 각각을 스페인어와 영어 모두에서 인간이 관리하는 레거시 버전과 체계적인 심리측정 비교를 포함하고 있어 이러한 도전에 취약하지 않습니다. 하지만 매우 상세한 과정이며, 30개 언어 임상시험을 적시에 실행하기는 매우 어려울 것입니다.

인간 테스터의 역할은 무엇인가요?
데이터는 감독 없는 디지털 평가 및 교육에서 참가자들이 기술을 제대로 활용하고 시스템에 접근할 수 있도록 하는 주요 과제임을 시사합니다. 참여자들이 기술 호환성 부족을 보고하는 등 다른 문제도 디지털 전략에 익숙하지 않고 기술을 제대로 활용하지 못하는 데서 비롯될 수 있습니다. 따라서 감독 없는 평가 패러다임에서는 평가 시작 전에 개인화된 지시가 도움이 되거나 심지어 필수적인 전략이 될 수 있습니다.

일부 기술 기반 평가는 주로 사무실 방문 중에 시행되며, 조현병 원격 평가를 위한 대부분의 업무가 포함됩니다. 예를 들어, VRFCAT은 평가에 대한 대면 감독을 요구하며, BAC-App도 마찬가지입니다. VRFCAT에는 공식 평가 전에 도입 부분이 있으며, 이 과정에서 인간 테스터가 질문에 답변하고 부족한 노력을 재조정하는 동안 주요 평가 섹션이 계속 진행됩니다. 시험관은 참가자를 감독하고 노력을 지속하지 못할 경우 지침을 제공하도록 지시받습니다. 하지만 최근 VRFCAT 연구에서는 일부 참가자들이 300초 이내에 시험 목표를 풀지 못하는 '강제 진행'이 많다는 사실이 밝혀졌습니다. 일부 목표가 단일한 간단한 과제("지갑 줍기")이기 때문에, 검사관 감독 실패가 의심될 수 있습니다. BAC-app 기술은 모든 자극을 관리하고 모든 데이터를 수집하지만, 참가자 완료 후에는 수행 감독과 하위 과제 진행이 인간 테스터가 필요합니다. 코그스테이트 시스템은 참가자의 수행 감독을 요구하지 않지만, 시스템의 특정 구성 요소에서 무효 수행과 정신분열증66 에서 지속 불충분한 수행과 불규칙한 점수로 인해 손상에 대한 민감도가 감소했다는 여러 보고가 있었으며, 이는 대면 감독으로 감지 및 교정할 수 있습니다.

디지털 감독을 사용할 수 있나요?
현재 챗봇이나 기타 AI 기반 디지털 심리치료 개입에 대한 관심이 상당히 높습니다. 이러한 개입의 과제 중 하나는 AI 치료사가 실시간으로 내담자의 의사소통을 이해하고 적절히 대응해야 하는 양방향 의사소통의 필요성입니다. LASSI-D 개발에는 다른 AI 전략이 사용되었습니다. 인간 아바타는 AI로 만들어졌으며, 표준 테스트 상황에서 인간 테스터가 내리는 모든 지침과 피드백을 제공하는 테스트 기술자 역할을 했습니다. 아바타는 또한 미리 정해진 FAQ에 답하도록 배웠는데, 이 FAQ는 화면의 "?" 아이콘을 터치하면 트리거됩니다. 그 단계에서는 대화형 소통을 시도하지 않았습니다. 이 절차의 수용률은 매우 높았으며(테스트 세션 완료율 95%), 주로 소수의 단일 언어 스페인어 사용 인구에서 매우 높았고, 완료율도 매우 높았으며(평가 세션의 96% 이상), 아바타 테스터가 인간 테스터보다 더 선호되는 질적 진술도 있었습니다.

비감독 평가 및 교육을 위한 AI 가이드 확장의 가능한 방안은 참가자들이 처음으로 비감독 평가나 교육을 설정하고 시작할 수 있도록 돕는 교육 및 지원 시스템을 개발하는 것입니다. 아직 개발 중이지만, FUNSAT은 잠재적 참가자들이 교육 신청, 웹사이트 로그인, 교육 시작을 위한 인간 아바타 안내가 포함된 초기 교육 모듈을 포함하도록 수정되고 있습니다. 이러한 전략들은 아바타 커뮤니케이션이 미리 정해진 답변과 일관된 지시를 전달하는 데 기반하기 때문에, 챗봇 치료 상호작용보다 일관되고 정확하게 전달될 가능성이 더 높습니다.

기타 디지털 전략
현재 검토는 성과 기반의 의도적 인지 평가에 초점을 맞추고 있습니다. 현재 동적인 디지털 표현형 측정 지표들이 인상적으로 존재하며, 이들은 비지도 평가 결과와 연관될 수 있습니다. 여기에는 위치67, 신체 활동68, 사회적 맥락69, 기기와의 상호작용70, 음성 및 언어 특성71이 포함됩니다. 이것들이 반드시 인지 측정치는 아니지만, 인지 수행에 영향을 미칠 수 있는 잠재적 환경적 요인을 반영합니다. 예를 들어, 얼굴이나 음성 반응, 사회적 맥락, 배경 산만함에서 추론되는 기분 상태는 특히 감독 없는 평가 시 인지 수행과 연관될 수 있습니다. 비지도 평가와 관련된 일부 도전 과제는 수동 eC 디지털 표현형을 동시 사용하여 감지 가능하고 줄일 수 있습니다. 이러한 조치들은 데이터를 수집하는 데 의도적인 노력을 요구하지 않으므로 평가에 부담을 더하지 않습니다.

결론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

인지 및 기능적 결함에 대한 디지털 평가와 치료는 과정을 확장하고 그렇지 않으면 접근할 수 없는 참가자들에게 도달할 수 있게 해주기 때문에 매우 유망합니다. 기술 발전으로 자극의 번역이 용이하고, 병렬 평가 양식을 만들며, 원격 전달이 가능해졌습니다. 대부분의 데이터는 비감독 평가 및 교육 결과가 전 세계 성과 지수 측면에서 레거시 전략과 매우 수렴 일치함을 시사합니다. 하지만 참여자 참여와 테스트 개발의 기술적 특성 모두에서 도전 과제가 존재합니다. 많은 참가자들이 감독 없이 기술을 관리하지 못합니다. 기술이 자극을 번역하고 평행 형태를 만드는 것은 용이하지만, 결과물이나 새로운 형태의 심리측정적 유사성에 대한 충분한 관심은 부족했습니다. 시험 품질의 심리측정학적 평가에 대한 체계적 접근법은 기술이 시험 자극을 생성하는 것을 더 쉽게 만든다는 이유로 용서받을 수 없습니다.

디지털 결과 평가를 이용한 일부 약리학적 치료 연구는 치료 효과를 식별하지 못했으며, 이러한 실패는 원래 버전과 수렴하지 않는 병행 형태나 번역된 자극 등 서로 다른 버전의 테스트와 부분적으로 관련이 있을 수 있습니다. 이러한 전략들은 테스터 문제나 새로 개발된 폼의 문제로 인해 과도하게 변동성 있는 테스트 성능과 데이터 누락을 초래할 가능성도 있음이 밝혀졌습니다.

보조 접근법으로는 AI 유도 아바타 테스트 및 교육 어시스턴트를 활용하는 것이 있습니다. 이러한 접근법은 상당한 가능성을 지니고 있지만, 본격적인 배포 전에 검증이 필요합니다. 이러한 전략이 사용되는 경우, 단계적 접근이 필요합니다: 보조원은 처음에 완전한 스크립트화된 지시와 피드백을 제공하고, 이후 대규모 언어 모델로 학습하여 참가자의 질문을 이해하고 상호작용합니다.

평가와 개입의 사회적 맥락은 기술 관련 노력을 지속하는 데 중요합니다. 인간 테스터는 참가자의 도전에 적응하고 교육 참여를 촉진하는 동시에 기술 지원을 제공할 수 있습니다. 이러한 상호작용은 이러한 전략의 범위를 넓히기 위해 비감독 인지 평가 및 훈련의 디지털 접근법에 통합되어야 합니다. 이러한 평가와 개입 전략이 가장 필요한 참가자들은 인지 및 기능적 기술 평가 및 훈련 과제를 스스로 수행하는 동안 보조 지원이 필요할 가능성이 높습니다.

보충 파일 1: 유효한 성과 기반 평가 개발과 관련된 문제: 디지털 제공 평가 및 교육의 타당성, 타당성, 타당성, 관용성에 중점을 둡니다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

하비 박사는 Alkermes, BMS(카루나 테라퓨틱스), Boehringer Ingelheim, Kynexis, Minerva Neurosciences, Neurocrine Biosciences, 그리고 Recognify로부터 컨설팅 수수료 또는 여행 경비를 받았습니다. 그는 Intracellular Therapeutics(현재 존슨앤드존슨의 일부)로부터 연구 연구비를 받았습니다. 그는 Clario 소유, 이전 WCG Endpoint Solutions, Inc, 이전 Verasci, MCCB에 포함된 정신분열증 인지 간략 평가에서 로열티를 받습니다. 그는 i-Function, Inc.의 최고과학 책임자이자 EMA Wellness, Inc.의 과학 자문입니다. 칼레스트럽 씨는 i-Function, Inc.의 공동 창립자이자 최고경영자입니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

FUNSAT과 LASSI-D 개발을 지원하는 연구는 미국 국립노인연구소(NIA)의 R44 AG074818-02, R43 AG057238-02, R44 AG057238-04 연구비로 지원받았으며, 피터 칼레스트럽이 PI로 참여했습니다.

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Crocco, A., et al. A novel cognitive assessment paradigm to detect pre-mild cognitive impairment (PreMCI) and the relationship to biological markers of Alzheimer’s disease. J Psychiatr Res. 96, 33-38 (2019).
  2. Keefe, R. S., et al. The brief assessment of cognition in schizophrenia: reliability, sensitivity, and comparison with a standard neurocognitive battery. Schizophr Res. 68, 283-297 (2004).
  3. Keefe, R. S., et al. Validation of a computerized test of functional capacity. Schizophr Res. 175 (1-3), 90-96 (2016).
  4. Pietrzak, R. H., Olver, J., Norman, T., Piskulic, D. A comparison of the CogState schizophrenia battery and the MATRICS battery in assessing cognitive impairment in chronic schizophrenia. J Clin Exp Neuropsychol. 31, 848-859 (2009).
  5. Czaja, S. J., et al. A novel method for direct assessment of everyday competence among older adults. J Alzheimers Dis. 57, 1229-1238 (2017).
  6. Paolillo, E. W., et al. Characterizing performance on a suite of English-language NeuroUX mobile cognitive tests in a US adult sample: ecological momentary cognitive testing study. J Med Internet Res. 26, e51978 (2024).
  7. Depp, C. A., et al. Ecological momentary facial emotion recognition in psychotic disorders. Psychol Med. 52 (13), 2531-2539 (2022).
  8. Parrish, E. M., et al. Remote ecological momentary testing of learning and memory in adults with serious mental illness. Schizophr Bull. 47 (3), 740-750 (2021).
  9. Bomyea, J. A., et al. Relationships between daily mood states and real-time cognitive performance in individuals with bipolar disorder and healthy comparators: a remote ambulatory assessment study. J Clin Exp Neuropsychol. 43 (8), 813-824 (2021).
  10. Keefe, R. S., et al. Norms and standardization of the brief assessment of cognition in schizophrenia (BACS). Schizophr Res. 102 (1-3), 108-115 (2008).
  11. Atkins, A. S., et al. Validation of the tablet-administered brief assessment of cognition (BAC App). Schizophr Res. 181, 100-106 (2017).
  12. Atkins, A. S., et al. Assessment of instrumental activities of daily living in older adults with subjective cognitive decline using the virtual reality functional capacity assessment tool (VRFCAT). J Prev Alzheimers Dis. 5 (4), 216-234 (2018).
  13. Harvey, P. D., et al. Digital migration of the Loewenstein Acevedo scales for semantic interference and learning (LASSI-L): development and validation study in older participants. JMIR Ment Health. 12, e64716 (2025).
  14. Huang-Ouyang, B., et al. Development and comparison of alternate forms of the LASSI-D in older participants with amnestic mild cognitive impairment and normal cognition. J Alzheimers Dis. 108 (2), 681-692 (2025).
  15. Crocco, E., et al. Brief version of the LASSI-L detects prodromal Alzheimer’s disease states. J Alzheimers Dis. 78 (2), 789-799 (2020).
  16. Goldberg, T. E., et al. Practice effects due to serial cognitive assessment: implications for preclinical Alzheimer’s disease randomized controlled trials. Alzheimers Dement (Amst). 1 (1), 103-111 (2015).
  17. Wang, G., et al. Using practice effects for targeted trials or subgroup analysis in Alzheimer’s disease. PLoS One. 15 (2), e0228064 (2020).
  18. Harvey, P. D., McGurk, S. R., Mahncke, H., Wykes, T. Controversies in computerized cognitive training. Biol Psychiatry Cogn Neurosci Neuroimaging. 3 (11), 907-915 (2018).
  19. Lynham, A. J., Jones, I. R., Walters, J. T. R. Cardiff online cognitive assessment in a national sample: cross-sectional web-based study. J Med Internet Res. 25, e46675 (2023).
  20. Polk, S. E., et al. A scoping review of remote and unsupervised digital cognitive assessments in preclinical Alzheimer’s disease. NPJ Digit Med. 8 (1), 266 (2025).
  21. Lavigne, K. M., et al. Remote cognitive assessment in severe mental illness: a scoping review. Schizophrenia (Heidelb). 8 (1), 14 (2022).
  22. Mwesiga, E. K., et al. A systematic review of neuropsychological measures in psychotic disorders from low- and middle-income countries. Schizophr Res Cogn. 22, 100187 (2020).
  23. Owen, A. M., et al. Putting brain training to the test. Nature. 465 (7299), 775-778 (2010).
  24. Harvey, P. D., et al. Migration of digital functional capacity assessments from device resident to cloud-based delivery. Schizophr Res Cogn. 39, 100331 (2024).
  25. Czaja, S. J., Kallestrup, P., Harvey, P. D. Evaluation of a novel technology-based program designed to assess and train everyday skills in older adults. Innov Aging. 4 (6), igaa052 (2020).
  26. Guzman, A., et al. Location-based differences in cognition and functional capacity. Psychiatry Res. 340, 116121 (2024).
  27. Green, M. F., et al. Approaching a consensus cognitive battery for clinical trials in schizophrenia. Biol Psychiatry. 56 (5), 301-307 (2004).
  28. Nuechterlein, K. H., et al. The MATRICS consensus cognitive battery, part 1. Am J Psychiatry. 165 (2), 203-213 (2008).
  29. Russell, M. T., et al. Validity of remote administration of the MATRICS battery. Schizophr Res Cogn. 27, 100226 (2021).
  30. Bralet, M. C., et al. Validation of the French version of the BACS. Eur Psychiatry. 22 (6), 365-370 (2007).
  31. Wang, L. J., et al. Validation of the Chinese version of BACS. Neuropsychiatr Dis Treat. 12, 2819-2826 (2016).
  32. Mazhari, S., et al. Validation of the Persian version of BACS. Psychiatry Clin Neurosci. 68 (2), 160-166 (2014).
  33. Haddad, C., et al. Validation of the Arabic version of BACS. BMC Psychiatry. 21 (1), 223 (2021).
  34. Segarra, N., et al. Spanish validation of BACS. Eur Psychiatry. 26 (2), 69-73 (2011).
  35. Kaneda, Y., et al. Validation of the Japanese version of BACS. Psychiatry Clin Neurosci. 61 (6), 602-609 (2007).
  36. . Available from: https://www.matricsinc.org/ (2025)
  37. Ruse, S. A., et al. Development of a virtual reality assessment of everyday living skills. J Vis Exp. (86), e51405 (2014).
  38. Harvey, P. D., et al. A computerized functional skills assessment and training program. J Vis Exp. (156), e60330 (2020).
  39. Harvey, P. D., et al. Virtual reality assessment of functional capacity in schizophrenia. Psychiatry Res. 277, 58-63 (2019).
  40. Harvey, P. D., et al. Factor structure of cognitive performance and functional capacity in schizophrenia. Schizophr Res. 223, 297-304 (2020).
  41. Horan, W. P., et al. Content validity of VRFCAT in schizophrenia. Schizophr Bull Open. 4 (1), sgad012 (2023).
  42. Harvey, P. D., et al. Computerized functional skills assessment and training program: psychometrics. Am J Geriatr Psychiatry. 29 (4), 395-404 (2021).
  43. Dowell-Esquivel, C., et al. Computerized cognitive and skills training in older people with MCI. Am J Geriatr Psychiatry. 32 (4), 446-459 (2024).
  44. Harvey, P. D., et al. Improvements in cognitive performance with computerized training. Am J Geriatr Psychiatry. 30 (6), 717-726 (2022).
  45. Harvey, P. D., et al. Improvements in functional capacity after computerized training. Psychiatry Res. 334, 115792 (2024).
  46. Harvey, P. D., et al. Awareness of baseline functioning and sensitivity to improvement. Int Psychogeriatr. 37 (3), 100025 (2025).
  47. Cornblatt, B. A., et al. Continuous performance test, identical pairs version (CPT-IP). Psychiatry Res. 126 (2), 223-238 (1988).
  48. Harvey, P. D., et al. Effect of lurasidone on neurocognitive performance. Eur Neuropsychopharmacol. 23 (11), 1373-1382 (2013).
  49. Sauder, C., et al. Effectiveness of KarXT for cognitive impairment in schizophrenia. Transl Psychiatry. 12 (1), 491 (2022).
  50. Campbell, L. M., et al. Smartphone-based cognitive testing across lifespan. NPP Digit Psychiatry Neurosci. 3 (1), 15 (2025).
  51. Atkins, A. S., et al. Remote self-administration of digital cognitive tests. Front Psychiatry. 13, 910896 (2022).
  52. Loewy, R., et al. Durable cognitive gains after remote auditory training. Schizophr Bull. 48 (1), 262-272 (2022).
  53. Czaja, S. J., et al. Home-based functional skills training program efficacy. Innov Aging. 8 (7), igae065 (2024).
  54. Fisher, M., et al. Remote cognitive training combined with mobile app intervention. J Med Internet Res. 25, e48634 (2023).
  55. Harvey, P. D., et al. Early prediction of mastery of computerized training. Int Psychogeriatr. 36 (12), 1182-1193 (2024).
  56. Vita, A., et al. Cognitive remediation for schizophrenia: meta-analysis. JAMA Psychiatry. 78 (8), 848-858 (2021).
  57. Jiménez, J. E., García, E., Balade, J. Advancing dyslexia assessment through computerized testing. J Vis Exp. (210), e67031 (2024).
  58. Rodríguez, C., et al. Multimedia battery for assessment of cognitive and basic math skills. J Vis Exp. (174), e62288 (2021).
  59. Wei, W., et al. Digital and walking trail making test. J Vis Exp. (153), e60456 (2019).
  60. Cheng, T., Wu, J. T. Online syntactic processing using dual-modal tasks. J Vis Exp. (151), e59660 (2019).
  61. Yow, W. Q., et al. Dual-language touchscreen intervention in older adults. Innov Aging. 8 (7), igae052 (2024).
  62. Gershon, R. C., et al. Assessment of neurological and behavioral function: the NIH toolbox. Lancet Neurol. 9 (2), 138-139 (2010).
  63. Khin, N. I., et al. A phase 2 randomized controlled trial of luvadaxistat in treatment of adults with cognitive impairment associated with schizophrenia: results from the ERUDITE study. Neuropsychopharmacology. , (2025).
  64. González-Blanch, C., et al. Validation of BAC app in Spanish-speaking individuals. Eur Psychiatry. 68 (1), e112 (2025).
  65. Keefe, R. S., et al. Efficacy and safety of iclepertin for cognitive impairment. Lancet Psychiatry. 12 (12), 906-920 (2025).
  66. Benoit, A., et al. Cognitive deficits using CogState battery in first-episode psychosis. Schizophr Res Cogn. 2 (3), 140-145 (2015).
  67. Depp, C. A., et al. GPS mobility as a digital biomarker of negative symptoms. NPJ Digit Med. 2, 108 (2019).
  68. Strauss, G. P., et al. Validation of accelerometry as a digital phenotyping measure. Schizophrenia (Heidelb). 8 (1), 37 (2022).
  69. Wahle, F., et al. Mobile sensing and support for depression. JMIR Mhealth Uhealth. 4 (3), e111 (2016).
  70. Dagum, P. Digital biomarkers of cognitive function. NPJ Digit Med. 1, 10 (2018).
  71. Cowan, T., et al. Computerized analysis of facial expression and blunted affect. Eur Arch Psychiatry Clin Neurosci. 274 (7), 1771-1775 (2024).

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

Digital Cognitive AssessmentFunctional AssessmentUnsupervised AssessmentDigital TrainingArtificial IntelligenceAssessment TranslationPsychometric IntegrityLinguistic ValidityHuman Tester SupportSelf Administered Assessment

관련 논문