본 프로토콜은 영-중 서면 번역 및 시역에서 인지적 노력의 관찰 가능한 상관관계와 수정의 기능적 효과를 평가하기 위해 다중 모드 행동 기록을 통합합니다. 여기에는 키스트로크 로깅, 화면 캡처, 오디오 분석, 전사 기반 코딩 및 표준화된 품질 평가가 결합되어 있습니다.
본 프로토콜은 영-중 서면 번역 및 시역에서 인지적 노력의 관찰 가능한 상관관계와 수정의 기능적 효과를 평가하기 위해 다중 모드 행동 기록을 통합합니다. 여기에는 키스트로크 로깅, 화면 캡처, 오디오 분석, 전사 기반 코딩 및 표준화된 품질 평가가 결합되어 있습니다.
본 논문은 영-중 서면 번역 및 시역 과정에서 인지적 노력과 전략적 수정의 관찰 가능한 상관관계를 조사하기 위한 다중 모드 행동 프로토콜을 제시합니다. 서면 번역의 경우 키스트로크 로그와 화면 녹화 영상을 동기화하며, 시역의 경우 오디오 녹음과 축자 전사본을 사용합니다. 수정 및 자기 수정 에피소드는 전체적인 출력 품질 평가와는 별개로, 유형 및 기능적 결과(효과적, 중립적 또는 해로움)에 따라 코딩됩니다. 초보자 그룹과 숙련자 그룹으로 배정된 62명의 참가자를 대상으로 한 시연에서, 두 그룹 모두 상쇄 순서로 두 가지 과제 조건을 수행했습니다. 숙련자 참가자들은 서면 번역(20.1 ± 2.1 vs. 16.8 ± 2.3)과 시역(18.9 ± 2.4 vs. 15.4 ± 2.6) 모두에서 더 높은 평균 출력 품질 점수를 보였으며, 효과적인 수정 또는 자기 수정의 비율이 더 높았습니다. 일시 정지, 삭제, 시작 지연 및 수정 밀도는 간접적이며 과제에 따라 민감하게 반응하므로, 이를 단일 구성 개념의 직접적인 측정치가 아니라 삼각 측량이 필요한 행동적 상관관계로 해석합니다. 본 프로토콜은 통제된 설명문 텍스트를 대상으로 하며, 입력 방식 처리, 일시 정지 임계값, 텍스트 비교 가능성 및 채점 절차를 재조정하여 다른 언어 쌍에도 적용할 수 있습니다.
영어-중국어 필기 번역과 시역은 원문 이해, 언어 간 전이, 그리고 도착어 표현 능력을 필요로 하지만, 서로 다른 과제 조건을 부과합니다. 필기 번역은 반복적인 읽기와 지연된 편집이 가능한 반면, 시역은 더 엄격한 시간적 제약 하에서 구어적 산출을 요구합니다. 인지 부하(Cognitive load), 처리 난이도(processing difficulty), 그리고 인지적 노력(cognitive effort)은 서로 관련이 있지만 상호 대체될 수 없는 개념들입니다. 부하는 과제의 요구 사항에 관한 것이며, 노력은 그러한 요구 사항 하에서 참가자가 투입하는 자원에 관한 것입니다. 인지적 노력은 잠재적이고 다차원적이므로, 본 연구에서는 잠복기, 휴지, 삭제 및 수정 밀도를 계획, 모니터링, 운동 프로세스 또는 난이도를 반영할 수 있는 행동적 상관물로 취급하며, 이를 노력의 직접적인 측정치라기보다 종합적으로 해석해야 합니다1,2,3,4,5,6,7,8.
과정 중심 연구는 제품 점수와 시간별로 정렬된 행동 기록을 결합하여 번역 결정이 언제, 어떻게 일어나는지 확인합니다. 키스트로크 로깅은 생성 및 수정 순서를 파악하는 데 유용하지만, 중국어 입력 방식의 조합 과정에서 실제 키 이벤트와 최종 입력된 문자가 분리될 수 있습니다. 따라서 가시적인 텍스트 상태를 재구성하기 위해 동기화된 화면 녹화가 필요합니다9,10,11. 일시 정지 임계값은 보편적인 인지적 경계라기보다 분석적 선택 사항이며, 임계값을 짧게 설정하면 일시 정지 기반의 결론이 실질적으로 달라질 수 있습니다8,12. 따라서 본 프로토콜에서는 명시적인 동기화 확인, 임계값 민감도 분석, 그리고 과제 특이적 측정 항목과 공유 측정 항목의 분리가 요구됩니다.
수정 빈도만으로는 모니터링이 결과물을 개선하는지 여부를 판단할 수 없습니다. 서면 수정과 구어적 자가 수정은 어휘 선택, 구문, 의미 또는 스타일을 대상으로 할 수 있지만, 그 기능적 결과는 원문 의미 및 직전에 생성된 타겟 세그먼트와 비교하여 판단해야 합니다. 영어-중국어 및 중국어-영어 처리에 관한 시역 연구에 따르면 훈련, 방향성, 눈-음성 협응, 그리고 언어별 문제 유발 요인이 수행 패턴을 변화시킬 수 있음이 나타났습니다13,14,15,16. 이러한 이유로 에피소드 유형, 에피소드 결과, 최종 결과물 품질 및 전달 관련 행동을 별개의 변수로 코딩합니다.
본 프로토콜은 통제된 컴퓨터 기반 세션에서 짧은 비전문가용 설명문을 다루는 성인 학습자 또는 숙련된 번역가/통역사를 대상으로 설계되었습니다. 작문 생산을 위해 키스트로크(keystroke) 및 화면 기록을 캡처할 수 있고, 구어 생산을 위해 고품질 오디오를 녹음할 수 있는 환경에 가장 적합합니다. 본 프레임워크는 다른 언어 쌍에도 적용할 수 있으나, 텍스트 매칭, 정보 단위로의 분절, 키보드 또는 입력 방식의 동작, 일시 정지 임계값 및 등급 척도 기준점은 각 언어 쌍과 문자 체계에 맞게 다시 검증되어야 합니다17. 본 시연에서는 텍스트 길이, 시간 제한, 출력 모드 및 수정 기회가 서로 다르기 때문에 모든 차이점을 단순히 양식(modality)의 차이로만 돌리지 않고 과제 조건 간의 비교를 수행합니다.
인체 대상자를 포함하는 모든 방법은 기관 지침을 준수하여 수행되었으며, Guilin Institute of Information Technology의 인체 연구 윤리 위원회로부터 명시적인 승인을 받았습니다(승인 번호 UYHAJ2025899). 모든 참여자로부터 참여 전 서면 동의서를 받았습니다. 본 연구에 사용된 장비 및 소프트웨어의 전체 목록은 재료 표를 참조하시기 바랍니다.
1. 참여자 모집 및 그룹 배정
2. 재료 선택 및 예비 평가
3. 과제 수행 관리 및 기록 설정
4. 행동 과정 지표의 추출
5. 전략적 수정 및 구어적 자기 수정의 코딩
6. 품질 평가 및 통계 모델링
참가자 기초 특성 및 데이터 가용성
설문조사에는 총 62명의 참가자(초심자 31명, 숙련자 31명)가 포함되었으며, 작업 시트에는 124개의 기록이 포함되어 참가자당 두 개의 작업 기록을 완료했음을 나타냅니다(표 1). 초심자 그룹은 12개월 미만의 체계적인 번역 훈련을 받았으며(관찰된 최대치 8.6개월), 숙련자 그룹은 최소 12개월 이상의 훈련을 받았습니다(관찰된 최소치 13.3개월). 연령, 성별, 영어 학습 기간, 능숙도 및 작업 순서 분포는 두 그룹 간에 유사했습니다. 그림 1은 최종 분석 샘플을 보고하며, 작업별 데이터를 정확하게 구분하고 있습니다. 즉, 키스트로크 로그와 화면 녹화는 서면 번역에 적용되고, 오디오 및 축어록은 시각 통역에 적용되며, 품질 등급은 두 작업 모두에 적용됩니다.
과제 조건별 행동 프로필
두 가지 과제 조건 및 훈련 그룹 간에 행동 프로필의 차이가 나타났다(표 2; 그림 2A–E). 필기 번역은 완료 시간이 더 길고 평균 휴지 시간이 더 길었던 반면, 시역은 보고된 임계값 미만의 정보 단위 100개당 휴지 횟수가 더 많았다. 각 과제 조건 내에서, 훈련 그룹은 과제를 더 빠르게 완료했으며 평균 출력 점수가 더 높았다. 이러한 대조 결과는 텍스트 길이, 시간 제한, 출력 방식 및 수정 기회 또한 서로 달랐기 때문에 순수한 양식 효과로 해석해서는 안 된다. 휴지가 항상 방해 요소가 되는 것은 아니다. 휴지는 해결되지 않은 어려움, 성공적인 계획, 모니터링 또는 입력 방식의 활동을 반영할 수 있으므로, 휴지 측정치는 수정, 전달 및 품질 측정치와 함께 종합적으로 해석된다.
전략적 수정, 자기 수선 및 예측 모델링
코딩 프레임워크는 에피소드 유형을 기능적 결과와 분리하였습니다(표 3; 그림 3A–D). 훈련된 참가자들은 초보자보다 더 많은 서면 수정 에피소드를 생성하였으며(과제당 12.4 ± 3.7 vs. 8.9 ± 3.0), 반면 총 구어 자기 수정은 그룹 간에 유의미한 차이가 없었습니다(과제당 4.9 ± 1.6 vs. 4.4 ± 1.5). 그럼에도 불구하고 훈련된 그룹은 두 과제 모두에서 효과적인 에피소드의 비율이 더 높았습니다. 표 4에 보고된 혼합 효과 요약은 인과 경로가 아닌 연관성을 나타내며, 따라서 그림 3E는 인과 관계 다이어그램 대신 보고된 고정 효과 추정치와 신뢰 구간을 표시합니다.

그림 1: 참가자 흐름, 과업 순서 할당 및 과업별 데이터 가용성. (A) 최종 분석된 62명의 참가자와 124개의 과업 기록 샘플. (B) 초보자 및 숙련자 그룹 내의 균형 설계된 과업 순서 할당. (C) 가용성 매트릭스로, 키스트로크 로그와 화면 녹화는 필기 번역에만, 오디오 녹음과 축어 전사본은 시역에만, 품질 등급은 두 과업 모두에 적용됨. (D) 그룹별-순서별 균형 (카이제곱 검정, p = 0.799). n = 62명의 참가자 (그룹당 31명). 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

그림 2: 필기 번역 및 시역 과제 조건에 따른 행동 프로필. (A) 과제별 녹음 설정. (B) 초기/시작 잠복기 및 총 과제 시간. (C) 일시 정지 빈도와 평균 일시 정지 지속 시간의 결합 분포. (D) 과제별 삭제, 수정 및 구어 유창성 저하 지표. (E) 필기 생산 속도 및 구어 발화 속도. 패널 B, C, E에서 점과 오차 막대는 그룹 평균 ± SD를 나타내며, 패널 D에서 점은 숙련자-초보자 간의 평균 차이를, 오차 막대는 95% 신뢰 구간을 나타냄. 그룹당 n = 31명의 참가자. 패널 E의 y축은 로그 스케일로 표시됨. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

그림 3: 수정/자가 수정 코딩, 기능적 결과 및 출력 품질 간의 연관성. (A) 에피소드 유형과 기능적 결과를 독립적으로 할당하기 위한 결정 프레임워크. (B) 각 과제 조건에서 나타난 어휘적, 구문적, 의미적 및 양식적 에피소드의 평균 횟수. (C) 효과적, 중립적 및 해로운 에피소드의 평균 비율. (D) 효과적 에피소드 비율과 총 출력 품질 점수 간의 기술적 연관성. (E) 95% 신뢰 구간을 포함한 선형 혼합 효과 모델의 고정 효과를 보여주는 포레스트 플롯(표 4에 상세히 설명됨); 이 플롯은 연관성을 나타내며 인과 경로 모델을 나타내지는 않음. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.
| 변수 | 초보자 그룹 (n = 31) | 숙련자 그룹 (n = 31) | p 값 |
| 연령, years | 21.9 ± 1.7 | 22.4 ± 1.9 | 0.279 |
| 여성, n (%) | 22 (71.0) | 21 (67.7) | 0.779 |
| 영어 학습 기간, years | 12.4 ± 2.1 | 12.9 ± 2.2 | 0.36 |
| 영어 능통도 점수 | 548.6 ± 41.3 | 562.4 ± 45.8 | 0.216 |
| 번역 훈련 기간, months | 5.6 ± 3.0 | 18.7 ± 5.4 | <0.001 |
| 통역 훈련 기간, months | 2.3 ± 2.1 | 13.9 ± 5.7 | <0.001 |
| 이전 서면 번역 실습 ≥5회, n (%) | 9 (29.0) | 24 (77.4) | <0.001 |
| 이전 시역 실습 ≥5회, n (%) | 5 (16.1) | 20 (64.5) | <0.001 |
| 서면 번역 우선, n (%) | 16 (51.6) | 15 (48.4) | 0.799 |
| 시역 우선, n (%) | 15 (48.4) | 16 (51.6) | 0.799 |
표 1: 그룹별 참가자 특성 및 기초 언어 훈련 프로필. 변수는 연속형 데이터의 경우 평균 ± 표준편차로, 범주형 데이터의 경우 빈도(백분율)로 표시되었습니다. 보고된 p-값은 기초 인구통계학적 균형을 확인하고 의도된 훈련 기간의 차이를 검증하기 위한 그룹 간 비교 결과를 나타냅니다.
| 변수 | 필기 번역 초보자 (n = 31) | 필기 번역 숙련자 (n = 31) | 시역 초보자 (n = 31) | 시역 숙련자 (n = 31) | 과업 효과 p | 집단 효과 p |
| 초기/시작 지연 시간, s | 31.8 ± 12.4 | 24.6 ± 9.7 | 14.2 ± 5.6 | 10.8 ± 4.2 | <0.001 | 0.003 |
| 총 과업 시간, s | 1038.5 ± 168.2 | 925.4 ± 151.6 | 305.6 ± 59.3 | 274.8 ± 50.7 | <0.001 | 0.004 |
| 일시 정지 빈도, 정보 단위 100개당 | 18.6 ± 6.1 | 14.2 ± 5.0 | 24.8 ± 7.4 | 19.6 ± 6.3 | <0.001 | 0.001 |
| 평균 일시 정지 지속 시간, s | 4.1 ± 1.2 | 3.3 ± 1.0 | 2.7 ± 0.8 | 2.3 ± 0.7 | 0.012 | 0.002 |
| 생산/발화 속도, 중국어 글자 수/min | 28.6 ± 6.7 | 34.1 ± 7.5 | 93.4 ± 18.9 | 108.7 ± 20.4 | 0.001 | |
| 삭제율, % | 8.9 ± 3.4 | 6.8 ± 2.7 | 0.009 | |||
| 수정 밀도, 중국어 글자 100개당 | 7.6 ± 2.8 | 8.9 ± 3.1 | 0.087 | |||
| 채워진 일시 정지 빈도, 분당 | 5.7 ± 1.9 | 4.2 ± 1.6 | 0.002 | |||
| 반복 빈도, 분당 | 4.9 ± 1.8 | 3.6 ± 1.4 | 0.004 | |||
| 거짓 시작 빈도, 분당 | 2.8 ± 1.1 | 2.0 ± 0.9 | 0.006 | |||
| 자기 수정 빈도, 분당 | 4.8 ± 1.7 | 3.9 ± 1.4 | 0.031 | |||
| 총 품질 점수, 0–25 | 16.8 ± 2.3 | 20.1 ± 2.1 | 15.4 ± 2.6 | 18.9 ± 2.4 | 0.002 | <0.001 |
| 정확도, 0–5 | 3.4 ± 0.7 | 4.1 ± 0.6 | 3.1 ± 0.8 | 3.8 ± 0.7 | 0.004 | <0.001 |
| 완전성, 0–5 | 3.3 ± 0.8 | 4.0 ± 0.6 | 3.0 ± 0.8 | 3.7 ± 0.7 | 0.006 | <0.001 |
| 어휘 적절성, 0–5 | 3.2 ± 0.7 | 4.0 ± 0.6 | 3.1 ± 0.7 | 3.8 ± 0.6 | 0.041 | <0.001 |
| 일관성, 0–5 | 3.5 ± 0.6 | 4.0 ± 0.6 | 3.1 ± 0.7 | 3.8 ± 0.6 | 0.003 | <0.001 |
| 대상 언어 자연스러움, 0–5 | 3.4 ± 0.7 | 4.0 ± 0.6 | 3.1 ± 0.7 | 3.8 ± 0.7 | 0.007 | <0.001 |
표 2: 과제 조건 및 집단별 행동 프로세스 지표와 산출물 품질.값은 평균 ± 표준편차로 표시되었다. 보고된 p-값은 각 프로세스 및 품질 변수에 대한 과제 양식(번역 vs. 시역)과 훈련 배경(초보자 vs. 훈련자)의 주효과를 나타낸다.
| 변수 | 번역 작성 초보자 | 번역 작성 숙련자 | p 값 | 시역 초보자 | 시역 숙련자 | p 값 |
| 어휘적 수정/자기 교정, n/task | 3.4 ± 1.5 | 4.2 ± 1.7 | 0.053 | 1.8 ± 0.8 | 1.7 ± 0.7 | 0.612 |
| 통사적 수정/자기 교정, n/task | 2.1 ± 1.1 | 3.0 ± 1.2 | 0.004 | 1.1 ± 0.7 | 1.2 ± 0.8 | 0.645 |
| 의미적 수정/자기 교정, n/task | 1.8 ± 1.0 | 2.5 ± 1.1 | 0.011 | 0.9 ± 0.6 | 1.1 ± 0.7 | 0.232 |
| 문체적 수정/자기 교정, n/task | 1.6 ± 0.9 | 2.7 ± 1.2 | <0.001 | 0.6 ± 0.4 | 0.9 ± 0.6 | 0.026 |
| 총 수정/자기 교정 횟수, n/task | 8.9 ± 3.0 | 12.4 ± 3.7 | <0.001 | 4.4 ± 1.5 | 4.9 ± 1.6 | 0.209 |
| 효과적인 에피소드, % | 52.6 ± 13.5 | 68.4 ± 12.1 | <0.001 | 45.1 ± 14.2 | 62.3 ± 13.0 | <0.001 |
| 중립적 에피소드, % | 31.8 ± 10.4 | 22.7 ± 8.8 | 0.001 | 35.6 ± 11.7 | 25.4 ± 9.6 | 0.001 |
| 부정적 에피소드, % | 15.6 ± 7.1 | 8.9 ± 5.6 | <0.001 | 19.3 ± 8.6 | 12.3 ± 6.8 | 0.001 |
표 3: 과제 조건에 따른 서면 수정 및 구두 자기 수정의 유형 및 효과. 에피소드 유형은 과제당 평균 횟수(± 표준 편차)로 표시하였으며, 기능적 결과는 평균 백분율(± 표준 편차)로 표시하였다. p-값은 각 과제 양식 내에서 그룹 간 차이의 유의성을 나타낸다.
| 고정 효과 | β | SE | 95% 신뢰구간 | p 값 |
| 절편 | 16.74 | 0.42 | 15.91 ~ 17.57 | <0.001 |
| 작업 모달리티: 시각 해석 대 서면 번역 | -1.08 | 0.29 | -1.65에서 -0.51까지 | <0.001 |
| 훈련 그룹: 숙련자 vs 초보자 | 2.84 | 0.47 | 1.91에서 3.77까지 | <0.001 |
| 과제 양상 × 훈련 그룹 | 0.26 | 0.47 | -0.67에서 1.19까지 | 0.581 |
| 정보 단위 100개당 일시 정지 빈도 | -0.12 | 0.05 | -0.22에서 -0.02까지 | 0.018 |
| 평균 일시 중지 지속 시간, s | -0.34 | 0.16 | -0.66 ~ -0.02 | 0.041 |
| 수정/자가-수복 밀도 | 0.07 | 0.07 | -0.07 ~ 0.21 | 0.334 |
| 10% 증가당 유효 교정/자가 수선율 | 0.56 | 0.13 | 0.30 ~ 0.82 | <0.001 |
| 삭제/비유창성 부담 | -0.18 | 0.08 | -0.34에서 -0.02까지 | 0.027 |
| 표준화된 생성/발화 속도 | 0.42 | 0.19 | 0.04에서 0.80까지 | 0.032 |
표 4: 총 출력 품질을 예측하는 선형 혼합 효과 모델의 보고된 고정 효과.요약 내용은 지정된 모든 과제 및 행동 예측 변수에 대한 비표준화 계수(β), 표준 오차(SE), 95% 신뢰 구간(CI) 및 정확한 p-값을 상세히 나타냅니다.
본 연구는 영어-중국어 서면 번역 및 시역(sight interpreting) 과정에서 관찰 가능한 프로세스 지표를 측정하고 전략적 수정 사항을 코딩하기 위한 다중 모드 프로토콜을 제시합니다. 이 프로토콜은 단일한 인지적 노력 변수를 직접 측정하지 않습니다. 대신, 잠복기(latency), 휴지(pause), 삭제 및 수정 패턴을 작업 민감형 행동 상관물로 해석하며, 그 의미는 동기화된 기록 및 산출물 품질 증거와의 삼각측량에 의해 결정됩니다1,2,3,4,5,6,7,8. 또한 두 작업은 자료, 타이밍, 산출 방식 및 수정 기회 면에서 차이가 있으며, 따라서 대표적인 대조 결과는 개별적인 모달리티 효과라기보다 작업 조건의 차이를 설명합니다. 주요 분석적 기여는 수정 빈도와 기능적 결과를 분리한 것입니다. 보고된 요약 내용에 따르면, 훈련된 참가자들은 서면 수정을 더 많이 수행했으며, 구어 자가 수정(self-repair)의 총 횟수는 집단 간에 유의미한 차이가 없었습니다. 이들의 유효 에피소드 비율이 더 높다는 점은 모니터링 품질이 단순 빈도보다 더 유용한 정보를 제공할 수 있음을 시사하지만, 이러한 해석은 투명한 결정 규칙, 독립적인 결과 코딩 및 보고된 신뢰도에 근거합니다. Supplementary File 1의 코드북과 실습 예제는 이러한 구분을 홍보하기 위함이 아니라 재현 가능하게 만들기 위한 것입니다.
핵심 단계는 기록 간 정렬, 오디오 품질, 전사본 검증 및 코딩 일관성 확보입니다. 로그와 녹음 파일을 정렬할 때는 사용 가능한 타임스탬프와 작업 경계 단서를 확인해야 합니다. 전사 작업 전 오디오의 클리핑 발생 여부와 명료도를 점검해야 하며, 제안된 일시 정지 경계는 파형 및 전사본과 대조하여 검증해야 합니다. 중국어 입력의 경우, 글자 조합을 위한 키 입력(composition keystrokes)을 확정된 문자의 수정으로 간주해서는 안 됩니다. 이러한 점검 및 수정 조치는 품질 관리 로그에 기록하여 보관해야 합니다.
해석에는 몇 가지 제한 사항이 있습니다. 본 시연은 학생 및 교육생 코호트, 짧은 일반 설명문, 서로 다른 과제 길이 및 시간 제한, 그리고 가용성 기반 표본을 사용하였습니다. 또한 과제 조건이 출력 방식과 수정 기회 면에서 차이가 있으며, 데이터셋에 텍스트 수준의 변동성을 추정하기 위한 독립적으로 샘플링된 소스 텍스트 식별자가 포함되어 있지 않습니다. 아울러, 일시 정지 임계값은 운영상의 선택 사항이며, 더 긴 일시 정지는 생산적인 계획과 해결되지 않은 어려움 모두를 반영할 수 있습니다. 전문가, 전문 분야, 다른 언어 쌍 또는 다른 문자 체계로 일반화하려면 자료, 입력 방법 처리, 임계값 및 채점 기준점에 대한 재검증이 필요합니다.
향후 연구에서는 행동 기록을 시선 추적, 동공 측정법 또는 주관적 작업 부하 측정과 결합하여, 어떤 일시 정지와 수정이 주의 집중, 체감 노력 또는 성공적인 계획 수립과 일치하는지 테스트할 수 있습니다5,6,13,14,15,16. Shreve 등은 시역 번역(sight translation)에 시선 추적을 사용하였으므로 동공 측정 연구로 인용해서는 안 되며18, 동공 측정법은 Seeber에 의해 직접적으로 논의되었습니다5. 이러한 다중 모드 확장 연구에서도 과제 요구도, 투입된 노력, 관찰된 행동 및 수행 능력 간의 구분은 유지되어야 합니다. 따라서 본 프로토콜은 지표들이 잠재적 인지 노력에 대한 주장을 뒷받침하지만, 그 자체만으로 이를 입증하지는 않는 투명한 프로세스 평가 프레임워크로 사용하는 것이 가장 적절합니다.
저자들은 상업적 또는 재정적 이해관계의 충돌이 없음을 보고합니다. 인공지능 사용과 관련하여, 저자들은 언어 편집, 일관성 확인, 변경 내용 추적 준비 및 저자가 제공한 데이터를 기반으로 한 그림 레이아웃 재생성을 돕기 위해 수정 과정에서 OpenAI Codex가 엄격하게 활용되었음을 밝힙니다. 저자들은 AI 지원 결과물을 세심하게 검토하였으며, 최종 원고의 정확성, 무결성 및 독창성에 대해 모든 책임을 집니다. 보고된 요약의 기초가 된 구조화된 워크북은 Zenodo(https://doi.org/10.5281/zenodo.21189434)에서 공개적으로 이용 가능합니다. 보충 파일 1에는 코딩 매뉴얼과 고정된 품질 루브릭이 포함되어 있습니다.
저자는 실험실 지원을 제공한 구이린 정보 기술 연구소(Guilin Institute of Information Technology)와 원문을 평가한 이중 언어 전문가들, 독립 평가자들, 그리고 참여자들에게 감사를 표합니다. 본 연구는 공공, 상업 또는 비영리 부문의 어떤 지원 기관으로부터도 특정 보조금을 지원받지 않았습니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 음향 분석 소프트웨어 (Praat) | Paul Boersma and David Weenink | https://www.fon.hum.uva.nl/praat/ | |
| 데스크톱 컴퓨터 | Dell | OptiPlex | |
| 디지털 오디오 녹음 소프트웨어 (Audacity) | Audacity Team | https://www.audacityteam.org/ | |
| 키스트로크 로깅 소프트웨어 (Inputlog) | University of Antwerp | https://www.inputlog.net/ | |
| 화면 녹화 소프트웨어 (OBS Studio) | OBS Project | https://democreator.wondershare.com/ | |
| 통계 분석 소프트웨어 (SPSS) | IBM | Version 27 |
이 논문이 게재되었습니다
동영상 곧 제공