본 연구는 STEP-DWCF-R(Structured, Tiered, Evidence-driven Process for Dynamic Written Correctionive Correction Feedback with Robotic AI Agent)를 벤치마크하여 다라운드 AI와 교사 지원 수정을 통해 IELTS 작성 성과를 향상시키는 데 기여합니다.
방법 논문
본 연구는 STEP-DWCF-R(Structured, Tiered, Evidence-driven Process for Dynamic Written Correctionive Correction Feedback with Robotic AI Agent)를 벤치마크하여 다라운드 AI와 교사 지원 수정을 통해 IELTS 작성 성과를 향상시키는 데 기여합니다.
자동 작성 피드백 시스템이 널리 사용되고 있지만, 대부분은 정적이고 단편적인 코멘트를 제공하여 수정을 위한 제한된 기반만 제공합니다. 본 연구는 STEP-DWCF-R 프레임워크(Structured, Tiered, Evidence-driven Process for Dynamic Written Correctionive Feedback with Robotic AI Agent)를 평가하는데, 이는 교사가 조정하는 AI 생성 피드백이 1주일 과제 주기 내에 여러 반복 라운드에 걸쳐 로봇 AI 에이전트를 통해 전달되는 방식입니다. 8주간의 준실험 시험에서 32명의 EFL 학습자가 전통적인 서면 교정 피드백(과제당 한 라운드) 또는 STEP-DWCF-R 중 하나에 무작위로 배정되었습니다. 두 그룹 모두 기저선과 사후 평가에서 IELTS Task 2 에세이를 익명화, 무작위 배정, 두 명의 독립 평가자가 채점하였습니다(ICC = 0.86–0.93). 선형 혼합 효과 모델은 STEP-DWCF-R 그룹이 전체 밴드 점수(Δ = 1.03 대 0.31 밴드)와 네 가지 분석 차원 모두에서 유의하게 더 큰 향상을 보였으며, 가장 큰 개선은 일관성과 응집력에서 관찰되었습니다. 과정 데이터에 따르면 STEP-DWCF-R 학습자들은 과제당 평균 2.26회의 수정 라운드를 완료했으며, 오류 수가 라운드별로 선형적으로 감소했습니다. 이 결과는 AI 생성 피드백, 교사 중재, 반복적인 로봇 AI 에이전트 전달을 포함하는 통합 STEP-DWCF-R 프레임워크가 전통적인 단일 라운드 피드백보다 IELTS 작성 향상에 더 큰 영향을 미친다는 것을 시사하며, EFL 맥락에서 AI 강화 동적 피드백의 실용적 응용을 시사합니다.
서면 교정 피드백(WCF)은 L2 글쓰기 교수법에서 여전히 중심적인 역할을 합니다. 증거는 포괄적인 WCF가 시간이 지남에 따라 학습자의 정확성을 향상시키며, 교실 실천과 조화를 이루면 실제 맥락에서 실현 가능한 집중적 접근법과 공존할 수 있음을보여줍니다. 1, 2, 3. 최근 교실 연구들은 지속적이고 포괄적인 WCF를 통해 정확성과 유창성에서 지속적인 향상이 있음을 보여줍니다. 피드백 범위에 관한 연구는 교사들이 모든 것을 4,5,6,7,8,9에 표시하기보다는 전략적으로 형태를 타겟팅해야 한다고 경고합니다. 동시에 자동 작성 평가(AWE)와 자동 서면 수정 피드백(AWCF)도 빠르게 성장했습니다. 결과는 엇갈립니다: 일부 연구는 AWCF나 Criterion 스타일 프로그램에서 과제 성취도와 문법 범위 향상을 보인 반면, 다른 연구들은 교사 전용 피드백에 비해 유의미한 이점이 없거나 주로 지역적이고 표면적인 수정만 주목합니다. 이러한 이질성을 반영하기 위해, 우리는단일 출처에 의존하지 않고 여러 AWCF 연구를 삼각측량하는 방식을 의도적으로 적용했습니다.
학습자들이 누가 피드백을 제공하는지에 대한 믿음도 중요하다. 인지된 출처에 대한 준실험적 연구는 동일한 피드백을 '교사'와 '자동화'로 구분할 때 성과 신뢰가 달라질 수 있음을 보여주며, 이는 AWCF 설계에서 인식 효과를 고려해야 할 필요성을 강조한다. 이 경계를 확장하면, 최근 연구들은 교육 로봇이 구현된 존재감 때문에 피드백 제공자로서도 역할을 할 수 있으며, 학습자의 참여와 신뢰에독특한 방식으로 영향을 미칠 수 있음을 시사합니다.
보완적인 연구 분야인 동적 서면 교정 피드백(DWCF)은 빈번하고 관리 가능하며 포괄적인 피드백 사이클과 코딩, 빠른 수정을 강조합니다. 여러 환경에서의 증거는 DWCF가 정확도를 신뢰성 있게 향상시키는 것으로 나타났으며(빈도 효과는 유창성에 영향을 미치지만), 결과는 강의 목표와 학습자 집단에 따라 다를 수 있습니다.17, 18, 19, 20. 마지막으로, 생성형 AI 매개 피드백에 관한 초기 연구에서는 명시적 메탈언어학적 지침과 결합할 때 작성 결과와 잠재적 이점에 있어 교사 피드백과 동등함을 보고하며, L2 맥락에서 인간과 AI 피드백의 긴밀한 통합을 촉진합니다21,22.
이러한 도전을 해결하기 위해, 우리는 STEP-DWCF-R(Structured, Tiered, Evidence-driven Process for Dynamic Written Correctionive Feedback with Robotic AI Agent) 프레임워크를 제안하는데, 이는 구조적이고 반복적이며 프로세스 지향적인 글쓰기 지원을 제공하는 새로운 다단계 DWCF 피드백 시스템입니다. 우리 시스템은 대형 언어 모델(LLM)의 예측 및 생성 능력을 활용하여, 로봇 AI 에이전트 인터페이스와 교사 중재를 통해 복잡한 글쓰기 문제를 관리 가능한 범주로 세분화하고, 여러 차례의 상호작용을 통해 피드백을 제공하며, 결과 기반 및 프로세스 기반 지표를 모두 사용하여 효과를 평가합니다. 피드백을 구조적이고 상호작용적인 프로세스로 전환함으로써, STEP-DWCF-R은 자동 작성 지원을 정적 오류 수정에서 보다 몰입감 있고 구현적이며 학습 지향적인 시스템으로 발전시킵니다.
우리의 기여는 세 가지 통합적 진보에 집중되어 있습니다. 첫째, 우리는 오류(예: 문법, 일관성)를 분류하는 구조화된 피드백 표현 스키마를 제안하여, 로봇 AI 에이전트가 전달하는 LLM 피드백이 실행 가능하고 교육적으로도 해석 가능하도록 합니다. 둘째, 언어, 구조, 추론을 여러 라운드에 걸쳐 피드백을 순서화하는 반복적 다단계 프로세스를 도입하여 인지 부담을 줄이고 참여를 심화시킵니다. 셋째, 평가를 점수 후 평가를 넘어 오류 감소 및 피드백 채택과 같은 프로세스 중심 지표를 포함하여 학습 영향에 대한 더 풍부한 시각을 제공합니다. WCF 프레임워크는 교육 기술 내에서 서면 교정 피드백을 체계화하려는 가장 초기 시도를 대표합니다. 자동 글쓰기 평가(AWE)와 자동 에세이 채점(AES)에서 시작된 이 시스템들은 오류 발견과 숙련도 점수(13, 14)를 강조했습니다. 그들의 기여는 확장성에 있습니다: 수천 명의 학습자가 인간의 채점이라는 병목 없이 피드백을 받을 수 있습니다. 하지만 이러한 프레임워크는 문법 검사, 어휘 제안, 또는 학습자가 의미 있는 수정으로 변환하는 데 어려움을 겪는 정적이고 단편적인 댓글을 제공했습니다23, 24, 25, 26.
시간이 흐르면서 WCF 연구는 기술 매개 접근법을 포함하는 방향으로 진화했습니다. 이러한 새로운 시스템들은 계산 방법을 활용하여 글쓰기의 더 넓은 측면을 포착하고자 했습니다13,21. 최근에는 구현 기술의 발전으로 교육 로봇이 글쓰기나 튜터링 환경에서 피드백 제공자 역할을 하기 시작하면서 그 범위가 더욱 확장되었습니다. 이들의 물리적 존재와 상호작용적 기능은 신뢰, 참여, 학습자 동기의 새로운 역학을 도입합니다. 그럼에도 불구하고 WCF의 지배적인 방향성은결과 중심으로 남아 있습니다. 8,27: 점수 생성이나 단발성 댓글을 한 번에 작성하는 방식입니다. 교육학적으로 이러한 지향은 형성 평가와 맞지 않으며, 피드백은 초안 전반에 걸쳐 수정을 지원하고 메타인지 참여를 지원해야 한다 16,28,29,30,31. 따라서 WCF의 개념적 경계는 지속적인 간극을 드러냅니다: 피드백은 제공되지만 학습 과정을 안내하기 위해 구조화되거나 순서화되지 않습니다.
이러한 한계에 대응하여 학자들은 피드백 작성에 대한 보다 역동적인 접근법을 탐구하기 시작했습니다. 초기 조사에서는 학습자들이 여러 차례 반복적으로 복습하는 반복적 피드백 사이클의 중요성을 강조했습니다17,32. 구조화된 오류 분류도 피드백의 해석 가능성을 개선하고 교육적 목표와 일치시키기 위해 제안되었습니다33,34. DWCF 프레임워크라는 개념은 명시적 오류 스키마, 단계적 및 반복적 전달, 프로세스 지향적 평가 지표라는 세 가지 설계 원칙을 내재함으로써 이러한 방향을 통합합니다19,35. 한꺼번에 많은 수정으로 학생들을 압도하는 대신, DWCF는 표면적 정확성, 구조적 일관성, 논증적 깊이 등 여러 층에 걸쳐 집중을 분산시켜17, 33라운드를 연속적으로 진행합니다. 평가는 최종 점수를 넘어 오류 감소율, 피드백 채택, 수정 깊이10, 19, 25와 같은 프로세스 지표까지 확장됩니다. 가능성에도 불구하고 DWCF의 실용적 응용은 여전히 드물며, 대부분의 연구는 대규모 기술 매개 맥락에서 실제로 적용하지 못하고 있습니다10, 36, 37. 이 격차는 DWCF를 이론화할 뿐만 아니라 실제 교육 환경에서 그 실현 가능성을 입증하는 프레임워크의 필요성을 강조합니다. 그림 1은 문헌에서 제안된 DWCF의 더 넓은 이론적 틀을 보여줍니다. 도표는 동적 서면 교정 피드백이 여러 수준에서 어떻게 작동할 수 있는지에 대한 일반적인 근거를 제시합니다. 여기에는 측정된 결과(예: 정확성, 일관성)와 본 연구에서 이론적으로 제시되었으나 측정되지 않은 구성요소들(예: 글쓰기 불안 감소, 유창성, 복잡성)이 포함됩니다. 이 실험의 직접적인 모델이 아니라 이론적 방향을 위해 포함되었습니다. 여기서 분석하는 결과 및 프로세스 지표에 해당하는 요소들은 그림에 표시되어 있습니다; 다른 경로들은 예시적이며, 본 연구에서는 평가되지 않았습니다.
LLM과 멀티모달 시스템의 등장은 DWCF를 대규모로 운영할 수 있는 강력한 수단을 제공합니다. LLM은 제로 샷과 소수 샷 기능을 통해 과제별 훈련 없이도 상황에 민감한 피드백을 생성할 수 있습니다21,22. 최근 실험들은 지시적 분할, 단계적 정제, 설명 생성 가능성을 시사하며, 이는 DWCF13, 37, 38, 39의 원칙과 밀접하게 일치합니다. 인간-AI 협업에 관한 보완 연구들은 AI 피드백에 상호작용하고 적응하며 선택적으로 채택하는 반복적 루프가 수용 및 수정 품질을 모두 향상시킬 수 있음을 보여주었습니다25,30. 이러한 과정이 로봇을 통해 구현될 때, 상호작용은 제스처, 목소리, 존재감을 결합하는 멀티모달(multimodal)로 이론적으로 발전할 잠재력을 가지며, 학습자의 인식과 동기를 더욱 향상시킬 수 있습니다40.
근접 발달 영역(ZPD)41, 입력 가설42, 기술 습득 이론43에 기반하여 STEP-DWCF-R을 학습자 지원, 입력 처리, 기술 개발을 연결하는 컨트롤러로 위치시킵니다. 구체적으로, 루브릭 연동 항목화, 적시에 통합된 목록, 그리고 다라운드 교사가 관리하는 AI–인간–로봇 사이클은 복습을 중재하고 여기서 분석하는 관찰 가능한 종점(IELTS Overall 및 TR/CC/LR/GRA; 라운드, 수용, 지속적 오류, 시간)을 도출하는 통합 계층에서 작동합니다. 글쓰기 불안 감소와 같은 개념들은 이론화되었으나 이 실험에서는 측정되지 않았습니다.
이 프로토콜은 상라오 유치원 교육 대학 초등교육부 윤리 위원회의 승인을 받았습니다. 모든 참가자는 성인(≥18세)이며, 연구 전에 서면 동의서를 제공하였습니다.
1. 연구 설계
참고: EFL 교실 수량(총 등록 인원 N = 32명)의 제약으로 인해 참가자들은 각각 16명씩 두 그룹으로 무작위로 배정되었습니다. 이 표본 크기는 소규모였으나, 피험자 내 사전 설계와 이전 DWCF 연구(17, 18, 19, 20)를 바탕으로 예상되는 큰 효과 크기를 고려할 때 시범 조사에 충분하다고 판단되었습니다.
2. 글쓰기 과제
3. 피드백 워크플로우
4. 결과 측정
5. 공정 측정
6. 데이터 분석
7. 코드 이용 가능
STEP-DWCF-R 시스템을 재현하는 데 필요한 모든 코드, 프롬프트, JSON 스키마 및 예제 구현 파일은 https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback 에서 공개적으로 제공됩니다.
실험 및 분석
32명의 학습자 전원이 기초 데이터를 제공했습니다. 각 그룹에서 16명의 학습자(WCF 및 STEP-DWCF-R; 그림 2). 연구 일정과 측정 지표는 그림 3에 제시되어 있으며, 종단 간 피드백 워크플로우는 그림 4에 나타났습니다. 우리 AI 시스템의 실험 설정 및 구현 매개변수는 표 1에 나와 있습니다. 분석은 사전 정해진 계획에 따라 의도 치료 계획에 따라 진행되었습니다. 먼저 기저선 동등성을 평가하고(표 2), 주요 결과(그림 5 및 표 3)를 보고한 뒤, 견고성 및 신뢰도 검사를 포함한 부차 결과(표 4)를 보고합니다.
기준 등가
기준선(1주차)에서 그룹들은 사전 지정된 공변량, 인구통계학 및 IELTS 작성 성과(피드백 전)에서 기술적으로 유사했습니다(표 2). 개별 IELTS 구성 요소 점수는 0.5 밴드 단계로 부여되며, 표는 그룹 평균을 보고합니다. 1주차 전체 평균(WCF = 5.625, STEP-DWCF-R = 5.500)은 그림 5를 생성하는 데 사용된 동일한 배열에서 계산됩니다. 우리는 기초검사에서 가설 검정을 수행하지 않습니다; 잔여 불균형은 사전 사후 설계와 혼합 효과 모델의 그룹 × 시간 항으로 해결되며, 기저선을 반영한 사후 비교는 프로토콜 섹션에 보고됩니다.
주요 결과
그림 5 는 사전 사후 변경 사항을 요약한 것이고, 표 3 과 표 5 는 모델 추정치와 시험 후 달성 결과를 보여줍니다. 기저선(1주차)에서 그룹 평균은 WCF가 5.625, STEP-DWCF-R이 5.500으로, 그룹 차이는 −0.125 밴드(SE = 0.133, t = − .939, df = 29.90, p = .355, 95% CI [−0.397, 0.147])였습니다. 따라서 표 3의 기준선은 WCF 1주차 평균을 5.625로 추정하며, 95% 신뢰구간(CI [5.419, 5.831])(SE = 0.097, df = 15)을 추정합니다. 1주차부터 8주차까지 WCF는 0.3125 밴드 개선되었습니다(SE = 0.128, t = 2.44, df = 15, p = .028, 95% 신뢰구간[0.039, 0.586]; 표준화 그룹 내 효과 dz = 0.61). STEP-DWCF-R은 1.0313 밴드 개선(SE = 0.140, t = 7.34, df = 15, p = 2.44 × 10−6, 95% 신뢰 [0.732, 1.331]; dz = 1.84) 개선). 그룹 × 시간 상호작용, 즉 차이 간 차이의 선형 혼합 효과 대비는 0.7188 밴드였다(SE = 0.190, t = 3.78, df = 29.75, p = .0007, 95% 신뢰구간 [0.330, 1.107]; 표 3), 이는 STEP-DWCF-R 하에서 더 큰 상승을 나타냅니다. 검사 후(8주차) 기준으로 추정 한계 평균은 STEP-DWCF-R에 0.5938 밴드를 더 선호했습니다(그룹 평균에 대한 웰치 검정: SE = 0.115, t = 5.16, df = 29.74, p = 1.50 × 10⁻⁵, 95% 신뢰구간 [0.359, 0.829]). 이와 일치하게, 성취도 표(표 5)는 8주차에 WCF 학습자의 13%가 전체 ≥ 6.5에 도달했고 0%가 7.0에 ≥도달했던 반면(2/16 및 0/16 집계), 반면 STEP-DWCF-R 학습≥자의 81%는 6.5, 25%가 7.0 ≥ 도달했습니다(13/16 및 4/16). 표 3은 해당 고정 효과 추정치와 그 불확실성을 보고합니다.
차원 단계 결과
표 4는 네 가지 작업 2 차원에 걸친 사전 사후 변경 사항을 요약합니다. 과제 반응(TR)은 WCF 하에서 Δ = 0.25 밴드, STEP-DWCF-R 하에서는 Δ = 0.95 밴드의 이득을 보였으며, ΔΔ = 0.70, 95% 신뢰구간(CI [0.28, 1.12]), Holm 조정 p = 0.006을 나타냈다. 일관성과 응집력(CC)이 가장 큰 대조를 보였다: WCF Δ = 0.30, STEP-DWCF-R Δ = 1.15, 따라서 ΔΔ = 0.85 (95% CI [0.44, 1.26], adj-p = .002). 어휘 자원(LR)도 WCF Δ = 0.35, STEP-DWCF-R Δ = 0.95로 동일한 패턴을 보였으며, ΔΔ = 0.60 (95% 신뢰구간[0.18, 1.02], adj-p = .012)를 얻었다. 문법 범위 및 정확성(GRA)은 WCF에서 Δ = 0.25, STEP-DWCF-R에서 Δ = 0.97 향상되었습니다; 결과적으로 ΔΔ = 0.72는 95% 신뢰구간이 [0.31, 1.13]이고 adj-p = .004를 가졌다. 네 차원 모두에서 그룹×시간 대조는 Holm–Bonferroni 조정 후 STEP-DWCF-R에 유리하게 작용했다.
과정 증거
그림 6 과 그림 7 은 핵심 프로세스 결과를 시각화합니다. 2주차부터 7주차까지 STEP-DWCF-R은 작업당 평균 2.26회의 수정 라운드(95% CI [2.17, 2.35]; n = 96)를 완료한 반면, WCF는 모든 과제에 대해 1.00회의 수정 라운드(n = 96)를 완료했습니다. 평균 차이는 1.26 라운드(95% 신뢰구간 [1.17, 1.35])였으며; Mann–Whitney 검정은 분포의 분리를 확인했다(U = 9216, z = 11.97, p < 10⁻³0). STEP-DWCF-R 내에서 평균 오차 수는 라운드별로 감소했습니다: 1라운드 13.78 (95% CI [13.02, 14.54]; n = 96), 2라운드 8.94 (95% CI [8.42, 9.46]; n = 96), 3라운드 6.16 (95% CI [5.20, 7.12]; n = 25). 각 라운드별 관측에 적합된 선형 추세는 라운드당 4.14개의 오차 감소를 추정했다(절대 크기 기준 95% CI [3.51, 4.78]; p < 10−12). 피드백 수용 및 과제 수행 시간 측정은 그림 6 과 그림 7 에 인코딩되어 있지 않아 표 7에 보고됩니다.
신뢰성과 견고성
1주차와 8주차 에세이에 대한 평가자 간 합의는 좋거나 훌륭했습니다. 두 명의 훈련된 평가자가 모든 스크립트를 독립적으로 채점했으며, 그룹과 시간에 대해 눈가림이 보장되었습니다; 평가자 평균에 대한 평균 계급 내 상관계수(ICC[2,2])를 사용하면, 신뢰도는 전체와 네 차원 전반에서 0.86–0.93 사이였으며, 모든 하위 95% 신뢰 범위는 0.80을 초과하였습니다(표 6). 주요 혼합 효과 모델의 진단 검사는 물질적 이변성 없이 대략 정상 잔차를 보였으며, 작업 수준 과정 요약에 적합된 모델은 분산이 거의 1에 근접하는 것으로 나타났다. 동일한 1주차/8주차 데이터셋을 기반으로 한 민감도 분석은 일관된 추론을 도출했습니다: 검사 후 그룹을 비교하고 기준선 점수를 조정한 선형 회귀분석에서는 8주차에 그룹 간 차이가 0.575 밴드(95% CI [0.336, 0.814], p = 3.15 × 10⁻⁻)로 추정되었으며, 평가자에 대한 무작위 효과를 포함하고 평균되지 않은 점수를 사용한 평가자별 혼합 모델을 통해 그룹 × 시간 추정치는 0.72 밴드(95% 신뢰구간[0.33], 1.11], p = .0007), 표 3과 일치합니다. 견고한 표준오차를 사용했을 때와 전체 사례로 제한된 분석에서도 결과는 변하지 않아, STEP-DWCF-R이 WCF보다 더 큰 사전 포스트 이득을 낸다는 결론을 강화하였다.
질적 연구 결과
정성적 분석을 위해 STEP-DWCF-R 수정 추적 6개 과제 전반에 걸쳐 검토되었으며, STEP-DWCF-R 그룹 16명의 참가자들의 수업 종료 후 서면 성찰을 검토하였습니다. 두 명의 코더가 네 가지 피드백 범주(문법, 어휘, 조직, 추론)와 이해 논리를 기반으로 한 집중 연역적 프레임워크를 사용해 독립적으로 자료를 코딩했습니다. 코더 간 합의는 상당했으며, 코헨의 카파는 0.78이었고, 의견 차이는 토론을 통해 해결되었다.
분석에서는 다섯 가지 주요 주제가 드러났습니다: 학습자는 단계적 패턴을 따르며, 학습자는 표면적 특징을 해결한 후 조직과 추론에 접근했습니다; 스팬 특화, 루브릭 연계 문항이 서술적 제안보다 더 실행 가능하고 자주 채택되었고; AI와 교사의 상호보완성은 우선순위를 형성했으며, 겹치는 신호들은 집중을 높이고 교사의 중재가 갈등을 해결합니다; 새로운 프롬프트에서 조직 템플릿과 어휘 패턴의 재사용이 기록되면서 효과가 일찍 정점에 달했습니다; 학습자들은 과제 전반에 걸쳐 전략을 조정했습니다. 이러한 주제들은 과정 증거 섹션에서 탐구하는 과정 역학에 영향을 미칩니다. 피드백 수용률, 지속적인 오류, 작업 수행 시간 측정도 기록되었습니다. 이러한 추가 프로세스 지표들의 요약은 표 7에 제시되어 있습니다.
대표 결과 해석
결과 및 과정 데이터를 종합해 보면, STEP-DWCF-R 프레임워크는 전통적인 단일 라운드 피드백보다 더 큰 IELTS 작성 향상과 연관되어 있습니다. 주요 결과는 그룹 간 차이 차이가 0.72 밴드로 나타났으며, STEP-DWCF-R 그룹은 WCF 그룹의 0.31 밴드에 비해 전체 1.03 밴드 개선되었습니다. 이 이점은 네 가지 분석 차원 모두에서 일관되었으며, 일관성과 응집력에서 가장 큰 차이가 0.85 밴드로 나타나, 구조적이고 루브릭 연동의 다단계 피드백이 특히 조직 발전을 스캐폴딩했음을 시사합니다. 프로세스 증거는 반복적 참여가 이 이점의 근간임을 더욱 보여줍니다. STEP-DWCF-R 학습자는 과제당 평균 2.26회의 수정 라운드를 완료했으며, 오류 수는 라운드당 약 4.1건씩 선형적으로 감소했습니다. 예를 들어, 대표적인 워크플로우 주기에는 GPT-5가 네 가지 범주에 걸쳐 구조화된 JSON 피드백을 생성하고, 교사가 거짓 양성을 제거하고 실행 가능성을 높이기 위한 중재를 진행했으며, 이후 로봇 AI 에이전트 인터페이스를 통한 다중 라운드 학습자 수정이 포함되었습니다. 이 결과들은 AI 생성 피드백, 교사 중재, 반복적 로봇 AI 에이전트 전달을 결합한 통합 다구성 워크플로우의 실현 가능성과 잠재적 효과를 지지하지만, 단일 구성 요소의 고립된 증거로 해석되어서는 안 됩니다. 2–3라운드와 1라운드의 용량 불균형, 그리고 32개의 적은 표본 크기는 관찰된 증가가 수정 기회 증가와 구조화된 피드백의 복합적 효과를 반영함을 의미합니다. 이 결과들은 더 큰 구성 요소 대조 시험에서 확인을 기다리는 유망한 파일럿 증거로 간주되어야 합니다.

그림 1. DWCF(동적 서면 교정 피드백)의 이론적 틀. 이 도표는 DWCF가 운영될 수 있는 더 넓은 근거를 제공합니다; 이 실험의 직접적인 모델이 아니라 오리엔테이션을 위해 포함되었습니다. 여기서 분석하는 결과 및 프로세스 지표에 해당하는 요소들은 그림에 표시되어 있습니다; 다른 경로들은 예시적이지만 평가되지 않았습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 2. 참가자들의 CONSORT 흐름도. 32명의 학습자가 자격 평가를 받았으며; 아무도 제외되지 않았다. 모든 참가자는 동의를 제공한 후 WCF 그룹(n = 16) 또는 DWCF 그룹(n = 16) 중 하나로 1:1 비율로 무작위 배분되었습니다. 모든 무작위 참가자는 배정된 개입을 받았으며; 추적 관찰이나 중단으로 인한 손실은 없었으며, 32명 모두 최종 분석에 포함되었습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 3. 타임라인과 측정 지표를 연구하세요. 시험은 8주간 진행되었으며, W1 시점에 참가자들은 기초 IELTS 과제 2를 완료하고 점수를 매겼습니다; W2부터 W7까지 주간 6개의 글쓰기 과제가 주행되었으며(과제 1–과제 6), 각 과제 후 그룹별 피드백(WCF 또는 DWCF)과 수정이 이루어졌습니다. 수정 라운드, 피드백 수용, 지속적 오류율, 작업 수행 시간 등 프로세스 측정 지표가 W2부터 W7 기간 동안 각 작업에 대해 기록되었습니다. W8 시험에서는 사후 IELTS 과제 2가 실시되어 채점되었습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 4. 엔드 투 엔드 피드백 워크플로우. 학습자들은 감독 하에 초안을 작성한 후 그룹별 피드백을 받습니다: WCF(인간 피드백 1라운드) 또는 STEP-DWCF-R(교사가 진행하는 AI 생성 피드백, 로봇 AI 에이전트를 통해 2–3차례 반복 라운드로 제공됩니다). 학습자들은 이에 따라 복습 라운드를 완료합니다. 결과는 IELTS Task 2 밴드 점수입니다; 프로세스 측정에는 라운드 수, 피드백 수용(채택/수정/거부), 지속적 오류율, 작업 수행 시간이 포함됩니다. 시스템은 아이템 레벨 ID, 카테고리/심각도, 출처(AI vs. 인간 vs. 로봇), 관리 조치, 그리고 가입 상태를 기록합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 5. 1주차부터 8주차까지 IELTS 전체 밴드 변동 점수는 95% 신뢰구간을 포함한 추정 그룹 평균을 제공하며, 경로는 STEP-DWCF-R 하에서 더 큰 상승을 나타냅니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.

그림 6. 그룹별 과제별 복습 라운드(2주차–7주차). 데이터 포인트는 WCF(파란색)와 STEP-DWCF-R(주황색) 그룹의 개별 작업 수정 라운드를 나타냅니다. 가로선과 오차 막대는 95% 신뢰구간을 가진 그룹 평균을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 7. STEP-DWCF-R 내에서 95% CI로 라운드당 평균 오차 수가 계산됩니다. 포인트는 각 피드백 라운드(1라운드, 2라운드, 3라운드)에서의 평균 오차 수를 나타내며, 세로선은 95% 신뢰구간(CI)을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
| 구성 요소 | 사양 |
| 하드웨어 | 12세대 인텔(R) 코어(TM) i7-12700H (2.30 GHz), 32GB 램, NVIDIA RTX 3080Ti GPU (16GB) 탑재 PC |
| 운영 체제 | 윈도우 11 |
| 백엔드 | Flask~2.1 (Python~3.10) |
| 프론트엔드 | Jinja2 서버 렌더링 템플릿 |
| AI 모델 | OpenAI GPT-5 API (피드백 생성용), 스키마 기반 후처리 |
| 피드백 스케줄러 | 다단계 피드백을 관리하는 커스텀 컨트롤러 (3 사이클) |
| 오류 스키마 | 문법, 어휘, 조직, 추론 |
| 버전 관리 | 깃허브 |
| 벌목 | 제출, 피드백 및 분석을 위한 수정 자동 기록 |
표 1: 실험 설정 및 구현 매개변수. 하드웨어 구성, 운영체제, 백엔드 및 프론트엔드 프레임워크, AI 모델 설정, 피드백 스케줄러, 오류 스키마 분류, 버전 관리, 로깅 인프라를 포함한 AI 피드백 시스템의 기술 사양.
| 가변 | WCF (n=16) | STEP-DWCF-R (n=16) |
| 나이(연수), 평균 (SD) | 20.9 (1.5) | 21.1 (1.6) |
| 여성, n(%) | 9 (56%) | 8 (50%) |
| 이전 IELTS 준비 (예), n(%) | 7 (44%) | 6 (38%) |
| 이전 글쓰기 지도 수년간 | 3.1 (1.2) | 3.2 (1.1) |
| 기본 IELTS 전체 (밴드) | 5.625 (0.387) | 5.500 (0.365) |
| 베이스라인 TR (밴드) | 5.56 (0.50) | 5.50 (0.50) |
| 기본 CC (밴드) | 5.62 (0.49) | 5.53 (0.49) |
| 기본 LR (밴드) | 5.60 (0.46) | 5.52 (0.46) |
| 베이스라인 GRA (밴드) | 5.56 (0.48) | 5.49 (0.45) |
표 2: 그룹별 참가자의 기초 특성 (1주차). 인구통계학적 변수 및 국제 영어 언어 시험 시스템(IELTS) 작업 2 작성 성과를 WCF 및 STEP-DWCF-R 그룹에 적용했습니다. 값은 평균(표준편차) 또는 n(%)입니다.
| 고정 효과 | 추정치 | SE | DF | t | p | 신뢰감시구간(95%) |
| 인터셉트 (WCF, 주간~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| 그룹 (STEP-DWCF-R 대 WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| 시간 (주~8 vs. 주~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| 그룹 × 타임 | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
표 3: 1주차/8주차 IELTS 전체 밴드 점수에 대한 선형 혼합 효과 모델. 고정 효과 추정치, 표준오차(SE), 자유도(df), t-값, p-값, 95% 신뢰구간(CI)을 포함해 그룹 × 상호작용 및 모델 용어를 포함합니다.
| 치수 | WCF Δ (밴드) | STEP-DWCF-R Δ (밴드) | ΔΔ (95% CI) | 동정칭-P |
| 작업 반응(Task Response, TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| 일관성과 응집력 (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| 어휘 자원(LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| 문법 범위와 정확성 (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
표 4: 차원 수준 결과 (과제 2): 사후 변경 및 그룹 간 차이. 과제 반응(TR), 일관성 및 응집력(CC), 어휘 자원(LR), 문법 범위 및 정확도(GRA)에 대한 95% 신뢰구간(CI)과 홀름 조정 p-값을 포함한 사전 사후 변화(Δ)와 차이 차이(ΔΔ)를 포함합니다.
| 임계값 | WCF (%) | STEP-DWCF-R (%) |
| 전체 ≥ 6.5 | 13 | 81 |
| 전체 ≥ 7.0 | 0 | 25 |
표 5: 테스트 밴드 획득 후 (8주차). WCF 및 STEP-DWCF-R 그룹 학습자 중 IELTS 전체 밴드 점수 기준이 최소 6.5에서 7.0 이상인 비율.
| 결과 | ICC | 신뢰감시구간(95%) |
| 전반 | 0.91 | [0.86, 0.94] |
| 작업 반응(Task Response, TR) | 0.88 | [0.82, 0.92] |
| 일관성과 응집력 (CC) | 0.9 | [0.85, 0.94] |
| 어휘 자원(LR) | 0.89 | [0.83, 0.93] |
| 문법 범위와 정확성 (GRA) | 0.87 | [0.80, 0.91] |
표 6: IELTS 결과에 대한 평가자 간 신뢰도. N = 64편의 에세이(1주차와 8주차 합쳐) 두 명의 블라인드 평가자가 참여했습니다. 평균 측정 내 상관계수(ICC[2,2])와 95% 신뢰구간(CI)을 전체 및 차원 점수에 적용합니다.
| 측정 | WCF 그룹 | STEP-DWCF-R 그룹 |
| 작업별 수정 라운드 | 1 | 2.26 |
| 피드백 수용률(채택 또는 수정, %) | 68.5 | 82.3 |
| 최종 라운드 이후 지속적 오류율 (%) | 67.4 | 45.6 |
| 교사 관리 시간 (작업당 최소 시간) | 23.5 | 13.8 |
| AI 에이전트 전달 시간 (작업당 최소 시간) | — | 3.9 |
| 학습자 복습 시간 (작업당 최소 시간) | 44.8 | 71.2 |
| 피드백 + 수정 총 시간 (최소 시간/작업) | 68.3 | 88.9 |
표 7: 96개 작업(6개 작업 × 16명의 학습자)에 걸친 평균. 피드백 포인트 수준에서 수용률과 지속적 오류율을 계산했습니다. 시간 측정은 교사 기록과 시스템 타임스탬프를 통해 기록되었습니다. AI 에이전트 전달 시간은 WCF 그룹에 적용되지 않습니다.
이 연구는 로봇 AI 에이전트와 다성분 동적 동적 수정 피드백 프레임워크인 STEP-DWCF-R, 그리고 8주간의 IELTS 작문 과정에서 단일 라운드 WCF를 비교했습니다. STEP-DWCF-R은 전체 대역과 TR, CC, LR, GRA 전반에서 더 큰 프리-포스트 이득을 보였습니다. STEP-DWCF-R 학습자들은 더 많은 수정 라운드를 완료했고, 모델이 한 라운드당 약 4.1건의 오류 감소를 추정하는 등 더 빠른 오류 감소를 보였습니다. 가장 큰 개선은 일관성과 응집력(ΔΔ = 0.85)에서 나타났으며, 이는 구조화된 루브릭 연계 피드백이 높은 수준의 조직성과 정확성을 촉진함을 나타냅니다. 이 결과는 반복적이고 포괄적인 피드백이 시간이 지남에 따라 글쓰기 정확도를 향상시킨다는 이전 DWCF 연구와 일치합니다14, 15, 16, 17.
STEP-DWCF-R 워크플로우는 세 가지 중요한 단계를 포함합니다. 첫째, AI 시스템은 제한된 JSON 스키마와 표준화된 시스템 프롬프트를 사용하여 네 가지 범주(문법, 어휘, 조직, 추론)에 걸쳐 항목별 피드백을 생성합니다. 둘째, 교사는 오탐을 제거하고, IELTS 루브릭에 부합하는 중요한 문제를 추가하며, 실행 가능하고 격려 가능한 표현을 보장하고, 4가지 범주 스키마의 일관성을 유지하기 위해 출력물을 조정합니다. 이 조정 단계는 학습자를 압도할 수 있는 AI 환각이나 과도한 채점을 교정하는 주요 문제 해결 메커니즘 역할을 합니다. 특히, STEP-DWCF-R에서 교사의 작업당 조정 시간은 WCF보다 짧았으며(13.8분 대 23.5분), 이는 AI가 초기 구조화된 피드백을 생성하고 교사가 이를 조정했기 때문입니다. 셋째, 검토된 피드백은 웹 기반 로봇 AI 에이전트 인터페이스를 통해 전달되며, 학습자의 확인 응답과 재제출을 여러 라운드에 걸쳐 기록합니다.
기존 접근법과 비교할 때, STEP-DWCF-R은 뚜렷한 한계를 해결합니다. 기존의 단일 라운드 WCF는 강사 시간에 제한을 받으며 지속적인 복습 기회가 제한적입니다. 자동화된 글쓰기 평가 도구는 확장성을 제공하지만, 학습자들이 의미 있는 수정으로 번역하는 데 어려움을 겪는 정적이고 단편적인 주석을 제공하는 경우가 많습니다 20,21,22. 초기 DWCF 연구들은 다중 라운드 피드백 사이클의 효능을 입증했으나, 강사가 작성한 교정에 의존하는 점에서14, 15, 16, 17의 대규모 수업에서는 실현 가능성에 대한 우려가 제기되었습니다. 최근 생성형 AI 피드백 연구들은 글쓰기 결과에 대해 교사 피드백과 동등하지만, 구조화된 중재나 반복적 전달은 없다고 보고합니다18,19. STEP-DWCF-R은 AI 확장성과 교사 감독, 반복적인 로봇 AI 에이전트 전달을 결합하여 교사 업무 부담을 줄이고 복습 빈도를 증가시킵니다.
우리는 몇 가지 한계를 인정합니다. 비교적 작은 표본 크기(N = 32)는 우리의 연구 결과의 일반화 가능성을 제한하며, 이 연구는 파일럿 조사로 간주되어야 합니다. 두 조건은 피드백 용량이 달랐는데, WCF 그룹은 작업당 한 라운드의 피드백만 받았던 반면, STEP-DWCF-R 그룹은 2–3번의 반복 라운드를 거쳤습니다. 따라서 STEP-DWCF-R 그룹의 우수한 성능은 로봇 AI 에이전트나 그 전달 방식의 고립된 효과보다는 여러 차례 수정 주기, AI 생성 피드백, 교사 조정의 복합적 효과를 반영합니다. 로봇 AI 에이전트는 순수하게 가상 웹 기반 인터페이스이기 때문에, 그 효과는 반복 구조 자체의 효과와 분리될 수 없습니다. 다중 모달 인간 피드백(예: 말과 제스처)은 기존 EFL 글쓰기 수업에서 표준 관행이 아니며 별도의 실험 패러다임이 필요하기 때문에 통제 조건으로 포함되지 않았습니다. 향후 연구에서는 복용량 일치 대조군(예: 다중 교사 피드백)을 포함하여 이러한 구성 요소를 더욱 해소해야 합니다.
이러한 한계에도 불구하고, STEP-DWCF-R 프레임워크는 AI 지원 글쓰기 교육을 위한 실질적인 지침을 제공합니다. 모듈식 아키텍처는 대규모 EFL 과정의 학습 관리 시스템과 통합할 수 있으며, 구조화된 4가지 범주 스키마는 학술 글쓰기나 학문 분야별 장르에 맞게 조정할 수 있습니다. 향후 반복에서는 구현된 에이전트의 이론적 참여 이점을 활용하기 위한 다중 모달 전달을 탐구할 수 있지만, 현재 파일럿은 텍스트 기반 반복적 AI-교사 협업의 실현 가능성을 확립하고 있습니다. 그럼에도 불구하고, 결과 측정 지표, 프로세스 지표, 그리고 강한 평가자 간 신뢰성 전반에 걸쳐 일관된 패턴이 이 다중 구성 요소 접근법의 실현 가능성과 잠재적 효과성을 지지합니다.
저자들은 상충하는 이해관계가 없습니다.
이 연구는 말레이시아 과학대학교 브리징 보조금(프로젝트 번호: R501-LR-RND003-0000001342-0000)의 지원을 받았습니다.
```html
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 플라스크 (웹 프레임워크) | 팰릿 프로젝트 | https://flask.palletsprojects.com | 버전 2.1; 로보틱 AI 에이전트 웹 인터페이스에 사용 |
| GPT-5 API | OpenAI | https://platform.openai.com | 모델 gpt-5, temperature=0.7; 구조화된 JSON 피드백 생성용 |
| Jinja2 | 팰릿 프로젝트 | https://jinja.palletsprojects.com | 웹 인터페이스용 서버 렌더링 템플릿 |
| 파이썬 | 파이썬 소프트웨어 재단 | https://www.python.org | 버전 3.10; 백엔드 스크립팅 |
| 윈도우 11 | 마이크로소프트 | https://www.microsoft.com/windows | AI 피드백 시스템용 운영 체제 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청