$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
연구에 사용된 모든 소프트웨어와 도구는 재료표에 나열되어 있습니다.
평가 기준
본 연구에서 채택된 평가 분류는 유창성과 정확성이라는 두 가지 주요 영역을 다루며, 이는 영어 외국어(EFL) 글쓰기의 포괄적 평가에 필요한 모든 요건을 포함합니다. 이 기준들은 효과적인 의사소통과 언어 능력 발휘에 도움이 되는 글쓰기 품질의 핵심 포인트를 측정하기 위한 것입니다. 유창성 모듈은 아이디어의 부드러움과 단어 및 문장 구조의 사용도를 측정하여 글쓰기의 자연스러움, 표현력, 일관성을 측정합니다. 정확성 모듈은 정확한 문법적 정확성, 기계적 완벽함, 표준 영어 관습 준수를 목표로 하며, 가상으로는 여러 수준에서 언어의 오류를 측정하고 계산합니다. ( 표 1 참조)
작업 정의
영어를 배우는 학생들의 자동 작문 평가 조건에 따라, 본 연구는 새로운 EG 컴퓨터 지원 영어 작문 평가 시스템을 제안합니다. 자동화 작성 평가 시스템의 범위에 제한된 이전 연구들과 비교할 때, 제안된 시스템은 혁신적인 딥러닝 기법을 도입하여 사용자에게 광범위한 데이터 처리를 기반으로 한 수준의 언어 분석, 수정 범위, 시스템 전반의 피드백 분석을 가능하게 하여 이러한 한계를 해소할 것입니다. 구성의 두 가지 가장 중요한 지표인 유창성(작품이 얼마나 자연스럽고 일관되며 표현력이 풍부한지)이나 정확성(문법적, 기계적 및 언어적 오류가 많은 텍스트가 얼마나 정확하게 쓰였는지)을 신경망의 개별 구성 요소들과 함께 작동시키며, 이중 모델 시스템은 여러 평가를 수행해야 한다. 또한 여러 언어 수준에서 오류를 식별하고, 교정 조치를 권고하며, 사용자가 체계적으로 학생들의 언어 학습을 향상시킬 수 있도록 리스트 형태로 피드백을 제공합니다. 컴퓨터 지원 자동 평가 시스템 계산 과정을 설명하기 위해, 다음과 같은 수학적 모델을 (1)–(4) 공식으로 제안합니다( 표 2 참조).
(1)
(2)
(3)
(4)
여기: 최종 점수 = 종합 글쓰기 평가 점수; w1 = 유창성 점수에 할당된 가중치; w2 = 정확성 점수에 할당된 가중치; Sf = BERT 기반 유창성 점수(정규화 [0, 1]); Sc = 지수 감쇠 정확성 점수; λ = 감쇠 상수 제어 오차 페널티; σ(x) = 로지스틱 시그모이드 활성화 함수; ErrorRatio = 텍스트 내 전체 토큰 수에 대한 오류의 비율. 유창성 점수는 로지스틱 시그모이드 함수σ(x)에 의해 [0, 1]로 정규화되며, 지수 감쇠 함수는 오류 빈도에 적절한 페널티를 부과하기 위해 정확성을 평가하는 데 사용됩니다.
시스템 아키텍처 및 설계
시스템 아키텍처는 병렬 처리 아키텍처를 가진 2-모델 시스템을 사용하며, 입력 에세이 분석이 병렬 평가 경로를 통해 병렬로 수행됩니다. 유창성과 정확성 모듈은 각각 점수를 산출하며, 최종 종합 점수는 두 하위 점수의 가중 평균입니다. 정확성 모듈은 점수 산정 외에도 오류 감지 및 수정에 대한 제안도 제공합니다( 그림 1 참조).
유창성 모듈
글쓰기 유창성은 어휘의 올바른 선택, 문장 구조의 다양성, 통사의 복잡성, 일관성 등과 관련하여 언어 사용의 본질이나 패턴으로 정의할 수 있습니다. 유창성 평가 모델은 말더듬거나 어색하지 않게 전달되는 아이디어를 포착하며, 이는 토착주의적 의사소통 경향에 근접한 느낌을 줍니다. 전통적인 유창성 측정은 척도에 기반하여 평가자 간 신뢰도에 대한 우려를 부각시킵니다. 제안된 시스템은 BERT 기반 신경망을 포함해 깊은 상황적 이해를 통해 의미적 일관성과 언어적 자연성을 자동으로 유도함으로써 이 단점을 극복합니다. 이 구조적 결정은 유창성 측정에 필요한 맥락적 관계와 의미 패턴을 식별하는 데 효과적인 것으로 밝혀진 BERT의 강점을 고려하여 내려졌습니다. 입력 시퀀스는 시스템에 입력되어 12개의 트랜스포머 계층을 거치며, 다중 헤드 자기 주의를 통해 장거리 의존성과 맥락적 관계를 식별합니다( 그림 2 참조).
주의의 메커니즘은 다음과 같다:
(5)
Q, K, V를 각각 쿼리, 키, 값을 나타내는 행렬이고, d와 k를 키 벡터의 차원이라고 하자. CLS 토큰 임베딩은 전체 입력 시퀀스의 전체 의미적 일관성을 기록하는 요약 임베딩입니다.
유창성 점수 계산은 다음과 같습니다:
(6)
여기서 hCLS 는 BERT [CLS] 토큰 임베딩이고, Wreg는 회귀 헤드의 매개변수 breg 이며, σ는 출력을 [0, 1]으로 정규화하는 시그모이드 활성화 함수입니다.
정확성 모듈
정확성 평가는 문법적 정확성, 기계적 정확성, 표준 영어 관습 준수에 중점을 둡니다. 이 차원은 문법, 형태론, 구두점, 맞춤법 정확성 등 글쓰기의 기술적 측면을 다룹니다. 정확성 요소는 언어적 오류 수뿐만 아니라 텍스트 전체의 품질에 미치는 영향도 살펴봅니다. 의미적 일관성과 자연스러운 흐름을 강조하는 유창성 평가와 달리, 정확성 평가 모듈은 정확한 오류 식별과 체계적인 수정이 필요합니다. 이 모듈은 다양한 오류 유형을 구분하고, 심각도를 평가하며, 학습 개선을 지원하기 위한 목표 교정을 제공합니다. 정확성 손실은 문법 오류 발견 및 수정을 위해 미세 조정된 FLAN-T5 모델을 사용합니다. 이 선택은 T5의 텍스트 간 변환 가능성에 의해 결정되었으며, 이는 시스템이 결함을 찾는 것뿐만 아니라 한 시스템 내에서 관련 수정도 수행할 수 있게 합니다. 이 시스템은 인코더-디코더 형태이며, 텍스트는 이 변환 형태로 입력됩니다: ( 그림 3 참조)
(7)
인코더 요소는 문법적 경향뿐만 아니라 잠재적 실패 영역도 포착하는 문맥 민감 표현을 생성합니다:
(8)
잘못 식별된 오류에 대해 적절한 문법 변형을 생성하는 도움으로, 디코더는 수정된 시퀀스를 생성합니다:
(9)
이러한 양방향 처리 방식은 오류가 발생하는 맥락과 그 맥락을 어떻게 수정해야 하는지를 인지하여 힌트가 의미적으로 일관되게 하면서도 문법 교정에 집중할 수 있게 합니다.
오류 정량화 및 점수 계산 알고리즘
정확성 점수는 원문과 올바른 글씨를 비교했으며, 언어적 오류와 텍스트 내 위치, 의미 간섭에 따른 심각성을 고려한 것이다. 이 방법은 오류 유형별 구분과 텍스트 이해에 미치는 영향을 비교하여 포착합니다. 오류 빈도와 텍스트 품질 저하의 관계는 채점 시스템에서 로그 방식으로 강조되었습니다. 원본 텍스트와 수정된 텍스트의 토큰 비교에서 기본적인 단계는 문자열 정렬의 비트 단위 기법에 기반한 두 단계의 비교입니다. 두 번째 단계는 문법적 오류(주어-동사 일치, 시제 일관성, 통사 구조 신뢰성), 기계적 오류(대문자 사용, 구두점, 맞춤법), 용법 오류(단어 선택, 관용구, 어체 적합성) 오류를 구분하는 알려진 언어학적 분류법을 바탕으로 오류 유형을 식별하고 분류하는 것입니다. 세 번째 단계는 전체 텍스트 길이를 바탕으로 오류 비율을 계산하는 것입니다. 네 번째 단계는 오류 비율을 직접 해석 가능한 정확성 점수로 변환하여 오류 빈도와 텍스트 품질 간의 비가산 및 비선형 의존성을 근사하는 지수 감쇠 점수 알고리즘을 활용합니다.
오류 정량화 과정의 수학적 처리는 설치된 오류의 비율을 계산하는 것에서 시작되며, 이를 통해 정규화된 오류 설치 비율을 제공하고, 이를 통해 서로 다른 길이의 텍스트를 공정하게 비교할 수 있습니다:
(10)
(11)
이 보정 매개변수는 경험적 기준으로 2.5로 확립되었으며, 이는 인간의 전문가 판단으로 완전히 검증된 결과로, 점수 함수가 오류 빈도가 증가함에 따라 텍스트 품질 저하와 관련하여 인간의 이해에 부합하는 결과를 제공할 수 있도록 했습니다. 이렇게 매개변수 값을 설정하면 오류율이 낮은 텍스트(Error_Ratio < 0.1)는 표준 영어 규칙을 충실히 따르기 때문에 높은 정확성 점수를 받고, 중간 정도의 오류율(0.1 < Error_Ratio ≤ 0.3)인 텍스트는 중간 정도의 정확성 점수를 받아 언어적 문제점이 있지만 명백히 치명적이지는 않음을 나타냅니다. 그리고 오류율이 높은 텍스트(Error_Ratio > 0.3)는 이해 가능성에 큰 영향을 미치는 중요한 언어적 문제들 때문에 낮은 정확성 점수를 받았습니다.
정답성 평가를 위한 정확도 점수 알고리즘은 T5 기반 시스템이 발견하고 수정한 모든 오류를 최종 오류율 계산 시 벌점 항목으로 체계적으로 고려합니다. 문법 오류에 대한 벌점 메커니즘은 오류 비율이 높은 값으로 증가하는 기하급수적 감소로 표현되며, 이는 텍스트의 품질이 매우 낮아지며, 오류 비율이 0이 되면 100이 되어 오류가 전혀 감지되지 않는다는 의미입니다. 이는 영어 표준 관습을 완벽하게 활용한 표현입니다. 이러한 수학적 관계는 정확성 코드가 언어 숙련도 수준 전체에서 상당한 구별을 제공하며, 실제 습득을 나타내는 작은 연속적 진전에 반응함을 보장합니다.
데이터셋: 교육 및 평가 말뭉치
충분한 품질과 범위의 학습 데이터는 이중 모델 시스템의 성능에 매우 중요합니다. 본 연구는 학생들이 직접 작성한 텍스트로 구성된 잘 설계된 데이터셋을 활용하여 다양한 글쓰기 과제를 활용해 모델을 개발하고 평가하였습니다. 표본은 평균 연령 19세의 파키스탄 대학생 45명과 여성 45명으로 구성되었으며, 필수 과목으로 '기능적 영어'를 공부하고 있었습니다. 각 학생은 8주 동안 8개의 에세이를 작성했으며, 여기에는 사전 시험, 개입 에세이, 시험 후 행사가 포함됩니다. 학생들은 각 글쓰기 과제마다 400에서 450단어를 작성할 수 있었습니다. 데이터 세트의 통계량은 다음과 같은 특징을 제공합니다:
70,500단어
평균 문장 길이: 15.7단어 (SD = 3.2)
어휘 범위 (유형-토큰 비율): 0.64 (표준표준화 0.08) 문법 오류 밀도: 100단어 중 2.3 (표준표준화 = 1.1)
선택된 데이터의 근거 및 데이터 품질 보증
선택된 데이터셋은 자동화 글쓰기 평가 연구에 풍부함과 관련성을 부여한 몇 가지 중요한 고려사항에 의해 결정되었습니다. 우선, 경제학 학생 집단은 파키스탄 고등교육의 EFL 학습자와 유사한 성격 때문에 선정되어, 실제 상황을 반영하는 보다 진정성 있는 글쓰기 샘플을 제시할 수 있게 되었습니다. 둘째, 최대 및 최소 잠재 단어 범위인 400–450단어의 설정은 파일럿 연구 데이터에 근거해 이 범위가 기계가 신뢰성 있게 분석할 수 있을 만큼 언어적으로 복잡하며, 인간의 일관된 평가 측면에서 관리 가능한 크기를 유지한다는 점을 알게 되었습니다. 각 작문은 세 명의 전문 영어 교사(평가자 간 신뢰도 κ = 0.847, 유창성 차원, 0.823, 정확성 차원)에 의해 표준화된 10점 유창성 및 정확성 평가 척도로 평가되었습니다. 인간 평가자 교육은 엄격했으며, IELTS와 TOEFL 작문 평가에 관한 개발된 점수 평가 기준에 의존했습니다. 이 데이터는 인간이 주석을 달고 있는 데이터셋으로 구성되어 있으며, 이는 인간이 주석을 달린 데이터를 기반으로 학습할 모델을 학습 및 검증하는 데 활용될 수 있습니다.
데이터 전처리 및 검증 절차
이 데이터셋은 체계적으로 사전 처리되었으며, 텍스트 정규화, BERT WordPiece 토큰라이저로 텍스트를 토큰화하고 품질 검증 검사를 수행했습니다. 미완성 작업을 제출하고 표절된 텍스트를 작성한 사람은 데이터 무결성 판단에 포함되지 않았습니다. 마지막 데이터는 숙련도 수준과 작업 유형 간 균형을 맞추기 위해 층별로 샘플링을 통해 학습(70%, n = 189), 검증(15%, n = 41), 테스트 세트(15%, n = 40)로 무작위로 나누었습니다. 전문적으로 편집된 학술 텍스트, 신문 기사, 출판된 에세이로 구성된 대규모 참고 코퍼스의 언어학적 분석으로, 약 5천만 단어에 달합니다. 이 말뭉치는 유창성 테스트를 수행하는 데 필요한 언어 패턴을 제공하며, 표준 사용법과 비교하여 오류 탐지 절차를 지원합니다. 참고 말뭉치에서는 전처리와 색인 이전 단계로는 토큰화, 품사 태깅, 구문 구문 분석, 의미 표시가 있어 실시간 평가 중 효율적인 접근을 용이하게 합니다.
유창성 모델 훈련 전략
데이터를 유창성을 달성하도록 훈련하기 위한 순차 최적화 시스템이 제안됩니다. 훈련은 적응형 학습률 스케줄링, 점진적 배치 크기, 고급 정규화 방법 등 최첨단 기능을 사용하여 학습 진행 중 과적합을 방지하여, 언어 유창성을 나타내는 언어 패턴을 식별하는 모델의 효율성을 유지했습니다. 학습 속도는 5 × 10-4 이며, 선형 감쇠 스케줄을 적용하여 수렴이 안정적이고 최적 매개변수 값 주위를 진동하지 않도록 구성되어 있습니다. 이 학습 속도는 [1 x 10-6, 1 x 10-4] 그리드 탐색을 통해 선택되며, 5 x 10-5 가 수렴 속도와 안정성 사이의 가장 적절한 절충입니다. 실제 훈련은 3개의 에포크로 제한되며, 검증 손실 추적을 통해 과적합을 방지하면서도 충분한 매개변수 업데이트를 방해하지 않고 학습을 효과적으로 구현하는 데 최적화된 구성입니다. 기전의 조기 정지와 2 에포크의 인내심과 최소 델타 0.001로 설정하는 방전이 진행되었습니다.
최적화는 AdamW 옵티마이너로 수행되며, β₁ = 0.9(운동량, 1차 모멘트 추정치의 기하급수적 감쇠를 제어), β₂ = 0.999(2차 모멘트 추정치의 지수적 감소를 제어), ε = 1 × 10⁻8 (수치 안정성 항)과 같은 단순화된 선택을 사용합니다. 가중치 붕괴 정규화(λ = 0.01)는 매개변수 크기가 지나치게 커지는 것을 방지하며, 이 값은 범위 전반에 걸친 검증 성능 분석을 통해 선택됩니다 [0.001, 0.1]. 복잡한 모니터링은 훈련 전반에 걸쳐 다양한 지표를 모니터링하여 모델의 최상의 성능을 보장하고 과적합을 방지할 수 있습니다. 모니터링 프레임워크에 포함된 항목은 다음과 같습니다:
손실 추적: 훈련 및 검증 손실은 각 에포크 내에서 추적되며, 2년 연속 에포크에서 검증 손실이 개선되지 않을 때 조기 중단이 자동으로 이루어집니다.
성과 지표: 검증 데이터는 100단계 학습마다 예측된 점수와 실제 점수 간 피어슨 상관계수를 계산하는 데 사용됩니다.
그라디언트 센싱: 그라디언트 노름을 모니터링하여 사라짐과 폭발하는 그라디언트를 감지하며, 1.0 노름에서는 그라디언트 클리핑이 적용됩니다.
학습률 스케줄링: 1개 이상의 시대 정체기가 감지될 경우 검증 기반 학습률 감소(인수 = 0.5).
정규화 관련: 체계적 절제술을 통해 중도 탈락률(BERT 0.1, 회귀 헤드 0.3)을 확인하였다. 훈련 과정에서 과적합 방지를 기반으로 한 여러 정규화 방법이 사용됩니다: (1) 네트워크 내 계층 유형별 최적화된 탈락률을 이용한 드롭아웃 정규화, (2) 위에서 설명한 가중치 감소, (3) 검증 성능에 따라 조기 중단, (4) 역변환 방법을 이용한 15%의 훈련 예제를 의역한 데이터 증강. 가장 성과가 좋은 모델의 체크포인트는 각 에포크 후에 저장되었고, 검증 상관관계 점수를 바탕으로 가장 높은 점수를 받은 모델이 선정되었습니다. 유창성 평가 부분에서 사용되는 손실 함수는 연속 유창성 점수 예측을 위한 회귀 과제의 주요 목적 함수인 평균 제곱 오차(MSE)입니다. 손실 공식은 수학적으로 다음과 같이 주어집니다:
(12)
N은 전체 훈련 샘플 크기, y_pred, i는 i번째 샘플의 예측 유창성 점수, y_true I는 인간 전문가 평가자가 제공한 대응하는 진실 점수입니다. 이 손실은 예측-실제 오차를 제곱적으로 억제하여 더 큰 오차가 더 큰 페널티를 받도록 하는 데 매우 유용하며, 미분 가능성도 있습니다. 학습률 스케줄링 메커니즘은 2단계 과정을 통해 매우 발전되어 있으며, 선형 워밍업 단계에서 시작해 체계적인 붕괴 과정을 거쳐 최적의 수렴 특징을 만듭니다. 이 과정은 워밍업 단계에서 이루어지며, 학습 속도가 0에서 시작해 점차 최대 속도로 변화한 후 모델 매개변수가 훈련 데이터셋에 대해 최적화됩니다. 워밍업 단계의 수학적 표현은 다음과 같습니다:
(13)
워밍업 단계 이후에는 최적 매개변수 값을 초과하지 않도록 체계적으로 선형적으로 학습 속도를 감쇠하여 꾸준히 수렴합니다. 수학적으로 붕괴 단계는 다음과 같습니다:
(14)
여기서 t는 현재 훈련 단계, lr max는 워밍업 동안 달성한 최대 학습률, 워밍업은 워밍업 단계에 할당된 단계 수, total은 모든 시대에 걸친 총 훈련 단계 수입니다. 앞서 언급한 스케줄링 절차는 하위 수준에서 모델의 적극적인 학습과 수렴 수준에서의 안정성을 보장합니다.
정확성 모델 훈련 전략
정확성 모델은 사전 학습된 FLAN-T5 모델을 활용한 전이 학습 전략을 기반으로 하며, 필요한 모든 문법 지식을 활용했습니다. 이 연구는 일반적인 언어 이해도와 ESL 학습자들이 저지른 실수에 관한 구체적인 정보를 살피기 위한 것이었습니다. 전이 학습 방법은 pszemraj/flan-t5-large-grammar-synthesis 체크포인트를 기본 모델로 사용하며, 정확성 측면에서 여러 주목할 만한 장점을 가지고 있습니다. 모델은 이미 다양한 텍스트 분야에서 훈련된 높은 언어 이해 능력을 갖추고 있어 다양한 글쓰기 스타일과 주제에 적응할 수 있습니다. 특히, 제2언어 글쓰기에서 마주칠 수 있는 다양한 문법 오류를 아우르는 대규모 수정 데이터셋에 대해 문법별 미세 조정이 수행되었습니다. 더불어, 체크포인트는 다양한 유형의 오류(예: 형태학적 오류, 통사적, 의미적 오류)에 대해 테스트되는 강력한 오류 감지 시스템으로 구성되어 있어, 연구의 선천적 수정 테스트 매개변수와 완벽한 비교 기준을 제공합니다.
도메인 적응 과정은 사전 학습 모델의 언어 이해 능력에 영향을 주지 않고, 평가 과제 작성 솔루션의 구체적인 특징을 도입하는 체계적인 매개변수 수정을 반영합니다. 이 적응 과정은 다음과 같은 수학적 유도를 가집니다:
(15)
여기서 θ는 일반적인 언어 이해와 문법 지식을 인코딩하는 사전 학습 모델의 매개변수를 나타내며 , Δθ도메인 은 대상 작성 평가 과제에서 학습된 특정 매개변수 업데이트를 나타냅니다. 도메인별 업데이트는 대상 데이터셋에 대한 구배 기반 최적화를 통해 계산되어, 모델이 EFL 글쓰기에서 흔히 볼 수 있는 오류 유형에 대한 과제별 민감도를 개발하면서도 광범위한 언어적 능력을 저해하지 않도록 합니다.
비교 실험
EG의 기능을 증명하기 위해, 자동 점수와 인간의 전문성 간의 선형적 연관성을 결정하는 측정의 핵심 값으로 피어슨 상관계수를 제안합니다. 상관계수는 다음 공식으로 구합니다:
(16)
여기서xi 는 자동 점수를, 인간 평가
를, 와
는 각각의 평균을 나타냅니다. 상관계수는 −1에서 1 사이이며, 값이 1에 가까워지면 자동화 평가와 인간 평가 사이에 강한 양의 관계가 있음을 나타냅니다.
(17)
(18)
(19)
기초 모델 비교
EG의 성능을 평가하고 기존 방법들에 대한 우수성을 입증하기 위해, 기존 AWE 및 전통적인 단일 지표 접근법과 심층 비교가 이루어집니다. 이러한 기본 비교는 EG 아키텍처의 부가가치를 검증하고, 유창성 및 정확성 평가의 통합이 개별 차원에만 집중하는 접근법보다 측정 가능한 개선을 제공함을 입증하는 데 필수적입니다. 기준선 모델 선정은 AWE의 네 가지 범주를 포함하며, 각각은 글쓰기 평가 방식에 대한 뚜렷한 방향성을 반영합니다. 첫 번째는 유창성을 평가하는 단일 BERT 기반 모델을 사용합니다. 이 모델들은 트랜스포머 아키텍처를 사용하여 텍스트의 매끄러움과 일관성 패턴을 평가합니다. 두 번째 범주는 전통 언어학 방법론에 내재되어 있으며, 문법 오류 탐지를 위한 규칙 기반 시스템에 초점을 맞춥니다. 따라서 정확성에 초점을 맞추고, 글쓰기 품질과 관련된 일관성과 내용 같은 다른 측면은 간과했습니다. 세 번째 범주는 특징 기반 AWE 시스템으로, 변분 문장 길이, 어휘 다양성, 통사 복잡성 등 언어 복잡도를 나타내는 지표를 포함하여 전반적인 품질 점수를 산출합니다. 네 번째는 다양한 표면적 언어적 특징을 결합하여 하이브리드 시스템을 고려하며, 종종 앙상블 방법이나 가중 평균을 사용합니다. 이 모델들은 EG 신경 아키텍처가 달성하는 통합 정교성 수준에 도달하지 못합니다. 기본 모델 성능은 세 가지 주요 차원으로 평가됩니다. 첫 번째 평가는 표준화된 평가표를 사용하여 시스템 생성 성적과 숙련된 인간 전문가(영어 강사)의 평가 일치를 측정합니다. 두 번째는 일반화 가능성을 판단하며, 주제와 복잡도가 다른 세 에세이 간의 수행 성과가 일관되게 유지되는지 판단합니다. 세 번째 차원은 예측 신뢰도에 의존하며, 평균 절대오차, 평균평균근 오차, 신뢰구간 분석과 같은 통계 도구를 통해 점수 매김의 정확성과 안정성을 평가합니다. 이러한 차원들은 비교를 위한 견고한 틀을 마련하며, 특히 전통적인 접근법보다 더 높은 정밀도와 안정성을 달성하는 데 있어 EG 시스템의 우수성을 강조합니다.
실험군 및 대조군
이 연구는 기능적 영어 과목을 두 개의 온전한 수업으로 수강하는 90명의 학부 경제학 학생들로 구성되었습니다. 데이터는 검사 전, 개입, 사후 세 차례에 걸쳐 작성 정확성과 유창성의 진전을 추적하기 위해 수집되었습니다. 이 인간 대상 연구는 파키스탄 라호르 캠퍼스에 위치한 COMSATS 대학교 이슬라마바드 자문위원회의 승인을 받았습니다. 참가자들은 전통적인 인간 피드백과 컴퓨터 지원 피드백 두 가지 조건에 노출되었습니다. 대조군은 45명의 학생으로 구성되었으며, 이들은 훈련된 영어 강사로부터 전통적인 서면 피드백을 받았습니다. 참가자들은 학생들의 에세이에 대한 전체적인 평가, 오류 식별, 그리고 강사가 과제를 개선하기 위한 코멘트 형태의 권고를 통해 서면 피드백을 받았습니다. 실험 그룹은 교실에서 같은 방식으로 교육받은 45명의 학생으로 구성되었으나, 학생들의 글쓰기는 EG가 제공하는 빠른 자동 피드백의 도움으로 보완되어 제출 후 약 30초 이내에 유창성과 정확성 진단 정보를 제공했습니다.
이 연구는 8주간 진행되었으며, 학생들에게 개입을 제공하기 전에 피험자들의 초기 글쓰기 성과를 파악하기 위해 사전 검사(1주차)가 실시되었습니다. 실험군에서는 NLP 의미 표지자를 이용한 컴퓨터 기반 피드백을, 대조군에서는 교사 평가를 6주간 참가자들에게 제공하였습니다. 궁극적으로, 8주차에 진행된 사후 검사는 정확도와 유창성 점수의 사전 및 사후 측정 차이를 이해하기 위해 수행되었습니다. 비교 가능성에서 유사한 결과를 얻기 위해, 응답자들은 매 평가 기간마다 유사한 과제를 작성 과제로 수행하도록 요청하여, 과제 난이도와 글쓰기 내용의 친숙도와 같은 잠재적 교란 변수를 최소화하였습니다. 글쓰기 주제가 난이도에 맞게 일관되게 하고 내용의 타당성을 설정하기 위해, 글쓰기 주제는 일치하는 방식으로 선택되었습니다. 에세이 주제는 학생들이 다양한 내용을 다루도록 하여 연습 효과와 참가자들이 오랜 시간 동안 같은 과제를 반복하지 않도록 지루함을 방지하도록 선택되었습니다.
사전 시험 단계에서 참가자들은 400에서 450단어 사이의 에세이를 작성하고 학업 및 진로 목표에 대해 작성하도록 요청받았습니다. 이 묘사 과제는 개인적 경험과 미래 예측을 바탕으로 작성되었으며, 글을 체계적으로 정리하고 명확한 예시를 제시하며 개인 목표와 동기를 논리적으로 표현할 필요가 있음을 의미합니다. 중재 글쓰기 과제는 일상생활, 취미, 여행, 대학 첫날, 인생의 기억에 남는 날들, 그리고 가장 친한 친구 순간 등 다양한 주제를 다루었습니다. 시험 후 주제는 '기술이 커뮤니케이션에 미치는 영향'이라는 주제와 연결되어 있었으며, 요구된 에세이 분량은 400–450단어였습니다.