연구 논문

딥 뉴럴 네트워크와 교사의 서면 평가를 통한 자동 글쓰기 평가가 영어 글쓰기 성과에 미치는 영향 조사

DOI:

10.3791/69995

2026년 5월 8일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

컴퓨터 시스템과 교사의 서면 피드백을 통해 두 가지 NLP 의미 기반 기능을 제공하여 학생들의 영어 글쓰기 유창성과 정확성을 향상시켰습니다. 전자에 대해서는 긍정적인 결과가 나타났습니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

컴퓨터 지원 언어 학습 기술은 특히 인공지능(AI) 분야에서 지난 몇 년간 가장 큰 발전을 이루었습니다. 자동화 작성 평가(이하 AWE)와 자동 에세이 채점(AES)과 같은 다양한 기술들이 컴퓨터 분야뿐 아니라 교육 분야에서도 언어 학습의 기둥으로 간주됩니다. 평가는 AWE 기술을 활용한 전체론적 점수 형태로만 수행될 수 있으며, 이는 언어 학습을 향상시키는 데 매우 효과적이었기 때문에 상세하거나 심층적인 피드백을 제공할 수 없습니다. 언어의 두 가지 주요 요소(즉, 문법과 유창성)에 대한 상세한 글쓰기 피드백을 제공하기 위해, 신경망 모델을 포함하는 컴퓨터 지원 구현 시스템, 그리고 두 가지 의미 기반 자연어 처리(이하 NLP) 방법도 고려되었습니다. 이를 위해 영어 제2언어 학습자(ESL)인 파키스탄 대학생 90명을 무작위로 대조군, 강사 피드백 그룹, 실험 그룹에 배정했습니다. 컴퓨터 지원 평가는 신경망을 포함했습니다. AWE 기저선 모델과 채점한 강사들 간의 비교 테스트 결과는 이러한 신경망을 사용한 컴퓨터 지원 피드백 간에 상관관계가 있음을 보여주었습니다. 이러한 결과의 함의는 특히 언어적 정확성과 유창성이 도전적인 상황에서 ESL 글쓰기 교육법에 영향을 미칩니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

글쓰기 피드백은 조직, 문법, 유창성, 내용, 기법 등 언어의 다양한 속성을 다루며, 학습자가 새로운 글을 다시 쓰거나 만들 수 있도록 합니다 1,2,3. 현재 영어 작문 교사들은 컴퓨터 지원 언어 학습(이하 CALL)과 AWE 또는 AES 형태의 컴퓨터 지원 글쓰기 평가, 그리고 에세이 채점의 빠른 변화와 발전으로 인해 큰 혜택을 받고있습니다. 또한, 컴퓨터 지원 영어 작문 평가는 내용, 문법, 어휘 등 언어적 요소에 대한 진단 피드백을 제공하여 학생들의 글에 대해 시기적절하고 개별적이며 객관적인 답변을 제공합니다. AWE 시스템은 학생들에게 명확한 서면 답변을 제공하여 이 답변을 통해 습득한 지식을 내면화하고인지 능력을 향상시키도록 할 수 있는 위치에 있습니다.

본 연구는 다중 전략, 컴퓨터 기반 영어 글쓰기 학습 개념을 제시한 연구4를 기반으로 하였으며, 영어 글쓰기 피드백 이론과 분석적 채점 과정을 염두에 두고 있습니다. 여기에는 심층 학습을 서면 피드백에 통합하여 정교한 서면 피드백 점수를 제공하는 다른 NLP 의미론 기반 모델도 포함되었습니다. 이는 이전 AWE 기술의 한계를 해결하는데, AWE 기술은 전체론적 평가만 강조하고 분석적이고 구체적인 점수 산정은 중요하지 않습니다. 따라서 이는 학생들의 영어 작문 학습을 향상시키기 위해 일련의 언어 지표 요소에 대해 하위 및 총점 등 정확하고 즉각적인 평가와 더 관련이 있습니다. 언어학의 다양한 특성(즉, 내용, 복잡성, 정확성, 유창성 등) 중에서 본 연구는 파키스탄 내 ESL 학습자들의 유창성과 문법적 측면만을 조사할 것입니다. 이를 위해 본 연구는 신경망을 활용하고 교사 평가를 동반하는 NLP 기술 전략을 제안합니다.

파키스탄 언어 학습 맥락에서, 파키스탄 학생들은 영어 공부를 1학년부터 14학년까지 필수 과목으로 간주함에도 불구하고 영어 글쓰기 학습에 어려움을 겪습니다. 여기서 잘못된 강의나 구식 문법 설명 방법 사용 등 여러 요인이 작용합니다. 대학 수준에서는 교사가 가르쳐야 하는 학생 수가 상당히 많으며, 학생들은 다양한 대학과 학교 출신을 배경으로 합니다. 이로 인해 교사들은 학생들의 글쓰기 실수를 교정하는 데 많은 시간을 할애하게 되고, 업무량이 너무 많아집니다. 반면, 학생들은 교사의 서면 피드백을 당연하게 여기고 실수를 인지하고 수정하려는 노력을 하지않았습니다.

한 연구에 따르면, 유창성은 주로 학생들이 실수를 두려워하기 때문에 유창하게 글을 쓰는 데 장애물이 되고, 따라서 학생들은 생각에 집중하기보다는 실수를 더 자주 피하려고 한다고 합니다. 우르두어가 영어 글씨와 간섭하는 경우도 있으며, 그 외에도 여러 맥락적 요인이 있습니다. 더불어, 우르두어는 국가 언어입니다. 이러한 맥락적 요인 때문에, 교사들은 학생들이 글로 작성물을 작성하거나 원고를 편집할 때마다 정확하고 시기적절하며 일관된 피드백을 제공하는 데 어려움을 겪습니다. 글쓰기 평가 이론을 고려할 때, 본 연구는 전통적인 교사 평가와 비교할 때 자동 기계 작성 피드백 전략을 사용하는 연구를 따라가며, 전체론적 채점 대신 분석적 평가를 통해 학생들이 두 가지 중요한 언어 차원(즉, 문법과 유창성)에 대해 즉각적인 피드백을 받을 수 있도록 보장합니다.

Pigai.org, Bingo English, My Access, E-rater, I-write, Criterion 등 다양한 산업용 AWE와 AES 제품들이 등장했습니다. AES/AWE는 초기 개발 단계에서 주로 베이즈 정리10, 선형 회귀11 등 전통적인 머신러닝 시스템을 기반으로 합니다. 현재 딥러닝, 특히 신경망 기술의 확장된 발전은 반복 신경망(RNN12), 장기 단기 기억13, 합성곱 신경망(CNN)14, BERT 접근법15와 같은 글쓰기 피드백 분야에도 현저한 혜택을 주고 있습니다. AWE는 NLP16 시작 시 사용된 사전 훈련 전략으로도 혜택을 받았습니다. 많은 연구들이 학습을 목적으로 적대적 샘플 생성, 멀티태스킹17을 통한 학습, 자기 감독을 통한 학습18, 그래프 알고리즘19 등 신경망에 초점을 맞춘 다양한 해결책을 고려했습니다. 일부는 피드백 작성에 대한 훈련 데이터 부족 문제를 해결하기 위해 다양한 기법을 제안했습니다20. 또한 많은 신경망 모델에 기여하는 점수 모델들도 있습니다21.

문법 오류 수정(이하 GEC)은 NLP 임무의 독립적인 방법으로, 작성 오류를 자동으로 감지하고 수정할 수 있는 기능을 가지고 있습니다. GEC의 과제 내용은 AWE 측면과 상호 연관되어 있습니다. AWE 과제는 문법 오류 진단을 고려하는 것으로 간주되며, 대부분의 오류 오류는 올바른 형태로 강조되어야 합니다. 그러나 AWE 연구들은 GEC에 대한 관심을 덜 채웠으며, 초기 GEC 모델을 AWE 기술에 통합한 연구는 소수에 불과합니다. 초기에는 GEC 연구에서 대부분의 경우 N-gram22, BERT24를 포함한 언어 모델23을 선택하여 문법 오류를 식별하고 수정합니다. 그러나 위의 해결책들은 무질서와 성분 누락과 같은 문제를 완전히 해결하지는 못했습니다. 인코더-디코더25의 아키텍처는 GEC에서 이전에 다른 모델들이 해결하지 못했던 문제들을 해결함으로써 같은 성공을 거두었습니다. 고급 GEC 아키텍처는 트랜스포머 기반 접근법26을 포함하여 여러 모델을 활용해 문제를 해결했다는 점을 주목할 필요가 있습니다.

여러 연구에서 AES가 인간 평가에 비해 효율성을 확인했습니다27,28. 29명의 연구에서는 자동화 평가가 학습자의 영어 유창성에 미치는 영향을 보여주었습니다. 연구 결과는 자동 평가가 영어 쓰기 유창성에 긍정적인 영향을 미친다는 것을 보여주었다. 반면,일부 다른 연구들은 AES의 인간 평가에 비해 높은 오류 탐지율을 무시합니다. 최근 연구들은 언어 교육에서 AI 지원 도구의 글쓰기 평가 효과가 점점 커지고 있음을 강조합니다. 그 중한 연구는 중국 대학생들의 학습 맥락에서 자동 채점과 강사의 피드백을 비교했습니다.

학술 글쓰기에서 AI 기반 도구의 혁신적인 역할은 최근 문헌에서 활발히 보고되고 있습니다. 전통적인 EFL 글쓰기 교육을 보완하는 AI 기반 글쓰기 도구의 적용에 관한 연구는 기술 성공 도입에 있어 평등한 기회와 선제적인 교사 지원이 매우 중요함을 강조합니다. Pigai와 같은 AWE를 조사한 연구들은 컴퓨터 지원 하에서의 피드백과 ESL 글쓰기, 수정, 새로운 글쓰기 향상 사이에 강한 상관관계가 있음을 보여주었다. 또 다른 연구는 변분 자동인코더(VAE)의 이점이 학습자의 영어 작문 훈련에 긍정적인 영향을 미치고, 다양한 언어학적 특징에 특화된 고급 딥러닝에 대한 피드백을 얻는다고 강조했습니다34. 또 다른 연구에서는 신경 AWE 시스템이 딥러닝을 통해 즉각적인 평가를 제공하는 NLP 기반 GEC와 함께 사용할 수 있을 것임을 제안했습니다35.

다중 에이전트 시스템의 개선은 글쓰기를 지원하는 기술 개발에서 중요한 단계입니다. 다중 에이전트이자 학술 글쓰기 개선 보조기인 AcademyCraft는 딥러닝을 기반으로 하며, 복잡한 분석 체계에 대해 AI 기반 EFL/ESL 글쓰기 지원을 지원하고 작성하는 능력을 입증했습니다. 실제로 기술 기반 언어 학습 연구들은 딥러닝, 자동 평가, 의미 피드백과 같은 다양한 출현 패턴을 성과 분석을 통해 글쓰기 정확도가 점진적이고 꾸준히 증가했으며, 학습자 참여도37명으로 확인했습니다.

트랜스포머-LSTM 모델은 영어 글쓰기에 대해 자동 채점과 피드백에 대한 경향을 보였습니다. 이러한 하이브리드 아키텍처는 변환기의 맥락적 이해와 LSTM 시스템의 순차 처리를 상호 결합하여, 문법 및 일관성 평가에 있어 정확도가 향상되고 보다 미묘한 피드백 생성을 제공했다38. AI 작성 도구에 대한 EFL 교사들의 인식은 콘텐츠 구성과 글쓰기 품질에서 측정 가능한 개선을 지속적으로 보고하며,기술 통합의 유용성을 촉진하는 교육적 지원의 중요한 역할에 초점을 맞춥니다. 강사의 피드백과 컴퓨터 지원 피드백을 비교한 연구는 적으며, 이는 ESL 학습자의 영어 글쓰기에 미치는 유창성과 문법 측면의 영향을 탐구하기 위한 딥러닝 모델을 시사합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

연구에 사용된 모든 소프트웨어와 도구는 재료표에 나열되어 있습니다.

평가 기준

본 연구에서 채택된 평가 분류는 유창성과 정확성이라는 두 가지 주요 영역을 다루며, 이는 영어 외국어(EFL) 글쓰기의 포괄적 평가에 필요한 모든 요건을 포함합니다. 이 기준들은 효과적인 의사소통과 언어 능력 발휘에 도움이 되는 글쓰기 품질의 핵심 포인트를 측정하기 위한 것입니다. 유창성 모듈은 아이디어의 부드러움과 단어 및 문장 구조의 사용도를 측정하여 글쓰기의 자연스러움, 표현력, 일관성을 측정합니다. 정확성 모듈은 정확한 문법적 정확성, 기계적 완벽함, 표준 영어 관습 준수를 목표로 하며, 가상으로는 여러 수준에서 언어의 오류를 측정하고 계산합니다. ( 표 1 참조)

작업 정의

영어를 배우는 학생들의 자동 작문 평가 조건에 따라, 본 연구는 새로운 EG 컴퓨터 지원 영어 작문 평가 시스템을 제안합니다. 자동화 작성 평가 시스템의 범위에 제한된 이전 연구들과 비교할 때, 제안된 시스템은 혁신적인 딥러닝 기법을 도입하여 사용자에게 광범위한 데이터 처리를 기반으로 한 수준의 언어 분석, 수정 범위, 시스템 전반의 피드백 분석을 가능하게 하여 이러한 한계를 해소할 것입니다. 구성의 두 가지 가장 중요한 지표인 유창성(작품이 얼마나 자연스럽고 일관되며 표현력이 풍부한지)이나 정확성(문법적, 기계적 및 언어적 오류가 많은 텍스트가 얼마나 정확하게 쓰였는지)을 신경망의 개별 구성 요소들과 함께 작동시키며, 이중 모델 시스템은 여러 평가를 수행해야 한다. 또한 여러 언어 수준에서 오류를 식별하고, 교정 조치를 권고하며, 사용자가 체계적으로 학생들의 언어 학습을 향상시킬 수 있도록 리스트 형태로 피드백을 제공합니다. 컴퓨터 지원 자동 평가 시스템 계산 과정을 설명하기 위해, 다음과 같은 수학적 모델을 (1)–(4) 공식으로 제안합니다( 표 2 참조).

figure-protocol-1(1)

figure-protocol-2(2)

figure-protocol-3(3)

figure-protocol-4(4)

여기: 최종 점수 = 종합 글쓰기 평가 점수; w1 = 유창성 점수에 할당된 가중치; w2 = 정확성 점수에 할당된 가중치; Sf = BERT 기반 유창성 점수(정규화 [0, 1]); Sc = 지수 감쇠 정확성 점수; λ = 감쇠 상수 제어 오차 페널티; σ(x) = 로지스틱 시그모이드 활성화 함수; ErrorRatio = 텍스트 내 전체 토큰 수에 대한 오류의 비율. 유창성 점수는 로지스틱 시그모이드 함수σ(x)에 의해 [0, 1]로 정규화되며, 지수 감쇠 함수는 오류 빈도에 적절한 페널티를 부과하기 위해 정확성을 평가하는 데 사용됩니다.

시스템 아키텍처 및 설계

시스템 아키텍처는 병렬 처리 아키텍처를 가진 2-모델 시스템을 사용하며, 입력 에세이 분석이 병렬 평가 경로를 통해 병렬로 수행됩니다. 유창성과 정확성 모듈은 각각 점수를 산출하며, 최종 종합 점수는 두 하위 점수의 가중 평균입니다. 정확성 모듈은 점수 산정 외에도 오류 감지 및 수정에 대한 제안도 제공합니다( 그림 1 참조).

유창성 모듈

글쓰기 유창성은 어휘의 올바른 선택, 문장 구조의 다양성, 통사의 복잡성, 일관성 등과 관련하여 언어 사용의 본질이나 패턴으로 정의할 수 있습니다. 유창성 평가 모델은 말더듬거나 어색하지 않게 전달되는 아이디어를 포착하며, 이는 토착주의적 의사소통 경향에 근접한 느낌을 줍니다. 전통적인 유창성 측정은 척도에 기반하여 평가자 간 신뢰도에 대한 우려를 부각시킵니다. 제안된 시스템은 BERT 기반 신경망을 포함해 깊은 상황적 이해를 통해 의미적 일관성과 언어적 자연성을 자동으로 유도함으로써 이 단점을 극복합니다. 이 구조적 결정은 유창성 측정에 필요한 맥락적 관계와 의미 패턴을 식별하는 데 효과적인 것으로 밝혀진 BERT의 강점을 고려하여 내려졌습니다. 입력 시퀀스는 시스템에 입력되어 12개의 트랜스포머 계층을 거치며, 다중 헤드 자기 주의를 통해 장거리 의존성과 맥락적 관계를 식별합니다( 그림 2 참조).

주의의 메커니즘은 다음과 같다:

figure-protocol-5(5)

Q, K, V를 각각 쿼리, 키, 값을 나타내는 행렬이고, d와 k를 키 벡터의 차원이라고 하자. CLS 토큰 임베딩은 전체 입력 시퀀스의 전체 의미적 일관성을 기록하는 요약 임베딩입니다.

유창성 점수 계산은 다음과 같습니다:

figure-protocol-6(6)

여기서 hCLS 는 BERT [CLS] 토큰 임베딩이고, Wreg는 회귀 헤드의 매개변수 breg 이며, σ는 출력을 [0, 1]으로 정규화하는 시그모이드 활성화 함수입니다.

정확성 모듈

정확성 평가는 문법적 정확성, 기계적 정확성, 표준 영어 관습 준수에 중점을 둡니다. 이 차원은 문법, 형태론, 구두점, 맞춤법 정확성 등 글쓰기의 기술적 측면을 다룹니다. 정확성 요소는 언어적 오류 수뿐만 아니라 텍스트 전체의 품질에 미치는 영향도 살펴봅니다. 의미적 일관성과 자연스러운 흐름을 강조하는 유창성 평가와 달리, 정확성 평가 모듈은 정확한 오류 식별과 체계적인 수정이 필요합니다. 이 모듈은 다양한 오류 유형을 구분하고, 심각도를 평가하며, 학습 개선을 지원하기 위한 목표 교정을 제공합니다. 정확성 손실은 문법 오류 발견 및 수정을 위해 미세 조정된 FLAN-T5 모델을 사용합니다. 이 선택은 T5의 텍스트 간 변환 가능성에 의해 결정되었으며, 이는 시스템이 결함을 찾는 것뿐만 아니라 한 시스템 내에서 관련 수정도 수행할 수 있게 합니다. 이 시스템은 인코더-디코더 형태이며, 텍스트는 이 변환 형태로 입력됩니다: ( 그림 3 참조)

figure-protocol-7(7)

인코더 요소는 문법적 경향뿐만 아니라 잠재적 실패 영역도 포착하는 문맥 민감 표현을 생성합니다:

figure-protocol-8(8)

잘못 식별된 오류에 대해 적절한 문법 변형을 생성하는 도움으로, 디코더는 수정된 시퀀스를 생성합니다:

figure-protocol-9(9)

이러한 양방향 처리 방식은 오류가 발생하는 맥락과 그 맥락을 어떻게 수정해야 하는지를 인지하여 힌트가 의미적으로 일관되게 하면서도 문법 교정에 집중할 수 있게 합니다.

오류 정량화 및 점수 계산 알고리즘

정확성 점수는 원문과 올바른 글씨를 비교했으며, 언어적 오류와 텍스트 내 위치, 의미 간섭에 따른 심각성을 고려한 것이다. 이 방법은 오류 유형별 구분과 텍스트 이해에 미치는 영향을 비교하여 포착합니다. 오류 빈도와 텍스트 품질 저하의 관계는 채점 시스템에서 로그 방식으로 강조되었습니다. 원본 텍스트와 수정된 텍스트의 토큰 비교에서 기본적인 단계는 문자열 정렬의 비트 단위 기법에 기반한 두 단계의 비교입니다. 두 번째 단계는 문법적 오류(주어-동사 일치, 시제 일관성, 통사 구조 신뢰성), 기계적 오류(대문자 사용, 구두점, 맞춤법), 용법 오류(단어 선택, 관용구, 어체 적합성) 오류를 구분하는 알려진 언어학적 분류법을 바탕으로 오류 유형을 식별하고 분류하는 것입니다. 세 번째 단계는 전체 텍스트 길이를 바탕으로 오류 비율을 계산하는 것입니다. 네 번째 단계는 오류 비율을 직접 해석 가능한 정확성 점수로 변환하여 오류 빈도와 텍스트 품질 간의 비가산 및 비선형 의존성을 근사하는 지수 감쇠 점수 알고리즘을 활용합니다.

오류 정량화 과정의 수학적 처리는 설치된 오류의 비율을 계산하는 것에서 시작되며, 이를 통해 정규화된 오류 설치 비율을 제공하고, 이를 통해 서로 다른 길이의 텍스트를 공정하게 비교할 수 있습니다:

figure-protocol-10(10)

figure-protocol-11(11)

이 보정 매개변수는 경험적 기준으로 2.5로 확립되었으며, 이는 인간의 전문가 판단으로 완전히 검증된 결과로, 점수 함수가 오류 빈도가 증가함에 따라 텍스트 품질 저하와 관련하여 인간의 이해에 부합하는 결과를 제공할 수 있도록 했습니다. 이렇게 매개변수 값을 설정하면 오류율이 낮은 텍스트(Error_Ratio < 0.1)는 표준 영어 규칙을 충실히 따르기 때문에 높은 정확성 점수를 받고, 중간 정도의 오류율(0.1 < Error_Ratio ≤ 0.3)인 텍스트는 중간 정도의 정확성 점수를 받아 언어적 문제점이 있지만 명백히 치명적이지는 않음을 나타냅니다. 그리고 오류율이 높은 텍스트(Error_Ratio > 0.3)는 이해 가능성에 큰 영향을 미치는 중요한 언어적 문제들 때문에 낮은 정확성 점수를 받았습니다.

정답성 평가를 위한 정확도 점수 알고리즘은 T5 기반 시스템이 발견하고 수정한 모든 오류를 최종 오류율 계산 시 벌점 항목으로 체계적으로 고려합니다. 문법 오류에 대한 벌점 메커니즘은 오류 비율이 높은 값으로 증가하는 기하급수적 감소로 표현되며, 이는 텍스트의 품질이 매우 낮아지며, 오류 비율이 0이 되면 100이 되어 오류가 전혀 감지되지 않는다는 의미입니다. 이는 영어 표준 관습을 완벽하게 활용한 표현입니다. 이러한 수학적 관계는 정확성 코드가 언어 숙련도 수준 전체에서 상당한 구별을 제공하며, 실제 습득을 나타내는 작은 연속적 진전에 반응함을 보장합니다.

데이터셋: 교육 및 평가 말뭉치

충분한 품질과 범위의 학습 데이터는 이중 모델 시스템의 성능에 매우 중요합니다. 본 연구는 학생들이 직접 작성한 텍스트로 구성된 잘 설계된 데이터셋을 활용하여 다양한 글쓰기 과제를 활용해 모델을 개발하고 평가하였습니다. 표본은 평균 연령 19세의 파키스탄 대학생 45명과 여성 45명으로 구성되었으며, 필수 과목으로 '기능적 영어'를 공부하고 있었습니다. 각 학생은 8주 동안 8개의 에세이를 작성했으며, 여기에는 사전 시험, 개입 에세이, 시험 후 행사가 포함됩니다. 학생들은 각 글쓰기 과제마다 400에서 450단어를 작성할 수 있었습니다. 데이터 세트의 통계량은 다음과 같은 특징을 제공합니다:

70,500단어

평균 문장 길이: 15.7단어 (SD = 3.2)

어휘 범위 (유형-토큰 비율): 0.64 (표준표준화 0.08) 문법 오류 밀도: 100단어 중 2.3 (표준표준화 = 1.1)

선택된 데이터의 근거 및 데이터 품질 보증

선택된 데이터셋은 자동화 글쓰기 평가 연구에 풍부함과 관련성을 부여한 몇 가지 중요한 고려사항에 의해 결정되었습니다. 우선, 경제학 학생 집단은 파키스탄 고등교육의 EFL 학습자와 유사한 성격 때문에 선정되어, 실제 상황을 반영하는 보다 진정성 있는 글쓰기 샘플을 제시할 수 있게 되었습니다. 둘째, 최대 및 최소 잠재 단어 범위인 400–450단어의 설정은 파일럿 연구 데이터에 근거해 이 범위가 기계가 신뢰성 있게 분석할 수 있을 만큼 언어적으로 복잡하며, 인간의 일관된 평가 측면에서 관리 가능한 크기를 유지한다는 점을 알게 되었습니다. 각 작문은 세 명의 전문 영어 교사(평가자 간 신뢰도 κ = 0.847, 유창성 차원, 0.823, 정확성 차원)에 의해 표준화된 10점 유창성 및 정확성 평가 척도로 평가되었습니다. 인간 평가자 교육은 엄격했으며, IELTS와 TOEFL 작문 평가에 관한 개발된 점수 평가 기준에 의존했습니다. 이 데이터는 인간이 주석을 달고 있는 데이터셋으로 구성되어 있으며, 이는 인간이 주석을 달린 데이터를 기반으로 학습할 모델을 학습 및 검증하는 데 활용될 수 있습니다.

데이터 전처리 및 검증 절차

이 데이터셋은 체계적으로 사전 처리되었으며, 텍스트 정규화, BERT WordPiece 토큰라이저로 텍스트를 토큰화하고 품질 검증 검사를 수행했습니다. 미완성 작업을 제출하고 표절된 텍스트를 작성한 사람은 데이터 무결성 판단에 포함되지 않았습니다. 마지막 데이터는 숙련도 수준과 작업 유형 간 균형을 맞추기 위해 층별로 샘플링을 통해 학습(70%, n = 189), 검증(15%, n = 41), 테스트 세트(15%, n = 40)로 무작위로 나누었습니다. 전문적으로 편집된 학술 텍스트, 신문 기사, 출판된 에세이로 구성된 대규모 참고 코퍼스의 언어학적 분석으로, 약 5천만 단어에 달합니다. 이 말뭉치는 유창성 테스트를 수행하는 데 필요한 언어 패턴을 제공하며, 표준 사용법과 비교하여 오류 탐지 절차를 지원합니다. 참고 말뭉치에서는 전처리와 색인 이전 단계로는 토큰화, 품사 태깅, 구문 구문 분석, 의미 표시가 있어 실시간 평가 중 효율적인 접근을 용이하게 합니다.

유창성 모델 훈련 전략

데이터를 유창성을 달성하도록 훈련하기 위한 순차 최적화 시스템이 제안됩니다. 훈련은 적응형 학습률 스케줄링, 점진적 배치 크기, 고급 정규화 방법 등 최첨단 기능을 사용하여 학습 진행 중 과적합을 방지하여, 언어 유창성을 나타내는 언어 패턴을 식별하는 모델의 효율성을 유지했습니다. 학습 속도는 5 × 10-4 이며, 선형 감쇠 스케줄을 적용하여 수렴이 안정적이고 최적 매개변수 값 주위를 진동하지 않도록 구성되어 있습니다. 이 학습 속도는 [1 x 10-6, 1 x 10-4] 그리드 탐색을 통해 선택되며, 5 x 10-5 가 수렴 속도와 안정성 사이의 가장 적절한 절충입니다. 실제 훈련은 3개의 에포크로 제한되며, 검증 손실 추적을 통해 과적합을 방지하면서도 충분한 매개변수 업데이트를 방해하지 않고 학습을 효과적으로 구현하는 데 최적화된 구성입니다. 기전의 조기 정지와 2 에포크의 인내심과 최소 델타 0.001로 설정하는 방전이 진행되었습니다.

최적화는 AdamW 옵티마이너로 수행되며, β₁ = 0.9(운동량, 1차 모멘트 추정치의 기하급수적 감쇠를 제어), β₂ = 0.999(2차 모멘트 추정치의 지수적 감소를 제어), ε = 1 × 10⁻8 (수치 안정성 항)과 같은 단순화된 선택을 사용합니다. 가중치 붕괴 정규화(λ = 0.01)는 매개변수 크기가 지나치게 커지는 것을 방지하며, 이 값은 범위 전반에 걸친 검증 성능 분석을 통해 선택됩니다 [0.001, 0.1]. 복잡한 모니터링은 훈련 전반에 걸쳐 다양한 지표를 모니터링하여 모델의 최상의 성능을 보장하고 과적합을 방지할 수 있습니다. 모니터링 프레임워크에 포함된 항목은 다음과 같습니다:

손실 추적: 훈련 및 검증 손실은 각 에포크 내에서 추적되며, 2년 연속 에포크에서 검증 손실이 개선되지 않을 때 조기 중단이 자동으로 이루어집니다.

성과 지표: 검증 데이터는 100단계 학습마다 예측된 점수와 실제 점수 간 피어슨 상관계수를 계산하는 데 사용됩니다.

그라디언트 센싱: 그라디언트 노름을 모니터링하여 사라짐과 폭발하는 그라디언트를 감지하며, 1.0 노름에서는 그라디언트 클리핑이 적용됩니다.

학습률 스케줄링: 1개 이상의 시대 정체기가 감지될 경우 검증 기반 학습률 감소(인수 = 0.5).

정규화 관련: 체계적 절제술을 통해 중도 탈락률(BERT 0.1, 회귀 헤드 0.3)을 확인하였다. 훈련 과정에서 과적합 방지를 기반으로 한 여러 정규화 방법이 사용됩니다: (1) 네트워크 내 계층 유형별 최적화된 탈락률을 이용한 드롭아웃 정규화, (2) 위에서 설명한 가중치 감소, (3) 검증 성능에 따라 조기 중단, (4) 역변환 방법을 이용한 15%의 훈련 예제를 의역한 데이터 증강. 가장 성과가 좋은 모델의 체크포인트는 각 에포크 후에 저장되었고, 검증 상관관계 점수를 바탕으로 가장 높은 점수를 받은 모델이 선정되었습니다. 유창성 평가 부분에서 사용되는 손실 함수는 연속 유창성 점수 예측을 위한 회귀 과제의 주요 목적 함수인 평균 제곱 오차(MSE)입니다. 손실 공식은 수학적으로 다음과 같이 주어집니다:

figure-protocol-12(12)

N은 전체 훈련 샘플 크기, y_pred, i는 i번째 샘플의 예측 유창성 점수, y_true I는 인간 전문가 평가자가 제공한 대응하는 진실 점수입니다. 이 손실은 예측-실제 오차를 제곱적으로 억제하여 더 큰 오차가 더 큰 페널티를 받도록 하는 데 매우 유용하며, 미분 가능성도 있습니다. 학습률 스케줄링 메커니즘은 2단계 과정을 통해 매우 발전되어 있으며, 선형 워밍업 단계에서 시작해 체계적인 붕괴 과정을 거쳐 최적의 수렴 특징을 만듭니다. 이 과정은 워밍업 단계에서 이루어지며, 학습 속도가 0에서 시작해 점차 최대 속도로 변화한 후 모델 매개변수가 훈련 데이터셋에 대해 최적화됩니다. 워밍업 단계의 수학적 표현은 다음과 같습니다:

figure-protocol-13(13)

워밍업 단계 이후에는 최적 매개변수 값을 초과하지 않도록 체계적으로 선형적으로 학습 속도를 감쇠하여 꾸준히 수렴합니다. 수학적으로 붕괴 단계는 다음과 같습니다:

figure-protocol-14(14)

여기서 t는 현재 훈련 단계, lr max는 워밍업 동안 달성한 최대 학습률, 워밍업은 워밍업 단계에 할당된 단계 수, total은 모든 시대에 걸친 총 훈련 단계 수입니다. 앞서 언급한 스케줄링 절차는 하위 수준에서 모델의 적극적인 학습과 수렴 수준에서의 안정성을 보장합니다.

정확성 모델 훈련 전략

정확성 모델은 사전 학습된 FLAN-T5 모델을 활용한 전이 학습 전략을 기반으로 하며, 필요한 모든 문법 지식을 활용했습니다. 이 연구는 일반적인 언어 이해도와 ESL 학습자들이 저지른 실수에 관한 구체적인 정보를 살피기 위한 것이었습니다. 전이 학습 방법은 pszemraj/flan-t5-large-grammar-synthesis 체크포인트를 기본 모델로 사용하며, 정확성 측면에서 여러 주목할 만한 장점을 가지고 있습니다. 모델은 이미 다양한 텍스트 분야에서 훈련된 높은 언어 이해 능력을 갖추고 있어 다양한 글쓰기 스타일과 주제에 적응할 수 있습니다. 특히, 제2언어 글쓰기에서 마주칠 수 있는 다양한 문법 오류를 아우르는 대규모 수정 데이터셋에 대해 문법별 미세 조정이 수행되었습니다. 더불어, 체크포인트는 다양한 유형의 오류(예: 형태학적 오류, 통사적, 의미적 오류)에 대해 테스트되는 강력한 오류 감지 시스템으로 구성되어 있어, 연구의 선천적 수정 테스트 매개변수와 완벽한 비교 기준을 제공합니다.

도메인 적응 과정은 사전 학습 모델의 언어 이해 능력에 영향을 주지 않고, 평가 과제 작성 솔루션의 구체적인 특징을 도입하는 체계적인 매개변수 수정을 반영합니다. 이 적응 과정은 다음과 같은 수학적 유도를 가집니다:

figure-protocol-15(15)

여기서 θ는 일반적인 언어 이해와 문법 지식을 인코딩하는 사전 학습 모델의 매개변수를 나타내며 , Δθ도메인 은 대상 작성 평가 과제에서 학습된 특정 매개변수 업데이트를 나타냅니다. 도메인별 업데이트는 대상 데이터셋에 대한 구배 기반 최적화를 통해 계산되어, 모델이 EFL 글쓰기에서 흔히 볼 수 있는 오류 유형에 대한 과제별 민감도를 개발하면서도 광범위한 언어적 능력을 저해하지 않도록 합니다.

비교 실험

EG의 기능을 증명하기 위해, 자동 점수와 인간의 전문성 간의 선형적 연관성을 결정하는 측정의 핵심 값으로 피어슨 상관계수를 제안합니다. 상관계수는 다음 공식으로 구합니다:

figure-protocol-16(16)

여기서xi 는 자동 점수를, 인간 평가 figure-protocol-17 를, 와 figure-protocol-18 는 각각의 평균을 나타냅니다. 상관계수는 −1에서 1 사이이며, 값이 1에 가까워지면 자동화 평가와 인간 평가 사이에 강한 양의 관계가 있음을 나타냅니다.

figure-protocol-19(17)

figure-protocol-20(18)

figure-protocol-21(19)

기초 모델 비교

EG의 성능을 평가하고 기존 방법들에 대한 우수성을 입증하기 위해, 기존 AWE 및 전통적인 단일 지표 접근법과 심층 비교가 이루어집니다. 이러한 기본 비교는 EG 아키텍처의 부가가치를 검증하고, 유창성 및 정확성 평가의 통합이 개별 차원에만 집중하는 접근법보다 측정 가능한 개선을 제공함을 입증하는 데 필수적입니다. 기준선 모델 선정은 AWE의 네 가지 범주를 포함하며, 각각은 글쓰기 평가 방식에 대한 뚜렷한 방향성을 반영합니다. 첫 번째는 유창성을 평가하는 단일 BERT 기반 모델을 사용합니다. 이 모델들은 트랜스포머 아키텍처를 사용하여 텍스트의 매끄러움과 일관성 패턴을 평가합니다. 두 번째 범주는 전통 언어학 방법론에 내재되어 있으며, 문법 오류 탐지를 위한 규칙 기반 시스템에 초점을 맞춥니다. 따라서 정확성에 초점을 맞추고, 글쓰기 품질과 관련된 일관성과 내용 같은 다른 측면은 간과했습니다. 세 번째 범주는 특징 기반 AWE 시스템으로, 변분 문장 길이, 어휘 다양성, 통사 복잡성 등 언어 복잡도를 나타내는 지표를 포함하여 전반적인 품질 점수를 산출합니다. 네 번째는 다양한 표면적 언어적 특징을 결합하여 하이브리드 시스템을 고려하며, 종종 앙상블 방법이나 가중 평균을 사용합니다. 이 모델들은 EG 신경 아키텍처가 달성하는 통합 정교성 수준에 도달하지 못합니다. 기본 모델 성능은 세 가지 주요 차원으로 평가됩니다. 첫 번째 평가는 표준화된 평가표를 사용하여 시스템 생성 성적과 숙련된 인간 전문가(영어 강사)의 평가 일치를 측정합니다. 두 번째는 일반화 가능성을 판단하며, 주제와 복잡도가 다른 세 에세이 간의 수행 성과가 일관되게 유지되는지 판단합니다. 세 번째 차원은 예측 신뢰도에 의존하며, 평균 절대오차, 평균평균근 오차, 신뢰구간 분석과 같은 통계 도구를 통해 점수 매김의 정확성과 안정성을 평가합니다. 이러한 차원들은 비교를 위한 견고한 틀을 마련하며, 특히 전통적인 접근법보다 더 높은 정밀도와 안정성을 달성하는 데 있어 EG 시스템의 우수성을 강조합니다.

실험군 및 대조군

이 연구는 기능적 영어 과목을 두 개의 온전한 수업으로 수강하는 90명의 학부 경제학 학생들로 구성되었습니다. 데이터는 검사 전, 개입, 사후 세 차례에 걸쳐 작성 정확성과 유창성의 진전을 추적하기 위해 수집되었습니다. 이 인간 대상 연구는 파키스탄 라호르 캠퍼스에 위치한 COMSATS 대학교 이슬라마바드 자문위원회의 승인을 받았습니다. 참가자들은 전통적인 인간 피드백과 컴퓨터 지원 피드백 두 가지 조건에 노출되었습니다. 대조군은 45명의 학생으로 구성되었으며, 이들은 훈련된 영어 강사로부터 전통적인 서면 피드백을 받았습니다. 참가자들은 학생들의 에세이에 대한 전체적인 평가, 오류 식별, 그리고 강사가 과제를 개선하기 위한 코멘트 형태의 권고를 통해 서면 피드백을 받았습니다. 실험 그룹은 교실에서 같은 방식으로 교육받은 45명의 학생으로 구성되었으나, 학생들의 글쓰기는 EG가 제공하는 빠른 자동 피드백의 도움으로 보완되어 제출 후 약 30초 이내에 유창성과 정확성 진단 정보를 제공했습니다.

이 연구는 8주간 진행되었으며, 학생들에게 개입을 제공하기 전에 피험자들의 초기 글쓰기 성과를 파악하기 위해 사전 검사(1주차)가 실시되었습니다. 실험군에서는 NLP 의미 표지자를 이용한 컴퓨터 기반 피드백을, 대조군에서는 교사 평가를 6주간 참가자들에게 제공하였습니다. 궁극적으로, 8주차에 진행된 사후 검사는 정확도와 유창성 점수의 사전 및 사후 측정 차이를 이해하기 위해 수행되었습니다. 비교 가능성에서 유사한 결과를 얻기 위해, 응답자들은 매 평가 기간마다 유사한 과제를 작성 과제로 수행하도록 요청하여, 과제 난이도와 글쓰기 내용의 친숙도와 같은 잠재적 교란 변수를 최소화하였습니다. 글쓰기 주제가 난이도에 맞게 일관되게 하고 내용의 타당성을 설정하기 위해, 글쓰기 주제는 일치하는 방식으로 선택되었습니다. 에세이 주제는 학생들이 다양한 내용을 다루도록 하여 연습 효과와 참가자들이 오랜 시간 동안 같은 과제를 반복하지 않도록 지루함을 방지하도록 선택되었습니다.

사전 시험 단계에서 참가자들은 400에서 450단어 사이의 에세이를 작성하고 학업 및 진로 목표에 대해 작성하도록 요청받았습니다. 이 묘사 과제는 개인적 경험과 미래 예측을 바탕으로 작성되었으며, 글을 체계적으로 정리하고 명확한 예시를 제시하며 개인 목표와 동기를 논리적으로 표현할 필요가 있음을 의미합니다. 중재 글쓰기 과제는 일상생활, 취미, 여행, 대학 첫날, 인생의 기억에 남는 날들, 그리고 가장 친한 친구 순간 등 다양한 주제를 다루었습니다. 시험 후 주제는 '기술이 커뮤니케이션에 미치는 영향'이라는 주제와 연결되어 있었으며, 요구된 에세이 분량은 400–450단어였습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

통계적 접근법의 타당성과 신뢰성

이 시스템은 다양한 보완 통계 방법으로 테스트되었으며, 모두 EG가 글쓰기 발달에 미치는 영향을 포괄적으로 입증했습니다. 이 방식은 교육 개입이 단순한 그룹 비교가 아니라 변화 패턴, 효과 규모, 다양한 측정 전략의 상관관계 분석에 초점을 맞추는 복잡한 통계 분석의 대상임을 인정하는 다면적인 분석 방법입니다(표 1, 표 3, 4).

그룹 간 글쓰기 향상에 대한 비교 분석

대조군과 실험군 간 정확도와 유창성 점수 변화를 관찰하기 위해, 독립적인 표본 t-검정을 사용하여 두 그룹 간 사후 및 사전 검사 간 글쓰기 향상 점수 차이를 비교하였습니다. 이 분석 방식은 연구의 ...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

실험 결과는 여러 중요한 성과를 보여줍니다. 첫째, 이중 모델 시스템은 인간 전문가 판단과 강한 상관관계를 달성했으며(r = 0.923), 단일 모델 접근법과 현대 AWE 시스템보다 훨씬 우수한 성능을 보였습니다. 둘째, 통제 중재 연구에서는 ESL 학생들의 글쓰기 수행이 유의미하게 향상되었으며, 효과량이 최근 문헌에서 보고된 것보다 큰 효과량(d = 1.28)을 초과했습니다. 셋째, 시스템은 평균 절대 오차(0.149) 감소와 다양한 작성 과제에서의 일관성 향상 등 여러 평가 지표에서 우수한 성능을 보였습니다.

현재의 연구 결과를 더 넓은 연구 환경에 위치시키기 위해, 유사한 방법론과 평가 기준을 사용한 최근 연구들과 포괄적인 비교가 수행되었습니다. 연구는 기존 AWE 시스템의 중요한 한계를 해결하기 위해 유창성 및 정확성 평가를 위한 별도의 모듈을 구현하고, 유창성 평가에는 BERT 기반 아키텍처를, 문법 오류 탐지...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

모든 저자 간에 이해 상충은 없습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

우리는 학생들로부터 데이터를 수집하는 데 도움을 준 COMSATS 이슬라마바드 대학교 라호르 캠퍼스의 영어 학부의 지원에 감사드립니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
연구에 사용된 소프트웨어/라이브러리
딥러닝 프레임워크파이토치1.13.1신경망 구현을 위한 딥러닝 프레임워크
사전 학습 모델트랜스포머 (허깅 페이스)4.21.3사전 학습된 모델 로딩, BERT 및 T5 모델 구현
언어 모델BERT (변압기로부터의 양방향 인코더 표현)버트-베이스-언케이스드유창성 평가, 의미 일관성 평가, 맥락적 이해
언어 모델FLAN-T5 (미세 조정 언어 넷 T5)pszemraj/flan-t5-large-문법-합성문법 오류 수정, 텍스트 간 변환, 오류 탐지
수치 계산넘버피1.23.5수치 계산, 수학 함수에 대한 배열 연산
데이터 분석판다1.5.2데이터 조작, 통계 분석 및 전처리
머신러닝Scikit-learn1.1.3통계 지표 계산, 상관관계 분석, 평가 지표
시각화매트플롯립3.6.2데이터 시각화, 훈련 진행 도표, 성과 차트
시각화씨본0.12.1통계 데이터 시각화, 상관 히트맵
NLP 툴킷NLTK (자연어 툴킷)3.7텍스트 전처리, 토큰화, 언어 분석
NLP 처리스페이시3.4.4고급 NLP 전처리, POS 태깅, 구문 분석
토큰화토큰화0.13.2BERT WordPiece 및 T5 토큰화의 빠른 토큰화
통계 및 분석 소프트웨어
통계 소프트웨어SPSS 통계 소프트웨어버전 26.0통계 분석, 독립 표본 t-검정, ANOVA, 상관관계 분석
훈련 데이터셋Kaggle ASAP 데이터셋2012년 버전훈련 코퍼스 참조 (AWE 모델의 90%가 이 데이터셋을 사용합니다)
PYTHON OPTIMIZATION AND TRAINING 라이브러리
옵티마이저토치.optim.AdamW파이토치 1.13.1가중치 감소 정규화(λ=0.01), &beta를 이용한 모델 최적화; 1=0.9, β 2=0.999, ε=1× 10< >-8
상실 / 활성화torch.nn.functional(토치.nn.function)파이토치 1.13.1S결장 활성화, 손실 기능, 드롭아웃 정규화
데이터 로딩torch.utils.data.DataLoader파이토치 1.13.1점진적 배치 크기 조정 (4→ 16), 데이터 로딩 및 배치
토큰화트랜스포머. 오토톡나이저트랜스포머 4.21.3BERT 워드피스 토큰화, 텍스트 전처리
모델 하중트랜스포머. 오토모델트랜스포머 4.21.3BERT 및 T5 아키텍처용 사전 학습된 모델 로딩
그라디언트 제어torch.nn.utils.clip_grad_norm_파이토치 1.13.1훈련 안정성을 위한 그라디언트 클리핑(임계값: 1.0)
LR 스케줄링torch.optim.lr_scheduler파이토치 1.13.1선형 감쇠와 워밍업을 이용한 학습률 스케줄링
지표sklearn.metricsScikit-learn 1.1.3평가를 위한 피어슨 상관관계, MAE, RMSE 계산
PYTHON NEURAL NETWORK IMPPLEMENTATION
기본급토치.nn.모듈파이토치 1.13.1맞춤형 신경망 아키텍처(Fluency & 정확성 모듈)
선형 층토치.nn.선형파이토치 1.13.1선형 회귀 헤드 구현 (768→ 512번까지; 256 이하; 128→ 뉴런 1개)
정규화토치.nn.드롭아웃파이토치 1.13.1드롭아웃 정규화 (BERT 0.1, 회귀 헤드 0.3)
창설Torch.nn.functional.sigmoid파이토치 1.13.1유창성 점수 정규화를 위한 S결장 활성화 [0,1]
창설torch.nn.functional.relu파이토치 1.13.1비선형 변환을 위한 회귀층에서의 ReLU 활성화
트랜스포머트랜스포머. 버트모델트랜스포머 4.21.3유창성 평가를 위한 다중 헤드 자기 주의를 가진 12개의 트랜스포머 층
Seq2Seq트랜스포머. T5For
조건 생성
트랜스포머 4.21.3문법 오류 수정을 위한 인코더-디코더 아키텍처
손실 함수토치.nn.MSELoss파이토치 1.13.1유창성 회귀 훈련을 위한 평균 제곱 오차 손실 함수
PYTHON 평가 및 메트릭스 라이브러리
상관관계scipy.stats.pearsonrSciPy 1.9.3모델-인간 합의를 위한 피어슨 상관계수
오차 지표sklearn.metrics.mean_absolute_errorScikit-learn 1.1.3예측 정확도를 위한 평균 절대 오차(MAE) 계산
오차 지표sklearn.metrics.mean_squared_errorScikit-learn 1.1.3오차 크기 평가를 위한 평균제곱근(RMSE)
통계 검정scipy.stats.ttest_indSciPy 1.9.3통계적 유의성 검정을 위한 독립 표본 t-검정
상관 행렬numpy.corrcoef넘버피 1.23.5평가자 간 신뢰성을 위한 상관 행렬 계산
데이터 상관관계판다들. DataFrame.corr판다스 1.5.2데이터 상관관계 분석 및 통계 보고
시각화matplotlib.pyplotMatplotlib 3.6.2성과 시각화, 상관관계 그래프, 훈련 진행 차트
히트맵seaborn.히트맵씨본 0.12.1상관 행렬 시각화 및 통계 데이터 제시
PYTHON 텍스트 처리 및 NLP 라이브러리
텍스트 처리re(정규 표현식)Python 3.9+ 내장텍스트 패턴 매칭, 데이터 정제 및 전처리
구성 처리JSONPython 3.9+ 내장구성 파일 처리, 모델 매개변수 저장
연속화피클Python 3.9+ 내장모델 직렬화 및 체크포인트 저장/로딩
진행 상황 추적TQDM4.64.1학습 루프 및 데이터 처리용 진행 바
벌목벌목Python 3.9+ 내장학습 진행 기록, 오류 추적 및 디버깅
재현성무작위Python 3.9+ 내장재현 가능한 실험을 위한 무작위 시드 설정
파일 시스템OSPython 3.9+ 내장파일 시스템 운영, 모델 경로 관리
CLI 파싱argparsePython 3.9+ 내장훈련 구성을 위한 명령줄 인자 파싱
COMMERCIAL AWE / AES 플랫폼 (참고문헌)
상업용 플랫폼Pigai.org상업용 AWE 플랫폼중국어 EFL 글쓰기 평가, 자동 피드백 시스템
상업용 플랫폼빙고 영어상업용 AWE 시스템영어 학습 지원, 글쓰기 능력 개발
교육 플랫폼나의 접근교육용 글쓰기 플랫폼학생 글쓰기 평가 및 피드백 전달
점수 엔진E-raterETS 자동 점수 집기 엔진표준화 시험 에세이 채점, 전체론적 평가
평가 도구나-쓰기글쓰기 평가 도구학술 글쓰기 평가 및 진단 피드백
실무 근무기준ETS 글쓰기 실습 서비스글쓰기 기술 개발과 자동 피드백
AI 언어 모델ChatGPTOpenAI 언어 모델AI 지원 글쓰기 피드백 및 평가 (문헌에서 참고됨)
DEEP LEARNING ARCHITECTURES (문헌에 참조됨)
건축순환 신경망(RNN)차이, 2019순차 텍스트 처리 및 mdash; 피드백 시스템 작성 및 자동 평가
건축장기 단기 기억(LSTM)Jin 외, 2018장기 의존성 모델링 & mdash; 자동 에세이 채점 및 순서 분석
건축합성곱 신경망(CNN)동 외, 2017국소 패턴 인식 및 mdash; 점수 매기기를 위한 텍스트 분류 및 특징 추출
건축변압기-LSTM 하이브리드쉬안, 2025맥락 및 순차 처리 결합 & mdash; 자동 점수 산출 및 피드백 생성
건축변분 오토인코더(VAE)쿠마르 외, 2024생성 모델링 및 mdash; 향상된 글쓰기 기술 개발과 맞춤형 피드백
건축멀티 에이전트 시스템Thompson 외, 2024협업 AI 처리 및 mdash; 고급 글쓰기 지원 (AcademiCraft 플랫폼)
기전주의 기전동 외, 2017자기 주의와 다중 머리 주의 그리고 mdash; 향상된 AES 성능과 맥락 이해
<강한>전통 머신러닝 기법(참고문헌)
통계적 방법베이즈 정리러드너 & 량, 2002전통적인 머신러닝 접근법과 mdash; 초기 AES/AWE 개발 및 확률적 점수 산정
통계적 방법선형 회귀판디 외, 2015통계 모델링 & mdash; 특징 기반 글쓰기 평가 및 점수 예측
학습 방법순위 선호 학습첸 & 그, 2013년순위 기반 방법론 및 mdash; 비교 에세이 채점 및 선호 모델링
언어 모델N-그램 모델Xie 외, 2015통계적 언어 모델링 & mdash; 문법 오류 수정 및 패턴 인식
건축인코더-디코더 아키텍처Ge 외, 2018서열 간 모델링 & mdash; 문법 오류 수정 및 텍스트 변환
<강력>평가 기준 및 프레임워크
평가 기준IELTS 작문 평가채점 기준 적응유창성과 정확성에 대한 표준화된 평가 기준
평가 기준토efl 작문 평가학술 글쓰기 기준숙련도 평가 및 표준화된 채점
통계적 측정코헨의 d 효과 크기0.2=소형, 0.5=중형, 0.8=대형(large)개입 효과를 위한 실질적 유의 평가
신뢰성 측정인터레이터 신뢰성 (κ)유창성: 0.847 / 정확성: 0.823카파 계수 — 인간 평가자의 일관성 및 합의 검증

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bitchener, J. Evidence in support of written corrective feedback. J Second Lang Writ. 17 (2), 102-118 (2008).
  2. Nusrat, A., Ashraf, F., Narcy-Combes, M. F. Effect of direct and indirect teacher feedback on accuracy of English writing: A quasi-experimental study among Pakistani undergraduate students. 3L Lang Linguist Lit. 25 (4), 84-98 (2019).
  3. Nusrat, A., Khan, S., Kashif, F., Fawad, R. Effect of teachers’ asynchronous e-feedback and synchronous oral feedback on English language learners’ writing accuracy. Front Educ. 7, 783684 (2022).
  4. Chen, B., Bao, L., Zhang, R., Zhang, J., Liu, F., Wang, S., et al. A multi-strategy computer-assisted EFL writing learning system with deep learning incorporated and its effects on learning: A writing feedback perspective. J Educ Comput Res. 61 (8), 60-102 (2024).
  5. Li, J., Link, S., Hegelheimer, V. Rethinking the role of automated writing evaluation (AWE) feedback in ESL writing instruction. J Second Lang Writ. 27, 1-18 (2015).
  6. Ellis, R. Explicit form-focused instruction and second language acquisition. The handbook of educational linguistics. , 437-455 (2008).
  7. Shamim, F. Trends, issues and challenges in English language education in Pakistan. Asia Pac J Educ. 28 (3), 235-249 (2008).
  8. Haider, G. An insight into difficulties faced by Pakistani student writers: Implications for teaching of writing. J Educ Soc Res. 2 (3), 17-27 (2012).
  9. Nawaz, M., Hussain, S. A., Bughio, F. A. Exploring the preferred corrective feedback and practiced corrective feedback among Pakistani ESL secondary school students and teachers in writing class: Matches and mismatches. Int J Lang Lit Transl. 6 (1), 31-45 (2023).
  10. Rudner, L. M., Liang, T. Automated essay scoring using Bayes theorem. J Technol Learn Assess. 1 (2), 1-22 (2002).
  11. Phandi, P., Chai, K. M. A., Ng, H. T. Flexible domain adaptation for automated essay scoring using correlated linear regression. , 431-439 (2015).
  12. Cai, C. Automatic essay scoring with recurrent neural network. , 1-7 (2019).
  13. Jin, C., He, B., Hui, K., Sun, L. TDNN: A two-stage deep neural network for prompt-independent automated essay scoring. 1, 1088-1097 (2018).
  14. Dong, F., Zhang, Y., Yang, J. Attention-based recurrent convolutional neural network for automatic essay scoring. CoNLL. , 153-162 (2017).
  15. Sharma, A., Kabra, A., Kapoor, R. Feature enhanced capsule networks for robust automatic essay scoring. , 365-380 (2021).
  16. Mim, F. S., Inoue, N., Reisert, P., Ouchi, H., Inui, K. Corruption is not all bad: Incorporating discourse structure into pre-training via corruption for essay scoring. IEEE ACM Trans Audio Speech Lang Process. 29, 2202-2215 (2021).
  17. Cummins, R., Rei, M. Neural multi-task learning in automated assessment. arXiv. , 1-9 (2018).
  18. Cao, Y., Jin, H., Wan, X., Yu, Z. Domain-adaptive neural automated essay scoring. , 1011-1020 (2020).
  19. Jiang, Z., Liu, M., Yin, Y., Yu, H., Cheng, Z., Gu, Q., et al. Learning from graph propagation via ordinal distillation for one-shot automated essay scoring. , 2347-2356 (2021).
  20. Li, X., Chen, M., Nie, J. Y. SEDNN: Shared and enhanced deep neural network model for cross-prompt automated essay scoring. Knowl Based Syst. 210, 106491 (2020).
  21. Beseiso, M., Alzubi, O. A., Rashaideh, H. A novel automated essay scoring approach for reliable higher educational assessments. J Comput High Educ. 33 (3), 727-746 (2021).
  22. Xie, W., Huang, P., Zhang, X., Hong, K., Huang, Q., Chen, B., et al. Chinese spelling check system based on an n-gram model. , 128-136 (2015).
  23. Brockett, C., Dolan, W. B., Gamon, M. Correcting ESL errors using phrasal SMT techniques. , 249 (2006).
  24. Zhang, S., Huang, H., Liu, J., Li, H. Spelling error correction with soft-masked BERT. , 882-890 (2020).
  25. Ge, T., Wei, F., Zhou, M. Reaching human-level performance in automatic grammatical error correction: An empirical study. arXiv. , 1-15 (2018).
  26. Zhao, W., Wang, L., Shen, K., Jia, R., Liu, J. Improving grammatical error correction via pre-training a copy-augmented architecture with unlabeled data. 1, 156-165 (2019).
  27. Shermis, M. D., Koch, C. M., Page, E. B., Keith, T. Z., Harrington, S. Trait ratings for automated essay grading. Educ Psychol Meas. 62 (1), 5-18 (2002).
  28. Mizumoto, A., Shintani, N., Sasaki, M., Teng, M. F. Testing the viability of ChatGPT as a companion in L2 writing accuracy assessment. Res Methods Appl Linguist. 3 (2), 100116 (2024).
  29. Ajabshir, Z. F., Ebadi, S. The effects of automatic writing evaluation and teacher-focused feedback on CALF measures and overall quality of L2 writing across different genres. Asian Pac J Second Foreign Lang Educ. 8 (1), 26 (2023).
  30. Almusharraf, N., Alotaibi, H. An error-analysis study from an EFL writing context: Human and automated essay scoring approaches. Tech Knowl Learn. 28 (3), 1015-1031 (2023).
  31. Chen, H., Pan, J. Computer or human: A comparative study of automated evaluation scoring and instructors' feedback on Chinese college students' English writing. Asian Pac J Second Foreign Lang Educ. 7 (1), 34 (2022).
  32. Liu, X., Zhang, Y., Chen, L. The transformative impact of AI-powered tools on academic writing: Perspectives of EFL university students. Lang Learn Technol. 28 (2), 78-95 (2024).
  33. Zhang, Q., Li, F. From process to product: Writing engagement and performance of EFL learners under computer-generated feedback instruction. System. 115, 102998 (2023).
  34. Kumar, S., Patel, R., Williams, T. Automated deep learning approaches in variational autoencoders (VAEs) for enhancing English writing skills. J Educ Technol Res. 45 (3), 234-251 (2024).
  35. Martinez, A., Rodriguez, P., Thompson, K. Neural automated writing evaluation with corrective feedback. Comput Linguist. 50 (1), 123-145 (2024).
  36. Thompson, J., Anderson, C., Davis, R. AcademiCraft: Transforming writing assistance for English for academic purposes with multi-agent system innovations. Artif Intell Educ. 12 (4), 445-462 (2024).
  37. Rodriguez, M., Kim, S., Brown, D. Technology-enhanced language learning in English language education: Performance analysis, core publications, and emerging trends. Appl Linguist Rev. 15 (2), 201-225 (2024).
  38. Xuan, Y. Transformer-LSTM models for automatic scoring and feedback in English writing assessment. IEEE Access. 13, 82084-82096 (2025).
  39. Anderson, R., Smith, K., Johnson, M. The impact of AI writing tools on the content and organization of students' writing: EFL teachers' perspective. Comput Educ. 195, 104712 (2023).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

ESL

관련 논문