이 연구는 지능형 교육에서 교수 평가, 교정, 교육 형평성을 위한 새로운 접근법을 제공하는 것을 목표로 합니다. 실험 결과는 제안된 모델이 비교 모델보다 훨씬 우수한 성능을 보이며, 기존 보정 방법에서 다중 출처 데이터 통합과 공정성 편향 문제를 효과적으로 해결했습니다.
Research Article
이 연구는 지능형 교육에서 교수 평가, 교정, 교육 형평성을 위한 새로운 접근법을 제공하는 것을 목표로 합니다. 실험 결과는 제안된 모델이 비교 모델보다 훨씬 우수한 성능을 보이며, 기존 보정 방법에서 다중 출처 데이터 통합과 공정성 편향 문제를 효과적으로 해결했습니다.
현재의 교수 평가 보정 방법은 다중 출처 이질적 평가 데이터를 처리할 때 낮은 통합 효율성, 학문 분야 및 교육 시나리오 간 적응성 부족, 공정성 보장이 약한 결과 편향 등 도전에 직면해 있습니다. 이 연구는 교수 평가 데이터의 심층 모델링과 동적 보정을 위한 해석 가능하고 전이 가능하며 확장 가능한 공정성 보정 프레임워크를 구축하는 것을 목표로 합니다. 이러한 문제들은 지능 교육에서 균형 잡힌 교수라는 핵심 요구사항을 충족하기 어렵게 만듭니다. 본 연구는 생성적 적대적 네트워크와 그라디언트 부스트 의사결정 트리를 통합한 공정성 지향 교육 네트워크 알고리즘을 제안합니다. 이 알고리즘은 공정성 보정 메커니즘을 구성하고, 양방향 인코더 표현 모델과 그래프 주의 네트워크를 결합하여 특징 추출과 동적 적응성을 최적화하여 다중 출처 데이터 처리 효율성과 공정성 보정 정확도를 향상시킵니다. 이 접근법은 교수 평가에서 정밀한 교정과 공정성 보장을 달성합니다. 지표 테스트에서 모델은 평가 특성 클러스터링에서 98.76%, 공정성 보정에서 98.05%, 교차 시나리오 보정 일관성에서 0.968의 정확도를 달성했습니다. 손실값 검사 과제에서는 검증 세트의 교육 평가 수정 과제에서 모델의 총 손실이 0.1237에서 0.1018로 감소했습니다. 지표 테스트에서 모델은 평가 특성 클러스터링에서 98.76%, 공정성 보정에서 98.05%, 교차 시나리오 보정 일관성에서 0.968의 정확도를 달성했습니다. 실험 결과는 제안된 모델이 비교 모델보다 훨씬 우수한 성능을 보이며, 기존 보정 방법에서 다중 출처 데이터 통합과 공정성 편향 문제를 효과적으로 해결했습니다. 더 나아가, 기술 개발자를 위한 혁신적인 알고리즘 프레임워크와 교육 행정가를 위한 신뢰할 수 있는 기술 도구를 제공하여 교육 형평성을 증진합니다. 연구 기여는 다음과 같습니다: (i) 다중 출처 데이터 전처리, 동적 공정성 지수 검증, 설명 가능성 시각화를 포함한 세 가지 핵심 모듈 통합; (ii) 생성적 적대 네트워크와 그라디언트 부스트 트리의 협력적 최적화를 기반으로 한 공정성 보정 패러다임을 제안하여, 전통적인 단일 모델 보정의 한계를 뚫고 편차 모델링과 보정 의사결정의 분리된 학습을 가능하게 합니다.
교수 평가와 교정은 지적 교육에서 교수의 질을 보장하는 핵심을 이룹니다. 동적 분석, 오류 수정, 결과 교정을 통해 교육 개선과 개인 맞춤형 학습의 기반을 제공합니다. 정확성과 공정성은 지능 교육이 기술적 편견을 극복하고 균형 잡힌 교육 지원을 제공할 수 있는지에 직접적인 영향을 미칩니다 1,2. 하지만 기존 방법들은 여러 가지 단점이 있습니다: 단일 데이터 소스에 의존하고 실제 상황을 무시하며, 데이터 편향과 수정 편향을 초래합니다. 동적 공정성 적응 메커니즘의 부재는 학문 및 시나리오의 공정성 요구를 충족시키기 어렵게 만듭니다 3,4. 또한, 공정성 지표의 부족과 여러 출처의 이질적인 데이터를 다룰 때 보정 전략의 편향 같은 문제도 존재합니다. 이를 위해 학자들은 개선된 조밀 궤적 알고리즘에 기반한 테니스 보조 교수법 평가 등 다차원적인 연구를 수행해 왔습니다. Yin 등은 분석 계층 구조 과정과 퍼지 합성 알고리즘을 활용하여 온라인 강의를 모니터링했습니다. 첸은 향상된 데이터 마이닝 알고리즘을 사용하여 노인용 교육 데이터를 분석하여 교육 품질을 향상시켰습니다7.
이 연구들이 진전을 이루었음에도 불구하고, 보정 결과 편향과 공정성 조정 부족 같은 문제는 여전히 남아 있습니다. 따라서 정확한 교수 평가 보정과 동적 공정성 보장을 동시에 제공하는 모델을 구축하는 것이 지능형 교육의 연구 초점이 되었습니다. 생성적 적대적 네트워크(GAN)는 생성기와 판별자 간의 실시간 적대적 훈련을 통해 민감한 속성의 암묵적 영향을 제거하여, 결과가 라벨에 의해 유발된 편향이 아닌 핵심 요인에 의해 결정되도록합니다. GAN은 평가 데이터에서 집단 편향을 다루고 비선형 공정성 제약을 모델링하는 데 장점을 보여준다. Cheng 등은 저해상도 이미지를 다루기 위해 GAN 기반 이미지 향상 알고리즘을 제안했습니다. 생성기는 저해상도 입력에서 고해상도 이미지를 출력하고, 판별기는 생성된 이미지를 실제 고해상도 이미지와 구별합니다. 적대적 훈련은 매개변수를 최적화하여 생성기 출력이실제 이미지에 근접하도록 합니다. 9. Kang 등은 재생에너지 분야에서 다중 모달 데이터 처리 효율을 향상시키기 위해 교차 모달 GAN 모델을 제안했습니다. 생성기는 단일 모달 데이터를 받고, 판별기는 실제 멀티모달 데이터와 구별하며, 대립적 훈련은 효율성을 높이기 위해 모델을 최적화합니다. 구배 부스트 결정 트리(GBDT) 알고리즘은 강력한 특징 캡처 기능을 갖춘 구조화 데이터 처리의 고전적인 알고리즘입니다. 여러 의사결정 트리를 반복적으로 통합함으로써 GBDT는 데이터 오류 패턴을 정확히 학습하고, 다중 출처의 이기종 평가 정보 처리와 비선형 점수 편차를 보정하는 데 유리함을 보여줍니다11,12. Mizuno 등은 강우 재난에 대해 GBDT 기반 경로 예측 방법을 제안했으며, 경로 특징을 학습하고 실시간 데이터를 통해 재난 경로를 예측하며, 다중 의사결정 트리를 통해 최적의 예측을 선택했습니다13. Gao 등은 광고 클릭률 예측을 위한 GBDT 기반 시각 분석 방법을 개발했으며, 시각적 특징과 과거 클릭 데이터 간의 관계를 학습하여 신규 광고의 클릭률을 예측합니다.14. 위의 도전 과제를 바탕으로, 본 연구는 다음 핵심 과학적 질문에 체계적으로 답하고자 합니다: 다중 출처의 이질적 데이터를 효율적으로 통합하고, 다양한 교육 시나리오에 동적으로 적응하며, 동시에 보정 정확성과 결과 공정성을 보장하는 지능형 교육 평가 모델을 어떻게 구축할 수 있을까요? 이 질문에 답하기 위해 본 연구는 GAN의 공정성 제약 메커니즘과 GBDT의 정밀 오차 보정 능력의 시너지 효과를 활용합니다. 더 나아가, 자연어 처리(BERT), 강화 학습(RL), 주의 메커니즘(AM), 장기 단기 기억 네트워크(LSTM), 그래프 주의 네트워크(GAT), 지식 정류(KD) 등 첨단 기술을 도입하는 방법에 대한 연구가 진행되어 단일 모델의 특징 추출, 동적 적응, 추론 효율성 측면에서 고유한 한계를 보완할 수 있습니다. 궁극적으로 목표는 정확하고 공정하며, 지능 교육 분야에 강력한 일반화 능력을 갖춘 교수 평가 교정 솔루션을 제공하는 것입니다.
FairEduNet 알고리즘 설계 및 최적화
이 연구는 GAN과 GBDT를 결합하여 FairEduNet 알고리즘을 구성하여, 일방향 최적화의 트레이드오프 대신 공정성 보정과 정확도 보정이라는 이중 목표를 달성합니다. FairEduNet은 이중 채널 협업 아키텍처를 채택합니다: GBDT 백본 채널은 구조화된 오류 모델링과 정밀한 수정을 담당하고, GAN 보조 채널은 민감한 속성의 분리와 공정성 동적 조정에 집중합니다. GAN과 GBDT를 결합한 FairEduNet 알고리즘 아키텍처는 그림 1에 나와 있습니다.

그림 1: GAN과 GBDT를 결합한 FairEduNet 알고리즘 아키텍처. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.
그림 1에서 보듯, FairEduNet은 먼저 다중 출처 평가 데이터를 수집하고 전처리합니다. GBDT는 여러 의사결정 트리를 사용하여 평가 오차 패턴을 반복적으로 학습하고, 초기 보정 결과를 출력하여 GAN 모듈에 전달합니다. GAN은 판별기를 학습시켜 초기 보정 결과와 민감한 속성 간의 관계를 학습시키고, 생성기는 보정 매개변수를 동적으로 조정합니다. 여러 차례의 대립적 훈련과 공정성 검증을 통해 공정성 편향이 최적화됩니다. 마지막으로, 공정성 보정된 결과는 GBDT 모듈로 피드백되어 정확성과 공정성을 조정하여 교수 평가 교정 기초와 보고서를 출력합니다. GBDT는 식(1)에서 나타난 잔차를 계산합니다.
(1)
식(1)에서는 t
번째 반복에서 i번째 표본의 잔차를 나타내며, yi 는 실제 값을
, t-1번째 반복의 예측값을 나타냅니다. GAN 대립 과정은 식(2)에 나타난다.
(2)
식(2)에서 x는 초기 보정 결과를, z는 민감 속성 특징, Pdata(x)는 비민감성 특징의 진정한 분포, Pz(z)는 민감 속성 분포, D는 판별기, G는 생성기15를 나타냅니다. GBDT의 초기 보정 결과는 식(3)에 나타난다.
(3)
식(3)
에서 는 초기 결정 트리에 의한 i번째 샘플의 예측을, K는 전체 결정 트리 수를, γ k는 k번째 트리의 가중치를, hk(xi)는 i에 대한 k번째 트리의 예측 출력을 나타냅니다-샘플. FairEduNet 알고리즘은 교수 평가 데이터에 대한 정밀한 교정과 공정성 보장을 제공할 수 있습니다. 그러나 비정형 평가 데이터를 처리하고 동적 시나리오에 적응할 때, FairEduNet은 비정형 특성에 대한 특징 추출 능력이 약해 보정 편향이 발생합니다. 또한, FairEduNet의 공정성 지표와 보정 매개변수는 정적으로 설정되어 있어 다양한 교육 시나리오에 대한 적응성이 제한되고 전반적인 보정 품질에 영향을 미칩니다. 변환기(BERT)의 양방향 인코더 표현과 강화 학습(RL)의 결합인 BERT-RL 알고리즘은 비구조화 텍스트에서 깊은 특징을 정확히 추출하고 정적 임계값을 수동으로 설정하지 않고도 시나리오 매개변수를 동적으로 적응시켜 시나리오 간 알고리즘 출력의 신뢰성을 더욱 향상시킵니다16,17. TF-IDF와 같은 전통적인 방법은 단어 빈도에 의존하지만 깊은 맥락적 이해가 부족하여 상황에 따라 특정 '공정성'의 방향을 구분하지 못합니다. Word2Vec은 복잡한 맥락 변화에 적응하고 간접 편향을 인식하는 데 어려움을 겪는 정적인 단어 벡터를 생성합니다. BERT는 다층 자기 주의를 사용하여 양방향 맥락을 인코딩하며, 명시적 편향된 용어와 암묵적 편향된 논리를 모두 포착합니다. 전통적인 접근법은 수작업으로 편향된 단어 목록을 작성해야 하며, 주관적 경험에 의존하고 제한된 시나리오를 다룹니다. 사전 학습된 모델 전이 학습을 통해 BERT는 광범위한 수작업 없이도 깊은 의미적 특징을 자동으로 학습하여 모호한 편향을 인식하는 데 더 강력한 일반화를 제공합니다. 더불어, 전통적인 방법은 긴 텍스트로 인해 정보를 잃는 경우가 많지만, BERT는 최대 512개의 토큰을 지원하여 맥락적 관계를 유지하고 편향 특징을 정확히 위치시키며, 세밀한 공정성 보정을 가능하게 합니다. BERT-RL의 작동 과정은 그림 2에 나와 있습니다.

그림 2: BERT-RL 알고리즘 연산 흐름도. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.
그림 2에서 보듯이, BERT-RL은 먼저 비정형 텍스트 평가 데이터를 표준화하고 이를 BERT 모델에 입력합니다. BERT는 양방향 의미 모델링을 위해 트랜스포머 인코더를 사용하여 주요 특징을 추출하고 특징 행렬을 구성합니다. 특징 행렬은 이후 RL 모듈에 입력되며, RL 모듈은 여러 반복을 통해 최적의 전략을 학습합니다. 최적화된 매개변수 구성은 최종적으로 FairEduNet에 입력되어 적응성을 향상시킵니다. BERT 자기 주의 특징 가중치 계산은 식(4)에 나와 있습니다.
(4)
식(4)에서 dk 는 벡터 K의 차원을 나타낸다. RL 다목적 보상 함수는 식(5)에 표현되어 있습니다.
(5)
식(5)에서 ω1, ω 2, ω3 은 가중치 계수,
보정 오차, Dt 는 공정성 편차, D타겟 은 타겟 공정성 편차, Tt는 실행 시간18을 나타냅니다. 이 연구는 BERT-RL과 FairEduNet을 결합하여 BFEN이라 불리는 BERT-RL-FairEduNet 알고리즘을 형성했습니다. BFEN은 GBDT 기능 반복과 GAN 실시간 대립 훈련을 통해 평가 데이터를 가르치는 정밀한 보정 및 공정성 보장을 달성하며, BERT-RL은 비정형 데이터 처리와 시나리오 동적 적응에 최적화되어 특징 추출과 정적 매개변수 한계의 약점을 해결합니다. 연구는 BERT-base-Chinese 모델을 사용했으며, 2024-2025 학년도에 국가 스마트 교육 플랫폼의 실제 교수 기록, 교실 녹화 텍스트, 교육 정책 문서 말뭉치를 사전 학습하여 어휘 크기는 21128개였습니다. 모델의 숨겨진 층 차원은 768이며, 12개의 주의 머리와 12개의 층을 가집니다. GBDT 트리의 깊이는 8로 설정되었고, 트리 수는 200개였으며, 학습률은 0.1이었습니다. GAN의 훈련 주기는 150발이며, 판별기는 512, 256, 1 크기의 3층 완전 연결 네트워크를 사용합니다. 이 발전기는 1024, 512, 256, 1 크기의 4계층 완전 연결 네트워크를 사용합니다. LSTM의 숨겨진 유닛 수는 128개이며, 시퀀스 길이는 512개입니다. GAT는 2개의 레이어와 4개의 어텐션 헤드를 가지고 있습니다. 지식 증류의 온도는 3.0으로 설정되어 있습니다. RL 보상 가중치 계수는 ω1 = 0.4, ω2 = 0.35, ω3 = 0.25입니다. 가중치 선택 기준은 다목적 최적화의 파레토 전면 균형과 교육 형평성 관행의 해석 가능성 요구사항 사이의 균형을 맞추기 위한 것입니다. 실험은 교차 검증과 하이퍼파라미터 튜닝을 통해 50% 데이터를 분할하여 완료되었습니다. BFEN 교육 평가 교정 과정은 그림 3에 나와 있습니다.

그림 3: 지능 교육 및 교수 평가를 위한 BFEN 알고리즘의 보정 과정. 이 그림의 확대 버전을 보시려면 여기를 클릭하세요.
그림 3에서 볼 수 있듯이, BFEN은 먼저 다중 출처 교수 평가 데이터를 전처리합니다. BERT는 의미 창을 기반으로 텍스트 의미 유사성과 깊은 특징 가중치를 계산하여 고차원 의미 특징 행렬을 구성할 중요한 특징을 선택하여 FairEduNet의 특징 추출 능력을 최적화합니다. 그 후 RL은 다중 목적 보상 함수를 설정하고 시나리오 적응성 및 매개변수 조정 기울기를 계산하여 공정성 임계값과 보정 매개변수를 더욱 최적화합니다. FairEduNet은 평가 데이터와 오류 패턴 모델 간의 편차를 계산하고, 의사결정 트리 가중치를 반복적으로 업데이트하며, 오류가 미리 설정된 임계값 내에서 안정화될 때까지 보정 전략을 조정합니다. 최종 결과물에는 오류 보정 모델과 공정성 검증 보고서가 포함됩니다. 교정 모델은 교수 평가 데이터에 적용되어 사전 및 사후 교정 비교표를 생성하고, 이를 지능형 교육 공정성 표준 라이브러리와 결합하여 목표 교정 매개변수를 결정하여 지능형 교육에서 교육 평가 교정의 과학적 기반을 제공합니다. 이 표준 도서관은 교육 기회 공정성, 과정 공정성, 성과 공정성의 세 가지 차원을 다루며, 12개의 핵심 지표를 포함하고 있습니다. 이 지표에는 지역 간 교육 자원 배분 균형, 도시와 농촌 학교 간 디지털 인프라 적용 차이, 학습 상황 진단에 대한 지연 응답 허용 임계치(≤200ms), 다중 모드 평가에서 누락된 데이터에 대한 허용치(≤3.5%), 알고리즘 편향 감지 민감도(성별/지역/단계 라벨링에 따른 AUC 편차≤ 0.02) 등이 포함됩니다. 교정 전후 점수 분포의 KL 발산 임계값(≤0.08), 교사 개입 제안의 해석 가능성 점수(≥4.2/5.0), 학생 프로필 업데이트의 시기성(T + 1일 이내에 완료), 크로스 플랫폼 학점 인정의 일관성 계수(≥0.93), 교육 정책 의미 정렬의 정확성(BERT 점수 ≥ 0.86), 공정성 검증 보고서 생성의 완전성(편향 귀속 포함), 신뢰구간과 재현 가능한 매개변수 스냅샷), 그리고 라이브 교실, 비동기 과제, AI 조교 등 세 가지 전형적인 시나리오를 포함하는 동적 시나리오 적응 검증 합격률도 포함됩니다. 의미적 특징 유사성 계산은 식(6)에 나와 있습니다.
(6)
식(6)에서 fi 는 i번째 의미적 특징 차원의 값을, gi 는 i번째 중요한 평가 특징 차원의 값을, n은 총 특징 차원의 수를 나타냅니다. RL 시나리오 적응 매개변수 계산은 식(7)에 나와 있습니다.
(7)
식(7)에서 θt는 t번째 반복에서의 매개변수 값을, α는 학습률을
, 보상 함수 R(θt)에 기반한 매개변수 기울기를 나타낸다.
교육 평가 교정 모델 구축
BFEN은 교육 평가 보정에서 특정 장점을 보여주지만, 다중 출처 이종 평가 데이터에 대한 낮은 통합 효율성과 실제 적용에서의 동적 공정성 적응이 부족한 점에 직면해 있습니다. AM-LSTM 알고리즘은 주의 메커니즘(AM)과 장기 단기 기억(LSTM)을 결합하여 AM을 통해 다중 출처 평가 데이터의 주요 특징에 가중치를 부여하고, LSTM의 순차 기억 기능을 사용해 시간에 따른 평가 데이터의 동적 변화 패턴을 포착합니다. 이 접근법은 멀티소스 데이터 통합 효율성과 동적 특징 학습을 효과적으로 향상시킵니다 19,20. AM-LSTM의 작동 과정은 그림 4에 나와 있습니다.

그림 4: AM-LSTM 운용 흐름도. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.
그림 4에서 보듯이, AM-LSTM은 먼저 다중 출처의 이기종 교수 평가 데이터를 전처리하여 표준화된 데이터셋을 만듭니다. AM은 다양한 데이터 소스의 특징에 대한 주의 가중치를 계산하여 중요한 특징을 선택하고, 가중치가 부여된 특징 행렬을 구성합니다. 가중치가 부여된 특징 행렬은 LSTM에 입력되며, LSTM은 게이팅 메커니즘을 사용해 시간에 따른 동적 패턴을 학습하고, 평가 데이터 간 관계를 포착하며, 동적 특징 벡터를 출력합니다. 마지막으로, 이러한 동적 특징 벡터는 공정성 제약과 결합되어 다중 출처 데이터 통합 및 동적 시나리오에 적응하는 중간 보정 결과를 생성하여 이후 모델 최적화의 기반을 제공합니다. 주의 가중치 계산은 식(8)에 나와 있습니다.
(8)
식(8)에서 n 은 n번째 특징에 대한 주의 할당을, xn 은 유사성, q는 쿼리 벡터, softmax는 활성화 함수를 나타냅니다. LSTM 포겟 게이트는 식(9)에서 표현됩니다.
(9)
식(9)에서 Wf는 포겟 게이트 가중치, bf 는 포겟 게이트 바이어스, xt 는 시간 t에서의 입력, ht-1은 시간 t-1에서의 외부 상태 변수, σ는 시그모이드 함수21을 나타낸다. 본 연구는 AM-LSTM과 BFEN을 결합하여 FBFEN이라 불리는 AM-LSTM-BFEN 교육 평가 교정 모델을 구축합니다. 이 모델에서 AM-LSTM은 BFEN의 다중 소스 이기종 데이터 통합 효율성과 동적 특징 추출의 한계를 해결합니다. 또한 공정성 제약을 통합하여 중간 보정 결과를 최적화하여, BFEN이 교수 평가 데이터에 대한 정밀한 보정과 동적 공정성 보장을 더욱 달성할 수 있게 합니다. FBFEN의 작동 과정은 그림 5에 나와 있습니다.

그림 5: FBFEN 교육 평가 및 교정 모델의 운영 과정. 이 그림의 확대 버전을 보시려면 여기를 클릭하세요.
그림 5에서 보듯이, FBFEN은 먼저 원래의 다중 출처 교수 평가 데이터를 전처리하고 표준화된 데이터셋을 AM-LSTM 모듈에 입력합니다. AM은 특징 주의 가중치를 계산하는 반면, LSTM은 동적 패턴을 학습하여 다중 출처 정보와 동적 특징을 통합한 중간 보정 결과를 출력합니다. 중간 결과는 BFEN 모듈에 입력됩니다. GBDT는 중간 결과와 미리 설정된 오차 모델을 바탕으로 평가 데이터의 오차 패턴을 반복적으로 학습하여 예비 보정 결과를 출력합니다. 한편, GAN은 생성기와 판별기 간의 대립적 훈련을 통해 예비 결과의 민감한 속성으로 인한 공정성 편향을 분석하며, 편향을 제거하기 위해 보정 매개변수를 동적으로 조정합니다. 마지막으로, GAN에 최적화된 보정 매개변수를 GBDT에 피드백하여 결정 트리 가중치와 보정 전략을 업데이트하여 정밀도와 공정성을 균형 있게 하는 2차 보정 결과를 생성합니다. 데이터 표준화는 식(10)에 표현되어 있습니다.
(10)
식(10)에서 z'는 표준화된 값을, z는 원래 값을, zmin 과 z max 는 최소값과 최대값을 나타냅니다. GAN 생성기의 최종 목적 함수는 식(11)에 표현되어 있습니다.
(11)
식(11)에서 N은 반복 횟수를, λ는 손실 가중률 인수를, ωi는 i번째 반복의 가중치 인자를,
대적적 손실 함수를,
이진 교차 엔트로피 손실을 나타냅니다.
FBFEN 교육 평가 보정 모델 최적화
FBFEN은 강력한 다중 출처 데이터 통합과 동적 공정성 보장을 교수 평가 보정에서 입증하지만, 복잡한 모델 구조와 복잡한 교육 시나리오로 인해 특징 상관관계가 약하고 훈련 및 추론 효율성이 낮은 문제를 겪고 있습니다. 그래프 주의 네트워크(GAT)와 지식 증류(KD)를 결합한 GAT-KD 알고리즘은 GAT의 주의 메커니즘을 통해 특징 간 의미 연관 그래프를 동적으로 구성하여 다중 출처 데이터의 의미적 정렬을 향상시킵니다. KD는 복잡한 모델의 지식을 경량 네트워크에 압축하여 추론 효율성을 크게 향상시키면서도 모델 성능을 유지합니다23,24. GAT-KD의 작동 과정은 그림 6에 나와 있습니다.

그림 6: GAT-KD 운영 흐름도. 이 그림의 더 큰 버전을 보려면 여기를 클릭해 주세요.
그림 6에서 보듯, GAT-KD는 GAT 모듈을 통해 특징 간 의미 연관 그래프를 구성하고, 주의 메커니즘을 이용해 동적으로 이웃 특징 정보를 집계하며, 국소 특징의 의미 표현을 향상시킵니다. KD는 출력 소프트 라벨을 감독 신호로 사용하여 출력 분포 간 발산 손실과 예측과 진짜 라벨 간 교차엔트로피 손실을 최소화하여 지식 전달과 모델 압축을 달성합니다. 최종 결과물은 높은 정밀도와 효율성을 갖춘 경량 보정 모델입니다. GAT 주의 계수 계산은 식(12)에 나와 있습니다.
(12)
식(12)
에서 노드
i와 j의 특징 벡터를 나타내며, W는 학습 가능한 가중치 행렬, a는 주의 가중치 벡터,
연결은 연산, LeakyReLU는 활성화 함수25를 나타냅니다. KD 손실 함수 계산은 식(13)에 나와 있습니다.
(13)
식(13)에서 KL은 발산 손실을, T2는 기울기 스케일링 밸런스를, p학생은 경량 모델의 소프트 라벨 확률을, p는 복소수 모델26의 소프트 라벨 확률을 나타낸다. 주의 강화 기능 연관과 경량 지식 전이를 결합함으로써, GAT-KD는 특징 의미 편향과 높은 계산 복잡도를 효과적으로 해결합니다. 이 연구는 GAT-KD를 FBFEN에 통합하여 GFBFEN이라 불리는 GAT-KD-FBFEN 교육 평가 교정 모델을 형성합니다. GAT-KD는 불완전한 다중 소스 특징 상관관계 캡처와 낮은 추론 효율성이라는 FBFEN의 단점을 최적화합니다. GFBFEN의 작동 과정은 그림 7에 나와 있습니다.

그림 7: GFBFEN 교육 평가 및 교정 모델 운영 과정. 이 그림의 확대 버전을 보시려면 여기를 클릭하세요.
그림 7에서 볼 수 있듯이, GFBFEN은 다중 출처 교수 평가 데이터를 표준화합니다. GAT는 특징 간 복잡한 관계를 모델링하고, 주의 메커니즘을 이용해 노드 간 의미적 연관 가중치를 동적으로 계산합니다. KD는 복잡한 모델의 지식을 경량 네트워크에 압축하여 정밀도를 유지하면서 추론 효율성을 크게 향상시킵니다. AM-LSTM 모듈은 다중 출처 특성에 중요도 가중치를 할당하고 평가 데이터의 시간적 동적 패턴을 포착하여 다중 출처 정보를 통합하는 중간 보정 결과를 출력합니다. 이 결과들은 BFEN 모듈에 입력되어 딥 프로세싱을 수행합니다. 구체적으로, BERT는 비구조화 텍스트에서 의미적 특징을 추출하고, RL은 공정성 임계값과 보정 매개변수를 동적으로 최적화하며, GBDT는 예비 보정을 위해 반복적으로 오류 패턴을 학습하고, GAN은 적대적 훈련을 통해 민감한 속성에 따른 편향을 제거합니다. 동적 매개변수 조정 메커니즘은 실시간 교수 장면의 시간 변화와 그룹 분포 이동을 감지하여 각 모듈의 응답 민감도와 공정성 가중치를 자동으로 보정하여, 정적 매개변수 구성으로 인한 적응성 부족 문제를 해결하고, 모델이 다양한 교육 단계에서 견고성과 공정성을 유지할 수 있도록 보장합니다. 학생 그룹과 평가 시나리오. 평가 유형은 시계열 모델링의 세분성과 피드백 주기에 직접적인 영향을 미치는 반면, 형성적 평가는 과정의 역동적인 특성을 강조합니다. 학문 분야별 차이가 BERT와 GBDT 모듈 간 특징 배분을 결정합니다. 따라서 동적 조정 메커니즘을 채택하면 다양한 평가 유형과 학문 특성에 효과적으로 적응할 수 있습니다. 마지막으로, 여러 차례의 매개변수 피드백과 반복적 최적화를 통해 모델은 정확하고 공정한 교육 평가 보정 결과를 출력합니다. 동적 공정성 제약 최적화 함수는 식(14)에 표현되어 있다.
(14)
식(14)에서 S는 민감한 속성 집합을 나타내고,
예측된 출력 보정 결과를 나타내며,
그룹 내 예측 분산을, 그룹 간 매개변수
γ 전체 기대값을 나타냅니다. 다중 소스 특징 융합 가중치의 적응형 계산은 식(15)에 나와 있습니다.
(15)
식(15)에서 wk는 k번째 데이터 소스의 특징 가중치를, β는 가중치 매개변수를, Sim은 특징 유사도 측정 함수를, fk 는 k번째 데이터 소스에서 추출한 특징 벡터를, fglobal 은 전역 특징 중심을, K는 는 전체 데이터 소스의 수를 나타냅니다. 이 연구는 성별, 민족, 지역, 가족 경제적 지위, 모국어 배경 등 민감한 속성의 가중치를 설정했습니다. 가중치는 상관분석 결과를 바탕으로 결정됩니다. 연구는 피어슨 상관계수와 스피어먼 순위 상관계수를 이중 지표로 사용하여 관절 평가를 수행했으며, 교육 분야 전문가 경험을 결합해 체중 교정을 수행하였습니다. 각 민감 속성에 대한 최종 가중치 결정 결과, 성별은 0.18, 민족은 0.22, 지역은 0.25, 가족 경제 상태는 0.19, 모국어 배경은 0.16이었습니다. 성별: 법적 등록 및 자기 정체성에 따른 성 정체성, 이분법(남성/여성)과 논바이너리 옵션; 데이터 필드 "성별". 민족성: 56개 집단의 국가별 민족 식별을 기반으로 하며, 미확인 및 국경을 넘는 집단과 호환됨; 데이터 필드 "민족성". 지역: 가구 등록 또는 장기 거주의 행정 구분으로, 성, 시, 현 단위를 포함하며, 도시-농촌 이중 구조와 이주 인구를 고려합니다; 데이터 필드 "region". 가족 경제 상태: 국가 통계 기준 및 교육 지원 지표에 따르면, 5단계 분류를 사용; 데이터 필드 "economic_status". 모국어 배경: 기본 교육 중 기본 교육 및 가족 의사소통 언어로, 만다린어, 소수 언어, 방언, 외국어를 포함하며, 습득 연령과 빈도에 따라 가중치를 부여; 데이터 필드 "mother_tongue."
교정 과정은 3단계의 동적 가중치(dynamic) 가중치를 채택했습니다. 첫 번째 단계는 민감한 속성의 가중치 행렬을 기반으로 초기 편차 식별을 구현했으며, 성별, 민족, 지역 등 차원에서 글로벌 특징 중심에서 유의미하게 벗어난 데이터 포인트를 표시했습니다. 두 번째 단계는 교육 맥락 제약을 도입하여 편차 강도를 맥락 인식 방식으로 재평가합니다. 세 번째 단계는 반사실적 섭동 테스트를 통해 보정 안정성을 검증하고, 민감한 속성의 값을 체계적으로 교체하면서 비민감 특징은 변경하지 않으며, 평가 점수 변화가 ±±3.2% 임계값 내에 있는지 관찰합니다.
BFEN 알고리즘 성능 분석
실험에서 평가된 지표들은 다음과 같다:
평가 수정 정확도(ECA)는 교육 평가 결과 내에서 모델에 의해 올바르게 식별되고 수정된 편차 항목의 비율을 나타내며, 이는 교정 메커니즘의 전반적인 효과를 반영합니다. 수치가 높을수록 보정 정확도가 우수함을 의미합니다.
공정성 편차율(FDR)은 모델이 보정 과정에서 제거하지 못한 그룹 간 점수 격차의 크기를 측정합니다. 점수 분포 내 각 민감 속성(예: 성별, 지역, 민족)의 표준편차와 전체 표준편차의 비율로 계산됩니다; 낮은 가치는 그룹 간 분산이 최소화되고 공정성 보장이 더 강해집니다.
시나리오 적응률(SAR)은 모델이 이질적인 교육 환경(예: 과학 vs. 인문학, 온라인 vs. 오프라인 환경)에서 성공적으로 수행한 수정 과제의 비율을 나타냅니다.
공정성 유지 정도(FMD)는 보정 후 민감한 속성 그룹 간 공정성 지표 분산과 보정 전 관측 비율을 1에서 뺀 값으로 정의되며, 보정 과정에서 시스템이 구조적 공정성을 유지할 수 있는 능력을 반영합니다.
학문적 특징 인식률(DFRR)은 각 학문 분야별 평가 데이터 내에서 핵심 특징이 올바르게 식별된 샘플의 비율을 전체 평가 샘플 크기에 비해 계산하여, 모델이 도메인별 변이를 식별하고 포착하는 능력을 보여줍니다.
다중 출처 데이터 융합 효율(MDFE)은 다중 출처 이기종 평가 데이터를 융합할 때 특징 정렬, 가중치 할당 및 편차 보정 시 모델의 처리량 효율성을 의미합니다. 이 포괄적인 지표는 초당 처리되는 평가 샘플 수(샘플/초)와 보정 일관성 준수율(>95% 신뢰수준에서)의 곱으로 정의되며, 값이 높을수록 더 효율적이고 안정적인 융합 파이프라인을 의미합니다.
보정 결과 안정성(CRS)은 동일한 입력 하에서 각 실행 간 보정 출력 유클리드 거리의 표준편차의 역수로 수치화된 여러 독립 실행에 걸친 보정 출력의 일관성을 나타냅니다. 높은 값은 시스템 신뢰성이 향상됨을 의미합니다.
단일 데이터 보정 시간(SDCT)은 모델이 단일 평가 샘플의 보정을 완료하는 데 소비하는 평균 계산 지연 시간을 나타, 밀리초(ms) 단위로 측정됩니다; 낮은 수치는 더 강력한 실시간 대응 능력을 나타냅니다.
보정 절대 오차(CAE)는 보정된 예측값과 실제 진실 값 간의 평균 절대 오차를 측정하며, 이는 원래 보정되지 않은 데이터에 비해 모델의 잔류 편차를 나타냅니다. 값이 낮을수록 보정된 출력이 실제 성능 수준에 더 가깝다는 의미입니다.
보정 상대 오차(CRE)는 보정된 예측값과 실제 진실값 간의 평균 절대 오차를 기준 진실의 백분율로 표현하며, 값이 낮을수록 상대 보정 정밀도가 높음을 나타냅니다.
보정 정확도율(CAR)은 보정 후 절대 오차가 전체 표본 크기에 비해 < 0.5인 샘플의 비율을 나타내며, 미리 정의된 정밀도 제약 조건을 만족하는 모델의 신뢰성을 보여줍니다. 높은 가치는 결과물의 실증적 유용성과 신뢰성을 입증합니다.
총 손실 값(TL)은 작업 완료 시 개별 하위 손실 항들의 가중 합산에서 도출된 포괄적인 최적화 목표 값을 나타냅니다. 구체적으로, DFRR, MDFE, CRS, SDCT, CAE, CRE, CAR의 7가지 지표가 Z-점수 정규화를 통해 표준화되고 평가 작업의 운영 우선순위에 따라 가중치가 부여됩니다. 가중 벡터 [0.15, 0.12, 0.1, 0.08, 0.13, 0.12, 0.1]가 주어지면, 이 7개의 정규화된 지시 값을 집계하여 최종 손실을 계산합니다.
평가 특징 군집 정확도(EFCA)는 모델이 생성하는 비감독 군집화 구성과 도메인 전문가가 검증한 실제 범주 간의 정렬 정도를 평가합니다.
고차원 데이터 처리 효율(HDPE)은 ≥50개의 평가 특징을 포함하는 고차원 희소 벡터를 처리할 때 단위 시간당 특징 차원 감소 및 편차 보정을 받는 샘플 수를 측정합니다. 초당 샘플 단위로 측정할 때, 높은 값은 복잡하고 대규모 평가 입력을 실시간으로 처리할 수 있는 더 견고한 능력을 반영합니다.
공정성 보정 정밀도(FCP)는 서로 다른 학생 집단에서 보정 효과의 균일성을 평가합니다. 이 계량은 민감한 속성 부분군 간 보정된 절대 오차에 대한 콜모고로프-스미르노프 거리의 분포 평균을 계산하여 정량화됩니다; 낮은 값은 더 균형 잡힌 그룹 간 성과와 더 강력한 공정성 보장을 의미합니다.
장면 간 보정 일관성(CSCC)은 교실 평가, 실기 평가, 온라인 테스트라는 세 가지 전형적인 시나리오에서 보정 결과의 분포 오프셋을 Wasserstein 거리 비율로 모델링하여 정량화합니다.
제안된 BFEN 교육 평가 교정 알고리즘의 성능을 검증하기 위해, 연구는 이를 주성분 분석(PCA)과 무작위 숲(RF)을 결합한 PRF 알고리즘과 비교했습니다; 극한 학습 기계(ELM)와 적응형 부스팅(AdaBoost)을 결합한 EAB 알고리즘; 그리고 딥 빌리프 네트워크(DBN)와 로지스틱 회귀(LR)를 결합한 DBLR 알고리즘이 있습니다. 이 실험들은 인텔 코어 i9-13900HX 프로세서와 NVIDIA RTX 4080 GPU가 탑재된 시스템에서 진행되었으며, 대규모 교육 평가 데이터의 특징 추출 및 보정 계산을 효율적으로 수행할 수 있도록 고병렬 컴퓨팅 능력과 대형 비디오 메모리를 제공했습니다. 운영체제는 Windows 11이었고, 프로그래밍에는 Python 3.9가 사용되었습니다. 알고리즘은 Scikit-learn 라이브러리를 사용하여 구현되었고, 딥러닝 모듈은 TensorFlow 프레임워크를 통해 개발되었으며, Pandas와 NumPy 라이브러리는 데이터 전처리를 위해 사용되었습니다. 개발 환경은 PyCharm Professional 2023.1을 사용했으며, Seaborn은 알고리즘 성능을 직관적으로 비교하기 위해 보정 결과 시각화에 적용되었습니다. 데이터의 신뢰성을 보장하기 위해 연구는 글로벌 교육 모니터링 보고서 데이터셋1 과 스페인어 중학생 학업 성과 데이터셋2를 활용했습니다. 이 데이터셋은 12,486개의 기록을 포함하며, 대학 교수 평가, 학생 학업 성과, 학생 교육 평가, 강의 피드백 등 다중 교육 평가 데이터를 포함하며, 교실 상호작용 빈도, 과제 피드백 시기성, 점수 일관성, 언어 포용성, 문화 간 민감성 등 137개의 교육 차원 특징을 포함합니다. 목표 변수는 교수 평가 점수로, 이 연구에서는 전문가들이 보정한 다차원 가중 복합 값으로 매핑됩니다. 이 연구는 학생 교수 평가, 동료 평가, 지도 교실 관찰, 교수 보고서 검토 등 네 가지 유형의 정보원을 통합하며, 각각 0.35, 0.25, 0.25, 0.15의 가중치를 가지고 있습니다. 학습 및 검증 세트는 두 데이터셋에서 시간 순서대로 나누어집니다. 이 연구는 2024년 9월의 데이터를 훈련 세트로, 2024년 10월부터 2025년 6월까지의 데이터를 검증 세트로 사용하여 교육 평가의 시간적 진행 상황에 맞춥니다. 전처리 단계에서는 모달리티별 전략이 사용되며, 구조화된 특징은 Z-점수 정규화와 이상치를 윈소라이즈하여 표준화하고, 텍스트 특징은 BERT 기반 중국어 모델을 사용해 768차원으로 축소합니다. 적대적 훈련은 암묵적 편향 표현에 대한 견고성을 높이고 문화적 배경 차이로 인한 의미 변동을 완화하기 위해 적용됩니다.
교차 영역 교육 및 검증 연구를 달성하기 위해, 이 모델은 K-12 기초 교육, 직업 교육, 평생 교육, 그리고 국제 중국어 교육의 네 가지 이질적 교육 시나리오로 전환되어 표본 검증이 0점 또는 소수로 이루어집니다. 이 네 가지 시나리오에서 본 연구는 알고리즘 훈련 중에 도메인 적응 정규화 항을 도입하여 서로 다른 교육 시나리오에서 모델의 특징 분포의 일관성을 제한합니다. K-12 시나리오에서 짧은 문장 잡음을 위한 경량 문법 인식 마스크 메커니즘 내장; 직업 교육에서 전문 용어의 모호함을 해결하기 위해, 동적 도메인 사전이 구축되어 교육과정 개요 지식 그래프와 통합됩니다. 세대 간 의미 격차를 해결하기 위한 연령대 비교 학습 모듈을 설계하고, 잠재 공간에서 연령대 평가 표현에 대한 의미적 앵커를 정렬합니다. 국제 중국어 교육에서 문화적 부담 표현을 해결하기 위해, 비문자적 교육 개념 이해의 견고성을 높이기 위해 언어 간 비교 프롬프트를 사용해 미세 조정을 합니다. 원본 평가 기록에서 구조화된 필드에 대한 전문가 보정 및 신뢰성 시험에 관한 연구, 크리펜도르프 알파 계수가 0.75 미만인 저신뢰도 항목을 제거함. 학생 평가 텍스트에 대해 이중 맹검 수동 주석이 적용되었으며, 3명의 교육 측정 전문가가 독립적으로 편차형 라벨링을 완료하여 주석에서 코헨의 k = 0.86 일관성을 달성했습니다. 마지막으로, 주석이 달린 결과를 감독 출석 기록 및 강의 파일 검토 결론과 교차 검증하여 최종 교정 라벨을 생성하였습니다.
선정된 데이터셋은 서로 다른 인구, 측정 체계, 교육 배경에서 출발했습니다. 이 교차 도메인 검증 패러다임은 진정한 교육 생태계 내에서 모델의 견고성과 일반화 경계를 엄격히 검증하여 데이터 동질화로 인한 평가 착각을 방지했습니다. 두 저장소 모두 방대한 양의 교수 평가 기록을 보유하고 있어 공정성 인식 지능형 교육 알고리즘 배포에 직접적인 참고 가치를 제공했습니다. 두 데이터셋 모두 상당한 교수 평가 데이터를 포함하고 있어, 공정성 인식 지능 교육 알고리즘 설계와 교수 평가 보정에 직접적인 참조값을 제공했습니다. 연구는 네 가지 알고리즘으로 1000건의 교육 평가 기록을 보정하고 ECA와 공정성 FDR을 계산했습니다. 결과는 그림 8에 나와 있습니다.

그림 8: ECA와 FDR 간 검사 결과 비교. (A) BFEN. (B) PRF. (C) EAB. (D) DBLR. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 8A에 보시다시피, BFEN은 평가 교정 과제에서 초기에는 ECA 82.47%, FDR 5.71%를 달성했습니다. 보정된 기록 수가 증가함에 따라 ECA는 98.75%로 상승해 421개의 기록을 보정한 후 안정화되었고, FDR은 2.87%로 감소하여 514개의 기록을 보정한 후 안정화되었습니다. 그림 8B에서 보듯이, PRF 알고리즘의 ECA 곡선은 점차 증가한 반면, FDR 선은 서서히 감소했습니다. 보정 과제가 끝날 때 ECA 값은 92.30%, PDR 값은 6.72%였습니다. 그림 8C는 EAB 알고리즘의 ECA 곡선이 급격히 상승했다가 평탄화되었음을 보여주며, FDR(자유 편방 곡선) 궤적은 수렴 전 초기 단계에 심각한 변동을 보여 ECA가 84.64%, FDR이 8.93%로 끝났음을 보여줍니다. 그림 8D에 설명된 바와 같이, DBLR 알고리즘은 느린 상승 ECA 궤적과 한계 변동, 제한된 압축을 동반하여 FDR 라인에서 ECA 83.51%, FDR 8.42%로 보정 작업을 마쳤습니다. 이 실험 결과는 BFEN 알고리즘이 평가 수정 정확도와 공정성 편향 제어 모두에서 기준선 접근법보다 훨씬 우수한 성과를 보임을 확인시켜 줍니다. 이러한 우수한 일반화 능력은 BFEN 내 BERT의 통합에 기인하며, 이는 비구조화된 평가 텍스트에서 깊은 의미적 특징을 추출하여 숨겨진 편향 표현을 포착하고, RL 모듈은 다중 목표 보상 함수를 통해 공정성 임계값과 보정 매개변수를 동적으로 최적화하여 민감한 속성을 최종 출력에서 분리합니다. 연구는 이후 SAR과 FMD를 교실 평가, 기말고사, 실기 평가, 온라인 평가에 대해 테스트했으며, 네 가지 시나리오를 A, B, C, D로 분류했습니다. 결과는 그림 9에 나와 있습니다.

그림 9: SAR과 FMD 비교 결과는 서로 다른 시나리오에서 나옵니다. (A) SAR 검사 결과. (B) 구제역 검사 결과. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 9A에서 보듯, BFEN은 모든 교육 시나리오에서 98% 이상의 SAR을 달성했으며, 교실 시험에서 가장 높은 SAR은 99.01%였습니다. 다양한 시나리오에서 비교 알고리즘의 SAR은 BFEN 알고리즘보다 낮으며, DBLR 알고리즘은 최종 평가 시나리오에서 70.23%로 가장 낮은 SAR을 기록합니다. 그림 9B에서 보듯, BFEN 알고리즘의 FMD는 서로 다른 교육 시나리오에서 비교 알고리즘보다 여전히 유의미하게 높으며, 각각 98.47%, 98.05%, 97.81%, 97.94%입니다. 벤치마크 알고리즘 DBLR의 FMD 비율은 각각 82.36%, 71.74%, 70.59%, 69.12%입니다. EAB 알고리즘의 구제구염은 각각 80.79%, 68.21%, 67.65%, 66.03%이며, PRF 알고리즘의 구제구염은 각각 86.42%, 82.17%, 80.98%, 78.33%입니다. 이 결과들은 GBDT의 다중 의사결정 트리를 통한 반복 학습 덕분에 BFEN이 시나리오 간 오류 패턴을 정확히 포착하고 안정적이고 공정한 보정 결과를 보장함으로써 비교 알고리즘보다 우수한 성능을 보였음을 입증했습니다. 연구는 네 가지 알고리즘을 사용해 중국어, 수학, 영어에 대한 학문별 특징 인식률(DFRR)을 추가로 평가했습니다. 결과는 그림 10에 나와 있습니다.

그림 10: 다양한 분야에서의 DFRR 검사 결과 비교. (A) 훈련 세트. (B) 검증 세트. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 10A에서 보듯, BFEN은 훈련 세트에서 중국어, 수학, 영어에서 99.23%, 98.94%, 99.13%의 DFRR을 달성했습니다. 그림 10B는 BFEN이 다른 알고리즘에 비해 검증 세트에서 더 높은 DFRR을 달성했음을 나타냅니다. 구체적으로, BFEN의 중국어 DFRR은 98.41%에 달해 DBLR의 87.61%보다 10.8% 높았다; 수학은 97.54%로, PRF의 88.47%보다 9.07% 높았다; 영어는 98.13%로, EAB의 84.79%보다 13.34% 높았습니다. 이 결과는 BFEN이 BERT의 의미적 차이 포착과 GBDT의 오류 패턴 개인화 학습을 결합하여 학문별 평가 보정에 효율적으로 적응했음을 확인시켜 주었습니다. BFEN 성능을 포괄적으로 평가하기 위해 연구는 MDFE, CRS, SDCT를 네 가지 알고리즘에 대해 평가했습니다. 결과는 표 1에 제시되어 있습니다.
| 데이터셋 | 알고리즘 | MDFE (%) | CRS | SDCT(s) |
| 훈련 | BFEN | 98.42 ± 0.28*&@ | 0.975 ± 0.28*&@ | 0.78 ± 0.04*&@ |
| PRF | 83.85 ± 0.41 | 0.779 ± 0.36 | 1.32 ± 0.08 | |
| EAB | 85.91 ± 0.50 | 0.806 ± 0.40 | 1.15 ± 0.07 | |
| DBLR | 88.76 ± 0.47 | 0.753 ± 0.39 | 1.45 ± 0.08 | |
| 검증 | BFEN | 97.58 ± 0.25*&@ | 0.968 ± 0.27*&@ | 0.86 ± 0.03*&@ |
| PRF | 81.62 ± 0.32 | 0.687 ± 0.50 | 1.51 ± 0.06 | |
| EAB | 84.37 ± 0.40 | 0.749 ± 0.42 | 1.28 ± 0.05 | |
| DBLR | 87.53 ± 0.30 | 0.728 ± 0.47 | 1.63 ± 0.07 |
표 1: MDFE, CRS, SDCT 검사 결과 비교. "*"는 BFEN과 PRF 결과 간의 유의한 차이(p < 0.05)를 나타냅니다. "&"는 BFEN과 EAB 결과 간의 차이가 유의했음을 나타냅니다(p < 0.05). "@"는 BFEN과 DBLR 결과 간 차이가 유의미함을 나타냅니다(p < 0.05)
표 1은 BFEN이 훈련 세트에서 98.42%의 MDFE를 달성했음을 보여줍니다. 이는 PRF의 83.85%보다 14.57% 높았고, CRS는 0.975이며, DBLR의 0.753보다 0.222초, SDCT는 0.78초로 DBLR의 1.45초보다 0.67초 낮았습니다. 검증 세트에서 BFEN은 MDFE, CRS, SDCT가 각각 97.58%, 0.968%, 0.86초로 비교 알고리즘보다 우수한 성능을 유지했습니다. 전반적으로 결과는 BFEN이 교수 평가 교정에서 우수한 종합적 성능을 입증했습니다.
GFBFEN 교육 평가 교정 모델 성능 검증
BFEN 성능 검증을 바탕으로, 연구는 BFEN 위에 구축된 GFBFEN 교육 평가 보정 모델의 성능을 추가로 평가하고, PRF, EAB, DBLR 알고리즘을 사용해 구축된 보정 모델과 비교하였습니다. 일관된 시험 조건과 비교 가능성을 보장하기 위해 글로벌 교육 모니터링 보고서 데이터셋이 교육 세트로, 대학생 학업 성과 데이터셋이 검증 세트로 사용되었습니다. 네 가지 모델은 500개의 교육 평가 기록을 보정하고, CAE와 CRE를 계산했습니다. 결과는 그림 11에 나와 있습니다.

그림 11: CAE와 CRE 검사 결과 비교. (A) CAE 검사 결과. (B) CRE 시험 결과. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 11A에서 볼 수 있듯이, GFBFEN은 처음에 CAE가 0.1279를 달성했습니다. 보정이 진행되면서 CAE는 0.0641로 감소했고, 104개의 기록 후 안정화되었습니다. 비교 모델들은 GFBFEN보다 초기 및 최종 CAE가 더 높았으며, EAB는 각각 0.1858과 0.1217로 초기 및 최종 CAE가 가장 높았습니다. 그림 11B는 보정 작업 중 GFBFEN의 초기 및 최종 CRE가 비교 모델보다 낮아 각각 0.1137과 0.0912로 유지됨을 나타냅니다. 이 결과는 GFBFEN이 강한 적합 능력을 보였음을 보여주었으며, GAT의 주의 메커니즘을 통해 특징 간 의미 상관 그래프를 생성하고, 다중 출처 평가 데이터의 의미적 정렬을 향상시키며, 특징 편향으로 인한 비효율적인 보정을 감소시켰습니다. 연구는 이후 학생 평가 데이터, 교사 평가 데이터, 학교 평가 데이터, 그리고 I, II, III, IV로 분류된 온라인 평가 데이터를 평가했습니다. 결과는 그림 12에 나와 있습니다.

그림 12: 다양한 평가 데이터의 CAR 결과 비교. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 12A에 나타난 것처럼, GFBFEN은 교육 세트 내 학생, 교사, 학교 및 온라인 평가 데이터에서 99.34%, 98.93%, 99.01%, 99.12%의 CAR 점수를 달성했습니다. 검증 세트에서 CAR 값은 각각 97.89%, 98.56%, 97.57%, 98.46%였습니다. 그림 12B–D는 비교 모델이 훈련 및 검증 세트 모두에서 더 낮은 CAR을 보였음을 보여주었다. 그중 EAB는 검증 세트에서 가장 낮은 성과를 냈으며, 교사 데이터에서 CAR가 76.31%, 온라인 데이터에서 78.29%를 기록했습니다. 이 결과는 GFBFEN이 비교 모델들보다 유의미하게 우수한 성능을 보였음을 확인시켜 주었습니다. 다음으로, 연구는 적합성 능력과 훈련 안정성을 평가하기 위해 교수 평가 보정 과제에서 TL을 검증했습니다. 결과는 그림 13에 나와 있습니다.

그림 13: 모델 적합 능력 및 훈련 안정성 테스트 결과. (A) GFBFEN. (B) PRF. (C) EAB. (D) DBLR. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 13A에서 볼 수 있듯이, GFBFEN은 처음에 훈련 세트에서 TL이 0.1021이었습니다. 67회 반복 후 TL은 0.0725로 감소하고 안정화되었습니다. 검증 세트에서 TL은 0.1237에서 0.1018로 감소했습니다. 그림 13B–D는 PRF의 훈련 세트 최종 TL이 0.0824, EAB의 검증 세트 최종 TL은 0.1178, DBLR의 TL은 두 세트 모두에서 불안정하고 다른 모델보다 유의미하게 높았음을 나타냅니다. 이 결과는 GFBFEN이 강한 적합 능력과 학습 안정성을 보였으며, KD 기반 지식 이전의 이점을 통해 모델이 효과적인 특징을 빠르게 학습하고 손실 수렴을 가속화하며 데이터셋 간 일반화를 보장할 수 있음을 보여주었습니다. GFBFEN의 핵심 성능을 포괄적으로 검증하기 위해, 연구는 네 가지 모델에 대해 EFCA, HDPE, FCP, CSCC 테스트를 수행했습니다. 결과는 그림 14에 나와 있습니다.

그림 14: 교수 평가 및 교정 과제의 종합 지표 시험 결과. (A) GFBFEN 검사 결과. (B) PRF 검사 결과. (C) EAB 검사 결과. (D) DBLR 검사 결과. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 14A–D에 나타난 것처럼, GFBFEN 모델은 훈련 세트와 검증 세트에서 각각 99.35%와 98.76%의 EFCA 값을 가집니다. PRF 모델의 EFCA는 각각 88.53%와 87.04%입니다. 검증 세트에서 GFBFEN 모델의 EFCA는 EAB 모델보다 92.17%로 6.59% 높았고, DBLR 모델의 EFCA보다 87.04%보다 11.72% 높았습니다. 또한 HDPE, FCP, CSCC 지표도 포괄적으로 선두를 달리고 있습니다. 검증 세트에서 GFBFEN 모델의 HDPE는 98.05%, FCP는 97.93%, CSCC는 0.968을 기록했으며, 모두 PRF, EAB, DBLR 모델을 능가했습니다. 전반적으로 이 결과들은 GFBFEN의 우수한 포괄적 성능을 검증했으며, GAT-KD, AM-LSTM, BFEN의 조정 최적화가 교정 정확도, 효율성, 교육 평가의 공정성을 효과적으로 향상시켰음을 입증했습니다.
연구는 점차 FairEduNet, BFEN, FBFEN, GFBFEN을 구성했으며, 최종 GFBFEN에는 FairEduNet, BERT-RL, AM-LSTM, GAT-KD와 같은 구성 요소가 포함되어 있습니다. 개별 부품의 독립적 기여도를 검증하기 위해, 연구 및 설계 소작 실험이 수행되며, 각 부품을 점진적으로 제거하고 전체 성능에 미치는 영향을 평가합니다. 비교 지표로는 ECA, FDR, SAR, FMD가 있습니다. 결과는 FairEduNet 구성 요소만으로도 ECA 가치가 87.32%였고, FDR은 12.45%, SAR은 89.67%, 구제구기병(FMD)은 11.89%였습니다. 전체 GFBFEN 모델의 ECA는 99.21%에 도달했고, FDR은 1.93%로 더 떨어졌으며, SAR은 99.45%로 안정적이었고, FMD는 7.28%로 최적화되었습니다. BERT-RL을 제거한 후 ECA는 91.04%로 감소했고, FDR 값은 6.23%, SAR 값은 92.33%, FMD는 7.85%로 증가했습니다. AM-LSTM 소작은 SAR 변동을 14.2% 증가시켰습니다. GAT-KD의 제거로 FMD가 8.36%로 증가했으며, 지식 증류에 의해 유도된 그래프 구조 편향 전파 억제 메커니즘은 집단 간 암묵적 연관 편향을 완화하는 데 유의미하게 효과적이었습니다.
연구 방법을 추가로 검증하기 위해, 연구는 교육 환경에서 널리 인식되는 세 가지 엄격한 제약 유형을 포함하는 공정성 보정 기준(FCB)이라는 확립된 공정성 기준 지표를 도입했습니다: (1) 그룹 간 보정 후 평균 차이의 절대값은 ≤ 1.2점(백분율 체계 기준); (2) 각 민감 속성 하위 그룹에 대한 보정된 신뢰구간의 중복률은 ≥ 95%입니다; (3) 어떤 단일 시나리오에서든, FDR과 SAR의 공동 실현 가능 영역은 파레토 프런티어 제약을 만족해야 한다(즉, SAR을 개선하려면 FDR이 악화되고, 그 반대도 마찬가지다). GFBFEN 모델은 EAB, PRF, DBLR, GBDT 등 주류 기초 모델과 실험 평가에서 비교되었습니다. 이 실험은 실제 교수 시나리오에서 수집된 421개의 실제 평가 데이터를 대상으로 수행되었으며, 교실 평가, 실기 평가, 온라인 시험의 세 가지 전형적인 교육 상황을 포함합니다. 결과는 표 2에 나와 있습니다.
| 알고리즘 | 평균 점수 차이의 절대값 | 신뢰구간 중복률(%) | 공동 실행 가능 영역 만족률(%) | 종합 점수 |
| GFBFEN | 0.87 | 98.3 | 100 | 97.2 |
| 유럽 기준 | 1.52 | 98.4 | 82.6 | 78.5 |
| PRF | 1.68 | 85.1 | 74.3 | 71.2 |
| DBLR | 1.45 | 87.9 | 79.8 | 75.6 |
| GBDT | 1.33 | 91.2 | 86.4 | 79.9 |
표 2: 공정성 기준 지표 및 실무 적용 검증의 평가 결과.
표 2에서 보듯, GFBFEN은 네 가지 FCB 강체 제약 조건을 독립적으로 완전히 준수했으며, 종합 점수는 다른 기저선 모델보다 +18.7점 차이로 크게 우수하여 제안된 다단계 협력적 보정 패러다임의 견고성을 입증했습니다. 특히, 공정성과 효율성 절충 능력을 반영하는 핵심 지표에서는 공동 실현 가능 지역 커버리지율이 100%에 도달하여, 모델이 실제 교육 상황에서 배치 가능한 파레토 최적 의사결정 능력을 갖추었음을 나타낸다.
교육 평가의 공정성은 개인차와 교육 법칙을 존중하면서 검증 가능한 정량적 제약을 기준점으로 사용하는 것을 의미합니다. 형평성 지표의 계산 논리와 임계값 설정은 교육 형평성과 실증적 데이터 검증 기준의 이론적 틀에 기반합니다. 이들은 5명의 학자로 구성된 전문가 위원회가 공동으로 검토하여 이론적 엄격성과 교육 실천 적응성 간의 높은 통일성을 보장합니다. 모델의 다양한 공정성 기준 하에서의 적응성을 더욱 검증하기 위해, 연구는 여러 기준에 대해 추가 검증을 실시했습니다. 구체적으로, 검증을 위해 세 가지 공정성 기준이 선정되었습니다. 표준 1은 인구통계학적 평등성에 기반한 집단 간 합격률 균형입니다. 표준 2는 균등화 오즈를 기반으로 한 진양성률과 거짓 양성률의 그룹 간 일관성입니다. 표준 3은 예측 정확도의 그룹 간 편향을 제어하기 위한 예측 균형(Predictive Parity)을 기반으로 합니다. GFBFEN은 세 가지 기준 모두에서 일관되게 엄격한 제약 요건을 충족하는 것으로 나타났습니다. 표준 1그룹 수용률 편차≤1.2%), 표준 2 참/거짓 양성률 그룹 간 차이 ≤0.85%, 표준 3 예측 정확도 그룹 간 편차는 ±±0.6% 내에서 통제됨. 반면, 다른 모델들은 적어도 한 가지 기준에서 제약 돌파구가 ≥3.7%로 나타났으며, 다변량 공정성 패러다임에 대한 GFBFEN의 일반화 적합성을 검증했습니다.
데이터 가용성:
데이터 신뢰성을 보장하기 위해 연구는 글로벌 교육 모니터링 보고서 데이터셋(https://www.education-progress.org/)과 스페인 중학생 학업 성과 데이터셋(https://archive.ics.uci.edu/dataset/320/student+performance)을 사용했습니다. 학습 및 검증 세트는 두 데이터셋에서 시간 순서대로 나누어집니다. 이 연구는 2024년 9월의 데이터를 훈련 세트로, 2024년 10월부터 2025년 6월까지의 데이터를 검증 세트로 사용하여 교육 평가의 시간적 진행과 일치합니다.
본 연구에서 제안된 BFEN 알고리즘은 비교 실험에서 우수한 성능을 보였습니다. ECA와 FDR의 관점에서는 PRF, EAB, DBLR 알고리즘보다 훨씬 뛰어난 성능을 보였습니다. 421건의 평가 기록을 보정할 때 BFEN은 ECA를 98.75%로 증가시키고 안정성을 유지한 반면, FDR은 2.87%로 감소했습니다. 이 성능은 기능 최적화와 동적 적응을 위한 BERT-RL의 통합에서 비롯되었습니다. BERT는 비구조화 평가 텍스트에서 깊은 의미 편향 정보를 정확히 추출했고, 강화학습은 다중 목적 보상 함수를 통해 공정성 임계값과 보정 매개변수를 동적으로 조정하여 민감한 속성의 결과를 제거했습니다. 이는 Valencia-Londoño 등이 인공지능 알고리즘을 사용해 다양한 신경근 질환을 가진 성인을 위한 교육 포용 모델을 구축한 연구와 유사합니다. 구성된 교육 포함 모델은 특정 신경근질환 그룹 내에서 실현 가능성에 대해 검증되었으나, 공정성 제약은 단일 차원(진단 그룹의 균등한 대표성)만 포함했고, 여러 그룹과 여러 목표에 걸쳐 엄격한 제약 체계가 설정되지 않았다27. 다양한 교육 시나리오 시험에서 BFEN은 교실 평가에서 99.01%의 SAR을, 실습 평가에서 FMD는 97.81%로, 비교 모델보다 훨씬 높았습니다. 이 이점은 GBDT가 다중 시나리오 평가 데이터에서 오류 패턴을 반복적으로 학습하고, 지능형 교육 공정성 표준 라이브러리를 결합해 목표 보정 매개변수를 매칭하여 시나리오 차이로 인한 보정 편향과 공정성 불균형을 효과적으로 줄인 데 기인했습니다. Kumar 등이 제안한 적응적이고 해석 가능한 공정 인공지능 평가 시스템과 비교할 때, 인간 전문가 피드백 루프와 언어 간 공정성 검증 모듈을 포함하지만, 이러한 기능을 도입하긴 하지만, 교육 평가 영역에서는 의미 밀도가 높고 맥락 의존성이 강한 평가 텍스트의 암묵적 편향 사슬을 효과적으로 모델링하지 못합니다28. 이 연구는 문헌에 비해 공정성 제약의 엄격한 보장과 교육 의미 모델링의 깊은 결합 측면에서 더 깊이 통합되어 있다28.
실용적인 지능 교육 평가 과제에서도 BFEN을 기반으로 구축된 GFBFEN 모델도 주목할 만한 장점을 보여주었습니다. 500건의 보정 기록에서 GFBFEN은 최종 CAE 0.0641, CRE 0.0912를 달성했습니다. 여러 평가 데이터에 대한 CAR은 교육 및 검증 세트 모두에서 97%를 초과했습니다. 이 성능은 GAT-KD의 특징 상관화 최적화와 경량 처리 덕분이었습니다. GAT는 다중 출처 데이터 특성 편향을 줄이기 위해 특징 간 의미 상관 그래프를 구축했으며, KD의 지식 이전은 모델 정확도를 저해하지 않으면서 추론 효율성을 높여 모델 복잡성으로 인한 보정 지연을 피했습니다. Deho 등이 학습 분석 모델의 공정성에 미치는 데이터셋 드리프트 영향에 관한 연구와 비교하면, 그들의 연구는 데이터 드리프트가 공정성에 미치는 영향 메커니즘에 초점을 맞추었으나, 보정 전략은 정적 재가중치와 이벤트 후 보상에 의존하여 실시간 의미 편차를 동적으로 인지하고 대응하는 능력이 부족했습니다. 교사의 주관적 표현과 학생들의 언어 스타일 차이로 인해 교육 평가에서 암묵적 편향이 진화하는 것을 다루는 것은 어려웠다. 그러나 본 연구는 GFBFEN 모델을 통해 평가 의미론의 의미 편차를 효과적으로 인지하고 동적으로 대응하며, 교사 발언의 암묵적 가치 경향, 학생 응답 텍스트의 언어 스타일 편차, 학년/과목 간 평가 표현의 의미 변동을 포착하여 "정적 보상"에서 "동적 보정"으로의 패러다임 전환을 달성했습니다29. 핵심 지표 테스트에서 GFBFEN은 학습 및 검증 세트에서 각각 99.35%와 98.76%의 EFCA를, 98.52%와 97.93%의 FCP를 달성하여 비교 모델보다 유의미하게 높았습니다. Dimari A 팀이 개발한 인공지능 기반 자동 채점 개방형 시험 시스템과 유사하게, 개방형 응답 채점에서 높은 일관성을 달성했음에도 불구하고, 공정성 보정은 인간이 주석을 단 채점 차원의 가중치와 인간이 주석을 단 편향된 표본 라이브러리에만 의존하며, 교육적 의미 역학 진화 메커니즘은 내장하지 않습니다. 이 연구는 공정성 교정의 동적 진화 메커니즘과 교육 의미론의 심층 모델링에서 Dimari A 팀의 연구 결과와 비교해 실질적인 돌파구를 마련했으며, 특히 교사 의견의 가치 지향 편향, 세대별 학생 언어 스타일 차이 등 실제 문제를 해결하는 데 있어 강한 견고성과 해석 가능성을 입증했습니다. 그리고 학제간 평가 표현의 모호성30.
이 연구는 세 가지 측면에서 기여했다. 첫째, BFEN 알고리즘은 BERT-RL과 FairEduNet을 통합하여 의미 특성 최적화와 동적 매개변수 조정을 통해 다중 출처 이기종 데이터에 대한 처리 효율성과 다중 시나리오 적응성을 향상시켰습니다. 둘째, GAT-KD와 FBFEN을 기반으로 한 GFBFEN 모델은 의미 상관 학습과 경량 지식 전이를 도입하여 복잡한 교육 상황에서 약한 특징 상관관계와 낮은 추론 효율 문제를 해결하여 평가 보정의 실용성을 높였습니다. 셋째, 모델들을 적용하여 다양한 과목과 평가 유형을 보정하여 정확한 교수 평가를 위한 기술적 지원을 제공하고 교육 공정성을 증진했습니다. 이러한 기여는 지능형 교육 평가 보정에 새로운 접근법을 제시했으며, 복잡한 교육 데이터 처리에서 다중 알고리즘 협업의 참고 자료가 되었습니다.
현재의 지능형 교육 평가 교정 방법은 적응성과 공정성이 부족합니다. 본 연구는 GAN과 GBDT를 이용한 공정성 보정을 위한 FairEduNet 기반 GFBFEN 모델을 제안합니다. BERT-RL은 비정형 데이터 처리를 향상시키고, AM-LSTM은 다중 소스 데이터 융합을 개선하며, GAT-KD는 특징 상관관계와 경가중치를 강화합니다. 이 알고리즘들을 통합함으로써 모델은 정밀한 보정과 동적 공정성을 달성합니다. 테스트는 우수한 다중 출처 데이터 처리 및 시나리오 간 공정성 보정을 보여주며, 정밀도와 공정성 요구사항을 충족합니다. 하지만 이 모델은 특수 교육 그룹에 한계가 있어 일반화 개선이 필요합니다. 향후 연구에서는 다양한 상황에 맞게 매개변수를 최적화하고 공정성 제약을 조정하여 교육 공정성과 교육 품질을 지원할 것입니다.
저자는 공개할 것이 없습니다.
저자는 이해 상충이 없다고 선언한다.
```html
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| 글로벌 교육 모니터링 보고서 데이터세트 | UNESCO | https://www.education-progress.org/ | 데이터세트 |
| NumPy | NumPy | https://numpy.org/ | 데이터 전처리 |
| Pandas | Pandas, NumPy | https://pandas.pydata.org/ | 데이터 전처리 |
| PyCharm Professional 2023.1 | PyCharm | 버전 2023.1 | 개발 환경 |
| Python 3.9 | Python | 버전 3.9 | 프로그래밍 언어 |
| Scikit-learn | Scikit-learn | https://scikit-learn.org/stable/index.html | 머신 러닝 |
| Seaborn | Seaborn | https://seaborn.pydata.org/ | 시각화 |
| 스페인 중학교 학생 학업 성적 데이터세트 | UC Irvine 머신 러닝 저장소 | https://archive.ics.uci.edu/dataset/320/student+performance | 데이터세트 |
| TensorFlow | TensorFlow | https://www.tensorflow.org/ | 딥 러닝 |
| Windows 11 | Microsoft | 버전 11 | 운영 체제 |
Request permission to reuse the text or figures of this JoVE article
Request Permission