연구 논문

다관점 모호한 추론과 XGBoost 기반 온라인 학습 행동 분석

DOI:

10.3791/69515

2026년 3월 17일

이 논문에서

정오 공지

Important: There has been an erratum issued for this article. View Erratum Notice

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 다관점 퍼지 추론 모델과 개선된 극한 구배 부스트(XGBoost) 알고리즘(개선된 그레이 울프 최적화 알고리즘으로 최적화됨)을 사용하여 온라인 학습 행동을 분석하고 학생 댓글 감정을 분류하여 개인화된 교육과 시기적절한 개입을 지원합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

온라인 교육의 급성장으로 온라인 강의실은 교육 분야에서 중요한 구성 요소가 되었습니다. 온라인 수업에서 학생들의 학습 행동에 대한 심층 분석은 교사가 교수 전략을 최적화하고 학생들에게 맞춤형 학습 지원을 제공하는 데 도움을 줄 수 있습니다. 따라서 학생들의 학습 행동을 심층적으로 분석하기 위해 본 연구는 온라인 교육 플랫폼에서 데이터를 수집하고 이를 전처리합니다. 이후 본 연구는 교육과정, 개인, 수업의 세 차원을 아우르는 다관점의 퍼지 추론 모델을 구축하여 학생들의 학습 성과를 다양한 수준에서 포괄적으로 고려합니다. 이 모델은 학습 행동 데이터의 불확실한 정보를 퍼지 집합과 퍼지 규칙을 통해 처리하여 학습 성과에 대한 다차원 평가를 달성합니다. 개선된 XGBoost 알고리즘은 학생들의 댓글 감정을 분류하도록 설계되었습니다. 이 개선된 알고리즘은 그레이 울프 최적화 알고리즘을 개선하여 XGBoost 알고리즘의 하이퍼파라미터를 최적화합니다. 이 알고리즘은 감정 분류의 정확성을 높이고, 학습 행동 뒤에 숨은 감정적 경향과 태도 피드백을 더욱 탐구합니다. 결과는 교육과정 관점에서 시험 3주 전 과목 과제 완료율이 기본적으로 45% 이상이었으며, 이는 과제 발표 3주 후 완료율(둘 다 18% 미만)보다 훨씬 높았습니다. 이 결과는 학생들이 마감일 전에 과제를 더 잘 완료하고 명백한 미루기를 보였음을 나타냈습니다. 개선된 분류 알고리즘의 최대 정확도는 98.78%로, 비교 모델보다 8.57%, 7.55%, 6.38%, 6.01% 높았고, 평균 시간 소모는 58ms였습니다. 부정적, 긍정적, 중립적 감정의 회상률은 98.35%, 97.69%, 98.02%였습니다. 이 연구 모델은 학생들의 온라인 학습 행동을 효과적으로 분석하고 위험에 처한 학생을 조기에 식별할 수 있게 하여 맞춤형 교육과 온라인 교육에서 정확한 개입을 촉진할 수 있습니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

인터넷과 교육 기술의 깊이 통합은 온라인 교육을 주변적인 보조에서 주류 형태로 도약시켰습니다. 2023년 말까지 전 세계 등록된 온라인 학습자 수는 12억 명을 넘어섰으며, 중국은 대규모 공개 온라인 강좌(MOOCs) 수와 학습자 1,2명에서 꾸준히 세계 1위를 차지했습니다. 하지만 온라인 수업이 편리함을 제공하는 한편, 불투명한 학습 과정, 교사와 학생의 시간·공간 분리, 규제 피드백 지연 등 문제점도 드러냅니다. 학습 행동 데이터와 학업 성과 사이에는 긍정적인 상관관계가 있습니다. 데이터를 기반으로 한 동적 조정은 강의 완료율을 20% 이상 증가시키고 중도탈락 위험을 크게 줄일 수 있습니다. 따라서 학습 행동 분석(LBA)을 수행하는 것이 매우 중요합니다. 이 문제에 대해 현재 방법으로는 기술 통계, 연관 규칙 마이닝, 전통적인 머신러닝 분류6이 포함됩니다. 많은 학자들이 이 문제를 연구해 왔습니다.

LBA를 수행하기 위해 Li Y 등은 하버드 대학교와 매사추세츠 공과대학교(MIT)의 온라인 교육 플랫폼에서 학습 행동 데이터를 활용하여 학습 결과를 예측하는 펄스 신경망(PNN)을 구축했습니다. 그들은 학습 행동과 결과 간의 상관관계를 분석했습니다. PNN을 기반으로 한 온라인 학습 행동 예측 모델은 99.80%의 정확도를 달성했습니다. 젱 B는 지연 시퀀스 분석과 데이터 마이닝 기법, 최소 스팬닝 트리 알고리즘을 사용하여 온라인 영어 학습 행동을 시각화하는 효율적인 모델을 설계했습니다. 또한, 이 연구는 그룹 학습 경로(GLP) 건설 서비스를 위한 온라인 지능형 학습 플랫폼도 구축했습니다. 설계된 방법은 GLP8을 성공적으로 제작할 수 있었습니다. Zhao M 등은 학생들의 온라인 학습에서 발생할 수 있는 문제를 밝히기 위해 이중 층 장기 단기 기억(LSTM)을 설계했습니다. 이들은 TensorFlow 프레임워크와 Python 언어를 사용했으며, Kaggle, edX, 영국 오픈 대학교 등 온라인 플랫폼의 데이터를 활용했습니다. 이 네트워크는 최대 정확도 83.4%로 우수한 성능을 보였습니다. Li F 등은 109명의 학부생으로부터 학습 행동 데이터를 수집하고 분석하여 다양한 온라인 학습자의 집단 행동 특성을 이해하려 했습니다. 이 연구는 데이터 차원을 줄이기 위해 주성분 분석을 도입하고, 학습자를 다양한 범주로 분류하기 위해 집적 계층적 군집화를 사용했습니다. 그중 15개 그룹이 군집화되었고, 제안된 방법은 우수한 군집 정확도를 보였습니다10.

요약하자면, 현재 LBA에 관한 연구는 매우 다양하며 다양한 방법을 사용하고 있습니다. 하지만 이러한 연구와 방법에는 몇 가지 한계도 있습니다. 예를 들어, 학생 리뷰 텍스트에서 감정 정보를 충분히 탐구하지 못하고, 기술적 통계로는 행동 뒤에 숨겨진 복잡한 상호작용 메커니즘을 밝혀낼 수 없습니다. 머신러닝 분류는 종종 단일 관점 특징에 기반하며, 이는 강의, 개인, 수업의 다차원 정보를 분리합니다. LBA를 더 잘 수행하기 위해, 본 연구는 다관점 모호 추론(MPFR) 모델을 설계하고, 개선된 그레이 울프 최적화(IGWO)와 극한 그라디언트 부스트(XGBoost) 알고리즘을 기반으로 한 감정 분류 모델을 구축합니다.

기존 LBA 연구에서는 LSTM이 학습 행동의 시간적 상관관계를 포착할 수 있지만, 모호하고 불확실한 학습 행동 데이터를 다루는 능력은 약합니다. 합성곱 신경망(CNN)은 텍스트 특징 추출에 특정 장점이 있지만, 국소적 특징을 포착하는 데 더 우수하며, 강의, 개인, 수업의 다차원 글로벌 정보를 통합하는 데 어려움을 겪습니다. CNN이나 LSTM과 같은 딥러닝 기법과 비교할 때, MPFR 모델은 퍼지 추론을 통해 학습 행동에서 불확실한 정보를 포착할 수 있습니다. 예를 들어, 학생들의 '중간 정도 참여'와 '기본 숙달'은 CNN의 국소 특징 추출의 한계를 보완합니다. IGWO-XGBoost는 감정 분류의 정확성과 효율성을 균형 있게 조정하여 시간이 많이 소요되는 LSTM 감정 분류와 약한 CNN 의미 퍼지 처리를 보완합니다. 이 연구는 행동 분석과 감정 분석 결과를 결합하여 온라인 교육 개입에 대한 3차원 정보 지원을 제공하는 것을 목표로 합니다. 연구의 혁신은 교육과정, 개인, 수업의 세 차원을 포괄하는 MPFR 모델 구축에 있습니다. 이러한 포괄적인 고려는 여러 관점에서 학생들의 학습 성과를 포괄적이고 입체적으로 반영하여 한 관점에서 간과될 수 있는 중요한 정보를 피할 수 있습니다. 이 방법은 플랫폼 확장성이 뛰어나며, Chaoxing, MOOC와 같은 주류 온라인 학습 플랫폼에 적용할 수 있습니다. 즉, 추가적인 플랫폼 개발 기능 없이도 통합 데이터 전처리 인터페이스를 통해 가능합니다. 동시에 이 방법은 간단한 분석 도구로 캡슐화되어 교육자들이 플랫폼에서 내보낸 기본 데이터만 업로드하면 복잡한 기술 작업 없이 자동으로 LBA 보고서를 생성할 수 있습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

MPFR과 감정적 관점을 고려한 LBA 방법 설계

학생의 온라인 학습 행동(SOLB) 분석을 위한 다관점 평가 시스템이 구축되었으며, MPFR 모델이 설계되었습니다. 학습에서 학생들의 주관적 감정을 더 분석하기 위해, 본 연구는 XGBoost 알고리즘을 채택하고 분류 정확도를 높이기 위해 초매개변수 최적화를 위한 IGWO 알고리즘을 설계합니다.

LBA를 위한 MPFR 모델 구축

SOLB를 분석하기 위해 본 연구는 주로 두 가지 관점에서 출발하여 완전한 분석 계획을 수립합니다. 첫째, 학습 성과 측면에서 본 연구는 교육과정, 개인, 수업의 세 가지 관점을 고려하여 MPFR 모델을 형성합니다. 둘째, 학생 댓글의 감정 분석 측면에서 본 연구는 향상된 XGBoost 알고리즘을 설계합니다. 학습 성과 및 학생 피드백 감정 분석을 통해 이 연구는 SOLB를 더 잘 분석할 수 있습니다. 학습 성과 분석의 구체적인 기술적 세부사항 측면에서, 본 연구는 먼저 온라인 학습 플랫폼의 데이터를 사용하고 이를 전처리합니다. 둘째, 본 연구는 다양한 관점에서 핵심 학습 성과 평가 지표를 선택하여 포괄적인 평가 시스템을 구축합니다. 그 후 학습 행동을 평가하기 위한 대응하는 MPFR 모델이 구성됩니다.

이 연구는 슈퍼스타 플랫폼에서 데이터를 선정했습니다(출처: https://www.chaoxing.com/). 교실 활동, 성적 평가 등 여러 차원의 정보를 담고 있어 이후 LBA의 좋은 기초가 될 수 있습니다. 데이터를 획득한 후에는 주로 관련 없는 필드 삭제, 데이터 필터링, 데이터 무결성 검사를 포함한 사전 처리가 필요합니다. 예를 들어, 교사 데이터에서는 강좌가 속한 번호나 학과 같은 무관한 정보를 제거해야 합니다. 이후 본 연구는 Superstar 플랫폼의 학습 행동 데이터를 기반으로 LBA의 특징 공학을 구성합니다. 학생 LBA 지수는 이후 MPFR 모델의 특징 공학적 기반을 제공하며, 이 지수의 내용은 그림 1에 나와 있습니다.

figure-protocol-1
그림 1: 학생 LBA의 지표. 그림은 학생 LBA의 세 가지 핵심 차원(교육과정, 개인, 수업)과 각 차원 하의 구체적 평가 지표를 명확히 하여 MPFR 모델에 대한 기능을 지원합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 1에서 학생 LBA 지표는 주로 과정, 개인, 수업의 세 가지 관점에 초점을 맞추어 MPFR 모델 구축에 대한 정확한 특징 지원을 제공합니다. 그중 강의 차원 지표 측면에서 본 연구는 강의 과제 완료율, 강의 학습 기간, 강의 상호작용 빈도를 선택합니다. 이 차원의 핵심 관심사는 과제의 전반적인 완료 품질과 학습 참여의 시기 성에 있습니다. 예를 들어, 강의 과제 완료율은 마감일 전후 완료율 차이를 추적하는 데 사용됩니다; 과정 학습 기간은 학습 강도 구간을 구분하는 데 사용됩니다; 상호작용의 빈도는 효과적인 상호작용 행동을 필터링하는 데 사용됩니다. 개인적으로는 학습 진행 상황, 숙제 완성 품질, 시험 점수가 평가 지표로 선택됩니다. 이 차원은 개인 학습 진도와 지식 숙달 결과 간의 일치 정도에 초점을 맞춥니다. 예를 들어, 개인 학습 진행 상황과 강의 계획 비교, 완료된 과제의 정확성과 효율성 평가, 시험 점수를 바탕으로 지식 숙달 수준을 분류하는 방법 등이 있습니다. 또한, 학급 차원 측면에서 선택된 지표에는 학급 평균 점수, 학급 상호작용 활동, 수업 학습 분위기가 포함됩니다. 이 차원은 주로 전체 학습 환경이 개인 행동에 미치는 영향에 초점을 맞춥니다. 예를 들어, 평균 성적은 그룹 내 개인 수행 수준을 측정하는 데 사용됩니다; 계급 상호작용 활동은 집단 참여 정도를 반영하는 데 사용된다; 학습 분위기는 집단 환경이 학습 행동에 미치는 주도 효과를 분석하는 데 사용됩니다. 학생들의 학습 행동을 분석하기 위해 퍼지 추론 모델이 구성되고, 다양한 관점에서 학습 행동 특성을 얻습니다. 퍼지 추론은 퍼지 논리를 이용한 추론 방법으로, 퍼지 집합과 퍼지 규칙을 통해 불확실하거나 불확실한 정보를 처리하며, 강한 유연성과 이해하기 쉬운 장점을 가지고 있습니다11,12. 퍼지 추론은 MPFR 모델의 핵심 계산 메커니즘으로, 특징 공학 이후에 적용됩니다. 퍼지 추론의 주요 과정은 그림 2에 나와 있습니다.

figure-protocol-2
그림 2: 퍼지 추론의 주요 흐름도. 그림은 퍼지 추론의 핵심 과정을 보여주며, 퍼지화, 퍼지 규칙 기반 구축, 퍼지 추론, 그리고 흐림 제거 네 가지 핵심 단계를 포함하며, 불확실한 학습 행동 데이터를 다루는 MPFR 모델의 논리를 명확히 합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

퍼지 추론은 주로 퍼지화, 퍼지 규칙 라이브러리(FRL) 구축, 퍼지 추론, 그리고 흐림 제거를 포함합니다. 그중 퍼지화는 정확한 입력 데이터를 퍼지 집합으로 변환하는 것을 요구하며, 소속 함수를 정의하는 것을 포함합니다. FRL은 일련의 퍼지 규칙을 포함하고 있으며, 주로 입력과 출력 간의 관계를 설명하는 데 사용됩니다. 퍼지 규칙 기반 구축 과정에서 연구는 8년≥의 교육 경험이 있는 교육기술 부교수 3명을 초청하여 28개의 규칙을 공동 개발하고, "델파이 방법"을 사용한 3라운드 반복을 통해 최종 규칙을 결정합니다. 예를 들어, 규칙 1: 과정 과제 완료율이 30% 미만이고 개별 학습 진행 상황이 일정보다 2주 늦→ 경우 고위험 상태입니다. 퍼지 추론은 FRL을 기반으로 한 퍼지 입력 데이터를 추론하고 퍼지 출력 결과를 얻는 과정입니다. 마지막으로 디블러링은 흐릿한 출력 결과를 정확한 출력 값으로 변환합니다. 이 연구는 퍼지 논리 시스템에서 널리 사용되는 삼각형 멤버십 함수를 선택하며, 강한 유연성과 높은 계산 효율성 등의 장점을 가지고 있습니다. 함수A(x)μ 표현식은 식(1)에 나타난다.

figure-protocol-3 (1)

식(1)에서 x는 특정 입력값이다. a, b, c는 삼각형의 세 꼭짓점이다. 디블러링에서는 이 논문에서 중심질 방식을 사용하여 출력 결과를 변환합니다. 중심 기법은 퍼지 논리에서 흔히 사용되는 흐림 제거 기법으로, 강한 직관성, 간단한 계산, 안정성 등의 장점이있습니다. 중심체 방법의 표현은 식(2)14에 나타난다.

figure-protocol-4 (2)

식(2)에서 f*는 흐림 제거 후 출력 값으로, 퍼지 집합의 중심점입니다. μ(x)는 멤버십 함수입니다. figure-protocol-5 는 퍼지 집합 내 모든 점들의 가중 합이다. figure-protocol-6 는 x의 모든 가능한 값에 대한 소속 함수의 적분이다. MPFR 모델에서 수작업으로 정의한 규칙과 멤버십 함수를 사용하는 합리성은 세 가지 측면에서 반영됩니다. 첫째, 전문가 자격 보장: 규칙 제정자는 교육기술 부교수 3명이며, 교육부 '온라인 교육 연구센터'의 '온라인 학습 행동 분석가'로부터 교육 및 교육법 준수를 보장하기 위해 인증을 받았습니다. 둘째, 효율성 이점: 수동 규칙의 추론 시간이 데이터 기반 방법보다 훨씬 짧아 온라인 교육 플랫폼의 "실시간 추론" 요구에 더 적합하고 많은 주석 데이터가 필요 없어 데이터 수집 비용이 절감됩니다15. 셋째, 온라인 교육 시나리오에서 "해석 가능성"이라는 핵심 요구사항에 적응하기 위해, 수작업으로 정의한 규칙과 삼각형 소속 함수(방정식 1)는 교수 상황에서 직관적 인지와 직접적으로 대응할 수 있습니다. 교육자들은 학생이 위험에 처한 이유를 이해하는 데 복잡한 기술적 배경이 필요하지 않습니다. 뉴로퍼지 시스템과 같은 데이터 기반 방법을 통해 규칙을 자동으로 최적화할 수 있습니다. 하지만 생성되는 대부분의 규칙은 복잡한 수학식으로, 교육자가 해석하기 어렵기 때문에 실제 교수 개입에서 모델의 수용 가능성을 떨어뜨립니다.

XGBoost용 개선된 학생 댓글 감정 분석 모델 설계

설계된 MPFR 모델은 SOLB를 과정, 개인, 수업의 세 가지 측면에서 분석할 수 있습니다. 그러나 외부 행동 데이터 분석은 학생들의 주관적 감정을 표현하는 데 한계가 있습니다. 따라서 학생들의 학습에 대한 주관적 감정을 더 분석하기 위해, 학생 의견 정보를 포함한 MOOC 학습 플랫폼의 추가 데이터를 수집하고 사전 처리합니다. 이후 XGBoost를 활용해 감정 분류 모델을 구축합니다. IGWO는 분류 모델의 정확도를 높이기 위해 매개변수를 최적화하도록 설계되었습니다. XGBoost의 개선은 IGWO 알고리즘을 통한 매개변수 최적화에 반영되어 있습니다. 데이터 전처리는 모델 구축과 분석 전에 매우 중요한 첫 단계입니다. 데이터 전처리 과정은 그림 3에 나와 있습니다.

figure-protocol-7
그림 3: 데이터 전처리 과정. 9단계로 이루어진 데이터 전처리 과정에는 텍스트 정리, 단어 분할, 정지어 제거, 어간 추출, 감성 단어 인식이 포함되어 있어 이후 행동 분석과 감성 분류를 위한 고품질 데이터를 제공합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

데이터 전처리 단계는 다음과 같습니다: 첫 번째 단계는 Chaoxing 플랫폼 데이터에서 관련 없는 필드를 제거하고 유효하지 않은 샘플을 필터링하기 위한 텍스트 클리닝을 수행하는 것입니다. 동시에 MOOC 플랫폼의 비텍스트 필드와 짧은 리뷰는 리뷰 데이터에서 제거됩니다. 두 번째 단계는 분할 처리를 수행하는 것입니다. 그중 중국어 주석은 단어 분할 처리에 Jieba의 "정밀 모드"를 사용하고, 영어 주석은 NLTK 라이브러리의 단어 분할 기능을 사용해 처리합니다. 세 번째 단계는 'de', 'yes', 'in' 등과 같은 흔한 정지어를 제거하는 것입니다. 그중 중국어 스톱워드(Stop words)는 하얼빈 공과대학(Harbin Institute of Technology)의 스톱워드 리스트(https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt)를 사용합니다. 스톱 워드(stop)는 단어 매칭으로 삭제됩니다. 영어 스톱워드는 NLTK 라이브러리에 내장된 범용 스톱워드 리스트를 사용하며, 이 목록도 단어별 매칭을 통해 삭제됩니다. 네 번째 단계는 NLTK 라이브러리의 어간을 사용해 텍스트에서 어간을 추출하고 영어 데이터 내 동사를 어간 형태로 복원하는 것입니다. 다섯 번째 단계는 CNKI 감정 사전을 기반으로 댓글 내 긍정적 및 부정적 감정 단어를 식별하여 이후 감정 분류를 위한 사전 주석 기반을 제공하는 것입니다. 여섯 번째 단계는 특징 추출을 수행하는 것입니다. 그중 Chaoxing 플랫폼의 구조화된 데이터는 표준화되어 있으며, 분류 지표는 별도로 인코딩되어 있습니다. 동시에, MOOC 플랫폼의 이 주석 데이터는 사전 학습된 언어 모델(Transformers의 양방향 인코더 표현, BERT) 방식을 사용하여 텍스트 특징을 추출합니다. 텍스트 특징 추출에서 BERT 모델의 핵심 장점은 깊은 양방향 트랜스포머 아키텍처를 통해 맥락 인식 단어 벡터를 동적으로 생성할 수 있다는 점으로, 전통적인 정적 단어 임베딩 모델이 처리하지 못하는 모호성을 효과적으로 해결할 수 있습니다. 일곱 번째 단계는 댓글 데이터 내 감정 범주의 불균형 문제를 해결하는 것입니다. 합성 소수자 과잉 표본 기법(SMOTE)이 이를 처리합니다. 다섯 개의 최근접 이웃 샘플을 선택해 합성 소수자 계급 샘플을 생성하며, 실험의 재현성을 보장하기 위해 고정된 무작위 시드인 42개를 사용합니다. 여덟 번째 단계는 데이터를 주석 달고 분할하는 것입니다. 아홉 번째 단계는 슈퍼스타 데이터의 누락된 값을 채우고 이상치를 제거하는 것입니다. 데이터 밸런싱 처리를 수행할 때, SMOTE는 소수 집단 샘플 간 보간을 통해 새로운 복합 표본을 생성하여 소수민족 집단 표본 수를 늘리고 데이터 집합의 분류 분포를 보다 균형 있게 만듭니다 16,17. SMOTE의 표현식은 식(3)에 나타난다.

Bmn = dm + rand(0,1) x (dmn - dm) (3)

식(3)에서 Bmn은 인위적으로 구성된 소수 계급 표본이고, dm은 i번째 소수 계급 표본이며, dmn은 dm의 k-최근접 이웃 중 n번째 표본이다. rand(0,1)는 0과 1 사이의 난수입니다. XGBoost는 예측 트리를 반복적으로 추가하여 예측 성능을 향상시킵니다. 높은 정확도, 강한 유연성, 사용 편의성 등의 장점이 있습니다18,19. XGBoost를 이용해 트리 모델을 반복적으로 구성하는 단계로는 모델 초기화, 트리, 목적 함수, 정규화 항의 반복 구성이 포함됩니다. t번째 반복에서 예측된 출력 figure-protocol-8 은 식(4)에 나타난다.

figure-protocol-9   (4)

식(4 figure-protocol-10)에서 는 t-1번째 반복 후 모델 예측 값이며, ft(h)는 t번째 반복에 추가된 트리 모델의 예측 함수이며, h는 입력 특징 벡터이다. XGBoost 최소화의 목적 함수는 식(5)에 나타난다.

figure-protocol-11 (5)

식(5)에서 i는 표본 번호입니다. I와 J는 샘플과 트리의 총 개수이고, j는 트리의 개수입니다. figure-protocol-12 는 손실 함수이며, GI는 i 번째 샘플의 진정한 라벨이다. figure-protocol-13 는 T 번째 반복 후 1번째 샘플에 대한 모델의 예측 값입니다. Ω(ft)는 정규화 항이고, (ft)는 j 번째 트리의 예측 함수입니다. 정규화에 대한 일반적인 식 Ω(f)는 식(6)에 나타난다.

figure-protocol-14 (6)

식(6)에서 γ는 잎 마디 수에 대한 페널티 계수를 의미하며, λ는 잎 마디의 가중치에 대한 L2 정규화 계수, w는 리프 마디의 가중치입니다. 하지만 XGBoost 하이퍼파라미터의 선택은 성능에 직접적이고 중요한 영향을 미칩니다. XGBoost의 일반적인 하이퍼파라미터로는 학습률, 트리의 최대 깊이, 정규화 파라미터가 있습니다. 잠재적으로 큰 하이퍼파라미터 공간 때문에 수동으로 매개변수를 조정하는 것은 시간이 많이 걸릴 뿐만 아니라 최적의 매개변수 조합을 찾는 것도 어렵습니다. 따라서 본 연구는 IGWO를 XGBoost의 하이퍼파라미터를 최적화하도록 설계합니다. GWO는 회색늑대의 사회적 계층 구조와 사냥 전략을 시뮬레이션하여 최적의 해를 찾으며, 매개변수가 적고 적응력이 강한 장점을 가지고 있습니다20,21. GWO에서는 모집단의 초기 위치가 식(7)에 나타난 대로 생성됩니다.

figure-protocol-15(7)

식(7)에서 Puv는 v차원에서 u번째 개체의 위치이다. figure-protocol-16figure-protocol-17 는 v차 탐색 공간의 상한과 하한이다. rand()는 [0,1] 사이의 난수이다. 하지만 GWO 알고리즘은 중간과 후기 단계에서 수렴 속도 느리거나 국소 최적에 갇히는 등의 문제를 겪을 수 있습니다. 이는 또한 현재 GWO가 전체 해의 공간을 효과적으로 탐색하지 못할 수 있음을 의미하며, 전역 최적 해를 찾기 어렵게 만듭니다. 이 문제를 해결하기 위해 본 연구는 텐트 카오틱 맵(TCM)과 비선형 수렴 인자(NCF)를 도입하는 두 가지 측면에서 GWO를 개선합니다. TCM은 탐색 과정에서 잠재적 최적 해의 영역을 놓치지 않도록 보장하고 동일한 영역을 반복적으로 탐색하지 않도록 하는 단순한 혼돈 매핑입니다. 따라서 TCM을 통해 보다 균일하고 무작위적인 초기 모집단을 생성할 수 있으며, 알고리즘의 국소 최적점 극복 능력도 향상될 수 있습니다. TCM의 계산은 식(8)에 나타난다.

figure-protocol-18 (8)

식(8)에서 y는 제어 매개변수입니다.  Rt와 Rt+1은 t번째 및 t+1번째 반복에서의 시스템 상태 변수입니다. NCF z의 공식은 식(9)에 나타난다.

figure-protocol-19(9)

식(9)에서 zmax는 최대 수렴 인수이고 tmax는 최대 반복 횟수입니다. 이 비선형 감소 방식 덕분에 GWO는 초기 단계에서 전역 탐색을 위해 큰 스텝 크기를 유지할 수 있습니다. 검색 중반 단계에서는 수렴 속도가 가속화되고, 후반부에는 더 작은 단계로 로컬 탐색이 수행되어 전역 및 로컬 탐색 능력의 균형을 효과적으로 맞추고 최적화 성능을 향상시킵니다. IGWO 알고리즘은 XGBoost 감성 분류기의 하이퍼파라미터 최적화 단계에 특별히 사용되며, 주요 과정은 그림 4에 나와 있습니다.

figure-protocol-20
그림 4: IGWO의 주요 과정. 그림은 텐트 혼돈 매핑을 기반으로 한 집단 초기화, 비선형 수렴 인자의 위치 업데이트, 최적의 개별 스크리닝을 포함한 IGWO의 실행 과정을 개략적으로 설명하며, XGBoost 하이퍼파라미터 최적화 논리를 명확히 합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 4에서 IGWO 과정은 알고리즘 초기화; TCM을 사용해 개체군을 초기화하는 것; 각 개인의 초기 적합도값 계산; NCF를 사용해 회색 늑대 위치를 업데이트하는 것; 최적의 적합도를 가진 해를 새로운 최적 개인으로 선택하고; 그리고 최적의 개인을 출력합니다. XGBoost 하이퍼파라미터의 최적 조합은 IGWO를 통해 출력할 수 있습니다. 감정 분류의 전체 과정은 데이터 전처리, IGWO 최적화, 그리고 최종 XGBoost 모델을 통합합니다. IGWO-XGBoost를 기반으로 한 분류 모델 과정은 그림 5에 나와 있습니다.

figure-protocol-21
그림 5: IGWO-XGBoost를 기반으로 한 분류 모델 과정. 그림은 IGWO-XGBoost 감정 분류 모델의 전체 과정을 보여주며, 데이터 입력 및 전처리부터 데이터셋 분할, IGWO 하이퍼파라미터 최적화, XGBoost 모델 구축, 분류 결과 출력까지 모델의 연산 체인을 명확히 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

IGWO-XGBoost 기반 모델은 입력 데이터, 데이터 전처리, 데이터셋 분할, IGWO 알고리즘 하이퍼파라미터 최적화, 최적 하이퍼파라미터 조합, 최적 하이퍼파라미터 조합에 기반한 XGBoost 구축, 분류 결과 출력과 같은 과정을 포함합니다. 이 분류 모델을 통해 학생 댓글의 감정을 분류하여 학생들의 학습에 대한 주관적 감정을 보다 직관적으로 이해할 수 있습니다. 특정 소프트웨어 버전, 무작위 시드, 하드웨어 사양, 환경 사양, 그리고 연구에 사용된 데이터셋 출처는 표 1에 나와 있습니다.

집합 유형구체적인 모델 및 내용
기본 소프트웨어파이썬 3.9.7
핵심 라이브러리XGBoost 1.7.5, Scikit-learn 1.2.2, Jieba 0.42.1、NLTK 3.8.1, Pandas 1.5.3、NumPy 1.24.3, Matplotlib 3.7.1, Imbalanced-learn 0.10.1
무작위 시드전역 랜덤 시드를 42로 설정하세요
하드웨어/환경 사양1. 운영체제: Windows 10 프로페셔널 에디션 (64비트, 버전 번호 22H2)
2. 프로세서: 인텔 코어 i5-12600KF (주 주파수 3.7GHz, 동적 가속 주파수 4.9GHz)
3. 메모리: 64GB DDR4 (주파수 3200MHz, 최대 128GB 메모리 지원)
4. 저장 공간: 1TB SSD (삼성 980 프로, 읽기 속도 7450MB/s)
5. 그래픽 카드: NVIDIA GeForce RTX 3060 (12GB 비디오 메모리)
데이터셋 출처 및 접근 세부사항1. 슈퍼스타 플랫폼 데이터셋:
- 출처 통일 자원 위치 추적기(URL): https://www.chaoxing.com/
- 획득 방법: Chaoxing Education 빅데이터 오픈 플랫폼을 통해 신청 (지원 경로: 플랫폼 공식 웹사이트 → 개발자 센터 → 학습 행동 데이터셋 → 데이터 인터페이스)
2. MOOC 플랫폼 댓글 데이터셋:
- 출처 URL: https://www.icourse163.org/.cn
- 획득 방법: MOOC 플랫폼의 "데이터 연구 지원" 채널을 통해 지원하기
커스텀 스크립트 또는 모델1. 데이터 전처리 스크립트
2. MPFR 모델 스크립트
3. IGWO-XGBoost 모델 스크립트
 

표 1: 특정 소프트웨어 버전, 무작위 시드, 하드웨어 사양, 환경 사양, 연구에 사용된 데이터셋 출처. 연구에 필요한 소프트웨어 및 하드웨어 환경, 무작위 시드 설정, 데이터셋 출처, XGBoost 하이퍼파라미터 검색 범위의 상세 목록을 제공하여 실험의 재현성과 표준화를 보장합니다.

표 1은 연구가 감정 분류 모델의 핵심 프레임워크로 XGBoost 1.7.5를 채택하고, 데이터 전처리, 특징 추출, 모델 평가를 위해 Scikit learn 1.2.2를 도입함을 보여줍니다. 또한, 연구는 데이터 분할, SMOTE 과잉샘플링, IGWO 하이퍼파라미터 최적화, IGWO-XGBoost 모델 학습 결과의 재현성을 보장하기 위해 무작위 시드를 균일하게 42로 설정했습니다. 또한 IGWO 알고리즘은 XGBoost 하이퍼파라미터의 탐색 공간을 설정합니다. 학습률의 탐색 범위는 로그 척도에서 [0.001, 0.3]이며, 트리의 최대 깊이는 정수 집합 {3, 4,..., 15}에서 탐색됩니다. L2 정규화 항의 최적화 범위는 [0.1, 5.0]이며, 각 트리 특징 부분집합의 샘플링 비율은 [0.6, 1.0] 범위 내에서 최적화됩니다. 잎 마디의 최소 중치에 대한 조정 범위는 [1, 10]입니다.

데이터셋과 관련 데이터 전처리 및 분석 코드는 팀 자체에 의해 생성되고 분석되었습니다. 데이터 전처리를 위한 핵심 스크립트는 표 2에 나와 있습니다.

PD로는 Pandas, Jieba, RE, NP로는 numpy를 import합니다
nltk.tokenize import word_tokenize; from nltk.stem import PorterStemmer
def clean(text, l):
Return re.Sub(r"[^\u4e00-\u9fa5]" l=="zh" else r"[^a-zA-Z]", " ", 텍스트).strip()
def 프로세스(텍스트, l):
t = jieba.lcut(텍스트) l="zh" 그렇지 않으면 word_tokenize(텍스트)
return " ".join([PorterStemmer().stem(w) l=="en" 그렇지 않으면 w for w in t , w in open("hit_stopwords.txt").read().split()])
디펜스 메인(C, M, L):
CX=pd.read_csv(c).query("강의 학습 기간>=1 & exam results.notna()"); mc=pd.read_csv(m).query("comment text.str.len()>=5")
mc["t"]=mc["comment text"].apply(clean,args=("zh",)).apply(process,args=("zh",))
NP.savez("out.npz",**{k:v for k,v in locals().items()})

표 2: 데이터 전처리를 위한 핵심 스크립트. 데이터 전처리를 위한 핵심 스크립트 정보를 제시하고, 스크립트에 대응하는 전처리 단계를 명확히 하며, 연구 방법 복제를 위한 기술적 참고 자료를 제공하세요.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

다중 관점 및 감정 분류를 고려한 LBA 결과

성능을 검증하기 위해 실험 환경을 설정하고 실험 데이터셋을 설명합니다. 또한, 이 연구는 비교 알고리즘인 IGWO-XGBoost를 선택하여 정확도, 시간 소비, 회상률과 같은 지표를 사용하여 분석 및 검증합니다. 결과 분석에서는 MPFR을 통한 LBA 결과와 IGWO-XGBoost를 통한 감정 분류의 성과 검증 두 부분으로 명확히 나누었습니다.

MPFR을 통한 행동 분석 학습

MPFR의 성능을 검증하고 학생들의 학습 행동을 여러 관점에서 분석하기 위해 본 연구는 Windows 10 시스템과 인텔 코어 i5-12600KF 중앙 처리 장치를 사용합니다. 프로세서의 주 주파수는 3.7 GHz, 동적 가속 주파수는 4.9 ...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

SOLB 분석을 위해 본 연구는 MPFR과 IGWO-XGBoost 모델을 설계하고 온라인 교육 플랫폼의 데이터를 활용했습니다. 실험에서 추론 모델의 평가와 실제 점수 사이에 높은 일관성이 나타났으며, 이는 추론 모델의 효과성을 나타냈다. 약 25%의 학생들이 수업 중 1시간에서 10시간 동안 공부했습니다. 11-20, 21-30, 31-40시간, 41시간 이상 학습 시간을 가진 학생 비율은 30%, 20%, 15%, 10%였습니다. 이는 대다수 학생들이 중간 정도의 학습 강도를 유지한 반면, 극단기 또는 장기 학습에 참여한 학생은 소수임을 나타냅니다. XGBoost 모델의 하이퍼파라미터 최적화 결과는 다양한 최적화 알고리즘에서 차이가 있었으며, IGWO가 더 우수한 성과를 냈습니다. IGWO-XGBoost의 분류 시간과 F1 점수는 각각 100ms와 0.968이었습니다. IGWO-XGBoost의 최대 분류 정확도는 98.78%, 최소 정확도는 95.02%로, 비교 모델...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 공개할 관련 금융적 또는 비금융적 이해관계가 없습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
BERT 사전 학습 언어 모델구글 리서치https://github.com/google-research/bert
CNKI 감정 사전CNKIhttps://www.cnki.net/
Chaoxing 플랫폼은 행동 데이터를 학습합니다차오싱 정보기술개발유한회사(Chaoxing Information Technology Development Co., Ltd, Ltd)https://www.chaoxing.com/
컴퓨터 메모리범용 하드웨어 공급업체 (특정 모델 없음)
하얼빈 공과대학의 폐지 용어 목록하얼빈 공과대학교https://github.com/goto456/stopwords/blob/master/hit_s 
인텔 코어 i5-12600KF 인텔 코퍼레이션BX8071512600KF
Jieba 단어 분할 도구 (정밀 모드)서드파티 오픈 소스 커뮤니티https://github.com/fxsjy/jieba.
MOOC 플랫폼 학생 리뷰 데이터러브 코스 네트워크https://www.icourse163.org/
NLTK 라이브러리NLTK 개발팀https://www.nltk.org/
파이썬 프로그래밍 언어파이썬 소프트웨어 재단https://www.python.org/
Scikit-learn 1.2.2Scikit 학습팀https://scikit-learn.org/stable/
스마트 트리 플랫폼은 행동 데이터를 학습합니다스마트 트리 네트워크https://www.zhihuishu.com/
SMOTE 기술학습 개발 팀 불균형불균형 학습 라이브러리에 통합되어 있습니다, https://imbalanced-learn.org/stable/
윈도우 10 운영체제마이크로소프트 코퍼레이션https://www.microsoft.com/zh-cn/windows/windows-10
XGBoost 1.7.5XGBoost 개발팀https://xgboost.readthedocs.io/

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Cebi, A., Araujo, R. D., Brusilovsky, P. Do individual characteristics affect online learning behaviors? An analysis of learners sequential patterns. J Res Technol Educ. 55 (4), 663-683 (2023).
  2. Wang, Y. Affective state analysis during online learning based on learning behavior data. Tech Knowl Learn. 28 (3), 1063-1078 (2023).
  3. Wang, K., Zheng, K., Wang, Y. Construction and empirical research of a subjective-and-objective-analysis model of the online learning behavior. Soft Comput. 29 (6), 2971-2982 (2025).
  4. Yang, J. Accurate prediction and analysis of college students' performance from online learning behavior data. IEIE Trans Smart Process Comput. 12 (5), 404-411 (2023).
  5. Du, K., et al. Image-Based Intelligent Classroom Monitoring and Learning Behavior Analysis via Joint Object Detection and Semantic Segmentation. Traitement Signal. 42 (4), 2323-2332 (2025).
  6. Alqahtani, S. Leveraging techniques of epistemic network analysis to discover behaviors of student learning reflections in online learning environments. Eng Technol Appl Sci Res. 14 (3), 14191-14199 (2024).
  7. Li, Y., Wang, X., Chen, F., Zhao, B., Fu, Q. Online learning behavior analysis and prediction based on spiking neural networks. J Social Comput. 5 (2), 180-193 (2024).
  8. Zeng, B. Visual interactive mobile analysis of online English learning behavior based on lagged sequence analysis approach. Int J Interact Mob Technol. 18 (10), 34-47 (2024).
  9. Zhao, M., Zhang, Z. Prediction of online learning behavior in universities based on long short-term memory networks. J Comput Methods Sci Eng. 25 (1), 502-513 (2025).
  10. Li, F., et al. SPOC online video learning clustering analysis: Identifying learners' group behavior characteristics. Comput Appl Eng Educ. 31 (4), 1059-1077 (2023).
  11. Atenyi, J. M., Wang, C. J. Fractional fuzzy inference system design and implementation for temperature control. Iran J Fuzzy Syst. 22 (2), 171-186 (2025).
  12. Alves, K., Ballini, R., Eduardo, P. Financial series forecasting: A new fuzzy inference system for crisp values and interval-valued predictions. Comput Econ. 65 (6), 3673-3721 (2025).
  13. TuuSzabo, B., Koczy, L. T. A highly accurate Mamdani fuzzy inference system for tennis match predictions. Fuzzy Optim Decis Making. 24 (1), 99-127 (2025).
  14. Chen, Y., Li, C. Study on sensible beginning divided-search enhanced Karnik-Mendel algorithms for centroid type-reduction of general type-2 fuzzy logic systems. AIMS Math. 9 (5), 11851-11876 (2024).
  15. Fumanal-Idocin, J., Andreu-Perez, J., Cordon, O., Hagras, H., Bustince, H. ARTxAI: Explainable Artificial Intelligence Curates Deep Representation Learning for Artistic Images Using Fuzzy Techniques. IEEE Trans. Fuzzy Syst. 32 (4), 1915-1926 (2024).
  16. Duan, L., Paknejad, J., Kim, H. Employee attrition prediction with convolutional neural network and synthetic minority over-sampling technique. J Bus Analytics. 8 (1), 24-35 (2025).
  17. Luo, H., Zeng, X., Chen, Y. Research on text classification of coal mine safety hazards based on SMOTE+ENN. China Mining Mag. 34 (1), 116-125 (2025).
  18. Binbusayyis, A., Mohemmed, S. Stability prediction in smart grid using PSO optimized XGBoost algorithm with dynamic inertia weight updation. CMES - Comput Model Eng Sci. 142 (1), 909-931 (2025).
  19. Mosa, M. A. Optimizing text classification accuracy: a hybrid strategy incorporating enhanced NSGA-II and XGBoost techniques for feature selection. Prog Artif Intell. 14 (2), 275-299 (2025).
  20. Luo, S. An interior design method based on the coupling of I-GWO and self-updating neural network under the background of green interaction. Int J Sustain Dev. 28 (1), 43-57 (2025).
  21. Prabhakar, K., Jain, S. K., Padhy, P. K. Virtual inertia control of isolated microgrids using GWO-optimized modified IMC controller. Trans Inst Meas Control. 47 (4), 733-745 (2025).
  22. Lai, Y., Kang, L., Cao, W. A multi-objective particle swarm optimization using logistics-tent chaotic map with GOBL and non-inertial Lévy flight. J Comput (Taiwan). 36 (1), 59-74 (2025).
  23. Hasibur, R., Uddin, M. A., Ria, Z. F., Rahman, R. M. Optimizing BERT for Bengali Emotion Classification: Evaluating Knowledge Distillation, Pruning, and Quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  24. Liang, G., Jiang, C., Ping, Q., Jiang, X. Academic performance prediction associated with synchronous online interactive learning behaviors based on the machine learning approach Interact. Learn. Environ. 32 (6), 3092-3107 (2024).
  25. Mei, L. Model Construction of Higher Education Quality Assurance System Based on Fuzzy Neural Network. Informatica. 10 (10), 153-164 (2024).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

정오

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Formal Correction: Erratum: Multi-Perspective Fuzzy Reasoning and XGBoost-Based Analysis of Online Learning Behavior
Posted by JoVE Editors on 5/25/2026. Citeable Link.

This corrects the article 10.3791/69515

태그

XGBoost AlgorithmEmotion ClassificationLearning PerformanceGrey Wolf OptimizationPersonalized TeachingLearning Behavior AnalysisProcrastination BehaviorOnline Education

관련 논문