研究文章

教育科学的未来:生成式人工智能的使用、信任与认知负荷作为高等教育中自我认知学业表现的预测因素

DOI:

10.3791/71684

2026年6月9日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究考察生成式人工智能的使用及其对人工智能的信任如何通过认知负荷影响高等教育学生的学业表现。利用偏最小二乘结构方程模型(PLS-SEM)对390名学生的数据显示,这两个因素都能显著增加认知负荷,从而积极预测表现并调节其影响。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究探讨了生成式人工智能的使用、对人工智能的信任、认知负荷与高等教育学生学业表现之间的复杂关系。该研究基于认知负荷理论和信任文献,探讨学生对生成式人工智能工具的参与及其对这些系统的信任如何影响学业成果,认知负荷作为中介机制。采用定量横断面研究设计,随机抽样390名高等教育学生。数据采用经过验证的量表收集,衡量生成式人工智能使用率、对人工智能(类人性和功能维度)、认知负荷(内在负载、额外负载和自我感知学习)以及学业表现的信任度。采用部分最小二乘结构方程建模(PLS-SEM)结合自助法(5,000次重采样)检验假设的直接与介导关系。结果显示,生成式人工智能的使用率(β = 0.34,p < 0.001)和对人工智能的信任(β = 0.28,p < 0.001)与认知负荷显著正相关。 认知负荷也与学业表现呈正相关(β = 0.52,p < 0.001)。 此外,认知负荷显著调节生成式人工智能使用与学业表现之间的关系(β = 0.18, p < 0.001)以及对人工智能的信任与学业表现之间的关系(β = 0.15, p < 0.001)。该模型解释了45%的学业表现方差,PLS Predict也证实了高预测力。研究结果将认知负荷理论扩展到人工智能增强的学习环境,并建议认知负荷可能作为连接人工智能相关因素与学业成果的重要解释途径。在实际操作中,研究强调了培养人工智能素养、设计优化认知负荷的学习环境以及优先考虑人工智能工具开发中功能可靠性的重要性。本研究提供了实证证据,表明认知负荷是生成式人工智能使用和信任转化为学业表现的重要中介机制。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

生成式人工智能(GenAI)的快速发展引发了高等教育范式转变,从根本上改变了学生获取、处理和构建知识的方式1.ChatGPT、Gemini和Claude等工具越来越多地融入学术环境中,最新估计显示超过30%的大学生定期使用这些技术进行课程相关活动2.这场技术革命为教育者、管理者和研究人员带来了前所未有的机遇和重大挑战,帮助他们理解人工智能整合如何影响学习过程和成果。3.

虽然生成式人工智能提供了个性化辅导、即时反馈和提升生产力的潜力,但学生不仅仅是被动地吸收AI生成的信息。相反,人工智能增强学习涉及持续互动过程,学生制定提示、评估输出、将AI生成的回答与外部来源进行比较、校准对AI系统的依赖,并将机器生成的内容整合进学术任务5。这些交互需求引入了超越传统技术使用模式的新认知动态,可能同时减轻某些认知负担,同时创造新的认知努力和过载形式。这些担忧的核心在于人工智能的使用如何影响学习背后的认知过程,这一问题在实证文献中大多未被深入探讨。认知负荷理论(CLT)为审视这些问题提供了坚实的理论框架。CLT认为,学习受限于工作记忆能力的限制,有效的教学设计必须管理三种认知负荷:内容复杂性带来的内在负担、由教学设计不当带来的额外负担,以及用于模式构建和自动化的相关负担6。在人工智能增强的学习环境中,这些区别尤为突出。与生成式人工智能工具互动的学生必须同时处理课程内容,评估人工智能生成的信息的准确性和相关性,并整合可能显著增加认知需求的多元知识来源。

重要的是,认知负荷理论将认知负荷概念化为一个多维结构,由内在负荷、外在负荷和相关负荷组成,每种负荷可能对学习产生不同的影响。内在负荷源于学习材料的固有复杂性,额外负荷反映出由无效教学设计或无关处理需求产生的不必要认知负担,相关负荷则指与图式构建和有意义学习过程相关的高效认知参与。因此,认知负荷不应被普遍解释为有益或有害。虽然内在和相关负荷在适当条件下可能支持更深层次的理解,但过多的额外负荷会通过消耗有限的认知资源干扰学习。

除了使用模式,学生对人工智能系统的信任也成为塑造人机交互的关键心理因素。基于基础信任框架,人工智能的信任可分为两个明显维度:类人信任,涵盖善意、诚信和可预测性的感知;以及功能信任,反映对技术本身可靠性、能力和可信性的信心11.先前研究已确立信任是技术采用和持续使用的决定因素12,但其认知影响仍大多未被深入探讨。人工智能信任与认知负荷之间的关系理论上复杂,不应被解释为均匀的正向或线性关系13。一方面,对人工智能的适当信任可能鼓励学生更深入地参与人工智能生成的内容,投入认知努力评估回答,并将机器生成信息融入学习任务中。人工智能相关因素与学业表现之间的关系是教育者和机构关注的最终结果15。学业表现在教育研究中以多种方式作化,有些研究采用了客观指标,如绩点16,而另一些则依赖学生自我认知的学业效能17。自我感知的测量表捕捉了学生对自身学习能力和任务表现的元认知意识,研究表明这与实际学业成就密切相关。在人工智能增强的学习环境中,了解学生如何感知自己的学习尤为重要,因为这些感知可能指导后续对人工智能工具和学习策略的使用。

尽管生成式人工智能在高等教育中的普及日益普及,但关于其认知和学术影响的实证研究仍然稀少,20。现有研究主要关注采用模式、伦理问题或学科申请21,对人工智能使用与学习成果之间的心理机制关注有限22。此外,尽管信任在电子商务和人机交互领域已被广泛研究,但其在教育人工智能环境中的作用理论上尚未充分发展,且缺乏实证验证。本研究通过考察生成式人工智能使用、对人工智能的信任、认知负荷与学业表现之间的关联,并以认知负荷作为潜在的中介途径,来弥补这些空白。本研究基于认知负荷理论24页及信任文献,提出了并检验了五个假设的中介模型:(H1)生成式人工智能的使用对认知负荷产生积极影响;(H2)对人工智能的信任积极影响认知负荷;(H3)认知负荷积极影响学业表现;(H4)认知负荷调节生成式人工智能使用与学业表现之间的关系;以及(H5)认知负荷调节对人工智能信任与学业表现之间的关系。

生成式人工智能(GenAI)融入高等教育,代表了当代教学实践中最重要的技术变革之一。像 OpenAI 开发的 ChatGPT 这样的工具,在生成类人文本、解决复杂问题以及提供个性化教育支持方面展现了卓越的能力26。近期实证研究记录了大学生广泛采用这一现象。学生利用生成式人工智能进行多种学术目的,包括头脑风暴、内容摘要、校对和概念解释27。这种激增促使学者们审视生成式人工智能在教育环境中的优势与挑战。支持者认为生成式AI工具可以通过提供即时反馈、搭建复杂任务的支架,以及提供学科内容的多元视角来提升学习效果(28)。使用ChatGPT进行编程任务的学生表现出代码质量提升和完成时间缩短,暗示了潜在的认知转移优势。同样,生成式人工智能可以通过根据学生的个别需求和学习节奏调整内容来个性化学习体验。然而,批评者对学术诚信、抄袭的可能性以及学生过度依赖AI生成内容时批判性思维能力的侵蚀提出了担忧。这些相互竞争的观点强调了对生成式人工智能使用如何影响基础学习过程进行严谨实证调查的必要性。

认知负荷理论(CLT)为理解学习任务和教学设计所施加的认知需求提供了一个全面的框架。CLT建立在人类认知的既定架构之上,该架构包括几乎无限的长期记忆和极其有限的工作记忆,无论是容量还是持续时间32。根据CLT,学习发生在信息成功地在工作记忆中处理,随后以模式形式存储在长期记忆中。该理论区分了三种认知负荷:内在负荷,由学习材料的固有复杂性和学习者已有的专业知识决定;额外负担,由设计不良的教学材料和活动带来,这些活动并未直接促进学习;以及相关负载,指用于模式构建与自动化33的认知资源。研究一再证明,有效的教学设计必须管理这三种负荷类型,以优化学习成果34。高的额外负荷会将认知资源从学习过程中转移,影响表现,而适当的内在和相关负载则有助于深入理解和知识转移35。这是一种综合工具,用于在教育环境中测量这些负荷维度,能够实证调查不同学习环境下的认知负荷。近年来,学者们将CLT扩展到技术增强的学习环境,探讨数字工具如何影响认知处理36。生成式人工智能使用与认知负荷之间的关系理论复杂,实证研究不足37。一方面,生成式AI工具可能通过简化信息检索、整合多元来源以及以易懂格式呈现信息来减轻额外负担。学生不再需要独立浏览多个数据库或解读复杂文本,可能释放认知资源用于更深层次的处理39

信任是塑造人与技术互动的基本心理机制。在信息系统背景下,信任是多维的,涵盖了对技术系统能力、善意和完整性的信念。应用于人工智能时,信任可分为两个概念上截然不同的维度:类人信任,涉及对人形特质如善意和可预测性的归因;以及功能信任,反映对技术能力可靠性能的信心41。这一区别在教育环境中尤为重要,学生必须决定在多大程度上依赖AI生成的内容完成学术任务。根据详细似然模型,个体根据动机和能力,通过中央或外围路径处理信息。当信任度高时,学生可能会进行集中路由处理,仔细审查并详细阐述AI生成的内容,从而增加用于学习的认知负荷。学业表现是教育研究中的终极标准变量,通过客观指标如绩点和主观衡量学生自我认知的学业效能来操作化43。自我感知的测量为学生对自身学习能力的元认知认知意识提供了宝贵的见解,并已证明与客观绩效指标有强烈关联。自我认知以评估学生对学业效能的感知,包括与学习效率和任务完成相关的项目44。这种方法在人工智能增强的环境中尤为适用,因为学生对自己通过人工智能工具学习能力的信心可能影响实际学习成果。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

材料表总结了研究中使用的工具、软件和量表,包括针对生成式人工智能使用的适配和验证量表、对人工智能的信任度、认知负荷、自我认知的学业表现、抽样和调查程序,以及数据分析工具(SPSS和SmartPLS)。此外,该研究不涉及任何可能对参与者构成身体或心理风险的实验操作、医疗程序或干预措施,因此不适用伦理批准。该研究使用非侵入式、自我管理的在线问卷,收集学生对生成式人工智能在学术环境中使用的感知、体验和行为数据。由于该研究仅完成调查,没有直接互动,未进行临床试验、生物医学程序或实验性治疗,参与者也未遭受任何可能造成伤害或痛苦的实验性条件。在数据收集前,所有参与者都获得了一份详细的知情同意书,说明研究目的、参与的自愿性质以及确保匿名和保密的措施。知情同意通过填写并提交问卷,隐含地获得,正如知情同意表中明确规定的那样。参与者被保证,他们的回答将仅用于学术研究目的,不会收集或报告任何可识别个人身份的信息。此外,参与者被告知在提交问卷前可随时退出研究,且无后果。所有数据均安全存储在仅研究团队可访问的密码保护设备上,汇总结果以防个别受访者身份被报告。这些措施确保研究按照《赫尔辛基宣言》的伦理原则及涉及人类参与者的研究机构指南进行,尽管IRB的正式审查要求不适用。

研究设计

本研究采用定量、横断面研究设计,探讨生成式人工智能的使用、对人工智能的信任、认知负荷与高等教育学生学业表现之间的复杂关系。该设计通过一种调查策略得以实施,因其在收集大量样本标准化数据方面的高效和有效性,从而实现对假设关系的稳健统计检验。调查方法便于利用经过验证的量表系统地测量每个构念,确保收集的数据既可靠又可对所有受访者进行比较。此外,采用横断面方法,即在单一时间点收集数据,对本研究尤为适用,因为它能够审视生成式人工智能在学生中当前的使用率和信任度,同时评估这些变量之间的相互关联及其对研究目标人群认知负荷和学业表现的集体影响。

参与者与抽样程序

本研究的目标人群包括在高等教育机构就读、有使用生成式人工智能工具(特别是ChatGPT及类似大型语言模型)进行学术工作的学生。为确保该总体的代表性横截面并增强结论的普遍性,采用了分层随机抽样技术。抽样框架来自大学注册处,包含所有院系现有在校学生的完整名单。分层基于两个关键的人口统计变量:学科和学习年份。学术学科分为四大主要层级:人文与社会科学、自然科学、工程与技术,以及商业与经济。学习年级分为四个层级:一年级、二年级、三年级和四年级本科生,以及研究生(硕士和博士)。这种双层分层方法确保了学生群体中每个子群体的比例代表,防止了任何学科领域或学术层面的过度代表或不足。从每个层级中,参与者通过随机数生成器随机抽取,数字与该层在整体学生群体中的代表性成比例。这种系统化的参与者选择方法确保最终样本准确反映了高等教育学生群体的多样性,包括学术背景和教育进展。

关于参与者的人口统计,390名受访者样本涵盖了不同年龄段的学生,通常在18至35岁及以上之间,性别认同比例与机构人口统计比例均衡。样本涵盖了所有四个本科年以及研究生,确保涵盖了学术发展的不同阶段以及不同程度的人工智能工具接触。学科按比例代表,样本中包含人文、理科、工程和商业背景的学生。此外,收集了基本的人口统计信息,如先前的技术经验、生成式人工智能的使用频率和母语状态,以为主要调查变量提供背景。这种全面的人口统计学分析有两个目的:首先,它允许对样本进行描述性描述;其次,使研究人员能够控制后续分析中潜在的混杂变量。对抽样程序和人口特征的详细记录确保其他研究者能够精确复制该研究,从而满足科学上的可重复性要求,并实现跨不同机构和文化背景的有意义比较。此外,这种严谨的抽样方法增强了研究结果的外部效度,使得结果能够更自信地推广到更广泛的高等教育学生群体。本研究的数据通过结构化、自我执行的在线问卷收集。问卷分为五个部分,旨在使用既定且验证的量表衡量研究的核心构念。除非另有说明,所有项目均采用五点李克特量表测量,范围为1(“强烈不同意”)到5(“强烈同意”)。

仪器与测量

生成式人工智能的使用,特别是ChatGPT,是通过一项基于45项研究的8项量表进行量化的。这一尺度超越了简单的使用频率,体现了学生与人工智能互动的多面性。这些题目聚焦于三个关键维度:(a)各种学术任务的使用频率,(b)其具体用途(如头脑风暴、内容总结、校对),以及(c)学生对该工具提升语言相关学术工作的感知效果。人工智能中的信任被概念化为一个多维构造,借鉴了人际信任46和技术信任的既定框架。该尺度包含两个不同的维度。类人信任:这个包含6题的子量表衡量学生赋予AI人性特质的程度,如仁慈、诚信和可预测性。例如,题目评估学生是否认为人工智能是否以他们的最佳利益为出发点或提供公正的信息。功能信任:该5项子量表评估AI功能表现的信任度。它关注技术本身的可靠性、能力和可靠性,体现了人工智能具备高效完成学术任务所需功能的信念。

认知负荷的测量采用了基于另一项基于CLT的47项研究的量表。为了体现CLT的三元结构,该量表被划分为三个子量表:内在负荷(3项):该子量表评估学习材料和任务本身固有的复杂性和难度。一个示例项目可能是,“我课程中涉及的主题非常复杂。”多余负荷(3项):该子量表衡量教学设计和信息呈现方式所施加的认知负担。例如,“作业的指示往往不清晰且难以跟上。自我感知学习(4项):根据先前的教育研究,该子量表被用作相关认知处理的近似指标,而非直接衡量相关负荷本身48。这些题目捕捉了学生对理解、理解和图式构建过程所投入的心理努力的感知,这些过程与有意义的学习相关。然而,由于自我感知的学习可能在概念上与更广泛的学术能力和成就认知重叠,应谨慎地将其解读为生产性认知参与的部分操作性表现,而非相关负荷的权威衡量。它包括与理解、理解以及掌握材料的感觉相关的内容。遵循教育研究46的先例,学业表现采用自我感知量表进行操作化。采用了4项乐器。这种方法适合捕捉学生对其学习效能和学业成就的主观评估。该量表侧重于学业效能的感知,包括诸如“我对成功完成课程有信心”和“我觉得自己已经学会了高效且有效地管理学业任务”等陈述。

数据分析策略

采用偏最小二乘结构方程建模(PLS-SEM)来考察生成式人工智能的使用、对人工智能的信任、认知负荷与自我认知学业表现之间的关系。PLS-SEM的选择基于方法学和分析两方面。首先,该研究采用了以预测为导向和探索性的建模视角,旨在考察AI增强学习环境中相对新兴构念之间的联想路径,而非检验完全确立的因果理论。其次,PLS-SEM适用于涉及多个潜在构念和中介通路的复杂模型,尤其当主要目标是方差解释和预测分析时。此外,PLS-SEM在非正态数据分布条件下具有鲁棒性,适用于使用适中样本量的社会科学调查研究。鉴于生成式人工智能研究在高等教育中的探索性质以及研究强调感知构念间预测关联的探讨,PLS-SEM在方法论上被认为适合本次分析。

收集的数据将采用两步法分析,采用偏最小二乘结构方程建模(PLS-SEM)和SmartPLS 4软件。PLS-SEM是一种基于方差的技术,适用于复杂预测模型,且不要求数据呈正态分布。第一步:评估测量模型。第一步是评估构念的可靠性和有效性。内部一致性可靠性将采用克朗巴赫α和复合信度评估,阈值为0.70。通过检查指标的外负载(应>0.70)和每个构念提取的平均方差(AVE)(应>0.50)来确定收敛效度。判别效度(即确保构念在经验上不同)将采用Fornell-Larkker准则和异性状-单一性状(HTMT)相关性比来评估。第二步:结构模型评估。一旦测量模型被确认可靠有效,结构模型将被评估以检验研究假设。这涉及使用自举程序对路径系数(β)进行显著性和相关性,分析5000次重采样。评估的关键标准将包括确定系数(R2):用于衡量模型的预测能力(即内生变量,特别是学业表现中解释的方差)。预测相关性(Q2):利用蒙眼程序评估模型的预测准确性。效应量(f2):评估每个自变量对因变量的实质性影响。中介分析:测试认知负荷在与人工智能相关前提(生成式人工智能使用、对人工智能的信任)与学业表现之间关系中的中介作用。间接效应的显著性将通过自助置信区间进行评估。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

描述性统计

通过描述性统计数据总结了本研究关键变量的核心趋势和分布,包括生成式人工智能的使用、类人信任、功能信任、内在负荷、额外负荷、自我感知学习和学业表现。描述性分析使用SPSS第26版进行,结果见下 表1

变量标准差偏态峰度
生成式人工智能的应用3.820.71-0.45

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究的第一个重大发现显示,生成式人工智能的使用与认知负荷呈正相关(β = 0.34,p < 0.001),这一结果与假设1相符。 这一发现表明,报告更频繁使用生成式人工智能工具(如ChatGPT)的学生,在学习活动中也报告了更高的认知负荷。生成式人工智能使用与认知负荷之间的这种积极关联,更适合从人机交互的角度理解,而非简单的技术使用框架。更频繁参与生成式人工智能的学生不仅是在获取信息,还参与了一个迭代的互动过程,包括提示制定、输出解释、来源比较、可靠性评估,以及是否以及如何将人工智能生成内容纳入学术工作的决策49.这些互动过程往往需要持续的认知监测和评估判断。从这个角度看,生成式人工智能的使用可能与认知需求减少和增加相关。例如,人工智能系统可能有助于减轻信息检索、起草和总结相关的负担,这可能对应某些额外认知努力水平的降低。与此同时,人工智能的使用可能伴随着验证、歧义管理和依赖校准等新需求,尤其是在输出不一致、不准确或上下文不完整时。因此,在本样本中,人工智能增强学习环境中的认知负荷不仅与教学内容本身相关...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

所有作者均声明无利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该研究未获得任何资助。

访问受限。请登录或开始试用以查看此内容。

材料

```html

本文使用的材料清单
姓名公司目录编号评论
Blindfolding ProcedureSmartPLS 4(内置)N/A计算结构模型的预测相关性的Q²。
Bootstrapping Procedure(5,000 次重抽样)SmartPLS 4(内置)N/A用于评估路径系数(β)和间接效应的显著性。
认知负荷量表 - 额外负荷(3 项)Hadie & Yusoff(2021) N/A(已验证量表)教学设计和信息展示的认知负担。
认知负荷量表 - 内在负荷(3 项)Hadie & Yusoff(2021) N/A(已验证量表)学习材料/任务的感知复杂性/难度。
认知负荷量表 - 自我感知学习(4 项)Hadie & Yusoff(2021) N/A(已验证量表)相关认知处理的代理;捕捉理解和模式构建的心理努力。
Fornell-Larcker 准则SmartPLS 4(内置)N/A评估构念的判别有效性。
生成式 AI 使用量表(8 项)Abbas et al.(2023) N/A(调整后的量表)衡量生成式 AI(ChatGPT)用于学术任务的频率、目的和感知效能。5 点 Likert 量表。
HTMT 相关系数比率SmartPLS 4(内置)N/A异质性-一致性比率;额外的判别有效性检查。
知情同意书研究团队(机构指南)N/A详细描述研究目的、自愿参与、匿名性、保密性和撤回权。通过完成调查隐含同意。
在线问卷平台未指定(通用)N/A结构化、自我管理的基于网络的问卷;所有项目采用 5 点 Likert 量表(1 = 强烈不同意到 5 = 强烈同意)。
抽样框架大学教务处N/A(机构记录)所有学院当前在读学生的完整列表,用于分层随机抽样。
自我感知学术表现量表(4 项)改编自教育研究先例 N/A(调整后的量表)学术效能和成就的主观评估(例如,对课程的信心、有效的任务管理)。
SmartPLS 4 软件SmartPLS GmbH版本 4基于方差的结构方程模型软件;用于 PLS-SEM 分析、引导、盲褐。
SPSS 版本 26IBMN/A用于初步数据筛选、描述性统计和任何预-PLS-SEM 数据管理(如果适用)。
分层随机抽样程序研究团队(手动)N/A基于学术学科(4 类)和学习年份(5 个层次:1-4 年本科 + 研究生)的层次。在层次内使用随机数生成器。
对 AI 的信任量表 - 功能信任(5 项)改编自技术信任文献N/A(调整后的量表)衡量对学术任务的 AI 的感知可靠性、能力和可靠性。
对 AI 的信任量表 - 人性化信任(6 项)改编自人际信任(Rempel 等)和技术信任文献N/A(调整后的量表)评估归因于 AI 的善意、诚信和可预测性。
```

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章