研究文章

基于贝叶斯网络的AI生成内容所有权中法律不确定性建模:知识产权分配方法

155 次观看

DOI:

10.3791/71101

2026年6月12日

本文内容

摘要

本研究提出了一种基于贝叶斯网络的工作流程,用于在法律和技术不确定性条件下分析人工智能生成内容的所有权。通过结合人工智能诉讼案例、版权数据集和框架模型,综合考虑人类贡献、合同约定、训练数据的合法性以及人工智能自主性等因素,以支持在知识产权争议中进行透明、可解释和基于情景的决策。

摘要

生成式人工智能的迅速普及暴露了基于人类创作的传统知识产权框架的局限性,导致所有权归属的不确定性。本研究提出了一种基于贝叶斯网络的工作流程,用于在法律与技术不确定性条件下分析人工智能生成内容的所有权归属。该工作流程整合了数据集整理、变量标注、概率依赖建模、推理生成、交叉验证和敏感性分析,以评估人类贡献、训练数据合法性、合同背景以及人工智能自主性等因素之间的关系。该框架通过从精选的人工智能诉讼数据集、公开的法院判决数据库以及人工智能版权案件追踪系统中提取的标注案例开发而成。研究还进行了敏感性分析,以考察不同情境下法律与技术变量对所有权归属的影响。所提出的框架支持对人工智能相关知识产权争议进行概率化且可解释的推理,为法律专业人士、政策制定者和人工智能开发者提供结构化的决策支持方法。结果表明,在不同数据折分下,后验概率估计稳定,跨数据集的所有权预测一致性超过80%。该框架支持基于情景的概率推理,提供可解释的决策支持工具,有助于提升法律专业人士、政策制定者和人工智能开发者在解决所有权争议时的透明度与一致性。

引言

人工智能(AI)系统在医疗保健、刑事司法、金融和数字平台等高风险行业中的应用日益广泛,引发了关于法律责任、问责制和公平性的重要问题。尽管取得了快速进展,但目前关于人工智能治理的大量文献要么具有规范性,要么具有预测性,缺乏实证支持1,2。现有的发现人工智能相关问题的方法,如事件数据库、基于调查的研究和伦理框架,往往难以捕捉现实世界中持续存在的问题。这些方法要么过度强调高调事件而忽视系统性、实践层面的问题,要么反映的是预期而非可观测的损害3,4。大多数事件数据库依赖于自愿报告和媒体报道,通常突出高调失败案例,而对常见但重要的与人工智能相关的问题则代表性不足5,6。生成式人工智能,特别是基于Transformer架构的深度学习模型(如大语言模型,LLMs),使系统能够生成文本、图像和音乐,进一步加剧了内容生产的复杂性7,8,9。这一转变使得基于人类创作的传统知识产权框架面临挑战,使人与机器生成的创新之间的界限变得更加模糊10,11,12

以往关于人工智能生成内容与知识产权的研究主要集中在政策分析和法律解释上,包括对作者身份、原创性和所有权等概念的讨论13。尽管这些研究提供了有价值的见解,但它们主要是描述性的,缺乏通过计算方法解决所有权认定不确定性的手段14。与此同时,支持内容归属与溯源的技术方法已被开发出来,包括水印、指纹识别和数据集保护15。然而,这些方法并未解决所有权的法律分配问题,尤其是在涉及开发者、用户和数据生产者的多利益相关方环境中。此外,当前的跨学科研究在构建能够整合技术和法律因素以在不确定性条件下评估所有权的概率模型方面,尚未取得充分进展16,17,18,19,20。法律研究已指出,现有知识产权框架在应对人工智能生成内容的所有权问题上存在局限性。在许多司法管辖区,包括根据《印度版权法》第13条的规定,人工智能生成的作品通常无法满足传统的作者身份标准,从而导致所有权归属模糊21,22。尽管先前的研究探讨了司法解释和版权影响,但缺乏对所有权认定中不确定性进行建模的正式机制22,23。为弥补这一空白,本研究提出一种基于贝叶斯网络的框架,通过建模人类参与程度、训练数据来源、合同背景以及人工智能自主性之间的概率关系,实现基于场景的所有权分析24

研究探索了机器学习模型(如逻辑回归、支持向量机(SVMs)、卷积神经网络(CNNs)和长短期记忆(LSTM)网络)在法律决策中的应用,表明这些模型在需要处理大量案件且人工判例分析耗时的法律环境中具有实用价值25。然而,这些方法通常缺乏可解释性和透明度,而这两点对于可问责的司法决策支持至关重要。因此,可解释人工智能(XAI)方法受到关注,因其能够提升模型的可解释性,并为人工智能辅助决策提供可理解的推理过程26,27,28

方法/途径所用数据优点缺点 / 不足
法律审查 & 技术仪器,用于将内容与训练数据关联 & 提出归因与问责的框架。29文献调查,案例示例融合技术与法律视角;提出可操作的归因策略缺乏形式化的概率建模;无定量验证
生成模型训练/输出技术知识产权保护方法的分类学30技术方法与风险评估系统性综述;整理现有的知识产权保护技术侧重于训练数据保护与生成内容所有权之间的对比
提出隐式指纹/水印技术以验证人工智能来源 & 知识产权归属31生成模型实验(文本 & 图像)实用验证工具;对所有权证据具有强支持性水印技术本身并不能解决法律所有权框架问题
作者身份的比较法律分析 & 不同司法管辖区的所有权标准。32法律学说、成文法文本、代表性案例阐释人类贡献如何影响所有权决策描述性;未提出计算模型

表1:先前研究中方法论、数据来源和主要发现的总结。 关于人工智能生成内容所有权的现有研究概述,重点介绍所采用的方法学方法、使用的数据集以及主要发现。

表1总结了现有方法、数据来源及主要发现29,30,31,32。该表格讨论了文献中关于人工智能生成内容的所有权问题,并重点阐述了相关研究采用的方法学路径、所使用的数据集以及研究结论。近期关于人工智能治理与版权争议的研究进一步凸显了人工智能生成内容在作者身份认定、训练数据合法性以及所有权归属方面所面临的挑战33,34。尽管溯源追踪和证据验证等方法有助于归属分析34,但现有的基于规则和机器学习的方法在处理模糊性、相互冲突的证据以及具有法律解释力的所有权推理方面仍存在局限性。水印技术和溯源分析等技术手段也主要聚焦于归属问题,而非所有权的判定。

本文提出了一种基于贝叶斯网络的框架,用于在法律和技术不确定性背景下评估人工智能生成内容的所有权,克服了当前确定性、基于规则的方法的局限性。该方法通过建模人类参与、训练数据来源、合同背景以及人工智能自主性等关键因素之间的概率性相互作用,能够基于不完整或模糊的证据进行情景化推断。与传统的预测模型不同,该方法提供了可解释的后验概率估计,有助于实现与司法决策程序一致的清晰、有序的推理过程。

重要的法律与技术概念在研究中被明确定义,以确保全文的一致性。“所有权”指与作品产出相关的权利分配,“作者身份”则指对创作者的法律承认。“归属”不一定表示法律上的所有权,但能够识别出贡献主体。“可解释性”指模型为概率性结果提供可理解解释的能力,而“法律不确定性”则指由于法律标准不完整或变化而产生的模糊性。通过将法律与技术因素融入可解释的概率化工作流程,所提出的方法旨在促进人工智能相关知识产权争议中的结构化决策。对于评估生成式人工智能系统中所有权问题的法律专家、立法者及人工智能开发者而言,该方法提供了一种计算视角。

访问受限。请登录或开始试用以查看此内容。

方案

本研究不涉及人类参与者或动物受试者。分析仅基于公开的法律案例资料和经过整理的法律数据集。因此,无需获得伦理审批和知情同意。

本研究提出的方法旨在通过基于实际案例数据构建贝叶斯网络,以捕捉围绕人工智能生成内容所有权的法律不确定性。首先,将从现有语料库中收集与人工智能相关的案例,包括版权、专利和商业秘密案例,并为每个案例标注实际的法律判决结果。根据法律先例和现有案例研究,可能影响内容所有权的不确定性参数包括人类创造性投入、人工智能系统自主性、训练数据的合法性、所有权的合同定义、司法管辖权以及透明度;这些参数将作为贝叶斯网络中的节点,每个节点具有离散状态,用以表示不同的法律与技术现实,而内容所有权的判定则作为目标节点。该网络结构通过结合法律专业知识与数据驱动的结构发现方法进行构建,以提升模型的可解释性与法律合理性。随后,基于案例中识别出的诉讼结果,对条件概率表进行近似估计,使网络能够以概率方式处理不确定和不完整的数据。模型训练完成后,可进行推理和情景测试,以确定各影响因素的变化如何基于所构建的贝叶斯网络影响对人工智能生成内容所有权的推断,并在得出结论前进行测试与敏感性分析验证,从而为开发者和司法机构在人工智能应用中的知识产权未来法律影响提供支持。图1展示了本研究提出的架构工作流程。

使用人工智能进行法律案例分析的贝叶斯网络模型示意图;包含数据预处理和模拟。
图1:所提出框架的架构图:基于贝叶斯网络的AI生成内容所有权判定系统的总体概述。 该架构展示了从数据获取与标注到概率建模、推理及所有权归属的流程。请点击此处查看该图的放大版本。

图1 展示了所提出的基于贝叶斯网络的AI生成内容所有权分析框架的体系结构工作流程。该流程包括数据收集、特征标注、贝叶斯网络建模、概率推理、情景分析和验证。在贝叶斯框架内,对人类参与度、AI自主性、训练数据来源、合同背景和司法管辖权等法律与技术变量进行建模,以在不确定条件下估算所有权归属。该框架支持可解释的概率推理和基于情景的评估,为法律决策提供支持。

数据收集
从多个来源收集了有关法律案件的数据,以建立一个专注于涉及人工智能生成内容的版权与知识产权诉讼的数据库。首先,对基础论文中获取的法律案例总体数据集进行筛选,仅保留与训练数据中版权、所有权、知识产权相关争议及其他知识产权事项有关的诉讼案件。此外,还从公开的法院判决数据库中获取了额外的法律案例,这些数据库提供了数百万起案件的法院判决意见;同时,还利用了一个版权案件追踪库,该库对全球范围内涉及人工智能在知识产权方面的使用所引发的正在进行和已结案的法律程序进行跟踪。所有法律案例均进行了标注,以突出关键变量,包括案件判决结果、人类创造性投入的程度、人工智能系统的自主性、训练数据的来源、司法管辖区以及合同相关参数(如适用)。该数据集为多来源整合而成,汇集了足够数量的与人工智能工具使用相关的知识产权数据,适用于贝叶斯网络分析中的概率推理。

本研究通过系统性的收集与筛选过程,使用了三个主要数据来源构建数据集,包括基础人工智能诉讼数据集、公开的法院判决数据库以及人工智能版权案件追踪库。在各数据库的检索界面和元数据字段中,使用了“人工智能”、“AI生成内容”、“版权”、“知识产权”、“作者身份”、“所有权”和“机器生成作品”等关键词,以查找相关案件。仅纳入涉及人工智能生成或人工智能辅助内容,并在所有权、作者身份或知识产权问题上具有足够分析深度、可用于变量提取的案件。排除重复案件、与人工智能生成内容无关、聚焦于其他法律领域或信息不足的案件。采用两阶段筛选流程,在初步进行标题和摘要审查后,进行全文资格评估。为确保案件唯一性,通过案件元数据识别来自多个数据集的重复记录并予以剔除。

在数据集检索过程中,使用了以下关键词:“人工智能”、“AI生成内容”、“机器生成作品”、“版权”、“作者身份”、“所有权”、“训练数据”以及“知识产权争议”。为确保数据集的质量与相关性,采用了两阶段筛选程序。第一阶段通过审查案件标题和案件摘要,识别与人工智能相关的所有权和版权争议。第二阶段进行全文案例审查,以确定是否符合纳入研究的标准。仅纳入涉及AI生成或AI辅助内容、且包含充分法律与技术细节(如作者身份、所有权归属、合同背景或训练数据使用)的案例。排除标准包括:背景信息不足、法律文件不充分、重复条目,以及与知识产权争议无关的案例。通过比对案例标题、司法管辖区、立案日期和争议类别等元数据,识别并剔除跨来源的重复案例。随后,对最终筛选出的数据集进行标注、贝叶斯网络建模、概率推断以及敏感性分析。

本研究所采用的数据包括涵盖人工智能内容所有权和知识产权主张相关争议全范围的法律资料汇编,如表2所示。首先,主要研究中使用的AI诉讼数据包含了约72起与版权主张、作者身份、发明者署名以及涉及AI输出所有权问题直接相关的法律争议的精选保留案例。为了提高数据的多样性,以更全面地反映生成式AI领域中新兴争议的情况,研究还从公开的法院判决数据库(CAP)——一个大规模公开的美国法院判例集合——中获取了相关争议,并基于与知识产权法律相关的术语,筛选出38起具体的AI知识产权争议案件。此外,本研究还利用AI与版权案件追踪系统,纳入了21起全球领先的AI版权争议案件,该系统基于一种由AI训练支持的版权法律分析方法,通过特定的初步分析流程对AI版权争议进行解析,从而构建出一个针对重大国际法律争议的定制化AI版权案件追踪库。最终的数据集共包含131个案件:一个基础AI诉讼数据集、一个公开法院判例数据库以及一个AI版权案件追踪库。这些案件在经过纳入标准、排除标准及去重程序筛选后被选定。

数据集来源数据集类型使用的案例数量覆盖范围
Base AI Litigation Dataset1与人工智能相关的法院案件72(筛选后的子集)美国联邦和州法院
Caselaw Access Project (CAP)31公开法律案例语料库38(聚焦人工智能与知识产权)美国法院判例意见
AI & Copyright Case Tracker (CMS)32人工整理的案例摘要21个具有里程碑意义的案件全球(美国、欧盟、英国)

表2:数据集描述。用于建模人工智能生成内容中知识产权争议的数据集概要,包括数据来源、结构及其对所有权分析的相关性。

为确保准确性和一致性,采用了人工与半自动化流程相结合的方法。标注方法由三名具有法律和人工智能相关法律研究背景的标注人员实施。所有变量,包括人类创造性贡献、人工智能系统自主性、训练数据合法性、合同所有权条款、司法管辖权、人工智能参与的透明度,以及明确的决策规则和示例,均在一份带注释的编码手册中进行了定义。两名标注人员独立对每个案例进行标注;分歧通过讨论解决,必要时由第三位专家评审员裁决。采用科恩 kappa 系数(Cohen's kappa coefficient)衡量评分者间一致性,结果为 0.81,表明一致性较强。约 9% 的案例存在分歧,主要集中在人工智能自主性判断和合同解释方面。完成的标注结果被用于后续的贝叶斯网络建模。

法律不确定性因素的识别
通过对多个法律数据集(包括基于诉讼的数据集和公开的法院资料库)中与人工智能相关的知识产权案例进行分析,确定了人工智能生成内容所有权方面的主要不确定性来源。人类创造力、人工智能的自主性、训练数据的合法性、合同关联性、司法管辖问题以及人工智能系统的透明度是重要的影响因素。法院经常强调人类参与的程度以及合同中所有权的定义,而版权法之间的差异以及受版权保护的训练数据的使用进一步加剧了法律上的模糊性。基于上述因素,构建了用于所有权概率分析的贝叶斯网络框架。

因素描述
人类创造性参与人类在生成内容过程中所作贡献的程度(高、中等或最低)。
人工智能自主性水平人工智能系统在无人类指导的情况下独立运行的程度。
训练数据的所有权与合法性所使用训练数据的法律状态(已授权、公共领域、专有或侵权)。
合同所有权条款是否存在明确界定各利益相关方所有权的协议及其清晰程度。
司法管辖区法律框架适用的国家或地区知识产权法律。
使用目的人工智能生成内容用于商业或非商业目的。
透明性与可解释性有关人工智能系统设计与运行的信息是否可获取。
人工智能辅助的披露在内容创作过程中是否明确披露了人工智能的使用。
生成内容的性质所产出内容的类型(例如文本、图像、代码或设计)。
司法判例的可获得性是否存在与人工智能生成内容所有权相关的先前法院裁决。

表3:影响所有权归属的关键法律与技术不确定性因素。 影响人工智能生成内容所有权认定的关键变量,涵盖法律与技术两个维度。

表3 总结了所提出的贝叶斯网络模型中与所有权归属相关的不确定性。这些不确定性基于与人工智能相关的知识产权争议以及现有的知识产权法律。人类在人工智能中的创造性投入与自主性,指的是在确定所有权时人类作者与人工智能生成内容之间的关系。包括人工智能所使用的训练数据的合法性、合同所有权以及司法管辖区现有知识产权法律在内的各种不确定性,均可能成为争议的依据。使用目的与人工智能辅助披露,指的是司法系统如何看待人工智能辅助生成内容的具体情形。而透明性与可解释性,则涉及与问责制和责任相关的方面。其他不确定性因素,包括人工智能生成成果的性质以及现有的司法判例,决定了现有知识产权法律如何适用于人工智能生成的成果。

数据标注与变量编码
该数据集由筛选后的AI诉讼案件、CAP以及选定的AI版权案件等构建而成,随后将根据每个案件所识别出的法律不确定性因素,进行人工和半自动化的标注。针对每个案件,通过评估法院意见、描述及推理来确定结构化标签。标注任务包括确定法律和技术因素,例如人类创造性参与的程度、AI的自主性、训练数据的法律有效性、所有权相关的合同条款、司法管辖权以及AI协助的披露情况。为确保一致性,相关指南源自其他知识产权原则,并通过多种法律来源的交叉核对予以验证。有关数据标注与变量编码的详细数学描述,请参见补充文件1S1)。

该框架使用具有概率图模型库和数值计算工具的编程语言实现。数据预处理和分析在配备多核处理器和标准内存配置的台式计算机系统的基于笔记本的计算环境中进行

为确保数据集标注的一致性和可重复性,针对贝叶斯网络框架中包含的所有法律与技术因素,建立了一套结构化的变量编码方案。每个案例均通过人工审阅,并依据法律先例及人工智能治理文献中的预定义分类状态进行标注。表4总结了本研究中使用的变量、描述及其编码类别。为支持贝叶斯网络框架内的概率建模与基于情景的推断,该编码系统被统一应用于所有标注案例。变量状态的选择旨在反映涉及人工智能生成内容的争议中常见法律与技术情境。

变量描述编码类别
人类贡献人类在内容生成中的创造性参与程度低、中、高
人工智能自主性人工智能系统独立生成内容的程度低、中、高
训练数据合法性用于人工智能训练的数据集的法律状态已授权、公共领域、不确定、未经授权
合同所有权是否存在合同中的所有权条款存在、不存在
署名清晰度贡献者身份识别的清晰程度清晰、部分清晰、不清晰
司法管辖区与争议相关的法律管辖区域印度、美国、中国、其他
透明度关于人工智能生成过程的信息可获取程度高、中等、低
所有权结果最终的所有权归属结果(目标变量)人类所有、共享所有权、组织所有、不确定

表4: 用于贝叶斯网络标注的变量编码方案。 该表总结了数据集标注过程中使用的法律和技术变量,包括其定义以及用于概率建模和所有权推断的类别编码状态。

贝叶斯网络结构设计
贝叶斯网络(BN)用于建模影响人工智能所生成信息所有权的上下文、技术和法律因素之间的概率关系。目标节点表示所有权结果,而网络中的节点则代表人类贡献、人工智能自主性、训练数据合法性、合同所有权条款和司法管辖权等变量。由数据驱动关联和司法推理过程产生的条件依赖关系通过有向边进行记录。数据驱动优化与法律约束相结合,形成了一种混合结构学习方法。允许的依赖关系由司法原则确定,并通过基于评分的结构学习方法找出最能解释已报告诉讼结果的依赖图。该方法确保最终网络在法律上具有可解释性,同时在统计上具有有效性。

人工智能治理示意图展示了影响所有权决策的因素:人类输入、自主性、数据。
图 2:用于所有权推断的贝叶斯网络结构。 贝叶斯网络的图示,展示了影响所有权决策的法律与技术变量之间的依赖关系。 请点击此处查看该图的放大版本。

图2展示了贝叶斯网络在人工智能生成内容所有权归属中的应用。在高层模型中,一些关键输入变量——即人类输入、训练数据、人工智能自主性以及司法管辖区——代表了在判定人工智能生成内容权利归属时应考虑的关键法律与技术维度。每个变量都被设定为概率节点,而非硬性编码规则,从而构建出一个能够反映变量间依赖关系的模型。绿色节点(也称为连接点)出现在输入节点与最终输出之间,例如,它们表明人类参与程度如何与人工智能自主性相关联,同时,训练数据的法律属性和司法管辖区因素则共同从地域法律视角界定人工智能生成内容的权利归属。

法律理论和带注释的诉讼数据为贝叶斯网络的变量选择和离散状态定义提供了基础。鉴于其在确定所有权方面的重要性,人类参与、人工智能自主性、训练数据的合法性、合同条款、司法管辖权和透明度等关键因素被列为首要考虑因素。通过专家评审的标注标准,将变量离散化为具有法律意义的类别。为了识别具有统计支持的依赖关系,采用结合基于评分的学习方法与法律约束的混合策略来构建网络结构。该方法进一步通过敏感性分析和消融研究加以验证,结果证实了人类输入和合同限制对所有权推断具有显著影响,而其他变量则表现出调节作用。对于决策支持系统而言,这种结合法律与实证的方法增强了系统的稳健性和可解释性。

所有相互连接节点的推断概率汇聚于所有权决策节点,该节点根据现有的法律和技术证据生成后验所有权概率。即使在证据不完整或存在争议的情况下,此方法仍可实现所有权推断,并在新证据出现时支持动态更新。为减少过拟合和虚假相关性,采用模型选择和敏感性分析去除冗余或影响较小的连接,从而得到一个简洁的有向无环图(DAG)。最终的贝叶斯网络结构刻画了影响人工智能生成内容所有权法律不确定性的各因素之间的概率依赖关系和因果关系。贝叶斯网络设计的数学描述详见补充文件1S2)。

即使某些法律或技术因素不完整或仅部分可观测,贝叶斯网络仍能实现概率性的所有权推断。通过修改证据变量,该框架还支持基于情景的分析,适用于法律决策、政策评估以及人工智能治理应用。网络结构采用混合方法构建,结合了专家定义的法律约束与数据驱动的学习方式。结构优化采用基于贝叶斯信息准则(BIC)评分的爬山算法,而参数估计则采用带有狄利克雷先验和拉普拉斯平滑(&α = 1)的贝叶斯方法,以应对数据稀疏性和缺失观测问题。所有变量均表示为离散的类别状态,以支持概率推断。使用 Python 概率图模型模块构建贝叶斯网络框架。网络构建包含两个阶段:参数学习与结构定义。初始时,网络中的节点代表在数据集标注过程中发现的法律与技术特征。通过结合数据驱动的结构依赖性分析与专家定义的法律关系,确定节点之间的有向边。利用最大似然估计法,从标注数据集中估计条件概率表(CPTs)。在计算环境软件包中,采用概率图建模技术实现贝叶斯网络,使用最大似然估计函数进行参数学习,使用贝叶斯网络()函数定义网络结构。采用变量消元()推理程序,在不同证据条件下计算后验所有权概率。

参数学习
在对人工智能生成内容所有权中的法律不确定性进行定量建模时,参数估计是所提出的贝叶斯网络框架中的关键步骤。本研究采用贝叶斯参数估计方法,从标注的法律案例中学习条件概率表(CPTs)。目标节点表示所有权归属,而每个节点则反映一个法律或技术层面的因素,例如人类贡献程度、人工智能自主性、训练数据的合法性或合同中的所有权条款。由于贝叶斯估计能够处理法律材料稀缺和证据不足的情况,因此被选用以促进可解释的法律推理,并体现司法判决中观察到的概率关联。贝叶斯网络中获得的代表性条件概率值见表5。当人工智能自主性较高时,往往导致所有权不确定或无所有权的结果;而显著的人类创造性参与则表明人类拥有较高概率的所有权,反映出司法实践中对人类智力贡献的重视。研究结果还强调了合同所有权条款和训练数据合法性的重要性:明确的协议和获得授权的数据更有利于确立所有权。不同司法管辖区之间的差异进一步体现了该框架对多种法律情境的敏感性。

父级变量父级变量的状态所有权结果学习得到的条件概率
人类创造性参与人类作者0.82
人类创造性参与AI开发者0.41
AI自主性不承认所有权0.55
训练数据合法性已获得许可人类 / 开发者0.76
训练数据合法性侵权无所有权 / 存在争议0.68
合同所有权条款明确存在合同方0.89
合同所有权条款不存在存在争议 / 不确定0.61
司法管辖区框架以人类为中心的知识产权法人类作者0.79
司法管辖区框架模糊 / 新兴法律共同 / 不确定0.47

表5: 贝叶斯网络模型中的条件概率示例。 贝叶斯网络学习得到的代表性条件概率值,展示了影响所有权结果的关键变量之间的依赖关系。

算法1概括了所提出的贝叶斯网络框架在捕捉人工智能内容所有权不确定性方面的完整流程。算法1:通过定义图模型来初始化一个贝叶斯网络结构,其中节点表示在诉讼中所考察的技术与法律不确定性,并附有注释信息,目标节点为所有权归属。然后,可通过采用一种联合方法建立贝叶斯网络模型的结构,该方法将现有法律约束结构与从数据中推导出的优化结构相结合。随后,可通过基于所获取数据集实施贝叶斯参数估计方案来确定条件概率表,从而纳入司法推断出的不确定性、数据稀疏性以及条件关系。当将该算法应用于特定法律案例或假设性示例时,可通过在贝叶斯网络中应用概率推理来引入输入信息或证据,以确定所有权归属的后验概率。随后,该算法可通过迭代调整输入贝叶斯网络的证据值,并评估对所有权归属的影响,从而对输入值进行调整,调整因素包括人类参与程度、人工智能自主性、合同合法性以及训练数据的合法性。有关算法步骤,请参见补充文件1S3)。

概率推断与情景分析
然后可以使用关于所有权的AI相关诉讼标注数据集来训练贝叶斯网络的图结构和条件概率表,该系统能够推断所有权的可能性。数学描述见补充文件1S4)。

通过观察这些后验所有权概率在不同反事实情境下的变化情况,该模型为每一项法律和技术特征提供了一组对司法结果的相对影响。这种基于情境的推断能力构成了本研究的主要贡献之一,因为它与法院、政策制定者及法律专家对人工智能生成内容所有权问题的推理方式相一致:即通过情境化评估,而非机械地套用规则。该贝叶斯网络因此成为一种可解释的决策支持工具,将实证诉讼模式转化为概率性洞察,从而支持在不同司法管辖区、合同背景以及人工智能自主程度下进行一致的推理。相应地,这种可用性因子超越了描述性法律分析,为在不断演变的人工智能与知识产权制度下预测所有权结果提供了系统性机制。本研究采用变量消元法(Variable Elimination)计算所有权结果的后验概率以进行推断。通过迭代改变证据变量并重新计算后验分布,实现了情境分析。为确保在小规模数据集上的稳健性,模型通过留一法验证和五折交叉验证(k = 5)进行了验证。为开展敏感性分析,系统性地调整输入变量,并测量后验概率随之发生的变化(ΔP(Y))。

模型验证与敏感性分析
所提出的贝叶斯网络模型通过一组标注的AI相关知识产权纠纷数据集进行验证,以确保其可靠性、稳健性及法律适用性。采用回顾性验证方法预测所有权归属结果,并将其与实际法律裁决进行比较。鉴于AI相关的所有权争议案例较为稀缺,采用留一法(leave-one-out)和k折交叉验证法评估模型的稳健性。

通过敏感性分析,研究了法律和技术因素对所有权归属的影响,包括人类参与程度、人工智能自主性、训练数据的合法性以及合同中的所有权条款。该研究识别出若干情境性和高影响力的因素,这些因素通过改变父节点状态并监测后验概率的变化,影响所有权判定结果。通过揭示法律不确定性如何在模型网络中传播,增强了模型的可解释性。验证和敏感性分析的结果汇总于表6中。在交叉验证过程中,模型推断结果与实际司法判决之间的吻合度超过80%。鲁棒性测试表明,在证据有限的情况下模型仍能实现可信的推断,且各折后验方差较低,表明条件概率具有稳定性与可推广性。敏感性分析显示,尽管人工智能自主性和训练数据的合法性显著增加了归属判断的不确定性,但合同中的所有权条款和人类创造性参与对所有权归属的影响最为显著。技术与合同条件与司法管辖区变量相互作用,产生中等程度影响。总体而言,研究结果表明,所提出的范式在法律上具有可解释性,在实证上具有可靠性。

验证 / 敏感性方面应用方法指标 / 观察结果
基于案例的验证留一法交叉验证81.3% 的所有权结果一致性
跨折稳定性5折交叉验证各折后验方差 < 0.05
缺失证据鲁棒性部分证据推断后验概率变化 < 7%
敏感性:人类创造性参与单因素扰动ΔP(Y) ≈ +0.32
敏感性:AI 自主性单因素扰动ΔP(Y) ≈ −0.28
敏感性:训练数据合法性单因素扰动ΔP(Y) ≈ +0.25
敏感性:合同条款单因素扰动ΔP(Y) ≈ +0.37
敏感性:司法管辖权单因素扰动ΔP(Y) ≈ +0.14

表6:验证与敏感性分析结果。 模型验证与敏感性分析的结果,用于评估模型在所有权推断中的稳健性、稳定性以及关键变量的影响。

解释与政策含义分析
贝叶斯网络的概率输出通过建模人类贡献、人工智能自主性、合同明确性以及训练数据合法性等法律和技术因素,为分析人工智能生成内容的所有权提供了可解释的框架。该框架的概率估计结果不仅用于预测,更支持在法律不确定性条件下进行透明的、基于情景的推理。该框架可协助法律专业人士提高所有权评估中的一致性,帮助政策制定者识别与人工智能生成内容相关的监管空白,并辅助人工智能开发者评估设计选择和治理机制在不同法律环境下对所有权归属可能产生的影响。

访问受限。请登录或开始试用以查看此内容。

结果

实验结果表明,贝叶斯网络框架在捕捉人工智能生成内容所有权中不确定性的本质方面具有有效性。该模型为在不确定性条件下支持所有权推断提供了一种结构化、以数据为驱动的方法。最终数据集包含131个案例:一个基础的人工智能诉讼数据集、一个公开的法院判决数据库以及一个人工智能版权案件追踪库。这些案例是在应用了纳入、排除和去重程序后选定的。该框架已在一组涉及人工智能相关知识产权诉讼的司法标注案例上进行了训练,确保所有权推断算法所针对的所有权后验分布与实际诉讼中识别出的司法结果相对应。对该框架的司法验证表明,在大多数测试案例中,算法识别出的所有权类型与司法判决一致,证明所学习到的分段概率依赖关系恰当地符合司法推理趋势。此外,在多次验证迭代中所有权后验分布的司法稳定性表明,该框架能够泛化至测试数据,而不仅仅是简单记忆司法结果。该框架并非消除模糊性,而是对不确定性进行量化,并突出法律与技术因素的相对影响。表7展示了实施细节、模型配置和仿真环境。包括用于模型实现与实验的软件、硬件及参数在内的计算设置详情。

访问受限。请登录或开始试用以查看此内容。

讨论

本文提出的贝叶斯网络框架相较于当前关于人工智能生成内容所有权的研究具有进步意义,不同于其他研究采用的描述性方法或问题识别方法。其他研究(包括Raghupathi等人1的基础论文)本质上采用机器学习方法进行文本分析,试图发现人工智能法律诉讼背景下的主题或类别。尽管这些方法有助于清晰理解相关法律问题的出现情况,但它们在任何意义上均未提供在不确定性情境下如何确定所有权的解决方案,而本提案正是针对这一问题展开研究。

成功实施所建议的贝叶斯网络框架需要几个关键的程序步骤。首先,必须进行可靠的数据集整理与筛选,以确保仅将具有法律意义的人工智能相关知识产权纠纷纳入分析。其次,为在概率建模过程中减少歧义,需使用预先设定的编码标准对法律和技术变量进行一致标注。第三,贝叶斯网络的构建必须将数据驱动的依赖关系学习与领域特定的法律约束相结合,以保持统计有效性与法律可解释性。在证据不足的情况下实现稳定的概率推理,还需要对条件概率表(CPTs)进行准确估计。最后,为评估模型的稳健性、可解释性以及各个因素对所有权归属结果的影响,必须采用交叉验证、敏感性分析和消融分...

访问受限。请登录或开始试用以查看此内容。

致谢

作者感谢蒙纳士大学法学院提供的学术支持和研究环境,这些支持和环境促进了本研究的完成。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
司法意见 & 法庭记录数据集案例法获取项目(Caselaw Access Project, CAP)RRID:SCR_016043用于提取法律推理和所有权结果的法院判决来源
人工智能 & 版权案例追踪器CMS 法律N/A全球人工智能相关知识产权争议精选数据集
法律合同 & 协议数据集各类公共法律数据库N/A定义所有权、许可和合同权利的文件
法律法规与判例参考文献政府法律门户网站N/A用于分析的知识产权法律与司法先例
法律注释指南专家定义(手动框架)N/A法律不确定性变量的一致性标注规则
标注法律数据集在研究中生成N/A标注了法律和技术变量的用于建模的数据集
Python 编程环境(v3.10)Python 软件基金会RRID:SCR_008394用于实现的核心编程环境
pgmpy 库(v0.1.24)开源RRID:SCR_016274用于贝叶斯网络建模的文库
NumPy (v1.24)开源RRID:SCR_008633数值计算与数组操作
Pandas(v1.5)开源RRID:SCR_018214数据预处理与数据集管理
Jupyter NotebookProject JupyterRRID:SCR_018315模型开发的交互式环境
贝叶斯网络模型在研究中开发N/A用于所有权推断的概率图模型
爬山算法(BIC)通过 pgmpy 实现N/A贝叶斯网络的结构学习方法
变量消元推理引擎通过 pgmpy 实现N/A计算后验归属概率
情景分析模块在研究中开发N/A使能够 “假设情况” 模拟
敏感性分析模块在研究中开发N/A衡量变量对所有权结果的影响
交叉验证框架(k折交叉验证,留一交叉验证)与 Scikit-learn 兼容RRID:SCR_002577用于模型验证和稳健性测试
计算系统(Intel Core i7,16GB RAM)英特尔 / 原始设备制造商N/A用于模型训练与评估的硬件
操作系统(Windows 11)Microsoft WindowsRRID:SCR_018096实施所需的操作系统环境

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章