Artículo de investigación

Modelando la incertidumbre legal en la propiedad de contenido generado por IA: un enfoque bayesiano de redes para la asignación de derechos de propiedad intelectual

155 vistas

DOI:

10.3791/71101

12 de junio de 2026

En este artículo

Resumen

Este estudio presenta un flujo de trabajo basado en la Xarxa Bayesiana para analizar la propiedad de contenido generado por IA bajo incertidumbre legal y técnica. Utilizando litigios por IA, conjuntos de datos de derechos de autor y modelos marco, factores como la contribución humana, los contratos, la legalidad de los datos de entrenamiento y la autonomía de la IA para apoyar la toma de decisiones transparente, interpretable y basada en escenarios en disputas de propiedad intelectual.

Resumen

La rápida adopción de la inteligencia artificial generativa ha puesto de manifiesto las limitaciones en los marcos tradicionales de propiedad intelectual basados en la autoría humana, generando incertidumbre en la atribución de la propiedad. Este estudio propone un flujo de trabajo basado en la Red Bayesiana para analizar la propiedad de contenido generado por IA bajo incertidumbre legal y técnica. El flujo de trabajo integra la curación de conjuntos de datos, anotación de variables, modelado probabilístico de dependencias, generación de inferencias, validación cruzada y análisis de sensibilidad para evaluar las relaciones entre factores, incluyendo la contribución humana, la legalidad de los datos de entrenamiento, el contexto contractual y la autonomía de la IA. El marco se desarrolló utilizando casos anotados derivados de un conjunto de datos de litigios seleccionados con IA, bases de datos de opiniones judiciales disponibles públicamente y rastreadores de casos de derechos de autor con IA. Se realizó un análisis de sensibilidad para examinar la influencia de variables legales y técnicas en la atribución de la propiedad en diferentes escenarios. El marco propuesto soporta razonamientos probabilísticos e interpretables para disputas de propiedad intelectual relacionadas con la IA y proporciona un enfoque estructurado de apoyo a la decisión para profesionales jurídicos, responsables políticos y desarrolladores de IA. Los resultados demostraron estimaciones de probabilidad posterior estables entre pliegues, con una consistencia de predicción de propiedad superior al 80% entre conjuntos de datos. El marco permite un razonamiento probabilístico basado en escenarios y proporciona una herramienta interpretable de apoyo a la decisión, mejorando la transparencia y la coherencia en la resolución de disputas de propiedad para profesionales legales, responsables políticos y desarrolladores de IA.

Introducción

El creciente uso de sistemas de inteligencia artificial (IA) en industrias de alto riesgo, incluyendo la sanidad, la justicia penal, las finanzas y las plataformas digitales, plantea importantes cuestiones sobre la responsabilidad legal, la rendición de cuentas y la equidad. A pesar del rápido progreso, una gran parte de la literatura sobre gobernanza de la IA es normativa o predictiva y carece de apoyo empírico 1,2. Los métodos actuales para descubrir problemas relacionados con la IA, como las bases de datos de eventos, la investigación basada en encuestas y los marcos éticos, a menudo no logran captar problemas persistentes en el mundo real. Estos enfoques sobrevaloran los sucesos de alto perfil ignorando problemas sistémicos a nivel de práctica, o reflejan expectativas en lugar de dañosobservables 3,4. La mayoría de las bases de datos de incidentes se basan en la información voluntaria y la cobertura mediática, que con frecuencia pone de manifiesto fallos de alto perfil mientras subestima problemas comunes pero importantes relacionados conla IA 5,6. Al permitir que los sistemas produzcan texto, imágenes y música utilizando arquitecturas de aprendizaje profundo basadas en transformadores, la IA generativa, especialmente los Grandes Modelos de Lenguaje (LLMs), ha hecho que la producción de contenidos sea aún másdesafiante 7,8,9. Los marcos tradicionales de propiedad intelectual basados en la autoría humana están enfrentando dificultades como resultado de este cambio, lo que dificulta distinguir entre innovación generada por humanos y generaciónpor máquinas 10,11,12.

Estudios previos sobre contenido generado por IA y propiedad intelectual se han centrado principalmente en el análisis de políticas e interpretación legal, incluyendo discusiones conceptuales sobre autoría, originalidad ypropiedad 13. Aunque estos estudios ofrecen valiosas perspectivas, siguen siendo principalmente descriptivos y carecen de métodos computacionales para abordar la incertidumbre de la determinación de la propiedad14. Simultáneamente, se han desarrollado métodos tecnológicos para apoyar la atribución y procedencia de contenido, incluyendo marcas de agua, huellas dactilares y protección de conjuntosde datos 15. Sin embargo, la distribución legal de la propiedad no se aborda con estos enfoques, especialmente en entornos multiactor con desarrolladores, usuarios y productores de datos. Además, los estudios interdisciplinarios actuales no han avanzado lo suficiente hacia modelos probabilísticos que puedan integrar factores técnicos y legales para la evaluación de la propiedad frente a la incertidumbre 16,17,18,19,20. Los estudios legales han puesto de manifiesto las limitaciones de los marcos existentes de propiedad intelectual a la hora de abordar la propiedad del contenido generado por IA. En muchas jurisdicciones, incluida la Sección 13 de la Ley de Derechos de Autor de la India, las obras generadas por IA a menudo no cumplen con los criterios tradicionales de autoría, lo que genera ambigüedad de propiedad21,22. Aunque estudios previos discuten interpretaciones judiciales e implicaciones sobre derechos de autor, carecen de mecanismos formales para modelar la incertidumbre en la determinación de la propiedad22,23. Para abordar esta brecha, este estudio propone un marco basado en redes bayesianas que modela las relaciones probabilísticas entre la implicación humana, la procedencia de los datos de entrenamiento, el contexto contractual y la autonomía de la IA para análisis de propiedad basado en escenarios24.

La investigación ha explorado la aplicación de modelos de aprendizaje automático como la regresión logística, máquinas de vectores de soporte (SVMs), redes neuronales convolucionales (CNN) y redes de memoria a corto plazo largo (LSTM) en la toma de decisiones legales, demostrando su utilidad en entornos jurídicos de alto volumen donde el análisis manual de precedentes consume muchotiempo 25. Sin embargo, estos enfoques a menudo carecen de interpretabilidad y transparencia, que son esenciales para un apoyo judicial responsable. En consecuencia, los métodos de Inteligencia Artificial Explicable (XAI) han atraído la atención por mejorar la interpretabilidad y proporcionar razonamientos comprensibles para las decisiones asistidas por IA 26,27,28.

Metodología / EnfoqueDatos utilizadosProsDesventajas / Lagunas
Revisión de instrumentos legales y técnicos para vincular contenido con datos de formación y proponer marcos para la atribución y la rendición de cuentas. 29Revisión bibliográfica, ejemplos de casosIntegra la perspectiva tecnológica + jurídica; propone estrategias accionables de atribuciónCarece de modelado probabilístico formal; Sin validación cuantitativa
Taxonomía de métodos técnicos de protección de propiedad intelectual para entrenamiento/resultados de modelos generativos. 30Estudio de enfoques técnicos y riesgosRevisión sistemática; organiza las técnicas existentes para la protección de la propiedad intelectualSe centra en el entrenamiento: protección de datos frente a la propiedad de la salida generada
Propone huellas latentes / marca de agua para verificar el origen de la IA y la atribución de IP. 31Experimentos con modelos generativos (texto e imagen)Herramienta práctica de verificación; Fuerte para la evidencia de propiedadLa marca de agua no resuelve por sí sola los marcos de propiedad legal
Análisis legal comparativo de los estándares de autoría y propiedad entre jurisdicciones. 32Doctrina jurídica, textos legales, casos representativosExplica cómo la contribución humana afecta a las decisiones de propiedadDescriptivo; no propone modelos computacionales

Tabla 1: Resumen de metodologías, fuentes de datos y hallazgos clave en trabajos previos. Visión general de los estudios existentes sobre la propiedad de contenido generado por IA, destacando enfoques metodológicos, conjuntos de datos utilizados y principales hallazgos.

La Tabla 1 resume las metodologías existentes, las fuentes de datos y los hallazgosclave 29,30,31,32. Esta tabla analiza la propiedad del contenido generado por IA en la literatura y destaca los enfoques metodológicos, los conjuntos de datos utilizados y los hallazgos de la literatura considerada. Estudios recientes sobre la gobernanza de la IA y disputas de derechos de autor han puesto aún más de manifiesto los desafíos relacionados con la autoría, la legalidad de los datos de entrenamiento y la asignación de propiedad en contenido generado por IA33,34. Aunque enfoques como el seguimiento de procedencia y la validación de evidencias contribuyen al análisis de atribución34, los métodos existentes basados en reglas y aprendizaje automático siguen siendo limitados en el manejo de ambigüedades, pruebas contradictorias y razonamientos de propiedad legalmente interpretables. Enfoques técnicos como la marca de agua y el análisis de procedencia también se centran principalmente en la atribución en lugar de en la determinación de la propiedad.

Este artículo propone un marco basado en la Red Bayesiana para evaluar la propiedad de contenido generado por IA en medio de ambigüedad legal y técnica, superando las deficiencias de los enfoques deterministas actuales basados en reglas. El enfoque permite inferir en escenarios a partir de evidencia incompleta o ambigua al modelar interacciones probabilísticas entre aspectos clave, incluyendo la participación humana, la procedencia de los datos de entrenamiento, el contexto contractual y la autonomía de la IA. El método sugerido, a diferencia de los modelos predictivos tradicionales, ofrece estimaciones de probabilidad a posteriori interpretables que facilitan un razonamiento claro y organizado, coherente con los procedimientos de toma de decisiones judiciales.

Se definen explícitamente conceptos legales y tecnológicos importantes para garantizar la coherencia a lo largo del estudio. Mientras que "propiedad" se refiere a la distribución de derechos relacionados con la obra producida, "autoría" se refiere al reconocimiento legal de un creador. "Atribución" puede no indicar siempre propiedad legal, pero sí identifica a las entidades contribuyentes. "Explicabilidad" se refiere a la capacidad de un modelo para proporcionar una justificación comprensible de resultados probabilísticos, mientras que "incertidumbre jurídica" se refiere a ambigüedad derivada de estándares legales incompletos o cambiantes. Al incorporar factores legales y técnicos en un flujo de trabajo probabilístico interpretable, el enfoque sugerido pretende facilitar la toma de decisiones estructurada en conflictos de propiedad intelectual relacionados con la IA. Para expertos legales, legisladores y desarrolladores de IA que evalúan preocupaciones sobre la propiedad en sistemas de IA generativa, la técnica ofrece una perspectiva computacional.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este estudio no involucra participantes humanos ni sujetos animales. El análisis se basa únicamente en materiales de casos legales disponibles públicamente y en conjuntos de datos legales seleccionados. Por lo tanto, no se requería la aprobación ética ni el consentimiento informado.

La metodología propuesta pretende captar la incertidumbre legal que rodea la propiedad de contenido creado por IA mediante el desarrollo de una Red Bayesiana basada en datos reales de casos. Para empezar, los casos relacionados con la IA, incluyendo derechos de autor, patentes y secretos comerciales, se extraerían de un corpus existente y cada uno se etiquetaría con datos legales reales sobre resultados. Basándose en precedentes legales y estudios de caso existentes, los parámetros de incertidumbre que podrían afectar a la propiedad del contenido incluirían la intervención humana creativa, la autonomía del sistema de IA, la legalidad de los datos de entrenamiento, definiciones contractuales de propiedad, jurisdicción y transparencia, cada uno asignado como nodo dentro de la Red Bayesiana con estados discretos que indican diferentes realidades legales y técnicas, y con la determinación de la propiedad del contenido como nodo objetivo. La estructura de esta red se descubre integrando la experiencia jurídica con el descubrimiento estructural basado en datos para promover tanto la interpretabilidad como la plausibilidad jurídica. Las tablas de probabilidades condicionales se aproximan entonces en función de los resultados de litigios identificados en los casos, permitiendo a la red procesar datos inciertos e incompletos de forma probabilística. Tras el entrenamiento del modelo, permite tanto inferencias como pruebas de escenarios para determinar cómo los cambios en los factores contribuyentes afectan a la propiedad inferida en contenido generado por IA basándose en esta Red Bayesiana construida, seguidas de pruebas y validación de análisis de sensibilidad antes de inferir resultados que faciliten futuras implicaciones legales para la propiedad intelectual en aplicaciones de IA por parte de desarrolladores y tribunales. La Figura 1 muestra el flujo de trabajo arquitectónico de la obra propuesta.

Figura 1
Figura 1: Diagrama arquitectónico del marco propuesto: Visión general del sistema propuesto basado en redes bayesianas para determinar la propiedad de contenido generado por IA. La arquitectura ilustra el flujo desde la adquisición y anotación de datos hasta el modelado probabilístico, inferencia y atribución de propiedad. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La Figura 1 ilustra el flujo de trabajo arquitectónico del marco propuesto basado en redes bayesianas para el análisis de propiedad de contenido generado por IA. El flujo de trabajo incluye recogida de datos, anotación de características, modelado de redes bayesianas, inferencia probabilística, análisis de escenarios y validación. Las variables legales y técnicas, como la implicación humana, la autonomía de la IA, la procedencia de los datos de entrenamiento, el contexto contractual y la jurisdicción, se modelan dentro de un marco bayesiano para estimar la atribución de la propiedad bajo condiciones inciertas. El marco soporta el razonamiento probabilístico interpretable y la evaluación basada en escenarios para el apoyo a la decisión legal.

Recogida de datos
Se recopilaron datos sobre casos legales de diversas fuentes para crear un conjunto de datos centrado en la propiedad y demandas de propiedad intelectual relacionadas con contenido generado por IA. Para empezar, el conjunto general de casos legales recogidos en el documento base fue filtrado para incluir únicamente litigios relacionados con derechos de autor, propiedad, disputas relacionadas con la propiedad intelectual y otros asuntos relacionados con la propiedad intelectual en los datos de entrenamiento. Se obtuvieron casos legales adicionales a partir de bases de datos públicas de opiniones judiciales que proporcionan acceso a opiniones judiciales de millones de casos, así como a un repositorio de seguimiento de casos de derechos de autor que rastrea tanto procedimientos legales en curso como concluidos en todo el mundo sobre el uso de la Inteligencia Artificial en materia de Propiedad Intelectual. También se anotaron casos legales para destacar variables clave, incluyendo el resultado del caso legal, el nivel de aportación creativa humana, la autonomía del sistema de Inteligencia Artificial, el origen de los datos de entrenamiento, la jurisdicción y los parámetros del contrato, si procedía. Se trata de un conjunto de datos multifuente que agrega datos suficientes sobre Propiedad Intelectual relacionados con el uso de herramientas de IA, adecuados para el razonamiento probabilístico en el análisis bayesiano de redes.

Se utilizaron tres fuentes principales, incluyendo el conjunto de datos base de litigios con IA, una base de datos pública de opiniones judiciales y un repositorio de seguimiento de casos de derechos de autor con IA, en un proceso metódico de recopilación y selección para crear el conjunto de datos de este estudio. Palabras clave como "inteligencia artificial", "contenido generado por IA", "derechos de autor", "propiedad intelectual", "autoría", "propiedad" y "obras generadas por máquina" se utilizaron en las interfaces de búsqueda de repositorios y en los campos de metadatos para encontrar casos pertinentes. Se consideraron casos que involucraran contenido generado o asistido por IA que abordaran cuestiones de propiedad, autoría o propiedad intelectual con suficiente profundidad para la extracción variable. No se aceptaban casos que eran duplicados, no estaban relacionados con contenido generado por IA, se centraban en otras áreas legales o carecían de información adecuada. Se utilizó un procedimiento de cribado en dos fases, con una evaluación completa de elegibilidad tras el título inicial y el examen resumen. Para garantizar la unicidad, se identificaron registros duplicados en múltiples conjuntos de datos utilizando metadatos de casos y se eliminaron.

Las palabras clave "inteligencia artificial", "contenido generado por IA", "obras generadas por máquinas", "derechos de autor", "autoría", "propiedad", "datos de entrenamiento" y "disputa de propiedad intelectual" se utilizaron en el proceso de búsqueda de conjuntos de datos. Para garantizar la calidad y relevancia del conjunto de datos, se utilizó un procedimiento de cribado en dos etapas. Para encontrar conflictos de propiedad y derechos de autor relacionados con la IA, se revisaron los títulos y resúmenes de casos en la primera fase. Para determinar la elegibilidad para la inclusión en el estudio, se realizó una revisión completa del caso en la segunda fase. Solo se incluyeron los casos que involucraran contenido generado o asistido por IA, con detalles legales y técnicos adecuados sobre autoría, atribución de propiedad, contexto contractual o uso de datos de entrenamiento. Se excluyeron los casos con información contextual insuficiente, documentos legales insuficientes, entradas duplicadas y casos no relacionados con conflictos de propiedad intelectual. Al comparar metadatos como el título del caso, la jurisdicción, la fecha de presentación y la categoría de disputa, se identificaron y eliminaron casos duplicados entre fuentes. Posteriormente se realizaron anotaciones, modelado bayesiano de Redes (Bayesian), inferencia probabilística y análisis de sensibilidad sobre el conjunto de datos final seleccionado.

Los datos empleados en el estudio comprenden una recopilación de fuentes legales que cubren todo el alcance de las disputas sobre derechos de propiedad de contenido de IA y reclamaciones de propiedad intelectual, como se muestra en la Tabla 2. En primer lugar, los datos de litigios por IA utilizados en el estudio principal incluyen la preservación selectiva de unas 72 disputas legales específicamente relacionadas con reclamaciones de derechos de autor, autoría, autoría por invención y propiedad relacionada con los resultados de la IA. Para aumentar la variabilidad de los datos y así representar mejor las disputas emergentes en el ámbito de la IA generativa, los datos incluyen la adquisición de disputas relevantes procedentes de la base de datos de opiniones judiciales (CAP) de acceso público, una enorme colección pública de opiniones judiciales estadounidenses, para seleccionar disputas específicas IA-IP de 38 reclamaciones basadas en términos legales relevantes de PI. Además, el estudio utiliza el AI and Copyright Case Tracker para incluir 21 disputas de derechos de autor de IA líderes mundiales, basándose en un enfoque de análisis legal de derechos de autor entrenado por IA que perfecciona la creación de un rastreador personalizado de casos de derechos de autor con IA para grandes disputas legales internacionales, utilizando enfoques de análisis inicial específicos que involucran el análisis de disputas de derechos de autor con IA. El conjunto final constaba de 131 casos: un conjunto base de datos de litigios con IA, una base de datos pública de opiniones judiciales y un repositorio de seguimiento de casos de derechos de autor con IA. Estos casos se seleccionaron tras aplicar procedimientos de inclusión, exclusión y deduplicación.

Fuente del conjunto de datosTipo de conjunto de datosNo. De casos utilizadosCobertura
Conjunto de Datos Base de Litigios de IA1Casos judiciales relacionados con IA72 (subconjunto filtrado)Tribunales federales y estatales de EE. UU.
Proyecto de Acceso a la Jurisprudencia (CAP)31Corpus de casos públicos38 (enfocado en IA-IP)Sentencias de los tribunales estadounidenses
IA y Rastreador de Casos de Derechos de Autor (CMS)32Resúmenes de casos seleccionados21 casos históricosGlobal (EE. UU., UE, REINO UNIDO)

Tabla 2: Descripción del conjunto de datos. Resumen de conjuntos de datos utilizados para modelar disputas de propiedad intelectual en contenido generado por IA, incluyendo fuente, estructura y relevancia para el análisis de propiedad.

Para garantizar la precisión y la consistencia, se utilizó una combinación de procesos manuales y semiautomatizados. El método de etiquetado utilizó tres anotadores con formación tanto en derecho como en estudios jurídicos relacionados con IA. Todas las variables, incluyendo la aportación creativa humana, la autonomía del sistema de IA, la legalidad de los datos de entrenamiento, las disposiciones de propiedad contractual, la jurisdicción, la transparencia de la implicación de la IA y las reglas y ejemplos explícitos de la decisión, se definieron en un libro de códigos anotado. Dos anotadores anotaban cada instancia de forma independiente; Las diferencias se resolvían mediante discusión y, si era necesario, por un tercer revisor experto. El coeficiente kappa de Cohen se utilizó para medir la concordancia entre evaluadores; El resultado fue 0,81, indicando un fuerte acuerdo. Alrededor del 9% de los casos implicaban desacuerdos, principalmente sobre autonomía de la IA e interpretación de contratos. Para un modelado adicional de redes bayesianas, se utilizaron las anotaciones completadas.

Identificación de factores de incertidumbre jurídica
Las principales fuentes de incertidumbre en la propiedad de contenido generado por IA se identificaron mediante un análisis de casos de propiedad intelectual relacionados con la IA en múltiples conjuntos de datos legales, incluyendo conjuntos de datos basados en litigios y repositorios judiciales públicos disponibles. La creatividad humana, la autonomía de la IA, la legalidad de los datos de entrenamiento, las conexiones contractuales, cuestiones jurisdiccionales y la transparencia de los sistemas de IA fueron factores importantes. El grado de implicación humana y las definiciones de propiedad contractual fueron a menudo destacadas por los tribunales, y la ambigüedad legal se agravó por las diferencias en las leyes de derechos de autor y el uso de datos de entrenamiento protegidos. El marco de la Red Bayesiana para el análisis probabilístico de la propiedad se desarrolló a partir de estas consideraciones.

FactorDescripción
Participación creativa humanaGrado de contribución humana en la generación del contenido (alto, moderado o mínimo).
Nivel de autonomía de la IAHasta qué punto el sistema de IA opera de forma independiente sin guía humana.
Formación en la propiedad de datos y legalidadEstado legal de los datos de entrenamiento utilizados (licenciados, de dominio público, propietarios o infractores).
Cláusulas de Propiedad ContractualExistencia y claridad de acuerdos que definen la propiedad entre las partes interesadas.
Marco Legal JurisdiccionalLeyes nacionales o regionales de propiedad intelectual aplicables.
Propósito de usoSi el contenido generado por IA se utiliza con fines comerciales o no comerciales.
Transparencia y explicabilidadDisponibilidad de información sobre el diseño y funcionamiento del sistema de IA.
Divulgación de la asistencia de IASi se reveló explícitamente el uso de IA en la creación de contenido.
Naturaleza del contenido generadoTipo de salida producida (por ejemplo, texto, imagen, código o diseño).
Disponibilidad de precedentes judicialesPresencia de sentencias judiciales previas relevantes para la propiedad de contenido generado por IA.

Tabla 3: Factores clave de incertidumbre legal y técnica que influyen en la propiedad. Identificación de variables críticas que afectan a la atribución de propiedad en contenido generado por IA, abarcando tanto dimensiones legales como técnicas.

La Tabla 3 resume las incertidumbres relacionadas con la atribución de propiedad en el modelo propuesto de Red Bayesiana. Estas incertidumbres se derivan de las disputas de propiedad intelectual asociadas a la IA y de las leyes vigentes de propiedad intelectual. La aportación creativa humana y la autonomía en IA se refieren a la relación entre autores humanos y contenido generado por IA en la determinación de la propiedad. Las incertidumbres, incluyendo la legalidad de los datos de entrenamiento utilizados por la IA, la titularidad del contrato y las leyes de propiedad intelectual vigentes en la jurisdicción, son motivo de disputa. El propósito de uso y la divulgación de asistencia de IA se refiere a las circunstancias en las que el sistema judicial considera la generación asistida por IA. La transparencia y la explicabilidad, en cambio, se refieren al aspecto asociado con la rendición de cuentas y la responsabilidad. Otras incertidumbres, incluyendo la naturaleza de las creaciones generadas por IA y los precedentes judiciales existentes, determinan cómo se aplican las leyes de propiedad intelectual existentes a las creaciones de IA.

Anotación de datos y codificación de variables
El conjunto de datos, construido a partir de casos de litigios filtrados por IA, CAP y casos seleccionados de derechos de autor por IA, entre otros, deberá ser anotado manualmente y semi-automáticamente en función de los factores de incertidumbre legal identificados para cada caso. Para cada caso, las etiquetas estructuradas se determinan evaluando las opiniones judiciales, descripciones y razonamientos. La tarea de anotación implica determinar tanto factores legales como técnicos, como el nivel de participación creativa humana, la autonomía de la IA, la validez legal de los datos de entrenamiento, cláusulas contractuales sobre la propiedad, jurisdicción y la divulgación de la asistencia por parte de la IA. Para mayor coherencia, las directrices se derivan de otros principios de propiedad intelectual y se verifican mediante verificaciones cruzadas entre diversas fuentes legales. Consulte el Archivo Suplementario 1(S1) para una descripción matemática detallada de la anotación de datos y la codificación de variables.

El marco se implementó utilizando un lenguaje de programación con bibliotecas de modelado gráfico probabilístico y herramientas de computación numérica. El preprocesamiento y análisis de datos se realizaban en un entorno informático basado en portátiles en un sistema de sobremesa con un procesador multinúcleo y configuración estándar de memoria

Para garantizar la consistencia y reproducibilidad en la anotación de conjuntos de datos, se desarrolló un esquema estructurado de codificación de variables para todos los factores legales y técnicos incluidos en el marco de la Red Bayesiana. Cada caso fue revisado y anotado manualmente utilizando estados categóricos predefinidos derivados de precedentes legales y literatura sobre gobernanza de IA. La Tabla 4 resume las variables, descripciones y categorías de codificación utilizadas en el estudio. Para facilitar el modelado probabilístico y la inferencia basada en escenarios dentro del marco de la Red Bayesiana, el sistema de codificación se aplicó de forma uniforme en todos los casos anotados. Para representar circunstancias legales y tecnológicas frecuentemente observadas en conflictos que involucran material generado por IA, se eligieron estados variables.

VariableDescripciónCategorías de codificación
Contribución humanaGrado de implicación creativa humana en la generación de contenidoBajo, Medio, Alto
Autonomía de la IANivel de generación independiente de sistemas de IABajo, Medio, Alto
Legalidad de los datos de entrenamientoEstado legal de los conjuntos de datos utilizados para el entrenamiento de IALicenciado, dominio público, incierto, no autorizado
Propiedad contractualPresencia de cláusulas contractuales de propiedadPresente, ausente
Claridad de atribuciónClaridad en la identificación de los contribuyentesClaro, parcial, inclaro
JurisdicciónJurisdicción legal asociada a la disputaIndia, Estados Unidos, China, Otros
TransparenciaDisponibilidad de información sobre el proceso de generación de IAAlto, Moderado, Bajo
Resultado de la propiedadResultado final de atribución de propiedad (variable objetivo)Propiedad humana, propiedad compartida, propiedad de la organización, incierto

Tabla 4: Esquema de codificación variable utilizado para la anotación bayesiana de redes. La tabla resume las variables legales y técnicas utilizadas durante la anotación de conjuntos de datos, incluyendo sus definiciones y estados categóricos de codificación aplicados para el modelado probabilístico y la inferencia de propiedad.

Diseño de la estructura de redes bayesiana
La Red Bayesiana (BN) fue creada para modelar las relaciones probabilísticas entre factores contextuales, tecnológicos y legales que afectan a la propiedad de la información producida por la inteligencia artificial. Mientras que el nodo objetivo representaba los resultados de la propiedad, los nodos de la red representaban variables como la contribución humana, la autonomía de la IA, la legalidad de los datos de entrenamiento, los términos contractuales de propiedad y la jurisdicción. Las dependencias condicionales derivadas de asociaciones basadas en datos y procesos de razonamiento judicial se registraron mediante aristas dirigidas. La optimización basada en datos y las restricciones legales se combinaron en un método híbrido de aprendizaje estructural. Las dependencias permitidas se determinaron por principios judiciales, y el gráfico de dependencias más probable que explica los resultados reportados de litigios se encontró mediante aprendizaje de estructuras basado en puntuaciones. Este método aseguraba que la red final siguiera siendo tanto interpretable legalmente como estadísticamente válida.

Figura 2
Figura 2: Estructura de la red bayesiana utilizada para la inferencia de propiedad. Representación gráfica de la Red Bayesiana que muestra dependencias entre variables legales y técnicas que influyen en las decisiones de propiedad. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La Figura 2 muestra cómo se emplea una Red Bayesiana en asignaciones de propiedad de contenido generado por IA. En un modelo de nivel superior, algunas variables de entrada esenciales, a saber, Entrada Humana, Datos de Entrenamiento, Autonomía de IA y Jurisdicción, indican algunas dimensiones legales y técnicas esenciales que deben considerarse al otorgar un derecho sobre contenido generado por IA. Cada variable se designa como un nodo probable en lugar de una regla codificada de forma fija, lo que permite un modelo que tenga en cuenta las dependencias de variables. Los nodos verdes, también conocidos como puntos de conexión, aparecen entre los nodos de entrada y la salida final. Indican, por ejemplo, cómo los niveles de implicación humana se correlacionan con la autonomía de la IA, mientras que tanto los datos legales de entrenamiento como los factores jurisdiccionales ayudan a definir un derecho al contenido generado por IA desde una perspectiva jurisdiccional.

La teoría legal y los datos anotados de litigios sirvieron como base para la selección de variables y definiciones de estados discretos de la Red Bayesiana. Dada su importancia para determinar la propiedad, factores clave como la implicación humana, la autonomía de la IA, la legalidad de los datos de entrenamiento, las condiciones contractuales, la jurisdicción y la transparencia recibieron máxima prioridad. Se utilizaron criterios de anotación revisados por expertos para discretizar variables en categorías legalmente significativas. Para identificar dependencias respaldadas estadísticamente, se utilizó una estrategia híbrida que combinaba aprendizaje basado en puntuaciones y restricciones legales para construir la estructura de red. El enfoque fue validado posteriormente mediante estudios de sensibilidad y ablación, que confirmaron el impacto significativo de la intervención humana y las restricciones contractuales en la inferencia de propiedad, mientras que otras variables mostraron efectos moderadores. Para los sistemas de apoyo a la decisión, este enfoque combinado jurídico-empírico mejora tanto la robustez como la interpretabilidad.

Las probabilidades inferidas de todos los nodos interconectados convergen en el nodo de Decisión de Propiedad, que genera probabilidades de propiedad posterior basadas en la evidencia legal y técnica disponible. Esto permite la inferencia de propiedad incluso bajo condiciones incompletas o disputadas y favorece la actualización dinámica cuando hay nueva evidencia disponible. Para reducir el sobreajuste y correlaciones espurias, se utilizaron la selección de modelos y el análisis de sensibilidad para eliminar bordes redundantes o de bajo impacto, dando lugar a un grafo acíclico dirigido conciso (DAG). La estructura final de la Red Bayesiana captura tanto dependencias probabilísticas como relaciones causales entre los factores que contribuyen a la incertidumbre legal en la propiedad de contenido generado por IA. La descripción matemática del diseño de la red bayesiano se proporciona en el Archivo Suplementario 1 (S2).

La Red bayesiana permite la inferencia probabilística de propiedad incluso cuando algunos factores legales o técnicos son incompletos o parcialmente observables. Al modificar variables de evidencia, el marco también apoya análisis basados en escenarios para la toma de decisiones legales, la evaluación de políticas y aplicaciones de gobernanza de IA. La estructura de la red se desarrolló utilizando un enfoque híbrido que combina restricciones legales definidas por expertos con aprendizaje basado en datos. Se utilizó un algoritmo de Hill Climbing con puntuación Bayesiano del Criterio de Información (BIC) para la optimización estructural, mientras que la estimación de parámetros bayesiano con priors de Dirichlet y suavizado de Laplace (&α = 1) abordó la escasez de datos y las observaciones faltantes. Todas las variables se representaron como estados categóricos discretos para apoyar la inferencia probabilística. Se utilizaron módulos de modelado gráfico probabilístico en Python para construir el marco de redes bayesianas. Las dos fases de la construcción de redes fueron el aprendizaje de parámetros y la definición de estructuras. Inicialmente, los nodos de la red representaban las características legales y técnicas encontradas durante la anotación del conjunto de datos. Se utilizó un método híbrido que combinaba análisis estructural de dependencias basados en datos con relaciones legales definidas por expertos para crear aristas dirigidas entre nodos. Se utilizó la estimación de máxima verosimilitud para estimar las Tablas de Probabilidad Condicional (CPT) a partir del conjunto de datos anotado. Las técnicas de modelado gráfico probabilístico dentro de un paquete de entorno computacional se utilizaron para implementar la Red Bayesiana, con la función de estimación de máxima verosimilitud para el aprendizaje de parámetros y la función de Red Bayesiana () para definir la estructura de la red. El procedimiento de inferencia de Eliminación de Variables () se utilizó para calcular probabilidades de propiedad a posteriori bajo diversas condiciones de evidencia.

Aprendizaje de parámetros
En la modelización cuantitativa de la incertidumbre legal en la propiedad de contenido generado por IA, la estimación de parámetros es un paso crucial en el marco propuesto de la Redes Bayesianas. La estimación de parámetros bayesianas se utilizó para aprender Tablas de Probabilidad Condicional (CPT) a partir de casos legales anotados. Aunque el nodo objetivo indica la atribución de propiedad, cada nodo refleja un aspecto legal o tecnológico, como la contribución humana, la autonomía de la IA, la legalidad de los datos de entrenamiento o las disposiciones contractuales de propiedad. Debido a que las estimaciones bayesianas pueden manejar escaso material jurídico y pruebas insuficientes, se eligió para promover un razonamiento jurídico interpretable y para representar correlaciones probabilísticas observadas en decisiones judiciales. Los valores representativos de probabilidad condicional adquiridos dentro de la Red Bayesiana se muestran en la Tabla 5. Aunque una gran autonomía de la IA fomenta la incertidumbre o resultados de no pertenencia, una participación creativa humana significativa indica una probabilidad considerable de propiedad humana, lo que indica énfasis judicial en la contribución intelectual humana. Los hallazgos también subrayan la importancia de los términos contractuales de propiedad y la legalidad de los datos de entrenamiento, con acuerdos explícitos y datos licenciados que aumentan la propiedad. La sensibilidad del marco ante diversas situaciones legales se demuestra además por las variaciones jurisdiccionales.

Variables parentalesEstados de las variables parentalesResultado de la propiedadProbabilidad condicional aprendida
Participación creativa humanaAltoAutor humano0.82
Participación creativa humanaBajoDesarrollador de IA0.41
Autonomía de la IAAltoNo se reconoce la propiedad0.55
Legalidad de los datos de entrenamientoLicenciaHumano / Desarrollador0.76
Legalidad de los datos de entrenamientoInfracciónSin propiedad / Disputado0.68
Cláusula de Propiedad ContractualPresente explícitoParte contractual0.89
Cláusula de Propiedad ContractualAusenteDisputado / Incierto0.61
Marco JurisdiccionalLey de PI centrada en el ser humanoAutor humano0.79
Marco JurisdiccionalDerecho ambiguo / emergenteArticulación / Incierto0.47

Tabla 5: Ejemplo de probabilidades condicionales en el modelo bayesiano de red. Valores ilustrativos de probabilidad condicional aprendidos por la Red Bayesiana, que demuestran dependencias entre variables clave que influyen en los resultados de propiedad.

El algoritmo 1 encapsula todo el proceso del marco propuesto de la Red Bayesiana para capturar las incertidumbres de propiedad en contenido de IA. Algoritmo 1: Iniciar una estructura de red bayesiana definiendo el modelo gráfico donde los nodos representan las incertidumbres técnicas y legales examinadas en los litigios con información anotada, y el nodo objetivo es la designación de propiedad. La estructura del modelo de Red Bayesiana puede establecerse aplicando un enfoque conjunto que fusiona las estructuras legalmente restrictivas existentes con estructuras optimizadas derivadas de los datos. Las tablas de probabilidad condicional pueden especificarse implementando el esquema bayesiano de estimación de parámetros basado en el conjunto de datos obtenido, teniendo en cuenta así las incertidumbres, la escasez y las relaciones condicionales inferidas por el poder judicial. Al aplicar el algoritmo a un ejemplo legal o hipotético particular, la información o evidencia de entrada puede ser obtenida en la Red Bayesiana aplicando inferencia probabilística para determinar la probabilidad posterior de propiedad. El algoritmo puede entonces aplicar ajustes a los valores de entrada modificando iterativamente la evidencia aportada a la Red Bayesiana y evaluando el impacto en la designación de la propiedad ajustando la entrada humana, la autonomía de la IA, la legalidad contractual y la legalidad de los datos de entrenamiento. Consulte el Archivo Suplementario 1(S3) para los pasos algorítmicos.

Inferencia probabilística y análisis de escenarios
La estructura gráfica y las tablas de probabilidad condicional de la Red Bayesiana pueden entrenar entonces sobre un conjunto de datos anotado de litigios relacionados con IA relacionados con la propiedad, y el sistema permite inferir sobre la probabilidad de propiedad. Las descripciones matemáticas se indican en el Archivo Suplementario 1 (S4).

Al observar cómo varían estas probabilidades de propiedad posterior entre escenarios contrafactuales, el modelo arroja un conjunto de influencias relativas en los resultados judiciales para cada característica legal y técnica. Esta capacidad de inferencia basada en escenarios constituye una de las principales contribuciones del trabajo propuesto, ya que se alinea con la forma en que los tribunales, responsables políticos y expertos legales razonan sobre la propiedad del contenido generado por IA: mediante la evaluación contextual en lugar de la aplicación rígida de reglas. La Red Bayesiana sirve por la presente como una herramienta explicable de apoyo a la decisión, transformando patrones empíricos de litigio en conocimientos probabilísticos que respaldan un razonamiento coherente entre jurisdicciones, contextos contractuales y niveles de autonomía de la IA. En consecuencia, dicho factorial de usabilidad va más allá del análisis jurídico descriptivo al proporcionar un mecanismo sistemático para anticipar los resultados de propiedad bajo la evolución de los regímenes de IA y propiedad intelectual. Se utilizó el enfoque de eliminación variable para calcular la probabilidad posterior de los resultados de propiedad para inferencia. Cambiar iterativamente las variables de evidencia y recalcular las distribuciones a posteriori permitió el análisis de escenarios. Para garantizar la resiliencia en conjuntos de datos pequeños, el modelo se validó mediante validación leave-one-out y k-fold cross-validation (k = 5). Para realizar un análisis de sensibilidad, las variables de entrada se variaron sistemáticamente y se midieron los cambios asociados en las probabilidades posteriores (ΔP(Y)).

Validación de modelos y análisis de sensibilidad
El modelo sugerido de Red Bayesiana fue verificado utilizando un conjunto de datos anotado de conflictos de propiedad intelectual relacionados con IA para garantizar fiabilidad, robustez y aplicabilidad legal. Para prever los resultados de la propiedad y compararlos con decisiones legales reales, se utilizó un enfoque de validación retrospectiva. Dada la escasez de situaciones de disputa de propiedad relacionadas con la IA, se utilizaron la validación cruzada de dejar uno fuera y la validación cruzada k-fold para evaluar la robustez del modelo.

El impacto de factores legales y técnicos en la atribución de la propiedad, incluyendo la participación humana, la autonomía de la IA, la legalidad de los datos de entrenamiento y los términos contractuales de propiedad, fue investigado mediante un análisis de sensibilidad. La investigación identificó factores contextuales y de alto impacto que influyen en las decisiones de propiedad al alterar los estados de los ganglios progenitores y monitorizar los cambios en las probabilidades posteriores. Al mostrar cómo la ambigüedad legal se extiende por toda la red, esto mejoró la interpretabilidad. Los resultados de validación y análisis de sensibilidad se recopilan en la Tabla 6. Durante la validación cruzada, el modelo logró más del 80% de concordancia entre los resultados judiciales inferidos y los reales. Las pruebas de robustez verificaron inferencias fiables bajo contextos de evidencia limitada, y una baja varianza posterior entre pliegues sugería probabilidades condicionales estables y generalizables. El análisis de sensibilidad reveló que, aunque la autonomía de la IA y la legalidad de los datos de entrenamiento aumentaron considerablemente la incertidumbre de atribución, las cláusulas contractuales de propiedad y la participación creativa humana tuvieron el mayor impacto en la atribución de la propiedad. Las condiciones técnicas y contractuales interactuaban con variables jurisdiccionales, ejerciendo un efecto moderado. En general, los hallazgos muestran que el paradigma sugerido es tanto interpretable legalmente como empíricamente sólido.

Validación / Aspecto de sensibilidadMétodo aplicadoMétrica / Observación
Validación basada en casosValidación cruzada de dejar uno fueraConsistencia del resultado de propiedad del 81,3%
Estabilidad de pliegue cruzadoValidación cruzada de 5 partesLa varianza posterior < 0,05 a través de pliegues
Robustez de la evidencia faltanteInferencia de evidencia parcial< cambio del 7% en las probabilidades posteriores
Sensibilidad: Participación creativa humanaPerturbación de un solo factorΔP(Y) ≈ +0,32
Sensibilidad: Autonomía de la IAPerturbación de un solo factorΔP(Y) ≈ −0,28
Sensibilidad: Legalidad de los datos de entrenamientoPerturbación de un solo factorΔP(Y) ≈ +0,25
Sensibilidad: Cláusulas contractualesPerturbación de un solo factorΔP(Y) ≈ +0,37
Sensibilidad: JurisdicciónPerturbación de un solo factorΔP(Y) ≈ +0,14

Tabla 6: Resultados de validación y análisis de sensibilidad. Resultados de la validación del modelo y análisis de sensibilidad, evaluación de la robustez, estabilidad y el impacto de variables clave en la inferencia de propiedad.

Interpretación y análisis de implicaciones políticas
Los resultados probabilísticos de la Red Bayesiana proporcionan un marco interpretable para analizar la propiedad de contenido generado por IA mediante el modelado de factores legales y técnicos, incluyendo la contribución humana, la autonomía de la IA, la claridad contractual y la legalidad de los datos de entrenamiento. En lugar de servir únicamente como resultados predictivos, las estimaciones de probabilidad posterior apoyan un razonamiento transparente basado en escenarios bajo condiciones legales inciertas. El marco puede ayudar a los profesionales del derecho a mejorar la coherencia durante la evaluación de la propiedad, apoyar a los responsables políticos en la identificación de brechas regulatorias relacionadas con el contenido generado por IA y ayudar a los desarrolladores de IA a evaluar cómo las decisiones de diseño y gobernanza pueden influir en la atribución de la propiedad en diferentes contextos legales.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Los resultados del experimento demuestran la eficacia del marco Bayesian Network para captar la naturaleza de la incertidumbre en la propiedad de contenido producido por IA. El modelo ofrece un enfoque estructurado y basado en datos para apoyar la inferencia de propiedad bajo incertidumbre. El conjunto final constaba de 131 casos: un conjunto base de datos de litigios con IA, una base de datos pública de opiniones judiciales y un repositorio de seguimiento de casos de derechos de autor con IA. Estos casos se seleccionaro...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

El marco propuesto de la Red Bayesiana supone un avance respecto a la investigación actual sobre la propiedad del contenido generado por IA, en contraposición a los enfoques descriptivos o de identificación de preguntas de otros trabajos. Los otros trabajos, incluido el artículo base de Raghupathi et al. en1, utilizan esencialmente enfoques de aprendizaje automático en análisis de texto para intentar descubrir temas o categorías en el contexto de litigios de IA. A...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no tienen conflictos de interés.

Agradecimientos

El autor reconoce el apoyo académico y el entorno de investigación proporcionados por la Facultad de Derecho de la Universidad Monash, que contribuyeron a la finalización de este estudio.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Judicial Opinions & Court Records DatasetCaselaw Access Project (CAP)RRID:SCR_016043Fuente de decisiones judiciales utilizadas para extraer razonamiento legal y resultados de propiedad
AI & Copyright Case TrackerCMS LegalN/AConjunto de datos seleccionado de disputas globales relacionadas con la propiedad intelectual de IA
Legal Contracts & Agreements DatasetVarious Public Legal RepositoriesN/ADocumentos que definen la propiedad, la concesión de licencias y los derechos contractuales
Statutory and Case Law ReferencesGovernment Legal PortalsN/ALeyes de propiedad intelectual y precedentes judiciales utilizados para el análisis
Legal Annotation GuidelinesExpert-defined (Manual Framework)N/AReglas para la anotación consistente de variables de incertidumbre legal
Annotated Legal DatasetGenerated in StudyN/AConjunto de datos etiquetado con variables legales y técnicas para modelado
Python Programming Environment (v3.10)Python Software FoundationRRID:SCR_008394Entorno de programación principal utilizado para la implementación
pgmpy Library (v0.1.24)Open-sourceRRID:SCR_016274Biblioteca utilizada para el modelado de Redes Bayesianas
NumPy (v1.24)Open-sourceRRID:SCR_008633Cálculos numéricos y operaciones de matrices
Pandas (v1.5)Open-sourceRRID:SCR_018214Preprocesamiento de datos y manejo de conjuntos de datos
Jupyter NotebookProject JupyterRRID:SCR_018315Entorno interactivo para el desarrollo de modelos
Bayesian Network ModelDeveloped in StudyN/AModelo gráfico probabilístico para la inferencia de propiedad
Hill Climbing Algorithm (BIC)Implemented via pgmpyN/AMétodo de aprendizaje de estructura para Red Bayesiana
Variable Elimination Inference EngineImplemented via pgmpyN/ACalcula probabilidades de propiedad posteriores
Scenario Analysis ModuleDeveloped in StudyN/APermite simulaciones de "¿y si?"
Sensitivity Analysis ModuleDeveloped in StudyN/AMide la influencia de las variables en los resultados de propiedad
Cross-Validation Framework (k-fold, LOOCV)Scikit-learn compatibleRRID:SCR_002577Utilizado para la validación del modelo y pruebas de robustez
Computing System (Intel Core i7, 16GB RAM)Intel / OEMN/AHardware utilizado para el entrenamiento y la evaluación del modelo
Operating System (Windows 11)Microsoft WindowsRRID:SCR_018096Entorno del sistema operativo para la implementación

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Propiedad del contenido de IAatribuci n de la propiedadrazonamiento probabil sticocuraci n de conjuntos de datosan lisis de sensibilidadlitigios de IAsoporte para la toma de decisiones

Artículos relacionados