$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Declaración ética
Este estudio fue revisado y aprobado por la Junta de Revisión Institucional (IRB) de la Universidad Nacional de Malasia (UKM) antes de la recopilación de datos (Id de aprobación: UKM/FEP/2025/AI-047; Fecha de aprobación: 12 de marzo de 2025). El protocolo aprobado abarcaba la administración de encuestas estructuradas y entrevistas semiestructuradas con participantes humanos. Todos los participantes fueron informados sobre el propósito del estudio, la naturaleza voluntaria de su participación y su derecho a retirarse en cualquier momento sin consecuencias, y se obtuvo el consentimiento informado por escrito antes de su inclusión. Se mantuvieron estrictamente el anonimato y la confidencialidad de los participantes, sin que se incluyera información personal identificable en el análisis o publicación, y todos los datos se almacenaron de forma segura y se utilizaron exclusivamente con fines de investigación académica, conforme a los estándares éticos institucionales y las directrices internacionales relevantes para la investigación con sujetos humanos.
Arquitectura general del marco propuesto BERT–GNN KM
Inicialmente se utilizaba un codificador transformador finamente ajustado para procesar texto no estructurado, incluyendo documentos internos, interacciones con clientes y contenido de redes sociales. La arquitectura general del sistema del flujo de trabajo KM basado en BERT–GNN se muestra en la Figura 1. Los datos empresariales utilizados en este estudio se recopilaron en formatos digitales, incluyendo archivos estructurados de encuestas, transcripciones de entrevistas, informes internos de la empresa y documentos de estudio de caso disponibles públicamente. Todos los documentos se consolidaron en un corpus unificado para su análisis. El contenido textual se extrajo de estas fuentes y se limpió para eliminar metadatos irrelevantes, entradas duplicadas y artefactos de formato. El corpus limpiado se segmentaba entonces en oraciones y se tokenizaba para prepararlo para el procesamiento posterior del lenguaje natural, como la extracción de texto con analizadores, eliminación de ruido, segmentación de oraciones y tokenización usando tokenizador de piezas de Word. Este conjunto de datos textual procesado sirvió como entrada para el modelo ajustado de extracción de entidadesy relaciones 33 , que tiene 12 capas con 12 cabezas de atención y 768 unidades ocultas. Los datos extraídos se organizaron en un Grafo de Conocimiento, que proporcionaba una representación estructurada e interconectada del conocimiento a través del mapeo ontológico del dominio empresarial. Se aplicaron GNN para el alineamiento de ontologías usando similitud coseno y razonamiento, para asegurar que las relaciones semánticas entre dominios de conocimiento se capturaran con precisión e inferieran lógicamente eliminando los duplicados mediante similitud de cadenas con el umbral 0,85. El conocimiento procesado se utilizó entonces dentro de la capa de toma de decisiones, permitiendo un análisis eficiente de datos y facilitando la toma de decisiones basada en datos. Esta arquitectura transformaba datos fragmentados en activos de información inteligentes y conscientes del contexto. El marco fue validado mediante simulaciones de casos de negocio y comparado con sistemas KM convencionales como Naive Bayes (NB), Support Vector Machine (SVM), Random Forest (RF), TF-IDF, LDA, BERT only y BERT con KG, con una división del conjunto de datos de 70:15:15 y un nivel fijo de 42 para evaluar mejoras de rendimiento en la precisión de la recuperación, la latencia de la decisión y la utilidad del conocimiento.

Figura 1. Arquitectura general del sistema del flujo de trabajo KM basado en BERT-GNN. Arquitectura general del sistema AI–BDA–GNN que muestra la ingesta de datos multifuente, preprocesamiento, BERT ajustado para extracción semántica, población KG, alineamiento/razonamiento de ontologías basadas en GNN y la capa de toma de decisiones. Las flechas indican el flujo de datos y bucles de retroalimentación opcionales para el aprendizaje online. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Adquisición de datos
El conjunto de datos utilizado en este estudio se recopiló de múltiples fuentes para apoyar la representatividad y la validez externa. La recopilación de datos primarios mediante encuestas estructuradas y entrevistas semiestructuradas con profesionales de los sectores de TI, manufactura, sanidad y educación incluyó miembros certificados de la Cámara de Auditores Financieros de Rumanía. Los datos secundarios incluían documentos internos empresariales anonimizados, informes anuales y estudios de caso de transformación digital disponibles públicamente. La recogida de datos se realizó dentro de un periodo de estudio bien definido, y todos los registros se anonimizaron por motivos de autorización ética institucional para proteger la confidencialidad y garantizar el cumplimiento.
Criterios de selección de participación: Para garantizar el rigor metodológico y la representatividade, los participantes fueron seleccionados en base a criterios bien definidos de inclusión y exclusión. Además de participar activamente en la transformación digital, la gestión de la información, la inteligencia artificial, el análisis de big data o iniciativas de sistemas de información empresariales, los participantes elegibles debían contar con al menos tres años de experiencia profesional en TI, manufactura, sanidad, educación, contabilidad o entornos empresariales relacionados. Era necesario que los profesionales certificados tuvieran estatus activo de certificación durante el periodo de recopilación de datos (por ejemplo, miembros de la Cámara de Auditores Financieros de Rumanía). Para comprender con precisión los materiales de la encuesta y la entrevista y dar permiso informado conforme al protocolo autorizado del IRB, también se requería que los participantes demostraran dominio del rumano o del inglés. Se excluyeron aquellos con menos de tres años de experiencia relevante, estatus profesional inactivo (si procede), sin participación directa en procesos de conocimiento o toma de decisiones a nivel empresarial, respuestas incompletas a encuestas (más del 20% de datos faltantes) o comprobaciones de calidad de datos fallidas. Además, no se incluyeron en el análisis las transcripciones de entrevistas que no eran suficientemente detalladas o pertinentes para las técnicas de KM. Estos estándares garantizaban una muestra de participante competente, representativa del sector y analíticamente sólida.
Los miembros certificados de la Cámara de Auditores Financieros de Rumanía (CAFR) eran una población objetivo clave para la recopilación de datos. Se desarrolló una encuesta en línea que se distribuyó a través de los canales internos de comunicación de CAFR para apoyar una distribución dirigida y altas tasas de respuesta. Para formar una muestra representativa, se revisaron las historias del CAFR y se seleccionaron 250 participantes registrados en función de características relevantes para el estudio.
Estructura de los instrumentos de encuesta: El estudio utilizó un cuestionario estructurado con 24 ítems distribuidos en cinco dominios de constructos: agilidad organizativa y eficiencia operativa (5 ítems), apoyo estratégico a la decisión y capacidad de innovación (5 ítems), impacto del análisis de Big Data en el intercambio de conocimiento (5 ítems), adopción de IA en KM (5 ítems) y efectividad y usabilidad del sistema percibidas por el usuario (4 ítems). Se utilizó una escala de Likert de 5 puntos, con 1 que denotaba "totalmente en desacuerdo" y 5 que denotaba "totalmente de acuerdo", para calificar cada ítem. La herramienta fue contextualizada para la implementación de IA empresarial y modificada a partir de escalas de KM y transformación digital previamente validadas. Tres académicos y dos expertos en negocios realizaron una revisión experta para confirmar la validez del contenido. Para mejorar el lenguaje, medir la claridad y medir la fiabilidad, se llevó a cabo una investigación piloto con 20 profesionales; todos los componentes tenían valores alfa de Cronbach superiores a 0,80, mostrando una fuerte consistencia interna. También se realizaron entrevistas semiestructuradas para complementar los resultados de la encuesta. La guía de entrevistas abordó cinco áreas temáticas: experiencia con transformación digital, dificultades con el flujo de conocimiento empresarial, integración de IA y Big Data en la toma de decisiones, obstáculos para la alineación semántica y cuestiones de gobernanza ética. Cada entrevista se realizó con consentimiento informado, duró aproximadamente entre 45 y 60 minutos, se grabó en audio y luego se transcribió para su análisis cualitativo.
Para evaluar el rendimiento del marco BERT-GNN sugerido para la gestión de la tecnología en organizaciones que se transforman digitalmente, se preparó un conjunto de datos grande y diverso a partir de diferentes fuentes y sectores distintos. El conjunto de datos abarca aspectos tanto cuantitativos como cualitativos para representar las percepciones dinámicas sobre el flujo de conocimiento y el cambio organizacional. Se recopilaron datos estructurados de más de 250 profesionales a través de un cuestionario en línea que consistía en ítems a escala Likert (rango 1–5) para medir los efectos percibidos de la Inteligencia Artificial (IA) y el análisis de Big Data (BDA) en el intercambio de conocimientos, la innovación y la agilidad empresarial. Simultáneamente, se recopilaron datos no estructurados mediante entrevistas semiestructuradas con 30 expertos del sector, proporcionando más de 120.000 palabras de transcripción. Se recopilaron materiales semiestructurados adicionales, incluyendo informes anuales de empresas y documentos estratégicos digitales (más de 50 documentos), para situar en contexto los patrones de adopción a escala empresarial. Además, se añadieron 15 estudios de caso detallados de los sectores de TI, manufactura, sanidad y educación para ofrecer contextos prácticos de transformación. Documentos internos de la base de conocimiento (alrededor de 200 MB), anonimizados por razones de privacidad, también se incluyeron para mejorar la representación de los activos de conocimiento operativo. Este conjunto de datos multifuente permite una sólida cadena de entrenamiento y evaluación para modelos de aprendizaje profundo y captura tanto los aspectos estratégicos como operativos de la KM. La Tabla 1 muestra la muestra poblacional utilizada para la evaluación.
| Componente | Tipo | Fuente | Tamaño/Volumen |
| Respuestas a encuestas profesionales | Estructurado | Encuestas online de 250+ profesionales | ~10.000 discos |
| Transcripciones de entrevistas | No estructurado | Entrevistas semiestructuradas con 30 expertos | ~120.000 palabras |
| Informes de la empresa | Semiestructurado | Informes anuales y documentos de estrategia digital | 50+ documentos |
| Estudios de caso | Mixta | Casos de uso específicos de la transformación digital para sectores | 15 casos detallados |
| Contenido de la Base de Conocimiento | No estructurado | Documentos internos de organizaciones (anonimizados) | ~200 MB |
Preprocesamiento de datos y ajuste fino de BERT
Los datos en bruto de los documentos empresariales se accedían a partir de listas seleccionadas y preprocesados mediante segmentación de oraciones, tokenización, eliminación de palabras de parada y normalización para cumplir con los requisitos del tokenizador. El modelo preentrenado se modificó posteriormente para afinar el modelo para una tarea concreta, y se ajustó para realizar una tarea de reconocimiento de entidades nombradas (NER) y extracción de relaciones (RE). El modelo ha sido ajustado con los datos de corpus preprocesados para un recuento de épocas concretas con el optimizador Adam. Finalmente, se produjeron incrustaciones contextualizadas de palabras (R768) a partir de entidades identificadas y sus relaciones. Las entidades normalizadas se generaban mediante una técnica de normalización basada en ontologías, en la que diferentes entidades, como sinónimos, se convertían en forma normalizada. Cada entidad normalizada distinta era un nodo, mientras que la relación entre entidades se llamaba arista en la representación del grafo de conocimiento. Las incrustaciones de entidades normalizadas generadas por el modelo formaron las características iniciales del nodo de la Red Neuronal de Grafos. En el siguiente paso, se entrenó la Red Neuronal de Grafos con el método de predicción supervisada de enlaces con muestreo negativo obtenido mediante corrupción de aristas. En el entrenamiento, hay una pérdida de entropía cruzada a lo largo de varias épocas. El marco entrenado se evaluó utilizando la Precisión de Recuperación de Conocimiento, la Latencia en la Toma de Decisiones y la Tasa de Satisfacción del Usuario como métricas de evaluación.
Se utilizó un enfoque híbrido de anotación para crear etiquetas de entrenamiento para RE y NER. Dos expertos independientes en la materia anotaron manualmente un corpus específico de dominio de documentos empresariales, como informes internos, registros de interacción con clientes y documentos de políticas, utilizando un esquema de ontología predeterminado que identificaba categorías de entidades (como Organización, Proceso, Tecnología, Rol, KPI) y tipos de relaciones (como soportes, depends_on y mejoras). Para garantizar la uniformidad en la dirección de relación y la detección de fronteras de entidades, se crearon directrices de anotación completas. El 20% del conjunto de datos fue anotado doblemente para evaluar la fiabilidad. El Kappa de Cohen se utilizó para probar la concordancia entre anotadores, y los resultados mostraron una fuerte concordancia (κ = 0,87 para el etiquetado de entidades y κ = 0,82 para la extracción de relaciones). Posteriormente, se utilizó una supervisión débil para ampliar el conjunto de datos anotado manualmente mediante la correspondencia de patrones basada en reglas y con limitaciones de ontología, con filtrado basado en confianza para reducir el ruido. Para garantizar la completa reproducibilidad, se registraron todos los procedimientos de anotación, definiciones de ontologías, divisiones de conjuntos de datos y semillas aleatorias.
Se midió la eficiencia en la precisión a nivel de documento, se estimó la latencia en función del tiempo de respuesta de la consulta de extremo a extremo y los usuarios quedaron satisfechos utilizando los cuestionarios de la escala Likert. Al final de cada etapa, se establecieron los puntos de control del protocolo de seguimiento. (i) punto de control de salida BERT - entidades muestrales y triples de relación extraídos; (ii) muestra de punto de control KG de subgrafo construido con etiquetas de ontología; (iii) Punto de control GNN - ejemplo de predicción de ontologías y enlace inferido; y (iv) punto de control de recuperación - muestra de elementos de conocimiento recuperados con etiquetas de relevancia.
El protocolo propuesto tiene la siguiente estructura: pipeline determinista de varias etapas con salidas intermedias bien definidas, que permite una reproducibilidad total. Paso 1, Tras la ingestión y preprocesamiento de datos empresariales estructurados, semiestructurados y no estructurados, se generarán corpora de texto limpios y matrices numéricas de características normalizadas. Paso 2: Se realizará la aplicación de modelos BERT ajustados para la extracción de conocimiento, proporcionando resultados explícitos en forma de entidades nombradas, como Departamento, Proceso, Documento y KPI; (ii) relaciones semánticas entre entidades, representadas como tripletes sujeto-predicado-objeto. En el Paso 3, estos triples se transforman en un grafo de conocimiento inicial, en el que los nodos son entidades y las relaciones son aristas tipadas, alineadas con un esquema ontológico predefinido. En el Paso 4, la aplicación de redes neuronales de grafos a este grafo para alineación y razonamiento de ontologías generaría mejoras incrustaciones de nodos, inferiría relaciones y alinearía etiquetas ontológicas. El Paso 5 proporciona el grafo de conocimiento finalizado y los resultados del razonamiento que alimentarán la recuperación semántica, el apoyo a la decisión y la evaluación del rendimiento.
Todos los artefactos intermedios, incluyendo listas de entidades, triples de relación, grafos alineados con ontologías y enlaces inferidos, se generan explícitamente en cada etapa de este protocolo, permitiendo la replicación independiente de la investigación sin necesidad de recordatorios.
El conjunto de datos se divide en el conjunto de entrenamiento, el conjunto de validación y el conjunto de pruebas según una proporción fija de 70:15:15 para garantizar la reproducibilidad de los resultados del experimento. La tokenización, el minúsculo, la eliminación de palabras de parada y el acortamiento de secuencias a 512 tokens se hacen para BERT en cuanto a preparación de texto. Por otro lado, la normalización Z-Score se utiliza para normalizar características estructurales. Además, el modelo BERT se ajusta con precisión utilizando la biblioteca del framework de aprendizaje profundo con el optimizador Adam, donde la tasa de aprendizaje es 2e-5, el tamaño del lote es 16 y el número de épocas es 5. Las entidades y relaciones extraídas predichas se guardan en un formato estándar para la construcción del grafo de conocimiento. Además, la incrustación de nodos en grafo de conocimiento (R768) se utiliza como entrada para el GNN para alineación y razonamiento de ontologías.
Interfaz BERT-GNN y flujo de datos
Dentro del marco propuesto, el codificador transformador está ajustado para realizar dos tareas de PLN: la tarea NER y la tarea RE en un corpus de texto empresarial. Finalmente, las salidas del modelo incluyen incrustaciones contextualizadas de tokens (R768), etiquetas de clasificación de entidades y tripletes relacionales sujeto-predicado-objeto. Las entidades normalizadas se utilizan construyendo una ontología empresarial predefinida, donde las variaciones textuales y los sinónimos de la entidad se asignan a un identificador de entidad. A cada entidad normalizada única se le asigna un nuevo nodo de entidad dentro del grafo de conocimiento construido. Dependiendo del tamaño del corpus industrial, el grafo de conocimiento generado en los escenarios empresariales evaluados tiene entre 18.000 y 25.000 nodos de entidad y entre 42.000 y 60.000 aristas relacionales tipadas. Persona, Departamento, Proceso, Producto, Organización y Documento son solo algunos de los tipos de nodos que se encuentran en el grafo. Otros tipos de bordes incluyen works_for, manages, belongs_to, produces, approved_by y related_to. A cada nodo se le asigna un identificador distinto basado en ontologías derivadas de una ontología empresarial predeterminada. Como resultado, el grafo heterogéneo resultante tiene aristas tipadas que representan relaciones normalizadas y nodos tipados con propiedades de incrustación semántica. Después de eso, el GNN obtiene estas incrustaciones de nodos para razonamiento relacional y alineamiento de ontologías. De forma crucial, el GNN funciona sobre el grafo generado sin propagar gradientes hacia el codificador BERT, garantizando el entrenamiento modular y manteniendo la separación de los componentes de razonamiento del grafo y extracción semántica.
BERT se utilizó en este estudio para modelado contextual del lenguaje y extracción semántica de características. El modelo puede aprender a predecir eficientemente las etiquetas de categoría correctas para entradas de texto novedosas cuando se ajusta con datos etiquetados adaptados a un objetivo de clasificación específico. Dado que BERT es bidireccional, considera tanto el contexto anterior como el posterior de cada palabra, permitiendo una comprensión más completa de las relaciones dentro del texto. El codificador del modelo base BERT consta de 12 bloques transformadores, cada uno con 12 cabezas de autoatención y un tamaño oculto de 768. Antes de su procesamiento, el texto de entrada se divide en tokens según el enfoque de tokenización seleccionado, que pueden representar palabras o subpalabras. La representación de secuencia derivada usando BERT se describe en el Archivo Suplementario 1. Los parámetros del modelo se optimizan minimizando la probabilidad logarítmica de la etiqueta correcta (Figura 2).

Figura 2. Proceso de trabajo detallado del modelo BERT utilizado para extraer características semánticas. Muestra las dimensiones de entrada/salida y el papel de las incrustaciones contextuales en la población KG. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Construcción de grafos de conocimiento usando GNN
El esquema del Grafo de Conocimiento está predefinido antes de construir el grafo. Proporciona coherencia semántica. La ontología está predefinida en relación con un número finito de tipos tanto para entidades como para tipos de relación, junto con restricciones de rango de dominio, que son útiles para el razonamiento. El esquema es aplicable para poblar el grafo a partir de los triples recogidos del modelo BERT, así como para el mensaje consciente de la relación que pasa por el GNN.
Dentro de este marco, el Grafo de Conocimiento (KG) sirve como una representación estructurada del conocimiento empresarial, modelando entidades (por ejemplo, departamentos, documentos, procesos) y relaciones semánticas entre ellas. Las derivaciones matemáticas de KG se añaden en el archivo suplementario 1. Esta integración de la construcción KG y el razonamiento basado en GNN permite la alineación de ontologías, la inferencia de relaciones y una recuperación semántica mejorada dentro del marco empresarial de KM.
El Grafo de Conocimiento (KG) se representa como un grafo heterogéneo G, mientras que su estructura se expresa mediante su ontología O. KG puede verse alternativamente como un conjunto de hechos que se expresan mediante afirmaciones de razonamiento predicativo. Estos fundamentos tienen las siguientesdescripciones 34. El grafo G es variable, con V representando el conjunto de objetos o nodos (ambos pueden usarse indistintamente) y
representando el conjunto de relaciones. Un triplete (
) también puede usarse para caracterizar respectivamente un par de objetos v1 y
su asociación
. La derivación matemática de la construcción KG usando GNN se describe en el Archivo Suplementario 1.
Alineamiento y razonamiento de ontologías basados en BERT-GNN
El algoritmo 1 muestra el alineamiento y razonamiento de ontologías basados en GNN. El proceso comienza inicializando las capacidades de los nodos utilizando incrustaciones preextraídas junto con aquellas generadas mediante una versión BERT ajustada de alta calidad, que capta el significado semántico de cada entidad a partir de texto no estructurado. El grafo de conocimiento, compuesto por nodos (entidades) y aristas (relaciones), se representa mediante el uso de una matriz de adyacencia (A) y una matriz de características (X).
El conjunto de reglas avanza a través de más de una capa GNN. En cada capa, la representación de un nodo se actualiza mediante la agregación de datos de sus nodos vecinos, ponderada por su conectividad (es decir, usando la matriz de adyacencia). Esto se formula matemáticamente mediante un método de paso de mensajes donde las incrustaciones de nodos se expanden mediante matrices de pesos entreenables y se transmiten mediante una característica de activación no lineal que incluye ReLU. Un paso de normalización (por ejemplo, normalización de capas o el uso de matrices de diploma como en la ecuación GCN) garantiza un conocimiento estable de adquisición a lo largo de las capas.
Tras repetir este proceso para un rango predefinido de capas T, el modelo produce un conjunto final de incrustaciones de nodos Z, que codifican cada vecindario y su forma y capacidades semánticas. Estas incrustaciones se superan mediante una capa suave de clasificación máxima para predecir etiquetas ontológicas alineadas, incluyendo ordenaciones de entidades (por ejemplo, "Departamento", "Producto", "Proyecto") o roles semánticos dentro de la corporación.
Algoritmo 1: Alineamiento y razonamiento de ontologías basados en GNN en BERT
El proceso de alineación y razonamiento basado en la ontología GNN operaba sobre el Grafo de Conocimiento construido, que consistía en entidades representadas como nodos y sus relaciones representadas como aristas. Las representaciones iniciales de nodos se derivaron de incrustaciones semánticas basadas en BERT y se organizaron en una matriz de características. La matriz de adyacencia representaba la estructura de conectividad del grafo, y se aplicó un número predefinido de capas GNN para refinar las representaciones de nodos. Para cada capa, el modelo actualizaba cada nodo agregando información de sus nodos vecinos basándose en la estructura del grafo. Esta agregación en Eqn (1) consiste en multiplicar representaciones de nodos vecinos por matrices de pesos entrenóbles, añadir un término de sesgo y aplicar una función de activación no lineal.
(1)
Tras cada actualización de capa, se aplicó la normalización para estabilizar el entrenamiento y asegurar escalas de incrustación consistentes. Una vez procesadas todas las capas, se obtuvieron las incrustaciones finales de los nodos. Estas incrustaciones pasaban luego a través de una capa de clasificación con una función softmax para predecir etiquetas de ontologías o clases de entidades alineadas. El procedimiento producía las incrustaciones finales refinadas de nodos y las etiquetas alineadas con ontologías predichas como salidas.
El método propuesto permite la alineación semántica de entidades de múltiples fuentes y soporta el razonamiento sobre el grafo de conocimiento inferiendo nuevas relaciones y clasificando nodos previamente no etiquetados.

Figura 3. Alineamiento de ontologías y razonamiento semántico usando GNN. Ilustra los pasos de paso de mensajes vecinales e incrustación de actualizaciones. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Las características agregadas se transforman usando matrices de pesos específicas de la relación y una función de activación no lineal (por ejemplo, ReLU), generando incrustaciones de nodos actualizadas que integran características semánticas derivadas de BERT con información estructural del grafo. Estas incrustaciones se pasan luego a una capa de clasificación softmax para predecir etiquetas de entidades o clases de ontologías alineadas. Este proceso establecido hace que el GNN sea enormemente eficaz para razonar sobre grafos tecnológicos, ayudando a tareas como la desambiguación de entidades, la inferencia de corte y el tipo semántico, contribuyendo finalmente a estructuras de control estadísticas más inteligentes impulsadas por IA (Tabla 2).
| Componente | Descripción |
| Marco/Kits de herramientas | Python 3.9, PyTorch 2.0.1, Transformadores de Caras Abrazadas 4.34, DGL 1.1 (Biblioteca de grafos profundos) |
| Hardware | GPU NVIDIA Tesla V100 (16GB), 128GB de RAM, Ubuntu 20.04 |
| Pipeline de preprocesamiento | Tokenización (Word Piece para BERT), eliminación de palabra de parada, reconocimiento de entidades (SpaCy), normalización de puntuación z para características numéricas |
| Fuentes del conjunto de datos | Encuesta profesional (250+ respuestas), transcripciones de entrevistas (~120.000 palabras), informes de empresas (50+), estudios de caso (15), documentos internos (200MB) |
| División de datos | 70% entrenamiento, 15% validación, 15% pruebas |
| Modelo codificador de texto | Base BERT (sin funda), 12 capas, tamaño oculto 768, 12 cabezas de atención |
| Ajuste fino de BERT | 4 épocas, tamaño del lote = 32, tasa de aprendizaje = 2e-5, optimizador Adam, longitud máxima de secuencia = 512 |
| Construcción de grafos | Extracción de conocimiento basada en tripletes (sujeto, predicado, objeto) |
| Tipo de grafo | Grafo heterogéneo con aristas multi-relacionales (entidades de la salida BERT) |
| Arquitectura GNN | Red Neuronal de Grafos Heterogéneos de 2 capas (modelo de paso de mensajes) |
| Hiperparámetros GNN | Dimensión oculta = 128, Activación = ReLU, Optimizador = Adam, Tasa de aprendizaje = 0,001 |
| Tipo decodificador | Dist. Mult con puntuación por producto escalar para la predicción de enlaces |
| Función de pérdida | Entropía cruzada binaria para clasificación de tripletes |
Finalmente, el protocolo concluye con la generación de los siguientes resultados: un grafo de conocimiento empresarial alineado con la ontología, modelos BERT y GNN, resultados de recuperación y razonamiento de información, y los informes del KRP, OAA, DML y USR. Estos proporcionan la salida final en forma reproducible. Para muestreo negativo durante el entrenamiento GNN, los tripletes válidos se corrompen mediante reemplazo de entidades según las restricciones de tipo definidas por la ontología. Los alineamientos resultantes de ontologías son validados para garantizar su consistencia y revisados manualmente por expertos del dominio para asegurar la coherencia semántica entre las entidades extraídas y las clases de ontología canónicas.
Criterios de evaluación
La latencia de toma de decisiones es la medida del tiempo total que tarda el sistema en proporcionar una respuesta accionable después de que se haya enviado la consulta del usuario. Sea i la consulta del usuario,
el momento en que se envía la consulta,
el momento en que el sistema proporciona la salida final de la decisión. La Latencia de Toma de Decisiones (DML) se da por:
(2)
donde es el número total de consultas evaluadas. Esta métrica mide el tiempo de respuesta total del marco propuesto, desde la recuperación del conocimiento hasta la generación de respuestas. Un valor menor para esta métrica es ideal, ya que muestra un tiempo de respuesta del sistema más rápido, lo cual es crucial para aplicaciones empresariales sensibles al tiempo.
La Relación de Cobertura de Conocimiento es la relación entre la capacidad del sistema de recuperar todos los elementos de conocimiento relevantes disponibles para una consulta determinada. Sea el conjunto de todos los elementos de conocimiento relevantes para la consulta q, es el conjunto de elementos de conocimiento realmente recuperados por el sistema. La Relación de Cobertura de Conocimiento (KCR) se define como:
(3)
Esta fórmula calcula la completitud de los elementos de conocimiento que se recuperan. Es equivalente a la medida de recuerdo utilizada en los sistemas tradicionales de recuperación de información.