$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании не участвовали люди или позвоночные, а также не брались образцы тканей. Все эксперименты проводились в соответствии с руководящими принципами вычислительных исследований в Университете науки и технологии им. Дж.
Сбор и оценка онтологий
Публичные онтологии, относящиеся к здравоохранению, умным домам и промышленному мониторингу, были получены из установленных репозиториев, включая Linked Open Vocabularies (LOV) и порталы, специфичные для предметной области, в форматах RDF/OWL 1,2,3. Каждая онтология была проверена в редакторе онтологий (например, Protégé) и программно проанализирована для извлечения иерархий классов, свойств объектов и данных, а также связанных метаданных в соответствии со спецификациями RDF/OWL 1,2.
Для попарных сравнений лексическое сходство между метками классов вычислялось с использованием нормализованного сходства строк на основе расстояния редактирования4. Структурное сходство было получено путем обхода отношений подклассов и суперклассов и вычисления коэффициентов перекрытия локальных окрестностей. Сходство экземпляров оценивалось путем обнаружения общих или совместимых экземпляров в онтологиях и проверки совместимости типов данных. Комбинированный балл был определен как уравнение (1):
Sвсего=w1Sлексический+w2Sструктурный+w3Sэкземпляр Уравнение (1)
с начальными весами w1 = 0,5, w2 = 0,3, w3 = 0,2 и пороговым значением, выбранным из непроверенного валидационного подмножества. Соответствия кандидатов с совокупными баллами на уровне или выше порогового значения регистрировались в регистре CSV с идентификаторами онтологий, IRIs сущностей, оценками компонентов и результатом решения для выравнивания по нисходящей цепочке.
Семантическое моделирование и интеграция данных
Для преобразования необработанных потоков IoT в онтологически совместимые представления была создана единая онтология, охватывающая статические метаданные (например, Student, Course, Device) и динамические наблюдения (например, Sensor, Observation, Timestamp), в соответствии с лучшими практиками RDF/OWL10 и установленной IoT Semantic 5,6,13. Семантическое преобразование определялось функцией отображения:
Dсемантическая карта = f (Draw, O) Уравнение (2)
где O обозначает прикладную онтологию, а f_map материализует тройки со стабильными IRI. Преобразованные данные сохранялись в формате RDF и проверялись на согласованность с помощью запросов SPARQL; конечная точка SPARQL была сконфигурирована для поддержки семантических запросов между источниками19. Полученный RDF-артефакт был заархивирован как semantic_data.rdf, а для задач обучения был создан синхронизированный табличный экспорт (нормализованная широкая таблица), включая столбец происхождения данных, указывающий происхождение функции и любую примененную импутацию или масштабирование.
Выравнивание онтологий с помощью машинного обучения
Гибридный подход сочетает в себе сигналы сходства на основе правил с контролируемым обучением для выбора соответствий с высокой степенью достоверности14,15. Обучающий набор состоял из 2500 вручную аннотированных пар онтологий-элементов (совпадающих или несовпадающих) для создания сбалансированного набора данных. Функции включали в себя три компонента подобия вместе со вспомогательной статистикой, такой как разница в длине метки. Ансамбль дерева принятия решений (Random Forest) со 100 деревьями, максимальной глубиной 10, class_weight = «сбалансированным» и фиксированным случайным семенем (42) был обучен в соответствии с установленной практикой14. Цель обучения была формализована в виде уравнения (3):
Уравнение (3)
где yi — наземная истинная метка, yi^ — прогнозируемая метка, а λ представляет параметр регуляризации.
После калибровки вероятностей пары с прогнозируемой вероятностью ≥ 0,50 были сохранены, а ограничения «один к одному» были применены, чтобы избежать сопоставлений «многие к одному». Окончательный файл сопоставления, включающий исходные и целевые IRI, оценки достоверности и вклад функций, был сериализован как alignment_results.json; Артефакт обученной модели хранился как alignment_model.pkl. Качество модели было оценено на тестовом наборе с использованием точности, прецизионности, полноты, F1-оценки и матрицы неточности с 95% доверительными интервалами, рассчитанными с помощью пятикратной перекрестной проверки14,15.
Развертывание и оценка в реальных условиях
Для стресс-тестирования приема и выравнивания была создана симулированная среда, представляющая 1000 гетерогенных устройств, за которыми последовали реальные потоки из умного дома и здравоохранения. Данные, выровненные по онтологии, были интегрированы в облачный промежуточный слой для приема и запроса в режиме реального времени11,12. Новые устройства были автоматически подключены путем проверки заголовков входящих данных и применения динамической семантической классификации с использованием обученной модели выравнивания14,15.
Производительность системы оценивалась по четырем параметрам: (i) качество выравнивания (приведенные выше классификационные метрики), (ii) коэффициент совместимости (успешные взаимодействия между источниками в процентах от попыток взаимодействия), (iii) сквозная задержка, определенная как уравнение (4), и (iv) использование ресурсов (ЦП и памяти).
L = Tответ−Tзапрос Уравнение (4)
Конфигурационные файлы, журналы и выходные данные архивировались со стабильными именами файлов и файлом README для облегчения независимой репликации19. Завершенная структура последовательно обеспечивала семантическую совместимость в гетерогенных условиях IoT; Выходные данные, журналы производительности и конфигурации объединены для поддержки воспроизводимости и внешней проверки 11,12,19.
Сведения о реализации репликации
Конвейер был реализован на Python (версия 3.10 или более поздняя) с использованием rdflib и owlready2 для обработки RDF/OWL, scikit-learn для обучения и оценки моделей, а также стандартных библиотек данных для предварительной обработки 8,14,15. Были исправлены случайные затравки, версии библиотеки были закреплены в файле requirements.txt, а также использована каноническая структура директории: ontologies/, data/raw/, data/processed/, models/, и results/. Имена файлов, указанные в тексте, точны: semantic_data.rdf, alignment_results.json и alignment_model.pkl19.
Дизайн исследования
Это компьютерное исследование со смешанными методами объединяет семантическое моделирование с контролируемым модулем онтологического выравнивания для улучшения совместимости между гетерогенными источниками IoT. Вкратце протокол выглядит следующим образом: собираются и анализируются публичные онтологии; необработанные таблицы IoT сопоставляются с унифицированной схемой RDF/OWL10; Соответствия кандидатов генерируются из лексических, структурных и экземплярных сигналов 15,16; Компактный ансамбль дерева принятия решений обучается на вручную помеченном наборе для приема совпадений «один к одному» при фиксированном пороге14,15; выровненные графики/таблицы объединяются; а производительность оценивается по метрикам на уровне соответствия (точность, прецизионность, полнота, F1, матрица несоответствий) и поведению системы (уровень совместимости, сквозная задержка, ЦП/память)14,15. Метод взвешенного подобия, основанный только на правилах, служит в качестве базового уровня16. Случайные начальные значения и версии библиотек исправлены, а артефакты используют стабильные имена (semantic_data.rdf, alignment_results.json, alignment_model.pkl) для поддержки репликации. На рисунке 2 показана общая структура для проектирования унифицированных онтологий в средах IoT.

Рисунок 2: Проектирование унифицированных онтологий в средах IoT. На рисунке показаны основные архитектурные слои унифицированной онтологии, демонстрирующие семантическое моделирование, интеграцию ИИ и абстракцию знаний предметной области для бесшовной совместимости данных IoT. Фреймворк поддерживает как междоменные, так и предметно-ориентированные онтологические структуры. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Сбор данных
Сбор данных проводился в два отдельных этапа.
Оценка онтологии: Был проведен критический анализ существующих онтологий и семантических моделей IoT для выявления пробелов в текущих стратегиях интеграции. Общедоступные наборы данных IoT и предметно-ориентированные онтологии были изучены для оценки структурных и семантических ограничений выравнивания 5,6,10,11.
Одобрение судебного разбирательства: Реальные системы IoT (например, умные дома, приложения для здравоохранения, промышленная автоматизация) использовались для сбора данных для валидации фреймворка. Кроме того, были созданы моделируемые наборы данных для оценки производительности системы в контролируемых и воспроизводимых условиях 8,9,11,12.
Анализ данных
На этапе анализа использовалась комбинация семантических, статистических и основанных на искусственном интеллекте методов для проверки предложенной структуры.
Практические выравниватели включают в себя сопоставители лексических строк с использованием нормализованного расстояния Левенштейна (NLD) для меток/синонимов16; методы на основе структурного графа, распространяющие или агрегирующие сходство Flooding, распространяющие сходство по окрестностям подкласса/суперкласса12,15; методы, осознающие логику/сохраняющие когерентность, которые сочетают согласование с рассуждениями для поддержания согласованности отображений15,19; подходы, основанные на примерах/вероятностные подходы, использующие данные из общих или совместимых примеров17; и гибридные/ансамблевые матчеры, объединяющие несколько сигналов и правил 12,14,15. В современных нейронных вариантах используются контекстуальные вложения предложений для оценки сходства кандидатов 12,14.
Выравнивание онтологий: Высокоуровневые алгоритмы выравнивания использовались для устранения семантических расхождений между гетерогенными онтологиями IoT. Эти алгоритмы использовали эвристические правила и методы машинного обучения (ML) для вычисления точных отображений и поддержания ограничений согласованности15,17. На рисунке 3 представлен процесс выравнивания онтологий для достижения функциональной совместимости между устройствами IoT.

Рисунок 3: Процесс выравнивания онтологий для совместимости устройств IoT. На этой схеме показан процесс выравнивания, который устраняет синтаксические и семантические несоответствия между устройствами в гетерогенной экосистеме Интернета вещей. В нем подчеркивается роль лексических, структурных метрик и метрик сходства на основе экземпляров, используемых в алгоритме выравнивания. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Семантическое моделирование: Стратегия семантического моделирования на основе искусственного интеллекта была применена для разработки единой онтологии, охватывающей как предметно-специфичную, так и междоменную семантику. Эта модель объединяет статические и динамические потоки данных IoT и соответствует передовым практикам RDF/OWL и установленной семантике IoT 5,6,10,13, поддерживая приложения реального времени.
Оценка эффективности: В ходе эксперимента оценивались ключевые показатели производительности, включая уровень совместимости, задержку, эффективность системы и масштабируемость 11,12. Был проведен сравнительный анализ с методами базовой интеграции, чтобы продемонстрировать гибкость и отказоустойчивость предложенного решения 12,14,15,16. На рисунке 4 показан вычислительный поток и критические компоненты процессов выравнивания онтологий и семантического моделирования.

Рисунок 4: Семантическая модель для приложений IoT реального времени. На этом рисунке показана стратегия семантического моделирования, которая объединяет статические конфигурации устройств и динамические потоки данных датчиков в единую онтологию. Архитектура поддерживает семантическое обогащение в режиме реального времени для принятия решений с учетом контекста. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Ключевые уравнения
Уравнение для выравнивания онтологий с использованием метрик подобия: Для выравнивания гетерогенных онтологий IoT совокупное сходство вычисляется как взвешенная смесь лексических, структурных и основанных на экземплярах сигналов в соответствии с уравнением 1 выше, где Stotal — совокупное сходство между двумя элементами онтологии, Slexical — сходство от лексического соответствия (например, нормализованное расстояние между строками), Sstructural — сходство, основанное на базовых отношениях (например, иерархия родитель-ребенок), Sinstance — сопоставимость, основанная на данных экземпляра (например, перекрытие в примерах использования), а W1, W2, W3 — весовые коэффициенты, скорректированные в зависимости от контекста приложения.
Уравнение для оптимизации на основе машинного обучения для отображения онтологий: Улучшение отображений может быть сформулировано как задача минимизации затрат с использованием возможности неудачи:

где L — возможность Misfortune для предсказания отображения, yi — метка основной истины для i-го отображения, y^i — метка предсказания для i-го отображения, ||Θ|| - член регуляризации для предотвращения переобучения, λ - параметр регуляризации.
Уравнение для семантического моделирования потоков данных IoT: Семантическое обогащение выражается в виде преобразования данных на основе онтологии в соответствии с уравнением 2 выше, где Dsemantic — это семантически аннотированный набор данных, Draw — это необработанные данные IoT, O — онтология, используемая для аннотации, а fmap — функция отображения, полученная из единой онтологии.
Уравнения для метрик производительности (совместимость и задержка)
Индекс интероперабельности (процент успешных взаимодействий между источниками):
I_index = (количество успешных взаимодействий / общее количество взаимодействий) x 100 Уравнение (5)
Задержка (воспроизведенная здесь для полноты картины) вычисляется в соответствии с уравнением 4 выше, где I_index — индекс совместимости (в %), L — задержка (мс), T_response — метка времени ответа, T_request — метка времени запроса.
Уравнение для анализа масштабируемости экосистемы IoT
Вычислительная сложность по отношению к количеству устройств и элементов онтологии:
C = O(n · m) Уравнение (6)
где C — вычислительная сложность, n — количество устройств IoT, а m — количество элементов онтологии.