Методическая статья

Воспроизводимый рабочий процесс с помощью искусственного интеллекта для разработки концепций в дизайне сценического искусства и оптимизации освещения через фреймворк GSAD

DOI:

10.3791/70737

12 мая 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Здесь авторы представляют протокол для реализации фреймворка генеративного дизайна сценического искусства (GSAD) — ИИ-управляемого рабочим процессом, интегрирующего модели диффузии, генеративные враждебные сети (GAN) и интеллектуальную оптимизацию клана слонов (IECO) для стандартизации перехода от нарративных скриптов к оптимизированным 3D-визуальным концепциям.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Искусственный интеллект (ИИ) фундаментально меняет творческие процессы дизайна, позволяя быстро генерировать идеи и последовательную визуализацию, особенно в области сценического искусства и сценографии. Однако существующие рабочие процессы по-прежнему сильно зависят от ручного эскиза и субъективной интерпретации, что ограничивает масштабируемость и снижает воспроизводимость в разных командах проектирования. Этот пробел подчёркивает необходимость структурированного фреймворка для генеративного этапного дизайна искусства (GSAD) с поддержкой искусственного интеллекта, который интегрирует глубокое обучение, генеративное моделирование и методы оптимизации для поддержки систематической и повторяемой разработки концепций. Основная цель фреймворка GSAD — объединить диффузионные модели для начальной генерации концепций, генеративные сопернические сети (GAN) для уточнения текстуры и освещения, а также интеллектуальную оптимизацию кланов слонов (IECO) для оптимизации планировки сцены и размещения освещения. Набор данных по дизайну сценического искусства, включающий 2500 изображений высокого разрешения, включает аннотированные театральные сценарии, световые схемы и 3D-макеты для облегчения мультимодального обучения. Экспериментальная оценка демонстрирует значительные улучшения качественных метрик, включая улучшенное семантическое согласование между содержанием скриптов и сгенерированными визуалами, а также повышенную эффективность оптимизации макета с помощью пространственного анализа, основанного на IECO. Реализация фреймворка в среде на Python обеспечила предсказательной точности 98,88%, 26,58 мега операций с плавающей запятой в секунду (MFPO) и параметрическое количество 1,08 М. Фреймворк GSAD представляет собой масштабируемый, воспроизводимый и технически надёжный рабочий процесс с помощью искусственного интеллекта, который повышает творческий результат, обеспечивает визуальную согласованность и поддерживает эффективную разработку концепций в современном дизайне сценического искусства.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Дизайн сценического искусства — это сложная междисциплинарная область, объединяющая сценографию, освещение, дизайн декораций и пространственное повествование 1,2. Исторически разработка концепций сцены опиралась на человеческую изобретательность, выраженную через физические модели, нарисованные от руки эскизы, мудборды и итеративные мозговые штурмы(3,4). Эта эволюция была глубоко сформирована напряжением между художественным видением и материальными ограничениями пространстваперформанса 5. По мере того как требования к производительности становятся всё более сложными, спрос на ресурсоэффективные, визуально насыщенные и быстрые генерации концепций превзошел традиционные ручныерабочие процессы 6,7. Появление генеративного искусственного интеллекта (GenAI) и крупных языковых моделей (LLM) открывает трансформационный путь для расширения творческого процесса, способствуя формированию идей и совместному творчеству в архитектуре иразвлечениях 8,9.

Традиционная сценография часто сталкивается с семантическим разрывом, когда абстрактные эмоции театрального сценария пытаются найти точный визуальный эквивалент без обширных проби ошибок 2,10. Современные инструменты искусственного интеллекта в креативных индустриях позволяют гибко искать и рекомбинировать референсные фотографии, однако многим из них не хватает структурной строгости, необходимой для профессиональной постановкисцены 11,12. Кроме того, субъективный характер эстетической оценки часто затрудняет согласование машинно генерируемых результатов с конкретным повествовательнымнамерением 13. Этот переход от ручных рабочих процессов, основанных на опыте, к сотрудничеству человека и ИИ, основанного на данных, становится определяющей чертой практики дизайна XXIвека 14,15. Интеграция этих вычислительных инструментов требует новой формы «практических» исследований, которые сокращают разрыв между разработкой цифровых инструментов и живымивыступлениями 16. Недавние исследования подчёркивают, что системы ИИ могут способствовать мозговому штурму и широкому изучению альтернатив, однако переход от 2D-идей к 3D-оптимизированной реализации остаётся техническисложным 9.

Фреймворк генеративного дизайна сценического арт-дизайна (GSAD) устранил эти недостатки, создав повторяемый рабочий процесс с поддержкой искусственногоинтеллекта 17,18. Обоснование этой концепции заключается в необходимости автоматизировать компоненты дизайна при сохранении художественной целостности оригинального повествования. Интегрируя мультимодальные системы ИИ, дизайнеры могут быстро дорабатывать как визуально, так и вербально, обеспечивая семантическое согласование освещения и текстур с драматичнымсодержанием 19. Ключевым элементом этой инновации является использование алгоритма интеллектуальной оптимизации клана слонов (IECO), который черпает вдохновение из социального поведения популяций слонов для преодоления сложных пространственных ограничений в планировке сцен и размещенииосвещения 20,21. Этот класс метаэвристических алгоритмов оказался особенно эффективным в решении задач многоцелевого проектирования, где традиционные методы на основе градиентов не работают.

В более широком контексте литературы системы автоматизированного проектирования (CAD) на базе ИИ уже продемонстрировали повышение эффективности до 20% в архитектурныхрабочих процессах 22,23. В частности, генеративное проектирование на основе ИИ позволяет исследовать нестандартные пространственные топологии, которые было бы невозможно представитьвручную 24. Хотя недавние исследования за последние два года успешно использовали условные GAN (CGAN) для автоматизации генерации 2D-планарных планов этажей и архитектурных пространственных планировок, расширение этих 2D-генеративных принципов на сложные, трёхмерные пространственные требования сценического освещения и дизайна декораций остаётся критически недоизученным. Однако традиционные модели глубокого обучения, такие как сверточные нейронные сети (CNN), часто испытывают трудности с дальними зависимостями, необходимыми для понимания сложных 3D-стадий25,26. Фреймворк GSAD преодолевает эти ограничения, используя визуальные трансформеры (ViT) для извлечения глобальных визуальных признаков и двунаправленных представлений кодировщиков из кодировщиков трансформеров (BERT) для захвата нарративнойсемантики 27,28. Поскольку трансформеры эффективнее захватывают глобальный контекст сцены дизайна, чем локальные фильтры, эти модели обеспечивают более целостное представление пространственныхотношений 29. Такое извлечение элементов с двумя потоками гарантирует, что итоговые сцены не только эстетически согласованны, но и актуальны с точки зрения повествования.

Преимущества подхода GSAD по сравнению с альтернативными методами, такими как механизм глубокого вложения внимания (DL-CBAM),многогранны 30,31. В то время как предыдущие модели улучшали точность распознавания наборов данных по обнаружению движения, эти модели часто требовали больших вычислительных затрат и не обладали возможностями пространственной оптимизации, присущими GSAD. Для сравнения, GSAD достигает точности 98,88% при сохранении количества параметров 1,08 М, обеспечивая оптимальный баланс между сложностью модели и предсказательнымивозможностями 32,33. Такая эффективность критически важна для творческих инструментов в реальном времени, что подтверждается успехом архитектур мобильного масштаба в специализированных проектныхзадачах 34. Это делает фреймворк очень подходящим для профессиональных театральных дизайнеров, создателей цифрового искусства и преподавателей архитектурной инженерии, которым нужны высококачественные и воспроизводимыевизуализации 35.

Кроме того, интеграция GAN для доработки текстур и освещения решает ограничения стандартных диффузионных моделей, которые иногда могут давать «стилистически плоские»выходы 36,37. Используя генератор на основе стиля, фреймворк может синтезировать текстуры высокого разрешения, демонстрирующие как разнообразие, так и художественнуюглубину 38. Используя состязательное обучение, рамка GSAD обеспечивает повышение художественных деталей и визуального реализма до профессиональныхстандартов 39. Такой подход также смягчает этические вопросы, связанные с авторством и предвзятостью, предоставляя контролируемую платформу для сотрудничества «дизайнер в цикле» 40,41. Конечная цель — не заменить человеческую интуицию, а предоставить партнёра для совместной работы, расширяющего творческую свободухудожника 42. По мере того как сфера движется к более погружающим и цифрово интегрированным перформансам, потребность в надёжных, нативных для ИИ протоколах дизайна увеличитсявсего на 43 раза. Следующий протокол предоставляет техническую дорожную карту для реализации фреймворка GSAD, гарантируя, что современный дизайн сценического искусства остаётся одновременно креативным и воспроизводимым.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Вычислительная среда и сбор данных

  1. Настройка системы (Убедитесь, что все вычислительные этапы выполняются на рабочей станции с достаточными возможностями GPU для задач глубокого обучения).
    1. Настройте среду программирования на Python на рабочей станции с достаточными возможностями GPU для симуляции глубокого обучения, которая послужит основой для фреймворка GSAD на рисунке 1.
    2. Установите необходимые зависимости, в частности настройте Python (версия 3.8 или выше) и PyTorch (версия 2.0.1 или выше), а также стандартные библиотеки, необходимые для симуляции глубокого обучения, чтобы обеспечить стабильное выполнение.
    3. Настройте систему управления памятью для обработки изображений высокого разрешения.
  2. Сбор наборов данных
    1. Получите доступ к «Stage Art Design Dataset» из репозитория Kaggle для получения необработанных данных.
      ПРИМЕЧАНИЕ: Изображения состоят из публично лицензированных материалов и оригинальных концептуальных дизайнов, соответствующих стандартам авторского права.
    2. Скачайте набор данных, содержащий 2 500 высококачественных JPG-изображений и соответствующие метаданные.
    3. Проверьте структуру файла, убедившись, что в ней содержатся 2500 изображений высокого разрешения, классифицированных по разным типам сцен, стилям выступлений и культурным фонам, чтобы избежать стилистических предвзятостей.
    4. Применяйте стандартизированные правила аннотирования данных перед обучением. Сопоставьте семантические элементы скриптов (например, «moody lighting») напрямую в конкретные шестигранные цветовые коды и аннотируете параметры освещения с помощью стандартизированных трёхмерных координатных ограничительных рамок (x, y, z) для обеспечения согласованного семантического визуального отображения.

2. Предобработка данных

  1. Нормализация изображения
    1. Выполните Min-Max нормализацию исходных данных изображения для равномерного масштабирования всех значений признаков и повышения стабильности данных.
    2. Применим уравнение 1, чтобы преобразовать исходные значения признаков (M) в нормированные значения (норма M):
      figure-protocol-1(1)
      Где нормапредставляет нормированное значение, M — исходное значение признака, а min(M) и max(M) — минимальное и максимальное значения набора данных соответственно.
    3. Подтвердите, что качество сближения и представления признаков улучшились, сравнив оригинальные изображения с предварительно обработанными изображениями, как показано на рисунке 2.
  2. Семантическая очистка текста
    1. Обрабатывайте текстовые скрипты, связанные с дизайном уровней, чтобы убрать «шум», который может запутать ИИ.
    2. Устраните орфографические опечатки, лишние символы, пунктуацию, стоп-слова и несогласованное форматирование.
    3. Стандартизировать текстовый падеж (строчные) для обеспечения семантическойсогласованности 13. См. таблицу 1 для примеров процесса семантической очистки.
  3. Токенизация
    1. Разделите очищенный текст на меньшие, управляемые единицы, называемые «токенами» (словами или символами).
    2. Убедитесь, что нежелательные компоненты удалены на этом этапе для облегчения точного концептуального анализа моделями ИИ.

3. Извлечение признаков (фреймворк GSAD)

  1. Визуальное извлечение признаков с помощью визуального трансформатора (ViT)
    1. Инициализируйте архитектуру ViT, как показано на рисунке 3 , чтобы обработать 3D-изображения сценического искусства.
    2. Вложение патча: Разделите входное изображение на фиксированные по размеру патчи (визуальные слова) для уменьшения размерности.
    3. Постройте визуальные жетоны (u) и добавьте позиционные вложения (u') с помощью уравнений 2, 3 и 4:
      figure-protocol-2(2)
      figure-protocol-3 (3)
      figure-protocol-4 (4)
      Где figure-protocol-5 представляет собой проецируемый токен патча, k — плоский входной патч, w c — линейная матрица веса проекции, u — развернутая последовательность патча, — позиционное вложение, добавленное для сохранения пространственной информации, а dk — добавленный классификационный токен.
      ПРИМЕЧАНИЕ: См. Таблицу 2 для подробного описания переменных ViT, таких как размер патча (O) и размерность проекции (d).
    4. Transformer Encoder: Введите обработанные токены в Transformer Encoder. Используйте механизмы самосознания для выявления корреляций между различными участками изображения (например, освещение и фон).
    5. Примените функции нормализации и активации с помощью уравнений 5–8 для получения окончательной карты признаков:
      figure-protocol-6(5)
      figure-protocol-7(6)
      figure-protocol-8(7)
      figure-protocol-9(8)
      Где u' — нормализованная последовательность токенов, RL представляет веса самовнимания, полученные из запросов R и L SC ключей (с коэффициентом масштабирования SC), w — выход внимания, вычисленный с использованием значений U, а линейные (w) и GeLU (w) обозначают преобразования внутри прямой сети.
    6. Визуализируйте карту функций выхода, которая выделяет ключевые элементы дизайна и снижает шум, как показано на рисунке 4.
  2. Извлечение текстовых признаков с помощью BERT
    1. Инициализировать модель BERT (двунаправленные представления кодировщиков от трансформеров) для обработки скриптов стадии.
    2. Преобразуйте письменные записи естественного языка в непрерывные векторы с помощью вложения слов для захвата семантического значения. См. таблицу 3 для структуры извлечения объектов.
    3. Объединяйте вложения токенов, сегментных и позиционных вложений в качестве входных данных для кодировщика.
    4. Выполните шаги блока трансформатора энкодера (Multi-Head Attention, Add & Norm, Feed Forward), как показано на рисунке 5 , чтобы создать контекстуализированные последовательности токенов.
    5. Соедините выходные контекстуализированные последовательности токенов (из BERT) с визуальными картами признаков (из ViT). Подайте эти объединённые мультимодальные данные как прямой условный входной вектор в модуль уточнения GAN на шаге 4.
  3. Начальная генерация концепции
    1. Введите извлечённые текстовые признаки (из BERT) и визуальные особенности (из ViT) в Модель диффузии.
    2. Генерируйте начальные 2D концептуальные этапные проекты на основе интегрированных мультимодальных функций.
    3. Передайте эти начальные 2D-концепции в качестве базовых входных данных в Generative Adversarial Network (GAN) на шаге 4 для дальнейшей доработки текстур и освещения.

4. Доработка текстур и освещения с помощью GAN

  1. Настройка генеративной состязательной сети (GAN)
    1. Постройте модуль уточнения GSAD, состоящий из генератора (H) и дискриминатора (C), как показано на рисунке 6.
    2. Настройте Дискриминатора так, чтобы различать реальные сценические изображения от сгенерированных, а генератор — для создания реалистичных текстур и освещения.
  2. Обучение и оптимизация
    1. Определим целевую функцию для условного GAN (CGAN) с помощью уравнения 9 для введения переменных условий (y) для лучшей стабильности:
      figure-protocol-10 (9)
      Где x — это условие проектирования входной стадии, y — вещественное целевое изображение, z — вектор случайного шума, G — генератор, а D — дискриминатор.
    2. Для улучшения изображения при слабой освещённости примените уравнение 10 для оптимизации выхода изображения при усиленном освещении (низкий уровень H Low):
      figure-protocol-11 (10)
      Где U(C, H) представляет собой функцию целевого значения, H — сеть генератора, C — дискриминаторная (критический) сеть, w — реальные данные, взятые из данных распределения O, y — входное условие, z — условная переменная шума, qha — реальные высококачественные изображения стадии, а HLow — выход генератора от входов при слабом освещении.
    3. Примените адаптивную модуляцию к преобразованию признаков с помощью уравнения 11:
      figure-protocol-12 (11)
      Где hEi(w) представляет отображение признаков на уровне i, AM обозначает адаптивную модуляционную функцию с изученными параметрами αi и βi, figure-protocol-13 — вес слоя, а — смещение.
    4. Реализуйте пропускные соединения и пуловые слои в генеративной сети с помощью уравнений 12 и 13 для сохранения пространственных деталей:
      figure-protocol-14(12)
      figure-protocol-15 (13)
      Где Skip(w) обозначает признаки, сохраняющиеся через пропускные соединения из сверточных блоков hE, а Hjw — выходную карту признаков после максимального пула на этапах энкодера (0 < j ≤ 3).
  3. Реконструкция изображения
    1. Выполните апсэмплинг и конкатенацию на фазе декодирования с использованием уравнений 14 и 15:
      figure-protocol-16(14)
      figure-protocol-17 (15)
      Где up(w) обозначает апдискретные признаки, соединённые с соответствующими соединениями skip(w), v°Hj-1(w) обозначает совокупный вход на каскады декодера (4 < j ≤7), а hout(w) — финальное уточнённое изображение стадии, генерируемое с помощью функции активации сигмовидного слоя с использованием весов последнего слоя X8 и смещения a 8.
    2. Сгенерируйте итоговый уточнённый выход изображения с помощью функции активации сигмовидной фигуры в уравнении 16:
      figure-protocol-18(16)
    3. Следуйте итеративной процедуре обучения, описанной в Алгоритме 1 (Псевдокод GAN-Texture Lighting Refinement)
  4. .

Алгоритм 1: Псевдокод уточнения освещения GAN-текстур
Входы: изображение сценического искусства при слабом освещении H(low), количество обучающих итераций N, размер партии B
Вывод: Улучшенное изображение с улучшением H
1: Инициализировать генератор с параметрами H
2: Инициализация дискриминатора с параметрами C
3: скорость обучения figure-protocol-19
4: условная переменная z (необязательно для GAN)
5: Параметры адаптивной модуляции αi и βi
6: Пропуск списка соединений (w)
7: для итерации = 1 до F do
Обучение дискриминаторов
8: Возьмите пример реальных изображений figure-protocol-20
9: Сэмплировать партию шума/случайных изображений при слабой освещённости
10: Если CGAN, добавить условную переменную z к входным данным
Генерируйте фейковые изображения
Вычисление потери дискриминатора
Обновление параметров дискриминатора
Обучение генератора
Генерируйте фейковые изображения
Потери генератора вычислений
Обновление параметров генератора
для j = 1 до 3 do

figure-protocol-21

figure-protocol-22

конец для
11: Свертка узкого места
12: Декодер/апсэмплинг
для j = 5 до 7 do

figure-protocol-23

конец для
13: Выходной слой

figure-protocol-24

14: конец для
15: возврат улучшений H и C

5. Оптимизация планировки стадий (IECO)

  1. Инициализация IECO
    1. Инициализировать алгоритм интеллектуальной оптимизации клана слонов (IECO) для оптимизации пространственного расположения элементов стадий.
    2. Определите популяцию «слонов» (представляющих возможные решения для проектирования) и связанные с ними кланы. См. рисунок 7 для блок-схемы IECO.
  2. Передвижение и эволюция
    1. Рассчитайте независимое движение каждого слона, чтобы исследовать пространство проектирования, используя уравнения 17 и 18:
      figure-protocol-25 (17)
      figure-protocol-26 (18)
      где представляет прирост движения, figure-protocol-27 рассчитанный с помощью коэффициента случайного распределения r, ограниченного между минимальным (figure-protocol-28) и максимальным (figure-protocol-29) шагом, а figure-protocol-30 — обновлённое независимое пространственное положение слона.
    2. Уменьшайте диапазон движения со временем с помощью уравнения 19 для облегчения сходимости по мере улучшения решения.
    3. Обновление матриарха: Обновите позицию главы клана (матриарх) в отношении лучшего решения в мире с помощью Уравнения 20:
      figure-protocol-31 (19)
      Где figure-protocol-32 представляет собой обновлённое положение матриарха, figure-protocol-33 — взвешенное текущее положение, figure-protocol-34 — лучшее в мире решение для раскладки, найдённое на данный момент, и β действует как фактор масштаба, контролирующий влияние лучшего решения.
    4. Обновление по самцам слонов: Обновите позиции самцов слонов относительно центра клана с помощью уравнений 21 и 22:
      figure-protocol-35 (20)
      figure-protocol-36 (21)
      Где figure-protocol-37 представляет обновлённое положение самца слона, figure-protocol-38 — его текущее эталонное положение, XCenterjs — центральное положение клана семьи, рассчитанное из всех мужских членов, Md — общее число мужчин в клане, а r и p — вероятности случайного распределения, направляющие движение к центру клана.
  3. Замена населения
    1. Рассчитать Clan Center: Во-первых, оценить соответствие решений для планировки. Затем вычислите центральное положение (figure-protocol-39) каждого клана семьи с помощью уравнения 22, где Mf — число членов семьи:
      figure-protocol-40 (22)
    2. Замена взрослых слонов: Для увеличения скорости сходимости замените менее качественных «взрослых слонов» (решения) на более эффективных, созданных из центра клана. Примените уравнение 23 для вычисления новой позиции (figure-protocol-41):
      figure-protocol-42(23)
      Где figure-protocol-43 представляет центральное положение взрослого слона, Mf — количество взрослых членов семьи, figure-protocol-44 обозначает недавно рассчитанную замену для низшего взрослого слона, figure-protocol-45 — это опорное положение, которое заменяется, а figure-protocol-46 и figure-protocol-47 — высшие позиции внутри клана, используемые для управления процессом замены с целью ускорения сходимости.
      (ПРИМЕЧАНИЕ: Здесь figure-protocol-48 и figure-protocol-49 представляют промежуточные взвешенные позиции, используемые для руководства заменой.)
    3. Замена молодых слонов: чтобы предотвратить локальные оптимуми и сохранить разнообразие, замените самых слабых «молодых слонов» (figure-protocol-50). Обновите позиции этих элементов с помощью уравнения 24:
      figure-protocol-51 (24)
      Где figure-protocol-52 обозначает текущее положение самого слабого молодого слона, а figure-protocol-53 — его новообразованное положение. Эта замена осуществляется случайным множителем r и верхними членами клана, чтобы предотвратить попадание процесса оптимизации в локальный оптимум и сохранить пространственное разнообразие.
    4. Прекращение: Объединить обновлённые кланы, пересчитать приспособленность и повторить цикл оптимизации, пока не будут выполнены критерии завершения, описанные в Алгоритме 2.

Алгоритм 2: Псевдокод IECO для оптимизации планировки сцен и размещения освещения
Вход: Размер популяции M:, максимальные итерации Xмаксимум:
Вывод: оптимальная планировка сцены и расположение освещения
Инициализация слоновьих кланов с случайными положениями (планировка сцены + параметры освещения)
Оцените приспособленность каждого слона
Для t = 1 до X максимум:
Для каждого клана:
Определите матриарха (лучший слон), самцов слонов и молодых независимых от слонов Движение
Для каждого слона:
Прирост вычисления движенияΔX max
Обновление независимой позиции figure-protocol-54
Уменьшить дальность передвижения по сравнению с итерациями
Обновление матриарха

figure-protocol-55

Для каждой матриархи:
Обновление позиции к мировому лучшему
Обновление о самце слонов

figure-protocol-56

figure-protocol-57

Для каждого самца слона
Вычислите центр клана и обновите положение к центру с помощью взрослой замены

figure-protocol-58

figure-protocol-59

Вычислите центр клана взрослых
Заменить взрослых взрослых на превосходных мелких слонов

figure-protocol-60

Заменить самых слабых молодых слонов для сохранения разнообразия
Объединить обновлённые кланы, пересчитать приспособленность всех слонов и обновить лучшее решение в мире
Вернуть лучшую в мире планировку сцены и освещение

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Экспериментальная настройка и аналитический рабочий процесс, описанные на рисунках 17 и таблицах 13, обеспечили прочную основу для предварительной обработки данных, извлечения признаков и оптимизации макета фреймворка GSAD.

Динамика обучения модели и сходимость
Экспериментальная оценка фреймворка GSAD дала значительные количественные и качественные данные об её эффект...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Основной вклад этого исследования — разработка воспроизводимого рабочего процесса с помощью ИИ, который стандартизирует концептуализацию сценического арт-дизайна 2,10. Сосредоточившись на фреймворке GSAD, авторы предлагают структурированную методологию, преодолевающую ограничения ручного идейного составления и субъективной интерпретации, распространённые в традиционной сценографии. Критически важным шагом в протоколе является инт...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего раскрывать.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Автор выражает искреннюю благодарность коллегам из Шанхайского политехнического института Минхан за содержательную обратную связь и техническую помощь при разработке и реализации рамочной структуры GSAD. Особая благодарность сообществу open-source за предоставление необходимых вычислительных инструментов и публичных наборов данных, которые способствовали обучению и валидации мультимодальных моделей ИИ, используемых в этом протоколе. Я также благодарен коллегам, которые дали конструктивные предложения по первоначальным черновикам этой работы. Это исследование не получило конкретных грантов от фондов в государственном, коммерческом или некоммерческом секторе.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
BERT (Двунаправленные представления кодировщиков от трансформеров)Трансформеры с объятием лицаОткрытый исходный код
Язык программирования PythonФонд программного обеспечения PythonВерсия 3.8 или выше
Фреймворк глубокого обучения PyTorchLinux Foundation / Meta AIВерсия 2.0.1 или выше
Набор данных по дизайну сценического искусстваРепозиторий KaggleОбщедоступно
Реализация Vision Transformer (ViT)Модели изображения PyTorch (timm)Открытый исходный код
Рабочая станция с возможностями GPUN/A (стандартное оборудование)Н/Д

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Masters, P. The history and theory of environmental scenography. Theatre Perform Des. 5 (3-4), 317-319 (2019).
  2. Lotker, S., Gough, R. On scenography: editorial. Perform Res. 18 (3), 3-6 (2013).
  3. Goldschmidt, G. The dialectics of sketching. Creat Res J. 4 (2), 123-143 (1991).
  4. Tversky, B. What do sketches say about thinking. , (2002).
  5. Baugh, C. . Theatre, performance and technology: the development and transformation of scenography. , (2013).
  6. Müller, M., Montag, C. Disentangling the link between creativity and technology use: individual differences in smartphone and social media (over)use. J Creat. 34 (2), 100081 (2024).
  7. Amankwah-Amoah, J., Abdalla, S., Mogaji, E., Elbanna, A., Dwivedi, Y. K. The impending disruption of creative industries by generative AI: opportunities, challenges, and research agenda. Int J Inf Manage. 79, 102759 (2024).
  8. Zhang, H., Zhang, R. Generative artificial intelligence (AI) in built environment design and planning: a state-of-the-art review. Prog Eng Sci. 2 (1), 100040 (2025).
  9. Cetinic, E., She, J. Understanding and creating art with AI: review and outlook. ACM Trans Multimed Comput Commun Appl. 18 (2), 66 (2022).
  10. Aronson, A., Palmer, S., McKinney, J., Benedetto, S. A. D. . The history and theory of environmental scenography. , (2018).
  11. Anantrasirichai, N., Bull, D. Artificial intelligence in the creative industries: a review. Artif Intell Rev. 55 (1), 589-656 (2022).
  12. Corvello, V. Generative AI and the future of innovation management: a human-centered perspective and an agenda for future research. J Open Innov Technol Mark Complex. 11 (1), 100456 (2025).
  13. Mazzone, M., Elgammal, A. Art, creativity, and the potential of artificial intelligence. Arts. 8 (1), 26 (2019).
  14. Kadenhe, N., Al Musleh, M., Lompot, A. Human-AI co-design and co-creation: a review of emerging approaches, challenges, and future directions. Proc AAAI Symp Ser. 6 (1), 265-270 (2025).
  15. Santoso, B., Wijayanti, R. Human-AI collaboration in creative industries: workflows in media production and community-driven platforms. Trans Artif Intell Mach Learn Cogn Syst. 9 (11), 11-26 (2024).
  16. Candy, L., Edmonds, E. Practice-based research in the creative arts: foundations and futures from the front line. Leonardo. 51 (1), 63-69 (2018).
  17. Peckham, O., Raines, J., Bulsink, E., Goudswaard, M., Gopsill, J., Barton, D., et al. Artificial intelligence in generative design: a structured review of trends and opportunities in techniques and applications. Designs. 9 (4), 79 (2025).
  18. Hegab, H., Khanna, N., Monib, N., Salem, A. Design for sustainable additive manufacturing: a review. Sustain Mater Technol. 35, e00576 (2023).
  19. Reed, S., Akata, Z., Yan, X., Logeswaran, L., Schiele, B., Lee, H., et al. Generative adversarial text-to-image synthesis. , 1060-1069 (2016).
  20. Wang, G. G., Deb, S., Coelho, L. D. S. Elephant herding optimization. , 1-5 (2015).
  21. Strumberger, I., Beko, M., Tuba, M., Minovic, M., Bacanin, N. . Elephant herding optimization algorithm for wireless sensor network localization problem. , (2018).
  22. Ploennigs, J., Berger, M. AI art in architecture. AI Civ Eng. 2 (1), 8 (2023).
  23. Zhang, L., Pan, Y., Wu, X., Skibniewski, M. J. . Artificial intelligence in construction engineering and management. , (2021).
  24. Chaillou, S. . Artificial intelligence and architecture: from research to practice. , (2022).
  25. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. , 6000-6010 (2017).
  26. Li, Y., Xu, W. A deep learning-based framework for intelligent modeling: from architectural sketch to 3D model. Front Archit Res. 14 (6), 1567-1584 (2025).
  27. Dosovitskiy, A. An image is worth 16×16 words: transformers for image recognition at scale. arxiv. , (2020).
  28. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: pre-training of deep bidirectional transformers for language understanding. , (2019).
  29. Han, K., Wang, Y., Chen, H., Chen, X., Guo, J., et al. A survey on vision transformer. IEEE Trans Pattern Anal Mach Intell. 45 (1), 87-110 (2022).
  30. Woo, S., Park, J., Lee, J. Y., Kweon, I. S. CBAM: convolutional block attention module. , (2018).
  31. Qi, X., Zhi, M. A review of attention mechanisms in computer vision. , (2023).
  32. Howard, A., Sandler, M., Chen, B., Wang, W., Chen, L. C., et al. Searching for MobileNetV3. , (2019).
  33. Mehta, S., Rastegari, M. MobileViT: light-weight, general-purpose, and mobile-friendly vision transformer. arxiv. , (2021).
  34. Tan, M., Le, Q. EfficientNet: rethinking model scaling for convolutional neural networks. , (2019).
  35. Liao, W. J., Tang, C. H. Teaching strategies and practices that facilitate the development of design concepts in architectural engineering education. SAGE Open. 13 (3), 21582440231196376 (2023).
  36. Goodfellow, I. J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., et al. Generative adversarial nets. , 2672-2680 (2014).
  37. Dhariwal, P., Nichol, A. Diffusion models beat GANs on image synthesis. , (2021).
  38. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , (2019).
  39. Isola, P., Zhu, J. Y., Zhou, T., Efros, A. A. Image-to-image translation with conditional adversarial networks. , (2017).
  40. Amershi, S., Weld, D., Vorvoreanu, M., Fourney, A., Nushi, B., et al. Guidelines for human-AI interaction. , 3 (2019).
  41. Xiao, Y., Lin, X., Ji, T., Qiao, J., Ma, B., Gong, H. AI-assisted design: intelligent generation of Dong paper-cut patterns. Electronics. 14 (9), 1804 (2025).
  42. Runco, M. A. . Creativity: research, development, and practice. , (2023).
  43. Plate, D., Hutson, J. Composition pedagogy as AI-native coding: from design kit to scholarly framework. World J Arts. 2 (11), 1-10 (2025).
  44. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , 4396-4405 (2019).
  45. Berryman, J. Creativity and style in GAN and AI art: some art-historical reflections. Philos Technol. 37 (2), 61 (2024).
  46. Yan, S., Wu, C., Zhang, Y. Generative design for architectural spatial layouts: a review of technical approaches. J Asian Archit Build Eng. , 1-21 (2025).
  47. Deng, Y., Zhai, Q. Integrating deep learning in art and design: computational techniques for enhancing creative expression. Int J Adv Comput Sci Appl. 16 (2), 175-183 (2025).
  48. Mirjalili, S. The ant lion optimizer. Adv Eng Softw. 83, 80-98 (2015).
  49. Lian, Q. Optimization of image recognition technology for dance theatre creation and evaluation of its effectiveness. J Comb Math Comb Comput. 127, 1653-1665 (2025).
  50. Avila, C., Ilbay, D., Rivera, D. Human-AI teaming in structural analysis: a model context protocol approach for explainable and accurate generative AI. Buildings. 15 (17), 3190 (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи