Artículo de método

Un flujo de trabajo reproducible asistido por IA para el desarrollo de conceptos en el diseño de arte escénico y la optimización de iluminación a través del marco GSAD

DOI:

10.3791/70737

12 de mayo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aquí, los autores presentan un protocolo para implementar el marco de diseño de arte generativo en etapas (GSAD), un flujo de trabajo impulsado por IA que integra modelos de difusión, redes generativas adversariales (GANs) y optimización inteligente del clan elefante (IECO) para estandarizar la transición de scripts narrativos a conceptos visuales 3D optimizados.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La inteligencia artificial (IA) está transformando fundamentalmente los procesos creativos de diseño al permitir una ideación rápida y una visualización consistente, especialmente en el arte escénico y la escenografía. Sin embargo, los flujos de trabajo existentes siguen dependiendo en gran medida del boceto manual y la interpretación subjetiva, lo que limita la escalabilidad y reduce la reproducibilidad entre equipos de diseño. Esta carencia subraya la necesidad de un marco estructurado de diseño de arte generativo en etapas (GSAD) asistido por IA que integre técnicas de aprendizaje profundo, modelado generativo y optimización para apoyar el desarrollo sistemático y repetible de conceptos. El objetivo principal del marco GSAD es combinar modelos de difusión para la generación inicial de conceptos, redes generativas adversariales (GANs) para el refinamiento de texturas e iluminación, y optimización inteligente de clanes de elefantes (IECO) para optimizar la disposición del escenario y la colocación de la iluminación. El Conjunto de Datos de Diseño de Arte Escénico, que comprende 2.500 imágenes de alta resolución, incluye guiones teatrales anotados, diagramas de iluminación y diseños 3D para facilitar el aprendizaje multimodal. La evaluación experimental demuestra mejoras sustanciales en las métricas cualitativas, incluyendo una mayor alineación semántica entre el contenido del guion y los elementos visuales generados, y una mayor eficiencia en la optimización del diseño lograda mediante análisis espaciales impulsados por IECO. Implementar el framework en un entorno basado en Python resultó en una precisión predictiva del 98,88%, 26,58 mega operaciones de punto flotante por segundo (MFPOs) y una cantidad de parámetros de 1,08 M. El marco GSAD presenta un flujo de trabajo asistido por IA escalable, reproducible y técnicamente robusto que mejora la producción creativa, garantiza la coherencia visual y apoya el desarrollo eficiente de conceptos en el diseño artístico escénico moderno.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El diseño artístico escénico es un campo multidisciplinar complejo que integra escenografía, iluminación, diseño de escenografía y narración espacial 1,2. Históricamente, el desarrollo de conceptos escénicos se ha basado en la ingeniosidad humana expresada a través de modelos físicos, bocetos dibujados a mano, mood boards y sesiones iterativas de lluviade ideas 3,4. Esta evolución ha sido profundamente moldeada por la tensión entre la visión artística y las limitaciones materiales del espacio de la performance5. A medida que los requisitos de rendimiento se vuelven cada vez más sofisticados, la demanda de generación de conceptos eficiente, visualmente rica y rápida ha superado a los flujos de trabajo manualestradicionales 6,7. La aparición de la inteligencia artificial generativa (GenAI) y los grandes modelos de lenguaje (LLMs) ofrece un camino transformador para aumentar el proceso creativo, facilitando la ideación y cocreación de diseño en arquitectura y entretenimiento 8,9.

La escenografía tradicional a menudo se encuentra con una brecha semántica donde las emociones abstractas de un guion teatral luchan por encontrar un equivalente visual preciso sin un extenso ensayo y error 2,10. Las herramientas actuales de IA en las industrias creativas permiten la búsqueda y recombinación flexible de fotos de referencia, aunque muchas carecen del rigor estructural necesario para la producción teatralprofesional 11,12. Además, la naturaleza subjetiva de la evaluación estética a menudo dificulta alinear los resultados generados por máquinas con la intención narrativaespecífica 13. Este cambio de flujos de trabajo manuales basados en la experiencia a la colaboración humano-IA basada en datos se está convirtiendo en una característica definitoria de la práctica de diseño del sigloXXI 14,15. La integración de estas herramientas computacionales requiere una nueva forma de investigación "basada en la práctica" que sirve de puente entre el desarrollo de herramientas digitales y el rendimiento envivo 16. Estudios recientes enfatizan que los sistemas de IA pueden facilitar la lluvia de ideas y la exploración amplia de alternativas, pero la transición de la ideación 2D a la realización optimizada en 3D sigue siendo técnicamentedesafiante 9.

El marco de diseño de arte generativo en etapas (GSAD) abordó estas carencias estableciendo un flujo de trabajo repetible asistido por IA17,18. La razón de este marco radica en la necesidad de automatizar los componentes de diseño preservando la integridad artística de la narrativa original. Al integrar sistemas de IA multimodales, los diseñadores pueden iterar rápidamente tanto visual como verbalmente, asegurando que los refinamientos de iluminación y texturas estén alineados semánticamente con el contenidodramático 19. Un componente fundamental de esta innovación es el uso del algoritmo de optimización inteligente de clanes de elefantes (IECO), que se inspira en el comportamiento social de las poblaciones de elefantes para navegar restricciones espaciales complejas en la disposición de los escenarios y la colocación de lailuminación 20,21. Esta clase de algoritmos metaheurísticos ha demostrado ser especialmente eficaz para resolver problemas de diseño multiobjetivo donde los métodos tradicionales basados en gradientes fallan.

En el contexto más amplio de la literatura, los sistemas de diseño asistido por ordenador (CAD) impulsados por IA ya han demostrado mejoras de eficiencia de hasta el 20% en flujos de trabajo arquitectónicos22,23. En concreto, el diseño generativo impulsado por IA permite explorar topologías espaciales no estándar que serían imposibles de concebir manualmente24. Aunque estudios recientes de los últimos dos años han utilizado con éxito las GANs condicionales (CGANs) para automatizar la generación de planos planos 2D y la distribución espacial arquitectónica, extender estos principios generativos 2D a los complejos requisitos espaciales tridimensionales de la iluminación escénica y el diseño de escenografía sigue siendo críticamente poco explorado. Sin embargo, los modelos tradicionales de aprendizaje profundo, como las redes neuronales convolucionales (CNN), a menudo tienen dificultades con las dependencias a largo alcance necesarias para comprender disposiciones complejas de etapas3D 25,26. El marco GSAD supera estas limitaciones utilizando transformadores de visión (ViT) para extraer características visuales globales y representaciones bidireccionales de codificadores de transformadores (BERT) para capturar semánticanarrativa 27,28. A medida que los transformadores capturan el contexto global de una escena de diseño de forma más eficaz que los filtros locales, estos modelos proporcionan una representación más holística de las relacionesespaciales 29. Esta extracción de características de doble flujo garantiza que los diseños de fases resultantes no solo sean estéticamente consistentes, sino también relevantes narrativamente.

Las ventajas del enfoque GSAD frente a técnicas alternativas, como el mecanismo de atención de embedding convolucional profundo (DL-CBAM), sonmultifacéticas 30,31. Aunque los modelos anteriores mejoraron la precisión del reconocimiento en conjuntos de datos de detección de movimiento, estos modelos a menudo requerían una mayor sobrecarga computacional y carecían de las capacidades de optimización espacial que se encuentran en GSAD. En contraste, GSAD logra una tasa de precisión del 98,88% manteniendo un conteo de parámetros de 1,08 M, logrando un equilibrio óptimo entre la complejidad del modelo y la capacidadpredictiva 32,33. Dicha eficiencia es fundamental para las herramientas creativas en tiempo real, como demuestra el éxito de las arquitecturas a escala móvil en tareas de diseñoespecializadas 34. Esto hace que el marco sea muy adecuado para diseñadores teatrales profesionales, creadores de arte digital y docentes de ingeniería arquitectónica que requieren visualizaciones de alta fidelidady reproducibles.

Además, la integración de GANs para el refinamiento de texturas e iluminación aborda las limitaciones de los modelos de difusión estándar, que a veces pueden producir salidas "estilísticamente planas" 36,37. Utilizando un generador basado en estilos, el framework puede sintetizar texturas de alta resolución que muestran tanto variedad como profundidad artística38. Mediante el uso de formación adversarial, el marco GSAD garantiza que los detalles artísticos y el realismo visual se mejoren hasta alcanzar estándaresprofesionales 39. Este enfoque también mitiga las preocupaciones éticas sobre la autoría y el sesgo al proporcionar una plataforma de colaboración controlable y "diseñadora en el bucle"40,41. El objetivo final no es reemplazar la intuición humana, sino proporcionar un socio colaborativo que amplíe la agencia creativa delartista 42. A medida que el campo avanza hacia rendimientos más inmersivos e integrados digitalmente, la necesidad de protocolos de diseño robustos y nativos de IA soloaumentará en 43 años. El siguiente protocolo proporciona la hoja de ruta técnica para implementar el marco GSAD, asegurando que el diseño artístico escénico moderno siga siendo tanto imaginativo como reproducible.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Entorno computacional y adquisición de datos

  1. Configuración del sistema (Asegurarse de que todos los pasos computacionales se realicen en una estación de trabajo con suficientes capacidades GPU para tareas de aprendizaje profundo).
    1. Configurar un entorno de programación en Python en una estación de trabajo con suficientes capacidades de GPU para simulación de aprendizaje profundo que sirva como base para el marco GSAD en la Figura 1.
    2. Instala las dependencias necesarias, específicamente configurando Python (versión 3.8 o superior) y PyTorch (versión 2.0.1 o superior), junto con las bibliotecas estándar necesarias para la simulación de aprendizaje profundo para asegurar una ejecución consistente.
    3. Configura el sistema de gestión de memoria para gestionar el procesamiento de imágenes de alta resolución.
  2. Colección de conjuntos de datos
    1. Accede al "Stage Art Design Dataset" del repositorio de Kaggle para obtener los datos en bruto.
      NOTA: Las imágenes comprenden materiales con licencia pública y diseños conceptuales originales para cumplir con los estándares de derechos de autor.
    2. Descarga el conjunto de datos que contiene 2.500 imágenes JPG de alta resolución y los metadatos asociados.
    3. Verifica la estructura del archivo, asegurándote de que contenga 2.500 imágenes de alta resolución categorizadas por diferentes tipos de etapa, estilos de interpretación y contextos culturales para evitar sesgos estilísticos.
    4. Aplica reglas estandarizadas de anotación de datos antes de entrenar. Mapea elementos semánticos del guion (por ejemplo, 'iluminación atmosférica') directamente a códigos de color hexadecimales específicos y anota parámetros de iluminación usando cuadros delimitados 3D estandarizados (x, y, z) para asegurar un mapeo semántico a visual consistente.

2. Preprocesamiento de datos

  1. Normalización de imagen
    1. Realizar la Normalización Min-Max en los datos de imagen en bruto para escalar todos los valores de las características de forma uniforme y mejorar la estabilidad de los datos.
    2. Aplicar la Ecuación 1 para transformar los valores originales de las características (M) en valores normalizados (norma M):
      figure-protocol-1(1)
      Donde lanormarepresenta el valor normalizado, M es el valor original de la característica, y min(M) y max(M) son los valores mínimo y máximo del conjunto de datos, respectivamente.
    3. Confirmar que la convergencia y la calidad de representación de características han mejorado comparando las imágenes originales con las imágenes preprocesadas, como se muestra en la Figura 2.
  2. Limpieza semántica de texto
    1. Procesa los scripts textuales asociados con los diseños de los niveles para eliminar el "ruido" que podría confundir a la IA.
    2. Elimina errores ortográficos, símbolos superfluos, puntuación, palabras clave y formatos inconsistentes.
    3. Estandariza el texto en mayúsculas minúsculas para asegurar la consistenciasemántica 13. Consulte la Tabla 1 para ejemplos del proceso de limpieza semántica.
  3. Tokenización
    1. Divide el texto limpiado en unidades más pequeñas y manejables llamadas "tokens" (palabras o caracteres).
    2. Asegúrese de que los componentes indeseables se eliminen durante este paso para facilitar un análisis conceptual preciso por parte de los modelos de IA.

3. Extracción de características (marco GSAD)

  1. Extracción de características visuales usando transformador de visión (ViT)
    1. Inicializa la arquitectura ViT tal como se muestra en la Figura 3 para procesar las imágenes de arte escénico 3D.
    2. Incrustación de parches: Divide la imagen de entrada en parches de tamaño fijo (palabras visuales) para reducir la dimensionalidad.
    3. Construye las fichas visuales (u) y añade incrustaciones posicionales (u') usando las Ecuaciones 2, 3 y 4:
      figure-protocol-2(2)
      figure-protocol-3 (3)
      figure-protocol-4 (4)
      Donde figure-protocol-5 representa el token de parche proyectado, k es el parche de imagen de entrada aplanado, wc es la matriz de peso de proyección lineal, u es la secuencia de parches desenrollados, es la incrustación posicional añadida para conservar la información espacial, y dk es el token de clasificación añadido.
      NOTA: Consulte la Tabla 2 para una descripción detallada de las variables ViT como el tamaño del parche (O) y la dimensión de proyección (d).
    4. Codificador de Transformadores: Alimenta los tokens procesados en el Codificador de Transformadores. Utiliza mecanismos de autoatención para identificar correlaciones entre diferentes parches de imagen (por ejemplo, iluminación vs. fondo).
    5. Aplicar funciones de normalización y activación usando las ecuaciones 5 a 8 para generar el mapa final de características:
      figure-protocol-6(5)
      figure-protocol-7(6)
      figure-protocol-8(7)
      figure-protocol-9(8)
      Donde u' es la secuencia de tokens normalizados, RL representa los pesos de auto-atención derivados de las consultas R y L de claves SC (con factor de escalado SC), w es la salida de atención calculada usando valores de U y lineal (w) y GeLU (w) denotan las transformaciones dentro de la red de avance de alimentación.
    6. Visualiza el mapa de características de salida, que resalta elementos clave de diseño y reduce el ruido, como se muestra en la Figura 4.
  2. Extracción de características textuales usando BERT
    1. Inicializa el modelo BERT (representaciones bidireccionales del codificador desde transformadores) para procesar los scripts de etapa.
    2. Convierte los scripts del lenguaje natural en vectores continuos usando incrustación de palabras para capturar el significado semántico. Consulte la Tabla 3 para la estructura de extracción de características.
    3. Combina incrustaciones de token, incrustaciones de segmento y incrustaciones posicionales como entradas para el codificador.
    4. Ejecuta los pasos de la unidad del codificador del transformador (Atención Multi-Cabeza, Añadir y Normalizar, Avanzar Alimentación) como se ilustra en la Figura 5 para crear secuencias contextualizadas de tokens.
    5. Concatena las secuencias de tokens contextualizadas de salida (de BERT) con los mapas visuales de características (de ViT). Introduce estos datos multimodales fusionados como vector de entrada condicional directo al módulo de refinamiento GAN en el Paso 4.
  3. Generación inicial de conceptos
    1. Introduce las características textuales extraídas (de BERT) y las características visuales (de ViT) en el Modelo de Difusión.
    2. Generar diseños iniciales de etapas conceptuales 2D basados en las características multimodales integradas.
    3. Pasa estos conceptos 2D iniciales como entradas base a la Red Generativa Adversarial (GAN) en el Paso 4 para un mayor refinamiento de texturas e iluminación.

4. Refinamiento de texturas e iluminación usando GAN

  1. Configuración de red generativa adversarial (GAN)
    1. Construyan el módulo de refinamiento GSAD que consiste en un Generador (H) y un Discriminador (C) como se muestra en la Figura 6.
    2. Configura el Discriminador para distinguir entre imágenes reales del escenario y las generadas, y el Generador para crear texturas e iluminación realistas.
  2. Entrenamiento y optimización
    1. Defina la función objetivo para la GAN condicional (CGAN) usando la Ecuación 9 para introducir las variables de condición (y) y así mejorar la estabilidad:
      figure-protocol-10 (9)
      Donde x representa la condición de diseño de la etapa de entrada, y es la imagen objetivo real, z representa el vector de ruido aleatorio, G es el generador y D es el discriminador.
    2. Para la mejora de imagen en baja luz, aplica la Ecuación 10 para optimizar la salida de imagen mejorada por luz (Hbajo):
      figure-protocol-11 (10)
      Donde U(C, H) representa la función de valor objetivo, H es la red generadora, C es la red discriminadora (crítica), w representa datos reales muestreados de los datos de distribución O, y es la condición de entrada, z es la variable de ruido condicional, qha representa las imágenes reales de alta calidad de la etapa y HLow denota la salida del generador proveniente de entradas de poca luz.
    3. Aplicar modulación adaptativa a la transformación de características usando la Ecuación 11:
      figure-protocol-12 (11)
      Donde hE i(w) representa el mapa de características en la capa i, AM denota la función de modulación adaptativa con parámetros aprendidos αi y βi, figure-protocol-13 es el peso de la capa y es el sesgo.
    4. Implementa conexiones de salto y capas de agrupación en la red generativa usando las Ecuaciones 12 y 13 para preservar los detalles espaciales:
      figure-protocol-14(12)
      figure-protocol-15 (13)
      Donde Skip(w) denota las características preservadas mediante conexiones de salto desde los bloques convolucionales hE, y Hjw representa el mapa de características de salida tras el pool máximo en las etapas del codificador (0 < j ≤ 3).
  3. Reconstrucción de la imagen
    1. Realiza el muestreo adicional y la concatenación en la fase de decodificación usando las Ecuaciones 14 y 15:
      figure-protocol-16(14)
      figure-protocol-17 (15)
      Donde up(w) representa las características remuestreadas concatenadas con las correspondientes conexiones skip(w), v°Hj-1(w) denota la entrada combinada a las etapas decodificadoras (4 < j ≤7), y hout(w) es la imagen final refinada generada mediante la función de activación sigmoide, utilizando los pesos X8 y el sesgo a 8 de la capa final.
    2. Genera la salida final refinada de la imagen usando la función de activación sigmoide en la Ecuación 16:
      figure-protocol-18(16)
    3. Sigue el procedimiento iterativo de entrenamiento descrito en el Algoritmo 1 (Pseudocódigo de refinamiento de iluminación de texturas GAN)
  4. .

Algoritmo 1: Pseudocódigo del refinamiento de iluminación de texturas GAN
Entrada: Imagen de arte escénico en poca luz H(baja), número de iteraciones de entrenamiento N, tamaño de lote B
Salida: Imagen mejorada H mejorada
1: Inicializar el generador con parámetros H
2: Inicializar el discriminador con parámetros C
3: Tasas de aprendizaje figure-protocol-19
4: variable condicional z (opcional para GAN)
5: Parámetros de modulación adaptativa αi y β i
6: Saltar la lista de conexiones saltar (w)
7: para iteración = 1 a F hacer
Entrenamiento con discriminadores
8: Muestreo de un lote de imágenes reales figure-protocol-20
9: Muestrear un lote de imágenes de ruido/aleatorias en poca luz
10: Si es CGAN, añade la variable condicional z a las entradas
Generar imágenes falsas
Pérdida del discriminador de cálculo
Actualizar parámetros del discriminador
Formación en generadores
Generar imágenes falsas
Pérdida del generador de cómputo
Parámetros del generador de actualización
para j = 1 a 3 do

figure-protocol-21

figure-protocol-22

fin para
11: Convolución de cuello de botella
12: Decodificador/upsampling
para j = 5 a 7 do

figure-protocol-23

fin para
13: Capa de salida

figure-protocol-24

14: fin de
15: retorno H y C mejorados

5. Optimización de la disposición de etapas (IECO)

  1. Inicialización de IECO
    1. Inicializar el algoritmo de optimización inteligente de clanes de elefantes (IECO) para optimizar la disposición espacial de los elementos de la etapa.
    2. Define la población de "elefantes" (que representan posibles soluciones de diseño) y los clanes asociados. Consulte la Figura 7 para el diagrama de flujo IECO.
  2. Movimiento y evolución
    1. Calcula el movimiento independiente de cada elefante para explorar el espacio de diseño usando las Ecuaciones 17 y 18:
      figure-protocol-25 (17)
      figure-protocol-26 (18)
      Donde figure-protocol-27 representa el incremento de movimiento calculado usando un factor de distribución aleatoria r acotado entre un tamaño mínimo (figure-protocol-28) y máximo (figure-protocol-29) de paso, y figure-protocol-30 es la posición espacial independiente actualizada del elefante.
    2. Reduce el rango de movimiento a lo largo del tiempo usando la Ecuación 19 para facilitar la convergencia a medida que la solución mejora.
    3. Actualización de la matriarca: Actualizar la posición del líder del clan (matriarca) hacia la mejor solución global usando la Ecuación 20:
      figure-protocol-31 (19)
      Donde figure-protocol-32 representa la posición recién actualizada de la matriarca, figure-protocol-33 es la posición actual ponderada, figure-protocol-34 es la mejor solución global de distribución encontrada hasta ahora, y β actúa como un factor de escala que controla la influencia de la mejor solución.
    4. Actualización del elefante macho: Actualizar las posiciones de los elefantes machos en relación con el centro del clan usando las Ecuaciones 21 y 22:
      figure-protocol-35 (20)
      figure-protocol-36 (21)
      Donde figure-protocol-37 representa la posición actualizada del elefante macho, figure-protocol-38 es su posición de referencia actual, XCenterjs denota la posición central del clan familiar calculada a partir de todos los miembros masculinos, Md es el número total de miembros varones de la familia en el clan, y r y p son probabilidades de distribución aleatoria que guían el movimiento hacia el centro del clan.
  3. Reemplazo de población
    1. Calcular el Centro del Clan: Primero, evalúa la aptitud de los sistemas de distribución. Luego, calcula la posición central (figure-protocol-39) de cada clan familiar usando la Ecuación 22, donde Mf es el número de miembros de la familia:
      figure-protocol-40 (22)
    2. Reemplazo de elefantes adultos: Para mejorar la velocidad de convergencia, sustituye a los "elefantes adultos" inferiores (soluciones) por otros superiores generados desde el centro del clan. Aplicar la ecuación 23 para calcular la nueva posición (figure-protocol-41):
      figure-protocol-42(23)
      Donde figure-protocol-43 representa la posición central de los elefantes adultos, Mf es el número de miembros adultos de la familia, figure-protocol-44 denota la posición de reemplazo recién calculada para un elefante adulto inferior, figure-protocol-45 es la posición de referencia que se está reemplazando, y figure-protocol-46 representa figure-protocol-47 posiciones superiores dentro del clan utilizadas para guiar el proceso de reemplazo y acelerar la convergencia.
      (NOTA: Aquí, figure-protocol-48 y figure-protocol-49 representan posiciones intermedias ponderadas usadas para guiar el reemplazo.)
    3. Reemplazo de elefantes jóvenes: Para prevenir óptimos locales y preservar la diversidad, sustituir a los "elefantes jóvenes" más débiles (figure-protocol-50). Actualizar las posiciones de estos elementos usando la Ecuación 24:
      figure-protocol-51 (24)
      Donde figure-protocol-52 denota la posición actual del elefante joven más débil, y figure-protocol-53 es su posición recién generada. Este reemplazo está impulsado por un factor aleatorio r y los miembros superiores del clan para evitar que el proceso de optimización caiga en óptimos locales y preservar la diversidad espacial.
    4. Terminación: Fusionar los clanes actualizados, recalcular la aptitud y repetir el bucle de optimización hasta que se cumplan los criterios de terminación detallados en el Algoritmo 2.

Algoritmo 2: Pseudocódigo de IECO para optimizar la disposición del escenario y la colocación de la iluminación
Entrada: Tamaño de población M:, iteraciones máximas Xmáx:
Salida: Disposición óptima del escenario y colocación de iluminación
Inicializar clanes de elefantes con posiciones aleatorias (disposición del escenario + parámetros de iluminación)
Evalúa la aptitud de cada elefante
Para t = 1 a X máximo:
Para cada clan:
Identificar matriarca (mejor elefante), elefantes machos y elefantes jóvenes Movimiento independiente
Para cada elefante:
Calcular incremento de movimiento ΔXmax
Actualizar la posición independiente figure-protocol-54
Reducir el rango de movimiento a lo largo de las iteraciones
Actualización de la Matriarca

figure-protocol-55

Para cada matriarca:
Actualizar la posición hacia lo mejor global
Actualización del elefante macho

figure-protocol-56

figure-protocol-57

Para cada elefante macho
Calcula el centro del clan y actualiza la posición hacia el centro con reemplazo adulto

figure-protocol-58

figure-protocol-59

Calcular el centro de clan de adultos
Sustituir a los adultos inferiores por el superior de un elefante pequeño

figure-protocol-60

Sustituir a los elefantes jóvenes más débiles para preservar la diversidad
Fusionar los clanes actualizados, recalcular la aptitud de todos los elefantes y actualizar la mejor solución global
Vuelve la mejor disposición de escenario y arreglo de iluminación a nivel mundial

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La configuración experimental y el flujo de trabajo analítico, tal como se describen en las Figuras 1 a 7 y en las Tablas 1 a 3, proporcionaron una base sólida para el preprocesamiento de datos, la extracción de características y la optimización de la disposición del marco GSAD.

Dinámica del entrenamiento del modelo y convergencia
La evaluación experimental del marco GSAD p...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La principal contribución de este estudio es el desarrollo de un flujo de trabajo reproducible asistido por IA que estandariza la conceptualización del diseño artísticoescénico 2,10. Al centrarse en el marco GSAD, los autores ofrecen una metodología estructurada que supera las limitaciones de la ideación manual y la interpretación subjetiva comunes en la escenografía tradicional. Un paso fundamental dentro del protocolo es la int...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El autor desea expresar su sincero agradecimiento a los colegas del Politécnico Minhang de Shanghái por los comentarios útiles y la asistencia técnica durante el desarrollo e implementación del marco GSAD. Se extiende un agradecimiento especial a la comunidad de código abierto por proporcionar las herramientas computacionales esenciales y los conjuntos de datos públicos que facilitaron el entrenamiento y validación de los modelos multimodales de IA utilizados en este protocolo. También agradezco a los compañeros que ofrecieron sugerencias constructivas sobre los primeros borradores de este trabajo. Esta investigación no recibió ninguna subvención específica de agencias financiadoras del sector público, comercial o sin ánimo de lucro.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
BERT (Representaciones Bidireccionales de Codificadores de Transformers)Transformadores de cara abrazandoCódigo abierto
Lenguaje de programación PythonFundación de Software PythonVersión 3.8 o superior
Marco de Aprendizaje Profundo PyTorchLinux Foundation / Meta AIVersión 2.0.1 o superior
Conjunto de datos de diseño artístico escénicoRepositorio KaggleAccesible al público
Implementación del Transformador de Visión (ViT)Modelos de imagen de PyTorch (timm)Código abierto
Estación de trabajo con capacidades de GPUN/A (Hardware estándar)N/A

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Masters, P. The history and theory of environmental scenography. Theatre Perform Des. 5 (3-4), 317-319 (2019).
  2. Lotker, S., Gough, R. On scenography: editorial. Perform Res. 18 (3), 3-6 (2013).
  3. Goldschmidt, G. The dialectics of sketching. Creat Res J. 4 (2), 123-143 (1991).
  4. Tversky, B. What do sketches say about thinking. , (2002).
  5. Baugh, C. . Theatre, performance and technology: the development and transformation of scenography. , (2013).
  6. Müller, M., Montag, C. Disentangling the link between creativity and technology use: individual differences in smartphone and social media (over)use. J Creat. 34 (2), 100081 (2024).
  7. Amankwah-Amoah, J., Abdalla, S., Mogaji, E., Elbanna, A., Dwivedi, Y. K. The impending disruption of creative industries by generative AI: opportunities, challenges, and research agenda. Int J Inf Manage. 79, 102759 (2024).
  8. Zhang, H., Zhang, R. Generative artificial intelligence (AI) in built environment design and planning: a state-of-the-art review. Prog Eng Sci. 2 (1), 100040 (2025).
  9. Cetinic, E., She, J. Understanding and creating art with AI: review and outlook. ACM Trans Multimed Comput Commun Appl. 18 (2), 66 (2022).
  10. Aronson, A., Palmer, S., McKinney, J., Benedetto, S. A. D. . The history and theory of environmental scenography. , (2018).
  11. Anantrasirichai, N., Bull, D. Artificial intelligence in the creative industries: a review. Artif Intell Rev. 55 (1), 589-656 (2022).
  12. Corvello, V. Generative AI and the future of innovation management: a human-centered perspective and an agenda for future research. J Open Innov Technol Mark Complex. 11 (1), 100456 (2025).
  13. Mazzone, M., Elgammal, A. Art, creativity, and the potential of artificial intelligence. Arts. 8 (1), 26 (2019).
  14. Kadenhe, N., Al Musleh, M., Lompot, A. Human-AI co-design and co-creation: a review of emerging approaches, challenges, and future directions. Proc AAAI Symp Ser. 6 (1), 265-270 (2025).
  15. Santoso, B., Wijayanti, R. Human-AI collaboration in creative industries: workflows in media production and community-driven platforms. Trans Artif Intell Mach Learn Cogn Syst. 9 (11), 11-26 (2024).
  16. Candy, L., Edmonds, E. Practice-based research in the creative arts: foundations and futures from the front line. Leonardo. 51 (1), 63-69 (2018).
  17. Peckham, O., Raines, J., Bulsink, E., Goudswaard, M., Gopsill, J., Barton, D., et al. Artificial intelligence in generative design: a structured review of trends and opportunities in techniques and applications. Designs. 9 (4), 79 (2025).
  18. Hegab, H., Khanna, N., Monib, N., Salem, A. Design for sustainable additive manufacturing: a review. Sustain Mater Technol. 35, e00576 (2023).
  19. Reed, S., Akata, Z., Yan, X., Logeswaran, L., Schiele, B., Lee, H., et al. Generative adversarial text-to-image synthesis. , 1060-1069 (2016).
  20. Wang, G. G., Deb, S., Coelho, L. D. S. Elephant herding optimization. , 1-5 (2015).
  21. Strumberger, I., Beko, M., Tuba, M., Minovic, M., Bacanin, N. . Elephant herding optimization algorithm for wireless sensor network localization problem. , (2018).
  22. Ploennigs, J., Berger, M. AI art in architecture. AI Civ Eng. 2 (1), 8 (2023).
  23. Zhang, L., Pan, Y., Wu, X., Skibniewski, M. J. . Artificial intelligence in construction engineering and management. , (2021).
  24. Chaillou, S. . Artificial intelligence and architecture: from research to practice. , (2022).
  25. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. , 6000-6010 (2017).
  26. Li, Y., Xu, W. A deep learning-based framework for intelligent modeling: from architectural sketch to 3D model. Front Archit Res. 14 (6), 1567-1584 (2025).
  27. Dosovitskiy, A. An image is worth 16×16 words: transformers for image recognition at scale. arxiv. , (2020).
  28. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: pre-training of deep bidirectional transformers for language understanding. , (2019).
  29. Han, K., Wang, Y., Chen, H., Chen, X., Guo, J., et al. A survey on vision transformer. IEEE Trans Pattern Anal Mach Intell. 45 (1), 87-110 (2022).
  30. Woo, S., Park, J., Lee, J. Y., Kweon, I. S. CBAM: convolutional block attention module. , (2018).
  31. Qi, X., Zhi, M. A review of attention mechanisms in computer vision. , (2023).
  32. Howard, A., Sandler, M., Chen, B., Wang, W., Chen, L. C., et al. Searching for MobileNetV3. , (2019).
  33. Mehta, S., Rastegari, M. MobileViT: light-weight, general-purpose, and mobile-friendly vision transformer. arxiv. , (2021).
  34. Tan, M., Le, Q. EfficientNet: rethinking model scaling for convolutional neural networks. , (2019).
  35. Liao, W. J., Tang, C. H. Teaching strategies and practices that facilitate the development of design concepts in architectural engineering education. SAGE Open. 13 (3), 21582440231196376 (2023).
  36. Goodfellow, I. J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., et al. Generative adversarial nets. , 2672-2680 (2014).
  37. Dhariwal, P., Nichol, A. Diffusion models beat GANs on image synthesis. , (2021).
  38. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , (2019).
  39. Isola, P., Zhu, J. Y., Zhou, T., Efros, A. A. Image-to-image translation with conditional adversarial networks. , (2017).
  40. Amershi, S., Weld, D., Vorvoreanu, M., Fourney, A., Nushi, B., et al. Guidelines for human-AI interaction. , 3 (2019).
  41. Xiao, Y., Lin, X., Ji, T., Qiao, J., Ma, B., Gong, H. AI-assisted design: intelligent generation of Dong paper-cut patterns. Electronics. 14 (9), 1804 (2025).
  42. Runco, M. A. . Creativity: research, development, and practice. , (2023).
  43. Plate, D., Hutson, J. Composition pedagogy as AI-native coding: from design kit to scholarly framework. World J Arts. 2 (11), 1-10 (2025).
  44. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , 4396-4405 (2019).
  45. Berryman, J. Creativity and style in GAN and AI art: some art-historical reflections. Philos Technol. 37 (2), 61 (2024).
  46. Yan, S., Wu, C., Zhang, Y. Generative design for architectural spatial layouts: a review of technical approaches. J Asian Archit Build Eng. , 1-21 (2025).
  47. Deng, Y., Zhai, Q. Integrating deep learning in art and design: computational techniques for enhancing creative expression. Int J Adv Comput Sci Appl. 16 (2), 175-183 (2025).
  48. Mirjalili, S. The ant lion optimizer. Adv Eng Softw. 83, 80-98 (2015).
  49. Lian, Q. Optimization of image recognition technology for dance theatre creation and evaluation of its effectiveness. J Comb Math Comb Comput. 127, 1653-1665 (2025).
  50. Avila, C., Ilbay, D., Rivera, D. Human-AI teaming in structural analysis: a model context protocol approach for explainable and accurate generative AI. Buildings. 15 (17), 3190 (2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Modelado generativomodelos de difusi nredes generativas antag nicasoptimizaci n del clan de elefantes inteligentesaprendizaje multimodalconsistencia visual

Artículos relacionados