方法文章

基于GSAD框架的可复现人工智能辅助舞台美术设计概念开发与灯光优化工作流程

DOI:

10.3791/70737

2026年5月12日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文中,作者提出了一种实现生成式舞台艺术设计(GSAD)框架的方案,该框架是一种由人工智能驱动的工作流程,结合了扩散模型、生成对抗网络(GANs)和智能象群优化算法(IECO),旨在将叙事脚本标准化地转化为优化的三维视觉概念。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

人工智能(AI)正在通过实现快速构思和一致的可视化,从根本上重塑创意设计流程,尤其是在舞台艺术与舞台设计领域。然而,现有的工作流程仍然严重依赖手工草图和主观解读,限制了可扩展性,并降低了设计团队之间的可重复性。这一差距凸显了构建一个结构化的、由人工智能辅助的生成式舞台艺术设计(GSAD)框架的必要性,该框架融合深度学习、生成建模与优化技术,以支持系统化且可重复的概念开发。GSAD框架的核心目标是结合扩散模型用于初始概念生成、生成对抗网络(GANs)用于纹理与光照细节优化,以及智能象群优化算法(IECO)用于舞台布局与灯光布置的优化。舞台艺术设计数据集包含2,500张高分辨率图像,涵盖带注释的戏剧剧本、灯光图和三维布局,以支持多模态学习。实验评估表明,在定性指标方面有显著提升,包括生成视觉内容与剧本内容之间更高的语义一致性,以及通过IECO驱动的空间分析实现的更高效的布局优化。在基于Python的环境中实现该框架后,取得了98.88%的预测准确率、每秒26.58兆次浮点运算(MFPOs)的处理性能,以及108万参数量。GSAD框架提供了一种可扩展、可重复且技术稳健的人工智能辅助工作流程,能够增强创意产出、确保视觉一致性,并支持现代舞台艺术设计中的高效概念开发。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

舞台美术设计是一个复杂的多学科领域,融合了舞台布景、灯光、场景设计和空间叙事12。传统上,舞台概念的开发依赖于通过物理模型、手绘草图、情绪板以及反复的头脑风暴会议所体现的人类创造力34。这一发展过程深受艺术构想与演出空间实际限制之间张力的影响5。随着演出需求日益复杂,对资源高效、视觉丰富且快速生成概念的需求已超越了传统的手工工作流程67。生成式人工智能(GenAI)和大语言模型(LLMs)的出现为增强创意过程提供了变革性的路径,推动了建筑与娱乐领域的设计构思与协同创作89

传统的舞台设计常常面临语义鸿沟问题,戏剧剧本中的抽象情感难以找到精确的视觉对应形式,往往需要大量反复尝试才能实现2,10。当前创意产业中的人工智能工具虽支持对参考图像进行灵活检索与重组,但许多工具缺乏专业舞台制作所需的结构严谨性11,12。此外,审美评价的主观性使得机器生成结果与特定叙事意图之间的匹配变得困难13。从依赖经验的手动工作流程转向以数据驱动的人机协作模式,正成为21世纪设计实践的显著特征14,15。这些计算工具的整合要求发展一种新型的"实践导向"研究,以弥合数字工具开发与现场表演之间的差距16。近期研究表明,人工智能系统可有效支持创意构思和广泛方案探索,但从二维构想过渡到三维优化实现仍面临技术挑战9

生成式舞台艺术设计(GSAD)框架通过建立可重复的AI辅助工作流程,解决了上述不足17,18。该框架的设计理念源于在保持原始叙事艺术完整性的同时,实现设计组件自动化的迫切需求。通过整合多模态AI系统,设计师能够快速进行视觉与语言层面的迭代,确保灯光与材质的优化在语义上与戏剧内容保持一致19。该创新的一项关键组成部分是采用智能象群优化(IECO)算法,该算法受大象种群社会行为的启发,用于应对舞台布局与灯光布置中的复杂空间约束20,21。这类元启发式算法在解决传统基于梯度的方法难以应对的多目标设计问题时,已证明具有显著有效性。

从更广泛的文献背景来看,由人工智能驱动的计算机辅助设计(CAD)系统在建筑工作流程中已实现了高达20%的效率提升22,23。具体而言,由人工智能驱动的生成式设计能够探索那些无法通过人工构想的非标准空间拓扑结构24。尽管过去两年的最新研究已成功利用条件生成对抗网络(CGANs)实现二维平面平面图生成和建筑空间布局的自动化,但将这些二维生成原理扩展至舞台灯光与布景设计中复杂且三维的空间需求,目前仍鲜有探索。然而,传统的深度学习模型(如卷积神经网络(CNNs))通常难以处理理解复杂三维舞台布局所需的长距离依赖关系25,26。GSAD 框架通过采用视觉变换器(ViT)提取全局视觉特征,并利用变换器的双向编码器表示(BERT)编码器捕捉叙事语义,从而克服了这些局限27,28。由于变换器模型比局部滤波器更能有效捕捉设计场景的全局上下文,因此这些模型能够更全面地表征空间关系29。这种双流特征提取机制确保了生成的舞台设计不仅在美学上保持一致,而且在叙事上具有相关性。

与深度卷积嵌入注意力机制(DL-CBAM)等替代技术相比,GSAD 方法具有多方面的优势30,31。尽管先前的模型在运动检测数据集上的识别准确率有所提升,但这些模型通常需要更高的计算开销,且缺乏 GSAD 所具备的空间优化能力。相比之下,GSAD 在保持 1.08 M 参数量的同时,实现了 98.88% 的准确率,在模型复杂度与预测能力之间达到了最佳平衡32,33。这种高效性对于实时创意工具至关重要,已在面向特定设计任务的移动端架构成功应用中得到验证34。因此,该框架非常适用于需要高保真、可重复可视化效果的专业戏剧设计师、数字艺术创作者以及建筑与工程教育工作者35

此外,通过生成对抗网络(GAN)进行纹理和光照优化,能够解决标准扩散模型的局限性,因为后者有时会产生"风格单一"的输出结果36,37。通过采用基于风格的生成器,该框架能够合成兼具多样性与艺术深度的高分辨率纹理38。借助对抗训练,GSAD 框架可将艺术细节和视觉真实感提升至专业水准39。该方法还通过提供一个可控的、"设计师参与其中"的协作平台,缓解了有关作者身份归属与偏见的伦理问题40,41。其最终目标并非取代人类的直觉,而是为艺术家提供一个可扩展其创作自主性的协作伙伴42。随着领域向更具沉浸感和高度数字化融合的表演形式发展,对稳健的、原生于人工智能的设计协议的需求将持续增长43。以下方案提供了实现 GSAD 框架的技术路线图,确保现代舞台艺术设计既富有想象力又具备可重复性。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 计算环境与数据获取

  1. 系统设置(确保所有计算步骤均在具备足够 GPU 能力的工作站上执行,以支持深度学习任务)。
    1. 在具备足够 GPU 能力的工作站上设置 Python 编程环境,用于进行深度学习模拟,作为 图1 中 GSAD 框架的基础。
    2. 安装必要的依赖项,具体包括配置 Python(版本 3.8 或更高)和 PyTorch(版本 2.0.1 或更高),以及深度学习模拟所需的标准库,以确保执行的一致性。
    3. 配置内存管理系统,以处理高分辨率图像处理任务。
  2. 数据集收集
    1. 从 Kaggle 仓库获取“舞台美术设计数据集”,以获得原始数据。
      注:图像包含符合版权标准的公开许可材料和原创概念设计。
    2. 下载包含 2,500 张高分辨率 JPG 图像及相关元数据的数据集。
    3. 验证文件结构,确保其包含按不同舞台类型、表演风格和文化背景分类的 2,500 张高分辨率图像,以避免风格偏差。
    4. 在训练前应用标准化的数据标注规则。将语义剧本元素(例如“情绪化照明”)直接映射到特定的十六进制颜色代码,并使用标准化的三维坐标边界框(x, y, z)标注照明参数,以确保语义到视觉的一致映射。

2. 数据预处理

  1. 图像归一化
    1. 对原始图像数据执行最小-最大归一化,以统一缩放所有特征值,提高数据稳定性。
    2. 应用公式 1 将原始特征值(M)转换为归一化值(Mnorm):
      数据归一化公式:M_norm=(M-min(M))/(max(M)-min(M));数学概念。  (1)
      其中 Mnorm 表示归一化后的值,M 为原始特征值,min(M) 和 max(M) 分别为数据集的最小值和最大值。
    3. 通过比较原始图像与预处理后的图像,确认收敛性及特征表示质量已得到改善,如图 2所示。
  2. 文本语义清洗
    1. 处理与舞台设计相关的文本脚本,去除可能干扰人工智能的“噪声”。
    2. 消除拼写错误、多余符号、标点、停用词以及格式不一致等问题。
    3. 将文本统一标准化为小写形式,以确保语义一致性13。语义清洗过程的示例见表 1
  3. 分词处理
    1. 将清洗后的文本划分为更小且易于处理的单元,称为“词元”(tokens),可以是单词或字符。
    2. 确保在此步骤中去除不需要的成分,以便人工智能模型进行精确的概念分析。

3. 特征提取(GSAD 框架)

  1. 使用视觉变换器(ViT)进行视觉特征提取
    1. 如图所示初始化 ViT 架构 图3 用于处理3D舞台艺术图像。
    2. 图像块嵌入:将输入图像分割为固定大小的图像块(视觉词),以降低维度。
    3. 构建视觉标记(u)并添加位置编码(u') 使用 公式 2、3 和 4:
      Equilibrium equation, xᵢʲ = Kw꜀, chemical kinetics formula in mathematical notation.  (2)
      Mathematical equation, static equilibrium, u'=u+o, variables o,v in Q set, educational concept. (3)
      Equation of concatenation in vector calculus; shown in a mathematical formula format. (4)
      何处 Mathematical variable \( x_c^j \) equation in dynamic systems analysis. 表示投影的图像块令牌, k 是展平后的输入图像块, wc 是线性投影权重矩阵, u 是展开的图像块序列,是为保留空间信息而添加的位置编码,且 dk 是添加的分类标记。
      注意:请参阅 表2 有关ViT变量(例如patch大小)的详细描述O)和投影维度(d).
    4. Transformer编码器:将处理后的标记输入Transformer编码器。利用自注意力机制识别不同图像块之间的相关性(例如,光照与背景之间的关系)。
    5. 使用公式 5 至公式 8 应用归一化和激活函数,生成最终的特征图:
      Equation for vector normalization: u = normalize(u).    (5)
      Softmax equation for reward learning algorithm, displaying formula RL=softmax(R×L^sc).   (6)
      Static equilibrium equation, w=RL×U, formula for mechanical systems analysis.   (7)
      Neural network activation layer formula, linear(w) and GeLU(w), illustrating computation process.   (8)
      何处 u' 是归一化后的令牌序列, RL 表示从查询中获得的自注意力权重 RL干细胞 钥匙(带缩放系数) 干细胞), w 使用以下方式计算的注意力输出 U 值和线性(w)和 GeLU(w表示前馈网络中的变换。
    6. 可视化输出特征图,该特征图突出关键设计元素并降低噪声,如图所示 图4.
  2. 使用 BERT 进行文本特征提取
    1. 初始化 BERT(双向编码器表示模型,bidirectional encoder representations from transformers)以处理舞台剧本。
    2. 使用词嵌入将自然语言脚本转换为连续向量,以捕捉语义含义。参考 表3 用于特征提取结构。
    3. 将词元嵌入、片段嵌入和位置嵌入组合后作为编码器的输入。
    4. 执行变换器编码器单元步骤(多头注意力、相加) & 归一化,前馈)如图所示 图5 生成具有上下文关联的词元序列。
    5. 将来自 BERT 的上下文化词元序列输出与来自 ViT 的视觉特征图进行拼接,将此融合后的多模态数据作为直接条件输入向量送入第 4 步的 GAN 精修模块。
  3. 初始概念生成
    1. 将从 BERT 提取的文本特征和从 ViT 提取的视觉特征输入扩散模型。
    2. 基于整合的多模态特征生成初始二维概念阶段设计。
    3. 将这些初始的二维概念作为基础输入传递给第四步中的生成对抗网络(GAN),以进一步优化纹理和光照效果。

使用生成对抗网络进行纹理和光照优化

  1. 生成对抗网络(GAN)设置
    1. 构建GSAD优化模块,包括一个生成器(H)和一个判别器(C),如图6所示。
    2. 配置判别器以区分真实舞台图像与生成图像,并配置生成器以生成逼真的纹理和光照效果。
  2. 训练与优化
    1. 使用公式9定义条件生成对抗网络(CGAN)的目标函数,引入条件变量(y)以提高稳定性:
      优化方程,最小-最大算法,公式分析,统计方法,数学表达式 (9)
      其中x表示输入的舞台设计条件,y为真实目标图像,z表示随机噪声向量,G为生成器,D为判别器。
    2. 针对低光照图像增强,应用公式10优化光照增强图像输出(Hlow):
      数学优化方程,min max U(C,H)=Σ fixa logC(qho),用于数据分析建模 (10)
      其中U(C, H)表示目标值函数,H为生成器网络,C为判别器(Critic)网络,w表示从分布Odata中采样的真实数据,y为输入条件,z为条件噪声变量,qha表示真实的高质量舞台图像,HLow表示生成器从低光照输入生成的输出。
    3. 使用公式11对特征变换应用自适应调制:
      动态平衡的数学公式;hEi(w)=max(0,AM(ai,βi)Xi*hEi-1(w)+ai) (11)
      其中hEi(w)表示第i层的特征图,AM表示具有可学习参数αiβi的自适应调制函数,静态平衡;ΣFx=0, ΣFy=0, 平衡图解,物理教学,力矢量分析为层权重,为偏置项。
    4. 在生成网络中使用公式12和13实现跳跃连接和池化层,以保留空间细节:
      显示神经网络残差跳跃连接公式的理论框架  (12)
      深度学习公式,\(H_j(w) = \text{max pooling(skip}(w)\),网络层分析,示意图 (13)
      其中Skip(w)表示通过跳跃连接从卷积块hE保留的特征,Hjw表示在编码器阶段经最大池化后的输出特征图(0 < j ≤ 3)。
  3. 图像重建
    1. 在解码阶段使用公式14和15进行上采样和拼接:
      up(w)=concat[resize(w),skip(w)];神经网络层操作公式  (14)
      显示信号处理公式的方程:Hj(w)=hEj,2[hEj,1voHj-1(w)], 4<j≤7 (15)
      其中up(w)表示与相应跳跃连接skip(w)拼接后的上采样特征,v°Hj-1(w)表示解码器阶段的组合输入(4 < j ≤ 7),hout(w)为通过Sigmoid激活函数生成的最终优化舞台图像,使用最后一层的权重X8和偏置a8
    2. 使用公式16中的Sigmoid激活函数生成最终优化图像输出:
      低通滤波器传递函数方程;频率响应分析图  (16)
    3. 遵循算法1(GAN纹理光照优化伪代码)中概述的迭代训练流程。

算法 1:GAN-纹理光照优化的伪代码
输入:低光照舞台艺术图像 H(low),训练迭代次数 N,批量大小 B
输出:增强图像 H enhanced
1:使用参数 H 初始化生成器
2:使用参数 C 初始化判别器
3:学习率 优化概念:极小极大微积分的数学公式,展示 (C, H) 函数。
4:条件变量 z(GAN 的可选参数)
5:自适应调制参数 αi 和 βi
6:跳跃连接列表 skip(w)
7:对于 iteration = 1 到 F 执行
判别器训练
8:采样一批真实图像 Fw~Odata 方程,公式分析,数据建模研究中的统计加权。
9:采样一批噪声/随机低光照图像
10:如果是条件生成对抗网络(CGAN),将条件变量 z 附加到输入中
生成伪造图像
计算判别器损失
更新判别器参数
生成器训练
生成伪造图像
计算生成器损失
更新生成器参数
对于 j = 1 到 3 执行

数学公式 Skip(w),分层函数,计算方法,过程分析。

神经网络方程,\(H_j(w) = \text{max pooling(skip(w))}\),0 < j ≤ 3,数学概念。

结束循环
11:瓶颈卷积
12:解码器/上采样
对于 j = 5 到 7 执行

多变量函数公式,\(H_j(w) = hE_{j,2}[hE_{j,1}[νο(H_{j-1}(w))]]_3\),数学分析。

结束循环
13:输出层

低通滤波器传递函数方程;信号处理分析公式。

14:结束循环
15:返回经增强的 H 和 C

5. 舞台布局优化(IECO)

  1. IECO 初始化
    1. 初始化智能象群优化(Intelligent Elephant Clan Optimization, IECO)算法,以优化舞台元素的空间布局。
    2. 定义“象群”种群(代表潜在的设计方案)及其关联的族群。IECO 的流程图参见图7
  2. 移动与进化
    1. 使用公式(17)和(18)计算每头大象的独立移动,以探索设计空间:
      动态范围分析中的优化公式 ΔX'i0。 (17)
      显示变量与变化的公式:ZX₀ = X₀ + ΔX₀;数学表达式。 (18)
      其中 静态平衡,公式 ΔXᵢⱼ,用于物理或工程分析的数学符号。 表示通过随机分布因子 r 计算的移动增量,该因子的取值范围介于最小步长(静态平衡概念;方程 ΔXᵐⁱⁿⱼ 表示最小位移。)和最大步长(ΔX_j_max 符号在方程中,符号表示,数学概念。)之间,ZXj_i0 方程;表示静态平衡分析的符号;用于教学。 为大象更新后的独立空间位置。
    2. 使用公式(19)随时间逐步减小移动范围,以在解的质量提升时促进收敛。
    3. 母象首领更新:使用公式(20)将族群首领(母象首领)的位置向全局最优解方向更新:
      描述迭代优化过程的公式;公式包含变量 YNED、YWED、XBest。 (19)
      其中 静态平衡方程,ΣFx=0,ΣFy=0,ΣMz=0,示意图,力平衡,力学分析。 表示母象首领更新后的新位置,数学公式 YWED^js+1_im(j) 的科学记法;用于数据分析研究的关键表达式。 为其加权后的当前位置,静态平衡方程,XBest_js(j);用于教学的符号表示。 为迄今为止找到的全局最优布局方案,β 为控制最优解影响程度的比例因子。
    4. 公象更新:使用公式(21)和(22)相对于族群中心更新公象的位置:
      描述质心调整迭代计算的动态方程,用于数学分析。 (20)
      静态平衡方程,XCenter_js;公式符号,用于数学教学内容。 (21)
      其中 数学符号 XND, n_js+1;用于序列分析或迭代方法的方程。 表示公象更新后的位置,静态平衡方程 \(Y_WND, n^j_{is+1}\),用于教育研究的符号公式。 为其当前参考位置,XCenterjs  表示由所有公象成员计算得到的家族族群中心位置,Md 为族群中公象成员的总数,rp 为引导移动趋向族群中心的随机分布概率。
  3. 种群替换
    1. 计算族群中心:首先评估布局方案的适应度,然后使用公式(22)计算每个家族族群的中心位置(XEDi,Hn 方程符号;教育研究;分析化学背景。),其中 Mf 为家族成员数量:
      描述统计平均方法的方程。 (22)
    2. 成年象替换:为提高收敛速度,用从族群中心生成的更优“成年象”(解)替换较差的个体。应用公式(23)计算新位置(示意图中的静态平衡公式:\( X_{EDi,calf} \)。):
      输运现象模型中流体动力学计算的方程。 (23)
      其中 数学公式,带下标和上标的变量在示意图中,用于教学。 表示成年象的中心位置,Mf  为成年家族成员的数量,科学记法中指数函数的方程;数学表达式分析。 表示为较差成年象计算出的新替换位置,静态平衡方程 X^js+1/ND_i,Hn(j),数学公式分析。 为被替换的参考位置,带变量符号的数学公式,用于复杂代数表达式;符号分析。带下标和上标的数学公式,教育用方程表示。 表示族群中用于引导替换过程以加速收敛的更优位置。
      (注:此处 静态平衡公式,XEDi,Qe,用于教育研究的符号。用于数学或科学分析的符号方程。 表示用于引导替换的中间加权位置。)
    3. 幼象替换:为防止陷入局部最优并保持多样性,替换最弱的“幼象”(静态平衡方程 \( X_{ED_{i,w}} \) 分析公式。)。使用公式(24)更新这些元素的位置:
      数学方程示意图,迭代计算,变量与参数,公式分析。 (24)
      其中 静态平衡方程;符号:X_ED^js+1(i,w);用于物理概念教学。 表示最弱幼象的当前位置,科学记法中指数函数的方程;数学表达式分析。 为其新生成的位置。该替换由随机因子 r 和族群中的更优成员驱动,以防止优化过程陷入局部最优,并保持空间多样性。
    4. 终止条件: 合并更新后的族群,重新计算适应度,并重复优化循环,直至满足 算法2 中详述的终止条件。

算法 2:用于优化舞台布局和灯光布置的 IECO 伪代码
输入:种群规模 M,最大迭代次数 Xmax
输出:最优舞台布局与灯光布置
初始化具有随机位置的大象族群(舞台布局 + 灯光参数)
评估每头大象的适应度
对于 t = 1 到 Xmax
对于每个族群:
识别雌性首领(最优个体)、雄性大象和幼象的独立移动
对于每头大象:
计算移动增量 ΔXmax
更新独立位置 表示统计变量的数学表达式 ZXi^0(j)。
随迭代次数减少移动范围
雌性首领更新

描述动态优化的进化策略公式,包含变量和常数的方程。

针对每位母象首领:
向全局最优位置更新位置
雄性象更新

优化公式,粒子群,数学方程,研究分析,收敛性研究。

统计数据处理公式,Σ公式,计算方法,数据分析模型。

对每头雄性大象
计算族群中心,并向中心更新其位置,同时进行成年个体替换

平均值计算公式;数学符号;简洁表示求和与平均值。

电荷分布方程;电化学模型计算公式;科学分析。

计算成年个体的族群中心
用小型象替换法中的较优个体替换较劣的成年个体

有限元分析方程;平衡迭代;计算模拟方法。

替换最弱小的幼象以保持多样性
合并更新后的象群,重新计算所有象的适应度,并更新全局最优解
返回全局最优的舞台布局与灯光配置

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

图1图7以及表1表3所示的实验设置与分析工作流程,为GSAD框架的数据预处理、特征提取和布局优化提供了坚实的基础。

模型训练动态与收敛性
对 GSAD 框架在舞台美术设计中的有效性进行的实验评估,获得了重要的定量与定性数据。如图 8A–B所示,模型的学习动态在 50 个训练周期内被持续监测。训练集与验证集的准确率曲线均呈现稳定上升趋势,最终在约 98.88% 的准确率处趋于稳定。该高准确率反映了模型能够有效从叙事文本和视觉数据中学习复杂的灯光与布局模式。同时,训练集和验证集的损失曲线均显著下降,表明 GSAD 框架能够可靠收敛,且在视觉设计参数上未出现明显的过拟合现象。

各类别的性能与鲁棒性
对各类别的性能分析进一步揭示了模型的鲁棒性。

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究的主要贡献在于开发了一种可重复的、人工智能辅助的工作流程,该流程标准化了舞台艺术设计的概念化过程2,10。通过聚焦于GSAD框架,作者提供了一种结构化的方法论,克服了传统舞台设计中常见的手工构思和主观解读的局限性。该方案中的关键步骤是将生成对抗网络(GANs)用于纹理和光照的优化,以确保生成的视觉效果达到专业戏剧制作所需的高保真真实感39,44。该方法直接解决了以往生成式人工智能艺术作品中所指出的"风格真实性"缺失问题45。关于该技术的修改与故障排查,必须针对常见问题提出解决方案,特别是模型训练不收敛以及生成结果中语义偏差的处理方法。为解决GAN模块中模型训练不收敛的问题,建议动态调整学习率并引入梯度惩罚机制。若出现语义偏差,用户需验证文本分词过程,并在多模态融合阶段重新校准映射权重。

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者谨向上海闵行职业技术学院的同事们致以诚挚的感谢,感谢他们在GSAD框架的开发与实施过程中提供的富有见地的反馈和专业技术支持。特别感谢开源社区提供了本方案中所使用的多模态人工智能模型训练与验证所依赖的关键计算工具和公开数据集。同时感谢同行们对本研究初稿提出的建设性意见。本研究未从公共、商业或非营利性资助机构获得任何特定资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
来自 Transformer 的双向编码器表示(BERT)Hugging Face Transformers开源
Python 编程语言Python 软件基金会版本 3.8 或更高
PyTorch 深度学习框架Linux 基金会 / Meta AI版本 2.0.1 或更高
舞台美术设计数据集Kaggle 仓库公开可访问
视觉 Transformer(ViT)实现PyTorch 图像模型(timm)开源
具备 GPU 能力的工作站不适用(标准硬件)不适用

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Masters, P. The history and theory of environmental scenography. Theatre Perform Des. 5 (3-4), 317-319 (2019).
  2. Lotker, S., Gough, R. On scenography: editorial. Perform Res. 18 (3), 3-6 (2013).
  3. Goldschmidt, G. The dialectics of sketching. Creat Res J. 4 (2), 123-143 (1991).
  4. Tversky, B. What do sketches say about thinking. , (2002).
  5. Baugh, C. . Theatre, performance and technology: the development and transformation of scenography. , (2013).
  6. Müller, M., Montag, C. Disentangling the link between creativity and technology use: individual differences in smartphone and social media (over)use. J Creat. 34 (2), 100081 (2024).
  7. Amankwah-Amoah, J., Abdalla, S., Mogaji, E., Elbanna, A., Dwivedi, Y. K. The impending disruption of creative industries by generative AI: opportunities, challenges, and research agenda. Int J Inf Manage. 79, 102759 (2024).
  8. Zhang, H., Zhang, R. Generative artificial intelligence (AI) in built environment design and planning: a state-of-the-art review. Prog Eng Sci. 2 (1), 100040 (2025).
  9. Cetinic, E., She, J. Understanding and creating art with AI: review and outlook. ACM Trans Multimed Comput Commun Appl. 18 (2), 66 (2022).
  10. Aronson, A., Palmer, S., McKinney, J., Benedetto, S. A. D. . The history and theory of environmental scenography. , (2018).
  11. Anantrasirichai, N., Bull, D. Artificial intelligence in the creative industries: a review. Artif Intell Rev. 55 (1), 589-656 (2022).
  12. Corvello, V. Generative AI and the future of innovation management: a human-centered perspective and an agenda for future research. J Open Innov Technol Mark Complex. 11 (1), 100456 (2025).
  13. Mazzone, M., Elgammal, A. Art, creativity, and the potential of artificial intelligence. Arts. 8 (1), 26 (2019).
  14. Kadenhe, N., Al Musleh, M., Lompot, A. Human-AI co-design and co-creation: a review of emerging approaches, challenges, and future directions. Proc AAAI Symp Ser. 6 (1), 265-270 (2025).
  15. Santoso, B., Wijayanti, R. Human-AI collaboration in creative industries: workflows in media production and community-driven platforms. Trans Artif Intell Mach Learn Cogn Syst. 9 (11), 11-26 (2024).
  16. Candy, L., Edmonds, E. Practice-based research in the creative arts: foundations and futures from the front line. Leonardo. 51 (1), 63-69 (2018).
  17. Peckham, O., Raines, J., Bulsink, E., Goudswaard, M., Gopsill, J., Barton, D., et al. Artificial intelligence in generative design: a structured review of trends and opportunities in techniques and applications. Designs. 9 (4), 79 (2025).
  18. Hegab, H., Khanna, N., Monib, N., Salem, A. Design for sustainable additive manufacturing: a review. Sustain Mater Technol. 35, e00576 (2023).
  19. Reed, S., Akata, Z., Yan, X., Logeswaran, L., Schiele, B., Lee, H., et al. Generative adversarial text-to-image synthesis. , 1060-1069 (2016).
  20. Wang, G. G., Deb, S., Coelho, L. D. S. Elephant herding optimization. , 1-5 (2015).
  21. Strumberger, I., Beko, M., Tuba, M., Minovic, M., Bacanin, N. . Elephant herding optimization algorithm for wireless sensor network localization problem. , (2018).
  22. Ploennigs, J., Berger, M. AI art in architecture. AI Civ Eng. 2 (1), 8 (2023).
  23. Zhang, L., Pan, Y., Wu, X., Skibniewski, M. J. . Artificial intelligence in construction engineering and management. , (2021).
  24. Chaillou, S. . Artificial intelligence and architecture: from research to practice. , (2022).
  25. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. , 6000-6010 (2017).
  26. Li, Y., Xu, W. A deep learning-based framework for intelligent modeling: from architectural sketch to 3D model. Front Archit Res. 14 (6), 1567-1584 (2025).
  27. Dosovitskiy, A. An image is worth 16×16 words: transformers for image recognition at scale. arxiv. , (2020).
  28. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: pre-training of deep bidirectional transformers for language understanding. , (2019).
  29. Han, K., Wang, Y., Chen, H., Chen, X., Guo, J., et al. A survey on vision transformer. IEEE Trans Pattern Anal Mach Intell. 45 (1), 87-110 (2022).
  30. Woo, S., Park, J., Lee, J. Y., Kweon, I. S. CBAM: convolutional block attention module. , (2018).
  31. Qi, X., Zhi, M. A review of attention mechanisms in computer vision. , (2023).
  32. Howard, A., Sandler, M., Chen, B., Wang, W., Chen, L. C., et al. Searching for MobileNetV3. , (2019).
  33. Mehta, S., Rastegari, M. MobileViT: light-weight, general-purpose, and mobile-friendly vision transformer. arxiv. , (2021).
  34. Tan, M., Le, Q. EfficientNet: rethinking model scaling for convolutional neural networks. , (2019).
  35. Liao, W. J., Tang, C. H. Teaching strategies and practices that facilitate the development of design concepts in architectural engineering education. SAGE Open. 13 (3), 21582440231196376 (2023).
  36. Goodfellow, I. J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., et al. Generative adversarial nets. , 2672-2680 (2014).
  37. Dhariwal, P., Nichol, A. Diffusion models beat GANs on image synthesis. , (2021).
  38. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , (2019).
  39. Isola, P., Zhu, J. Y., Zhou, T., Efros, A. A. Image-to-image translation with conditional adversarial networks. , (2017).
  40. Amershi, S., Weld, D., Vorvoreanu, M., Fourney, A., Nushi, B., et al. Guidelines for human-AI interaction. , 3 (2019).
  41. Xiao, Y., Lin, X., Ji, T., Qiao, J., Ma, B., Gong, H. AI-assisted design: intelligent generation of Dong paper-cut patterns. Electronics. 14 (9), 1804 (2025).
  42. Runco, M. A. . Creativity: research, development, and practice. , (2023).
  43. Plate, D., Hutson, J. Composition pedagogy as AI-native coding: from design kit to scholarly framework. World J Arts. 2 (11), 1-10 (2025).
  44. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , 4396-4405 (2019).
  45. Berryman, J. Creativity and style in GAN and AI art: some art-historical reflections. Philos Technol. 37 (2), 61 (2024).
  46. Yan, S., Wu, C., Zhang, Y. Generative design for architectural spatial layouts: a review of technical approaches. J Asian Archit Build Eng. , 1-21 (2025).
  47. Deng, Y., Zhai, Q. Integrating deep learning in art and design: computational techniques for enhancing creative expression. Int J Adv Comput Sci Appl. 16 (2), 175-183 (2025).
  48. Mirjalili, S. The ant lion optimizer. Adv Eng Softw. 83, 80-98 (2015).
  49. Lian, Q. Optimization of image recognition technology for dance theatre creation and evaluation of its effectiveness. J Comb Math Comb Comput. 127, 1653-1665 (2025).
  50. Avila, C., Ilbay, D., Rivera, D. Human-AI teaming in structural analysis: a model context protocol approach for explainable and accurate generative AI. Buildings. 15 (17), 3190 (2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章