方法論記事

GSADフレームワークを通じたステージアートデザインおよび照明最適化におけるコンセプト開発のための再現可能なAI支援ワークフロー

DOI:

10.3791/70737

2026年5月12日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本件では、著者らは、拡散モデル、生成的敵対ネットワーク(GAN)、インテリジェント象群の最適化(IECO)を統合したAI駆動ワークフローである生成ステージアートデザイン(GSAD)フレームワークを実装するプロトコルを提示し、ナラティブスクリプトから最適化された3D視覚概念への移行を標準化します。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

人工知能(AI)は、特に舞台美術や舞台美術において、迅速なアイデア考案と一貫した可視化を可能にすることで、創造的なデザインプロセスを根本的に再構築しています。しかし、既存のワークフローは手作業のスケッチや主観的な解釈に大きく依存しており、スケーラビリティを制限し、設計チーム間の再現性を低下させています。このギャップは、深層学習、生成モデリング、最適化技術を統合し、体系的かつ繰り返し可能なコンセプト開発を支援する構造化されたAI支援生成ステージアートデザイン(GSAD)フレームワークの必要性を強調しています。GSADフレームワークの中核的な目的は、初期コンセプト生成のための拡散モデル、テクスチャやライティングの精緻化のための生成的敵対ネットワーク(GAN)、ステージレイアウトと照明配置の最適化のためのインテリジェントな象群の最適化(IECO)を組み合わせることです。ステージアートデザインデータセットは2,500点の高解像度画像で構成されており、注釈付き劇場脚本、照明図、3Dレイアウトを含み、マルチモーダル学習を促進します。実験評価では、スクリプト内容と生成されたビジュアル間の意味的整合性の向上や、IECO駆動の空間解析によるレイアウト最適化効率の向上など、定性的指標の大幅な改善が示されています。Pythonベースの環境でフレームワークを実装すると、予測精度は98.88%、浮動小数点演算(MFPO)は26.58メガ/秒、パラメータ量は1.08 Mとなりました。GSADフレームワークは、スケーラブルで再現可能かつ技術的に堅牢なAI支援ワークフローを提供し、創造的な成果を向上させ、視覚的な一貫性を確保し、現代の舞台芸術デザインにおける効率的なコンセプト開発を支援します。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

舞台美術デザインは、舞台美術、照明、セットデザイン、空間的ストーリーテリングを統合した複雑で多分野的な分野です。歴史的に、ステージコンセプトの開発は、物理モデル、手描きスケッチ、ムードボード、反復的なブレインストーミングセッションを通じて表現される人間の創意工夫に依存してきました。3,4。この進化は、芸術的ビジョンとパフォーマンス空間の物質的制約との緊張によって大きく形作られてきました。パフォーマンス要件がますます高度化する中、リソース効率が高く、視覚的に豊かで迅速なコンセプト生成の需要は、従来の手動ワークフローを上回っています。生成型人工知能(GenAI)や大規模言語モデル(LLM)の登場は、創造的プロセスを拡張する変革的な道を示し、建築やエンターテインメントにおけるデザインのアイデア発想と共創を促進します8,9

伝統的な舞台美術はしばしば意味論的なギャップに直面します。演劇脚本の抽象的な感情が、広範な試行錯誤なしに正確な視覚的同等物を見つけるのに苦労する、2,10。クリエイティブ産業の現在のAIツールは、参考写真の柔軟な検索と再構成を可能にしますが、多くはプロの舞台制作に必要な構造的厳密さに欠けています11,12。さらに、美的評価の主観的な性質は、機械生成の成果物を特定の物語的意図と整合させるのを困難にすることが多い13。体験主導の手動ワークフローからデータ駆動型の人間とAIの協働への移行は、21世紀のデザイン実践を特徴づけるものとなりつつあります。これらの計算ツールの統合は、デジタルツール開発とライブパフォーマンスのギャップを埋める新しい形の「実践ベース」研究を必要としています16。最近の研究では、AIシステムがブレインストーミングや幅広い代替案の探求を促進することが強調されていますが、2Dのアイデア化から3D最適化された実現への移行は技術的には依然として困難です。

生成ステージアート(GSAD)フレームワークは、繰り返し可能なAI支援ワークフローを確立することでこれらの欠点を解決しました(17,18)。この枠組みの根拠は、オリジナルの物語の芸術的整合性を保ちつつ、デザイン要素を自動化する必要性にあります。マルチモーダルAIシステムを統合することで、デザイナーは視覚的にも言語的にも素早く反復でき、ライティングやテクスチャの洗練がドラマチックな内容と意味的に一致していることを確実にします。この革新の重要な要素は、インテリジェントゾウクラン最適化(IECO)アルゴリズムの利用であり、象の社会的行動から着想を得て、ステージレイアウトや照明配置の複雑な空間的制約を乗り越えるために活用しています。このメタヒューリスティックアルゴリズムのクラスは、従来の勾配ベース手法が失敗する多目的設計問題の解決に特に効果的であることが証明されています。

より広い文献の文脈では、AI搭載のコンピュータ支援設計(CAD)システムはすでに建築ワークフローにおいて最大20%の効率向上を示している(22,23)。具体的には、AI駆動の生成デザインにより、手動で考えることは不可能な非標準的な空間トポロジーの探求が可能になります。過去2年間の研究では、条件付きGAN(CGAN)を活用して2D平面平面図生成や建築空間レイアウトの自動化に成功していますが、これらの2D生成原理を舞台照明やセットデザインの複雑で三次元的な空間要件に拡張することは、依然として十分に探求されていません。しかし、畳み込みニューラルネットワーク(CNN)などの従来の深層学習モデルは、複雑な3D段階配置を理解するために必要な長距離依存関係に苦労することが多いです(25,26)。GSADフレームワークは、ビジョントランスフォーマー(ViT)を用いてトランスフォーマー(BERT)エンコーダからグローバルな視覚特徴や双方向エンコーダ表現を抽出し、物語の意味を捉えることでこれらの制約を克服しています(27,28)。トランスフォーマーは局所フィルターよりもデザインシーンのグローバルな文脈をより効果的に捉えるため、これらのモデルは空間関係をより包括的に表現する29。この二重ストリームの特徴抽出により、ステージデザインは美的にも一貫性があるだけでなく、物語的にも関連性があります。

GSADアプローチが、深層畳み込み的注意メカニズム(DL-CBAM)などの代替手法に比べて持つ利点は多面的です30,31。従来のモデルはモーション検出データセットの認識精度を向上させましたが、これらのモデルは計算負荷が高く、GSADに見られる空間最適化機能が不足していました。対照的に、GSADはパラメータ数1.08 Mを維持しながら98.88%の精度を達成し、モデルの複雑さと予測能力の最適なバランスを取っています。この効率性はリアルタイムのクリエイティブツールにとって極めて重要であり、モバイルスケールアーキテクチャの特殊設計タスクでの成功が示しています。この枠組みは、高忠実度で再現可能な可視化を必要とするプロの劇場デザイナー、デジタルアートクリエイター、建築工学教育者に非常に適しています。

さらに、テクスチャやライティングの精緻化のためのGANの統合は、標準的な拡散モデルの限界を解消します。これらのモデルは時に「スタイル的にフラット」な出力を生み出すことがあり、36,37。スタイルベースのジェネレーターを活用することで、このフレームワークは多様性と芸術的な深みの両方を示す高解像度テクスチャを合成できます。対抗的トレーニングを採用することで、GSADの枠組みは芸術的なディテールや視覚的リアリズムを専門基準まで向上させます。このアプローチはまた、著者シップやバイアスに関する倫理的懸念を軽減し、制御可能な「デザイナーがループ内にいる」コラボレーションプラットフォームを提供します究極の目標は人間の直感を置き換えることではなく、アーティスト42の創造的主体性を拡大する協力パートナーを提供することです。この分野がより没入感のあるデジタル統合パフォーマンスへと進む中で、堅牢でAIネイティブな設計プロトコルの需要は今後さらに増加するでしょう。以下のプロトコルは、GSADフレームワークを実装するための技術的ロードマップを提供し、現代の舞台芸術デザインが想像力豊かで再現性を保つことを保証します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 計算環境とデータ収集

  1. システムセットアップ(すべての計算ステップは、ディープラーニング作業に十分なGPU能力を持つワークステーション上で行われることを確認)。
    1. GPU能力が十分に備わったワークステーション上で、図 1のGSADフレームワークの基盤となるPythonプログラミング環境を構築します。
    2. 必要な依存関係をインストールし、特にPython(バージョン3.8以降)とPyTorch(バージョン2.0.1以上)の設定、そしてディープラーニングシミュレーションに必要な標準ライブラリをインストールして、一貫した実行を保証します。
    3. メモリ管理システムを高解像度画像処理に対応するように設定します。
  2. データセット収集
    1. Kaggleリポジトリから「ステージアートデザインデータセット」にアクセスし、生データを取得してください。
      注:画像は著作権基準に準拠するためのパブリックライセンス資料およびオリジナルのコンセプトデザインで構成されています。
    2. 2,500枚の高解像度JPG画像および関連メタデータを含むデータセットをダウンロードしてください。
    3. ファイル構造を確認し、ステージタイプ、パフォーマンススタイル、文化的背景ごとに分類された2,500枚の高解像度画像を含んでいることを確認してください。これによりスタイルの偏りを防ぎましょう。
    4. トレーニング前に標準化されたデータ注釈ルールを適用してください。セマンティックスクリプト要素(例:「ムーディーライティング」)を特定の十六進形カラーコードに直接マッピングし、標準化された3D座標バウンディングボックス(x, y, z)を使って照明パラメータを注釈付けして、意味から視覚への一貫性を保証します。

2. データ前処理

  1. 画像正規化
    1. 生画像データに対してMin-Max正規化を行い、すべての特徴値を均一にスケールさせ、データの安定性を向上させます。
    2. 式1を適用して、元の特徴値(M)を正規化された値(Mノルム)に変換します。
      figure-protocol-1(1)
      ここでMノルム は正規化値、Mは元の特徴値、min(M)とmax(M)はそれぞれデータセットの最小値と最大値を表します。
    3. 2に示すように、元の画像と前処理画像を比較することで収束性と特徴表現の品質が向上していることを確認します。
  2. テキストセマンティッククリーニング
    1. ステージデザインに関連するテキストスクリプトを処理し、AIを混乱させる「ノイズ」を除去します。
    2. スペルミス、余計な記号、句読点、ストップワード、一貫性のないフォーマットを排除しましょう。
    3. 意味的整合性を確保するためにテキストの大文字(小文字)を標準化する13.意味的クリーニングプロセスの例については 表1 を参照してください。
  3. トークン化
    1. きれいにしたテキストを「トークン」(単語や文字)と呼ばれる小さく管理しやすい単位に分割します。
    2. このステップで望ましくない要素を除去し、AIモデルによる正確な概念分析を容易にします。

3. 特徴抽出(GSADフレームワーク)

  1. 視覚トランスフォーマー(ViT)を用いた視覚的特徴抽出
    1. 図3に示されたViTアーキテクチャを初期化し、3Dステージアート画像を処理します。
    2. パッチ埋め込み:入力画像を固定サイズのパッチ(視覚語)に分割して次元を減らします。
    3. 2、3、4を用いて視覚的トークン(u)を構築し、位置埋め込み(u')を加えます。
      figure-protocol-2(2)
      figure-protocol-3 (3)
      figure-protocol-4 (4)
      ここでfigure-protocol-5は射影されたパッチトークンを表し、kは平坦化された入力画像パッチ、wcは線形射影の重み行列、uは展開されたパッチ列、は空間情報を保持するために追加された位置埋め込み、dは追加された分類トークンを表します。
      注意:パッチサイズ(O)や投影次元(d)などのViT変数の詳細は表2を参照してください。
    4. トランスフォーマーエンコーダー:処理済みのトークンをトランスフォーマーエンコーダーに入力します。自己注意メカニズムを使って、異なる画像パッチ間の相関(例:照明と背景)間の相関を特定しましょう。
    5. 式5から8を用いて正規化と活性化関数を適用し、最終的な特徴マップを作成します。
      figure-protocol-6(5)
      figure-protocol-7(6)
      figure-protocol-8(7)
      figure-protocol-9(8)
      ここでu'は正規化されたトークン列、RLクエリRおよびLのSCキー(スケーリング係数SC付き)から導出される自己注意重みを表し、wU値で計算される注意出力を表し、線形(w)とGeLU(w)はフィードフォワードネットワーク内の変換を表します。
    6. 4に示すように、主要な設計要素を強調しノイズを軽減する出力特徴マップを可視化します。
  2. BERTを用いたテキスト特徴抽出
    1. BERT(トランスフォーマーからの双方向エンコーダ表現)モデルを初期化してステージスクリプトを処理します。
    2. 自然言語のスクリプトを単語埋め込みを用いて連続ベクトルに変換し、意味的な意味を捉えます。特徴抽出構造については 表3 を参照してください。
    3. トークン埋め込み、セグメント埋め込み、位置埋め込みをエンコーダへの入力として組み合わせます。
    4. 図5に示されているように、トランスエンコーダユニットのステップ(マルチヘッド注意、加算&ノルム、フィードフォワード)を実行して、文脈化されたトークンシーケンスを作成します。
    5. 出力されたコンテキスト化されたトークンシーケンス(BERTの)と視覚的特徴マップ(ViTの)を連結します。この融合したマルチモーダルデータを直接条件入力ベクトルとして、ステップ4のGAN精錬モジュールに入力します。
  3. 初期コンセプト生成
    1. 抽出したテキスト特徴(BERTから)と視覚的特徴(ViTから)を拡散モデルに入力します。
    2. 統合されたマルチモーダル機能に基づいて初期の2D概念ステージ設計を生成します。
    3. これらの初期の2D概念をステップ4の生成敵対ネットワーク(GAN)に基本入力として渡し、さらにテクスチャやライティングの洗練を行ってください。

4. GANを用いたテクスチャとライティングの精緻化

  1. 生成的敵対ネットワーク(GAN)設定
    1. 図6に示すように、ジェネレーター(H)と判別器(C)からなるGSAD精錬モジュールを構築します。
    2. ディスクリミネーターを設定して実際のステージ画像と生成されたものを区別し、ジェネレーターでリアルなテクスチャやライティングを作成します。
  2. トレーニングと最適化
    1. 条件付きGAN(CGAN)の目的関数を、より良い安定性のために条件変数(y)を導入するために式9を用いて定義します。
      figure-protocol-10 (9)
      ここで x は入力段階設計条件、 y は実のターゲット画像、 z はランダムノイズベクトル、 G は生成器、 D は識別子を表します。
    2. 低照度画像強調のために、式10を適用して光強化画像出力(Hlow)を最適化します:
      figure-protocol-11 (10)
      ここでU(C, H)は目的関数、Hはジェネレーターネットワーク、Cは判別器(批評)ネットワーク、wは分布Oデータからサンプリングされた実データ、yは入力条件、zは条件付きノイズ変数、qhaは実際の高品質ステージ画像、HLowは低照度入力からのジェネレーター出力を表します。
    3. 式11を用いて特徴変換に適応変調を適用します:
      figure-protocol-12 (11)
      hEi(w) はレイヤーiの特徴マップを表し、AMは学習パラメータ i i α βi を含む適応変調関数を表し、figure-protocol-13 はレイヤーウェイト、はバイアスを表します。
    4. 生成ネットワークにおいて、空間の詳細を保持するために式12および13を用いてスキップ接続とプーリング層を実装します。
      figure-protocol-14(12)
      figure-protocol-15 (13)
      ここで Skip(w)は畳み込みブロック hEからのスキップ接続によって保存される特徴を表し、 Hjw はエンコーダ段階(0 < j ≤ 3)での最大プーリング後の出力特徴マップを表します。
  3. 画像の復元
    1. デコードフェーズで式14および15を用いてアップサンプリングと連結を行います。
      figure-protocol-16(14)
      figure-protocol-17 (15)
      ここで、up(w)は対応するskip(w)接続と連結されたアップサンプリング特徴を表し、v°Hj-1(w)はデコーダ段階(4 < j ≤7)への結合入力を表し、hout(w)は最終層の重み X8 とバイアス a 8 を用いたシグモイド活性化関数によって生成される最終的な精製ステージ画像を表します。
    2. 式16のシグモイド活性化関数を用いて最終的な精製画像出力を生成します:
      figure-protocol-18(16)
    3. アルゴリズム1(GANテクスチャライティングの擬似コード)に記載された反復訓練手順に従ってください
  4. .

アルゴリズム1:GANテクスチャライティングの擬似コード
入力:低照度ステージアート画像H(low)、 訓練反復回数N、バッチサイズB
出力:強化画像 H 強化
1: パラメータHでジェネレーターを初期化する
2: パラメータCで判別器を初期化する
3: 学習率 figure-protocol-19
4: 条件付き変数z(GANの場合は任意)
5: 適応変調パラメータ i  と β i α
6: 接続をスキップするリスト skip(w)
7: 反復 = 1 から F に対して
識別子訓練
8: 実物の画像のサンプルを一括で取る figure-protocol-20
9: ノイズやランダムな低照度画像のサンプルを抽出する
10: CGANの場合、条件付き変数zを入力に追加します
偽の画像を生成する
判別子損失を計算する
識別子パラメータを更新
発電機トレーニング
偽の画像を生成する
計算ジェネレーター損失
ジェネレーターパラメータの更新
j = 1から3の場合、

figure-protocol-21

figure-protocol-22

終わり
11: ボトルネック畳み込み
12: デコーダー/アップサンプリング
j = 5から7の場合、

figure-protocol-23

終わり
13: 出力層

figure-protocol-24

14:終わり
15:H とC 強化を返す

5. ステージレイアウト最適化(IECO)

  1. IECOの初期化
    1. ステージ要素の空間配置を最適化するためにインテリジェントゾウクラン最適化(IECO)アルゴリズムを初期化します。
    2. 「象」(潜在的な設計解決策を表す)の人口と関連する氏族を定義してください。IECOのフローチャートについては 図7 を参照してください。
  2. 移動と進化
    1. 各象の独立した動きを計算し、式17と18を用いてデザイン空間を探索します。
      figure-protocol-25 (17)
      figure-protocol-26 (18)
      ここでfigure-protocol-27は最小(figure-protocol-28)と最大(figure-protocol-29)ステップサイズの有界を持つランダム分布因子rを使って計算された移動増分を表し、figure-protocol-30は象の更新された独立空間位置を表します。
    2. 解が改善するにつれて収束を促進するために式19を用いて移動範囲を時間とともに縮小します。
    3. マトリアークアップデート:式20を用いてクランリーダー(マトリアーク)の位置をグローバルベストソリューションに向けて更新してください:
      figure-protocol-31 (19)
      ここで figure-protocol-32 は母族の新たに更新された位置を表し、 figure-protocol-33 は加重された現在位置、 figure-protocol-34 はこれまでに見つかったグローバルベストレイアウト解であり、 β は最適解の影響を制御するスケールファクターとして機能します。
    4. オス象の最新情報:式21と22を使ってオスの位置をクランの中心地に対して更新してください:
      figure-protocol-35 (20)
      figure-protocol-36 (21)
      ここでfigure-protocol-37はオ象の更新された位置を表し、figure-protocol-38は現在の基準位置、XCenterjs はすべてのオスメンバーから算出された家族の中心位置、Mdはクラン内のオス家族メンバーの総数、rpはクラン中心への移動を導くランダム分布確率を表します。
  3. 人口の置換
    1. クランセンターを計算する:まず、レイアウト解の適合度を評価します。次に、各家族の中心位置(figure-protocol-39)を式22を用いて計算します。ここでM家族メンバー数です。
      figure-protocol-40 (22)
    2. 成象の置き換え:収束速度を向上させるために、劣った「成象」(溶液)をクランセンターから生成される優れたものに置き換えます。式23を適用して新しい位置(figure-protocol-41):
      figure-protocol-42(23)
      figure-protocol-43は成象の中心位置を表し、Mf は成体家族の数、figure-protocol-44は劣等な成象の新たに計算された置換位置、figure-protocol-45は置き換えられる基準位置、figure-protocol-46figure-protocol-47は、収束を加速させるための置換プロセスを導くクラン内の優れた位置を表します。
      (注:ここで figure-protocol-48figure-protocol-49 は置換を指すために用いられる中間の重み付けポジションを表しています。)
    3. 若いゾウの置換:局所最適を防ぎ多様性を保つために、最も弱い「若いゾウ」(figure-protocol-50)を置き換えます。これらの要素の位置を式24を用いて更新します:
      figure-protocol-51 (24)
      ここで figure-protocol-52 は最も弱い若いゾウの現在の位置を示し、 figure-protocol-53 は新たに生成された位置を表します。この置換はランダム因子 rと上位クランメンバーによって駆動され、最適化プロセスが局所最適解に陥るのを防ぎ空間的多様性を保つために行われます。
    4. 終了: 更新されたクランを統合し、適応度を再計算し、 アルゴリズム2で説明された終了基準を満たすまで最適化ループを繰り返します。

アルゴリズム2:ステージレイアウトと照明配置の最適化のためのIECOの擬似コード
入力:人口サイズ M:、最大反復回数 X最大:
出力:最適なステージレイアウトと照明配置
象のクランをランダムな位置(ステージレイアウト+ライティングパラメータ)で初期化する
各ゾウの適応度を評価してください
t = 1から Xの最大値に対して:
各クランについて:
母象(最良の象)、雄象、そして若い象の独立運動を特定する
各象について:
移動増分ΔXを計算してください
独立立場の更新 figure-protocol-54
反復ごとに移動範囲を縮小する
マトリアークの最新情報

figure-protocol-55

各家長について:
グローバルベストへの位置更新
オスの象の最新情報

figure-protocol-56

figure-protocol-57

各オスの象に対して
クランの中心を計算し、成体の置換で中心に向かう位置を更新します

figure-protocol-58

figure-protocol-59

大人の氏族センターを計算します
劣った成象を小型象の代替に置き換える

figure-protocol-60

多様性を守るために最も弱い若い象を置き換えましょう
更新されたクランを統合し、すべての象の適度を再計算し、グローバルベストソリューションを更新します
世界最高のステージレイアウトと照明配置を返す

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

図1から7および表1から3に示された実験的セットアップと解析ワークフローは、GSADフレームワークのデータ前処理、特徴抽出、レイアウト最適化の強固な基盤を提供しました。

モデルトレーニングの動態と収束
GSADフレームワークの実験的評価は、舞台芸術デザインにおける有効性に関する定量的および定性的に重要なデータを得ました。モデルの学習動態は図 8A–Bに示されるように、50エポックにわたって監視されました。トレーニング精度および検証精度曲線は着実に上昇し、約98.88%の精度で安定しました。この高い精度は、モデルがナラティブスクリプトや視覚データから複雑な照明やレイアウトパターンを効果的に学習できる能力を反映しています。同時に、訓練セットと検証セットの両方の損失曲線が急激に減少し、GSADフレームワークが視覚設...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究の主な貢献は、舞台美術デザインの概念化を標準化する再現可能なAI支援ワークフローの開発です。GSADの枠組みに焦点を当てることで、著者らは伝統的な舞台美術に共通する手作業のアイデアや主観的解釈の限界を克服する構造化された方法論を提供しています。プロトコルの重要なステップは、テクスチャや照明の精緻化のためのGANの統合であり、これにより生成された映像がプロの演劇制作に必要な高精実度のリアリズムを満たすことを保証します39,44。このアプローチは、過去の生成AI作品45で指摘された「スタイルの真正性」ギャップに直接対処しています。技術の修正やトラブルシューティングに関しては、一般的な問題の解決策、特にモデルトレーニングの非収束性や生成された結果における意味バイアスのトラブルシューティング方...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは何も明かすことはありません。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者は、GSADフレームワークの開発と実施において、上海民恒理工大学の同僚の皆様から貴重なフィードバックと技術的支援をいただき、心より感謝申し上げます。このプロトコルで使用されるマルチモーダルAIモデルの訓練と検証を助けるために必要な計算ツールと公開データセットを提供してくださったオープンソースコミュニティに特別な感謝を申し上げます。また、この作業の初期草稿に対して建設的な提案をしてくださった同僚の皆さんにも感謝しています。本研究は、公共、商業、非営利分野の資金提供機関から特定の助成金を受けていません。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
BERT(トランスフォーマーからの双方向エンコーダ表現)ハグフェイストランスフォーマーオープンソース
Pythonプログラミング言語Pythonソフトウェア財団バージョン3.8以降
PyTorch ディープラーニングフレームワークLinux Foundation / Meta AIバージョン2.0.1以降
ステージアートデザインデータセットカグル・リポジトリ一般公開
ビジョントランスフォーマー(ViT)実装PyTorch画像モデル(timm)オープンソース
GPU機能を備えたワークステーションN/A(標準ハードウェア)該当なし

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Masters, P. The history and theory of environmental scenography. Theatre Perform Des. 5 (3-4), 317-319 (2019).
  2. Lotker, S., Gough, R. On scenography: editorial. Perform Res. 18 (3), 3-6 (2013).
  3. Goldschmidt, G. The dialectics of sketching. Creat Res J. 4 (2), 123-143 (1991).
  4. Tversky, B. What do sketches say about thinking. , (2002).
  5. Baugh, C. . Theatre, performance and technology: the development and transformation of scenography. , (2013).
  6. Müller, M., Montag, C. Disentangling the link between creativity and technology use: individual differences in smartphone and social media (over)use. J Creat. 34 (2), 100081 (2024).
  7. Amankwah-Amoah, J., Abdalla, S., Mogaji, E., Elbanna, A., Dwivedi, Y. K. The impending disruption of creative industries by generative AI: opportunities, challenges, and research agenda. Int J Inf Manage. 79, 102759 (2024).
  8. Zhang, H., Zhang, R. Generative artificial intelligence (AI) in built environment design and planning: a state-of-the-art review. Prog Eng Sci. 2 (1), 100040 (2025).
  9. Cetinic, E., She, J. Understanding and creating art with AI: review and outlook. ACM Trans Multimed Comput Commun Appl. 18 (2), 66 (2022).
  10. Aronson, A., Palmer, S., McKinney, J., Benedetto, S. A. D. . The history and theory of environmental scenography. , (2018).
  11. Anantrasirichai, N., Bull, D. Artificial intelligence in the creative industries: a review. Artif Intell Rev. 55 (1), 589-656 (2022).
  12. Corvello, V. Generative AI and the future of innovation management: a human-centered perspective and an agenda for future research. J Open Innov Technol Mark Complex. 11 (1), 100456 (2025).
  13. Mazzone, M., Elgammal, A. Art, creativity, and the potential of artificial intelligence. Arts. 8 (1), 26 (2019).
  14. Kadenhe, N., Al Musleh, M., Lompot, A. Human-AI co-design and co-creation: a review of emerging approaches, challenges, and future directions. Proc AAAI Symp Ser. 6 (1), 265-270 (2025).
  15. Santoso, B., Wijayanti, R. Human-AI collaboration in creative industries: workflows in media production and community-driven platforms. Trans Artif Intell Mach Learn Cogn Syst. 9 (11), 11-26 (2024).
  16. Candy, L., Edmonds, E. Practice-based research in the creative arts: foundations and futures from the front line. Leonardo. 51 (1), 63-69 (2018).
  17. Peckham, O., Raines, J., Bulsink, E., Goudswaard, M., Gopsill, J., Barton, D., et al. Artificial intelligence in generative design: a structured review of trends and opportunities in techniques and applications. Designs. 9 (4), 79 (2025).
  18. Hegab, H., Khanna, N., Monib, N., Salem, A. Design for sustainable additive manufacturing: a review. Sustain Mater Technol. 35, e00576 (2023).
  19. Reed, S., Akata, Z., Yan, X., Logeswaran, L., Schiele, B., Lee, H., et al. Generative adversarial text-to-image synthesis. , 1060-1069 (2016).
  20. Wang, G. G., Deb, S., Coelho, L. D. S. Elephant herding optimization. , 1-5 (2015).
  21. Strumberger, I., Beko, M., Tuba, M., Minovic, M., Bacanin, N. . Elephant herding optimization algorithm for wireless sensor network localization problem. , (2018).
  22. Ploennigs, J., Berger, M. AI art in architecture. AI Civ Eng. 2 (1), 8 (2023).
  23. Zhang, L., Pan, Y., Wu, X., Skibniewski, M. J. . Artificial intelligence in construction engineering and management. , (2021).
  24. Chaillou, S. . Artificial intelligence and architecture: from research to practice. , (2022).
  25. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. , 6000-6010 (2017).
  26. Li, Y., Xu, W. A deep learning-based framework for intelligent modeling: from architectural sketch to 3D model. Front Archit Res. 14 (6), 1567-1584 (2025).
  27. Dosovitskiy, A. An image is worth 16×16 words: transformers for image recognition at scale. arxiv. , (2020).
  28. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: pre-training of deep bidirectional transformers for language understanding. , (2019).
  29. Han, K., Wang, Y., Chen, H., Chen, X., Guo, J., et al. A survey on vision transformer. IEEE Trans Pattern Anal Mach Intell. 45 (1), 87-110 (2022).
  30. Woo, S., Park, J., Lee, J. Y., Kweon, I. S. CBAM: convolutional block attention module. , (2018).
  31. Qi, X., Zhi, M. A review of attention mechanisms in computer vision. , (2023).
  32. Howard, A., Sandler, M., Chen, B., Wang, W., Chen, L. C., et al. Searching for MobileNetV3. , (2019).
  33. Mehta, S., Rastegari, M. MobileViT: light-weight, general-purpose, and mobile-friendly vision transformer. arxiv. , (2021).
  34. Tan, M., Le, Q. EfficientNet: rethinking model scaling for convolutional neural networks. , (2019).
  35. Liao, W. J., Tang, C. H. Teaching strategies and practices that facilitate the development of design concepts in architectural engineering education. SAGE Open. 13 (3), 21582440231196376 (2023).
  36. Goodfellow, I. J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., et al. Generative adversarial nets. , 2672-2680 (2014).
  37. Dhariwal, P., Nichol, A. Diffusion models beat GANs on image synthesis. , (2021).
  38. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , (2019).
  39. Isola, P., Zhu, J. Y., Zhou, T., Efros, A. A. Image-to-image translation with conditional adversarial networks. , (2017).
  40. Amershi, S., Weld, D., Vorvoreanu, M., Fourney, A., Nushi, B., et al. Guidelines for human-AI interaction. , 3 (2019).
  41. Xiao, Y., Lin, X., Ji, T., Qiao, J., Ma, B., Gong, H. AI-assisted design: intelligent generation of Dong paper-cut patterns. Electronics. 14 (9), 1804 (2025).
  42. Runco, M. A. . Creativity: research, development, and practice. , (2023).
  43. Plate, D., Hutson, J. Composition pedagogy as AI-native coding: from design kit to scholarly framework. World J Arts. 2 (11), 1-10 (2025).
  44. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , 4396-4405 (2019).
  45. Berryman, J. Creativity and style in GAN and AI art: some art-historical reflections. Philos Technol. 37 (2), 61 (2024).
  46. Yan, S., Wu, C., Zhang, Y. Generative design for architectural spatial layouts: a review of technical approaches. J Asian Archit Build Eng. , 1-21 (2025).
  47. Deng, Y., Zhai, Q. Integrating deep learning in art and design: computational techniques for enhancing creative expression. Int J Adv Comput Sci Appl. 16 (2), 175-183 (2025).
  48. Mirjalili, S. The ant lion optimizer. Adv Eng Softw. 83, 80-98 (2015).
  49. Lian, Q. Optimization of image recognition technology for dance theatre creation and evaluation of its effectiveness. J Comb Math Comb Comput. 127, 1653-1665 (2025).
  50. Avila, C., Ilbay, D., Rivera, D. Human-AI teaming in structural analysis: a model context protocol approach for explainable and accurate generative AI. Buildings. 15 (17), 3190 (2025).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

関連記事