방법 논문

GSAD 프레임워크를 통한 무대 아트 디자인 및 조명 최적화의 개념 개발을 위한 재현 가능한 AI 지원 워크플로우

DOI:

10.3791/70737

2026년 5월 12일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

여기서 저자들은 생성적 스테이지 아트 디자인(GSAD) 프레임워크를 구현하는 프로토콜을 제시하는데, 이는 확산 모델, 생성적 적대 네트워크(GAN), 지능형 코끼리 클랜 최적화(IECO)를 통합한 AI 기반 워크플로우로, 내러티브 스크립트에서 최적화된 3D 시각 개념으로의 전환을 표준화하는 것입니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

인공지능(AI)은 특히 무대 예술과 무대 무대 촬영 분야에서 빠른 아이디어 탄생과 일관된 시각화를 가능하게 함으로써 창의적 디자인 과정을 근본적으로 재편하고 있습니다. 하지만 기존 워크플로우는 여전히 수작업 스케치와 주관적 해석에 크게 의존하여 확장성을 제한하고 설계팀 간 재현성을 저하시킵니다. 이 격차는 딥러닝, 생성 모델링, 최적화 기법을 통합하여 체계적이고 반복 가능한 개념 개발을 지원하는 구조화된 AI 지원 생성 스테이지 아트 디자인(GSAD) 프레임워크의 필요성을 강조합니다. GSAD 프레임워크의 핵심 목표는 초기 개념 생성을 위한 확산 모델, 텍스처 및 조명 정제를 위한 생성적 적대 네트워크(GAN), 그리고 스테이지 배치와 조명 배치를 최적화하는 지능형 코끼리 클랜 최적화(IECO)를 결합하는 것입니다. 무대 예술 디자인 데이터셋은 2,500장의 고해상도 이미지로 구성되어 있으며, 주석이 달린 극장 대본, 조명 다이어그램, 3D 레이아웃을 포함하여 다중 모드 학습을 지원합니다. 실험 평가는 스크립트 내용과 생성된 시각 자료 간의 의미적 정렬 개선, IECO 기반 공간 분석을 통한 레이아웃 최적화 효율성 향상 등 질적 지표에서 상당한 개선을 보여주었습니다. Python 기반 환경에서 프레임워크를 구현한 결과, 98.88%의 예측 정확도, 초당 26.58메가소수점 연산(MFPO), 그리고 1.08 M의 매개변수 수를 달성했습니다. GSAD 프레임워크는 확장 가능하고 재현 가능하며 기술적으로 견고한 AI 지원 워크플로우를 제공하여 창의적 산출을 향상시키고 시각적 일관성을 보장하며 현대 무대 예술 디자인에서 효율적인 개념 개발을 지원합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

무대 미술 디자인은 무대 무대, 조명, 무대 디자인, 공간적 스토리텔링을 통합한 복잡한 다학제 분야입니다 1,2. 역사적으로 무대 개념 개발은 물리적 모델, 손으로 그린 스케치, 무드 보드, 반복적인 브레인스토밍 세션을 통해 표현된 인간의 창의성에 의존해왔습니다. 3,4. 이 진화는 예술적 비전과 공연 공간의 물질적 제약 사이의 긴장에 의해 깊이 형성되었습니다. 성능 요구가 점점 더 정교해지면서, 자원 효율적이고 시각적으로 풍부하며 빠른 개념 생성에 대한 수요가 전통적인 수작업 워크플로우를 능가하고 있습니다 6,7. 생성형 인공지능(GenAI)과 대형 언어 모델(LLM)의 등장은 창작 과정을 보완하는 변혁적 길을 제공하며, 건축과 엔터테인먼트 분야에서 디자인 아이디어 창출과 공동 창작을 촉진합니다 8,9.

전통적인 무대 미술은 종종 연극 대본의 추상적 감정들이 광범위한 시행착오 없이는 정확한 시각적 동등물을 찾기 위해 고군분투하는 의미론적 간극에 직면한다 2,10. 현재 창작 산업의 AI 도구는 참조 사진의 유연한 검색 및 재조합을 가능하게 하지만, 많은 도구들이 전문 무대 제작에 필요한 구조적 엄격성을 갖추지 못합니다11,12. 더욱이, 미적 평가의 주관적 특성은 기계가 생성한 산출물을 특정 내러티브 의도와 일치시키기 어렵게 만듭니다.13. 경험 중심의 수동 워크플로우에서 데이터 기반 인간-AI 협업으로의 전환은 21세기 디자인 관행의 특징이 되어가고 있습니다14,15. 이러한 계산 도구의 통합은 디지털 도구 개발과라이브 퍼포먼스 사이의 간극을 메우는 새로운 형태의 "실천 기반" 연구를 필요로 합니다. 최근 연구들은 AI 시스템이 브레인스토밍과 광범위한 대안 탐색을 촉진할 수 있음을 강조하지만, 2D 아이디어 구상에서 3D 최적화 실현으로의 전환은 기술적으로 여전히도전적입니다.

생성형 무대 예술 디자인(GSAD) 프레임워크는 반복 가능한 AI 지원 워크플로우를 구축함으로써 이러한 한계를 해결했습니다17,18. 이 프레임워크의 근거는 원래 내러티브의 예술적 완전성을 유지하면서 디자인 구성 요소를 자동화할 필요성에서 비롯됩니다. 멀티모달 AI 시스템을 통합함으로써 디자이너들은 시각적, 언어적으로 빠르게 반복 작업을 할 수 있으며, 조명과 텍스처 세련미가 극적인 콘텐츠와 의미적으로 일치하도록 할 수 있습니다. 이 혁신의 핵심 요소는 지능형 코끼리 클랜 최적화(IECO) 알고리즘의 사용으로, 코끼리 집단의 사회적 행동에서 영감을 받아 무대 배치와 조명 배치의 복잡한 공간적 제약을 헤쳐 나가는 것입니다20,21. 이 메타휴리스틱 알고리즘 클래스는 전통적인 그라디언트 기반 방법이 실패하는 다목적 설계 문제를 해결하는 데 특히 효과적임이 입증되었습니다.

문헌의 광범위한 맥락에서, AI 기반 컴퓨터 지원 설계(CAD) 시스템은 이미 건축 워크플로우에서 최대 20%의 효율성 향상을 입증했습니다22,23. 구체적으로, AI 기반 생성 설계는 수작업으로는 상상할 수 없는 비표준 공간 토폴로지를 탐구할 수 있게 합니다. 지난 2년간의 연구들은 조건부 GAN(CGAN)을 성공적으로 활용해 2D 평면도 생성과 건축 공간 배치를 자동화했지만, 이러한 2D 생성 원리를 무대 조명과 세트 디자인의 복잡하고 3차원적인 공간 요구사항으로 확장하는 것은 여전히 매우 미흡하게 탐구되고 있습니다. 그러나 합성 신경망(CNN)과 같은 전통적인 딥러닝 모델은 복잡한 3D 단계 배열을 이해하는 데 필요한 장거리 의존성 때문에 어려움을 겪는 경우가 많습니다25,26. GSAD 프레임워크는 비전 트랜스포머(ViT)를 활용해 전역 시각적 특징과 양방향 인코더 표현을 추출하여 내러티브 의미를 포착함으로써 이러한 한계를 극복합니다(BERT). 트랜스포머가 로컬 필터보다 디자인 장면의 전역 맥락을 더 효과적으로 포착하기 때문에, 이 모델들은 공간적 관계를 보다 전체적으로 표현할 수 있게 됩니다29. 이 이중 흐름 특징 추출 덕분에 결과 스테이지 디자인은 미적으로도 일관성 있을 뿐만 아니라 내러티브적으로도 관련성이 있습니다.

GSAD 접근법이 딥 컨볼루션 임베디션 주의 메커니즘(DL-CBAM)과 같은 대안 기법에 비해 가지는 장점은 다면적입니다30,31. 이전 모델들은 모션 감지 데이터셋의 인식 정확도를 향상시켰지만, 종종 더 많은 계산 오버헤드가 필요했고 GSAD에서 볼 수 있는 공간 최적화 기능이 부족했습니다. 반면 GSAD는 1.08 M의 매개변수 수를 유지하면서 98.88%의 정확도를 달성하여 모델 복잡도와 예측 능력32,33 사이의 최적의 균형을 이룹니다. 이러한 효율성은 실시간 창의적 도구에 매우 중요하며, 모바일 규모 아키텍처가 특수설계 작업에서 성공한 사례에서 알 수 있습니다. 이로 인해 이 프레임워크는 고충실도의 재현 가능한 시각화가 필요한 전문 연극 디자이너, 디지털 아트 창작자, 건축공학 교육자들에게 매우적합합니다.

더불어, 텍스처와 조명 정제를 위한 GAN의 통합은 표준 확산 모델의 한계를 해결하는데, 이 모델은 때때로 '스타일적으로 평면적인' 출력을 낼 수 있습니다36,37. 스타일 기반 생성기를 활용함으로써, 프레임워크는 다양성과 예술적 깊이를 모두 보여주는 고해상도 텍스처를 합성할 수 있습니다. 대립적 훈련을 활용함으로써 GSAD 프레임워크는 예술적 세부 묘사와 시각적 사실성을전문 기준에 맞게 향상시킵니다. 이 접근법은 또한 저자와 편향에 관한 윤리적 우려를 완화하며, 통제 가능한 '디자이너가 루프 속에 있는' 협업 플랫폼을 제공합니다 40,41. 궁극적인 목표는 인간의 직관을 대체하는 것이 아니라, 예술가의 창의적 주체성을 확장하는 협력 파트너를 제공하는것입니다. 이 분야가 더 몰입감 있고 디지털 통합된 퍼포먼스로 나아가면서, 견고하고 AI 네이티브인 설계 프로토콜에 대한 수요는 앞으로43명으로 증가할 것입니다. 다음 프로토콜은 GSAD 프레임워크 구현을 위한 기술적 로드맵을 제공하여 현대 무대 예술 디자인이 창의적이고 재현 가능하게 유지되도록 보장합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 계산 환경 및 데이터 수집

  1. 시스템 설정 (모든 계산 단계는 딥러닝 작업에 충분한 GPU 기능이 있는 워크스테이션에서 수행되도록 보장합니다).
    1. 딥러닝 시뮬레이션을 위한 충분한 GPU 기능을 갖춘 워크스테이션에 파이썬 프로그래밍 환경을 구축하여 그림 1의 GSAD 프레임워크의 기초가 됩니다.
    2. 필요한 의존성을 설치하세요. 특히 Python(버전 3.8 이상)과 PyTorch(버전 2.0.1 이상)를 구성하고, 딥러닝 시뮬레이션에 필요한 표준 라이브러리를 포함하여 일관된 실행을 보장합니다.
    3. 메모리 관리 시스템을 고해상도 이미지 처리에 맞게 설정하세요.
  2. 데이터셋 수집
    1. Kaggle 저장소에서 "스테이지 아트 디자인 데이터셋"에 접근하여 원시 데이터를 획득하세요.
      참고: 이미지는 저작권 기준을 준수하기 위해 공공 라이선스 자료와 독창적인 개념 디자인으로 구성되어 있습니다.
    2. 2,500장의 고해상도 JPG 이미지와 관련 메타데이터가 포함된 데이터셋을 다운로드하세요.
    3. 파일 구조를 확인하여 무대 유형, 공연 스타일, 문화적 배경별로 분류된 2,500장의 고해상도 이미지를 포함해 스타일 편향을 방지하세요.
    4. 교육 전에 표준화된 데이터 주석 규칙을 적용하세요. 의미 스크립트 요소(예: '분위기 조명')를 특정 16진수 색상 코드에 직접 매핑하고, 표준화된 3D 좌표 경계 박스(x, y, z)를 사용해 조명 매개변수를 주석하여 의미에서 시각적 매핑으로의 일관성을 보장합니다.

2. 데이터 전처리

  1. 이미지 정규화
    1. 원시 이미지 데이터에 대해 최소-최대 정규화를 수행하여 모든 특징값을 균일하게 스케일링하고 데이터 안정성을 향상시킵니다.
    2. 방정식 1을 적용하여 원래 특징값(M)을 정규화된 값(M노름)으로 변환합니다:
      figure-protocol-1(1)
      여기서 M노름 은 정규화된 값을, M은 원래 특징값을, min(M)과 max(M)는 각각 데이터셋의 최소값과 최대값입니다.
    3. 원본 이미지와 사전 처리된 이미지를 비교하여 수렴 및 특징 표현 품질이 향상되었는지 확인하라( 그림 2에 나타난 것처럼).
  2. 텍스트 의미 정리
    1. 무대 디자인과 관련된 텍스트 스크립트를 처리하여 AI를 혼란스럽게 할 수 있는 '잡음'을 제거하세요.
    2. 오타, 불필요한 기호, 구두점, 중단어, 일관성 없는 형식을 제거하세요.
    3. 의미적 일관성을 보장하기 위해 텍스트 대문자(소문자)를 표준화하세요.13. 의미 정리 과정의 예시는 표 1 을 참조하십시오.
  3. 토큰화
    1. 정리된 텍스트를 '토큰'(단어 또는 문자)이라 불리는 더 작고 관리 가능한 단위로 나누세요.
    2. 이 단계에서 원하지 않는 성분을 제거하여 AI 모델의 정밀한 개념 분석을 용이하게 하세요.

3. 특징 추출 (GSAD 프레임워크)

  1. 비전 트랜스포머(ViT)를 이용한 시각적 특징 추출
    1. 그림 3에 나타난 ViT 아키텍처를 초기화하여 3D 스테이지 아트 이미지를 처리합니다.
    2. 패치 임베딩: 입력 이미지를 고정 크기의 패치(시각적 단어)로 나누어 차원성을 줄입니다.
    3. 시각적 토큰(u)을 구성하고 위치 임베딩(u')을 추가하여 방 정식 2, 3, 4를 사용한다:
      figure-protocol-2(2)
      figure-protocol-3 (3)
      figure-protocol-4 (4)
      여기서 figure-protocol-5 는 투영된 패치 토큰, k는 평탄화된 입력 이미지 패치, wc는 선형 투영 가중치 행렬, u는 펼쳐진 패치 시퀀스, 는 공간 정보를 유지하기 위해 추가된 위치 임베딩, d는 추가된 분류 토큰입니다.
      참고: 패치 크기(O)와 투영 차원(d)과 같은 ViT 변수에 대한 자세한 설명은 표 2를 참조하십시오.
    4. 트랜스포머 인코더: 처리된 토큰을 트랜스포머 인코더에 입력합니다. 자기 주의 메커니즘을 사용해 서로 다른 이미지 패치(예: 조명과 배경) 간의 상관관계를 식별하세요.
    5. 방정식 5부터 8까지 정규화 및 활성화 함수를 적용하여 최종 특징 지도를 생성합니다:
      figure-protocol-6(5)
      figure-protocol-7(6)
      figure-protocol-8(7)
      figure-protocol-9(8)
      u'는 정규화된 토큰 시퀀스이고, RLRLSC 키(스케일링 팩터 SC 포함)에서 도출된 자기 주의 가중치를, wU 값을 사용해 계산된 주의 출력이며, 선형(w)과 GeLU(w)는 피드포워드 네트워크 내의 변환을 나타냅니다.
    6. 출력 특징 맵을 시각화하면, 주요 설계 요소를 강조하고 노이즈를 줄이기 위해 그림 4에 나타난다.
  2. BERT를 이용한 텍스트 특징 추출
    1. BERT(변압기의 양방향 인코더 표현) 모델을 초기화하여 스테이지 스크립트를 처리합니다.
    2. 단어 임베딩을 사용하여 자연어 스크립트를 연속 벡터로 변환하여 의미적 의미를 포착합니다. 특징 추출 구조는 표 3 을 참조하십시오.
    3. 토큰 임베딩, 세그먼트 임베딩, 위치 임베딩을 인코더에 입력할 때 결합합니다.
    4. 그림 5에 나타난 트랜스포머 인코더 유닛 단계(멀티헤드 주의, 덧셈 및 정규, 피드 포워드)를 실행하여 맥락화된 토큰 시퀀스를 생성합니다.
    5. 출력된 맥락화된 토큰 시퀀스(BERT에서)와 시각적 특징 맵(ViT에서)을 연결합니다. 이 융합된 멀티모달 데이터를 4단계에서 GAN 정제 모듈에 직접 조건부 입력 벡터로 입력합니다.
  3. 초기 개념 생성
    1. 추출한 텍스트 특징(BERT)과 시각적 특징(ViT)을 확산 모델에 입력합니다.
    2. 통합된 멀티모달 특징을 기반으로 초기 2D 개념 단계 설계를 생성하세요.
    3. 이 초기 2D 개념들을 4단계에서 생성적 적대 네트워크(GAN)에 기본 입력으로 전달하여 텍스처와 조명을 더 세밀하게 다듬으세요.

4. GAN을 이용한 텍스처 및 조명 정제화

  1. 생성적 적대 네트워크(GAN) 설정
    1. 그림 6에 나타난 것처럼 생성자(H)와 판별기(C)로 구성된 GSAD 정제 모듈을 구성합니다.
    2. 판별기를 설정해 실제 스테이지 이미지와 생성된 이미지를 구분하고, 생성기를 설정해 사실적인 텍스처와 조명을 생성하세요.
  2. 훈련 및 최적화
    1. 조건부 GAN(CGAN)의 목적 함수를 방정식 9를 사용하여 조건 변수 (y)를 도입하여 더 나은 안정성을 위해 정의합니다:
      figure-protocol-10 (9)
      여기서 x는 입력 단계 설계 조건, y는 실제 목표 이미지, z는 무작위 잡음 벡터, G는 생성기, D는 판별기입니다.
    2. 저조도 이미지 향상을 위해 방정식 10을 적용하여 빛 강화 이미지 출력(Hlow)을 최적화합니다:
      figure-protocol-11 (10)
      여기서 U(C, H)는 목적값 함수, H는 생성기 네트워크, C는 판별기(비판자) 네트워크, w는 분포 O데이터에서 샘플링한 실수 데이터, y는 입력 조건, z는 조건부 잡음 변수, qha는 실제 고품질 스테이지 이미지, HLow는 저조도 입력에서 발생한 생성기 출력을 나타냅니다.
    3. 형 변환에 적응 변조를 적용하여 식 11을 사용하세요:
      figure-protocol-12 (11)
      hEi(w)는 계층 i의 특징 맵을 나타내고, AM은 학습된 매개변수 i와 α β i를 가진 적응 변조 함수이며, figure-protocol-13 는 레이어 가중치, 는 편향입니다.
    4. 생성 네트워크에서 방정식 12와 13을 사용하여 스킵 연결과 풀링 계층을 구현하여 공간적 세부 사항을 보존합니다:
      figure-protocol-14(12)
      figure-protocol-15 (13)
      여기서 Skip(w)는 합성곱 블록 hE에서 스킵 연결을 통해 보존된 특징을 나타내고, Hjw 는 인코더 단계(0 < j ≤ 3)에서 최대 풀링 후의 출력 특징 맵을 나타냅니다.
  3. 이미지 재구성
    1. 디코딩 단계에서 식14와 15를 사용하여 업샘플링과 연결 작업을 수행합니다:
      figure-protocol-16(14)
      figure-protocol-17 (15)
      여기서 up(w)은 해당 skip(w) 연결과 연결된 업샘플링 특징을 나타내고, v°Hj-1(w)는 디코더 단계(4 < j ≤7)의 결합 입력을 나타내며, hout(w)은 최종 계층의 가중치 X8 과 바이어스 a 8을 이용한 시그모이드 활성화 함수를 통해 생성된 최종 정제된 단계 이미지입니다.
    2. 식16의 시그모이드 활성화 함수를 사용하여 최종 정제된 이미지 출력을 생성합니다:
      figure-protocol-18(16)
    3. 알고리즘 1(GAN텍스처 조명 정제의 의사코드)에 명시된 반복 훈련 절차를 따르세요
  4. .

알고리즘 1: GAN 텍스처 조명 정제의 의사코드
입력: 저조도 스테이지 아트 이미지 H(low), 훈련 반복 횟수 N, 배치 크기 B
출력: 향상된 이미지 H 향상
1: 매개변수 H로 생성기 초기화
2: 매개변수 C로 판별기를 초기화한다
3: 학습률 figure-protocol-19
4: 조건부 변수 z (GAN의 경우 선택 사항)
5: 적응형 변조 매개변수 α i βi
6: 연결 건너뛰기 목록 skip(w)
7: 반복 = 1에서 F 대해 다음을 수행한다
식별자 훈련
8: 실제 이미지 샘플 배치 figure-protocol-20
9: 노이즈/무작위 저조도 이미지 샘플링
10: CGAN이라면 입력에 조건부 변수 z를 추가합니다
가짜 이미지 생성
판별 손실 계산
판별기 매개변수를 업데이트하세요
발전기 교육
가짜 이미지 생성
계산 생성기 손실
생성기 매개변수 업데이트
j = 1에서 3일 때 다음을 수행한다

figure-protocol-21

figure-protocol-22


11: 병목 합성곱
12: 디코더/업샘플링
j = 5에서 7에 대해 do를 수행한다.

figure-protocol-23


13: 출력 계층

figure-protocol-24

14: 끝
15: H 와 C 강화 반환

5. 스테이지 배치 최적화(IECO)

  1. IECO 초기화
    1. 지능형 코끼리 클랜 최적화(IECO) 알고리즘을 초기화하여 스테이지 요소의 공간적 배열을 최적화합니다.
    2. "코끼리"(잠재적 설계 해결책을 나타냄)와 관련된 씨족의 개체군을 정의하세요. IECO 플로우차트는 그림 7 을 참조하십시오.
  2. 이동과 진화
    1. 각 코끼리가 디자인 공간을 탐색할 수 있는 독립적인 움직임을 17과 18을 사용하여 계산합니다:
      figure-protocol-25 (17)
      figure-protocol-26 (18)
      여기서 figure-protocol-27 는 최소figure-protocol-28 ()와 최대figure-protocol-29 () 발걸음 사이에 경계가 있는 무작위 분포 계수 r을 사용해 계산된 이동 증가량이며, figure-protocol-30 는 코끼리의 업데이트된 독립 공간 위치입니다.
    2. 해가 개선됨에 따라 수렴을 용이하게 하기 위해 방정식 19를 사용하여 이동 범위를 시간에 따라 줄이세요.
    3. 가계장 업데이트: 씨족 리더(가계장)의 위치를 전 세계 최선의 해법에 대해 식20을 사용해 업데이트하세요:
      figure-protocol-31 (19)
      여기서 figure-protocol-32 는 모계 대성의 새롭게 업데이트된 위치, figure-protocol-33 는 가중 현재 위치, figure-protocol-34 는 지금까지 발견된 전역 최적 배치 해이며, β 는 최적 해의 영향을 조절하는 척도 요인 역할을 합니다.
    4. 수컷 코끼리 업데이트: 수컷 코끼리의 위치를 클랜 센터에 대해 21, 22식 사용:
      figure-protocol-35 (20)
      figure-protocol-36 (21)
      여기서 figure-protocol-37 는 수컷 코끼리의 업데이트된 위치, 는 figure-protocol-38 현재 기준 위치, XCenterjs 는 모든 수컷 구성원을 통해 계산된 가족 씨족의 중심 위치, M은 씨족 내 남성 가족 구성원 총수, rp는 씨족 중심지로 이동하는 무작위 분포 확률입니다.
  3. 인구 대체
    1. 클랜 센터 계산: 먼저 레이아웃 솔루션의 적합도를 평가하세요. 그다음 각 가족 씨족의 중심 위치(figure-protocol-39)를 식22를 사용하며, 여기서 Mf는 가족 구성원 수를 나타냅니다:
      figure-protocol-40 (22)
    2. 성체 코끼리 대체: 수렴 속도를 높이기 위해 열등한 '성체 코끼리'(솔루션)를 클랜 센터에서 생성된 우수한 솔루션으로 대체합니다. 식23을 적용하여 새로운 위치를 계산합니다 (figure-protocol-41):
      figure-protocol-42(23)
      figure-protocol-43 여기서 는 성체 코끼리의 중심 위치, Mf 는 성체 가족 구성원 수, figure-protocol-44 열등한 성체 코끼리의 새로 계산된 대체 위치, figure-protocol-45 교체 중인 기준 위치, figure-protocol-46 와 는 figure-protocol-47 대체 과정을 촉진하는 데 사용되는 씨족 내 상위 위치를 나타냅니다.
      (참고: 여기, figure-protocol-48figure-protocol-49 대체 항목을 안내하는 중간 가중치 포지션을 나타냅니다.)
    3. 어린 코끼리 대체: 국소적 최적을 방지하고 다양성을 유지하기 위해 가장 약한 '어린 코끼리'를 교체합니다(figure-protocol-50). 이 원소들의 위치를 식24를 사용하여 업데이트합니다:
      figure-protocol-51 (24)
      여기서 figure-protocol-52 는 가장 약한 어린 코끼리의 현재 위치를 나타내며 figure-protocol-53 , 는 새로 생성된 위치입니다. 이 치환은 무작위 요인 r과 상위 클랜 구성원에 의해 구동되며, 최적화 과정이 국소적 최적에 빠지는 것을 방지하고 공간적 다양성을 유지합니다.
    4. 해고: 업데이트된 클랜을 병합하고, 적합도를 재계산한 뒤, 알고리즘 2에 설명된 종료 기준이 충족될 때까지 최적화 루프를 반복하세요.

알고리즘 2: 무대 배치 및 조명 배치 최적화를 위한 IECO의 의사코드
입력: 인구 크기 M:, 최대 반복 횟수 X최대:
결과물: 최적 무대 배치 및 조명 배치
코끼리 무리를 랜덤 위치(스테이지 레이아웃 + 조명 매개변수)로 초기화하세요
각 코끼리의 체력 평가
t = 1에서 X최대 값에 대해:
각 클랜에 대해:
모족장(최고의 코끼리), 수컷 코끼리, 그리고 어린 코끼리 독립 운동을 식별하세요
각 코끼리에 대해:
이동 증가 ΔXmax를 계산합니다
독립 입장 업데이트 figure-protocol-54
반복 동안 이동 범위를 줄이기
모계 주체 업데이트

figure-protocol-55

각 가부장에 대해:
글로벌 최고 순위로 위치 업데이트
수컷 코끼리 업데이트

figure-protocol-56

figure-protocol-57

수컷 코끼리마다
클랜 센터를 계산하고 성체 대체 센터 쪽 위치를 업데이트합니다

figure-protocol-58

figure-protocol-59

성인의 씨족 중심지 계산
열등한 성체를 우수한 코끼리 대체

figure-protocol-60

다양성을 유지하기 위해 가장 약한 어린 코끼리들을 교체하세요
업데이트된 클랜을 병합하고, 모든 코끼리의 적합도를 재계산하며, 글로벌 최적 해법을 업데이트하세요
전 세계 최고의 무대 배치와 조명 배치를 반환합니다

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

그림 1부터 7, 표 1부터 3에 나타난 실험 설정과 분석 워크플로우는 GSAD 프레임워크의 데이터 전처리, 특징 추출, 레이아웃 최적화에 견고한 기반을 제공했습니다.

모델 훈련 역학과 수렴
GSAD 프레임워크의 실험적 평가는 무대 예술 디자인에서의 효과에 관한 상당한 정량적·정성적 데이터를 제공하였습니다. 모델의 학습 역학은 50개 시대에 걸쳐 모니터링되었으며, 이는 그림 8A–B에 나타난 것입니다. 훈련 및 검증 정확도 곡선은 꾸준히 상승하여 약 98.88%의 정확도로 안정화되었습니다. 이 높은 정확도는 모델이 내러티브 스크립트와 시각 데이터를 통해 복잡한 조명과 레이아웃 패턴을 효과적으로 학습할 수 있는 능력을 반영합니다. 동시에...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구의 주요 기여는 무대 예술 디자인의 개념화를 표준화하는 재현 가능한 AI 지원 워크플로우 개발입니다 2,10. GSAD 프레임워크에 집중함으로써, 저자들은 전통적인 무대 무대 제작에서 흔히 볼 수 있는 수작업 아이디어 생성과 주관적 해석의 한계를 극복하는 구조화된 방법론을 제시합니다. 프로토콜 내에서 중요한 단계는 텍스처와 조명 정제를 위한 GAN의 통합으로, 생성된 시각 효과가 전문 극장 제작에 필요한 고충실한 사실성을 충족하도록 보장합니다39,44. 이 접근법은 이전 생성형 AI 작품45에서 언급된 '스타일 진정성' 격차를 직접적으로 해결합니다. 기법의 수정 및 문제 해결과 관련해서는, 일반적인 문제의 해결책...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 공개할 것이 없습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자는 GSAD 프레임워크 개발 및 구현 과정에서 제공해 주신 통찰력 있는 피드백과 기술 지원에 대해 상하이민항 폴리테크닉 동료들에게 진심으로 감사드립니다. 이 프로토콜에서 사용된 다중 모달 AI 모델의 학습 및 검증을 용이하게 한 필수 계산 도구와 공개 데이터셋을 제공해 주신 오픈 소스 커뮤니티에 특별히 감사드립니다. 또한 이 작업의 초기 초안에 대해 건설적인 제안을 해주신 동료들께도 감사드립니다. 이 연구는 공공, 상업, 비영리 부문의 자금 지원 기관으로부터 별도의 보조금을 받지 않았습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
BERT (변압기로부터의 양방향 인코더 표현)포옹 페이스 트랜스포머오픈 소스
파이썬 프로그래밍 언어파이썬 소프트웨어 재단버전 3.8 이상
PyTorch 딥러닝 프레임워크리눅스 재단 / 메타 AI버전 2.0.1 이상
스테이지 아트 디자인 데이터셋캐글 저장소공개 접근 가능
비전 트랜스포머(ViT) 구현파이토치 이미지 모델 (timm)오픈 소스
GPU 기능이 있는 워크스테이션해당 없음 (표준 하드웨어)해당 없음

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Masters, P. The history and theory of environmental scenography. Theatre Perform Des. 5 (3-4), 317-319 (2019).
  2. Lotker, S., Gough, R. On scenography: editorial. Perform Res. 18 (3), 3-6 (2013).
  3. Goldschmidt, G. The dialectics of sketching. Creat Res J. 4 (2), 123-143 (1991).
  4. Tversky, B. What do sketches say about thinking. , (2002).
  5. Baugh, C. . Theatre, performance and technology: the development and transformation of scenography. , (2013).
  6. Müller, M., Montag, C. Disentangling the link between creativity and technology use: individual differences in smartphone and social media (over)use. J Creat. 34 (2), 100081 (2024).
  7. Amankwah-Amoah, J., Abdalla, S., Mogaji, E., Elbanna, A., Dwivedi, Y. K. The impending disruption of creative industries by generative AI: opportunities, challenges, and research agenda. Int J Inf Manage. 79, 102759 (2024).
  8. Zhang, H., Zhang, R. Generative artificial intelligence (AI) in built environment design and planning: a state-of-the-art review. Prog Eng Sci. 2 (1), 100040 (2025).
  9. Cetinic, E., She, J. Understanding and creating art with AI: review and outlook. ACM Trans Multimed Comput Commun Appl. 18 (2), 66 (2022).
  10. Aronson, A., Palmer, S., McKinney, J., Benedetto, S. A. D. . The history and theory of environmental scenography. , (2018).
  11. Anantrasirichai, N., Bull, D. Artificial intelligence in the creative industries: a review. Artif Intell Rev. 55 (1), 589-656 (2022).
  12. Corvello, V. Generative AI and the future of innovation management: a human-centered perspective and an agenda for future research. J Open Innov Technol Mark Complex. 11 (1), 100456 (2025).
  13. Mazzone, M., Elgammal, A. Art, creativity, and the potential of artificial intelligence. Arts. 8 (1), 26 (2019).
  14. Kadenhe, N., Al Musleh, M., Lompot, A. Human-AI co-design and co-creation: a review of emerging approaches, challenges, and future directions. Proc AAAI Symp Ser. 6 (1), 265-270 (2025).
  15. Santoso, B., Wijayanti, R. Human-AI collaboration in creative industries: workflows in media production and community-driven platforms. Trans Artif Intell Mach Learn Cogn Syst. 9 (11), 11-26 (2024).
  16. Candy, L., Edmonds, E. Practice-based research in the creative arts: foundations and futures from the front line. Leonardo. 51 (1), 63-69 (2018).
  17. Peckham, O., Raines, J., Bulsink, E., Goudswaard, M., Gopsill, J., Barton, D., et al. Artificial intelligence in generative design: a structured review of trends and opportunities in techniques and applications. Designs. 9 (4), 79 (2025).
  18. Hegab, H., Khanna, N., Monib, N., Salem, A. Design for sustainable additive manufacturing: a review. Sustain Mater Technol. 35, e00576 (2023).
  19. Reed, S., Akata, Z., Yan, X., Logeswaran, L., Schiele, B., Lee, H., et al. Generative adversarial text-to-image synthesis. , 1060-1069 (2016).
  20. Wang, G. G., Deb, S., Coelho, L. D. S. Elephant herding optimization. , 1-5 (2015).
  21. Strumberger, I., Beko, M., Tuba, M., Minovic, M., Bacanin, N. . Elephant herding optimization algorithm for wireless sensor network localization problem. , (2018).
  22. Ploennigs, J., Berger, M. AI art in architecture. AI Civ Eng. 2 (1), 8 (2023).
  23. Zhang, L., Pan, Y., Wu, X., Skibniewski, M. J. . Artificial intelligence in construction engineering and management. , (2021).
  24. Chaillou, S. . Artificial intelligence and architecture: from research to practice. , (2022).
  25. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., et al. Attention is all you need. , 6000-6010 (2017).
  26. Li, Y., Xu, W. A deep learning-based framework for intelligent modeling: from architectural sketch to 3D model. Front Archit Res. 14 (6), 1567-1584 (2025).
  27. Dosovitskiy, A. An image is worth 16×16 words: transformers for image recognition at scale. arxiv. , (2020).
  28. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: pre-training of deep bidirectional transformers for language understanding. , (2019).
  29. Han, K., Wang, Y., Chen, H., Chen, X., Guo, J., et al. A survey on vision transformer. IEEE Trans Pattern Anal Mach Intell. 45 (1), 87-110 (2022).
  30. Woo, S., Park, J., Lee, J. Y., Kweon, I. S. CBAM: convolutional block attention module. , (2018).
  31. Qi, X., Zhi, M. A review of attention mechanisms in computer vision. , (2023).
  32. Howard, A., Sandler, M., Chen, B., Wang, W., Chen, L. C., et al. Searching for MobileNetV3. , (2019).
  33. Mehta, S., Rastegari, M. MobileViT: light-weight, general-purpose, and mobile-friendly vision transformer. arxiv. , (2021).
  34. Tan, M., Le, Q. EfficientNet: rethinking model scaling for convolutional neural networks. , (2019).
  35. Liao, W. J., Tang, C. H. Teaching strategies and practices that facilitate the development of design concepts in architectural engineering education. SAGE Open. 13 (3), 21582440231196376 (2023).
  36. Goodfellow, I. J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., et al. Generative adversarial nets. , 2672-2680 (2014).
  37. Dhariwal, P., Nichol, A. Diffusion models beat GANs on image synthesis. , (2021).
  38. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , (2019).
  39. Isola, P., Zhu, J. Y., Zhou, T., Efros, A. A. Image-to-image translation with conditional adversarial networks. , (2017).
  40. Amershi, S., Weld, D., Vorvoreanu, M., Fourney, A., Nushi, B., et al. Guidelines for human-AI interaction. , 3 (2019).
  41. Xiao, Y., Lin, X., Ji, T., Qiao, J., Ma, B., Gong, H. AI-assisted design: intelligent generation of Dong paper-cut patterns. Electronics. 14 (9), 1804 (2025).
  42. Runco, M. A. . Creativity: research, development, and practice. , (2023).
  43. Plate, D., Hutson, J. Composition pedagogy as AI-native coding: from design kit to scholarly framework. World J Arts. 2 (11), 1-10 (2025).
  44. Karras, T., Laine, S., Aila, T. A style-based generator architecture for generative adversarial networks. , 4396-4405 (2019).
  45. Berryman, J. Creativity and style in GAN and AI art: some art-historical reflections. Philos Technol. 37 (2), 61 (2024).
  46. Yan, S., Wu, C., Zhang, Y. Generative design for architectural spatial layouts: a review of technical approaches. J Asian Archit Build Eng. , 1-21 (2025).
  47. Deng, Y., Zhai, Q. Integrating deep learning in art and design: computational techniques for enhancing creative expression. Int J Adv Comput Sci Appl. 16 (2), 175-183 (2025).
  48. Mirjalili, S. The ant lion optimizer. Adv Eng Softw. 83, 80-98 (2015).
  49. Lian, Q. Optimization of image recognition technology for dance theatre creation and evaluation of its effectiveness. J Comb Math Comb Comput. 127, 1653-1665 (2025).
  50. Avila, C., Ilbay, D., Rivera, D. Human-AI teaming in structural analysis: a model context protocol approach for explainable and accurate generative AI. Buildings. 15 (17), 3190 (2025).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

관련 논문