Bu içeriği görüntülemek için JoVE aboneliğiniz gereklidir. Giriş yapın veya ücretsiz denemenizi bugün başlatın.

Araştırma makalesi

Bir Derin Öğrenme Çerçevesi Kullanarak Somut Olmayan Kültürel Miras Desenlerinin Semantik Segmentasyon Rehberliğinde Yeniden Yapılandırılması ve Sanatsal Stil Sentezi

45 görüntülenme

DOI:

10.3791/71577

14 Ağustos 2026

Bu makalede

Özet

Bu protokol; dijital koruma ve yaratıcı miras uygulamalarını desteklemek amacıyla, transformer tabanlı özellik çıkarımı, adversaryal yeniden yapılandırma ve uzamsal olarak uyarlanabilir görüntü oluşturma yöntemlerini kullanarak somut olmayan kültürel miras desenlerinin semantik segmentasyonu, yeniden yapılandırılması ve sanatsal stil sentezi için bir derin öğrenme iş akışını açıklamaktadır.

Özet

Derin öğrenme tabanlı görüntü sentezleme tekniklerinin ilerlemesiyle birlikte, somut olmayan kültürel miras (SOKM) desenlerinin dijital olarak korunması ve yeniden yapılandırılması giderek daha fazla dikkat çekmektedir. Mevcut SegCycle-SPADE tabanlı yaklaşımlar, geleneksel zanaat desenlerinin yapısal segmentasyonu ve sanatsal yeniden yapılandırılması konusunda potansiyel göstermiştir; ancak, sınırlı veri seti çeşitliliği, kültürel semantiğin yetersiz entegrasyonu ve yeniden yapılandırma sırasında yapısal desen özelliklerinin yetersiz korunması gibi kısıtlamalar devam etmektedir. Bu zorlukları aşmak için bu çalışma, SOKM desen türlerinin semantik segmentasyonu ve sanatsal yeniden yapılandırılması için geliştirilmiş bir SegCycle-SPADE çerçevesi önermektedir. Motif sınırlarını ve desen bölgelerini doğru bir şekilde belirlemek için Transformer tabanlı bir segmentasyon modeli olan SegFormer kullanılmıştır. Ayrıca, kültürel açıdan anlamlı motifleri güçlendirmek ve özellik temsilini iyileştirmek için bir Çapraz-Dikkat Kültürel Özellik Füzyon Modülü tanıtılmıştır. Desen çevirisi ve yeniden yapılandırma CycleGAN kullanılarak gerçekleştirilirken, segmentasyon haritaları ile üretilen görüntüler arasında semantik tutarlılığı sağlamak için sanatsal stil sentezinde Mekansal-Adaptif Denormalizasyon (SPADE) kullanılmıştır. Model genellemesini ve sanatsal çeşitliliği artırmak için çerçeve, hem Miao Batik kültürel motif veri seti hem de WikiArt veri seti kullanılarak eğitilmiştir. Deneysel sonuçlar, önerilen dikkat yönlendirmeli SegCycle-SPADE çerçevesinin, mevcut üretken çekişmeli ağ (GAN) tabanlı yeniden yapılandırma yöntemlerine kıyasla segmentasyon doğruluğunu ve miras deseni yeniden yapılandırma performansını artırdığını göstermektedir. Önerilen çerçeve, yapay zeka destekli kültürel miras belgeleme, yeniden yapılandırma ve geleneksel desen tasarımlarının sanatsal olarak canlandırılması için ölçeklenebilir bir çözüm sunmaktadır.

Giriş

Gelenekler, diller ve inançlar gibi somut olmayan unsurların yanı sıra sanat eserleri, binalar ve yazılı kayıtlar gibi somut unsurları da içeren kültürel miras; insan tarihinin, yaratıcılığının ve kimliğinin temel bir dışavurumudur1. Miras koruması, toplulukların kökenleriyle yeniden bağ kurmalarını sağlamayı amaçlar ve gelecek nesillerin ortak kültürel belleklerinden faydalanmalarına olanak tanır. Ayrıca kültürlerarası anlayışı, çeşitli gelenek ve göreneklerin takdir edilmesini ve farklı tarihsel anlatıların tanınmasını teşvik eder. Bu kültürel varlıklar, önceki nesillerin değerlerini, bakış açılarını ve deneyimlerini anlamamıza yardımcı olur; çağdaş sosyal kimliklerin oluşumuna ve kültürel sürekliliğe katkıda bulunur. Kültürel mirasın korunmasının temel ilkeleri Şekil 1'de gösterilmiştir.

Segmentasyon süreci: veri toplama, ön işleme, SegCycle-SPADE çerçevesi; değerlendirme metrikleri.
Şekil 1SegCycle-SPADE Çerçevesini Kullanarak Kültürel Miras Desen Rekonstrüksiyonuna İlişkin Kavramsal Genel Bakış. Somut olmayan kültürel miras desenlerinin yeniden yapılandırılması ve iyileştirilmesi için önerilen yaklaşımın şematik gösterimi. İş akışı; Miao Batik ve WikiArt veri setlerinden veri seti toplama, görüntü ön işleme, SegFormer-B2 kullanılarak semantik segmentasyon, Çapraz Dikkat Kültürel Özellik Füzyon Modülü (CAFFM) kullanılarak özellik füzyonu, CycleGAN kullanılarak desen yeniden yapılandırma, SPADE kullanılarak sanatsal stil sentezi ve segmentasyon ile yeniden yapılandırma metrikleri kullanılarak nihai değerlendirme aşamalarını içermektedir. Oklar, çerçeve boyunca veri ve özellik temsillerinin akışını göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

İnsan toplumunun kolektif hafızası ve kültürel mirası, sanatsal ifade ve kültürel kimlik için önemli bir araç olan somut olmayan kültürel miras (SOK) ile somutlaşmaktadır. Ancak SOK, küreselleşme ve dijitalleşmenin etkileri nedeniyle önemli zorluklarla karşı karşıyadır2,3,4. Tehlike altındaki birçok SOK uygulaması, yetkin zanaatkâr sayısındaki azalma ve modern pazarlara sınırlı uyum yeteneği nedeniyle koruma ve geliştirme konusunda yeni yaklaşımlara ihtiyaç duymaktadır5,6. SOK araştırmalarının önemli bir alanı olan sürdürülebilir tasarım; kültür, toplum ve çevrenin entegre gelişimini vurgulayarak SOK'un sürekliliğinin sağlanması için pratik bir yol sunar. Sürdürülebilir tasarım yaklaşımları aracılığıyla SOK, çağdaş toplumun ihtiyaçlarına uyum sağlarken yeniden canlandırılabilir7,8.

Bu çalışmada, “somut olmayan kültürel miras desenleri” terimi, temelindeki somut olmayan kültürel değerleri ileten ve koruyan görsel motif temsillerini ifade etmektedir. Sonuç olarak, önerilen çerçeve, bu motiflerin görsel formlarını yeniden oluştururken, onlarla ilişkili kültürel bilgileri korumayı ve belgelemeyi amaçlamaktadır.

Miao nakışı ve batiki, kuşlar, kelebekler ve ata totemleri gibi sembolik motifler aracılığıyla Miao topluluğunun tarihini, inançlarını ve geleneklerini yansıtan Çin somut olmayan kültürel mirasının (ICH) önemli formlarıdır9. Bu motifler, ritüel giysilerine ve festival uygulamalarına derinlemesine yerleşmiş olup yerel kültürel ve ekonomik gelişime katkıda bulunur10,1. Dijital teknolojilerdeki gelişmeler, özellikle yapay zeka (AI) ve derin öğrenme (DL), kültürel mirasın korunması, analizi, yeniden oluşturulması ve belgelenmesi için yeni fırsatlar yaratmıştır. Çin'in en iyi korunmuş batik geleneklerinden biri olan Guizhou Miao batiki, Miao halkının kültürel bilgisini, inançlarını, geleneklerini ve ritüellerini aktarmak için önemli bir araç görevi görmektedir12,13,14,15,16.

Son çalışmalar, DL'nin kültürel mirasın korunması ve desen yeniden yapılandırması potansiyelini ortaya koymuş; U-Net ve DeepLabV3+1'e kıyasla geliştirilmiş segmentasyon doğruluğu (piksel doğruluğu = %8,6, ortalama birlik üzerinden kesişim [IoU]= %78,1) ve yeniden yapılandırma performansı elde etmiştir. Bununla birlikte, bazı zorluklar devam etmektedir. Mevcut üretken çekişmeli ağ (GAN) tabanlı yaklaşımlar, karmaşık desenlerdeki ince yapısal detayları korumakta genellikle zorlanırken17, sınırlı veri kümesi çeşitliliği modelin farklı kültürel alanlar genelindeki genelleme yeteneğini kısıtlamaktadır18. Ayrıca, CycleGAN gibi görüntüden görüntüye çeviri modelleri, segmentasyon haritaları ile üretilen görüntüler arasındaki anlamsal tutarlılığı korumada yetersiz kalabilir19 ve dikkat mekanizmalarının eksikliği, yeniden yapılandırma sırasında kültürel açıdan anlamlı motif detaylarının kaybına yol açabilir20. Bu nedenle, etkili bir Somut Olmayan Kültürel Miras (ICH) desen yeniden yapılandırması için transformer tabanlı segmentasyon, dikkat güdümlü özellik öğrenimi ve çoklu veri kümesi eğitimini entegre eden geliştirilmiş bir çerçeveye ihtiyaç duyulmaktadır.

Miao nakışının dijitalleştirilmesi ve üretken yapay zekanın hızlı gelişimi sayesinde kültürel mirasın korunması için yeni fırsatlar ortaya çıkmıştır. Gelişmekte olan bir derin üretken modeller sınıfı olan difüzyon modelleri, güçlü içerik üretim yetenekleri sayesinde bilgisayarlı görü görevlerinde dikkat çekici bir performans göstermiştir21,2,23,24,25. Ters difüzyon işlemi sırasında model, gürültülü temsillerden orijinal giriş verilerini yeniden yapılandırmayı kademeli olarak öğrenir26,27,28. Önceki çalışmalar ayrıca kültürel mirasın korunması ve yaygınlaştırılması için üç boyutlu yeniden yapılandırma ve bilgisayar destekli tasarım (CAD) teknolojilerinin uygulanmasını da araştırmıştır.

Evrişimli sinir ağları (CNN'ler) ve GAN'lar görüntü oluşturma ve özellik koruma konularında iyi performans gösterseler de, sınırlı alıcı alanlar, mod çökmesi ve eğitim kararsızlığı ile ilgili zorluklarla karşılaşmaya devam etmektedirler29. SegFormer ve Segmenter gibi Transformer tabanlı mimariler, küresel bağlamı ve semantik ilişkileri yakalamada başarılıdır; ancak, hesaplama açısından yoğundurlar ve ince detaylarda zorlanabilirler. Stable Diffusion gibi difüzyon modelleri güçlü görüntü oluşturma yetenekleri sergilese de, genellikle oluşturulan tasarımların yapısal ve sanatsal özellikleri üzerinde hassas kontrole sahip değildirler. Dahası, mevcut yaklaşımların çoğu, segmentasyon ve üretim bileşenleri arasında etkili bilgi paylaşımını ve iş birlikçi optimizasyonu sınırlayan bağımsız eğitim stratejileri kullanmaktadır; bu durum, yapısal doğruluk ile sanatsal özgünlük arasında bir ödünleşmeye yol açmaktadır30.

Latent difüzyon ve Stable Diffusion gibi güncel difüzyon tabanlı modeller yüksek kaliteli görüntü sentezi gerçekleştirse de, iteratif gürültü giderme gerektirmeleri nedeniyle artan hesaplama maliyeti ve çıkarım süresine yol açarlar. Ayrıca, özel koşullandırma mekanizmaları olmadan ince kültürel motiflerin ve yapısal tutarlılığın korunması zor olmaya devam etmektedir. Transformer tabanlı üretici modeller, küresel bağlamsal ilişkileri etkili bir şekilde yakalasa da genellikle büyük ölçekli veri kümelerine ve önemli hesaplama kaynaklarına ihtiyaç duyarlar. Buna karşılık, önerilen SegCycle-Mekansal Adaptif Denormalizasyon (SegCycle-SPADE) çerçevesi; açık yapısal rehberlik sağlamak için SegFormer tabanlı segmentasyon, çapraz dikkat (cross-attention) özellik füzyonu, CycleGAN rekonstrüksiyonu ve SPADE rehberliğinde sentezi birleştirerek motif korunumunu, anlamsal tutarlılığı ve kültürel miras desenlerinin kontrol edilebilir rekonstrüksiyonunu iyileştirir.

Modern semantik segmentasyon tekniklerinin çoğu, U şeklinde mimarilere sahip tam CNN'lere (FCNN'ler) dayanmaktadır31. Kodlama aşamasında, bir dizi konvolüsyon ve alt örnekleme işlemi aracılığıyla geniş alıcı alanlara sahip derin özellikler çıkarılır. Kod çözme aşaması, üst örnekleme yoluyla uzamsal çözünürlüğü kademeli olarak geri yükleyerek nihayetinde piksel düzeyinde semantik tahmine olanak tanır. Alt örnekleme sırasında meydana gelen uzamsal bilgi kaybını telafi eden ve geniş bir uygulama yelpazesinde segmentasyon performansını artıran atlama bağlantıları, farklı kodlayıcı seviyelerinden gelen yüksek çözünürlüklü bilgilerin doğrudan kod çözücüye entegre edilmesini sağlar32.

Son dönemdeki GAN tabanlı, CNN tabanlı ve difüzyon tabanlı yöntemler görüntü oluşturma ve kültürel miras restorasyonunda gelecek vadeden sonuçlar göstermiş olsa da, semantik tutarlılığı korumakta, ince yapısal motifleri muhafaza etmekte ve farklı kültürel desenler genelinde tekrarlanabilir yeniden yapılandırmayı sağlamakta sıklıkla zorlanmaktadırlar. Mevcut yaklaşımların çoğu segmentasyonu, yeniden yapılandırmayı ve stil sentezini ayrı süreçler olarak ele almaktadır; bu durum, kültürel açıdan anlamlı unsurların kaybına ve tutarsız çıktılara yol açabilmektedir. Bu metodolojik boşluğu gidermek için bu çalışma, SegFormer tabanlı semantik segmentasyon, yeni bir Çapraz Dikkatli Kültürel Özellik Füzyon Modülü (CAFFM), CycleGAN tabanlı yeniden yapılandırma ve SPADE güdümlü stil sentezini entegre eden birleşik bir SegCycle-SPADE çerçevesi önermektedir. Yapısal segmentasyon bilgilerini üretken özellik öğrenimiyle açıkça entegre eden önerilen çerçeve, hem kültürel özgünlüğü hem de sanatsal kaliteyi korurken, somut olmayan kültürel miras (ICH) motiflerinin daha güvenilir, semantik olarak tutarlı ve tekrarlanabilir bir şekilde yeniden yapılandırılmasını sağlamaktadır.

Bu çalışmada, mevcut kültürel miras yeniden yapılandırma yaklaşımlarının üç temel sınırlaması belirlenmiştir: (i) GAN tabanlı yeniden yapılandırma yöntemlerinde ince yapısal motiflerin yetersiz korunması; (ii) küçük veya alana özgü veri kümeleri üzerinde eğitim yapılması sonucunda ortaya çıkan sınırlı genelleme yeteneği ve (iii) görüntüden görüntüye çeviri çerçevelerinde segmentasyon çıktıları ile üretilen görüntüler arasındaki yetersiz semantik tutarlılık. Ayrıca segmentasyon, yeniden yapılandırma ve stil sentezi genellikle ayrı süreçler olarak ele alınmakta, bu da yeniden yapılandırma sırasında kültürel açıdan önemli öğelerin kaybına yol açmaktadır. Transformer tabanlı semantik segmentasyon, çapraz dikkat özellik füzyonu, CycleGAN yeniden yapılandırma ve SPADE rehberliğinde sanatsal sentezi tek bir mimaride birleştiren önerilen SegCycle-SPADE çerçevesi, bu sınırlamaları gidermekte ve somut olmayan kültürel miras (ICH) desenlerinin yeniden yapılandırılmasında motif korumasını, semantik tutarlılığı ve sanatsal özgünlüğü iyileştirmektedir.

Bu çalışmanın temel amacı, Somut Olmayan Kültürel Miras (ICH) desenlerinin anlamsal segmentasyon güdümlü sanatsal yeniden yapılandırması için geliştirilmiş bir SegCycle-SPADE çerçevesi geliştirmektir. Çerçeve, kültürel motiflerin doğru segmentasyonu için SegFormer'ı, desen yeniden yapılandırması için CycleGAN'ı ve stil açısından tutarlı sanatsal sentez için SPADE'i entegre eder. Özellik temsilini iyileştirmek ve ince yapısal detayları korumak amacıyla, segmentasyon ve üretici özellikler arasında etkili etkileşimi kolaylaştırmak için bir CAFFM sunulmuştur. Miao Batik ve WikiArt veri setleri üzerinde eğitilen önerilen çerçeve; yeniden yapılandırma gerçekliğini, stil tutarlılığını ve kültürel açıdan önemli motiflerin korunmasını artırmaktadır.

Bu çalışma; semantik segmentasyon, dikkat güdümlü özellik füzyonu, desen yeniden yapılandırma ve stil sentezini birleşik bir mimari içinde birleştirerek, Somut Olmayan Kültürel Miras (SOKÜM) desenlerinin sanatsal yeniden yapılandırılması için özgün bir SegCycle-SPADE çerçevesi sunmaktadır. Bu çalışmanın temel katkıları şunlardır. İlk olarak, SegFormer entegrasyonu yoluyla, karmaşık kültürel motiflerin ve yapısal unsurların doğru bir şekilde çıkarılmasını ve korunmasını sağlayan yeni bir semantik segmentasyon güdümlü yeniden yapılandırma çerçevesi geliştirilmiştir. İkinci olarak, segmentasyon özelliklerini üretici temsillerle etkili bir şekilde birleştirmek için yeni bir CAFFM tanıtılmıştır; bu sayede modelin, kültürel motifler ile sanatsal stil desenleri arasındaki uzun menzilli ilişkileri yakalaması sağlanmıştır. Üçüncü olarak, önerilen CAFFM, yeniden yapılandırılan miras desenlerinin görsel gerçekçiliğini ve yapısal tutarlılığını artırırken kültürel açıdan anlamlı unsurların korunmasını güçlendirmektedir. Dördüncü olarak, kültürel desen yeniden yapılandırması için CycleGAN ve segmentasyon güdümlü sanatsal sentez için SPADE entegre edilerek, çerçeve üretilen çıktılarda hem semantik doğruluğu hem de stilistik özgünlüğü sağlamaktadır. Beşinci olarak, genelleştirme yeteneğini ve sanatsal çeşitliliği artırmak amacıyla model, kültürel desen öğrenimi için Miao Batik kültürel motif veri seti ve sanatsal stil temsili için WikiArt veri seti kullanılarak eğitilmiştir. WikiArt, Miao kültürel miras ürünlerinde doğrudan uygulama için bir hedef stil olarak değil, çerçevenin farklı görsel bağlamlardaki genelleme kabiliyetini, özellik öğrenme sağlamlığını ve stil kontrol etkinliğini değerlendirmek için yardımcı bir veri seti olarak kullanılmıştır. Son olarak, mevcut GAN tabanlı kültürel miras yeniden yapılandırma yöntemleriyle karşılaştırıldığında, deneysel sonuçlar, önerilen SegCycle-SPADE çerçevesinin daha iyi segmentasyon doğruluğu, yeniden yapılandırma kalitesi ve stilistik tutarlılık sağladığını göstermektedir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Önerilen SegCycle-SPADE çerçevesi; semantik segmentasyon, dikkat mekanizması kullanılarak özellik geliştirme, üretken yeniden yapılandırma ve sanatsal stil sentezi yoluyla geleneksel kültürel miras desenlerini yeniden yapılandırmak ve iyileştirmek için tasarlanmıştır. Bu çalışmada, Miao Batik veri seti ve WikiArt veri seti dahil olmak üzere kamuya açık kültürel miras ve sanatsal görüntü veri setleri kullanılmıştır. Araştırmada insan katılımcılar, hasta verileri, kişisel bilgiler, hayvan denekler veya klinik kayıtlar yer almamıştır; bu nedenle, kurumsal etik kurul onayı ve bilgilendirilmiş onam gerekmemiştir. Başlangıçta, değerlendirme için Miao Batik kültürel motif veri seti ve WikiArt veri seti kullanılmıştır. Quan ve ark. (2024)32 tarafından tanımlanan Miao Batik veri seti, geleneksel Miao batik motiflerine ait 15.148 adet etiketlenmiş görüntü içermektedir. Veri seti oluşturucuları tarafından sağlanan mevcut etiketlemeler doğrudan kullanılmış ve bu çalışmada ek manuel etiketleme yapılmamıştır. Ardından, görüntülerin ön işlemesi; yeniden boyutlandırma, normalleştirme, gürültü giderme ve bir segmentasyon maskesi oluşturma işlemleriyle gerçekleştirilmiştir. Kesin ön işleme parametreleri, Veri Ön İşleme alt bölümünde açıklanmıştır. Önerilen çerçeve, verilerin semantik segmentasyonu için SegFormer-B2 adlı transformer tabanlı bir model kullanmaktadır. Bu yöntem, kültürel motiflerin anahtar bölgelerini tespit etmek ve yapılarını öğrenmek için tasarlanmıştır. Segmentlere ayrılmış özellikler daha sonra, kültürel motiflerle ilgili önemli bilgilerin vurgulandığı ve ilgisiz bilgilerin ayıklandığı bir dikkat mekanizması aracılığıyla geliştirilmiştir. Dikkat mekanizması konfigürasyonu, CAFFM alt bölümünde açıklanmıştır. Geliştirilen özellikler daha sonra, hasarlı yapıların döngüsel öğrenme yoluyla yeniden yapılandırıldığı CycleGAN'a aktarılmıştır. Eğitim sırasında, orijinal Miao Batik görüntülerine rastgele maskeleme ve kısmi kapatma işlemleri uygulanarak yapay olarak eksik motif örnekleri oluşturulmuştur. Bu bozulma prosedürleri, yıpranmış kültürel miras eserlerinde yaygın olarak gözlemlenen eksik motif bölgelerini ve yapısal hasarları simüle etmiştir. Elde edilen eksik görüntüler CycleGAN yeniden yapılandırma modülüne girdi olarak kullanılırken, karşılık gelen orijinal görüntüler yeniden yapılandırma hedefleri olarak hizmet etmiştir. Yeniden yapılandırılan kültürel miras desenleri daha sonra, üretilen segmentasyon haritalarına dayanarak sanatsal iyileştirmenin gerçekleştirildiği SPADE aracılığıyla geliştirilmiştir. Önerilen çerçevenin performansı, kantitatif segmentasyon ve görüntü kalitesi metrikleri kullanılarak değerlendirilmiş; yeniden yapılandırılan kültürel motiflerin görsel özgünlüğü ise kalitatif olarak incelenmiştir. Görsel özgünlük, üretilen kültürel desenlerin görsel denetimi yoluyla değerlendirilmiş ve bağımsız bir kantitatif metrik olarak kullanılmamıştır. Değerlendirme; motiflerin korunması, semantik tutarlılık, kültürel özellikler, yapısal uyumluluk ve ilgili referans kültürel motiflere göre sanatsal görünüm üzerine odaklanmıştır. Model performansının kantitatif değerlendirmesi; Segmentasyon Doğruluğu, IoU, Dice Katsayısı, Yapısal Benzerlik İndeksi (SSIM), Tepe Sinyal-Gürültü Oranı (PSNR) ve Fréchet Başlangıç Mesafesi (FID) kullanılarak gerçekleştirilmiştir. Şekil 2, önerilen SegCycle-SPADE çerçevesinin genel iş akışını göstermekte ve bu çalışmada kullanılan değerlendirme metriklerini özetlemektedir.

Semantik segmentasyon diyagramı; veri kümeleri, işleme, CAFFM, örüntü yeniden yapılandırma, değerlendirme metrikleri.
Şekil 2Önerilen SegCycle-SPADE Çerçevesinin Genel Mimari İş Akışı. Tam SegCycle-SPADE iş akışına genel bakış. Miao Batik ve WikiArt veri setlerinden alınan görüntüler; SegFormer-B2 kullanılarak semantik segmentasyon, CAFFM kullanılarak özellik iyileştirme, CycleGAN kullanılarak desen yeniden yapılandırma ve SPADE kullanılarak sanatsal stil üretimi süreçlerinden geçirilmeden önce ön işlemlere tabi tutulur. Model performansı Segmentasyon Doğruluğu, Kesişim üzerinden Birleşim (IoU), Dice Katsayısı, Yapısal Benzerlik İndeksi Ölçümü (SSIM), PSNR ve Fréchet Inception Mesafesi (FID) kullanılarak değerlendirilirken, görsel özgünlük nitel olarak analiz edilir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Kültürel miras desen rekonstrüksiyonu için geliştirilen SegCycle-SPADE çerçevesi, Şekil 2'de gösterildiği üzere, doğru motif segmentasyonu, rekonstrüksiyonu ve sanatsal geliştirme için birden fazla DL bileşenini entegre etmek üzere tasarlanmıştır. Çeşitli kültürel desenler ve sanatsal stiller sağlamak amacıyla Miao Batik kültürel motif veri seti ve WikiArt veri setinden alınan görüntüler kullanılmıştır. Başlangıçta, görüntüler, kültürel motifleri arka plandan tanımlamak ve ayırmak için SegFormer tabanlı bir semantik segmentasyon modülü kullanılarak işlenir. Genel mimari dört ana aşamadan oluşmaktadır. İlk olarak, SegFormer modeli kültürel desen görüntülerinden semantik segmentasyon haritaları çıkarır. İkinci olarak, CAFFM, özellik öğrenimini geliştirmek için segmentasyon özelliklerini üretici temsillerle entegre eder. Üçüncü olarak, CycleGAN modülü, kaynaştırılmış özellik temsillerini kullanarak kültürel desenleri rekonstrükte eder. Son olarak, SPADE modülü, segmentasyon kılavuzlu sentez yoluyla yapısal tutarlılığı korurken stilistik olarak geliştirilmiş çıktılar üretir. İyileştirilmiş özellik haritaları daha sonra, bozulmuş desenleri karşılık gelen tam formlarına eşleyerek eksik kültürel motifleri geri yüklemeyi öğrenen CycleGAN rekonstrüksiyon modülü tarafından işlenir. Eksik motif örnekleri, orijinal Miao Batik görüntülerine rastgele maskeleme ve kısmi oklüzyon işlemleri uygulanarak oluşturulmuş; böylece hasarlı kültürel eserlerde yaygın olarak gözlenen eksik desen bölgeleri ve yapısal bozulmalar simüle edilmiştir. Her bir bozulmuş görüntü, eğitim sırasında rekonstrüksiyon hedefi olarak hizmet eden karşılık gelen orijinal görüntüsüyle eşleştirilmiştir. Bu strateji, CycleGAN modülünün, semantik tutarlılığı ve kültürel açıdan önemli karakteristikleri korurken eksik motif yapılarının restorasyonunu öğrenmesini sağlamıştır. Son olarak SPADE üreteci, görüntü sentezini üretilen segmentasyon haritalarına koşullandırarak görsel olarak geliştirilmiş sanatsal çıktılar üretir ve böylece sanatsal geliştirme süreci boyunca kültürel motiflerin yapısal bütünlüğünü korur.

Önerilen SegCycle-SPADE çerçevesinde aşağıdaki adımlar yer almaktadır.

Adım 1: Veri Seti Toplama
Kültürel desen öğrenimi ve sanatsal stil üretimi hedeflerine ulaşmak için iki veri seti kullanılmıştır. Geleneksel kültürel desen bilgilerini sağlamak amacıyla Miao Batik Kültürel Motif Veri Seti kullanılmıştır. Veri seti, Zenodo (https://doi.org/10.5281/zenodo.20807658) üzerinden halka açık olarak erişilebilirdir ve geleneksel Miao batik motiflerine ait 15.148 adet etiketlenmiş görüntü içermektedir. Veri setini oluşturanlar tarafından sağlanan mevcut etiketlemeler doğrudan kullanılmış ve bu çalışmada ek olarak manuel etiketleme yapılmamıştır. Sanatsal stil üretimi için çeşitli sanatsal stil bilgileri sağlamak amacıyla WikiArt veri seti kullanılmış ve bu veri seti halka açık WikiArt deposundan (https://www.wikiart.org/) elde edilmiştir.

Adım 2: Veri Ön İşleme
Tüm görüntüler; yeniden boyutlandırma, normalizasyon ve gürültü azaltma işlemleriyle ön işlemeden geçirilmiştir. Semantik segmentasyon aşamasını desteklemek amacıyla, orijinal veri seti kaynaklarından elde edilen mevcut kültürel motif açıklamaları kullanılmıştır. Bu çalışma kapsamında herhangi bir ek açıklama veya yeniden etiketleme işlemi gerçekleştirilmemiştir.

Adım 3: SegFormer Kullanarak Semantik Desen Segmentasyonu
Kültürel motif segmentasyonu için SegFormer modeli kullanılmıştır. Kesin SegFormer omurgası ve başlatma stratejisi, Semantic Pattern Segmentation Using SegFormer alt bölümünde açıklanmıştır. Spesifik olarak, semantik motif segmentasyonu için ImageNet ile önceden eğitilmiş bir MIT-B2 omurgasına sahip SegFormer-B2 mimarisi kullanılmıştır. Bu model, geleneksel kültürel desenlerin karmaşık yapısal detaylarını korurken küresel bağlamsal bilgileri etkili bir şekilde yakalamaktadır.

Adım 4: CAFFM
CAFFM, semantik segmentasyon özelliklerini üretici temsillerle birleştirerek çerçevenin hem yapısal motif özelliklerini hem de sanatsal stil bilgilerini öğrenmesini sağlar. CAFFM'nin entegrasyon detayları CAFFM alt bölümünde verilmiştir. Modül, SegFormer tabanlı semantik segmentasyon aşaması ile üretici yeniden yapılandırma aşaması arasında konumlandırılmış olup, burada segmentasyondan türetilen yapısal özellikleri çok başlı çapraz dikkat (multi-head cross-attention) aracılığıyla yeniden yapılandırma özellikleriyle kaynaştır. Bu işlem, kültürel motiflerin korunmasını iyileştirir ve yeniden yapılandırılan çıktıların gerçekçiliğini artırır.

Adım 5: Desen Yeniden Yapılandırma (CycleGAN)
Birleştirilmiş özellikler, kültürel desen yapılarını yeniden oluşturmak için daha sonra CycleGAN modülü tarafından işlenir. CycleGAN mimarisi ve eğitim yapılandırması CycleGAN Kullanarak Desen Yeniden Yapılandırma alt bölümünde açıklanmıştır. Yeniden yapılandırma modülü, iki jeneratör ve iki diskriminatörden oluşur; dokuz rezidüel blok içeren bir rezidüel ağ jeneratör mimarisi kullanır, bir PatchGAN diskriminatörü uygular ve adversariyal ile döngüsel tutarlılık kayıpları kullanılarak eğitilir. Bu yapılandırma, çift yönlü alan eşlemesine olanak tanır ve eksik kültürel desen yapılarının yeniden yapılandırılmasını kolaylaştırır.

Adım 6: Sanatsal Stil Üretimi (SPADE)
Yeniden yapılandırılan desenler, ardından segmentasyon kılavuzlu sanatsal stil sentezi gerçekleştirmek üzere SPADE modülü aracılığıyla işlenir. SPADE jeneratör yapılandırması, SPADE Kullanarak Sanatsal Stil Üretimi alt bölümünde açıklanmıştır. Modül; SPADE rezidüel bloklar, mekansal olarak uyarlanabilir normalizasyon katmanları ile SegFormer segmentasyon haritaları ve CAFFM özellik temsillerinden türetilen semantik koşullandırmayı kullanır. Görüntü üretimi segmentasyon haritalarına koşullandırılarak, sentezlenen çıktıların orijinal kültürel motiflerle yapısal hizalamayı koruması ve aynı zamanda sanatsal stil özelliklerini bünyesinde barındırması sağlanır.

Adım 7: Performans Tahmini
Önerilen çerçeve; Segmentasyon Doğruluğu, IoU, Dice Benzerlik Katsayısı (Dice), SSIM, PSNR ve FID dahil olmak üzere çok sayıda segmentasyon ve görüntü kalitesi değerlendirme metriği kullanılarak değerlendirilmiştir. Deneysel tutarlılığı ölçmek için tüm deneyler farklı rastgele tohumlar kullanılarak beş kez tekrarlanmış ve sonuçlar ortalama ± standart sapma olarak raporlanmıştır. İstatistiksel anlamlılık, p < 0,05 anlamlılık eşiği ile eşli t-testleri kullanılarak değerlendirilmiştir.

Veri Kümesi Toplama
SegCycle-SPADE'in önerilen çerçevesinde, kültürel desen anlayışı ve stil öğrenimi için iki veri kümesi kullanılmaktadır. Önerilen çerçevede kullanılan ilk veri kümesi, Miao Batik kültürel motif veri kümesidir. Bu veri kümesi, Miao etnik sanatında kullanılan hayvanlar, bitkiler ve geometrik şekiller gibi motifler içeren geleneksel Miao Batik imgelerinden oluşan Miao Batik kültürel motiflerini içerir. Bu veri kümesi, kültürel mirasın korunması için genellikle önemli olan zengin doku bilgisine sahip imgeler içermektedir. SegCycle-SPADE'in önerilen çerçevesinde kullanılan ikinci veri kümesi ise WikiArt veri kümesidir. Bu veri kümesi, genellikle farklı stillerde olan çok sayıda sanat eseri içermektedir. Bu veri kümesi, sanat eserlerini geliştirmek için genellikle faydalı olan karmaşık stil öğrenimi için kullanılmaktadır. Bu veri kümesi, 27 farklı tasarıma sahip HD çözünürlükte 80.0 sanat eseri içermekte olup, bu durum onu DL tabanlı stil üretimi veya dönüştürme görevleri için daha kullanışlı kılmaktadır.

Miao Batik Veri Seti:
Miao Batik veri seti (https://doi.org/10.5281/zenodo.20807658), kültürel açıdan önemli motifleri betimleyen 15.148 batik deseni görüntüsünden oluşmaktadır. Görüntüler; hayvan motifleri (örneğin kelebekler ve balıklar), bitki tabanlı desenler ve kültürel sembolizm taşıyan geometrik motifler gibi çeşitli geleneksel tasarımları içermektedir. Bu veri seti, desen yeniden yapılandırma sırasında segmentasyon modülünün motif sınırlarını doğru bir şekilde tanımlamasını ve korumasını sağlayan otantik kültürel yapılar sunduğu için önerilen çerçevenin önemli bir bileşenidir (Tablo 1). Bu çalışmada, kültürel açıdan önemli motifler; kuşlar, kelebekler, çiçek desenleri ve ata totemleri dahil olmak üzere, Miao kültürel miras literatüründe yaygın olarak belgelenen ve veri seti açıklamalarında temsil edilen sembolik görsel unsurları ifade etmektedir. Bu motifler, yalnızca görünme sıklıklarına veya mekansal kompozisyonlarına göre değil, belgelenmiş kültürel önemleri ve geleneksel Miao batik ile nakış tasarımlarında tekrarlanan varlıkları temel alınarak seçilmiştir. Uzman rehberliğindeki motif açıklamaları ve segmentasyon etiketleri, orijinal Miao Batik veri seti kaynağından alınmış ve bu çalışmada doğrudan kullanılmıştır. Yazarlar tarafından herhangi bir ek manuel açıklama, yeniden etiketleme veya uzman rehberliğinde açıklama işlemi gerçekleştirilmemiştir. Veri seti oluşturucuları tarafından sağlanan mevcut açıklamalar, semantik segmentasyon eğitimi ve değerlendirmesi için kullanılmıştır.

ParametreAçıklama
Veri Seti AdıMiao Batik Kültürel Desen Veri Seti
Veri Kümesi KaynağıZenodo Deposu (DOI: 10.5281/zenodo.20807658)
AlanSomut Olmayan Kültürel Miras (SOKÜM) / Tekstil Desen Analizi
Toplam Görüntü Sayısı15.148 görüntü
Görüntü TipiGeleneksel Miao batik tekstil desenlerinin dijital görüntüleri
Desen KategorileriHayvan motifleri, bitki motifleri ve geometrik motifler
Kültürel KökenMiao etnik kültürü, Guizhou Eyaleti, Çin
Orijinal Görüntü ÇözünürlüğüÖnişlemden önce ham taramalar veya fotoğraflar olarak yakalanmış yüksek çözünürlüklü görüntüler (tipik olarak kısa kenarı ≥ 1.0 piksel)
Eğitim ÇözünürlüğüÖnişleme sırasında görüntüler 256 × 256 piksele yeniden boyutlandırıldı
Anotasyon KullanılabilirliğiVeri seti oluşturucuları tarafından sağlanan mevcut segmentasyon anotasyonları, eğitim ve değerlendirme için herhangi bir değişiklik yapılmadan kullanılmıştır. Bu çalışmada ek bir manuel anotasyon, yeniden etiketleme veya uzman onay prosedürü uygulanmamıştır.
Bu Çalışmadaki UygulamaKültürel motif segmentasyonu, özellik çıkarımı, motif koruma ve örüntü yeniden yapılandırma

Tablo 1: Miao Batik Kültürel Desen Veri Setinin Özellikleri. Semantik segmentasyon, kültürel desen analizi ve motif yeniden yapılandırması için kullanılan Miao Batik kültürel motif veri setinin özeti. Tablo; veri seti kaynağını, görüntü özelliklerini, motif kategorilerini, kültürel kökeni, görüntü çözünürlüğünü ve önerilen SegCycle-SPADE çerçevesindeki rolünü tanımlamaktadır.

WikiArt Veri Seti:
WikiArt veri seti [https://www.wikiart.org/], 27 farklı sanatsal stilde 80.0'den fazla görüntü içeren popüler ve büyük ölçekli bir dijital sanat deposudur. Tablo 2Stiller arasında Rönesans sanatı, İzlenimcilik, Kübizm ve Sürrealizm yer almaktadır. Veri seti, SPADE modülünün segmentasyon sürecinden elde edilen yapısal bilgileri korurken kültürel açıdan zenginleştirilmiş desenler oluşturmasına olanak tanıyan bilgiler sunduğu için önerilen çerçevede oldukça önemlidir. Veri seti, eğitim için 56.0 ve hem doğrulama hem de test için 12.0 görüntüden oluşmaktadır. Veri setindeki görüntüler, derin öğrenme (DL) modelinin etkili bir şekilde eğitilmesine yardımcı olmaktadır.

ParametreAçıklama
Veri Seti AdıWikiArt Veri Seti
Veri Seti KaynağıWikiArt Deposu (https://www.wikiart.org/)
AlanDijital Sanat ve Tablolar
Toplam Görüntü SayısıYaklaşık 80,0 sanat eseri
Eğitim Görüntüleri56,0
Doğrulama Görüntüleri12,0
Test Görüntüleri12,0
Sanat StilleriRönesans, Empresyonizm, Kübizm, Sürrealizm, Ekspresyonizm, Realizm ve Soyut Sanat dahil olmak üzere 27 sanat stili
Orijinal Görüntü ÇözünürlüğüOrijinal görüntü çözünürlükleri sanat eserlerine ve kaynaklara göre farklılık göstermektedir. Görüntüler, ön işleme sırasında 256 × 256 piksel şeklinde tek tip bir çözünürlüğe yeniden boyutlandırılmıştır.
Eğitim ÇözünürlüğüGörüntüler, sanat stili öğrenimi ve segmentasyon güdümlü görüntü sentezi öncesindeki ön işleme aşamasında 256 × 256 piksele yeniden boyutlandırılmıştır.
Veri Seti Bölümleme42 sabit rastgele tohumu kullanılarak yapılan tabakalı rastgele bölümleme (%70 eğitim, %15 doğrulama ve %15 test)
Stil Örnekleme StratejisiEğitim, doğrulama ve test alt kümelerinde 27 sanat stilinin dağılımını korumak için tabakalı orantılı örnekleme uygulanmıştır
Bu Çalışmadaki UygulamasıSanat stili öğrenimi, stil temsili ve segmentasyon güdümlü sanatsal sentez

Tablo 2: WikiArt Veri Setinin Özellikleri. Artistik stil öğrenimi ve stil yönlendirmeli görüntü sentezi için kullanılan WikiArt veri setinin özeti. Tablo; veri seti kaynağını, görüntü dağılımını, artistik stil kapsamını, veri seti bölümlendirmesini, görüntü çözünürlüğünü ve önerilen SegCycle-SPADE çerçevesindeki uygulamasını açıklamaktadır.

Miao Batik veri seti, geleneksel Miao kültürel motiflerini temsil eden 15.148 görüntü içermektedir.32 Veri setine Zenodo (https://doi.org/10.5281/zenodo.20807658) üzerinden halka açık olarak erişilebilir. Model eğitimi öncesinde tüm görüntüler görsel olarak incelenmiş, 256 × 256 piksel boyutuna getirilmiş, normalize edilmiş ve bozuk veya yinelenen örnekler için taranmıştır. Kalite kontrol taraması sonucunda herhangi bir görüntü dışlanmamıştır; bu nedenle, sonraki analizler için 15.148 görüntünün tamamı muhafaza edilmiştir. Veri seti bölme işlemlerinin tekrarlanabilirliğini sağlamak amacıyla, 42 sabit rastgele tohumu (random seed) kullanılarak eğitim (%70), doğrulama (%15) ve test (%15) alt kümelerine rastgele bölünmüştür. WikiArt veri setine resmi WikiArt deposu (https://www.wikiart.org/) aracılığıyla erişilmiş olup, veri seti 27 sanatsal stili kapsayan 80.0'den fazla sanat eseri içermektedir. Stil öğrenme deneyleri için 56.00 görüntü eğitim, 12.0 görüntü doğrulama ve 12.0 görüntü test için kullanılmıştır.

Veri Ön İşleme
Önerilen SegCycle-SPADE çerçevesinin eğitimi öncesinde, tutarlı görüntü kalitesi ve doğru öznitelik temsili sağlamak amacıyla Miao Batik kültürel motif veri seti ve WikiArt veri seti çeşitli ön işleme adımlarına tabi tutulmuştur. Gauss gürültü giderme, normalizasyon, tutarlı bir giriş çözünürlüğüne yeniden boyutlandırma ve görüntü kalitesi doğrulamasını içeren aynı temel ön işleme hattı her iki veri setine de uygulanmıştır. Bununla birlikte, veri setleri çerçeve içerisinde farklı roller üstlenmiştir. WikiArt veri seti sanatsal stil öğrenimi ve sentezi için kullanılırken, Miao Batik veri seti öncelikle kültürel motif segmentasyonu ve yeniden yapılandırma için kullanılmıştır. Bu göreve özgü roller dışında veri setine özel herhangi bir ön işleme değişikliği yapılmamıştır. DL modelinin tutarlı bir şekilde işlem yapmasını sağlamak için görüntüler önce sabit bir çözünürlüğe yeniden boyutlandırılmıştır. Her iki veri setindeki görüntülerin kaynaklarına bağlı olarak çözünürlüklerinin farklılık göstermesi nedeniyle bu adım gerekli olmuştur. Yeniden boyutlandırma, hesaplama verimliliğini artırmış ve boyutsal tutarsızlıkların eğitimi etkilemesini önlemiştir. İkinci ön işleme adımı, eğitim sırasında gradyan güncellemelerini stabilize etmek için piksel değerlerinin standartlaştırılmış bir aralığa ölçeklendirildiği normalizasyondur. Görüntüler daha sonra, kültürel motif yapılarını bozabilecek gürültüyü azaltmak için Gauss filtreleme kullanılarak işlenmiştir. Miao Batik veri seti için, orijinal veri seti kaynağından doğrudan elde edilen mevcut kültürel motif segmentasyon maskeleri, semantik segmentasyon eğitimi ve değerlendirmesi için herhangi bir değişiklik yapılmadan kullanılmıştır. Bu çalışma için özel olarak yeni segmentasyon maskeleri oluşturulmamıştır.

Aksi belirtilmedikçe, yerleşik yöntemleri tanımlayan denklemler önceki çalışmalardan uyarlanmış ve buna göre atıfta bulunulmuştur. Önerilen CAFFM ve kompozit SegCycle-SPADE optimizasyon çerçevesini tanımlayan denklemler, yazarlar tarafından bu çalışma için geliştirilmiştir.

Veri setinden alınan bir giriş görüntüsünün Denklem 1 ile temsil edildiğini varsayalım:

Öklid uzayındaki görüntü matematiksel kavramı, boyutları belirten I ∈ ℝ^HxWxC.  (1)

Burada H, W ve C sırasıyla görüntü yüksekliğini, genişliğini ve renk kanalı sayısını ifade eder. Tüm görüntüler, Denklem 2'de gösterildiği gibi sabit bir H′ × W′ boyutuna yeniden boyutlandırılır:

H' x W' boyutları için yeniden boyutlandırma denklemi; matematiksel formül.

Burada, Ir yeniden boyutlandırılmış görüntüdür. Normalize edilmiş piksel değerleri Denklem 3'e göre hesaplanır:

Görüntü normalizasyon formülünü gösteren In=Ir/25 denklemi.   (3)

Bu, eğitim prosedürünün stabilize edilmesine yardımcı olur. Gürültü filtrelemesi, Denklem 4'te gösterildiği gibi bir Gauss filtresi kullanılarak gerçekleştirilir:

Sinyal işleme yönteminin denklemi, \( I_s = I_n * G(\sigma) \), matematiksel analizdeki formül.

Burada, G(σ) bir Gauss filtresidir ve * konvolüsyonu temsil eder. Standart sapması σ = 1.0 olan 5 × 5 çekirdekli bir Gauss filtresi kullanılmıştır. Kenar artefaktlarını azaltmak amacıyla sınır piksellerine yansıtmalı dolgu uygulanmıştır. Ölçekleme ve normalizasyondan önce, gürültü giderme işlemi görüntü yüklemesinin hemen ardından gerçekleştirilmiştir. Çalışma boyunca ön işlemenin tekdüze olmasını sağlamak için, Miao Batik ve WikiArt veri kümelerindeki her bir görüntüye aynı filtre konfigürasyonu uygulanmıştır. Miao Batik veri kümesi için segmentasyon maskeleri Denklem 5'e göre oluşturulmuştur:

Motif bölgesindeki piksel sınıflandırması için M(x,y) matematiksel formülü; karar kuralı denklemi.

Burada M, SegFormer modeline rehberlik etmek için kullanılan bir segmentasyon maskesidir.

Önişleme hattı, Şekil 3'te gösterildiği gibi, Miao Batik veri seti ve WikiArt veri setinden görüntülerin elde edilmesiyle başlar. Eğitim sırasında herhangi bir veri artırma tekniği uygulanmamıştır. Yeniden boyutlandırma, normalleştirme, Gauss gürültü giderme ve segmentasyon maskesi hazırlama işlemlerini içeren önişleme sonrasında görüntüler; önerilen SegCycle-SPADE çerçevesinin eğitimi, doğrulanması ve test edilmesi için doğrudan kullanılmıştır. Önişleme hattının ilk adımı, derin öğrenme modelinin görüntüleri daha verimli işlemesini sağlamak amacıyla görüntülerin sabit bir boyuta yeniden boyutlandırılmasını içerir. İkinci adım, piksel değerlerini standartlaştırılmış bir sayısal aralığa dönüştüren ve model yakınsamasını kolaylaştıran normalleştirmeyi kapsar. Üçüncü adımda, desen tanımayı iyileştirmek için görüntülerin istenmeyen gürültülerden arındırıldığı gürültü giderme işlemi gerçekleştirilir. Ek olarak, Miao Batik veri seti için kültürel motif bölgeleri etiketlenerek, önerilen modelin segmentasyon modülünde kullanılan maskelerin oluşturulması sağlanmış ve böylece üretim sırasında kültürel motiflerin korunması garanti edilmiştir. Bu aşamanın nihai çıktısı, önerilen modelin segmentasyon ve üretim modüllerini eğitmek için hazır, temiz bir veri setidir.

Sanat görüntüsü işleme iş akışı: veri kümesi girişi, yeniden boyutlandırma, normalizasyon, gürültü giderme, motif açıklama.
Şekil 3Kültürel Miras Görüntüleri için Veri Ön İşleme İşleme Hattı. Model eğitimi öncesinde uygulanan görüntü ön işleme prosedürlerini gösteren iş akışı. İş hattı; veri kümesi edinimi, görüntü boyutlandırma, normalizasyon, Gauss gürültü giderme, mevcut kültürel motif açıklamaları ve segmentasyon maskesi hazırlama aşamalarını içermektedir. Elde edilen işlenmiş görüntüler ve maskeler, semantik segmentasyon ve örüntü yeniden yapılandırma için girdi olarak kullanılır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Her bir görüntü, model eğitimi öncesinde bir kalite kontrol sürecinden geçirilmiştir. Miao Batik veri seti 15.148 görüntü içermekteydi. Bozuk, yinelenen ve düşük kaliteli örnekler orijinal veri seti oluşturucuları tarafından halihazırda ele alınmıştı; bu nedenle, bu çalışmadaki kalite kontrol taraması sırasında ek bir görüntü çıkarılmamıştır. Sonuç olarak, 15.148 görüntünün tamamı analiz için saklanmıştır. Görüntüler, ön işlem sırasında RGB formatında yüklenmiş ve bilinear interpolasyon kullanılarak 256 × 256 piksel boyutuna getirilmiştir. Piksel değerleri, 25'e bölünerek [0, 25] aralığından [0, 1] aralığına ölçeklendirilmiştir. Ardından, sırasıyla kırmızı, yeşil ve mavi kanallar için [0.485, 0.456, 0.406] ortalama değerleri ve [0.29, 0.24, 0.25] standart sapma değerleri kullanılarak kanal bazlı normalizasyon uygulanmıştır. Ön işlem hattı; görüntü yükleme, RGB dönüştürme, boyutlandırma, piksel değeri ölçeklendirme, normalizasyon ve tensör dönüştürme işlemlerini içermekteydi. Gerektiğinde, DL modelleriyle uyumluluğu korumak amacıyla gri tonlamalı görüntüler üç kanallı RGB formatına dönüştürülmüştür. Ön işlemin ardından görüntüler; eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Semantik segmentasyon, öznitelik füzyonu, motif yeniden yapılandırma ve SPADE tabanlı sanatsal sentez dahil olmak üzere SegCycle-SPADE çerçevesinin tüm aşamalarında 256 × 256 piksellik tutarlı bir giriş çözünürlüğü kullanılmıştır.

SegFormer Kullanılarak Semantik Desen Segmentasyonu
Bu ön işleme adımının ardından, Miao Batik kültürel motif veri setinin ve WikiArt veri setinin temizlenmiş ve normalize edilmiş görüntüleri, önerilen SegFormer-B2 çerçevesine dayalı semantik segmentasyon modülüne aktarılır. Bu adımın amacı, miras desenlerinde bulunan kültürel motiflerin doğru şekilde tanımlanması ve ayrılmasıdır. Önerilen SegFormer çerçevesi, karmaşık miras desenlerinden hem küresel bağlamsal bilgileri hem de detaylı yapısal bilgileri doğru şekilde yakalamak için hiyerarşik bir Transformer kodlayıcı ve hafif bir MLP kod çözücü içeren bir transformer mimarisine dayanmaktadır. Model önce girdi görüntüsünden çoklu ölçeklerde öznitelik temsilleri çıkarır, ardından bu temsilleri kod çözücü aracılığıyla birleştirerek doğru segmentlere ayrılmış desenler üretir. Bu işlem, miras görüntüsündeki desenlerin geometrik desenler, çiçeksi desenler ve sembolik desenler gibi motiflere doğru şekilde segmentlere ayrılmasını, böylece yapısal bütünlükleri korunurken arka plandan ayrılmalarını sağlar. Bu yapısal bilgiler daha sonra SegCycle-SPADE çerçevesi içindeki desen üretimi aşamalarında kullanılır.

Önişlenmiş giriş görüntüsünün Denklem 6 ile temsil edildiğini varsayalım:

Görüntü özelliklerinin matematiksel gösterimi; denklem; boyutlu uzay gösterimi \(I_p \in \mathbb{R}^{H \times W \times C}\).    (6)

SegFormer kodlayıcısı, görüntüyü yamalara ayır ve Denklem 71'de gösterildiği gibi transformer katmanlarını kullanarak hiyerarşik özellikler çıkarır:

F=Encoder(Ip) formülü, hesaplamalı bir yöntemdeki kodlama sürecini temsil etmektedir.

Burada, F transformer kodlayıcıdan elde edilen çok ölçekli özellik haritalarını ifade eder. Bu özellikler, hem yerel doku desenlerini hem de motif bölgeleri arasındaki küresel bağlamsal ilişkileri kodlar. SegFormer modeli, Denklem 8'de tanımlandığı şekilde farklı ölçeklerde özellik haritaları çıkarır:

Statik denge denklemi, F={F1,F2,F3,F4}, matematiksel ifade, fizik çalışmasında kuvvetler

Çok ölçekli temsillerin kullanımı, kültürel motifler içindeki farklı boyutlardaki örüntülerin tespitini kolaylaştırır. Son olarak, özellikler, şurada gösterildiği gibi MLP kod çözücü kullanılarak birleştirilir: Denklem 91:
 Bir kod çözücü fonksiyon kullanarak sinyal kod çözme sürecinin denklemi; matematiksel denklem gösterimi.

Burada, S nihai tahmin edilen segmentasyon haritasını ifade eder.

SegFormer-B2 omurgası, ImageNet ile önceden eğitilmiş ağırlıklar kullanılarak başlatılmış ve ardından kültürel motif segmentasyonu için Miao Batik veri kümesi üzerinde ince ayar yapılmıştır. Önceden eğitilmiş kontrol noktası, resmi SegFormer uygulamasından elde edilmiştir. Özellikle, ince ayar öncesinde SegFormer-B2 omurgasını başlatmak için resmi SegFormer deposu tarafından sağlanan ImageNet-1K önceden eğitilmiş MIT-B2 kontrol noktası (mit_b2.pth) kullanılmıştır. Önceden eğitilmiş ağırlıklar, SegFormer yazarları tarafından yayınlanan MIT-B2 omurgasına karşılık gelmekte olup semantik segmentasyon eğitimi için başlatma modeli olarak hizmet etmiştir. Geriye kalan göreve özel katmanlar, eğitimden önce varsayılan PyTorch ağırlık başlatma prosedürleri kullanılarak başlatılmıştır.

Mimaride, örtüşen yama gömmeleri (patch embeddings) ile dört aşamalı hiyerarşik bir Transformer kodlayıcı kullanılmıştır. İlk aşamada, yama boyutu 4 adımlı (stride) bir ilerleme ile 7 × 7 olarak belirlenmiştir. Dört kodlayıcı aşamasının her biri için gömme boyutları sırasıyla 64, 128, 320 ve 512'dir. Dört aşama boyunca, sırasıyla 1, 2, 5 ve 8 çok başlı öz-dikkat (multihead self-attention) başlığı kullanılmış ve buna karşılık gelen kodlayıcı derinlikleri 3, 4, 6 ve 3 katman olarak seçilmiştir. Kodlayıcıdan elde edilen çok ölçekli özellikler, hafif bir tüm-MLP (all-MLP) kod çözücü kullanılarak birleştirilmiştir. Kod çözücü, nihai segmentasyon haritasını oluşturmadan önce her bir kodlayıcı aşamasındaki özellikleri tek bir gömme uzayına yansıtmıştır. Tüm Transformer bloklarında Gaussian Error Linear Unit (GELU) aktivasyon fonksiyonu kullanılmıştır. Genelleştirmeyi artırmak ve aşırı öğrenmeyi (overfitting) azaltmak için eğitim sırasında 0,1'lik bir dropout oranı uygulanmıştır.

Eğitim aşamasında, SegFormer çerçevesi her iki veri setinden gelen ön işlemden geçmiş görüntüleri alır. Miao Batik veri setinden gelen görüntüler, segmentasyon modelinin denetimli öğrenimi için etiket görevi gören motif bölgelerini içerir. Transformer kodlayıcı, görüntünün tamamını işleyerek görüntü bileşenleri arasındaki uzun menzilli ilişkileri yakalar; bu durum, özellikle mekansal olarak dağılmış motifler içeren geleneksel batik desenleri için önemlidir. Hiyerarşik özellik çıkarma mekanizması, tekrarlanan geometrik dokular gibi yerel yapıları eş zamanlı olarak yakalar. MLP kod çözücü, bu çıkarılan özellikleri işleyerek motif bölgelerini belirginleştiren bir segmentasyon maskesi üretir. Bu aşamada oluşturulan segmentasyon haritaları, daha sonra dikkat modülü ve desen yeniden yapılandırma aşaması için yapısal girdiler olarak kullanılır ve böylece üretilen desenlerin özgünlüğünün korunmasına yardımcı olur.

Kültürel motifler, görsel ve kültürel özelliklerine göre semantik segmentasyon için farklı sınıflara ayrılmıştır. Segmentasyon taksonomisi; hayvan motiflerini (örneğin kelebekler, balıklar, kuşlar ve diğer sembolik fauna), bitki motiflerini (örneğin çiçekler, yapraklar, sarmaşıklar ve botanik desenler), geometrik motifleri (örneğin tekrarlayan şekiller, bordürler ve soyut geometrik yapılar) ve motif dışı alanları temsil eden arka plan bölgelerini kapsamaktaydı. Her bir pikseli önceden tanımlanmış sınıflardan birine atamak için piksel düzeyinde segmentasyon maskeleri kullanılmıştır. Tam sayı etiketleri şu şekilde kodlanmıştır: Etiket 0 = arka plan, Etiket 1 = hayvan motifleri, Etiket 2 = bitki motifleri ve Etiket 3 = geometrik motifler. Segmentasyon anotasyonları ve motif etiketleri, doğrudan orijinal Miao Batik veri seti kaynağından alınmıştır. Bu çalışmada ek bir manuel anotasyon, yeniden etiketleme, sınır doğrulama veya uzman onay prosedürü gerçekleştirilmemiştir. Veri seti oluşturucuları tarafından sağlanan mevcut anotasyonlar, eğitim ve değerlendirme için herhangi bir değişiklik yapılmadan kullanılmıştır.

Kültürel motif segmentasyonu için kullanılan SegFormer modeli, Şekil 4'te gösterildiği üzere, kültürel desen bölgelerinin doğru tespiti için transformer tabanlı bir mekanizma kullanarak Miao Batik veri setinden ve WikiArt veri setinden gelen ön işlemli görüntüleri işler. İlk olarak, geleneksel kültürel motifler içeren giriş görüntüsü SegFormer modeline sunulur. Transformer kodlayıcı, görüntü yamalarından hem küresel bağlamsal bilgileri hem de yerel yapısal özellikleri çıkarır. Elde edilen çok ölçekli özellikler, özellik temsillerini iyileştirmek ve motif tespitini geliştirmek için Mix Feed-Forward Network kullanan segmentasyon kod çözücüye aktarılır. SegFormer modelinin çıktısı, ilgisiz arka plan bilgilerini bastırırken kültürel desenlere karşılık gelen pikselleri vurgulayan bir segmentasyon maskesidir. İzole edilen kültürel desenler daha sonra SegCycle-SPADE çerçevesinin sonraki aşamaları için yapısal rehberlik sağlar.

Giriş görüntüsü analizi için transformer kodlayıcılı SegFormer kullanan segmentasyon süreci diyagramı.
Şekil 4. SegFormer-B2 Tabanlı Kültürel Motiflerin Semantik Segmentasyonu. Kültürel motif çıkarımı için kullanılan ve yalnızca Miao Batik veri seti üzerinde eğitilen SegFormer-B2 semantik segmentasyon modülünün mimarisi. Çerçeve, çok ölçekli öznitelik çıkarımı için Transformer tabanlı bir kodlayıcıdan ve motif maskeleri oluşturmak için hafif bir segmentasyon kod çözücüsünden oluşmaktadır. Model; hayvan, bitki, geometrik ve arka plan olmak üzere dört semantik sınıfı tahmin eder ve sonuç olarak elde edilen segmentasyon maskeleri, ilgisiz arka plan bilgilerini baskılayarak kültürel açıdan önemli motif bölgelerini tanımlar. Bu segmentasyon çıktıları, önerilen SegCycle-SPADE çerçevesinin sonraki öznitelik birleştirme, yeniden yapılandırma ve sanatsal sentez aşamaları için yapısal rehberlik sağlar. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Önerilen çerçevede yeni segmentasyon anotasyonları oluşturmaya gerek yoktur. Miao Batik veri seti, halihazırda mevcut olan halka açık bir kaynaktan temin edilmiş ve model, veri seti oluşturucuları tarafından sağlanan ilgili motif bilgileri kullanılarak eğitilmiştir. Öğrenme süreci boyunca SegFormer modeli semantik segmentasyon haritaları üretmiştir. Sonuç olarak, mevcut çalışma herhangi bir ek manuel anotasyon yazılımı, anotasyon kılavuzu veya anotasyon kalite kontrol prosedürü gerektirmemiştir.

CAFFM
Semantik segmentasyon özelliklerinin üretken yeniden yapılandırma temsilleriyle etkileşimini artırmak için çalışma aynı zamanda bir CAFFM önermiştir. SegFormer-B2 kodlayıcı, CAFFM modülüne semantik özellik haritaları sağlarken, CycleGAN yeniden yapılandırma adımı üretken özellik haritaları sağlar. İlk olarak, her iki özellik akışını ortak bir gömme uzayına yansıtmak için doğrusal projeksiyon katmanları kullanılır. Çapraz dikkat hesaplaması için, üretilen özellik tensörleri kullanılarak sorgu (Q), anahtar (K) ve değer (V) temsilleri oluşturulur. Ardından, yapısal motif bilgileri ile sanatsal stil öğeleri arasındaki ilişkiler, çok başlı çapraz dikkat kullanılarak modellenir. Daha sonra, kaynaştırılmış özellik temsillerine katman normalizasyonu, artık bağlantılar ve GELU aktivasyonlu ileri beslemeli katmanlar uygulanır. SPADE tabanlı sentez aşaması, sanatsal tutarlılıktan ödün vermeden kültürel olarak anlamlı temaların korunmasına olanak tanıyarak CAFFM modülünün çıktısını alır.

Özellik uyumluluğunu garanti etmek için, giriş özellikleri önce doğrusal projeksiyon katmanları kullanılarak 256 boyutlu ortak bir gömme alanına yansıtılır. Ardından, anlamsal yapısal bilgiler ile üretici stil temsilleri arasındaki karşılıklı etkileşimler, sekiz dikkat başlığına sahip bir Çok Başlı Çapraz Dikkat (MultiHead Cross-Attention) mekanizması kullanılarak modellenir. Çapraz dikkat hesaplaması, belirli doğrusal dönüşüm katmanları tarafından üretilen Sorgu (Q), Anahtar (K) ve Değer (V) vektörlerini kullanır. Eğitim stabilitesini artırmak ve özellik bütünlüğünü korumak amacıyla, birleştirilmiş özellik temsillerini daha da geliştirmek için artık bağlantılar (residual connections) ve Katman Normalizasyonu (Layer Normalization) uygulanır. Daha sonra, Gaussian Hata Doğrusal Birimi (GELU) aktivasyon fonksiyonuna sahip bir ileri beslemeli ağ uygulanarak doğrusal olmayan özellik öğrenimi geliştirilir. Modül tarafından 256 boyutunda bir çıktı özellik temsili oluşturulur ve yaratıcı sentez için diğer aşamalara gönderilir. CAFFM, çapraz dikkat tabanlı bir füzyon tekniği kullanarak sanatsal stil verilerini kültürel motif yapılarıyla başarıyla birleştirir; bu da yeniden oluşturulan kültürel miras desenlerinde motiflerin korunmasını ve görsel tutarlılığı artır.

Önerilen sistemde, yapısal özellikler Miao Batik veri setinden türetilirken, üslup özellikleri WikiArt veri setinden öğrenilmektedir. Miao Batik veri setindeki görüntüleri kullanan SegFormer segmentasyon ağından türetilen özellik haritası Fs ile, WikiArt görüntülerini kullanan üslup-özellik çıkarma dalından türetilen özellik haritası ise Fa ile gösterilmiştir. Önerilen CAFFM, kültürel desenlerin hem yapısal hem de üslup bağımlılıklarını öğrenmek için bir çapraz dikkat mekanizması kullanarak iki özellik alanını birleştirir. Tablo 3; gömme boyutları, normalizasyon katmanları, aktivasyon fonksiyonları ve dikkat başlığı konfigürasyonu dahil olmak üzere tüm mimari özellikleri rapor etmektedir. 256 × 256 piksel boyutundaki bir giriş görüntüsü için SegFormer-B2 kodlayıcısı 64 × 64 × 128 boyutunda semantik özellik haritaları üretirken, üslup-özellik çıkarma dalı 64 × 64 × 128 boyutunda özellik haritaları üretmiştir. Her iki özellik haritası da çapraz dikkat füzyonu öncesinde, öğrenilebilir doğrusal katmanlar aracılığıyla 256 boyutlu ortak bir gömme alanına iz düşürülmüştür.

ParametreYapılandırma
Önerilen ÇerçeveSegCycle-SPADE
Semantik Segmentasyon ModeliSegFormer-B2
SegFormer Kodlayıcı Aşamaları4
Ağırlık BaşlatmaImageNet-1K Ön Eğitimli SegFormer-B2 (MIT-B2 Omurgası)
Kontrol Noktası KaynağıResmi NVIDIA SegFormer Deposu (https://github.com/NVlabs/SegFormer); kontrol noktası: segformer.b2.512x512.ade.160k
İnce Ayar StratejisiMiao Batik veri kümesi üzerinde uçtan uca ince ayar
Yama Gömme Boyutu7 × 7
Yama Adımı4
Gömme Boyutları64, 128, 320 ve 512
Kodlayıcı Derinlikleri3, 4, 6 ve 3
Dikkat Başlıkları1, 2, 5 ve 8
Dekoder TipiTamamı-MLP Dekoder
Aktivasyon FonksiyonuGELU (Gaussian Error Linear Unit / Gauss Hata Doğrusal Birimi)
Terkmeye Oranı0.1
Özellik İyileştirme ModülüÇapraz Dikkatli Kültürel Öznitelik Füzyon Modülü (CAFFM)
CAFFM Gömme Boyutu256
CAFFM Dikkat Başlıkları8
CAFFM Füzyon Ölçekleri4
Rekonstrüksiyon ModeliCycleGAN
Stil Üretim ModeliSPADE
Kültürel Veri KümesiMiao Batik Veri Seti
Stil Veri KümesiWikiArt Veri Kümesi
Miao Batik Görüntüleri15,148
WikiArt GörselleriYaklaşık 80.0
Giriş Görüntü Çözünürlüğü256 × 256 piksel
Renk FormatıRGB
İnterpolasyon YöntemiBilineer İnterpolasyon
Gürültü Giderme YöntemiGauss Filtreleme
Gauss Çekirdek Boyutu5 × 5
Gauss Sigma (σ)1
Normalizasyon Aralığı[0, 1]
Parti Boyutu16
Epok Sayısı100
Optimize ediciAdam
Öğrenme Oranı0.0002
Adam Parametreleriβ₁ = 0,5, β₂ = 0,9, ε = 1 × 10⁻⁸, ağırlık azalması (weight decay) = 0
Kayıp FonksiyonlarıSegmentasyon Kaybı, Adversaryal Kayıp, Döngüsel Tutarlılık Kaybı, Yeniden Yapılandırma Kaybı, Motif Koruma Kaybı ve Stil Tutarlılık Kaybı
Veri Kümesi Bölme StratejisiEğitim / Doğrulama / Test Etme
Eğitim Seti70%
Doğrulama Seti15%
Test Seti15%
Rastgele Tohum42
Değerlendirme MetrikleriSegmentasyon Doğruluğu, IoU, Dice Katsayısı, SSIM, PSNR ve FID
Programlama DiliPython 3.8.10
Derin Öğrenme ÇerçevesiPyTorch 1.10.0
Donanım PlatformuNVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (1. Nesil), 32 GB RAM
Çalışma OrtamıUbuntu 20.04 LTS

Tablo 3: Deneysel Kurulum ve Model Konfigürasyonu. Önerilen SegCycle-SPADE çerçevesinin uygulanması ve değerlendirilmesi için kullanılan mimari bileşenlerin, eğitim konfigürasyonunun, ön işleme ayarlarının, veri kümelerinin, optimizasyon parametrelerinin, değerlendirme metriklerinin ve hesaplama ortamının özeti.

Dikkat modülü, önce özellik haritasını Denklem 10'u kullanarak sorgu, anahtar ve değer temsillerine eşler:

Vektör mekanizması denklemi: Q=FsWq, K=FsWk, V=FsWv; fizik çalışmasında analiz için diyagram.

Burada, Wq, Wk ve Wv öğrenilebilir ağırlık matrisleridir. Dikkat ağırlıkları, sorgu vektörü ile anahtar vektörü arasındaki benzerliğe dayanarak Denklem 117 kullanılarak hesaplanır: 

Dikkat mekanizması formülü A=Softmax(QKᵀ/√dₖ), derin öğrenme yöntemi, denklem.

Burada, dk anahtar vektörün boyutudur. Geliştirilmiş özellik temsili, dikkat ağırlıklarının değer matrisi ile Denklem 12 kullanılarak çarpılmasıyla hesaplanır:

Fizik formül türetiminden gelen kuvvet hesaplama denklemi, \( F_a = A \cdot V \).

Burada, Fa özellik haritasının geliştirilmiş özellik temsilidir. Geliştirilmiş özellik temsili, orijinal segmentasyon özellikleri ile dikkat mekanizması kullanılarak elde edilen geliştirilmiş özelliklerin Denklem 13 kullanılarak birleştirilmesiyle hesaplanır:

Statik denge denklemi: Fe=Fs+Fa. Kuvvet dengesi analizi için matematiksel ifade.                                

Burada, Fe desen yeniden yapılandırması için kullanılan geliştirilmiş özellik haritasıdır. CAFFM, farklı ölçeklerdeki kültürel motifler için özellikler çıkarmak amacıyla çok ölçekli bir çapraz dikkat mekanizması ile genişletilmiştir. Fsi, i ölçeğindeki segmentasyon özelliklerini, Faj ise aynı ölçekteki sanatsal stil özelliklerini temsil etsin. Nihai özellik temsili Denklem 14 kullanılarak tanımlanmıştır:

  Sinir ağlarında dikkat mekanizması denklemi, ΣAttention(Q,K,V), matematiksel formül.

Burada Qi, Ki ve Vi sırasıyla i ölçeğindeki sorgu, anahtar ve değer matrislerini temsil ederken, N özellik ölçeklerinin sayısını belirtmektedir. Bu çalışmada N = 4 olarak belirlenmiş olup, bu değer giriş görüntüsü boyutunun 1/4, 1/8, 1/16 ve 1/32 uzamsal çözünürlüklerinde çıkarılan özellik haritalarına karşılık gelmektedir. Bu çok ölçekli özellik temsilleri, yeniden yapılandırma ve sanatsal sentez öncesinde öğrenilebilir dikkat ağırlıkları kullanılarak birleştirilmiştir. Yukarıdaki genişletme, yöntemin kültürel desenleri yeniden yapılandırmak için küresel kültürel motifleri ve dokuları çıkarmasına olanak tanır. CAFFM, önerilen SegCycle-SPADE sisteminde SegFormer tabanlı segmentasyon aşaması ile SPADE tabanlı yaratıcı sentez aşaması arasında yer almaktadır. İlk olarak, CycleGAN stilistik ve desenle ilgili bilgilerle birlikte yeniden yapılandırma özelliklerini eş zamanlı olarak oluştururken, SegFormer-B2 kültürel motiflerin yapısal özelliklerini betimleyen semantik özellik haritalarını geri getirir. CAFFM modülü bu iki özellik akışını alır ve yapısal ile sanatsal temsiller arasındaki ilişkileri tanımlamak için çapraz dikkat tabanlı birleştirme yöntemini kullanır. Semantik tutarlılığı ve yapısal özellikleri koruyarak kültürel açıdan otantik desenler oluşturmak amacıyla, sonuç olarak elde edilen birleştirilmiş özellik haritaları daha sonra segmentasyon rehberli yaratıcı sentez için SPADE modülüne gönderilir.

CycleGAN Kullanarak Desen Rekonstrüksiyonu
Dikkat tabanlı özellik geliştirme aşaması tamamlandığında, özellik haritaları geliştirilmiş kültürel motif yapılarını içerecektir. Ancak, özellik haritaları hala eksik veya hasarlı desen bölgeleri içerebilir. Bu nedenle, desenlerin yeniden yapılandırılması sorununu çözmek için önerilen çerçevede CycleGAN modeli kullanılacaktır. Önerilen çerçevede iki alan, orijinal kültürel motif desenleri ve rekonstrükte edilmiş kültürel motif desenleri olacaktır. CycleGAN modeli, önceki aşamalardan gelen geliştirilmiş özellikleri kullanarak, yapısal tutarlılığı korurken kültürel desenleri yeniden yapılandıracaktır. Bu, geometrik desenler, floral desenler ve sembolik desenler gibi kültürel desenlerin mekansal düzenlerini korumasını sağlayacaktır. Eksik veya hasarlı kültürel motifler oluşturmak için orijinal Miao Batik görüntüleri rastgele maskelemeye ve kısmi oklüzyon işlemlerine tabi tutulmuştur. Bu bozulma prosedürleri, yıpranmış kültürel miras eserlerinde yaygın olarak gözlemlenen eksik desen bölgelerini ve yapısal hasarları simüle etmiştir. Bozulmuş görüntüler rekonstrüksiyon modülü için girdi olarak kullanılırken, karşılık gelen orijinal görüntüler performans değerlendirmesi ve rekonstrüksiyon kalitesi ölçümü için referans görüntüler olarak hizmet etmiştir. Bu strateji, modelin semantik tutarlılığı ve kültürel özellikleri korurken eksik motif yapılarının restorasyonunu öğrenmesini sağlamıştır.

X'in eksik kültürel kalıplar alanı ve Y'nin yeniden yapılandırılmış kültürel kalıplar alanı olduğunu varsayalım. İki üreteç, Denklem 15'i kullanarak çift yönlü eşleme yapmayı öğrenir:

 Matematiksel birebir örten eşleşmeler; GF:X→Y, FM:Y→X fonksiyonları; denklem diyagramı; cebirsel eşleme.

Burada, motif yapılarını yeniden oluşturmak için GE ve paternleri orijinal domaine geri eşlemek için FM kullanılır. Yeniden oluşturulan paternlerin gerçekçi olmasını sağlamak için adversaryal kayıp kullanılır (Denklem 16)30

GAN kayıp fonksiyonu denklemi, optimizasyon analizi formülü, araştırma amaçlı anahtar kelimeler.

Burada, DY gerçek ve yeniden yapılandırılmış desenleri ayırt etmek için kullanılan ayırt edici (discriminator), GE(x) ise oluşturulan yeniden yapılandırılmış deseni ifade eder. CycleGAN, kültürel motiflerin yapısal düzenini korumak için ayrıca döngüsel tutarlılığı zorunlu kılar (Denklem 17)30.

Üretici model döngüsel tutarlılığı için kayıp fonksiyonunu gösteren denklem; matematiksel notasyondaki formül.

Nihai kayıp fonksiyonu, Denklem 1830 kullanılarak tanımlanmıştır:

Makine öğrenmesinde GAN optimizasyonu için toplam kayıp denklemi.

Burada, λi döngü tutarlılığı kaybı için ağırlıklandırma katsayısını temsil eder ve orijinal CycleGAN formülasyonuyla tutarlı olarak eğitim sırasında 10 olarak ayarlanmıştır. Bu değer, adversaryal öğrenme ile kaynak ve hedef alanlar arasındaki yeniden oluşturma tutarlılığını dengelemek için seçilmiştir.

CycleGAN yeniden yapılandırma modülü, çift yönlü görüntü çevirisi için iki jeneratör ve iki diskriminatörden oluşur. Her jeneratör; başlangıçta bir 7 × 7 konvolüsyon katmanı, ardından iki altörnekleme konvolüsyon katmanı, dokuz rezidüel blok ve iki üstörnekleme katmanından oluşan bir rezidüel ağ mimarisini takip eder. Giriş katmanındaki gelişmiş özellik çıkarımı için kullanılan 7 × 7 çekirdek hariç, tüm konvolüsyon işlemleri 3 × 3 çekirdek boyutuyla uygulanır. Eğitim stabilitesini artırmak için her konvolüsyon katmanından sonra Örnek Normalizasyonu (Instance Normalization) uygulanırken, jeneratör ağı genelinde ReLU aktivasyonu kullanılır. Çıkış katmanı, normalize edilmiş görüntü çıktıları üretmek için Tanh aktivasyon fonksiyonunu kullanır. Diskriminatör, 4 × 4 çekirdek boyutlarına ve kademeli olarak artan özellik kanallarına sahip bir dizi konvolüsyonel katmandan oluşan 70 × 70 PatchGAN mimarisini takip eder. Özellik ayrımını ve adversariyel öğrenmeyi geliştirmek için diskriminatörde Örnek Normalizasyonu ve LeakyReLU aktivasyonu (negatif eğim = 0.2) kullanılır. CycleGAN modülü, ön işlenmiş kültürel motif görüntülerini girdi olarak alır ve daha sonra segmentasyon özellikleriyle entegrasyon için CAFFM'ye iletilen yeniden yapılandırılmış desen temsillerini oluşturur. CycleGAN eğitimi, 0.02 başlangıç öğrenme hızıyla Adam optimizasyonu (β₁ = 0.5, β₂ = 0.9) kullanılarak gerçekleştirilmiştir. Öğrenme hızı ilk 100 epok boyunca sabit tutulmuş ve ardından eğitim süresinin geri kalanında doğrusal olarak sıfıra düşürülmüştür. Diskriminatör eğitimini stabilize etmek için önceden oluşturulmuş 50 görüntüyü içeren bir tekrar belleği (replay buffer) kullanılmıştır. Jeneratörler ve diskriminatörler, her eğitim iterasyonunda bir jeneratör güncellemesini bir diskriminatör güncellemesinin takip ettiği 1:1 güncelleme oranıyla güncellenmiştir.

CycleGAN'in yeniden yapılandırma süreci, Şekil 5'te yer alan CAFFM mekanizması kullanılarak elde edilen geliştirilmiş özellik haritalarına dayanmaktadır. Özellik haritaları, segmentasyon ve CAFFM'nin önceki aşamalarından elde edilen geliştirilmiş kültürel motifleri içerir. Özellik haritaları, ilk generatör olan GE için girdi olarak kullanılır. İlk generatör GE, kültürel desenleri yeniden yapılandırmak için gerekli olan eşlemeyi öğrenir. Çıktılar daha sonra, gerçek kültürel desenler ile yeniden yapılandırılmış desenleri ayırt etmek üzere diskriminatör DY'ye aktarılır. Diskriminatör DY, generatörün GE gerçekçi çıktılar üretmesine yardımcı olur. Yeniden yapılandırma sırasında kültürel desenlerin bozulmamasını sağlamak için, ikinci generatör FM döngüsel tutarlılık (cycle-consistency) eşlemesi gerçekleştirir. İkinci generatör FM, çıktıları orijinal alana geri eşler. Çıktılar ardından gerçekçiliği sağlamak için diskriminatör tarafından değerlendirilir. Nihai çıktılar, daha sonra önerilen SegCycle-SPADE çerçevesinin bir sonraki aşamasında sanatsal stil üretimi için SPADE modülüne iletilir.

Desen yeniden yapılandırma süreci, jeneratör G, diskriminatör Dy ve döngüsel tutarlılık kontrolü içeren diyagram.
Şekil 5CycleGAN Tabanlı Desen Rekonstrüksiyon İş Akışı. CycleGAN yeniden yapılandırma modülünün iş akışı. Eksik kültürel motifleri yeniden yapılandırmak için dikkatle geliştirilmiş özellik temsilleri, jeneratör ağına girdi olarak sağlanır. Diskriminatör, yeniden yapılandırılmış çıktıları referans desenlerle karşılaştırarak değerlendirirken, döngüsel tutarlılık eşlemesi çift yönlü görüntü çevirisi sırasında yapısal bütünlüğü korur. Yeniden yapılandırılan motifler, daha sonra sanatsal stil sentezi için SPADE modülüne iletilir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

SPADE Kullanarak Sanatsal Stil Oluşturma
Ardından, yeniden yapılandırılan kültürel motifler, sanatsal stil oluşturma amacıyla SPADE modülüne tabi tutulur. SPADE modülünün temel amacı, motiflerin yapısal düzenini bozmadan, yeniden yapılandırılan kültürel motiflere görsel olarak daha zengin sanatsal stil dokuları eklemektir. SPADE modülü, görüntü oluşturma için görüntü segmentasyonu kavramından yararlanan koşullu bir görüntü oluşturma tekniğidir. SegFormer-B2 tarafından üretilen semantik segmentasyon maskelerinden, önceden belirlenmiş motif sınıflarına karşılık gelen çok kanallı semantik haritalar kodlanmıştır. SPADE üreteci, bu kodlanmış haritaları koşullandırma girişleri olarak almıştır. Mekansal olarak adaptif ölçekleme (γ) ve sapma (β) parametreleri, semantik haritaların her bir SPADE katmanı içindeki konvolüsyonel katmanlar aracılığıyla işlenmesiyle üretilmiştir. Böylece üreteç, bu parametreleri normalize edilmiş özellik aktivasyonlarına uygulayarak sanatsal sentez sırasında motif sınırlarını, yapısal düzenleri ve semantik bilgileri koruyabilmiştir. Koşullandırma işlemi SPADE üretecinin birkaç katmanında gerçekleştirildiği için semantik yönlendirme, hem üst düzey yapısal yeniden yapılandırmayı hem de alt düzey doku sentezini etkileyebilmiştir. Sonuç olarak, oluşturulan sanatsal desenler, segmentasyon aşamasında bulunan kültürel motif yapılarını korurken WikiArt veri setinden elde edilen stilistik özellikleri bünyesine katmıştır.

Sanatsal stillerin anlaşılması için temel kaynak olarak; Rönesans, Empresyonizm, Kübizm, Ekspresyonizm, Sürrealizm, Realizm ve Soyut Sanat gibi 27 farklı sanatsal kategoriden eserler içeren WikiArt veri seti kullanılmıştır. Modelin çeşitli yaratıcı özelliklere maruz kalmasını sağlamak ve stil genellemesini geliştirmek amacıyla, eğitim sırasında çeşitli kategorilerden rastgele stil görüntüleri seçilmiştir. Stil yanlılığını azaltmak için veri seti; sanatsal kategorilerin dengeli bir temsiline sahip olacak şekilde eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Tüm 27 sanatsal kategorinin dengeli bir şekilde temsil edilmesini sağlamak için tabakalı örnekleme yöntemi kullanılmıştır. Orijinal sınıf dağılımı korunarak, her kategoriden örnekler eğitim, doğrulama ve test alt kümelerine orantılı olarak dağıtılmıştır. WikiArt görüntülerinden türetilen stil yönleri ile CycleGAN tarafından üretilen yeniden yapılandırma özelliklerini birleştirmek için CAFFM modülü kullanılmıştır. Sentez ağının, segmentasyon haritalarından türetilen semantik yapıyı ve kültürel motif sınırlarını korurken sanatsal nitelikleri aktarmasına olanak tanımak için, elde edilen füzyon temsilleri SPADE üretecine koşullandırma bilgisi olarak sağlanmıştır. Önerilen çerçeve, bu stil-koşullandırma tekniği sayesinde tutarlı yapısal ve stilistik temsillere sahip, kültürel olarak otantik sanatsal desenler üretebilmiştir.

SPADE ayrıca segmentasyon haritasına bağlı olan uzaysal olarak adaptif parametreler sunar. Parametreler şurada gösterildiği gibi tanımlanabilir: Denklem 191:

y = γ(S)x̂ + β(S), denklem.

Burada, γ(S) uzamsal olarak değişen ölçek parametresi ve β(S) uzamsal olarak değişen sapma parametresidir. Bu parametreler, üretecin görüntülerdeki semantik bölgeye bağlı olarak farklı dokular ve stiller oluşturmasına yardımcı olabilir. Nihai kültürel sanat eseri Denklem 20'de gösterildiği gibi tanımlanabilir:

 Matematiksel modelleme için gösterilen genel denklem diyagramı, I_gen = G_E(X^P_r, SM).

Burada, GE SPADE üreteci, XrP yeniden yapılandırılmış desen ve SM segmentasyon haritasıdır. Nihai çalışma, sanatsal görünümü geliştirirken kültürel motiflerin yapısal bütünlüğünü korur. Önerilen SegCycle-SPADE mimarisini optimize etmek için semantik segmentasyon doğruluğunu, kültürel motiflerin korunmasını, desen yeniden yapılandırma kalitesini ve sanatsal stil tutarlılığını dengeleyen kompozit bir kayıp fonksiyonu kullanılmıştır. Genel eğitim amacını belirlemek için segmentasyon kaybı (Lseg), adversariyal kayıp (Ladv), döngü tutarlılığı kaybı (Lcycle), yeniden yapılandırma kaybı (Lrecon), motif koruma kaybı (Lmotif) ve stil tutarlılığı kaybının (Lstyle) ağırlıklı bir karışımı kullanılmıştır. Toplam kayıp fonksiyonu Denklem 21'de tanımlanmıştır:

Makine öğrenmesi, segmentasyon ve yeniden yapılandırma terimleriyle toplam kayıp denklemi formülü.  (21)

Girdi ve yeniden yapılandırılan kültürel motifler arasındaki yapısal tutarlılığı garanti etmek için döngüsel tutarlılık kaybı katsayısı 10 olarak belirlenmiştir. İnce taneli motif özelliklerini korumak ve görsel doğruluğu artırmak için yeniden yapılandırma kaybı katsayısı 5 olarak ayarlanmıştır. Sanatsal sentez sırasında kültürel açıdan temel yapısal kalıpların korunmasını vurgulamak amacıyla, motif koruma kaybı için 2 katsayısı kullanılmıştır. Anlamsal motif yapılarını aşırı bozmadan sanatsal stil aktarımını teşvik etmek için stil tutarlılığı kaybı katsayısı 1'e ayarlanmıştır. Gerçekçi görüntü üretimi ile hassas motif segmentasyonu arasında dengeli bir katkı sağlamak için, segmentasyon ve adversarial kayıplara eşit ağırlıklar verilmiştir. Stil tutarlılığı kaybını hesaplamak için WikiArt veri setinin özellik tabanlı stil temsilleri kullanılmıştır. Özellikle, sanatsal stil özellikleri, derin özellik haritalarından alınan Gram matrisi korelasyonları kullanılarak yakalanmıştır. Denklem 22'de gösterildiği gibi, hedef stil görüntüsü ile oluşturulan görüntünün Gram matrisleri arasındaki Frobenius norm farkı, stil kaybını hesaplamak için kullanılmıştır:

Sinir ağı, derin öğrenme formül analizi kapsamında kullanılan stil kaybı denklemi, \(L_{\text{style}}\).

Burada, GLütfen çevrilmesini istediğiniz metni paylaşın. Gram matrisi, şunlardan hesaplanır mı: Lütfen çevirmemi istediğiniz metni sağlayın.th özellik katmanı, ILütfen çevirmek istediğiniz metni sağlayın. oluşturulan sanatsal görüntüyü ifade eder, Istil WikiArt veri setinden alınan hedef stil görüntüsünü ifade eder ve F Frobenius normunu ifade eder. Bu formülasyon, önerilen çerçevenin kültürel motiflerin yapısal ve anlamsal bütünlüğünü korurken sanatsal özellikleri muhafaza etmesini sağlar.

CAFFM modülü tarafından üretilen birleştirilmiş öznitelik temsilleri, önerilen çerçevenin sanatsal sentez bileşeni olarak görev yapan SPADE modülü için koşullandırma girişleri olarak kullanılır. SPADE üreteci, 256 kanallık bir gizli öznitelik boyutuna sahip yedi SPADE rezidüel bloktan oluşur ve 256 × 256 piksel çözünürlükte çıkış görüntüleri üretir. SegFormer–CAFFM modülünden elde edilen semantik segmentasyon haritaları, SPADE rezidüel katmanları boyunca koşullandırma girişleri olarak kullanılır. SPADE katmanları, her rezidüel blok içindeki aktivasyon fonksiyonlarından önce uygulanarak segmentasyon güdümlü semantik koşullandırmayı sağlar. Ardışık üstörnekleme ve evrişim işlemleri yoluyla, semantik tutarlılığı ve motif yapısını korurken yüksek çözünürlüklü sanatsal desenler oluşturmak için gizli öznitelik temsili aşamalı olarak geliştirilir. Üreteci boyunca LeakyReLU aktivasyon fonksiyonları kullanılır ve normalize edilmiş görüntüler üretmek için çıkış katmanında bir Tanh aktivasyon fonksiyonu uygulanır.

Algoritma ve İş Akışı
SegCycle-SPADE çerçevesi; semantik segmentasyon, özellik füzyonu, desen yeniden yapılandırması ve sanatsal stil sentezini birleşik bir eğitim hattı içerisinde entegre eder. İş akışı, görüntü boyutlandırma, normalizasyon, gürültü giderme ve segmentasyon maskesi hazırlama dahil olmak üzere veri seti edinimi ve ön işleme ile başlar. Ön işlemden geçmiş görüntüler, semantik motif temsillerini çıkarmak için SegFormer-B2 segmentasyon ağı kullanılarak işlenir. Elde edilen segmentasyon özellikleri, CAFFM aracılığıyla yeniden yapılandırma özellikleriyle birleştirilerek yapısal motif bilgileri ile sanatsal özellik temsilleri arasında etkileşim sağlanır. Füzyon uygulanmış özellik haritaları daha sonra, semantik tutarlılığı korurken eksik kültürel motif yapılarını restore eden CycleGAN yeniden yapılandırma modülüne aktarılır. Yeniden yapılandırılan desenler, motif sınırlarını ve yapısal özgünlüğü koruyarak stilistik iyileştirme sağlayan segmentasyon güdümlü sanatsal sentez için SPADE üreticisine sunulur. Eğitim sırasında model parametreleri, segmentasyon doğruluğu, motif koruması, yeniden yapılandırma kalitesi ve sanatsal stil tutarlılığını dengeleyen Denklem 21 ve 22'de açıklanan bileşik kayıp fonksiyonu kullanılarak optimize edilir. Veri seti yükleme, ön işleme, model başlatma, eğitim yinelemeleri, doğrulama prosedürleri, kontrol noktası seçimi ve final değerlendirmesini içeren ayrıntılı adım uygulama iş akışı Ek Dosya 1 (Algoritma 1)'de sunulmuştur. Tüm algoritmik iş akışı; 16'lık bir grup boyutu (batch size), 0.02 öğrenme hızı ve 10 eğitim dönemi (epoch) kullanılarak uygulanmıştır. Veri seti bölümlendirme, model başlatma ve tüm eğitim deneyleri için 42 sabit rastgele tohum (seed) kullanılmıştır. Tekrarlanabilirliği sağlamak amacıyla tohum; Python, NumPy ve PyTorch rastgele sayı üreteçleri genelinde tutarlı bir şekilde uygulanmıştır. Adam optimize edici β₁ = 0.5, β₂ = 0.99 ve ağırlık azalması olmadan (weight decay = 0) yapılandırılmıştır. Model kontrol noktaları, doğrulama veri setinde elde edilen en yüksek doğrulama IoU puanına göre seçilmiştir.

Kayıp Fonksiyonu Optimizasyonu
Yeniden yapılandırma ve sanatsal sentez sırasında kültürel motif yapılarını korumak için, önerilen çerçeve; segmentasyon, adversariyal, döngüsel tutarlılık, yeniden yapılandırma, motif koruma ve stil tutarlılığı kayıplarını birleştiren bileşik bir optimizasyon hedefi kullanır. Eksiksiz matematiksel formülasyon, ağırlıklandırma katsayıları ve stil kaybı tanımı, SPADE kullanılarak Sanatsal Stil Üretimi alt bölümündeki Denklem 21 ve 22'de sunulmuştur. Motif koruma bileşeni, tahmin edilen motif bölgeleri ile karşılık gelen gerçek segmentasyon maskeleri arasındaki yapısal sapmaları cezalandırarak, yeniden yapılandırma süreci boyunca kültürel açıdan önemli desen yapılarının korunmasını teşvik eder.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Önerilen SegCycle-SPADE çerçevesi, iki veri kümesi kullanılarak değerlendirilmiştir: Miao Batik kültürel motif veri kümesi ve WikiArt veri kümesi. Miao Batik veri kümesi, geleneksel kültürel miras imgelerini içermekte olup öncelikle semantik segmentasyon ve yapısal yeniden yapılandırma görevleri için kullanılmıştır; WikiArt veri kümesi ise çeşitli sanatsal stiller içermekte olup sanatsal stil öğrenimi ve üretimi için kullanılmıştır. Her iki veri kümesinden alınan imgeler; semantik segmentasyon, CAFFM, desen yeniden yapıl...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Geleneksel zanaatların kademeli olarak yok olması nedeniyle, Somut Olmayan Kültürel Miras (SOKÜM) desenlerinin korunması ve dijital rekonstrüksiyonu son yıllarda artan bir ilgi görmüştür. Önceki çalışmalar, DL tabanlı görüntü işleme teknikleri aracılığıyla kültürel miras kaybını gidermeye çalışmıştır. Örneğin, Quan ve ark.32, Guizhou Miao batik kültürü için bilgi grafikleri ve DL tabanlı bir kültürel miras koruma çerçevesi önermiştir. Çalışma kültürel desenlerin dijital rekonstrüksiyonuna odaklanm...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Çıkar Çatışması:
Yazarlar herhangi bir çıkar çatışması olmadığını beyan ederler.

Teşekkürler

Yazarlar, bu araştırmanın tamamlanması sırasında Guangdong Mühendislik Politeknik Üniversitesi ve Güney Çin Normal Üniversitesi tarafından sağlanan akademik ve kurumsal desteği kabul ederler. Bu araştırma, “Dijital Yeniden Canlandırma Müzesi: Çin Klasik Kaligrafi ve Resim Kültürel Kalıntılarının Aktivasyonu ve İletişimi Üzerine Araştırmalar” başlıklı 2023 Ulusal Sosyal Bilimler Fonu Genel Projesi (No. 23BH161) tarafından desteklenmiştir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Adam OptimizerPyTorch Optimizer KütüphanesiAdamModel eğitimi sırasında kullanılan optimizasyon algoritması.
CUDA ToolkitNVIDIA CorporationCUDA 11.3Derin öğrenme hesaplamaları için GPU hızlandırması.
cuDNNNVIDIA CorporationcuDNN 8.2Eğitimi ve çıkarımı hızlandırmak için kullanılan derin sinir ağı hızlandırma kütüphanesi.
CycleGANUniversity of California, Berkeley / Açık KaynakResmî PyTorch Uygulaması (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)Kültürel motif yeniden yapılandırması için kullanılan üretken çekişmeli ağ.
ImageNet Ön Eğitimli AğırlıklarImageNet / Açık Kaynakmit_b2.pth (ImageNet-1K Ön Eğitimli Kontrol Noktası)Miao Batik veri seti üzerinde ince ayar yapmadan önce SegFormer-B2 omurgasını başlatmak için kullanılır.
Intel İşlemciIntel CorporationIntel Core i7 (11. Nesil)Görüntü ön işleme, model eğitimi desteği ve çıkarım için kullanılan CPU.
MatplotlibMatplotlib Geliştirme EkibiMatplotlib 3.5.1Eğitim eğrilerinin ve değerlendirme sonuçlarının görselleştirilmesi.
Miao Batik Veri SetiZenodo DeposuDOI: 10.5281/zenodo.20807658Semantik segmentasyon ve desen yeniden yapılandırması için kullanılan 15.148 görüntü içeren kültürel motif veri seti.
NumPyNumPy GeliştiricileriNumPy 1.21.5Sayısal hesaplama ve veri seti işleme.
NVIDIA GPUNVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)Model eğitimi ve çıkarımı için kullanılan donanım platformu.
OpenCVOpenCV VakfıOpenCV 4.5.5Görüntü ön işleme, yeniden boyutlandırma, interpolasyon ve Gauss gürültü giderme.
İşletim SistemiCanonical Ltd.Ubuntu 20.04 LTSDeneysel yürütme ortamı.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0Görüntü yükleme ve manipülasyonu.
PythonPython Software FoundationPython 3.8.10Uygulama ve deneyleme için kullanılan programlama dili.
PyTorchMeta AIPyTorch 1.10.0Model eğitimi ve çıkarımı için kullanılan derin öğrenme çerçevesi.
Rastgele TohumDeneysel Ayar42Veri seti bölümlendirme, model başlatma ve deneysel tekrarlanabilirlik için kullanılan sabit tohum.
Scikit-learnScikit-learn GeliştiricileriScikit-learn 1.0.2Veri seti bölümlendirme, istatistiksel analiz ve değerlendirme metrikleri.
SeabornAçık Kaynak TopluluğuSeaborn 0.11.2İstatistiksel veri görselleştirme.
SegFormer-B2NVIDIA Research / Açık KaynakSegFormer-B2 (MIT-B2 Omurgası)Kültürel motif segmentasyonu için kullanılan Transformer tabanlı semantik segmentasyon modeli.
Segmentasyon Maskeleri / AçıklamalarMiao Batik Veri SetiVeri Seti ile Birlikte VerilmiştirMotif sınıflandırması ve eğitimi için kullanılan piksel düzeyinde semantik segmentasyon etiketleri.
SPADENVIDIA Research / Açık KaynakResmî PyTorch Uygulaması (https://github.com/NVlabs/SPADE)Artistik desen üretimi için kullanılan segmentasyon güdümlü görüntü sentezleme modeli.
TorchVisionMeta AITorchVision 0.11.1PyTorch ile kullanılan görüntü işleme yardımcıları ve veri seti dönüşümleri.
WikiArt Veri SetiWikiArthttps://www.wikiart.org/Stil öğrenimi ve sentezi için kullanılan, 27 artistik stilde 80.000'den fazla sanat eseri içeren artistik stil veri seti.

Kaynaklar

  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Etiketler

Desen Rekonstr ksiyonuSegCycle SPADESegFormer ModeliCycleGANK lt rel znitelik F zyonuUzamsal Adaptif Denormalizasyon