$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Önerilen SegCycle-SPADE çerçevesi; semantik segmentasyon, dikkat mekanizmasıyla özellik iyileştirme, üretici yeniden yapılandırma ve sanatsal stil sentezi aracılığıyla geleneksel kültürel miras desenlerini yeniden yapılandırmak ve iyileştirmek için tasarlanmıştır. Bu çalışmada, Miao Batik veri seti ve WikiArt veri seti dahil olmak üzere halka açık kültürel miras ve sanatsal görüntü veri setleri kullanılmıştır. Araştırmada insan katılımcı, hasta verisi, kişisel bilgi, hayvan denek veya klinik kayıt yer almadığından, kurumsal etik kurul onayı ve bilgilendirilmiş onam gerekmemiştir. İlk olarak, değerlendirme için Miao Batik kültürel motif veri seti ve WikiArt veri seti kullanılmıştır. Quan et al. (2024)32 tarafından tanımlanan Miao Batik veri seti, geleneksel Miao batik motiflerinin 15.148 adet açıklanmış görüntüsünü içermektedir. Veri setini oluşturanlar tarafından sağlanan mevcut açıklamalar doğrudan kullanılmış ve bu çalışmada ek manuel açıklamalar oluşturulmamıştır. Ardından, görüntülerin ön işlemesi boyutlandırma, normalleştirme, gürültü giderme ve bir segmentasyon maskesi oluşturma işlemleriyle gerçekleştirilmiştir. Kesin ön işleme parametreleri Veri Ön İşleme alt bölümünde açıklanmıştır. Önerilen çerçeve, verilerin semantik segmentasyonu için SegFormer-B2 adlı transformer tabanlı bir model kullanmaktadır. Yöntem, kültürel motiflerin anahtar bölgelerini tespit etmek ve yapılarını öğrenmek için tasarlanmıştır. Segmentlere ayrılmış özellikler daha sonra, kültürel motiflerle ilgili önemli bilgilerin vurgulandığı ve ilgisiz bilgilerin elendiği bir dikkat mekanizması aracılığıyla iyileştirilmiştir. Dikkat mekanizması konfigürasyonu CAFFM alt bölümünde açıklanmıştır. İyileştirilen özellikler daha sonra, hasarlı yapıların döngüsel öğrenme yoluyla yeniden yapılandırıldığı CycleGAN'den geçirilmiştir. Eğitim sırasında, orijinal Miao Batik görüntülerine rastgele maskeleme ve kısmi kapatma işlemleri uygulanarak yapay olarak eksik motif örnekleri oluşturulmuştur. Bu bozulma prosedürleri, yıpranmış kültürel miras eserlerinde yaygın olarak gözlemlenen eksik motif bölgelerini ve yapısal hasarları simüle etmiştir. Ortaya çıkan eksik görüntüler CycleGAN yeniden yapılandırma modülüne girdi olarak verilmiş, karşılık gelen orijinal görüntüler ise yeniden yapılandırma hedefleri olarak kullanılmıştır. Yeniden yapılandırılan kültürel miras desenleri daha sonra, üretilen segmentasyon haritalarına dayalı olarak sanatsal iyileştirmenin gerçekleştirildiği SPADE aracılığıyla geliştirilmiştir. Önerilen çerçevenin performansı, kantitatif segmentasyon ve görüntü kalitesi metrikleri kullanılarak değerlendirilmiş; yeniden yapılandırılan kültürel motiflerin görsel özgünlüğü ise kalitatif olarak değerlendirilmiştir. Görsel özgünlük, üretilen kültürel desenlerin görsel incelemesi yoluyla değerlendirilmiş ve bağımsız bir kantitatif metrik olarak kullanılmamıştır. Değerlendirme; motif korunumu, semantik tutarlılık, kültürel özellikler, yapısal uyum ve ilgili referans kültürel motiflere göre sanatsal görünüme odaklanmıştır. Model performansının kantitatif değerlendirmesi; Segmentasyon Doğruluğu, IoU, Dice Katsayısı, Yapısal Benzerlik İndeksi (SSIM), Pik Sinyal-Gürültü Oranı (PSNR) ve Fréchet Inception Distance (FID) kullanılarak gerçekleştirilmiştir. Şekil 2, önerilen SegCycle-SPADE çerçevesinin genel iş akışını göstermekte ve bu çalışmada kullanılan değerlendirme metriklerini özetlemektedir.

Şekil 2. Önerilen SegCycle-SPADE Çerçevesinin Genel Mimari İş Akışı. SegCycle-SPADE iş akışının tamamına genel bakış. Miao Batik ve WikiArt veri setlerinden alınan görüntüler; SegFormer-B2 kullanılarak semantik segmentasyon, CAFFM kullanılarak özellik iyileştirme, CycleGAN kullanılarak desen yeniden yapılandırma ve SPADE kullanılarak sanatsal stil üretimi işlemlerinden geçmeden önce ön işlemlere tabi tutulur. Model performansı Segmentasyon Doğruluğu, Intersection over Union (IoU), Dice Katsayısı, Yapısal Benzerlik Endeksi Ölçümü (SSIM), PSNR ve Fréchet Inception Distance (FID) kullanılarak değerlendirilirken, görsel özgünlük nitel olarak analiz edilir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Kültürel miras desen rekonstrüksiyonu için geliştirilen SegCycle-SPADE çerçevesi, Şekil 2'de gösterildiği üzere, motiflerin doğru segmentasyonu, rekonstrüksiyonu ve sanatsal iyileştirmesi için birden fazla DL bileşenini entegre edecek şekilde tasarlanmıştır. Çeşitli kültürel desenler ve sanatsal stiller sağlamak amacıyla Miao Batik kültürel motif veri kümesi ve WikiArt veri kümesinden alınan görüntüler kullanılmıştır. Başlangıçta görüntüler, kültürel motifleri arka plandan ayırt etmek ve sınırlarını belirlemek için SegFormer tabanlı bir semantik segmentasyon modülü kullanılarak işlenir. Genel mimari dört ana aşamadan oluşmaktadır. İlk olarak, SegFormer modeli kültürel desen görüntülerinden semantik segmentasyon haritaları çıkarır. İkinci olarak, CAFFM, özellik öğrenimini geliştirmek için segmentasyon özelliklerini üretken temsillerle entegre eder. Üçüncü olarak, CycleGAN modülü, birleştirilmiş özellik temsillerini kullanarak kültürel desenleri yeniden yapılandırır. Son olarak, SPADE modülü, segmentasyon kılavuzlu sentez yoluyla yapısal tutarlılığı korurken stilistik olarak iyileştirilmiş çıktılar üretir. İyileştirilmiş özellik haritaları, daha sonra bozulmuş desenleri karşılık gelen tam formlarına eşleyerek eksik kültürel motifleri geri yüklemeyi öğrenen CycleGAN rekonstrüksiyon modülü tarafından işlenir. Eksik motif örnekleri, orijinal Miao Batik görüntülerine rastgele maskeleme ve kısmi oklüzyon işlemleri uygulanarak oluşturulmuş, böylece hasarlı kültürel eserlerde yaygın olarak gözlemlenen eksik desen bölgeleri ve yapısal bozulmalar simüle edilmiştir. Her bozulmuş görüntü, eğitim sırasında rekonstrüksiyon hedefi olarak hizmet eden karşılık gelen orijinal görüntüsüyle eşleştirilmiştir. Bu strateji, CycleGAN modülünün semantik tutarlılığı ve kültürel açıdan önemli özellikleri korurken eksik motif yapılarının restorasyonunu öğrenmesini sağlamıştır. Son olarak, SPADE üreteci, görüntü sentezini üretilen segmentasyon haritalarına koşullandırarak görsel olarak iyileştirilmiş sanatsal çıktılar üretir ve böylece sanatsal iyileştirme süreci boyunca kültürel motiflerin yapısal bütünlüğünü korur.
Önerilen SegCycle-SPADE çerçevesinde aşağıdaki adımlar yer almaktadır.
Adım 1: Veri Seti Toplama
Kültürel desen öğrenimi ve sanatsal stil oluşturma hedeflerine ulaşmak için iki veri seti kullanılmıştır. Geleneksel kültürel desen bilgilerini sağlamak amacıyla Miao Batik Kültürel Motif Veri Seti kullanılmıştır. Bu veri setine Zenodo (https://doi.org/10.5281/zenodo.20807658) üzerinden herkese açık olarak erişilebilmekte olup, geleneksel Miao batik motiflerine ait 15.148 adet etiketlenmiş görüntü içermektedir. Veri setini oluşturanlar tarafından sağlanan mevcut etiketlemeler doğrudan kullanılmış ve bu çalışmada ek bir manuel etiketleme yapılmamıştır. Sanatsal stil oluşturma için çeşitli sanatsal stil bilgilerini sağlamak amacıyla kullanılan WikiArt veri seti ise herkese açık olan WikiArt deposundan (https://www.wikiart.org/) temin edilmiştir.
Adım 2: Veri Ön İşleme
Tüm görüntüler yeniden boyutlandırma, normalizasyon ve gürültü azaltma işlemleriyle ön işlemeden geçirilmiştir. Semantik segmentasyon aşamasını desteklemek amacıyla, orijinal veri seti kaynaklarından elde edilen mevcut kültürel motif açıklamaları kullanılmıştır. Bu çalışmanın bir parçası olarak herhangi bir ek açıklama veya yeniden etiketleme prosedürü uygulanmamıştır.
Adım 3: SegFormer Kullanarak Semantik Desen Segmentasyonu
Kültürel motif segmentasyonu için SegFormer modeli kullanılmıştır. Tam SegFormer omurgası ve başlatma stratejisi, SegFormer Kullanarak Semantik Desen Segmentasyonu alt bölümünde açıklanmıştır. Özellikle, semantik motif segmentasyonu için ImageNet-ön eğitimli MIT-B2 omurgasına sahip SegFormer-B2 mimarisi kullanılmıştır. Bu model, geleneksel kültürel desenlerin karmaşık yapısal detaylarını korurken küresel bağlamsal bilgileri etkili bir şekilde yakalar.
Adım 4: CAFFM
CAFFM, anlamsal segmentasyon özelliklerini üretici temsillerle birleştirerek, çerçevenin hem yapısal motif özelliklerini hem de sanatsal stil bilgilerini öğrenmesini sağlar. CAFFM'nin entegrasyon ayrıntıları CAFFM alt bölümünde verilmiştir. Modül, SegFormer tabanlı anlamsal segmentasyon aşaması ile üretici yeniden yapılandırma aşaması arasına yerleştirilmiştir ve burada segmentasyondan türetilen yapısal özellikleri, çok kafalı çapraz dikkat (multi-head cross-attention) aracılığıyla yeniden yapılandırma özellikleriyle kaynaştırır. Bu işlem, kültürel motiflerin korunmasını iyileştirir ve yeniden yapılandırılan çıktıların gerçekçiliğini artırır.
Adım 5: Desen Yeniden Yapılandırma (CycleGAN)
Birleştirilmiş özellikler, kültürel desen yapılarını yeniden oluşturmak için ardından CycleGAN modülü tarafından işlenir. CycleGAN mimarisi ve eğitim konfigürasyonu, CycleGAN Kullanarak Desen Yeniden Yapılandırma alt bölümünde açıklanmıştır. Yeniden yapılandırma modülü, iki jeneratör ve iki diskriminatörden oluşur; dokuz rezidüel blok içeren bir rezidüel ağ jeneratör mimarisi kullanır, bir PatchGAN diskriminatörü uygular ve adverseryal ile döngü tutarlılığı kayıpları kullanılarak eğitilir. Bu konfigürasyon, çift yönlü alan eşlemesine olanak tanır ve eksik kültürel desen yapılarının yeniden yapılandırılmasını kolaylaştırır.
Adım 6: Artistik Stil Üretimi (SPADE)
Yeniden yapılandırılan desenler, ardından segmentasyon rehberliğinde artistik stil sentezi gerçekleştirmek amacıyla SPADE modülünden geçirilir. SPADE jeneratör yapılandırması, SPADE Kullanılarak Artistik Stil Üretimi alt bölümünde açıklanmıştır. Modül; SPADE rezidüel bloklar, mekansal olarak uyarlanabilir normalizasyon katmanları ve SegFormer segmentasyon haritaları ile CAFFM öznitelik temsillerinden türetilen semantik koşullandırmayı kullanır. Görüntü üretimi segmentasyon haritalarına koşullandırılarak, sentezlenen çıktıların orijinal kültürel motiflerle yapısal hizalanmasının korunması ve aynı zamanda artistik stil özelliklerinin dahil edilmesi sağlanır.
Adım 7: Performans Tahmini
Önerilen çerçeve; Segmentasyon Doğruluğu, IoU, Dice Benzerlik Katsayısı (Dice), SSIM, PSNR ve FID dahil olmak üzere birden fazla segmentasyon ve görüntü kalitesi değerlendirme metriği kullanılarak değerlendirilmiştir. Deneysel tutarlılığı değerlendirmek için tüm deneyler farklı rastgele tohumlar kullanılarak beş kez tekrarlanmış ve sonuçlar ortalama ± standart sapma olarak raporlanmıştır. İstatistiksel anlamlılık, p < 0.05 anlamlılık eşiği ile eşleştirilmiş t-testleri kullanılarak değerlendirilmiştir.
Veri Kümesi Toplama
Önerilen SegCycle-SPADE çerçevesinde, kültürel desen anlayışı ve stil öğrenimi için iki veri kümesi kullanılmaktadır. Önerilen çerçevede kullanılan ilk veri kümesi, Miao Batik kültürel motif veri kümesidir. Bu veri kümesi, Miao etnik sanatında kullanılan hayvanlar, bitkiler ve geometrik şekiller gibi motifler içeren geleneksel Miao Batik görüntülerinden oluşan kültürel motifleri içermektedir. Bu veri kümesi, kültürel mirasın korunması için genellikle önemli olan zengin doku bilgilerine sahip görüntüler içermektedir. SegCycle-SPADE'in önerilen çerçevesinde kullanılan ikinci veri kümesi ise WikiArt veri kümesidir. Bu veri kümesi, genellikle farklı stillerde olan çok sayıda sanat eseri içermektedir. Bu veri kümesi, sanat eserlerini geliştirmek için genellikle yararlı olan karmaşık stil öğrenimi için kullanılmaktadır. Bu veri kümesi, DL tabanlı stil oluşturma veya dönüştürme görevleri için onu daha kullanışlı kılan, 27 farklı tasarımda HD çözünürlüğünde 80.000 sanat eseri içermektedir.
Miao Batik Veri Seti:
Miao Batik veri seti (https://doi.org/10.5281/zenodo.20807658), kültürel açıdan anlamlı motifler içeren 15.148 batik desen imajından oluşmaktadır. İmajlar; hayvan motifleri (örneğin kelebekler ve balıklar), bitki tabanlı desenler ve kültürel sembolizm taşıyan geometrik motifler gibi çeşitli geleneksel tasarımları içermektedir. Bu veri seti, segmentasyon modülünün desen yeniden yapılandırması sırasında motif sınırlarını doğru bir şekilde tanımlamasını ve korumasını sağlayan özgün kültürel yapılar sunduğu için önerilen çerçevenin önemli bir bileşenidir (Tablo 1). Bu çalışmada, kültürel açıdan önemli motifler; kuşlar, kelebekler, floral desenler ve ata totemleri dahil olmak üzere, Miao kültürel miras literatüründe yaygın olarak belgelenen ve veri seti açıklamalarında temsil edilen sembolik görsel öğeleri ifade etmektedir. Bu motifler, yalnızca görülme sıklıklarına veya mekansal kompozisyonlarına göre değil, belgelenmiş kültürel önemleri ve geleneksel Miao batik ile nakış tasarımlarındaki tekrarlayan varlıklarına göre seçilmiştir. Uzman rehberliğindeki motif açıklamaları ve segmentasyon etiketleri, orijinal Miao Batik veri seti kaynağından alınmış ve bu çalışmada doğrudan kullanılmıştır. Yazarlar tarafından ek bir manuel açıklama, yeniden etiketleme veya uzman rehberliğinde açıklama prosedürü gerçekleştirilmemiştir. Veri seti oluşturucuları tarafından sağlanan mevcut açıklamalar, semantik segmentasyon eğitimi ve değerlendirmesi için kullanılmıştır.
| Parametre | Açıklama |
| Veri Seti Adı | Miao Batik Kültürel Desen Veri Seti |
| Veri Seti Kaynağı | Zenodo Deposu (DOI: 10.5281/zenodo.20807658) |
| Alan | Somut Olmayan Kültürel Miras (SOKM) / Tekstil Desen Analizi |
| Toplam Görüntü Sayısı | 15.148 görüntü |
| Görüntü Türü | Geleneksel Miao batik tekstil desenlerinin dijital görüntüleri |
| Desen Kategorileri | Hayvan motifleri, bitki motifleri ve geometrik motifler |
| Kültürel Köken | Miao etnik kültürü, Guizhou Eyaleti, Çin |
| Orijinal Görüntü Çözünürlüğü | Ön işlemden önce ham taramalar veya fotoğraflar olarak yakalanmış yüksek çözünürlüklü görüntüler (genellikle kısa kenarı ≥ 1.000 piksel) |
| Eğitim Çözünürlüğü | Görüntüler 256 boyutuna getirildi × ön işleme sırasında 256 piksel |
| Anotasyon Kullanılabilirliği | Veri seti oluşturucuları tarafından sağlanan mevcut segmentasyon anotasyonları, eğitim ve değerlendirme için herhangi bir değişiklik yapılmadan kullanılmıştır. Bu çalışmada ek bir manuel anotasyon, yeniden etiketleme veya uzman onay prosedürü uygulanmamıştır. |
| Bu Çalışmadaki Uygulama | Kültürel motif bölütleme, öznitelik çıkarma, motif koruma ve desen yeniden yapılandırma |
Tablo 1: Miao Batik Kültürel Desen Veri Setinin Özellikleri. Semantik segmentasyon, kültürel desen analizi ve motif rekonstrüksiyonu için kullanılan Miao Batik kültürel motif veri setinin özeti. Tablo; veri seti kaynağını, görüntü özelliklerini, motif kategorilerini, kültürel kökeni, görüntü çözünürlüğünü ve önerilen SegCycle-SPADE çerçevesindeki rolünü tanımlamaktadır.
WikiArt Veri Seti:
WikiArt veri seti [https://www.wikiart.org/], Tablo 2'de belirtilen 27 farklı sanatsal stilden 80.000'den fazla görüntüyü içeren popüler ve geniş ölçekli bir dijital sanat deposudur. Stiller arasında Rönesans sanatı, Empresyonizm, Kübizm ve Sürrealizm yer almaktadır. Veri seti, SPADE modülünün segmentasyon sürecinden elde edilen yapısal bilgileri korurken kültürel açıdan zengin desenler oluşturmasına olanak tanıyan bilgiler sunduğu için önerilen çerçevede oldukça önemlidir. Veri seti, eğitim için 56.000 ve hem doğrulama hem de test için 12.000 görüntüden oluşmaktadır. Veri setindeki görüntüler, DL modelinin etkili bir şekilde eğitilmesine yardımcı olur.
| Parametre | Açıklama |
| Veri Seti Adı | WikiArt Veri Seti |
| Veri Seti Kaynağı | WikiArt Deposu (https://www.wikiart.org/) |
| Alan | Dijital Sanat ve Tablolar |
| Toplam Görüntü Sayısı | Yaklaşık 80,000 sanat eseri |
| Eğitim Görüntüleri | 56,000 |
| Doğrulama Görüntüleri | 12,000 |
| Test Görüntüleri | 12,000 |
| Sanatsal Stiller | Rönesans, İzlenimcilik, Kübizm, Sürrealizm, Ekspresyonizm, Realizm ve Soyut Sanat dahil olmak üzere 27 sanatsal stil |
| Orijinal Görüntü Çözünürlüğü | Orijinal görüntü çözünürlükleri sanat eserlerine ve kaynaklara göre değişiklik göstermektedir. Görüntüler, ön işleme sırasında 256 × 256 piksel standart çözünürlüğe yeniden boyutlandırılmıştır. |
| Eğitim Çözünürlüğü | Görüntüler, sanatsal stil öğrenimi ve segmentasyon güdümlü görüntü sentezi öncesindeki ön işleme aşamasında 256 × 256 piksele yeniden boyutlandırılmıştır. |
| Veri Seti Bölümleme | 42 sabit rastgele tohumu kullanılarak tabakalı rastgele bölümleme (%70 eğitim, %15 doğrulama ve %15 test) |
| Stil Örnekleme Stratejisi | 27 sanatsal stilin eğitim, doğrulama ve test alt kümeleri arasındaki dağılımını korumak için tabakalı orantılı örnekleme uygulanmıştır |
| Bu Çalışmadaki Uygulaması | Sanatsal stil öğrenimi, stil temsili ve segmentasyon güdümlü sanatsal sentez |
Tablo 2: WikiArt Veri Kümesinin Özellikleri. Sanatsal stil öğrenimi ve stil rehberli görüntü sentezi için kullanılan WikiArt veri kümesinin özeti. Tablo; veri kümesi kaynağını, görüntü dağılımını, sanatsal stil kapsamını, veri kümesi bölümlendirmesini, görüntü çözünürlüğünü ve önerilen SegCycle-SPADE çerçevesi içindeki uygulamasını açıklamaktadır.
Miao Batik veri seti, geleneksel Miao kültürel motiflerini temsil eden 15.148 görüntü içermektedir.32 Veri seti Zenodo (https://doi.org/10.5281/zenodo.20807658) üzerinden kamuya açık olarak sunulmaktadır. Model eğitimi öncesinde tüm görüntüler görsel olarak incelenmiş, 256 × 256 piksel boyutuna getirilmiş, normalize edilmiş ve bozuk veya kopya örnekler için taranmıştır. Kalite kontrol taraması sonucunda herhangi bir görüntünün çıkarılmasına gerek duyulmamış; bu nedenle, sonraki analizler için tüm 15.148 görüntü korunmuştur. Veri seti bölümlerinin tekrarlanabilirliğini sağlamak amacıyla, 42 sabit rastgele tohum (seed) kullanılarak eğitim (%70), doğrulama (%15) ve test (%15) alt kümelerine rastgele ayrılmıştır. WikiArt veri setine resmi WikiArt deposu (https://www.wikiart.org/) aracılığıyla erişilmiş olup, bu set 27 farklı sanatsal stili kapsayan 80.000'den fazla sanat eseri içermektedir. Stil öğrenme deneyleri için 56.000 görüntü eğitim, 12.000 görüntü doğrulama ve 12.000 görüntü test amacıyla kullanılmıştır.
Veri Ön İşleme
Önerilen SegCycle-SPADE çerçevesi eğitilmeden önce, tutarlı görüntü kalitesi ve doğru özellik temsili sağlamak amacıyla Miao Batik kültürel motif veri seti ve WikiArt veri seti birkaç ön işleme adımına tabi tutulmuştur. Gauss gürültü giderme, normalizasyon, tutarlı bir giriş çözünürlüğüne yeniden boyutlandırma ve görüntü kalitesi doğrulamasını içeren aynı temel ön işleme hattı her iki veri setine de uygulanmıştır. Bununla birlikte, veri setleri çerçeve içerisinde farklı roller üstlenmiştir. WikiArt veri seti sanatsal stil öğrenimi ve sentezi için kullanılırken, Miao Batik veri seti öncelikle kültürel motif segmentasyonu ve yeniden yapılandırma için kullanılmıştır. Bu göreve özel roller dışında, veri setine özgü herhangi bir ön işleme değişikliği yapılmamıştır. DL modelinin tutarlı bir şekilde işlem yapmasını sağlamak için görüntüler önce sabit bir çözünürlüğe yeniden boyutlandırılmıştır. Her iki veri setindeki görüntülerin kaynaklarına bağlı olarak çözünürlüklerinin farklılık göstermesi nedeniyle bu adım gerekli olmuştur. Yeniden boyutlandırma, hesaplama verimliliğini artırmış ve boyut tutarsızlıklarının eğitimi etkilemesini önlemiştir. İkinci ön işleme adımı, eğitim sırasında gradyan güncellemelerini stabilize etmek için piksel değerlerinin standart bir aralığa ölçeklendiği normalizasyon işlemi olmuştur. Ardından görüntüler, kültürel motif yapılarını bozabilecek gürültüyü azaltmak için Gauss filtreleme kullanılarak işlenmiştir. Miao Batik veri seti için, orijinal veri seti kaynağından doğrudan elde edilen mevcut kültürel motif segmentasyon maskeleri, semantik segmentasyon eğitimi ve değerlendirmesi için herhangi bir değişiklik yapılmadan kullanılmıştır. Bu çalışma için özel olarak yeni segmentasyon maskeleri oluşturulmamıştır.
Aksi belirtilmedikçe, yerleşik yöntemleri tanımlayan denklemler önceki çalışmalardan uyarlanmış ve buna göre atıfta bulunulmuştur. Önerilen CAFFM ve kompozit SegCycle-SPADE optimizasyon çerçevesini tanımlayan denklemler, yazarlar tarafından bu çalışma için geliştirilmiştir.
Veri kümesinden gelen bir giriş görüntüsünün Denklem 1 ile temsil edildiğini varsayalım:
(1)
Burada H, W ve C sırasıyla görüntü yüksekliğini, genişliğini ve renk kanallarının sayısını ifade eder. Tüm görüntüler, Denklem 2'de gösterildiği gibi sabit bir H′ × W′ boyutuna yeniden boyutlandırılır:

Burada, Ir yeniden boyutlandırılmış görüntüdür. Normalize edilmiş piksel değerleri Denklem 3'e göre hesaplanır:
(3)
Bu, eğitim prosedürünün stabilize edilmesine yardımcı olur. Gürültü filtreleme, Denklem 4'te gösterildiği gibi bir Gauss filtresi kullanılarak gerçekleştirilir:

Burada, G(σ) bir Gauss filtresidir ve * konvolüsyonu temsil eder. Standart sapması σ = 1.0 olan 5 × 5 çekirdekli bir Gauss filtresi kullanılmıştır. Kenar artefaktlarını azaltmak için sınır piksellerine yansıtmalı dolgu (reflective padding) uygulanmıştır. Gürültü giderme işlemi, ölçeklendirme ve normalizasyondan önce, görüntüler yüklendikten hemen sonra gerçekleştirilmiştir. Çalışma boyunca tekdüze bir ön işleme sağlamak amacıyla, Miao Batik ve WikiArt veri setlerindeki her görüntüye aynı filtre yapılandırması uygulanmıştır. Miao Batik veri seti için segmentasyon maskeleri Denklem 5'e göre oluşturulur:

Burada, M, SegFormer modeline rehberlik etmek için kullanılan bir segmentasyon maskesidir.
Önişleme hattı, Şekil 3'te gösterildiği gibi, Miao Batik veri setinden ve WikiArt veri setinden görüntülerin elde edilmesiyle başlar. Eğitim sırasında herhangi bir veri artırma tekniği uygulanmamıştır. Yeniden boyutlandırma, normalleştirme, Gauss gürültü giderme ve segmentasyon maskesi hazırlama işlemlerini içeren önişlemeden sonra görüntüler; önerilen SegCycle-SPADE çerçevesinin eğitimi, doğrulanması ve test edilmesi için doğrudan kullanılmıştır. Önişleme hattının ilk adımı, DL modelinin görüntüleri daha verimli işlemesini sağlamak amacıyla görüntülerin sabit bir boyuta yeniden boyutlandırılmasını içerir. İkinci adım, piksel değerlerini standartlaştırılmış bir sayısal aralığa dönüştüren ve model yakınsamasını kolaylaştıran normalleştirmeyi kapsar. Üçüncü adım, örüntü tanımayı geliştirmek için görüntülerin istenmeyen gürültülerden arındırıldığı gürültü giderme işlemini içerir. Ayrıca, Miao Batik veri seti için kültürel motif bölgeleri işaretlenerek, önerilen modelin segmentasyon modülünde kullanılan maskelerin oluşturulması sağlanmış ve böylece üretim sırasında kültürel motiflerin korunması garanti altına alınmıştır. Bu aşamanın nihai çıktısı, önerilen modelin segmentasyon ve üretim modüllerini eğitmek için hazır, temiz bir veri setidir.

Şekil 3. Kültürel Miras Görüntüleri için Veri Ön İşleme Hattı. Model eğitimi öncesinde uygulanan görüntü ön işleme prosedürlerini gösteren iş akışı. Hat; veri seti edinimi, görüntü boyutlandırma, normalizasyon, Gaussian gürültü giderme, mevcut kültürel motif anotasyonları ve segmentasyon maskesi hazırlama adımlarını içerir. Elde edilen işlenmiş görüntüler ve maskeler, semantik segmentasyon ve desen yeniden yapılandırma için girdi olarak kullanılır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Model eğitimi öncesinde her görüntü bir kalite kontrol sürecinden geçirilmiştir. Miao Batik veri seti 15.148 görüntü içermekteydi. Bozuk, kopya ve düşük kaliteli örnekler orijinal veri seti oluşturucuları tarafından halihazırda ele alınmıştı; bu nedenle, bu çalışmadaki kalite kontrol taraması sırasında ek herhangi bir görüntü hariç tutulmamıştır. Sonuç olarak, tüm 15.148 görüntü analiz için saklanmıştır. Görüntüler ön işleme sırasında RGB formatında yüklenmiş ve bilinear interpolasyon kullanılarak 256 × 256 piksel boyutuna getirilmiştir. Piksel değerleri, 255'e bölünerek [0, 255] aralığından [0, 1] aralığına ölçeklendirilmiştir. Ardından, sırasıyla kırmızı, yeşil ve mavi kanallar için [0.485, 0.456, 0.406] ortalama değerleri ve [0.229, 0.224, 0.225] standart sapma değerleri kullanılarak kanal bazlı normalizasyon uygulanmıştır. Ön işleme hattı; görüntü yükleme, RGB dönüşümü, yeniden boyutlandırma, piksel değeri ölçeklendirme, normalizasyon ve tensör dönüşümünü içermiştir. Gerektiğinde, DL modelleriyle uyumluluğu korumak için gri tonlamalı görüntüler üç kanallı RGB formatına dönüştürülmüştür. Ön işlemenin ardından görüntüler eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Semantik segmentasyon, öznitelik füzyonu, motif yeniden yapılandırması ve SPADE tabanlı sanatsal sentez dahil olmak üzere SegCycle-SPADE çerçevesinin tüm aşamalarında 256 × 256 piksellik tutarlı bir giriş çözünürlüğü kullanılmıştır.
SegFormer Kullanarak Semantik Desen Segmentasyonu
Bu ön işleme adımından sonra, Miao Batik kültürel motif veri setinin ve WikiArt veri setinin temizlenmiş ve normalize edilmiş görüntüleri, önerilen SegFormer-B2 çerçevesine dayalı semantik segmentasyon modülüne aktarılır. Bu adımın amacı, miras desenlerinde bulunan kültürel motifleri doğru bir şekilde tanımlamak ve ayırmaktır. Önerilen SegFormer çerçevesi, karmaşık miras desenlerinden hem küresel bağlamsal bilgileri hem de detaylı yapısal bilgileri doğru bir şekilde yakalamak için hiyerarşik bir Transformer kodlayıcı ve hafif bir MLP kod çözücü içeren bir transformer mimarisine dayanmaktadır. Model, öncelikle giriş görüntüsünden çoklu ölçeklerde özellik temsilleri çıkarır ve ardından bu temsilleri kod çözücü aracılığıyla birleştirerek doğru segmentlere ayrılmış desenler oluşturur. Bu işlem, miras görüntüsündeki desenlerin geometrik desenler, floral desenler ve sembolik desenler gibi motiflere doğru şekilde segmentlere ayrılmasını sağlar; böylece yapısal bütünlüklerini korurken onları arka plandan ayırır. Bu yapısal bilgiler, daha sonra SegCycle-SPADE çerçevesi içindeki desen oluşturma aşamalarında kullanılır.
Ön işlemeden geçmiş giriş görüntüsü Denklem 6 ile temsil edilsin:
(6)
SegFormer kodlayıcısı, görüntüyü yamalara ayırır ve Denklem 7'de1 gösterildiği gibi transformer katmanlarını kullanarak hiyerarşik özellikleri çıkarır:

Burada, F transformer kodlayıcıdan elde edilen çok ölçekli özellik haritalarını ifade eder. Bu özellikler, hem yerel doku desenlerini hem de motif bölgeleri arasındaki küresel bağlamsal ilişkileri kodlar. SegFormer modeli, Denklem 8'de tanımlandığı şekilde farklı ölçeklerde özellik haritaları çıkarır:

Çok ölçekli temsillerin kullanımı, kültürel motifler içindeki farklı boyutlardaki desenlerin tespit edilmesini kolaylaştırır. Son olarak, özellikler Denklem 9'da1 gösterildiği gibi MLP kod çözücü kullanılarak birleştirilir:

Burada, S nihai öngörülen segmentasyon haritasını belirtir.
SegFormer-B2 omurgası, ImageNet ön eğitimli ağırlıklar kullanılarak başlatılmış ve ardından kültürel motif segmentasyonu için Miao Batik veri kümesi üzerinde ince ayar yapılmıştır. Ön eğitimli kontrol noktası, resmi SegFormer uygulamasından temin edilmiştir. Özellikle, ince ayar öncesinde SegFormer-B2 omurgasını başlatmak için resmi SegFormer deposu tarafından sağlanan ImageNet-1K ön eğitimli MIT-B2 kontrol noktası (mit_b2.pth) kullanılmıştır. Ön eğitimli ağırlıklar, SegFormer yazarları tarafından yayınlanan MIT-B2 omurgasına karşılık gelmektedir ve semantik segmentasyon eğitimi için başlangıç modeli olarak hizmet etmiştir. Kalan göreve özgü katmanlar, eğitimden önce varsayılan PyTorch ağırlık başlatma prosedürleri kullanılarak başlatılmıştır.
Mimaride, örtüşen yama gömmelerine (patch embeddings) sahip dört aşamalı hiyerarşik bir Transformer kodlayıcı kullanılmıştır. İlk aşamada, yama boyutu 4 adım aralığıyla (stride) 7 × 7 olarak belirlenmiştir. Dört kodlayıcı aşamasının her biri için gömme boyutları sırasıyla 64, 128, 320 ve 512'dir. Dört aşama boyunca 1, 2, 5 ve 8 çok başlı öz-dikkat (multihead self-attention) başlığı kullanılmış ve karşılık gelen kodlayıcı derinlikleri 3, 4, 6 ve 3 katman olarak ayarlanmıştır. Kodlayıcıdan elde edilen çok ölçekli özellikler, hafif bir tamamı-MLP çözücü (decoder) kullanılarak birleştirilmiştir. Nihai segmentasyon haritası oluşturulmadan önce çözücü, her kodlayıcı aşamasından gelen özellikleri tek bir gömme alanına yansıtmıştır. Tüm Transformer bloklarında Gaussian Hata Doğrusal Birimi (GELU) aktivasyon fonksiyonu kullanılmıştır. Genelleştirmeyi artırmak ve aşırı öğrenmeyi (overfitting) azaltmak için eğitim sırasında 0,1'lik bir dropout oranı uygulanmıştır.
Eğitim aşamasında, SegFormer çerçevesi her iki veri setinden ön işlemesi yapılmış görüntüleri alır. Miao Batik veri setinden gelen görüntüler, segmentasyon modelinin denetimli öğrenimi için etiket görevi gören motif bölgelerini içerir. Transformer kodlayıcı, görüntünün tamamını işleyerek görüntü bileşenleri arasındaki uzun menzilli ilişkileri yakalar; bu durum, özellikle mekansal olarak dağılmış motifler içeren geleneksel batik desenleri için önemlidir. Hiyerarşik özellik çıkarma mekanizması, tekrarlayan geometrik dokular gibi yerel yapıları eş zamanlı olarak yakalar. MLP kod çözücü, bu çıkarılan özellikleri işler ve motif bölgelerini vurgulayan bir segmentasyon maskesi üretir. Bu aşamada oluşturulan segmentasyon haritaları, daha sonra dikkat modülü ve desen yeniden yapılandırma aşaması için yapısal girdiler olarak kullanılır ve böylece oluşturulan desenlerin özgünlüğünün korunmasına yardımcı olur.
Kültürel motifler, görsel ve kültürel özelliklerine göre semantik segmentasyon için farklı sınıflara ayrılmıştır. Segmentasyon taksonomisi; hayvan motifleri (örneğin kelebekler, balıklar, kuşlar ve diğer sembolik fauna), bitki motifleri (örneğin çiçekler, yapraklar, asmalar ve botanik desenler), geometrik motifler (örneğin tekrarlayan şekiller, bordürler ve soyut geometrik yapılar) ve motif dışı alanları temsil eden arka plan bölgelerinden oluşmuştur. Her pikseli önceden tanımlanmış sınıflardan birine atamak için piksel düzeyinde segmentasyon maskeleri kullanılmıştır. Tam sayı etiketleri şu şekilde kodlanmıştır: Etiket 0 = arka plan, Etiket 1 = hayvan motifleri, Etiket 2 = bitki motifleri ve Etiket 3 = geometrik motifler. Segmentasyon açıklamaları ve motif etiketleri doğrudan orijinal Miao Batik veri seti kaynağından alınmıştır. Bu çalışmada ek bir manuel açıklama, yeniden etiketleme, sınır doğrulama veya uzman onay prosedürü uygulanmamıştır. Veri seti oluşturucuları tarafından sağlanan mevcut açıklamalar, eğitim ve değerlendirme için herhangi bir değişiklik yapılmadan kullanılmıştır.
Kültürel motif segmentasyonu için kullanılan SegFormer modeli, Şekil 4'te gösterildiği üzere, kültürel desen bölgelerinin doğru tespiti için transformer tabanlı bir mekanizma kullanarak Miao Batik veri kümesinden ve WikiArt veri kümesinden gelen ön işlemlere tabi tutulmuş görüntüleri işler. İlk olarak, geleneksel kültürel motifler içeren giriş görüntüsü SegFormer modeline sunulur. Transformer kodlayıcı, görüntü yamalarından hem küresel bağlamsal bilgileri hem de yerel yapısal özellikleri çıkarır. Elde edilen çok ölçekli özellikler, özellik temsillerini geliştirmek ve motif tespitini iyileştirmek için Karma İleri Beslemeli Ağ (Mix Feed-Forward Network) kullanan segmentasyon kod çözücüye aktarılır. SegFormer modelinin çıktısı, ilgisiz arka plan bilgilerini bastırırken kültürel desenlere karşılık gelen pikselleri vurgulayan bir segmentasyon maskesidir. Ayrıştırılan kültürel desenler daha sonra SegCycle-SPADE çerçevesinin sonraki aşamaları için yapısal rehberlik görevi görür.

Şekil 4. SegFormer-B2 Tabanlı Kültürel Motiflerin Semantik Segmentasyonu. Kültürel motif çıkarımı için kullanılan ve yalnızca Miao Batik veri seti üzerinde eğitilen SegFormer-B2 semantik segmentasyon modülünün mimarisi. Çerçeve, çok ölçekli öznitelik çıkarımı için Transformer tabanlı bir kodlayıcı ve motif maskeleri oluşturmak için hafif bir segmentasyon kod çözücüden oluşur. Model; hayvan, bitki, geometrik ve arka plan olmak üzere dört semantik sınıf tahmin eder; burada elde edilen segmentasyon maskeleri, ilgisiz arka plan bilgilerini bastırırken kültürel açıdan anlamlı motif bölgelerini belirler. Bu segmentasyon çıktıları, önerilen SegCycle-SPADE çerçevesinin sonraki öznitelik birleştirme, yeniden yapılandırma ve sanatsal sentez aşamaları için yapısal rehberlik sağlar. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Önerilen çerçevede yeni segmentasyon anotasyonları oluşturmaya gerek yoktur. Miao Batik veri seti, halihazırda mevcut olan halka açık bir kaynaktan edinilmiş ve model, veri seti oluşturucuları tarafından sağlanan ilgili motif bilgileri kullanılarak eğitilmiştir. Öğrenme sürecinde SegFormer modeli semantik segmentasyon haritaları üretmiştir. Sonuç olarak, mevcut çalışma herhangi bir ek manuel anotasyon yazılımı, anotasyon kılavuzu veya anotasyon kalite kontrol prosedürü gerektirmemiştir.
CAFFM
Semantik segmentasyon özelliklerinin üretken yeniden yapılandırma temsilleriyle etkileşimini geliştirmek için çalışma aynı zamanda bir CAFFM önermiştir. SegFormer-B2 kodlayıcı, CAFFM modülüne semantik özellik haritaları sağlarken, CycleGAN yeniden yapılandırma adımı üretken özellik haritaları sağlar. İlk olarak, her iki özellik akışını ortak bir gömme alanına yansıtmak için doğrusal projeksiyon katmanları kullanılır. Çapraz dikkat hesaplaması için, üretilen özellik tensörleri kullanılarak sorgu (Q), anahtar (K) ve değer (V) temsilleri oluşturulur. Ardından, yapısal motif bilgileri ile sanatsal stil unsurları arasındaki ilişkiler çok başlı çapraz dikkat kullanılarak modellenir. Daha sonra, birleştirilmiş özellik temsillerine katman normalizasyonu, artık bağlantılar ve GELU aktivasyonlu ileri besleme katmanları uygulanır. SPADE tabanlı sentez aşaması, CAFFM modülünün çıktısını alarak sanatsal tutarlılıktan ödün vermeden kültürel açıdan anlamlı temaların korunmasını sağlar.
Özellik uyumluluğunu garanti etmek için, giriş özellikleri önce doğrusal projeksiyon katmanları kullanılarak 256 gömme boyutuna sahip ortak bir gömme uzayına projekte edilir. Ardından, anlamsal yapısal bilgiler ile üretken stil temsilleri arasındaki karşılıklı bağlantılar, sekiz dikkat başlığına sahip bir Çok Başlı Çapraz Dikkat (MultiHead Cross-Attention) mekanizması kullanılarak modellenir. Çapraz dikkat hesaplaması, spesifik doğrusal dönüşüm katmanları tarafından üretilen Sorgu (Q), Anahtar (K) ve Değer (V) vektörlerini kullanır. Eğitim kararlılığını artırmak ve özellik bütünlüğünü korumak için, birleştirilmiş özellik temsillerini daha da geliştirmek amacıyla artık bağlantılar ve Katman Normalizasyonu (Layer Normalization) uygulanır. Daha sonra, Gaussian Hata Doğrusal Birimi (GELU) aktivasyon fonksiyonuna sahip bir ileri beslemeli ağ uygulanarak doğrusal olmayan özellik öğrenimi geliştirilir. Modül tarafından 256 boyutunda bir çıktı özellik temsili oluşturulur ve yaratıcı sentez için diğer aşamalara gönderilir. CAFFM, çapraz dikkat tabanlı bir birleştirme tekniği kullanarak sanatsal stil verilerini kültürel motif yapılarıyla başarıyla birleştirir; bu da yeniden yapılandırılan kültürel miras desenlerinde motif korunumunu ve görsel tutarlılığı artırır.
Önerilen sistemde, yapısal özellikler Miao Batik veri setinden türetilirken, stilistik özellikler WikiArt veri setinden öğrenilmektedir. Miao Batik veri setindeki görüntüler kullanılarak SegFormer segmentasyon ağından türetilen özellik haritası Fs ile, WikiArt görüntülerini kullanan stil-özellik çıkarma dalından türetilen özellik haritası ise Fa ile gösterilsin. Önerilen CAFFM, kültürel desenlerin hem yapısal hem de stilistik bağımlılıklarını öğrenmek için bir çapraz dikkat (cross-attention) mekanizması kullanarak iki özellik alanını birleştirir. Tablo 3; gömme boyutları, normalizasyon katmanları, aktivasyon fonksiyonları ve dikkat başlığı yapılandırması dahil olmak üzere tüm mimari özellikleri rapor etmektedir. 256 × 256 piksel boyutundaki bir giriş görüntüsü için, SegFormer-B2 kodlayıcı 64 × 64 × 128 boyutunda semantik özellik haritaları üretirken, stil-özellik çıkarma dalı 64 × 64 × 128 boyutunda özellik haritaları üretmiştir. Her iki özellik haritası da çapraz dikkat füzyonu öncesinde, öğrenilebilir doğrusal katmanlar aracılığıyla 256 boyutlu ortak bir gömme alanına yansıtılmıştır.
| Parametre | Konfigürasyon |
| Önerilen Çerçeve | SegCycle-SPADE |
| Semantik Segmentasyon Modeli | SegFormer-B2 |
| SegFormer Kodlayıcı Aşamaları | 4 |
| Ağırlık Başlatma | ImageNet-1K Ön Eğitimli SegFormer-B2 (MIT-B2 Omurgası) |
| Kontrol Noktası Kaynağı | Resmi NVIDIA SegFormer Deposu (https://github.com/NVlabs/SegFormer); kontrol noktası: segformer.b2.512x512.ade.160k |
| İnce Ayar Stratejisi | Miao Batik veri kümesi üzerinde uçtan uca ince ayar |
| Yama Gömme Boyutu | 7 × 7 |
| Yama Adımı | 4 |
| Gömme Boyutları | 64, 128, 320 ve 512 |
| Kodlayıcı Derinlikleri | 3, 4, 6 ve 3 |
| Dikkat Başlıkları | 1, 2, 5 ve 8 |
| Kod Çözücü Tipi | Tamamı MLP'den Oluşan Dekoder |
| Aktivasyon Fonksiyonu | GELU |
| Yıpranma Oranı | 0.1 |
| Özellik İyileştirme Modülü | Çapraz-Dikkat Kültürel Özellik Füzyon Modülü (CAFFM) |
| CAFFM Gömme Boyutu | 256 |
| CAFFM Dikkat Başlıkları | 8 |
| CAFFM Füzyon Ölçekleri | 4 |
| Yeniden Yapılandırma Modeli | CycleGAN |
| Stil Oluşturma Modeli | SPADE |
| Kültürel Veri Seti | Miao Batik Veri Seti |
| Stil Veri Seti | WikiArt Veri Seti |
| Miao Batik Görüntüleri | 15,148 |
| WikiArt Görselleri | Yaklaşık 80.000 |
| Giriş Görüntü Çözünürlüğü | 256 × 256 piksel |
| Renk Formatı | RGB |
| İnterpolasyon Yöntemi | Bilineer İnterpolasyon |
| Gürültü Giderme Yöntemi | Gauss Filtreleme |
| Gauss Çekirdek Boyutu | 5 × 5 |
| Gaussian Sigma (σ) | 1 |
| Normalizasyon Aralığı | [0, 1] |
| Yığın Boyutu | 16 |
| Epok Sayısı | 100 |
| Optimize Edici | Adam |
| Öğrenme Oranı | 0.0002 |
| Adam Parametreleri | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, ağırlık azalması = 0 |
| Kayıp Fonksiyonları | Segmentasyon Kaybı, Adversaryal Kayıp, Döngüsel Tutarlılık Kaybı, Rekonstrüksiyon Kaybı, Motif Koruma Kaybı ve Stil Tutarlılığı Kaybı |
| Veri Kümesi Bölme Stratejisi | Eğitim / Doğrulama / Test |
| Eğitim Seti | 70% |
| Doğrulama Seti | 15% |
| Test Seti | 15% |
| Rastgele Tohum | 42 |
| Değerlendirme Metrikleri | Segmentasyon Doğruluğu, IoU, Dice Katsayısı, SSIM, PSNR ve FID |
| Programlama Dili | Python 3.8.10 |
| Derin Öğrenme Çerçevesi | PyTorch 1.10.0 |
| Donanım Platformu | NVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (11. Nesil), 32 GB RAM |
| Çalışma Ortamı | Ubuntu 20.04 LTS |
Tablo 3: Deneysel Kurulum ve Model Yapılandırması. Önerilen SegCycle-SPADE çerçevesinin uygulanması ve değerlendirilmesi için kullanılan mimari bileşenlerin, eğitim yapılandırmasının, ön işleme ayarlarının, veri kümelerinin, optimizasyon parametrelerinin, değerlendirme metriklerinin ve hesaplama ortamının özeti.
Dikkat modülü, öncelikle özellik haritasını Denklem 10'u kullanarak sorgu, anahtar ve değer temsillerine dönüştürür:

Burada Wq, Wk ve Wv öğrenilebilir ağırlık matrisleridir. Dikkat ağırlıkları, sorgu vektörü ile anahtar vektörü arasındaki benzerliğe dayalı olarak Denklem 1117 kullanılarak hesaplanır:

Burada, dk anahtar vektörünün boyutudur. Geliştirilmiş özellik temsili, dikkat ağırlıklarının değer matrisi ile Denklem 12 kullanılarak çarpılmasıyla hesaplanır:

Burada, Fa özellik haritasının geliştirilmiş özellik temsilidir. Geliştirilmiş özellik temsili, orijinal segmentasyon özellikleri ile dikkat mekanizması kullanılarak elde edilen geliştirilmiş özelliklerin Denklem 13 kullanılarak birleştirilmesiyle hesaplanır:
Burada, Fe desen yeniden yapılandırması için kullanılan geliştirilmiş özellik haritasıdır. CAFFM, farklı ölçeklerdeki kültürel motifler için özellikler çıkarmak amacıyla çok ölçekli bir çapraz dikkat mekanizmasıyla genişletilmiştir. Fsi ölçek i'deki segmentasyon özelliklerini, Faj ise aynı ölçekteki sanatsal stil özelliklerini temsil etsin. Nihai özellik temsili Denklem 14 kullanılarak tanımlanır:

Burada Qi, Ki ve Vi sırasıyla i ölçeğindeki sorgu (query), anahtar (key) ve değer (value) matrislerini temsil eder ve N özellik ölçeklerinin sayısını belirtir. Bu çalışmada, giriş görüntüsü boyutunun 1/4, 1/8, 1/16 ve 1/32 mekansal çözünürlüklerinde çıkarılan özellik haritalarına karşılık gelen N = 4 olarak belirlenmiştir. Bu çok ölçekli özellik temsilleri, yeniden yapılandırma ve sanatsal sentez öncesinde öğrenilebilir dikkat ağırlıkları kullanılarak birleştirilmiştir. Yukarıdaki genişletme, yöntemin kültürel desenleri yeniden yapılandırmak için küresel kültürel motifleri ve dokuları çıkarmasını sağlar. CAFFM, önerilen SegCycle-SPADE sisteminde SegFormer tabanlı segmentasyon aşaması ile SPADE tabanlı yaratıcı sentez aşaması arasında yer almaktadır. İlk olarak, CycleGAN stilsel ve desenle ilgili bilgileri içeren yeniden yapılandırma özelliklerini eş zamanlı olarak oluştururken, SegFormer-B2 kültürel motiflerin yapısal özelliklerini betimleyen semantik özellik haritalarını geri kazanır. CAFFM modülü bu iki özellik akışını alır ve yapısal ve sanatsal temsiller arasındaki ilişkileri belirlemek için çapraz dikkat tabanlı birleştirme (cross-attention-based fusion) kullanır. Semantik tutarlılığı ve yapısal özellikleri korurken kültürel olarak özgün desenler oluşturmak amacıyla, sonuçta ortaya çıkan birleştirilmiş özellik haritaları daha sonra segmentasyon yönlendirmeli yaratıcı sentez için SPADE modülüne gönderilir.
CycleGAN kullanarak Desen Yeniden Yapılandırma
Dikkat tabanlı özellik geliştirme aşaması tamamlandığında, özellik haritaları geliştirilmiş kültürel motif yapılarını içerecektir. Bununla birlikte, özellik haritaları hâlâ eksik veya hasarlı desen bölgeleri içerebilir. Bu nedenle, desenlerin yeniden yapılandırılması sorununu çözmek için önerilen çerçeve CycleGAN modelinden yararlanacaktır. Önerilen çerçevede iki alan, orijinal kültürel motif desenleri ve yeniden yapılandırılmış kültürel motif desenleri olacaktır. Önceki aşamalardan gelen geliştirilmiş özellikleri kullanan CycleGAN modeli, yapısal tutarlılığı koruyarak kültürel desenleri yeniden yapılandıracaktır. Bu durum; geometrik desenler, çiçeksi desenler ve sembolik desenler gibi kültürel desenlerin uzamsal düzenlerini korumalarını sağlayacaktır. Eksik veya hasarlı kültürel motifler oluşturmak için orijinal Miao Batik görüntüleri rastgele maskeleme ve kısmi örtme işlemlerine tabi tutulmuştur. Bu bozulma prosedürleri, yıpranmış kültürel miras eserlerinde yaygın olarak gözlemlenen eksik desen bölgelerini ve yapısal hasarları simüle etmiştir. Bozulmuş görüntüler yeniden yapılandırma modülüne girdi olarak kullanılırken, karşılık gelen orijinal görüntüler performans değerlendirmesi ve yeniden yapılandırma kalitesi değerlendirmesi için referans görüntüler olarak hizmet etmiştir. Bu strateji, modelin anlamsal tutarlılığı ve kültürel özellikleri korurken eksik motif yapılarının restorasyonunu öğrenmesini sağlamıştır.
X, tamamlanmamış kültürel kalıpların alanı ve Y, yeniden yapılandırılmış kültürel kalıpların alanı olsun. İki üreteç, Denklem 15'i kullanarak çift yönlü eşleme yapmayı öğrenir:

Burada, motif yapılarını yeniden oluşturmak için GE ve desenleri orijinal domaine geri eşlemek için FM kullanılır. Yeniden oluşturulan desenlerin gerçekçi olduğundan emin olmak için adversariyal kayıp kullanılır (Denklem 16)30

Burada, DY gerçek ve yeniden yapılandırılmış desenleri ayırt etmek için kullanılan ayırıcıdır ve GE(x) üretilen yeniden yapılandırılmış deseni ifade eder. CycleGAN, kültürel motiflerin yapısal düzenini korumak için döngüsel tutarlılığı da uygular (Denklem 17)30.

Nihai kayıp fonksiyonu Denklem 1830 kullanılarak tanımlanmıştır:

Burada λi, döngü tutarlılığı kaybı için ağırlıklandırma katsayısını temsil eder ve orijinal CycleGAN formülasyonuyla tutarlı olarak eğitim sırasında 10 olarak ayarlanmıştır. Bu değer, adversaryal öğrenme ile kaynak ve hedef alanlar arasındaki yeniden yapılandırma tutarlılığı arasında bir denge kurmak için seçilmiştir.
CycleGAN yeniden yapılandırma modülü, çift yönlü görüntü çevirisi için iki jeneratör ve iki diskriminatörden oluşur. Her jeneratör; başlangıçta bir 7 × 7 konvolüsyon katmanı, ardından iki alt örnekleme konvolüsyon katmanı, dokuz rezidüel blok ve iki üst örnekleme katmanından oluşan bir rezidüel ağ mimarisini takip eder. Geliştirilmiş özellik çıkarımı için 7 × 7 çekirdek kullanan giriş katmanı hariç, tüm konvolüsyon işlemleri 3 × 3 boyutunda bir çekirdek boyutu kullanır. Eğitim kararlılığını artırmak için her konvolüsyon katmanından sonra Örnek Normalizasyonu (Instance Normalization) uygulanırken, jeneratör ağının genelinde ReLU aktivasyonu kullanılır. Çıkış katmanı, normalize edilmiş görüntü çıktıları üretmek için Tanh aktivasyon fonksiyonunu kullanır. Diskriminatör, 4 × 4 çekirdek boyutlarına ve kademeli olarak artan özellik kanallarına sahip bir dizi konvolüsyonel katmandan oluşan 70 × 70 PatchGAN mimarisini takip eder. Özellik ayrımını ve çekişmeli öğrenmeyi (adversarial learning) geliştirmek için diskriminatörde Örnek Normalizasyonu ve LeakyReLU aktivasyonu (negatif eğim = 0.2) kullanılır. CycleGAN modülü, girdi olarak ön işlemden geçirilmiş kültürel motif görüntülerini alır ve daha sonra segmentasyon özellikleriyle entegrasyon için CAFFM'ye iletilen yeniden yapılandırılmış desen temsilleri oluşturur. CycleGAN eğitimi, 0.0002 başlangıç öğrenme hızıyla Adam optimize edici (β₁ = 0.5, β₂ = 0.999) kullanılarak gerçekleştirilmiştir. Öğrenme hızı ilk 100 epok boyunca sabit tutulmuş ve ardından kalan eğitim süresi boyunca lineer olarak sıfıra düşürülmüştür. Diskriminatör eğitimini stabilize etmek için önceden oluşturulmuş 50 görüntü içeren bir tekrar tamponu (replay buffer) kullanılmıştır. Jeneratörler ve diskriminatörler, her eğitim iterasyonunda bir jeneratör güncellemesini takip eden bir diskriminatör güncellemesi şeklinde, 1:1 güncelleme oranı kullanılarak güncellenmiştir.
CycleGAN'in yeniden yapılandırma süreci, Şekil 5'teki CAFFM mekanizması kullanılarak elde edilen geliştirilmiş özellik haritalarına dayanmaktadır. Özellik haritaları, önceki segmentasyon ve CAFFM aşamalarından elde edilen geliştirilmiş kültürel motifleri içerir. Özellik haritaları, ilk jeneratör GE için girdi olarak kullanılır. İlk jeneratör GE, kültürel desenleri yeniden yapılandırmak için gereken eşlemeyi öğrenir. Çıktılar daha sonra, gerçek kültürel desenler ile yeniden yapılandırılmış desenler arasındaki ayrımı yapmak üzere diskriminatör DY'ye aktarılır. Diskriminatör DY, jeneratör GE'nin gerçekçi çıktılar üretmesine yardımcı olur. Yeniden yapılandırma sırasında kültürel desenlerin bozulmamasını sağlamak için, ikinci jeneratör FM döngü tutarlılığı eşlemesi gerçekleştirir. İkinci jeneratör FM, çıktıları orijinal alana geri eşler. Çıktılar daha sonra gerçekçiliği sağlamak amacıyla diskriminatör tarafından değerlendirilir. Nihai çıktılar, önerilen SegCycle-SPADE çerçevesinin bir sonraki aşamasındaki sanatsal stil üretimi için SPADE modülüne iletilir.

Şekil 5. CycleGAN Tabanlı Desen Rekonstrüksiyon İş Akışı. CycleGAN rekonstrüksiyon modülünün iş akışı. Eksik kültürel motifleri rekonstrükt etmek için jeneratör ağına girdi olarak dikkatle güçlendirilmiş öznitelik temsilleri sağlanır. Diskriminatör, rekonstrükt edilmiş çıktıları referans desenlerle karşılaştırarak değerlendirirken, döngüsel tutarlılık eşlemesi çift yönlü görüntü çevirisi sırasında yapısal bütünlüğü korur. Rekonstrükt edilen motifler daha sonra sanatsal stil sentezi için SPADE modülüne iletilir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
SPADE kullanılarak Sanatsal Stil Üretimi
Ardından, yeniden oluşturulan kültürel motifler, sanatsal stil üretimi için SPADE modülüne tabi tutulur. SPADE modülünün temel amacı, motiflerin yapısal düzeninden ödün vermeden, yeniden oluşturulan kültürel motiflere sanatsal stile ait görsel olarak daha zengin dokular eklemektir. SPADE modülü, görüntü üretimi için görüntü segmentasyonu kavramından yararlanan koşullu bir görüntü üretme tekniğidir. Önceden belirlenmiş motif sınıflarına karşılık gelen çok kanallı semantik haritalar, SegFormer-B2 tarafından üretilen semantik segmentasyon maskelerinden kodlanmıştır. SPADE oluşturucusu, bu kodlanmış haritaları koşullandırma girişleri olarak almıştır. Uzamsal olarak uyarlamalı ölçekleme (γ) ve sapma (β) parametreleri, semantik haritaların her bir SPADE katmanı içindeki evrişimli katmanlar aracılığıyla işlenmesiyle üretilmiştir. Böylece oluşturucu, bu parametreleri normalize edilmiş öznitelik aktivasyonlarına uygulayarak sanatsal sentez sırasında motif sınırlarını, yapısal düzenleri ve semantik bilgileri koruyabilmiştir. Koşullandırma işlemi SPADE oluşturucusunun birkaç katmanında gerçekleştirildiği için semantik yönlendirme, hem üst düzey yapısal yeniden oluşturmayı hem de alt düzey doku sentezini etkileyebilmiştir. Sonuç olarak, oluşturulan sanatsal desenler, segmentasyon aşamasında bulunan kültürel motif yapılarını korurken WikiArt veri setinden elde edilen stilistik özellikleri bünyesine katmıştır.
Sanatsal stilleri anlamak için temel kaynak olarak; Rönesans, İzlenimcilik, Kübizm, Ekspresyonizm, Sürrealizm, Realizm ve Soyut Sanat gibi 27 farklı sanatsal kategoriye ait eserleri içeren WikiArt veri seti kullanılmıştır. Modelin çeşitli yaratıcı özelliklere maruz kalması ve stil genellemesinin artırılması amacıyla, eğitim sırasında çeşitli kategorilerden rastgele stil görüntüleri seçilmiştir. Stil yanlılığını azaltmak için veri seti; eğitim, doğrulama ve test alt kümelerine, sanatsal kategorilerin dengeli bir temsiliyle bölünmüştür. Tüm 27 sanatsal kategorinin dengeli bir şekilde temsil edilmesini sağlamak için tabakalı örnekleme yöntemi kullanılmıştır. Orijinal sınıf dağılımı korunarak, her kategoriden örnekler eğitim, doğrulama ve test alt kümelerine orantılı olarak dağıtılmıştır. WikiArt görüntülerinden türetilen stil özellikleri ile CycleGAN tarafından üretilen yeniden yapılandırma özelliklerini birleştirmek için CAFFM modülü kullanılmıştır. Sentez ağının, segmentasyon haritalarından türetilen semantik yapıyı ve kültürel motif sınırlarını korurken sanatsal özellikleri aktarabilmesi için, ortaya çıkan füzyon temsilleri SPADE üretecine koşullandırma bilgisi olarak sağlanmıştır. Önerilen çerçeve, bu stil-koşullandırma tekniği sayesinde tutarlı yapısal ve stilsel temsillere sahip, kültürel açıdan otantik sanatsal desenler üretebilmiştir.
SPADE ayrıca segmentasyon haritasına bağlı olan uzamsal adaptif parametreler sunar. Parametreler Denklem 191'de gösterildiği gibi tanımlanabilir:

Burada, γ(S) mekansal olarak değişen ölçek parametresini ve β(S) mekansal olarak değişen sapma parametresini temsil eder. Parametreler, üretecin görüntülerdeki semantik bölgeye bağlı olarak farklı dokular ve stiller oluşturmasına yardımcı olabilir. Nihai kültürel sanat eseri, Denklem 20'de gösterildiği gibi tanımlanabilir:

Burada, GE SPADE üreteci, XrP yeniden yapılandırılmış desen ve SM segmentasyon haritasıdır. Nihai sanat eseri, sanatsal görünümü geliştirirken kültürel motiflerin yapısal bütünlüğünü korur. Önerilen SegCycle-SPADE mimarisini optimize etmek için semantik segmentasyon doğruluğunu, kültürel motif korunmasını, desen yeniden yapılandırma kalitesini ve sanatsal stil tutarlılığını dengeleyen bileşik bir kayıp fonksiyonu kullanılmıştır. Genel eğitim amacını belirlemek için segmentasyon kaybı (Lseg), adversariyal kayıp (Ladv), döngüsel tutarlılık kaybı (Lcycle), yeniden yapılandırma kaybı (Lrecon), motif koruma kaybı (Lmotif) ve stil tutarlılığı kaybının (Lstyle) ağırlıklı bir karışımı kullanılmıştır. Toplam kayıp fonksiyonu Denklem 21'de tanımlanmıştır:
(21)
Giriş ve yeniden yapılandırılmış kültürel motifler arasında yapısal tutarlılığı garanti etmek için döngüsel tutarlılık kaybı katsayısı 10 olarak belirlenmiştir. İnce detaylı motif özelliklerini korumak ve görsel doğruluğu artırmak için yeniden yapılandırma kaybı katsayısı 5 olarak ayarlanmıştır. Sanatsal sentez sırasında kültürel açıdan temel yapısal kalıpların korunmasını vurgulamak amacıyla, motif koruma kaybı için 2 katsayısı kullanılmıştır. Semantik motif yapılarını aşırı bozmadan sanatsal stil transferini teşvik etmek için stil tutarlılığı kaybı katsayısı 1'e ayarlanmıştır. Gerçekçi görüntü üretimi ile hassas motif segmentasyonu arasında dengeli bir katkı sağlamak için segmentasyon ve adversariyal kayıplara eşit ağırlıklar verilmiştir. Stil tutarlılığı kaybını hesaplamak için WikiArt veri setinin özellik tabanlı stil temsilleri kullanılmıştır. Özellikle sanatsal stil özellikleri, derin özellik haritalarından alınan Gram matrisi korelasyonları kullanılarak yakalanmıştır. Denklem 22'de gösterildiği gibi, hedef stil görüntüsünün ve üretilen görüntünün Gram matrisleri arasındaki Frobenius norm farkı, stil kaybını hesaplamak için kullanılmıştır:

Burada, GLütfen çevirmemi istediğiniz metni paylaşın. Gram matrisi şundan hesaplanır mı Lütfen çevirmemi istediğiniz metni sağlayın.th özellik katmanı, ILütfen çevirmemi istediğiniz metni sağlayın. oluşturulan sanatsal görüntüyü ifade eder, Istil WikiArt veri setinden alınan hedef stil görüntüsünü ifade eder ve F Frobenius normunu ifade eder. Bu formülasyon, önerilen çerçevenin kültürel motiflerin yapısal ve semantik bütünlüğünü korurken sanatsal özellikleri muhafaza etmesini sağlar.
CAFFM modülü tarafından üretilen birleştirilmiş öznitelik temsilleri, önerilen çerçevenin sanatsal sentez bileşeni olarak görev yapan SPADE modülüne koşullandırma girişleri olarak kullanılır. SPADE üreteci, 256 kanallık gizli öznitelik boyutuna sahip yedi SPADE artık bloğundan oluşur ve 256 × 256 piksel çözünürlüğünde çıktı görüntüleri üretir. SegFormer–CAFFM modülünden elde edilen semantik segmentasyon haritaları, SPADE artık katmanları boyunca koşullandırma girişleri olarak kullanılır. SPADE katmanları, her bir artık blok içerisindeki aktivasyon fonksiyonlarından önce uygulanarak segmentasyon güdümlü semantik koşullandırma sağlar. Ardışık üstörnekleme ve evrişim işlemleri aracılığıyla, semantik tutarlılığı ve motif yapısını korurken yüksek çözünürlüklü sanatsal desenler üretmek için gizli öznitelik temsili aşamalı olarak geliştirilir. Üreteci boyunca LeakyReLU aktivasyon fonksiyonları kullanılır ve normalize edilmiş görüntüler üretmek için çıktı katmanında bir Tanh aktivasyon fonksiyonu uygulanır.
Algoritma ve İş Akışı
SegCycle-SPADE çerçevesi; semantik segmentasyon, öznitelik füzyonu, desen yeniden yapılandırma ve sanatsal stil sentezini birleşik bir eğitim hattı içerisinde entegre eder. İş akışı; görüntü boyutlandırma, normalizasyon, gürültü giderme ve segmentasyon maskesi hazırlama dahil olmak üzere veri seti edinimi ve ön işleme ile başlar. Ön işlemeden geçmiş görüntüler, semantik motif temsillerini çıkarmak için SegFormer-B2 segmentasyon ağı kullanılarak işlenir. Elde edilen segmentasyon öznitelikleri, CAFFM aracılığıyla yeniden yapılandırma öznitelikleriyle birleştirilerek yapısal motif bilgileri ile sanatsal öznitelik temsilleri arasında etkileşim sağlanır. Birleştirilmiş öznitelik haritaları daha sonra, semantik tutarlılığı korurken eksik kültürel motif yapılarını restore eden CycleGAN yeniden yapılandırma modülüne aktarılır. Yeniden yapılandırılan desenler, motif sınırlarını ve yapısal özgünlüğü korurken stilistik iyileştirmeye olanak tanıyan segmentasyon güdümlü sanatsal sentez için SPADE üretecine sunulur. Eğitim sırasında model parametreleri; segmentasyon doğruluğunu, motif korunumunu, yeniden yapılandırma kalitesini ve sanatsal stil tutarlılığını dengeleyen Denklem 21 ve 22'de açıklanan bileşik kayıp fonksiyonu kullanılarak optimize edilir. Veri seti yükleme, ön işleme, model başlatma, eğitim yinelemeleri, doğrulama prosedürleri, kontrol noktası seçimi ve final değerlendirmesini içeren ayrıntılı adım adım uygulama iş akışı, Ek Dosya 1 (Algoritma 1)'de sunulmuştur. Tüm algoritmik iş akışı; 16'lık bir grup boyutu (batch size), 0.0002 öğrenme hızı ve 100 eğitim epoku kullanılarak uygulanmıştır. Veri seti bölümlendirme, model başlatma ve tüm eğitim deneyleri için 42 sabit rastgele tohum (seed) kullanılmıştır. Tekrarlanabilirliği sağlamak amacıyla tohum; Python, NumPy ve PyTorch rastgele sayı üreteçlerine tutarlı bir şekilde uygulanmıştır. Adam optimize edici β₁ = 0.5, β₂ = 0.999 ve ağırlık azalması olmaksızın (weight decay = 0) yapılandırılmıştır. Model kontrol noktaları, doğrulama veri setinde elde edilen en yüksek doğrulama IoU skoruna göre seçilmiştir.
Kayıp Fonksiyonu Optimizasyonu
Yeniden yapılandırma ve sanatsal sentez sırasında kültürel motif yapılarını korumak için önerilen çerçeve; segmentasyon, adversariyal (çekişmeli), döngüsel tutarlılık, yeniden yapılandırma, motif koruma ve stil tutarlılığı kayıplarını birleştiren kompozit bir optimizasyon hedefi kullanır. Tam matematiksel formülasyon, ağırlıklandırma katsayıları ve stil kaybı tanımı, SPADE kullanılarak Sanatsal Stil Üretimi alt bölümündeki Denklem 21 ve 22'de sunulmuştur. Motif koruma bileşeni, tahmin edilen motif bölgeleri ile karşılık gelen gerçek (ground-truth) segmentasyon maskeleri arasındaki yapısal sapmaları cezalandırarak, yeniden yapılandırma süreci boyunca kültürel açıdan anlamlı desen yapılarının korunmasını teşvik eder.