Budowa korpusu i skład opisowy
Rysunek 1 przedstawia czteropanelowy przegląd korpusu. Rysunek 1A pokazuje zgłoszony proces przesiewowy, od 612 rekordów kandydujących do 43 rekordów zachowanych. Rysunek 1B prezentuje reprezentatywne przykłady mediów i formatów. Rysunek 1C przedstawia liczebność w czterech przedziałach czasowych, a Rysunek 1D podsumowuje skład korpusu pod względem źródła i medium. Ponieważ przedziały czasowe obejmują nierówne okresy, liczby te opisują skład pobranego korpusu i nie powinny być interpretowane jako historyczne tempo produkcji.
Tabela 1 podsumowuje zagregowane cechy korpusu. Kolekcje muzealne stanowiły 302 rekordy, archiwa cyfrowe 81, a opublikowane katalogi 50. Media skategoryzowano jako akwarele eksportowe (n = 176), obrazy na papierze z rdzenia (n = 12), karty albumów eksportowych (n = 83), malarstwo figuralne (n = 41) oraz inne formaty (n = 21). Metadane skategoryzowano jako kompletne (n = 288), częściowe (n = 18) lub minimalne (n = 27). Postacie kobiece skategoryzowano jako centralne (n = 214), drugoplanowe (n = 102) lub liczne (n = 17). Każdy blok klasyfikacji obejmował wszystkie 43 rekordy.
Wstępne etykiety AI i kategorie referencyjne opracowane przez ludzi
Tabela 2 podsumowuje zbiorczą zgodność między wstępnymi etykietami wygenerowanymi przez AI a kategoriami referencyjnymi opracowanymi przez ludzi dla 433 obrazów, natomiast Tabela uzupełniająca 1 zawiera odpowiadające im wstępne etykiety AI na poziomie poszczególnych przypadków, klasyfikacje koderów, rozstrzygnięte kategorie referencyjne opracowane przez ludzi, status dopasowania oraz przypisania do klastrów. Ogólnie etykiety AI i referencyjne opracowane przez ludzi były zgodne w przypadku 356 obrazów, co odpowiada dokładności dopasowania wynoszącej 82,2%. Przywołanie na poziomie kategorii obliczono jako proporcję dokładnych dopasowań AI–człowiek w stosunku do liczby przypadków w kategorii referencyjnej opracowanej przez ludzi dla każdej kategorii.
Czułość (recall) na poziomie kategorii wynosiła od 73.3% dla scen rytualnych/ślubnych (3/45) do 8.4% dla kategorii elity/urody (9/12). Czułość wyniosła 84.7% dla pracy fizycznej (61/72), 82.1% dla występów (32/39), 79.7% dla zajęć domowych (51/64), 79.3% dla służby (46/58) oraz 79.1% dla rynku (34/43). Ogólna zgodność całkowita wyniosła 356/43 (82.2%). Ocena par na poziomie poszczególnych przypadków umożliwiła obliczenie precyzji oraz wskaźników F1 dla wszystkich siedmiu kategorii, które wyniosły odpowiednio od 74.5% do 89.2% dla precyzji oraz od 0.75 do 0.8 dla wskaźników F1. Kompleksowa macierz pomyłek, szczegółowo przedstawiająca wyniki fałszywie dodatnie dla klas docelowych oraz wzorce poza przekątną, została przedstawiona na Rysunku uzupełniającym 1.
Zgłoszone podsumowania wzorców obliczeniowych
Rysunek 2 przedstawia cztery zgłoszone wizualizacje analizy obliczeniowej. Rysunek 2A pokazuje galerię dziewięciu obrazów z kolorowymi nakładkami segmentacji używanymi do lokalizacji wizualnej i weryfikacji. Rysunek 2B przedstawia wykres rozrzutu UMAP zgłoszonych osadzeń obrazów CLIP z zaznaczonymi konturami gęstości C1–C7. Rysunek 2C porównuje zgłoszoną liczbę obrazów (pełne kropki) z czułością na poziomie kategorii (otwarte kółka), a Rysunek 2D prezentuje galerię reprezentatywnych obrazów pogrupowanych według tych samych etykiet. Walidacja klastrów potwierdziła wybrane rozwiązanie klastrowania, które dało wynik współczynnika sylwetki 0,54 oraz indeks Daviesa–Bouldina 0,92. Mapowanie klastrów na kategorie ludzkie wykazało silną zgodność, przy czym każdy otrzymany klaster odpowiadał głównie odrębnej kategorii referencyjnej zdefiniowanej przez człowieka.
Tabela 3 przedstawia siedem zgłoszonych profili obliczeniowych z wielkościami prób odpowiadającymi siedmiu kategoriom referencyjnym ustalonym przez ekspertów. Tabela kontyngencji klastrów według kategorii została przedstawiona w Tabeli uzupełniającej 2 i pokazuje rozkład siedmiu rozstrzygniętych kategorii referencyjnych dla ludzi w obrębie klastrów C1–C7. Analiza tych przypisań klastrowych na poziomie poszczególnych przypadków wykazała, że klastrowanie obliczeniowe odtworzyło struktury wizualne, które ściśle odpowiadały siedmiu referencyjnym kategoriom ustalonym przez ekspertów.
Asocjacje wskazówek wizualnych i synteza interpretacyjna
Tabela 4 podsumowuje jakościowe profile wskazówek wizualnych wykorzystanych do charakterystyki siedmiu kategorii zakodowanych przez ludzi. Profile te opisują powtarzające się powiązania między ubiorem, otoczeniem przestrzennym, postawą, przedmiotami i relacjami społecznymi. Nie zostały one wyprowadzone z ilościowej tabulacji krzyżowej, w związku z czym nie ustalono na ich podstawie statusu prawnego, przynależności etnicznej, przyczyn społecznych ani odbioru przez publiczność.
Rysunek 3 integruje opisowe podsumowania ilościowe zakodowanych cech wizualnych z interpretacyjnym modelem koncepcyjnym. Rysunek 3A przedstawia siedem rozstrzygniętych kategorii referencyjnych dla ludzi oraz wielkości ich próbek. Rysunek 3B pokazuje względne powiązania między tymi kategoriami a zakodowanymi markerami wizualnymi w pięciu wymiarach: odzieży, otoczeniu przestrzennym, obiektach, postawie i relacjach społecznych. Wyświetlone siły powiązań zostały obliczone na podstawie adnotacji na poziomie przypadków w każdej kategorii referencyjnej dla ludzi. Rysunek 3C podsumowuje zależności między kategoriami referencyjnymi dla ludzi, wymiarami markerów wizualnych a archetypami implikacji klasowych, wykorzystując ważone przepływy wyprowadzone z zakodowanych obserwacji. Te ilościowe zależności charakteryzują powtarzające się wzorce reprezentacyjne w próbkowanych obrazach i nie powinny być interpretowane jako szacunki historycznych rozkładów demograficznych lub społecznych. Rysunek 3D przedstawia koncepcyjny model interpretacji międzykulturowej i powinien być rozumiany jako historycznie uargumentowane ramy interpretacyjne, a nie empirycznie przetestowana ścieżka przyczynowa.
Zintegrowana interpretacja wzorców wizualnych
W całym korpusie siedem kategorii tożsamości kobiecej charakteryzowało się powtarzającymi się kombinacjami ubioru, otoczenia przestrzennego, przedmiotów, postawy oraz relacji społecznych. Kombinacje te dostarczyły opisowych dowodów na istnienie utrwalonych konwencji wizualnych w analizowanych obrazach. Interpretacje historyczne dotyczące płci, hierarchii i mediacji międzykulturowej pozostały na poziomie wnioskowania.
Wszystkie razem wzięte, zagregowane wyniki pozwoliły zidentyfikować siedem kategorii tożsamości kobiet określonych przez ludzi oraz pięć powracających wymiarów służących do ich charakterystyki: ubiór, otoczenie przestrzenne, przedmioty, postawa oraz relacje społeczne. Wstępne etykiety AI były zgodne z ustalonymi przez ludzi kategoriami w 356 z 433 obrazów (82,2%), przy czym najniższa czułość na poziomie kategorii odnotowano dla scen rytualnych/ślubnych (73,3%). Wyniki te wsparły opisową organizację i porównanie korpusu. Etykiety AI i ludzkie na poziomie poszczególnych przypadków umożliwiły oszacowanie precyzji i miary F1 na poziomie kategorii. Osobno przeprowadzona analiza skupień zidentyfikowała struktury odpowiadające siedmiu kategoriom określonym przez ludzi. Niemniej jednak, te obliczeniowe wyniki charakteryzują konwencje reprezentacji wizualnej, a nie ustanawiają twierdzeń przyczynowych dotyczących historycznej rzeczywistości społecznej lub odbioru przez publiczność.
DOSTĘPNOŚĆ DANYCH:
Dane wspierające niniejsze badanie, w tym metadane, informacje o źródłach i zapisy z przesiewu, są dostępne za pośrednictwem Zenodo pod adresem https://doi.org/10.5281/zenodo.2130291.

Rysunek 1Konstrukcja korpusu i analiza opisowa próby 43 obrazów. (A) Sekwencyjna selekcja 612 potencjalnych obrazów, w wyniku której wyłoniono 43 obrazy kwalifikujące się do badania. Kryteria wykluczenia obejmowały obrazy spoza okresu objętego badaniem lub spoza tradycji malarstwa eksportowego (n = 85), współczesne reprodukcje, obrazy rozmyte lub z błędnie zidentyfikowanym tematem (n = 58), obrazy bez możliwej do zidentyfikowania postaci kobiecej lub o niewystarczającej rozdzielczości (n = 29) oraz rekordy z niewystarczającymi metadanymi (n = 7). (BReprezentatywne przykłady pięciu mediów i formatów: akwarele eksportowe (40,6%, n = 176), obrazy na papierze z rdzenia (25,9%, n = 12), karty albumów eksportowych (19,2%, n = 83), obrazy przedstawiające postacie (9,5%, n = 41) oraz inne formaty eksportowe (4,8%, n = 21).C) Rozkład pobranych próbek obrazów w czterech przedziałach chronologicznych. (D) Rozkład źródeł pozyskiwania (zewnętrzny pierścień) oraz mediów/formatów (wewnętrzny pierścień). Procenty odnoszą się do całkowitej próby (N = 43) i zostały zaokrąglone do jednego miejsca po przecinku. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 2Przedstawiono segmentację, wizualizację osadzeń, rozkład klastrów, czułość kategorii oraz reprezentatywne obrazy. (A) Galeria dziewięciu obrazów z kolorowymi nakładkami segmentacyjnymi, wykorzystywanych do lokalizacji postaci lub elementów wizualnych w celu ich weryfikacji. (B) Wykres rozrzutu UMAP zgłoszonych osadzeń obrazów CLIP z konturami gęstości i etykietami C1–C7. (C) Zgłoszona liczba obrazów (pełne kropki, górna oś) i przypomnienie kategorii (otwarte kółka, dolna oś); przypomnienie kategorii stanowi iloraz dokładnych dopasowań i wsparcia referencyjnego człowieka. Przedziały ufności oraz słupki błędów nie zostały przedstawione. (D) Galeria reprezentatywnych obrazów pogrupowana według etykiet C1–C7, z obrazami wybranymi na podstawie ich bliskości do odpowiednich centroidów skupień. Skróty: AI = sztuczna inteligencja; CLIP = Contrastive Language–Image Pre-training; SAM = Segment Anything Model; UMAP = Uniform Manifold Approximation and Projection; C1–C7 = zgłoszone etykiety 1–7. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 3Asocjacje wskazówek wizualnych i międzykulturowe ramy interpretacyjne. (A) Siedem zweryfikowanych kategorii tożsamości żeńskiej w odniesieniu do człowieka oraz liczebność prób w korpusie 43 obrazów. (B) Mapa ciepła korelacji przedstawiająca względną siłę powiązań między siedmioma kategoriami referencyjnymi dla ludzi a zakodowanymi markerami wizualnymi w zakresie odzieży, otoczenia przestrzennego, obiektów, postawy i relacji społecznych. Siła powiązań została wyprowadzona z adnotacji na poziomie przypadków w obrębie każdej kategorii. (C) Reprezentacja aluwialna podsumowująca ważone zależności między kategoriami referencyjnymi dla ludzi, wymiarami oznakowania wizualnego a archetypami implikacji klas na podstawie zakodowanych obserwacji. (D) Koncepcyjny międzykulturowy model interpretacyjny łączący przedstawione działania, wybór warsztatu i rynku, pięciowymiarowe kodowanie wizualne, powtarzające się typy tożsamości oraz potencjalne ścieżki interpretacyjne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Tabela 1: Charakterystyka korpusu i kompletność metadanych (N = 43). Liczebności i procenty podsumowują sześć oddzielnych bloków: przedział dat, źródło, nośnik lub format, kompletność metadanych, reprezentację postaci kobiecych oraz typ sceny. W każdym bloku mianownikiem jest N = 43, a suma wynosi 43; procenty stanowią proporcje korpusu w obrębie bloku, zaokrąglone do jednego miejsca po przecinku. Kliknij tutaj, aby pobrać ten plik.
Tabela 2: Wstępne etykiety AI i kategorie referencyjne opracowane przez człowieka (N = 43). Support oznacza liczbę obrazów przypisanych do każdej kategorii referencyjnej opracowanej przez człowieka. Dokładne dopasowania wskazują obrazy, dla których wstępna etykieta wygenerowana przez AI odpowiadała kategorii referencyjnej opracowanej przez człowieka. Pełność (recall) na poziomie kategorii oblicza się jako liczbę dokładnych dopasowań podzieloną przez liczbę referencyjnych supportów opracowanych przez człowieka. Kliknij tutaj, aby pobrać ten plik.
Tabela 3: Podsumowanie zgłoszonego profilu obliczeniowego. C1–C7 odwzorowują zwalidowane rozmiary profilu i dominujące etykiety. Integracja przypisań klastrów na poziomie przypadków oraz tabela kontyngencji klastrów według kategorii potwierdzają, że klasteryzacja nienadzorowana skutecznie uchwyciła struktury wizualne odpowiadające siedmiu kategoriom referencyjnym ustalonym przez człowieka. Kliknij tutaj, aby pobrać ten plik.
Tabela 4: Profilowe jakościowe kategorii tożsamości żeńskiej i wizualnych wskazówek związanych z klasą społeczną. Liczby i wartości procentowe podsumowują kategorie referencyjne określone przez ludzi, natomiast ubiór, przestrzeń, obiekty, postawa i relacje społeczne charakteryzują powtarzające się profile wizualne przypisane do każdej kategorii. Interpretacje związane z klasą społeczną stanowią odczytania ikonograficzne wzorców obrazowych, a nie bezpośrednie pomiary historycznego statusu społecznego. Kliknij tutaj, aby pobrać ten plik.
Rycina uzupełniająca 1: Macierz pomyłek porównująca wstępne etykiety AI z rozstrzygniętymi kategoriami referencyjnymi ustalonymi przez człowieka dla korpusu 43 obrazów.Wiersze reprezentują rozstrzygnięte kategorie referencyjne ustalone przez człowieka (etykiety prawdziwe), a kolumny reprezentują wstępne kategorie wygenerowane przez CLIP (etykiety przewidywane). Wartości w komórkach wskazują liczbę obrazów dla każdej kombinacji etykiet AI–człowiek. Komórki na przekątnej reprezentują dokładne dopasowania AI–człowiek, przy czym odpowiadająca im czułość na poziomie kategorii została przedstawiona jako wartość procentowa. Komórki poza przekątną reprezentują niezgodności między wstępną klasyfikacją AI a rozstrzygniętą kategorią referencyjną ustaloną przez człowieka. Ogólna dokładność dopasowań dokładnych wyniosła 82,2% (356/43). Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 1: Porównanie na poziomie przypadków wstępnych etykiet AI, rozstrzygniętych kategorii referencyjnych ustalonych przez człowieka oraz przypisań do klastrów UMAP. Każdy wiersz reprezentuje jeden z 43 chińskich obrazów eksportowych z okresu dynastii Qing włączonych do korpusu analitycznego. Tabela zawiera stabilny identyfikator obrazu QEP, wstępną etykietę CLIP ViT-B/32, niezależne klasyfikacje Koderów Ludzkich 1 i 2, rozstrzygniętą kategorię referencyjną ustaloną przez człowieka, status zgodności AI–człowiek oraz przypisanie do klastra UMAP. „Exact Match” oznacza zgodność między wstępną etykietą AI a rozstrzygniętą kategorią referencyjną ustaloną przez człowieka; „Mismatch” oznacza brak zgodności. Rozstrzygnięta kategoria ludzka służyła jako klasyfikacja referencyjna dla analiz zgodności AI–człowiek. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 2: Tabela kontyngencji kategorii referencyjnych ustalonych przez ludzi oraz przypisań do klastrów obliczeniowych.Wiersze reprezentują siedem rozstrzygniętych kategorii referencyjnych ustalonych przez ludzi, a kolumny reprezentują klastry C1–C7 uzyskane z obliczeniowej analizy klastrowania. Wartości w komórkach wskazują liczbę obrazów przypisanych do każdej kombinacji kategoria–klaster. Całkowite wsparcie reprezentuje liczbę obrazów w każdej ludzkiej kategorii referencyjnej. Koncentracja obserwacji w kombinacjach kategoria–klaster zapewnia opisową ocenę zgodności pomiędzy niezależnie wyprowadzonymi klastrami obliczeniowymi a rozstrzygniętymi kategoriami referencyjnymi ustalonymi przez ludzi. Kliknij tutaj, aby pobrać ten plik.