Korpuskonstruktion und beschreibende Zusammensetzung
Abbildung 1 zeigt eine vierteilige Übersicht über das Korpus. Abbildung 1A veranschaulicht den berichteten Screening-Prozess von 612 Kandidatenaufzeichnungen auf 433 beibehaltene Aufzeichnungen. Abbildung 1B zeigt repräsentative Beispiele für Medien und Formate. Abbildung 1C zeigt die Anzahlen über vier Zeitintervalle hinweg, und Abbildung 1D fasst die Zusammensetzung des Korpus nach Quelle und Medium zusammen. Da die Zeitintervalle unterschiedlich lange Zeiträume umfassen, beschreiben diese Anzahlen die Zusammensetzung des Stichprobenkorpus und sollten nicht als historische Produktionsraten interpretiert werden.
Tabelle 1 fasst die aggregierten Merkmale des Korpus zusammen. Museumssammlungen entfielen auf 302 Datensätze, digitale Archive auf 81 und veröffentlichte Kataloge auf 50. Die Medien wurden kategorisiert als Export-Aquarell (n = 176), Pith-Papier-Malerei (n = 112), Export-Albenblatt (n = 83), Figurenmalerei (n = 41) und anderes Format (n = 21). Die Metadaten wurden als vollständig (n = 288), teilweise (n = 118) oder minimal (n = 27) eingestuft. Weibliche Figuren wurden als zentral (n = 214), sekundär (n = 102) oder mehrfach (n = 117) kategorisiert. Jeder Klassifizierungsblock umfasste alle 433 Datensätze.
Vorläufige KI-Kennzeichnungen und menschliche Referenzkategorien
Tabelle 2 fasst die Gesamtübereinstimmung zwischen den vorläufigen, künstlich-intelligenten generierten Kennzeichnungen und den menschlich erstellten Referenzkategorien über alle 433 Gemälde hinweg zusammen, während Zusatz-Tabelle 1 liefert die entsprechenden vorläufigen KI-Kennzeichnungen auf Fallbasis, Codierer-Klassifizierungen, überprüfte menschliche Referenzkategorien, Übereinstimmungsstatus und Cluster-Zuordnungen. Insgesamt stimmten die KI- und die menschlich erstellten Referenzlabels bei 356 Gemälden überein, was einer Genauigkeit bei exakter Übereinstimmung von 82,2 % entspricht. Die Kategorie-spezifische Rückstellrate wurde als Anteil der exakten Übereinstimmungen zwischen KI und Mensch relativ zur Unterstützung durch die menschliche Referenz für jede Kategorie berechnet.
Die Kategorie-Erinnerungsrate reichte von 73,3 % bei Ritual-/Hochzeitsszenen (33/45) bis zu 88,4 % bei Elite/Schönheit (99/112). Die Erinnerungsrate betrug 84,7 % bei Arbeit (61/72), 82,1 % bei Darbietung (32/39), 79,7 % bei häuslichen Szenen (51/64), 79,3 % bei Dienstboten (46/58) und 79,1 % bei Markt (34/43). Insgesamt lag die exakte Übereinstimmung bei 356/433 (82,2 %). Die Bewertung der Fallpaare ermöglichte die Berechnung von Präzision und F1-Scores über alle sieben Kategorien hinweg, wobei die Präzision zwischen 74,5 % und 89,2 % lag und die F1-Scores zwischen 0,75 und 0,88. Eine umfassende Konfusionsmatrix, die falsch positive Ergebnisse pro Zielklasse sowie Muster außerhalb der Diagonalen detailliert darstellt, ist in Abbildung 1, Zusatzmaterial enthalten.
Berichtete Zusammenfassungen der Berechnungsmuster
Abbildung 2 zeigt vier berichtete Darstellungen computergestützter Analysen. Abbildung 2A zeigt eine Galerie mit neun Gemälden, die farbige Segmentierungsüberlagerungen zur visuellen Lokalisierung und Überprüfung enthalten. Abbildung 2B zeigt ein UMAP-Streudiagramm der berichteten CLIP-Bild-Embeddings mit Dichte-Konturlinien, die mit C1–C7 beschriftet sind. Abbildung 2C vergleicht die berichtete Anzahl an Gemälden (volle Punkte) mit dem Kategorierückruf (offene Kreise), und Abbildung 2D zeigt eine Galerie repräsentativer Gemälde, die entsprechend denselben Beschriftungen gruppiert sind. Die Cluster-Validierung unterstützte die gewählte Clustering-Lösung, die einen Silhouettenwert von 0,54 und einen Davies-Bouldin-Index von 0,92 ergab. Die Zuordnung der Cluster zu menschlichen Kategorien zeigte eine starke Übereinstimmung, wobei jeder abgeleitete Cluster vorwiegend einer eindeutigen Referenzkategorie von Menschen entsprach.
Tabelle 3 zeigt sieben berichtete rechnergestützte Profile mit Stichprobengrößen, die den sieben Unterstützungen der menschlichen Referenzkategorien entsprechen. Die Kontingenztabelle nach Cluster und Kategorie ist in der Zusatz-Tabelle 2 enthalten und veranschaulicht die Verteilung der sieben festgelegten menschlichen Referenzkategorien über die Cluster C1–C7. Die Analyse dieser fallbezogenen Clusterzuordnungen zeigte, dass die rechnergestützte Clusterung visuelle Strukturen erfasst hat, die eng mit den sieben menschlichen Referenzkategorien übereinstimmen.
Assoziationen visueller Hinweise und interpretative Synthese
Tabelle 4 fasst die qualitativen Profilmerkmale visueller Hinweise zusammen, die zur Beschreibung der sieben manuell kodierten Kategorien verwendet wurden. Diese Profile beschreiben wiederkehrende Assoziationen zwischen Kleidung, räumlichem Umfeld, Körperhaltung, Gegenständen und sozialen Beziehungen. Sie wurden nicht aus einer quantitativen Kreuztabelle abgeleitet und erlauben daher keine Aussagen über rechtlichen Status, ethnische Zugehörigkeit, soziale Ursachen oder die Rezeption durch das Publikum.
Abbildung 3 verbindet deskriptive quantitative Zusammenfassungen der codierten visuellen Merkmale mit einem interpretativen konzeptionellen Modell. Abbildung 3A zeigt die sieben festgelegten menschlichen Referenzkategorien und deren Stichprobengrößen. Abbildung 3B veranschaulicht die relativen Assoziationen zwischen diesen Kategorien und den codierten visuellen Markern entlang fünf Dimensionen: Kleidung, räumliche Umgebung, Objekte, Körperhaltung und soziale Beziehungen. Die dargestellten Assoziationsstärken wurden anhand der Fallniveau-Anmerkungen innerhalb jeder menschlichen Referenzkategorie berechnet. Abbildung 3C fasst die Beziehungen zwischen den menschlichen Referenzkategorien, den Dimensionen der visuellen Markierung und den Klassenimplikations-Archetypen zusammen, wobei gewichtete Flüsse verwendet werden, die aus den codierten Beobachtungen abgeleitet sind. Diese quantitativen Beziehungen charakterisieren wiederkehrende repräsentative Muster innerhalb der untersuchten Gemälde und sollten nicht als Schätzung historischer demografischer oder sozialer Verteilungen interpretiert werden. Abbildung 3D präsentiert ein konzeptionelles, kulturvergleichendes Interpretationsmodell und sollte als historisch fundierter interpretativer Rahmen verstanden werden, nicht als empirisch überprüfter kausaler Pfad.
Integrierte Interpretation visueller Muster
Im gesamten Korpus zeichneten sich die sieben Kategorien weiblicher Identität durch wiederkehrende Kombinationen von Kleidung, räumlichem Setting, Objekten, Körperhaltung und sozialen Beziehungen aus. Diese Kombinationen lieferten beschreibende Hinweise auf geprägte visuelle Konventionen innerhalb der untersuchten Gemälde. Historische Interpretationen bezüglich Geschlecht, Hierarchie und interkultureller Vermittlung blieben indes inferentiell.
Insgesamt identifizierten die zusammengefassten Ergebnisse sieben menschlich definierte weibliche Identitätskategorien sowie fünf wiederkehrende Dimensionen, die zur Beschreibung dieser Kategorien herangezogen wurden: Kleidung, räumliche Umgebung, Objekte, Körperhaltung und soziale Beziehungen. Die vorläufigen KI-Kennzeichnungen stimmten bei 356 von 433 Gemälden (82,2 %) mit den endgültig festgelegten menschlichen Kategorien überein, wobei die geringste Kategorie-spezifische Rückstellrate bei Ritual- beziehungsweise Hochzeitsszenen beobachtet wurde (73,3 %). Diese Befunde unterstützten die beschreibende Organisation und den Vergleich des Korpus. Die auf einzelnen Fällen basierenden KI–Mensch-Kennzeichnungen ermöglichten Schätzungen zur Kategorie-spezifischen Genauigkeit und zum F1-Wert. Unabhängig davon identifizierte die Clusteranalyse Strukturen, die den sieben menschlich definierten Kategorien entsprachen. Dennoch beschreiben diese rechnergestützten Ergebnisse visuelle Repräsentationskonventionen, ohne kausale Aussagen über die historische soziale Wirklichkeit oder die Rezeption durch das Publikum zu begründen.
VERFÜGBARKEIT VON DATEN:
Die Daten, die diese Studie unterstützen, einschließlich Metadaten, Quellenangaben und Screening-Aufzeichnungen, sind über Zenodo unter https://doi.org/10.5281/zenodo.21130291 verfügbar.

Abbildung 1: Aufbau des Korpus und beschreibende Zusammensetzung der Stichprobe aus 433 Gemälden. (A) Schrittweise Auswahl von 612 Kandidatenbildern, woraus 433 geeignete Gemälde hervorgingen. Ausschlüsse umfassten Werke außerhalb des Untersuchungszeitraums oder der Exportgemälde-Tradition (n = 85), moderne Reproduktionen, unscharfe Bilder oder falsche Motive (n = 58), Abbildungen ohne erkennbare weibliche Figur oder mit unzureichender Auflösung (n = 29) sowie Datensätze mit unvollständigen Metadaten (n = 7). (B) Beispiele für fünf Medien und Formate: Export-Aquarelle (40,6 %, n = 176), Pith-Papier-Gemälde (25,9 %, n = 112), Export-Albumblätter (19,2 %, n = 83), Figurenbilder (9,5 %, n = 41) und andere Exportformate (4,8 %, n = 21). (C) Verteilung der untersuchten Gemälde auf vier chronologische Intervalle. (D) Verteilung der Sammlungsquellen (äußerer Ring) und der Medien/Formate (innerer Ring). Die Prozentangaben basieren auf der Gesamtstichprobe (N = 433) und sind auf eine Dezimalstelle gerundet. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 2: Berichtete Segmentierung, Visualisierung der Einbettung, Cluster-Verteilung, Kategorie-Rückruf und repräsentative Gemälde. (A) Galerie mit neun Gemälden mit farbigen Segmentierungs-Overlays, die zur Lokalisierung von Figuren oder visuellen Elementen zur Überprüfung verwendet wurden. (B) UMAP-Streudiagramm der berichteten CLIP-Bild-Embeddings mit Dichtekonturen und den Bezeichnungen C1–C7. (C) Berichtete Anzahl der Gemälde (volle Punkte, obere Achse) und Kategorie-Rückruf (offene Kreise, untere Achse); der Kategorie-Rückruf entspricht der Anzahl exakter Übereinstimmungen geteilt durch die menschliche Referenzunterstützung. Keine Konfidenzintervalle oder Fehlerbalken dargestellt. (D) Galerie repräsentativer Gemälde, gruppiert nach den Bezeichnungen C1–C7, mit Bildern, die basierend auf ihrer Nähe zu den jeweiligen Cluster-Zentroiden ausgewählt wurden. Abkürzungen: AI = künstliche Intelligenz; CLIP = Contrastive Language–Image Pre-training; SAM = Segment Anything Model; UMAP = Uniform Manifold Approximation and Projection; C1–C7 = berichtete Bezeichnungen 1–7. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 3: Visuelle Hinweisassoziationen und interkulturelles Interpretationsmodell. (A) Sieben festgelegte menschliche Referenzkategorien für weibliche Identität und ihre Stichprobengrößen innerhalb des Korpus von 433 Gemälden. (B) Assoziations-Heatmap, die die relative Stärke der Beziehungen zwischen den sieben menschlichen Referenzkategorien und codierten visuellen Merkmalen bezüglich Kleidung, räumlichem Setting, Objekten, Körperhaltung und sozialen Beziehungen zeigt. Die Stärke der Assoziationen ergab sich aus den annotierten Einzelfällen innerhalb jeder Kategorie. (C) Alluvial-Darstellung, die gewichtete Beziehungen zwischen menschlichen Referenzkategorien, Dimensionen visueller Markierung und klassenimplikativen Archetypen auf Grundlage der codierten Beobachtungen zusammenfasst. (D) Konzeptionelles interkulturelles Interpretationsmodell, das dargestellte Aktivitäten, die Auswahl von Werkstätten und Märkten, eine fünfdimensionale visuelle Kodierung, wiederkehrende Identitätstypen und mögliche interpretative Verläufe verknüpft. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Tabelle 1: Korpusmerkmale und Vollständigkeit der Metadaten (N = 433). Die Angaben in Anzahl und Prozent beziehen sich auf sechs getrennte Blöcke: Zeitintervall, Quelle, Medium oder Format, Vollständigkeit der Metadaten, Darstellung weiblicher Figuren und Szenentyp. Jeder Block verwendet N = 433 als Nenner und summiert sich auf 433; die Prozentangaben entsprechen den innerhalb der Blöcke berechneten Anteilen am Korpus, gerundet auf eine Dezimalstelle. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Tabelle 2: Vorläufige KI-Labels und menschliche Referenzkategorien (N = 433). Die Unterstützung gibt die Anzahl der Gemälde an, die jeder menschlichen Referenzkategorie zugeordnet wurden. Exakte Übereinstimmungen bezeichnen Gemälde, bei denen das vorläufige, von der KI generierte Label mit der menschlichen Referenzkategorie übereinstimmte. Die rekapitulierte Genauigkeit auf Kategorieebene wird als Anzahl der exakten Übereinstimmungen geteilt durch die Anzahl der menschlichen Referenzunterstützungen berechnet. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Tabelle 3: Zusammenfassung des berichteten rechnerischen Profils. C1–C7 reproduzieren die validierten Profilgrößen und dominierenden Bezeichnungen. Die Integration der fallbasierten Clusterzuweisungen und der Kontingenztafel Cluster nach Kategorie bestätigt, dass die unbeaufsichtigte Clusteranalyse visuelle Strukturen effektiv erfasst hat, die den sieben menschlichen Referenzkategorien entsprechen. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Tabelle 4: Qualitative Profile weiblicher Identitätskategorien und klassenbezogener visueller Hinweise. Die Angaben in Anzahl und Prozentanteilen fassen die menschlich definierten Kategorien zusammen, während Kleidung, Raum, Objekte, Körperhaltung und soziale Beziehungen die wiederkehrenden visuellen Profile charakterisieren, die mit jeder Kategorie assoziiert sind. Die klassenbezogenen Interpretationen stellen ikonographische Deutungen bildhafter Muster dar und keine direkten Messungen des historischen sozialen Status. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Abbildung 1 (zusätzlich): Konfusionsmatrix zum Vergleich vorläufiger KI-Labels mit überprüften menschlichen Referenzkategorien für den Korpus aus 433 Gemälden. Die Zeilen stellen die überprüften menschlichen Referenzkategorien (tatsächliche Labels) dar, die Spalten die vorläufigen, von CLIP generierten Kategorien (vorhergesagte Labels). Die Zellenwerte geben die Anzahl der Gemälde für jede KI–Mensch-Label-Kombination an. Zellen auf der Diagonalen repräsentieren exakte Übereinstimmungen zwischen KI und Mensch, wobei die entsprechende Kategorie-spezifische Rückstellrate in Prozent angegeben ist. Zellen außerhalb der Diagonalen zeigen Diskrepanzen zwischen der vorläufigen KI-Klassifizierung und der überprüften menschlichen Referenzkategorie auf. Die gesamte Genauigkeit bei exakten Übereinstimmungen betrug 82,2 % (356/433). Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzungstabelle 1: Fallweise Gegenüberstellung der vorläufigen KI-Labels, der konsensbasierten menschlichen Referenzkategorien und der UMAP-Clusterzuordnungen. Jede Zeile repräsentiert eines der 433 chinesischen Exportgemälde aus der Qing-Dynastie, die in den Analysekorporus aufgenommen wurden. Die Tabelle enthält den stabilen QEP-Bildidentifikator, das vorläufige CLIP ViT-B/32-Label, unabhängige Klassifikationen durch menschliche Kodierer 1 und 2, die konsensbasierte menschliche Referenzkategorie, den KI–Mensch-Übereinstimmungsstatus sowie die UMAP-Clusterzuordnung. „Exakte Übereinstimmung“ weist auf eine Übereinstimmung zwischen dem vorläufigen KI-Label und der konsensbasierten menschlichen Referenzkategorie hin; „Nichtübereinstimmung“ zeigt eine Abweichung an. Die konsensbasierte menschliche Kategorie diente als Referenzklassifikation für die Analysen zur KI–Mensch-Übereinstimmung. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatz-Tabelle 2: Kontingenztafel der menschlichen Referenzkategorien und rechnerischen Clusterzuordnungen. Die Zeilen repräsentieren die sieben überprüften menschlichen Referenzkategorien, und die Spalten repräsentieren die Cluster C1–C7, die aus der rechnerischen Clusteranalyse gewonnen wurden. Die Zellenwerte geben die Anzahl der Gemälde an, die jeder Kombination aus Kategorie und Cluster zugeordnet sind. Die Gesamtunterstützung zeigt die Anzahl der Gemälde in jeder menschlichen Referenzkategorie an. Die Konzentration der Beobachtungen über die Kombinationen aus Kategorie und Cluster ermöglicht eine beschreibende Bewertung der Übereinstimmung zwischen den unabhängig ermittelten rechnerischen Clustern und den überprüften menschlichen Referenzkategorien. Bitte klicken Sie hier, um diese Datei herunterzuladen.