Costruzione del corpus e composizione descrittiva
Figura 1 presenta una panoramica in quattro parti del corpus. Figura 1A mostra il processo di selezione riportato, che passa da 612 record candidati a 433 record conservati. Figura 1B mostra esempi rappresentativi di media e formati. Figura 1C presenta i conteggi suddivisi in quattro intervalli temporali, e Figura 1D riassume la composizione del corpus per fonte e tipo di supporto. Poiché gli intervalli temporali coprono periodi di durata disuguale, questi conteggi descrivono la composizione del corpus campionato e non devono essere interpretati come tassi storici di produzione.
Tabella 1 riassume le caratteristiche aggregate del corpus. Le collezioni museali comprendevano 302 record, gli archivi digitali 81 e i cataloghi pubblicati 50. I supporti sono stati classificati come acquerello da esportazione (n = 176), dipinti su carta di pith (n = 112), fogli da album da esportazione (n = 83), dipinti di figure (n = 41) e altri formati (n = 21). I metadati sono stati classificati come completi (n = 288), parziali (n = 118) o minimi (n = 27). Le figure femminili sono state classificate come centrali (n = 214), secondarie (n = 102) o multiple (n = 117). Ogni blocco di classificazione comprendeva tutti e 433 i record.
Etichette preliminari dell'IA e categorie di riferimento umano
Tabella 2 riassume l'accordo complessivo tra le etichette preliminari generate dall'IA e le categorie di riferimento umane per i 433 dipinti, mentre Tabella supplementare 1 fornisce le corrispondenti etichette preliminari basate su intelligenza artificiale a livello di singolo caso, le classificazioni degli annotatori, le categorie di riferimento umane definitive, lo stato di corrispondenza e gli assegnamenti ai cluster. In generale, le etichette attribuite dall'intelligenza artificiale e quelle di riferimento umano hanno coinciso per 356 dipinti, corrispondenti a un'accuratezza di corrispondenza esatta dell'82,2%. Il richiamo a livello di categoria è stato calcolato come la proporzione di corrispondenze esatte tra intelligenza artificiale e riferimento umano rispetto al supporto di riferimento umano per ciascuna categoria.
Il richiamo a livello di categoria è variato dal 73,3% per scene rituali/matrimoniali (33/45) all'88,4% per élite/bellezza (99/112). Il richiamo è stato dell'84,7% per lavoro manuale (61/72), dell'82,1% per spettacolo (32/39), del 79,7% per ambiente domestico (51/64), del 79,3% per servitore (46/58) e del 79,1% per mercato (34/43). Nel complesso, l'accordo esatto è stato di 356/433 (82,2%). La valutazione delle coppie a livello di caso ha permesso il calcolo della precisione e dei punteggi F1 per tutte e sette le categorie, con valori compresi tra il 74,5% e l'89,2% per la precisione e tra 0,75 e 0,88 per i punteggi F1. Una matrice di confusione completa, che illustra i falsi positivi per classe target e i modelli fuori dalla diagonale, è riportata nella Supplementary Figure 1.
Riepiloghi dei modelli computazionali riportati
Figura 2 presenta quattro visualizzazioni di analisi computazionali riportate. Figura 2A mostra una galleria di nove dipinti con sovrapposizioni di segmentazione colorate utilizzate per la localizzazione visiva e la revisione. Figura 2B mostra un grafico a dispersione UMAP degli embedding di immagini CLIP riportati, con contorni di densità etichettati da C1 a C7. Figura 2C confronta il numero di dipinti riportati (punti pieni) con il richiamo a livello di categoria (cerchi vuoti), e Figura 2D presenta una galleria di dipinti rappresentativi raggruppati secondo le stesse etichette. La validazione dei cluster ha supportato la soluzione di clustering selezionata, che ha prodotto un punteggio di siluetta di 0,54 e un indice di Davies-Bouldin di 0,92. L'associazione tra cluster e categorie umane ha dimostrato un forte allineamento, con ciascun cluster derivato che corrispondeva prevalentemente a una categoria di riferimento distinta.
Tabella 3 presenta sette profili computazionali riportati con dimensioni campionarie corrispondenti ai sette supporti delle categorie di riferimento umano. La tabella di contingenza cluster-per-categoria è fornita nella Tabella Supplementare 2 e mostra la distribuzione delle sette categorie di riferimento umano valutate tra i cluster C1–C7. L'analisi di questi assegnamenti di cluster a livello di singolo caso ha dimostrato che il raggruppamento computazionale ha recuperato strutture visive che corrispondevano strettamente alle sette categorie di riferimento umano.
Associazioni basate sui segnali visivi e sintesi interpretativa
Tabella 4 riassume i profili qualitativi dei segnali visivi utilizzati per caratterizzare le sette categorie codificate manualmente. Questi profili descrivono associazioni ricorrenti tra abbigliamento, contesto spaziale, postura, oggetti e relazioni sociali. Tali profili non sono stati ottenuti da una tabulazione incrociata quantitativa e pertanto non stabiliscono status legale, etnia, causalità sociale né ricezione da parte del pubblico.
Figura 3 integra sintesi quantitative descrittive delle caratteristiche visive codificate con un modello concettuale interpretativo. Figura 3A presenta le sette categorie di riferimento umano valutate e le relative dimensioni campionarie. Figura 3B mostra le associazioni relative tra queste categorie e i marcatori visivi codificati lungo cinque dimensioni: abbigliamento, contesto spaziale, oggetti, postura e relazioni sociali. Le intensità delle associazioni visualizzate sono state calcolate a partire dalle annotazioni a livello di singolo caso all'interno di ciascuna categoria di riferimento umano. Figura 3C riassume le relazioni tra categorie di riferimento umano, dimensioni di marcatura visiva e archetipi di implicazione categoriale, utilizzando flussi ponderati derivati dalle osservazioni codificate. Queste relazioni quantitative descrivono schemi rappresentativi ricorrenti all'interno dei dipinti campionati e non devono essere interpretate come stime di distribuzioni demografiche o sociali storiche. Figura 3D presenta un modello interpretativo interculturale e deve essere compreso come un quadro interpretativo informato dal contesto storico, piuttosto che come un percorso causale sottoposto a verifica empirica.
Interpretazione integrata dei modelli visivi
Nell'intero corpus, le sette categorie di identità femminile si sono caratterizzate per combinazioni ricorrenti di abbigliamento, ambientazione spaziale, oggetti, postura e relazioni sociali. Queste combinazioni hanno fornito evidenze descrittive di convenzioni visive strutturate nei dipinti analizzati. Le interpretazioni storiche relative al genere, alla gerarchia e alla mediazione interculturale sono rimaste di carattere inferenziale.
Nel complesso, i risultati aggregati hanno identificato sette categorie di identità femminile di riferimento umano e cinque dimensioni ricorrenti utilizzate per caratterizzarle: abbigliamento, contesto spaziale, oggetti, postura e relazioni sociali. Le etichette preliminari dell'IA corrispondevano alle categorie umane concordate in 356 su 433 dipinti (82,2%), con il valore più basso di richiamo a livello di categoria osservato per le scene rituali/nuziali (73,3%). Questi risultati hanno sostenuto l'organizzazione descrittiva e il confronto del corpus. Le etichette caso-per-caso di IA e umane hanno permesso stime della precisione e dell'F1 a livello di categoria. In modo indipendente, l'analisi dei cluster ha identificato strutture corrispondenti alle sette categorie di riferimento umano. Tuttavia, questi risultati computazionali descrivono convenzioni di rappresentazione visiva piuttosto che stabilire affermazioni causali sulla realtà sociale storica o sulla ricezione da parte del pubblico.
DISPONIBILITÀ DEI DATI:
I dati a supporto di questo studio, inclusi metadati, informazioni sulle fonti e registrazioni di screening, sono disponibili su Zenodo all'indirizzo https://doi.org/10.5281/zenodo.21130291.

Figura 1: Costruzione del corpus e composizione descrittiva del campione di 433 dipinti. (A) Selezione sequenziale di 612 immagini candidate, che ha portato a 433 dipinti idonei. Le esclusioni comprendevano dipinti al di fuori del periodo di studio o della tradizione dei dipinti di esportazione (n = 85), riproduzioni moderne, immagini sfocate o soggetti errati (n = 58), immagini senza una figura femminile identificabile o con risoluzione inadeguata (n = 29) e record con metadati insufficienti (n = 7). (B) Esempi rappresentativi di cinque supporti e formati: acquerello di esportazione (40,6%, n = 176), dipinto su carta di midollo di pith (25,9%, n = 112), foglio d'album di esportazione (19,2%, n = 83), dipinto di figura (9,5%, n = 41) e altri formati di esportazione (4,8%, n = 21). (C) Distribuzione dei dipinti campionati in quattro intervalli cronologici. (D) Distribuzione delle fonti delle collezioni (anello esterno) e dei supporti/formati (anello interno). Le percentuali si basano sul campione totale (N = 433) e sono arrotondate a una cifra decimale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 2: Segmentazione riportata, visualizzazione dell'incorporamento, distribuzione dei cluster, richiamo delle categorie e dipinti rappresentativi. (A) Galleria di nove dipinti con sovrapposizioni di segmentazione colorate utilizzate per localizzare figure o elementi visivi da esaminare. (B) Grafico a dispersione UMAP degli incorporamenti immagine CLIP riportati, con contorni di densità ed etichette C1–C7. (C) Numero riportato di dipinti (punti pieni, asse superiore) e richiamo delle categorie (cerchi vuoti, asse inferiore); il richiamo delle categorie corrisponde al numero di corrispondenze esatte diviso per il supporto di riferimento umano. Non vengono mostrati intervalli di confidenza né barre di errore. (D) Galleria di dipinti rappresentativi raggruppati in base alle etichette C1–C7, con immagini selezionate in base alla loro vicinanza ai rispettivi centroidi dei cluster. Abbreviazioni: AI = intelligenza artificiale; CLIP = Contrastive Language–Image Pre-training; SAM = Segment Anything Model; UMAP = Uniform Manifold Approximation and Projection; C1–C7 = etichette riportate 1–7. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 3: Associazioni basate su indizi visivi e modello interpretativo interculturale. (A) Sette categorie di identità femminile di riferimento umano valutate e le rispettive dimensioni campionarie all'interno del corpus di 433 dipinti. (B) Mappa termica delle associazioni che mostra l'intensità relativa delle relazioni tra le sette categorie di riferimento umano e i marcatori visivi codificati relativi a abbigliamento, contesto spaziale, oggetti, postura e relazioni sociali. Le intensità delle associazioni sono state ricavate dalle annotazioni a livello di singolo caso all'interno di ciascuna categoria. (C) Rappresentazione a flusso (alluvial) che riassume le relazioni ponderate tra categorie di riferimento umano, dimensioni dei marcatori visivi e archetipi implicati per classe, basate sulle osservazioni codificate. (D) Modello concettuale di interpretazione interculturale che collega le attività raffigurate, la selezione di botteghe e mercati, la codifica visiva in cinque dimensioni, i tipi ricorrenti di identità e i possibili percorsi interpretativi. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Tabella 1: Caratteristiche del corpus e completezza dei metadati (N = 433). Le frequenze e le percentuali riassumono sei blocchi distinti: intervallo temporale, fonte, supporto o formato, completezza dei metadati, rappresentazione di figure femminili e tipo di scena. Ogni blocco utilizza N = 433 come denominatore e ha un totale di 433; le percentuali rappresentano proporzioni all'interno di ciascun blocco del corpus, arrotondate a una cifra decimale. Cliccare qui per scaricare il file.
Tabella 2: Etichette preliminari dell'IA e categorie di riferimento umano (N = 433). Il supporto rappresenta il numero di dipinti assegnati a ciascuna categoria di riferimento umano. Le corrispondenze esatte indicano i dipinti per cui l'etichetta preliminare generata dall'IA corrispondeva alla categoria di riferimento umano. Il richiamo a livello di categoria è calcolato come il numero di corrispondenze esatte diviso per il numero di supporti di riferimento umano. Cliccare qui per scaricare il file.
Tabella 3: Sintesi del profilo computazionale riportato. C1–C7 riproducono le dimensioni dei profili validati e le etichette dominanti. L'integrazione delle assegnazioni di cluster a livello di singolo caso e della tabella di contingenza cluster-per-categoria conferma che il clustering non supervisionato ha efficacemente catturato le strutture visive corrispondenti alle sette categorie di riferimento umano. Cliccare qui per scaricare il file.
Tabella 4: Profili qualitativi delle categorie di identità femminile e dei segnali visivi correlati alla classe. Le frequenze e le percentuali riassumono le categorie di riferimento umane, mentre l'abbigliamento, lo spazio, gli oggetti, la postura e le relazioni sociali caratterizzano i profili visivi ricorrenti associati a ciascuna categoria. Le interpretazioni relative alla classe rappresentano letture iconografiche di modelli pittorici piuttosto che misurazioni dirette dello status sociale storico. Cliccare qui per scaricare il file.
Figura supplementare 1: Matrice di confusione che confronta le etichette preliminari dell'IA con le categorie di riferimento umane per il corpus di 433 dipinti. Le righe rappresentano le categorie di riferimento umane (etichette reali) e le colonne rappresentano le categorie preliminari generate da CLIP (etichette previste). I valori delle celle indicano il numero di dipinti per ciascuna combinazione di etichette tra IA e umano. Le celle sulla diagonale rappresentano corrispondenze esatte tra IA e umano, con il relativo richiamo a livello di categoria mostrato come percentuale. Le celle fuori dalla diagonale rappresentano discrepanze tra la classificazione preliminare dell'IA e la categoria di riferimento umana. L'accuratezza complessiva per corrispondenza esatta è stata dell'82,2% (356/433). Cliccare qui per scaricare questo file.
Tabella supplementare 1: Confronto a livello di singolo caso tra le etichette preliminari dell'IA, le categorie di riferimento umane concordate e le assegnazioni dei cluster UMAP. Ogni riga rappresenta uno dei 433 dipinti cinesi di epoca Qing esportati inclusi nel corpus analitico. La tabella riporta l'identificatore immagine QEP stabile, l'etichetta preliminare CLIP ViT-B/32, le classificazioni indipendenti del Codificatore Umano 1 e del Codificatore Umano 2, la categoria di riferimento umana concordata, lo stato di corrispondenza tra IA e valutazione umana e l'assegnazione al cluster UMAP. "Corrispondenza esatta" indica accordo tra l'etichetta preliminare dell'IA e la categoria di riferimento umana concordata; "Discordanza" indica disaccordo. La categoria umana concordata è stata utilizzata come classificazione di riferimento per le analisi di accordo tra IA e valutazione umana. Cliccare qui per scaricare il file.
Tabella supplementare 2: Tabella di contingenza delle categorie di riferimento umano e delle assegnazioni dei cluster computazionali. Le righe rappresentano le sette categorie di riferimento umano stabilite tramite valutazione congiunta, e le colonne rappresentano i cluster C1–C7 ottenuti dall'analisi di clustering computazionale. I valori delle celle indicano il numero di dipinti assegnati a ciascuna combinazione categoria-cluster. Il supporto totale rappresenta il numero di dipinti in ciascuna categoria di riferimento umano. La concentrazione delle osservazioni attraverso le combinazioni categoria-cluster fornisce una valutazione descrittiva della corrispondenza tra i cluster computazionali derivati in modo indipendente e le categorie di riferimento umano stabilite tramite valutazione congiunta. Cliccare qui per scaricare il file.