Construction du corpus et composition descriptive
Figure 1 présente un aperçu en quatre parties du corpus. Figure 1A montre le processus de sélection signalé, allant de 612 références candidates à 433 références conservées. Figure 1B affiche des exemples représentatifs de médias et de formats. Figure 1C présente les effectifs répartis selon quatre intervalles de dates, et Figure 1D résume la composition du corpus selon les sources et les médiums. Étant donné que les intervalles de dates couvrent des périodes inégales, ces effectifs décrivent la composition du corpus échantillonné et ne doivent pas être interprétés comme des taux de production historiques.
Tableau 1 résume les caractéristiques globales du corpus. Les collections de musées représentaient 302 entrées, les archives numériques 81 et les catalogues publiés 50. Les supports ont été classés en aquarelle d'exportation (n = 176), peinture sur papier de pith (n = 112), feuille d'album d'exportation (n = 83), peinture de figures (n = 41) et autre format (n = 21). Les métadonnées ont été classées comme complètes (n = 288), partielles (n = 118) ou minimales (n = 27). Les figures féminines ont été classées comme principales (n = 214), secondaires (n = 102) ou multiples (n = 117). Chaque groupe de classification comprenait l'ensemble des 433 enregistrements.
Étiquettes préliminaires générées par IA et catégories de référence humaine
Le Tableau 2 résume l'accord global entre les étiquettes préliminaires générées par IA et les catégories de référence humaine pour l'ensemble des 433 peintures, tandis que le Tableau supplémentaire 1 fournit, au niveau individuel, les étiquettes préliminaires de l'IA, les classifications des codeurs, les catégories de référence humaine arbitées, le statut de correspondance et les affectations aux groupes. Dans l'ensemble, les étiquettes de l'IA et celles de référence humaine correspondaient pour 356 peintures, ce qui correspond à une précision par correspondance exacte de 82,2 %. Le rappel au niveau des catégories a été calculé comme la proportion de correspondances exactes entre l'IA et l'humain par rapport au nombre d'occurrences dans chaque catégorie selon la référence humaine.
Le rappel au niveau des catégories variait de 73,3 % pour les scènes rituelles/mariages (33/45) à 88,4 % pour les élites/beauté (99/112). Le rappel était de 84,7 % pour le travail (61/72), de 82,1 % pour la performance (32/39), de 79,7 % pour le cadre domestique (51/64), de 79,3 % pour les domestiques (46/58) et de 79,1 % pour le marché (34/43). Dans l'ensemble, l'accord exact était de 356/433 (82,2 %). L'évaluation des paires au niveau des cas a permis de calculer la précision et les scores F1 pour l'ensemble des sept catégories, avec des valeurs allant de 74,5 % à 89,2 % pour la précision, et de 0,75 à 0,88 pour les scores F1. Une matrice de confusion détaillée, indiquant les faux positifs par classe cible et les motifs hors diagonale, est fournie dans la figure supplémentaire 1.
Résumés des motifs computationnels rapportés
Figure 2 présente quatre affichages d'analyses computationnelles rapportées. Figure 2A montre une galerie de neuf peintures avec des superpositions de segmentation colorées utilisées pour la localisation visuelle et l'examen. Figure 2B montre un nuage de points UMAP des intégrations d'images CLIP rapportées, avec des contours de densité étiquetés C1–C7. Figure 2C compare le nombre de peintures rapportées (points pleins) avec le rappel au niveau des catégories (cercles ouverts), et Figure 2D présente une galerie de peintures représentatives regroupées selon les mêmes étiquettes. La validation des groupes a soutenu la solution de regroupement sélectionnée, qui a donné un score de silhouette de 0,54 et un indice de Davies–Bouldin de 0,92. La correspondance entre les groupes et les catégories humaines a montré un fort alignement, chaque groupe dérivé correspondant principalement à une catégorie de référence humaine distincte.
Tableau 3 présente sept profils computationnels rapportés avec des tailles d'échantillon correspondant aux sept catégories de référence humaine. Le tableau de contingence regroupant les clusters par catégorie est fourni dans le Tableau supplémentaire 2 et illustre la répartition des sept catégories de référence humaine attribuées par consensus parmi les clusters C1–C7. L'analyse de ces attributions de clusters au niveau des cas a démontré que le regroupement computationnel a permis de retrouver des structures visuelles correspondant étroitement aux sept catégories de référence humaine.
Associations liées aux indices visuels et synthèse interprétative
Le tableau 4 résume les profils qualitatifs d'indices visuels utilisés pour caractériser les sept catégories codées par des humains. Ces profils décrivent les associations récurrentes entre vêtements, cadre spatial, posture, objets et relations sociales. Ils n'ont pas été établis à partir d'une table de contingence quantitative et ne permettent donc pas d'établir le statut juridique, l'ethnicité, la causalité sociale ou la réception par le public.
Figure 3 associe des résumés quantitatifs descriptifs des caractéristiques visuelles codées à un modèle conceptuel interprétatif. Figure 3A présente les sept catégories humaines de référence validées ainsi que leurs tailles d'échantillon. Figure 3B montre les associations relatives entre ces catégories et les marqueurs visuels codés selon cinq dimensions : vêtements, cadre spatial, objets, posture et relations sociales. Les intensités d'association affichées ont été calculées à partir des annotations au niveau des cas dans chaque catégorie de référence humaine. Figure 3C résume les relations entre les catégories de référence humaine, les dimensions de marquage visuel et les archétypes d'implication de classe, à l’aide de flux pondérés dérivés des observations codées. Ces relations quantitatives caractérisent des schémas de représentation récurrents au sein des peintures échantillonnées et ne doivent pas être interprétées comme des estimations de répartitions démographiques ou sociales historiques. Figure 3D présente un modèle interprétatif conceptuel transculturel et doit être compris comme un cadre interprétatif éclairé par l’histoire, plutôt que comme un chemin causal éprouvé empiriquement.
Interprétation intégrée des motifs visuels
Dans l'ensemble du corpus, les sept catégories d'identité féminine étaient caractérisées par des combinaisons récurrentes de vêtements, de cadre spatial, d'objets, de postures et de relations sociales. Ces combinaisons fournissaient des preuves descriptives de conventions visuelles structurées au sein des peintures échantillonnées. Les interprétations historiques relatives au genre, à la hiérarchie et à la médiation interculturelle demeuraient inférentielles.
Dans leur ensemble, les résultats agrégés ont identifié sept catégories d'identité féminine de référence humaine et cinq dimensions récurrentes utilisées pour les caractériser : les vêtements, le cadre spatial, les objets, la posture et les relations sociales. Les étiquettes préliminaires de l'IA correspondaient aux catégories humaines validées pour 356 des 433 peintures (82,2 %), le taux de rappel le plus faible au niveau des catégories étant observé pour les scènes rituelles ou de mariage (73,3 %). Ces résultats ont soutenu l'organisation descriptive et la comparaison du corpus. Les étiquettes cas par cas issues de l'IA et des annotateurs humains ont permis d'estimer la précision et le score F1 au niveau des catégories. Par ailleurs, l'analyse de regroupement a mis en évidence des structures correspondant aux sept catégories de référence humaine. Néanmoins, ces résultats computationnels décrivent des conventions de représentation visuelle plutôt qu'ils n'établissent de liens de causalité concernant la réalité sociale historique ou la réception par le public.
DISPONIBILITÉ DES DONNÉES :
Les données soutenant cette étude, y compris les métadonnées, les informations sur les sources et les enregistrements de criblage, sont disponibles via Zenodo à l'adresse suivante : https://doi.org/10.5281/zenodo.21130291.

Figure 1 : Construction du corpus et composition descriptive de l'échantillon de 433 peintures. (A) Analyse séquentielle de 612 images candidates, aboutissant à 433 peintures éligibles. Les exclusions comprenaient des peintures en dehors de la période d'étude ou de la tradition des peintures d'exportation (n = 85), des reproductions modernes, des images floues ou des sujets incorrects (n = 58), des images sans figure féminine identifiable ou avec une résolution insuffisante (n = 29), ainsi que des enregistrements comportant des métadonnées insuffisantes (n = 7). (B) Exemples représentatifs de cinq médias et formats : aquarelle d'exportation (40,6 %, n = 176), peinture sur papier de pith (25,9 %, n = 112), feuille d'album d'exportation (19,2 %, n = 83), peinture de figures (9,5 %, n = 41) et autres formats d'exportation (4,8 %, n = 21). (C) Répartition des peintures échantillonnées selon quatre intervalles chronologiques. (D) Répartition des sources de collection (anneau extérieur) et des médias/formats (anneau intérieur). Les pourcentages sont calculés sur l'ensemble de l'échantillon (N = 433) et arrondis à une décimale. Veuillez cliquer ici pour consulter une version agrandie de cette figure.

Figure 2 : Segmentation signalée, visualisation par intégration, distribution des groupes, rappel des catégories et peintures représentatives. (A) Galerie de neuf peintures avec superpositions colorées de segmentation utilisées pour localiser les figures ou éléments visuels à examiner. (B) Graphique de dispersion UMAP des intégrations d'images CLIP signalées, avec des contours de densité et les étiquettes C1–C7. (C) Nombre signalé de peintures (points pleins, axe supérieur) et rappel des catégories (cercles vides, axe inférieur) ; le rappel des catégories correspond au nombre de correspondances exactes divisé par le soutien de référence humaine. Aucun intervalle de confiance ni barre d'erreur n'est indiqué. (D) Galerie de peintures représentatives regroupées selon les étiquettes C1–C7, avec des images sélectionnées en fonction de leur proximité respective aux centroïdes des groupes. Abréviations : IA = intelligence artificielle ; CLIP = pré-entraînement contrastif langage-image ; SAM = modèle de segmentation universel ; UMAP = approximation et projection uniforme des variétés ; C1–C7 = étiquettes signalées 1–7. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 3 : Cadre visuel des associations et modèle interprétatif interculturel. (A) Sept catégories d'identité féminine de référence humaine validées et leurs effectifs au sein du corpus de 433 tableaux. (B) Carte thermique d'association montrant l'intensité relative des liens entre les sept catégories de référence humaine et les marqueurs visuels codés portant sur les vêtements, le cadre spatial, les objets, la posture et les relations sociales. Les intensités d'association ont été déduites des annotations au niveau des cas dans chaque catégorie. (C) Représentation en flux superposés résumant les relations pondérées entre les catégories de référence humaine, les dimensions de marquage visuel et les archétypes d'implication de classe, basées sur les observations codées. (D) Modèle conceptuel d'interprétation interculturelle reliant les activités représentées, la sélection d'atelier et de marché, le codage visuel à cinq dimensions, les types d'identité récurrents et les voies interprétatives possibles. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Tableau 1 : Caractéristiques du corpus et exhaustivité des métadonnées (N = 433). Les effectifs et pourcentages résument six blocs distincts : intervalle de dates, source, support ou format, exhaustivité des métadonnées, représentation des figures féminines et type de scène. Chaque bloc utilise N = 433 comme dénominateur et totalise 433 ; les pourcentages correspondent à des proportions du corpus par bloc, arrondies à une décimale. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 2 : Étiquettes préliminaires de l'IA et catégories de référence humaine (N = 433). Le support représente le nombre de peintures attribuées à chaque catégorie de référence humaine. Les correspondances exactes indiquent les peintures pour lesquelles l'étiquette préliminaire générée par l'IA correspondait à la catégorie de référence humaine. Le rappel au niveau des catégories est calculé comme le nombre de correspondances exactes divisé par le nombre de supports de référence humaine. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 3 : Résumé du profil computationnel rapporté. Les profils C1 à C7 reproduisent les tailles validées et les libellés dominants. L'intégration des attributions de clusters au niveau des cas et du tableau de contingence cluster-par-catégorie confirme que le regroupement non supervisé a efficacement capturé les structures visuelles correspondant aux sept catégories de référence humaine. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 4 : Profils qualitatifs des catégories d'identité féminine et indices visuels liés à la classe sociale. Les effectifs et pourcentages résument les catégories de référence humaine, tandis que les vêtements, l'espace, les objets, la posture et les relations sociales caractérisent les profils visuels récurrents associés à chaque catégorie. Les interprétations liées à la classe représentent des lectures iconographiques de motifs picturaux plutôt que des mesures directes du statut social historique. Veuillez cliquer ici pour télécharger ce fichier.
Figure supplémentaire 1 : Matrice de confusion comparant les étiquettes préliminaires de l'IA aux catégories de référence humaine validées pour le corpus de 433 peintures. Les lignes représentent les catégories de référence humaine validées (étiquettes réelles), et les colonnes représentent les catégories préliminaires générées par CLIP (étiquettes prédites). Les valeurs des cellules indiquent le nombre de peintures pour chaque combinaison d'étiquettes IA–humain. Les cellules diagonales représentent les correspondances exactes entre l'IA et l'humain, la sensibilité (rappel) au niveau de chaque catégorie étant indiquée en pourcentage. Les cellules hors diagonale représentent les inadéquations entre la classification préliminaire de l'IA et la catégorie de référence humaine validée. La précision globale par correspondance exacte était de 82,2 % (356/433). Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 1 : Comparaison au niveau des cas entre les étiquettes préliminaires de l'IA, les catégories de référence humaine consensuelles et les attributions de clusters UMAP. Chaque ligne représente l'une des 433 peintures chinoises d'exportation Qing incluses dans le corpus analytique. Le tableau indique l'identifiant d'image QEP stable, l'étiquette préliminaire de CLIP ViT-B/32, les classifications indépendantes des codeurs humains 1 et 2, la catégorie de référence humaine consensuelle, le statut de concordance entre l'IA et l'humain, ainsi que l'attribution au cluster UMAP. « Concordance exacte » indique un accord entre l'étiquette préliminaire de l'IA et la catégorie de référence humaine consensuelle ; « Discordance » indique un désaccord. La catégorie humaine consensuelle a servi de classification de référence pour les analyses de concordance entre l'IA et l'humain. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 2 : Tableau de contingence des catégories de référence humaine et des attributions de grappes computationnelles. Les lignes représentent les sept catégories de référence humaine validées par consensus, et les colonnes représentent les grappes C1–C7 obtenues à partir de l'analyse de regroupement computationnel. Les valeurs des cellules indiquent le nombre de peintures attribuées à chaque combinaison catégorie-grappe. Le soutien total représente le nombre de peintures appartenant à chaque catégorie de référence humaine. La concentration des observations selon les combinaisons catégorie-grappe fournit une évaluation descriptive de la concordance entre les grappes computationnelles déterminées indépendamment et les catégories de référence humaine validées par consensus. Veuillez cliquer ici pour télécharger ce fichier.