Construcción del corpus y composición descriptiva
Figura 1 presenta una visión general en cuatro paneles del corpus. Figura 1A muestra el proceso de cribado reportado, desde 612 registros candidatos hasta 433 registros conservados. Figura 1B muestra ejemplos representativos de medios y formatos. Figura 1C presenta los conteos en cuatro intervalos de tiempo, y Figura 1D resume la composición por fuente y medio del corpus. Dado que los intervalos de tiempo abarcan períodos desiguales, estos conteos describen la composición del corpus muestreado y no deben interpretarse como tasas históricas de producción.
Tabla 1 resume las características agregadas del corpus. Las colecciones de museos representaron 302 registros, los archivos digitales 81 y los catálogos publicados 50. Los soportes se clasificaron como acuarela de exportación (n = 176), pintura sobre papel de pith (n = 112), hoja de álbum de exportación (n = 83), pintura de figura (n = 41) y otro formato (n = 21). Los metadatos se clasificaron como completos (n = 288), parciales (n = 118) o mínimos (n = 27). Las figuras femeninas se clasificaron como centrales (n = 214), secundarias (n = 102) o múltiples (n = 117). Cada bloque de clasificación incluyó los 433 registros.
Etiquetas preliminares de IA y categorías de referencia humana
Tabla 2 resume el acuerdo agregado entre las etiquetas generadas inicialmente por inteligencia artificial y las categorías de referencia humana en las 433 pinturas, mientras Tabla suplementaria 1 proporciona las etiquetas preliminares de IA a nivel de caso, las clasificaciones realizadas por los codificadores, las categorías de referencia humana adjudicadas, el estado de coincidencia y las asignaciones de clústeres. En general, las etiquetas de IA y las de referencia humana coincidieron en 356 pinturas, lo que corresponde a una precisión de coincidencia exacta del 82,2 %. El índice de recuperación a nivel de categoría se calculó como la proporción de coincidencias exactas entre IA y humano en relación con el respaldo de referencia humana para cada categoría.
El recuerdo a nivel de categoría varió desde 73,3 % para escenas rituales/matrimoniales (33/45) hasta 88,4 % para élite/belleza (99/112). El recuerdo fue del 84,7 % para trabajo (61/72), 82,1 % para actuación (32/39), 79,7 % para entorno doméstico (51/64), 79,3 % para sirviente (46/58) y 79,1 % para mercado (34/43). En general, el acuerdo exacto fue de 356/433 (82,2 %). La evaluación de los pares a nivel de caso permitió calcular la precisión y las puntuaciones F1 en las siete categorías, que oscilaron entre 74,5 % y 89,2 % para la precisión, y entre 0,75 y 0,88 para las puntuaciones F1. Se proporciona una matriz de confusión completa con los falsos positivos por clase objetivo y los patrones fuera de la diagonal en la Figura suplementaria 1.
Resúmenes de patrones computacionales informados
Figura 2 presenta cuatro visualizaciones de análisis computacionales informados. Figura 2A muestra una galería de nueve pinturas con superposiciones de segmentación de colores utilizadas para la localización visual y revisión. Figura 2B muestra un diagrama de dispersión UMAP de los embeddings de imágenes CLIP informados, con contornos de densidad etiquetados como C1–C7. Figura 2C compara el número informado de pinturas (puntos sólidos) con el recuerdo a nivel de categoría (círculos abiertos), y Figura 2D presenta una galería de pinturas representativas agrupadas según las mismas etiquetas. La validación de clústeres respaldó la solución de agrupamiento seleccionada, que arrojó un puntaje de silueta de 0.54 y un índice de Davies-Bouldin de 0.92. La asignación de clústeres a categorías humanas demostró una fuerte concordancia, ya que cada clúster derivado correspondía predominantemente a una categoría de referencia humana distinta.
Tabla 3 presenta siete perfiles computacionales reportados con tamaños de muestra correspondientes a los siete apoyos de categorías de referencia humana. La tabla de contingencia agrupada por categoría se proporciona en la Tabla Suplementaria 2 y muestra la distribución de las siete categorías de referencia humana adjudicadas a través de los grupos C1–C7. El análisis de estas asignaciones de grupos a nivel de caso demostró que el agrupamiento computacional recuperó estructuras visuales que correspondían estrechamente a las siete categorías de referencia humana.
Asociaciones basadas en señales visuales y síntesis interpretativa
Tabla 4 resume los perfiles cualitativos de señales visuales utilizados para caracterizar las siete categorías codificadas por humanos. Estos perfiles describen asociaciones recurrentes entre la vestimenta, el entorno espacial, la postura, los objetos y las relaciones sociales. No se derivaron de una tabulación cruzada cuantitativa y, por lo tanto, no establecen estatus legal, etnia, causación social ni recepción por parte del público.
Figura 3 integra resúmenes cuantitativos descriptivos de las características visuales codificadas con un modelo conceptual interpretativo. Figura 3A muestra las siete categorías de referencia humana adjudicadas y sus tamaños muestrales. Figura 3B muestra las asociaciones relativas entre estas categorías y los marcadores visuales codificados a lo largo de cinco dimensiones: vestimenta, entorno espacial, objetos, postura y relaciones sociales. Las intensidades de asociación mostradas se calcularon a partir de las anotaciones a nivel de caso dentro de cada categoría de referencia humana. Figura 3C resume las relaciones entre las categorías de referencia humana, las dimensiones de marcado visual y los arquetipos de implicación de clase, utilizando flujos ponderados derivados de las observaciones codificadas. Estas relaciones cuantitativas caracterizan patrones representacionales recurrentes dentro de las pinturas muestreadas y no deben interpretarse como estimaciones de distribuciones demográficas o sociales históricas. Figura 3D presenta un modelo conceptual interpretativo transcultural y debe entenderse como un marco interpretativo informado históricamente, más que como una vía causal sometida a prueba empírica.
Interpretación integrada de patrones visuales
En todo el corpus, las siete categorías de identidad femenina se caracterizaron por combinaciones recurrentes de vestimenta, entorno espacial, objetos, postura y relaciones sociales. Estas combinaciones proporcionaron evidencia descriptiva de convenciones visuales estructuradas dentro de las pinturas analizadas. Las interpretaciones históricas relacionadas con el género, la jerarquía y la mediación intercultural siguieron siendo inferenciales.
En conjunto, los resultados agregados identificaron siete categorías de identidad femenina de referencia humana y cinco dimensiones recurrentes utilizadas para caracterizarlas: vestimenta, entorno espacial, objetos, postura y relaciones sociales. Las etiquetas preliminares de inteligencia artificial coincidieron con las categorías humanas adjudicadas en 356 de 433 pinturas (82,2 %), con la menor recuperación a nivel de categoría observada en escenas rituales o de bodas (73,3 %). Estos hallazgos respaldaron la organización descriptiva y la comparación del corpus. Las etiquetas de inteligencia artificial y humanas a nivel de caso permitieron estimaciones de precisión y F1 a nivel de categoría. Por separado, el análisis de conglomerados identificó estructuras que correspondían a las siete categorías de referencia humana. No obstante, estos hallazgos computacionales caracterizan convenciones de representación visual, en lugar de establecer afirmaciones causales sobre la realidad social histórica o la recepción por parte del público.
DISPONIBILIDAD DE LOS DATOS:
Los datos que respaldan este estudio, incluyendo metadatos, información de las fuentes y registros de cribado, están disponibles a través de Zenodo en https://doi.org/10.5281/zenodo.21130291.

Figura 1: Construcción del corpus y composición descriptiva de la muestra de 433 pinturas. (A) Selección secuencial de 612 imágenes candidatas, resultando en 433 pinturas elegibles. Las exclusiones incluyeron pinturas fuera del período de estudio o de la tradición de pintura de exportación (n = 85), reproducciones modernas, imágenes borrosas o con sujetos incorrectos (n = 58), imágenes sin una figura femenina identificable o con resolución insuficiente (n = 29) y registros con metadatos insuficientes (n = 7). (B) Ejemplos representativos de cinco soportes y formatos: acuarela de exportación (40,6 %, n = 176), pintura sobre papel de matasueño (25,9 %, n = 112), hoja de álbum de exportación (19,2 %, n = 83), pintura de figura (9,5 %, n = 41) y otros formatos de exportación (4,8 %, n = 21). (C) Distribución de las pinturas muestreadas en cuatro intervalos cronológicos. (D) Distribución de las fuentes de colección (anillo exterior) y de los soportes/formatos (anillo interior). Los porcentajes se basan en la muestra total (N = 433) y se redondean a un lugar decimal. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Segmentación informada, visualización de incrustación, distribución de clústeres, recuperación de categorías y pinturas representativas. (A) Galería de nueve pinturas con superposiciones de segmentación coloreadas utilizadas para localizar figuras o elementos visuales para revisión. (B) Gráfico de dispersión UMAP de las incrustaciones de imágenes CLIP informadas, con contornos de densidad y etiquetas C1–C7. (C) Número informado de pinturas (puntos sólidos, eje superior) y recuperación de categorías (círculos abiertos, eje inferior); la recuperación de categorías equivale a los aciertos exactos divididos por el soporte de referencia humana. No se muestran intervalos de confianza ni barras de error. (D) Galería de pinturas representativas agrupadas por las etiquetas C1–C7, con imágenes seleccionadas según su proximidad a los respectivos centroides de clúster. Abreviaturas: AI = inteligencia artificial; CLIP = Preentrenamiento Contrastivo Lenguaje-Imagen; SAM = Modelo de Segmentación Universal; UMAP = Aproximación y Proyección Uniforme de Variedad; C1–C7 = etiquetas informadas 1–7. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Asociaciones de señales visuales y marco conceptual interpretativo intercultural. (A) Siete categorías adjudicadas de identidad femenina de referencia humana y sus tamaños muestrales dentro del corpus de 433 pinturas. (B) Mapa de calor de asociaciones que muestra la intensidad relativa de las relaciones entre las siete categorías de referencia humana y los marcadores visuales codificados relacionados con la vestimenta, el entorno espacial, los objetos, la postura y las relaciones sociales. Las intensidades de asociación se derivaron de las anotaciones a nivel de caso dentro de cada categoría. (C) Representación aluvial que resume las relaciones ponderadas entre las categorías de referencia humana, las dimensiones de marcado visual y los arquetipos de implicación de clase basados en las observaciones codificadas. (D) Modelo conceptual interpretativo intercultural que vincula las actividades representadas, la selección del taller y del mercado, la codificación visual pentadimensional, los tipos recurrentes de identidad y las posibles vías interpretativas. Haga clic aquí para ver una versión ampliada de esta figura.
Tabla 1: Características del corpus y completitud de los metadatos (N = 433). Los conteos y porcentajes resumen seis bloques separados: intervalo de fecha, fuente, medio o formato, completitud de los metadatos, representación de figuras femeninas y tipo de escena. Cada bloque utiliza N = 433 como denominador y suma 433; los porcentajes son proporciones del corpus dentro de cada bloque, redondeadas a un decimal. Haga clic aquí para descargar este archivo.
Tabla 2: Etiquetas preliminares de IA y categorías de referencia humana (N = 433). El soporte representa el número de pinturas asignadas a cada categoría de referencia humana. Las coincidencias exactas indican pinturas para las cuales la etiqueta preliminar generada por IA correspondió a la categoría de referencia humana. El índice de recuperación a nivel de categoría se calcula como el número de coincidencias exactas dividido por el número de soportes de referencia humana. Haga clic aquí para descargar este archivo.
Tabla 3: Resumen del perfil computacional reportado. C1–C7 reproducen los tamaños de perfil validados y las etiquetas dominantes. La integración de las asignaciones de clústeres a nivel de caso y la tabla de contingencia de clústeres por categoría confirma que el agrupamiento no supervisado capturó eficazmente las estructuras visuales correspondientes a las siete categorías de referencia humana. Haga clic aquí para descargar este archivo.
Tabla 4: Perfiles cualitativos de las categorías de identidad femenina y señales visuales relacionadas con la clase. Los conteos y porcentajes resumen las categorías de referencia humana, mientras que la vestimenta, el espacio, los objetos, la postura y las relaciones sociales caracterizan los perfiles visuales recurrentes asociados con cada categoría. Las interpretaciones relacionadas con la clase representan lecturas iconográficas de patrones pictóricos, más que medidas directas del estatus social histórico. Haga clic aquí para descargar este archivo.
Figura suplementaria 1: Matriz de confusión que compara las etiquetas preliminares de IA con las categorías de referencia humana adjudicadas para el corpus de 433 pinturas. Las filas representan las categorías de referencia humana adjudicadas (etiquetas reales) y las columnas representan las categorías preliminares generadas por CLIP (etiquetas predichas). Los valores de las celdas indican el número de pinturas para cada combinación de etiquetas de IA y humanas. Las celdas diagonales representan coincidencias exactas entre IA y humanos, con el porcentaje correspondiente de recuperación a nivel de categoría. Las celdas fuera de la diagonal representan discrepancias entre la clasificación preliminar de IA y la categoría de referencia humana adjudicada. La precisión general por coincidencia exacta fue del 82,2 % (356/433). Haga clic aquí para descargar este archivo.
Tabla suplementaria 1: Comparación por caso entre las etiquetas preliminares de IA, las categorías de referencia humana adjudicadas y las asignaciones de clústeres UMAP. Cada fila representa una de las 433 pinturas chinas de exportación Qing incluidas en el corpus analítico. La tabla muestra el identificador estable de la imagen QEP, la etiqueta preliminar CLIP ViT-B/32, clasificaciones independientes del Codificador Humano 1 y del Codificador Humano 2, la categoría de referencia humana adjudicada, el estado de coincidencia entre IA y humano, y la asignación del clúster UMAP. «Coincidencia exacta» indica acuerdo entre la etiqueta preliminar de IA y la categoría de referencia humana adjudicada; «Discrepancia» indica desacuerdo. La categoría humana adjudicada sirvió como clasificación de referencia para los análisis de concordancia entre IA y humano. Haga clic aquí para descargar este archivo.
Tabla suplementaria 2: Tabla de contingencia de categorías de referencia humana y asignaciones de clústeres computacionales. Las filas representan las siete categorías de referencia humana adjudicadas, y las columnas representan los clústeres C1–C7 obtenidos a partir del análisis computacional de agrupamiento. Los valores de las celdas indican el número de pinturas asignadas a cada combinación de categoría y clúster. El soporte total representa el número de pinturas en cada categoría de referencia humana. La concentración de observaciones a través de las combinaciones de categoría–clúster proporciona una evaluación descriptiva de la correspondencia entre los clústeres computacionales derivados independientemente y las categorías de referencia humana adjudicadas. Haga clic aquí para descargar este archivo.