Construção do corpus e composição descritiva
Figura 1 apresenta a visão geral em quatro painéis do corpus. Figura 1A mostra o processo de triagem relatado, desde 612 registros candidatos até 433 registros mantidos. Figura 1B exibe exemplos representativos de mídias e formatos. Figura 1C apresenta as contagens em quatro intervalos de datas, e Figura 1D resume a composição por fonte e tipo de mídia do corpus. Como os intervalos de datas abrangem períodos desiguais, essas contagens descrevem a composição do corpus amostrado e não devem ser interpretadas como taxas históricas de produção.
Tabela 1 resume as características agregadas do corpus. As coleções de museus corresponderam a 302 registros, os arquivos digitais a 81 e os catálogos publicados a 50. Os suportes foram categorizados como aquarela de exportação (n = 176), pintura sobre papel de pith (n = 112), folha de álbum de exportação (n = 83), pintura de figura (n = 41) e outro formato (n = 21). Os metadados foram classificados como completos (n = 288), parciais (n = 118) ou mínimos (n = 27). As figuras femininas foram classificadas como centrais (n = 214), secundárias (n = 102) ou múltiplas (n = 117). Cada bloco de classificação compreendeu os 433 registros.
Rótulos preliminares de IA e categorias de referência humana
Tabela 2 resume o acordo agregado entre as etiquetas preliminares geradas por IA e as categorias de referência humana ao longo das 433 pinturas, enquanto Tabela Suplementar 1 fornece as respectivas etiquetas preliminares de IA por caso, classificações dos codificadores, categorias de referência humana adjudicadas, status de correspondência e atribuições de agrupamento. No geral, as etiquetas de IA e de referência humana coincidiram em 356 pinturas, correspondendo a uma precisão de acerto exato de 82,2%. A revocação no nível de categoria foi calculada como a proporção de acertos exatos entre IA e humano em relação ao suporte de referência humana para cada categoria.
A recordação em nível de categoria variou de 73,3% para cenas rituais/casamentos (33/45) a 88,4% para elite/beleza (99/112). A recordação foi de 84,7% para trabalho (61/72), 82,1% para atuação (32/39), 79,7% para ambiente doméstico (51/64), 79,3% para servo (46/58) e 79,1% para mercado (34/43). No geral, a concordância exata foi de 356/433 (82,2%). A avaliação dos pares em nível de caso permitiu o cálculo da precisão e dos escores F1 em todas as sete categorias, variando de 74,5% a 89,2% para a precisão e de 0,75 a 0,88 para os escores F1. Uma matriz de confusão abrangente detalhando os falsos positivos por classe-alvo e os padrões fora da diagonal é fornecida na Figura Suplementar 1.
Resumos dos padrões computacionais relatados
Figura 2 apresenta quatro exibições de análises computacionais relatadas. Figura 2A mostra uma galeria de nove pinturas com sobreposições coloridas de segmentação utilizadas para localização visual e revisão. Figura 2B mostra um gráfico de dispersão UMAP dos embeddings de imagens CLIP relatados, com contornos de densidade rotulados de C1 a C7. Figura 2C compara o número relatado de pinturas (pontos sólidos) com a recordação em nível de categoria (círculos vazados), e Figura 2D apresenta uma galeria de pinturas representativas agrupadas de acordo com as mesmas etiquetas. A validação dos agrupamentos apoiou a solução de agrupamento selecionada, que resultou em um escore de silhueta de 0,54 e um índice de Davies–Bouldin de 0,92. O mapeamento entre agrupamentos e categorias humanas demonstrou forte alinhamento, com cada agrupamento derivado correspondendo predominantemente a uma categoria de referência humana distinta.
Tabela 3 apresenta sete perfis computacionais relatados com tamanhos amostrais correspondentes aos sete suportes de categorias de referência humana. A tabela de contingência agrupada por categoria é fornecida na Tabela Suplementar 2 e mostra a distribuição das sete categorias de referência humana adjudicadas entre os agrupamentos C1–C7. A análise dessas atribuições de agrupamento em nível de caso demonstrou que o agrupamento computacional recuperou estruturas visuais que correspondiam estreitamente às sete categorias de referência humana.
Associações baseadas em pistas visuais e síntese interpretativa
Tabela 4 resume os perfis qualitativos de pistas visuais utilizados para caracterizar as sete categorias codificadas por humanos. Esses perfis descrevem associações recorrentes entre vestuário, ambiente espacial, postura, objetos e relações sociais. Eles não foram derivados de uma tabulação cruzada quantitativa e, portanto, não estabelecem status legal, etnia, causação social ou recepção pelo público.
Figura 3 integra resumos quantitativos descritivos das características visuais codificadas com um modelo conceitual interpretativo. Figura 3A apresenta as sete categorias de referência humana adjudicadas e seus tamanhos amostrais. Figura 3B mostra as associações relativas entre essas categorias e os marcadores visuais codificados ao longo de cinco dimensões: vestuário, cenário espacial, objetos, postura e relações sociais. As intensidades das associações exibidas foram calculadas a partir das anotações em nível de caso dentro de cada categoria de referência humana. Figura 3C resume as relações entre as categorias de referência humana, as dimensões de marcação visual e os arquétipos de implicação de classe, utilizando fluxos ponderados derivados das observações codificadas. Essas relações quantitativas caracterizam padrões representacionais recorrentes nas pinturas amostradas e não devem ser interpretadas como estimativas de distribuições demográficas ou sociais históricas. Figura 3D apresenta um modelo conceitual interpretativo transcultural e deve ser compreendido como um referencial interpretativo historicamente fundamentado, e não como um caminho causal empiricamente testado.
Interpretação integrada de padrões visuais
Ao longo do corpus, as sete categorias de identidade feminina foram caracterizadas por combinações recorrentes de vestuário, cenário espacial, objetos, postura e relações sociais. Essas combinações forneceram evidências descritivas de convenções visuais padronizadas nas pinturas analisadas. As interpretações históricas relativas a gênero, hierarquia e mediação intercultural permaneceram inferenciais.
Em conjunto, os resultados agregados identificaram sete categorias de identidade feminina de referência humana e cinco dimensões recorrentes utilizadas para caracterizá-las: vestuário, cenário espacial, objetos, postura e relações sociais. As etiquetas preliminares de IA coincidiram com as categorias humanas adjudicadas em 356 de 433 pinturas (82,2%), com a menor taxa de recuperação ao nível das categorias observada em cenas rituais/casamentos (73,3%). Esses achados apoiaram a organização descritiva e a comparação do corpus. As etiquetas de IA–humano ao nível dos casos permitiram estimativas de precisão e F1 ao nível das categorias. Separadamente, a análise de agrupamento identificou estruturas que correspondiam às sete categorias de referência humana. Contudo, esses achados computacionais caracterizam convenções de representação visual, em vez de estabelecer afirmações causais sobre a realidade social histórica ou a recepção pelo público.
DISPONIBILIDADE DE DADOS:
Os dados que apoiam este estudo, incluindo metadados, informações de origem e registros de triagem, estão disponíveis por meio do Zenodo em https://doi.org/10.5281/zenodo.21130291.

Figura 1: Construção do corpus e composição descritiva da amostra de 433 pinturas. (A) Triagem sequencial de 612 imagens candidatas, resultando em 433 pinturas elegíveis. As exclusões incluíram pinturas fora do período do estudo ou da tradição de pintura de exportação (n = 85), reproduções modernas, imagens desfocadas ou com temas incorretos (n = 58), imagens sem uma figura feminina identificável ou com resolução inadequada (n = 29) e registros com metadados insuficientes (n = 7). (B) Exemplos representativos de cinco mídias e formatos: aquarela de exportação (40,6%, n = 176), pintura em papel pith (25,9%, n = 112), folha de álbum de exportação (19,2%, n = 83), pintura de figura (9,5%, n = 41) e outros formatos de exportação (4,8%, n = 21). (C) Distribuição das pinturas amostradas em quatro intervalos cronológicos. (D) Distribuição das fontes de coleção (anel externo) e das mídias/formatos (anel interno). As porcentagens são baseadas na amostra total (N = 433) e arredondadas para uma casa decimal. Clique aqui para visualizar uma versão maior desta figura.

Figura 2: Segmentação relatada, visualização de incorporação, distribuição de agrupamentos, recuperação de categorias e pinturas representativas. (A) Galeria de nove pinturas com sobreposições coloridas de segmentação utilizadas para localizar figuras ou elementos visuais para análise. (B) Gráfico de dispersão UMAP dos incorporamentos de imagens CLIP relatados, com contornos de densidade e rótulos C1–C7. (C) Número relatado de pinturas (pontos sólidos, eixo superior) e recuperação de categoria (círculos vazados, eixo inferior); a recuperação de categoria equivale ao número de acertos exatos dividido pelo suporte de referência humana. Nenhum intervalo de confiança ou barra de erro é mostrado. (D) Galeria de pinturas representativas agrupadas pelos rótulos C1–C7, com imagens selecionadas com base em sua proximidade aos respectivos centróides dos agrupamentos. Abreviações: IA = inteligência artificial; CLIP = Pré-treinamento Contrastivo entre Linguagem e Imagem; SAM = Modelo de Segmentação Universal; UMAP = Aproximação Uniforme de Variedade e Projeção; C1–C7 = rótulos relatados 1–7. Clique aqui para visualizar uma versão maior desta figura.

Figura 3: Associações de pistas visuais e estrutura interpretativa transcultural. (A) Sete categorias adjudicadas de identidade feminina de referência humana e seus tamanhos amostrais dentro do corpus de 433 pinturas. (B) Mapa de calor de associação mostrando a intensidade relativa das relações entre as sete categorias de referência humana e marcadores visuais codificados relacionados a vestuário, cenário espacial, objetos, postura e relações sociais. As intensidades de associação foram derivadas das anotações em nível de caso dentro de cada categoria. (C) Representação aluvial que resume as relações ponderadas entre categorias de referência humana, dimensões de marcação visual e arquétipos de implicação de classe com base nas observações codificadas. (D) Modelo conceitual de interpretação transcultural que conecta atividades representadas, seleção de oficinas e mercados, codificação visual pentadimensional, tipos recorrentes de identidade e possíveis trajetórias interpretativas. Clique aqui para visualizar uma versão ampliada desta figura.
Tabela 1: Características do corpus e completude dos metadados (N = 433). As contagens e porcentagens resumem seis blocos separados: intervalo de datas, fonte, suporte ou formato, completude dos metadados, representação de figuras femininas e tipo de cena. Cada bloco utiliza N = 433 como seu denominador e soma 433; as porcentagens são proporções do corpus dentro de cada bloco, arredondadas para uma casa decimal. Clique aqui para baixar este arquivo.
Tabela 2: Rótulos preliminares de IA e categorias de referência humana (N = 433). O suporte representa o número de pinturas atribuídas a cada categoria de referência humana. As correspondências exatas indicam pinturas para as quais o rótulo preliminar gerado por IA correspondeu à categoria de referência humana. O recall no nível da categoria é calculado como o número de correspondências exatas dividido pelo número de suportes de referência humana. Clique aqui para baixar este arquivo.
Tabela 3: Resumo do perfil computacional relatado. C1–C7 reproduzem os tamanhos dos perfis validados e as etiquetas dominantes. A integração das atribuições de clusters em nível de caso e da tabela de contingência entre clusters e categorias confirma que o agrupamento não supervisionado capturou efetivamente as estruturas visuais correspondentes às sete categorias de referência humana. Clique aqui para baixar este arquivo.
Tabela 4: Perfis qualitativos das categorias de identidade feminina e pistas visuais relacionadas à classe. As contagens e porcentagens resumem as categorias de referência humana, enquanto a vestimenta, o espaço, os objetos, a postura e as relações sociais caracterizam os perfis visuais recorrentes associados a cada categoria. As interpretações relacionadas à classe representam leituras iconográficas de padrões pictóricos, e não medidas diretas do status social histórico. Clique aqui para baixar este arquivo.
Figura Suplementar 1: Matriz de confusão comparando rótulos preliminares de IA com categorias de referência humana adjudicadas para o corpus de 433 pinturas. As linhas representam as categorias de referência humana adjudicadas (rótulos reais) e as colunas representam as categorias preliminares geradas pelo CLIP (rótulos previstos). Os valores das células indicam o número de pinturas para cada combinação de rótulos de IA e humanos. As células diagonais representam correspondências exatas entre IA e humano, com a taxa de recuperação específica da categoria apresentada como uma porcentagem. As células fora da diagonal representam discrepâncias entre a classificação preliminar de IA e a categoria de referência humana adjudicada. A precisão geral de correspondência exata foi de 82,2% (356/433). Clique aqui para baixar este arquivo.
Tabela Suplementar 1: Comparação por caso entre rótulos preliminares de IA, categorias de referência humanas adjudicadas e atribuições de agrupamento UMAP. Cada linha representa uma das 433 pinturas chinesas de exportação da dinastia Qing incluídas no corpus analítico. A tabela apresenta o identificador estável da imagem QEP, rótulo preliminar do CLIP ViT-B/32, classificações independentes dos Codificadores Humanos 1 e 2, categoria de referência humana adjudicada, status de correspondência entre IA e humano, e atribuição do agrupamento UMAP. “Correspondência Exata” indica concordância entre o rótulo preliminar de IA e a categoria de referência humana adjudicada; “Discordância” indica desacordo. A categoria humana adjudicada serviu como classificação de referência para as análises de concordância entre IA e humano. Clique aqui para baixar este arquivo.
Tabela Suplementar 2: Tabela de contingência das categorias de referência humana e atribuições de agrupamentos computacionais. As linhas representam as sete categorias de referência humana adjudicadas, e as colunas representam os agrupamentos C1–C7 obtidos a partir da análise computacional de agrupamento. Os valores das células indicam o número de pinturas atribuídas a cada combinação categoria–agrupamento. O suporte total representa o número de pinturas em cada categoria de referência humana. A concentração de observações entre as combinações categoria–agrupamento fornece uma avaliação descritiva da correspondência entre os agrupamentos computacionais derivados independentemente e as categorias de referência humana adjudicadas. Clique aqui para baixar este arquivo.