Построение корпуса и описательный состав
На рисунке 1 представлен четырехпанельный обзор корпуса. На рисунке 1A показан процесс отбора записей: от 612 потенциальных кандидатов до 433 отобранных записей. На рисунке 1B приведены репрезентативные примеры медиафайлов и форматов. На рисунке 1C представлены данные по количеству записей для четырех временных интервалов, а на рисунке 1D обобщен состав корпуса по источникам и носителям. Поскольку временные интервалы охватывают разные периоды, данные показатели описывают состав сформированного корпуса и не должны интерпретироваться как исторические темпы производства.
Таблица 1 содержит сводные характеристики корпуса. Музейные коллекции составили 302 записи, цифровые архивы — 81, опубликованные каталоги — 50. Материалы были разделены на следующие категории: экспортная акварель (n = 176), живопись на сердцевине тростника (n = 112), лист экспортного альбома (n = 83), фигуративная живопись (n = 41) и прочие форматы (n = 21). Метаданные были классифицированы как полные (n = 288), частичные (n = 118) или минимальные (n = 27). Женские фигуры были разделены на центральные (n = 214), второстепенные (n = 102) или множественные (n = 117). Каждый блок классификации включал в себя все 433 записи.
Предварительные метки ИИ и эталонные категории, определенные человеком
В таблице 2 приведен обобщенный анализ согласованности между предварительными метками, сгенерированными ИИ, и эталонными категориями, определенными человеком, для 433 картин, в то время как в Дополнительной таблице 1 представлены соответствующие предварительные метки ИИ на уровне отдельных случаев, классификации кодировщиков, утвержденные эталонные категории, статус совпадения и назначения по кластерам. В целом, метки ИИ и эталонные метки совпали для 356 картин, что соответствует точности полного совпадения 82,2%. Полнота на уровне категорий рассчитывалась как доля точных совпадений ИИ и человека относительно эталонного количества случаев для каждой категории.
Полнота на уровне категорий варьировалась от 73,3% для сцен ритуалов/свадеб (33/45) до 88,4% для элиты/красоты (99/112). Полнота составила 84,7% для физического труда (61/72), 82,1% для выступлений (32/39), 79,7% для домашнего быта (51/64), 79,3% для слуг (46/58) и 79,1% для рынка (34/43). В целом, точное совпадение составило 356/433 (82,2%). Оценка пар на уровне конкретных случаев позволила рассчитать точность и F1-меры для всех семи категорий: точность варьировалась от 74,5% до 89,2%, а F1-меры — от 0,75 до 0,88. Подробная матрица ошибок с указанием ложноположительных результатов целевого класса и внедиагональных закономерностей представлена на Дополнительном рисунке 1.
Сводные данные о выявленных вычислительных паттернах
На рисунке 2 представлены четыре варианта отображения результатов вычислительного анализа. На рисунке 2A показана галерея из девяти картин с цветными масками сегментации, используемыми для визуальной локализации и анализа. На рисунке 2B представлен график рассеяния UMAP для полученных эмбеддингов изображений CLIP с контурами плотности, обозначенными C1–C7. На рисунке 2C приведено сравнение зарегистрированного количества картин (закрашенные точки) с полнотой охвата на уровне категорий (пустые круги), а на рисунке 2D представлена галерея репрезентативных картин, сгруппированных в соответствии с теми же метками. Валидация кластеров подтвердила правильность выбранного решения по кластеризации, для которого коэффициент силуэта составил 0.54, а индекс Дэвиса–Болдина — 0.92. Сопоставление полученных кластеров с человеческими категориями продемонстрировало высокую степень соответствия, при этом каждый выделенный кластер преимущественно соответствовал отдельной эталонной категории, определенной человеком.
Таблица 3 представляет семь зарегистрированных вычислительных профилей с размерами выборок, соответствующими семи категориям эталонных оценок человека. Таблица сопряженности «кластер по категориям» приведена в Дополнительной таблице 2 и показывает распределение семи установленных эталонных категорий человека по кластерам C1–C7. Анализ распределения этих конкретных случаев по кластерам показал, что вычислительная кластеризация позволила выявить визуальные структуры, которые тесно соответствуют семи эталонным категориям человека.
Ассоциации визуальных признаков и интерпретационный синтез
В таблице 4 обобщены качественные профили визуальных признаков, использованные для характеристики семи категорий, закодированных человеком. Эти профили описывают повторяющиеся связи между одеждой, пространственной обстановкой, позой, объектами и социальными отношениями. Они не были получены путем количественной перекрестной табуляции и, следовательно, не устанавливают правовой статус, этническую принадлежность, социальную причинность или восприятие аудиторией.
Рисунок 3 объединяет описательные количественные сводки закодированных визуальных признаков с интерпретационной концептуальной моделью. Рисунок 3A представляет семь согласованных категорий человеческих эталонов и объемы их выборок. Рисунок 3B показывает относительные связи между этими категориями и закодированными визуальными маркерами по пяти измерениям: одежда, пространственная обстановка, объекты, поза и социальные отношения. Отображаемая сила ассоциаций была рассчитана на основе аннотаций на уровне конкретных случаев в каждой категории человеческих эталонов. Рисунок 3C обобщает взаимосвязи между категориями человеческих эталонов, измерениями визуальной маркировки и архетипами классовой принадлежности, используя взвешенные потоки, полученные из закодированных наблюдений. Эти количественные зависимости характеризуют повторяющиеся репрезентативные паттерны в выбранных картинах и не должны интерпретироваться как оценки исторических демографических или социальных распределений. Рисунок 3D представляет концептуальную модель кросс-культурной интерпретации и должна пониматься как исторически обоснованная интерпретационная база, а не как эмпирически проверенный причинно-следственный путь.
Интегративная интерпретация визуальных паттернов
В исследуемом корпусе семь категорий женской идентичности характеризовались повторяющимися сочетаниями одежды, пространственного окружения, предметов, поз и социальных отношений. Эти сочетания предоставили описательные доказательства наличия устойчивых визуальных конвенций в отобранных картинах. Исторические интерпретации, касающиеся гендера, иерархии и кросс-культурного посредничества, оставались на уровне умозаключений.
В совокупности полученные результаты позволили выделить семь категорий женской идентичности, определенных человеком, и пять повторяющихся измерений, используемых для их характеристики: одежда, пространственная обстановка, объекты, поза и социальные отношения. Предварительные метки ИИ совпали с согласованными человеческими категориями для 356 из 433 картин (82,2%), при этом самый низкий показатель полноты (recall) на уровне категорий наблюдался для ритуальных/свадебных сцен (73,3%). Эти результаты подтвердили возможность описательной организации и сравнения корпуса данных. Метки ИИ и человека на уровне отдельных случаев позволили рассчитать точность (precision) и F1-меру на уровне категорий. Отдельно проведенный кластерный анализ выявил структуры, которые соответствовали семи категориям, определенным человеком. Тем не менее, эти вычислительные результаты характеризуют конвенции визуального представления, а не устанавливают причинно-следственные связи с исторической социальной реальностью или восприятием аудитории.
ДОСТУПНОСТЬ ДАННЫХ:
Данные, подтверждающие результаты настоящего исследования, включая метаданные, информацию об источниках и записи о скрининге, доступны через Zenodo по адресу https://doi.org/10.5281/zenodo.21130291.

Рисунок 1: Формирование корпуса и дескриптивный состав выборки из 433 картин. (A) Последовательный отбор 612 потенциальных изображений, в результате которого было отобрано 433 подходящих картины. Исключения составили картины, не относящиеся к периоду исследования или к традиции экспортной живописи (n = 85), современные репродукции, размытые изображения или некорректные сюжеты (n = 58), изображения без идентифицируемой женской фигуры или с недостаточным разрешением (n = 29), а также записи с недостаточными метаданными (n = 7). (B) Репрезентативные примеры пяти техник и форматов: экспортная акварель (40,6%, n = 176), живопись на бумаге из сердцевины растения (pith-paper) (25,9%, n = 112), лист экспортного альбома (19,2%, n = 83), фигуративная живопись (9,5%, n = 41) и другие экспортные форматы (4,8%, n = 21). (C) Распределение отобранных картин по четырем хронологическим интервалам. (D) Распределение источников коллекций (внешнее кольцо) и техник/форматов (внутреннее кольцо). Проценты рассчитаны на основе общей выборки (N = 433) и округлены до одного десятичного знака. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Представленные результаты сегментации, визуализация эмбеддингов, распределение кластеров, полнота категорий и репрезентативные картины. (A) Галерея из девяти картин с цветными наложенными масками сегментации, использованными для локализации фигур или визуальных элементов при анализе. (B) Диаграмма рассеяния UMAP для полученных эмбеддингов изображений CLIP с контурами плотности и метками C1–C7. (C) Представленное количество картин (закрашенные точки, верхняя ось) и полнота категорий (пустые круги, нижняя ось); полнота категории равна количеству точных совпадений, деленному на поддержку в человеческом эталоне. Доверительные интервалы или планки погрешностей не показаны. (D) Галерея репрезентативных картин, сгруппированных по меткам C1–C7, где изображения выбраны на основе их близости к центроидам соответствующих кластеров. Сокращения: AI = искусственный интеллект; CLIP = Contrastive Language–Image Pre-training; SAM = Segment Anything Model; UMAP = Uniform Manifold Approximation and Projection; C1–C7 = полученные метки 1–7. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Ассоциации визуальных подсказок и кросс-культурная интерпретационная модель. (A) Семь согласованных эталонных категорий женской идентичности и размеры их выборок в корпусе из 433 картин. (B) Тепловая карта ассоциаций, показывающая относительную силу связей между семью эталонными категориями и кодируемыми визуальными маркерами одежды, пространственного окружения, объектов, позы и социальных отношений. Сила ассоциаций была выведена из аннотаций на уровне конкретных случаев в каждой категории. (C) Аллювиальная диаграмма, обобщающая взвешенные связи между эталонными категориями, измерениями визуальной маркировки и архетипами классовой принадлежности на основе закодированных наблюдений. (D) Концептуальная модель кросс-культурной интерпретации, связывающая изображенную деятельность, выбор мастерской и рынка, пятимерное визуальное кодирование, повторяющиеся типы идентичности и потенциальные пути интерпретации. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Таблица 1: Характеристики корпуса и полнота метаданных (N = 433).Количество и процентное соотношение обобщены по шести отдельным блокам: временной интервал, источник, носитель или формат, полнота метаданных, изображение женских фигур и тип сцены. В каждом блоке в качестве знаменателя используется N = 433, и общая сумма составляет 433; проценты представляют собой доли корпуса внутри блока, округленные до одного десятичного знака. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 2: Предварительные метки ИИ и эталонные категории, определенные человеком (N = 433). Поддержка представляет собой количество картин, отнесенных к каждой эталонной категории. Точные совпадения указывают на картины, для которых предварительная метка, созданная ИИ, соответствовала эталонной категории. Полнота на уровне категории рассчитывается как количество точных совпадений, деленное на количество эталонных поддержек. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 3: Сводка полученных результатов вычислительного профилирования. C1–C7 воспроизводят проверенные размеры профилей и доминирующие метки. Интеграция назначений кластеров на уровне случаев и таблицы сопряженности «кластер по категориям» подтверждает, что ненаправляемая кластеризация эффективно выявила визуальные структуры, соответствующие семи категориям человеческого эталона. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 4: Качественные профили категорий женской идентичности и связанных с классом визуальных признаков. Количественные показатели и проценты обобщают категории человеческих эталонов, в то время как одежда, пространство, объекты, поза и социальные отношения характеризуют повторяющиеся визуальные профили, связанные с каждой категорией. Интерпретации, связанные с классом, представляют собой иконографический анализ живописных паттернов, а не прямые показатели исторического социального статуса. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительный рисунок 1: Матрица путаницы, сравнивающая предварительные метки ИИ с верифицированными эталонными категориями, определенными человеком, для корпуса из 433 картин. Строки представляют верифицированные эталонные категории (истинные метки), а столбцы — предварительные категории, созданные CLIP (предсказанные метки). Значения в ячейках указывают количество картин для каждой комбинации меток ИИ и человека. Диагональные ячейки представляют точные совпадения ИИ и человека, при этом соответствующая полнота на уровне категории указана в процентах. Внедиагональные ячейки представляют несоответствия между предварительной классификацией ИИ и верифицированной эталонной категорией. Общая точность точных совпадений составила 82,2% (356/433). Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 1: Послучайное сравнение предварительных меток ИИ, установленных эталонных категорий, определенных человеком, и назначений кластеров UMAP. Каждая строка представляет одну из 433 экспортных китайских картин эпохи Цин, включенных в аналитический корпус. В таблице указаны стабильный идентификатор изображения QEP, предварительная метка CLIP ViT-B/32, независимые классификации от Кодировщика-человека 1 и Кодировщика-человека 2, установленная эталонная категория, определенная человеком, статус соответствия ИИ и человека, а также назначение кластера UMAP. «Exact Match» (точное совпадение) означает согласие между предварительной меткой ИИ и установленной эталонной категорией; «Mismatch» (несоответствие) означает расхождение. Установленная категория, определенная человеком, служила эталонной классификацией для анализа согласованности данных ИИ и человека. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 2: Таблица сопряженности категорий, определенных экспертами, и результатов компьютерной кластеризации. Строки представляют семь согласованных эталонных категорий, определенных человеком, а столбцы — кластеры C1–C7, полученные в результате компьютерного кластерного анализа. Значения в ячейках указывают количество картин, отнесенных к каждой комбинации категория–кластер. Общая поддержка представляет количество картин в каждой эталонной категории. Концентрация наблюдений в комбинациях категория–кластер обеспечивает описательную оценку соответствия между независимо полученными компьютерными кластерами и согласованными эталонными категориями. Пожалуйста, нажмите здесь, чтобы скачать этот файл.