Niniejsze badanie korzysta z anonimizowanych logów interakcji fan-przedmiot oraz anonimizowanych danych z kwestionariuszy zebranych wyłącznie do celów badawczych. Żadne informacje umożliwiające identyfikację osobistą nie były dostępne, przechowywane ani przetwarzane. Zgodnie z wytycznymi instytucjonalnymi i krajowymi, niniejsze badanie nie wymagało formalnej zgody komitetu etycznego ani indywidualnej zgody na udział w badaniu.
Przygotowanie danych i procedura eksperymentu
Krok 1. Przygotowanie danych i przetwarzanie wstępne
Przygotowanie danych i procedury eksperymentu zostały zaprojektowane w celu przekształcenia surowych logów zachowań i odpowiedzi ankietowych w ujednolicony, odtwarzalny zestaw eksperymentalny nadający się do trenowania i oceny modelu. Proces koncentruje się na czyszczeniu danych, anonimizowaniu, budowie funkcji, normalizacji i dostosowywaniu zapisów interakcji do zmiennych związanych z relacją. Surowe logi interakcji były najpierw filtrowane w celu usunięcia niekompletnych wpisów i zduplikowanych zdarzeń, aby zapewnić spójność danych. Identyfikatory fanów i identyfikatory przedmiotów były następnie anonimizowane za pomocą skrótu w celu ochrony prywatności użytkowników. Wiele form interakcji, w tym przeglądanie, klikanie, zakup i walidacja obecności, zostało przypisanych do sygnatur zwrotu biernego, a każda zaobserwowana interakcja była traktowana jako pozytywny przypadek. Zmienne związane z relacją - satysfakcja, zaufanie, zaangażowanie i wzajemność - zostały zebrane z odpowiedzi na kwestionariusz i powiązane z odpowiednimi identyfikatorami fanów. Wartości brakujące w kwestionariuszu zostały zaadresowane za pomocą średniej interpolacji w obrębie tej samej klasy członkostwa, aby zachować cechy na poziomie grupy. Ciągłe zmienne zostały znormalizowane za pomocą skalowania min-max w zakresie [0, 1], aby zapewnić porównywalność między zmiennymi. Po przetwarzaniu wstępnym sfinalizowany zestaw danych był przechowywany w zstrukturyzowanych plikach zawierających anonimizowane identyfikatory fanów, identyfikatory przedmiotów, znaczniki czasowe, tagi kontekstowe i znormalizowane zmienne związane z relacją, które były następnie używane spójnie w wszystkich ustawieniach eksperymentalnych.
Oczekiwany wynik:
W wyniku tego procesu wynikiem są oczyszczona tabela interakcji, znormalizowana tabela zmiennych związanych z relacją dostosowanych do identyfikatorów fanów oraz statystyczne podsumowanie liczby fanów, przedmiotów i interakcji w końcowym zestawie danych.
Krok 2. Podział na zbiór treningowy/walidacyjny/testowy i próbkowanie ujemne
Dane są chronologicznie dzielone na poziomie użytkownika, aby uniknąć wycieku informacji. Dla każdego fanów najnowsza interakcja jest zarezerwowana do testowania, druga najnowsza do walidacji, a pozostałe interakcje do trenowania. Negatywne próbki są generowane przez jednolite pobieranie nieinterakcyjnych przedmiotów z zestawu przedmiotów. Dla każdej pozytywnej interakcji losowane jest stałe liczby próbek ujemnych (stosunek próbkowania ujemnego = 1:5) podczas trenowania. Ta sama konstrukcja zestawu kandydatów jest zastosowana spójnie we wszystkich modelach.
Oczekiwany wynik:
W wyniku tego kroku wynikami są chronologicznie podzielone zestawy treningowe, walidacyjne i testowe wraz z wstępnie wygenerowanymi listami ujemnych próbek przygotowanymi zgodnie ze wskazanym współczynnikiem próbkowania.
Krok 3. Środowisko oprogramowania i implementacja
Wszystkie eksperymenty są implementowane w języku Python. Trenowanie i ocena modelu są przeprowadzane przy użyciu PyTorch (wersja ≥ 1.12). Optymalizacja hiperparametrów Bayesa jest wykonywana za pomocą Optuna (wersja ≥ 3.0). Skrypty treningowe są wykonywane na stacji roboczej wyposażonej w pojedynczą kartę graficzną NVIDIA (≥ 8 GB pamięci). Pliki konfiguracyjne określają ścieżki zestawów danych, parametry modelu i ustawienia optymalizacji, aby zapewnić możliwość odtworzenia.
Krok 4. Budowa modelu i określenie parametrów
Model MLP-PA składa się z warstwy osadzenia, wielowarstwowego perceptronu, kanału uwagi relacji i modułu fuzji uwagi piramidy. Kluczowe parametry są ustawione następująco: wymiar osadzenia = 32; ukryte warstwy MLP = [64, 32]; funkcja aktywacji = ReLU; optymalizator = Adam z wskaźnikiem uczenia się 0,001 i spadkiem wagi 1e-5. Moduł uwagi piramidy używa trzech skal poolingu z rozmiarami jądra {1, 2, 4} i skoku równym rozmiarowi jądra. Współczynnik redukcji uwagi jest ustawiony na 4. Dropout z współczynnikiem 0,3 jest stosowany w celu zapobiegania przetrenowaniu. Wcześniejsze zatrzymanie jest wyzwalane, jeśli walidacja NDCG@10 nie poprawia się przez 10 kolejnych epok.
Krok 5. Trenowanie i optymalizacja hiperparametrów
Model jest trenowany przy użyciu straty Bayesian Personalized Ranking (BPR) par. Podczas trenowania monitorowana jest wydajność walidacji na końcu każdej epoki. Optymalizacja hiperparametrów Bayesa przeszukije wskaźnik uczenia się, rozmiar osadzenia, wskaźnik odrzucania, stosunek próbkowania ujemnego i parametry związane z uwagą. Celem optymalizacji jest walidacja NDCG@10. Każda kandydacka konfigura