$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
W obszarach widzenia komputerowego i przetwarzania języka naturalnego tworzenie napisów do obrazów jest zadaniem kluczowy, które ekstrahuje opis obrazu i przedstawionych na nim czynności. Intencją modelu jest zrozumienie obrazów i przetłumaczenie informacji na znaczące zdania lub napisy1. Cały proces składa się z dwóch istotnych faz: pierwsza to ekstrakcja cech, gdzie wykorzystywany jest model CNN; druga to opis obrazu za pomocą RNN & pomiędzy nimi ResNet jest używany do analizy semantycznej, generowania sekwencji i mechanizmu uwagi. ResNet różni się znacznie od metod opartych na szablonach lub modułów opartych na DenseNet, ponieważ wykorzystuje połączenia pomijania, które zmniejszają czas wykonania, poprawiając jednocześnie wydajność. Istnieje wiele zastosowań tworzenia napisów do obrazów, które obejmują pomaganie osobom niewidomym, zwiększanie efektywności platform społecznościowych, optymalizację wyszukiwarek obrazowych, sztuczna inteligencja oparta na obrazach (AI) i wiele innych2.
W widzeniu komputerowym rozpoznawanie scen to proces identyfikacji i klasyfikacji ogólnego kontekstu lub środowiska obrazu, takiego jak plaża, panorama miasta, las lub biuro. W przeciwieństwie do rozpoznawania obiektów, które koncentrują się na pojedynczych przedmiotach, rozpoznawanie scen uwzględnia tekstury, ułożenia przestrzenne i relacje obiektów, aby zrozumieć szerszy kontekst. Wykorzystuje CNN i Vision Transformers, głębokie modele uczenia się szkolowane na dużych zbiorach danych, takich jak Places365 i ImageNet. Zastosowania obejmują bezpieczeństwo, rzeczywistość rozszerzoną i wirtualną (AR i VR) dla immersyjnych doświadczeń, robotykę dla świadomości środowiskowej i autonomiczne pojazdy dla nawigacji. Pomimo postępu, problemy takie jak zmieniające się punkty widzenia, zasłony i zmieniające się oświetlenie sprawiają, że rozpoznawanie scen jest popularnym tematem w badaniach nad widzeniem komputerowym i sztuczną inteligencją. Innym fundamentalnym problemem w widzeniu komputerowym jest rozpoznawanie scen.
EnsCaption, dwójka generującego sieci adwersarnych, została zaproponowana, aby poprawić technikę zespołowego generowania i pobierania3. Ten układ umożliwia harmonijne, prokreacyjne metody tworzenia napisów do obrazów, które generują napisy zgodne z istniejącymi celami. Podczas gdy technika pobierania używa modelu opartego na pozycji lub ocenie, aby wybrać najlepszy model do dokładniejszego wyciągania informacji niż inne w zapytaniu opartym na obrazie. Zaproponowano mapowanie obrazów na “przestrzeń znaczeń” przy użyciu komponentów wizualnych, takich jak obiekty, działania i sceny, które następnie zostały dostosowane do odpowiednich szablonów werbalnych4. Korzystając z korelacji i cech znalezionych na obrazach, podejście konstruuje frazy. Zdania wyrażają informacje w sposób bogaty, skoncentrowany i subtelny. Generowanie napisów oparte na szablonach zostało ulepszone poprzez włączenie wiedzy powszechnej, aby poprawić zrozumienie semantyczne5. Ta technika rozszerzyła zasięg szablonu poza bezpośrednie cechy obrazu, aby obejmować wnioskowane skojarzenia. Ta praca wykorzystuje istniejący zbiór danych do wykrywania obiektów, aby wyodrębnić 16 000 powszechnych stwierdzeń dotyczących każdej zaznaczonej kategorii. Dodatkowo generalizacja została osiągnięta za pomocą WordNet, umożliwiając indukcję dużej liczby faktów dotyczących wcześniej niespotykanych obiektów6. Oferuje przegląd uporządkowanej taksonomii głębokich technik uczenia się do tworzenia napisów do obrazów, w tym tematy takie jak mechanizmy uwagi, taktyki uczenia się przez wzmacnianie i ramy enkoder-dekoder. Obok rozwiązywania problemów takich jak halucynacje obiektów i zrozumienie kontekstowe, omawia również często używane zbiory danych i kryteria oceny. Autorzy wskazują obszary dalszych badań, takie jak ulepszanie techniki pre-trenowania wizji i języka oraz zmniejszenie uprzedzenia w zbiorach danych. Zaproponowano podejście do analizy semantycznej oparte na konwolucyjnych sieciach neuronowych i rekurencyjnych sieciach neuronowych do zadań tworzenia napisów do obrazów7. Tworzenie napisów do obrazów jest jednym z najbardziej znanych zastosowań, pozwalającym komputerom tworzyć sugestywne frazy, które streszczają obraz. Aby zapewnić wysokiej klasy, znaczące semantyczne opisy, procedura ta obejmuje więcej niż tylko identyfikację obiektów i scen; wiąże się również z badaniem ich stanów, cech i interakcji. Pomimo wrodzonej złożoności i trudności w tworzeniu napisów do obrazów, naukowcy osiągnęli imponujące postępy w tej dziedzinie. Trzy główne techniki tworzenia napisów do obrazów oparte na głębokich sieciach neuronowych omówione w tej pracy to oparte na CNN-RNN, oparte na CNN-CNN i ramy uczenia się przez wzmacnianie. Wprowadzono uczący się model końcowo-końcowy do tworzenia napisów do obrazów, integrując widzenie komputerowe i przetwarzanie języka naturalnego w celu generowania spójnych opisów obrazów8. Aby stworzyć napis, używa on ramki enkoder-dekoder, w której LSTM dekoduje obraz na ciąg słów po zakodowaniu go przez wstępnie przeszkolony CNN w wektor cech. Pomimo jego wad,