É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de investigação

Geração de Legendas de Imagens Usando Abordagens de Deep Learning

177 visualizações

⸱

DOI:

10.3791/71528

⸱

12 de junho de 2026

Neste artigo

Resumo

Este protocolo utiliza CNNs, RNNs e ResNets para legendagem de imagens, extraindo descrições das atividades, pessoas, objetos e outros elementos das imagens. Ele foi justificado com as pontuações das métricas BLEU, CIDEr, METEOR e ROUGE.

Resumo

A geração de legendas de imagem é um esforço para fornecer uma descrição textual significativa que envolva uma imagem. As informações extraídas são relevantes para as atividades presentes nas imagens. A ResNet (Rede Residual) é bem conhecida por sua capacidade de classificar imagens, tendo desenvolvido representações hierárquicas profundas. A intenção deste artigo é usar o ResNet com vários filtros inteligentes para classificar imagens de forma mais profunda, permitindo a geração de descrições genuínas e significativas, altamente precisas em relação às legendas de referência. Aqui, o trabalho utiliza uma técnica de filtragem inteligente para aprimorar imagens, uma CNN para codificar características, treinamento de modelos e, posteriormente, uma RNN (Rede Neural Recorrente) para decodificar as características. O ResNet é um modelo muito eficaz para tarefas de visão computacional, especialmente classificação de objetos e análise semântica. A ResNet é bem conhecida por conexões residuais, que também são conhecidas como conexões de pular que resolvem o problema do gradiente nulo, que é um problema crucial no aprendizado profundo. Aqui, o benchmark MSCOCO (Microsoft Common Object in Context) é usado para treinar o modelo, que é um grande conjunto de dados com anotações de referência úteis para várias tarefas de visão computacional. O ResNet ajuda a aprimorar a capacidade de generalização, o que é particularmente útil para imagens diversas. De acordo com os resultados obtidos, as pontuações BLUE são B1: 0,579, B2: 0,404, B3: 0,279, B4: 0,191; METEORO: 0,195; ROUGE: 0,396; e CIDEr: 0,6.

Introdução

Nos campos de visão computacional e processamento de linguagem natural, a legendagem de imagens é uma tarefa crucial que extrai uma descrição da imagem e das ações que ela retrata. A intenção do modelo é compreender imagens e traduzir as informações em frases ou legendassignificativas 1. Todo o procedimento consiste em duas fases significativas: a primeira é a extração de características, onde é usado um modelo CNN; a segunda é a descrição da imagem usando um RNN e, entre elas, o ResNet é usado para análise semântica, geração de sequências e um mecanismo de atenção. O ResNet é muito diferente dos métodos baseados em templates ou dos módulos bas....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

A implementação foi feita com o modelo principal, que é o ResNet-152, junto com um codificador como CNN, um decodificador como RNN e os recursos da Tabela de Materiais.

ResNet-152
O ResNet é considerado a espinha dorsal para extrair recursos de forma mais eficiente na legenda de imagens. O ResNet proporcionou melhor desempenho de treinamento do que outros modelos, pois resolveu o problema do gradiente nulo e o resolveu de forma eficiente. Vários objetos podem aparecer nas imagens, e o modelo precisa entender suas relações para uma legenda melhor. Por isso, pode ser considerado uma extração hierárquica de....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Especificações de software e ambiente
Python 3.10 foi a principal linguagem de programação usada para os experimentos. O Visual Studio Code foi usado para configurar o ambiente de desenvolvimento (VS Code). Bibliotecas importantes usadas nessa pesquisa incluem Pickle para serialização de dados, multiprocessamento para processamento paralelo, glob para manuseio de arquivos e PyTorch para desenvolvimento de modelos de aprendizado profundo. A configuração de hardware incluía 256 GB de armazenamento, 8 GB.......

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

No campo da inteligência artificial, legendar imagens é uma tarefa difícil. Legendas de imagens têm sido objeto de inúmeros estudos, e legendas agudas ou precisas ainda exigem o mais alto nível de precisão. Muitas técnicas de aprendizado de máquina podem ser usadas para alcançar o objetivo da legenda de imagens, e inúmeros estudos já utilizaram CNN, RNN e ResNet-152. No entanto, é necessário maior precisão e redução do tempo de processamento. O sistema proposto é construído usando a CNN .......

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores afirmam que não possuem interesses financeiros ou relacionamentos pessoais concorrentes que possam ter influenciado o trabalho relatado neste artigo.

Agradecimentos

Agradecemos aos criadores dos conjuntos de dados MSCOCO por fornecerem os parâmetros utilizados neste estudo. Os autores afirmam que nenhum financiamento externo foi recebido para este estudo.

....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
AMD Ryzen 5000 seriesAMD100-100000059WOFA série AMD Ryzen 5000 é uma linha de processadores de alto desempenho desenvolvida pela AMD, baseada na arquitetura Zen 3. Esses processadores são amplamente utilizados em desktops e laptops para computação de uso geral e tarefas exigentes, como processamento de dados e fluxos de trabalho de aprendizado de máquina.
GPUNVIDIA 4.71933E+12A NVIDIA GeForce GTX é uma série de unidades de processamento gráfico (GPUs) desenvolvidas pela NVIDIA, amplamente utilizadas para jogos, bem como para tarefas de computação de uso geral, como aprendizado profundo e processamento de imagens.
Intel Core i5IntelBX8071514400FIntel Core i5 é uma série de processadores de médio alcance desenvolvida pela Intel, amplamente utilizada em computadores pessoais para tarefas de uso geral e computacionais.
Python 3.10Python Software FoundationPEP 619Python é uma linguagem de programação interpretada de alto nível amplamente utilizada em computação científica, análise de dados e aprendizado de máquina. É conhecida por sua simplicidade, legibilidade e extenso ecossistema de bibliotecas.
PyTorchFacebook26.03-py3PyTorch é uma estrutura de aprendizado profundo de código aberto desenvolvida pela Meta Platforms (anteriormente Facebook), amplamente utilizada para construção e treinamento de redes neurais em pesquisa e indústria.
Visual Studio CodeMicrosoftNoneVisual Studio Code (VS Code) é um editor de código de código aberto e leve desenvolvido pela Microsoft. É amplamente utilizado para desenvolvimento de software, incluindo projetos de aprendizado de máquina e aprendizado profundo.
Windows 11MicrosoftKB5083631Windows 11 é um sistema operacional desenvolvido pela Microsoft, amplamente utilizado para computação geral, bem como para tarefas de desenvolvimento de software e aprendizado de máquina.

Reimpressões e permissões

Etiquetas

Modelo ResNetFiltragem InteligenteCodificação de CaracterísticasCodificador CNNDecodificador RNNClassificação de ObjetosAnálise SemânticaConjunto de Dados MSCOCO