Logo do repositório
 
A carregar...
Miniatura
Publicação

Text and Image Automatic Generation Applied to Digital Signage

Utilize este identificador para referenciar este registo.
Nome:Descrição:Tamanho:Formato: 
Raimundo_2025.pdf6.08 MBAdobe PDF Ver/Abrir

Resumo(s)

This thesis tackles the challenge of automating content generation for digital signage by leveraging artificial intelligence techniques. It introduces contentAI, a modular and scalable platform designed to integrate seamlessly with existing digital signage infrastructures, enabling the automatic creation of context-aware textual and visual content. The proposed solution strategically combines state-of-the-art generative models, in- cluding large language models such as LLaMA 2 for text and diffusion-based models like FLUX and Stable Diffusion for image generation. These models were selected for their strong performance in terms of language fluency and visual realism, as well as their suitability for domain-specific fine-tuning. While fine-tuning improved the text model’s performance, the fine-tuned version of Stable Diffusion failed to produce consistently better visuals. Instead, FLUX was chosen as the final image model due to its superior perceptual quality, as demonstrated both quantitatively and through human evaluation. A Human-in-the-Loop mechanism was integrated into the system to continuously collect user feedback via a REST API, enabling iterative improvement of the models. This approach allows the platform to evolve dynamically, aligning its outputs with audience expectations and commercial objectives. A key architectural decision was the separation of text and image generation processes, driven by practical limitations in positioning and styling embedded text. This separation ensures greater flexibility for post-processing and real-time customization, which are critical requirements in digital signage contexts. The experimental results confirm that the domain-specific adaptation of generative models leads to content that is more persuasive, concise and visually appealing. The integration of Human-in-the-Loop feedback makes contentAI a viable and forward-looking solution for dynamic, real-time content creation in commercial environments. This work lays the groundwork for future research in multi-modal generative artificial intelligence systems, with potential applications in advertising, retail and public communication.
Esta dissertação aborda o desafio da geração automática de conteúdos para sinalização digital, através da utilização de inteligência artificial. É apresentada a plataforma contentAI, um sistema modular e escalável, concebido para se integrar facilmente com infraestruturas de sinalização digital já existentes, permitindo a criação automática de conteúdos textuais e visuais adaptados ao contexto. A solução proposta combina modelos generativos de última geração, incluindo mo- delos de linguagem de grandes dimensões, como o LLaMA 2 para geração de texto e modelos de difusão como o FLUX e o Stable Diffusion para geração de imagem. Estes modelos foram selecionados com base na sua qualidade na geração de texto e imagem, bem como na capacidade de adaptação a domínios específicos. Embora o fine-tuning tenha melhorado significativamente o desempenho do modelo de texto, a versão afinada do Stable Diffusion não produziu melhorias visuais consistentes. Assim, o modelo FLUX foi escolhido como solução final para imagem dada a sua superior qualidade perceptiva, comprovada tanto por métricas quantitativas como por avaliação humana. Foi integrado um mecanismo de Human-in-the-Loop que recolhe feedback dos uti- lizadores através de uma API REST, permitindo a melhoria contínua dos modelos. Esta abordagem permite que a plataforma evolua dinamicamente, ajustando os seus resultados às expectativas dos utilizadores e aos objetivos comerciais. Uma decisão arquitetónica fundamental foi a separação entre os processos de geração de texto e imagem, motivada por limitações práticas na colocação e personalização do texto embutido. Esta separação assegura uma maior flexibilidade no pós-processamento e na personalização, aspetos que são cruciais em ambientes de sinalização digital. Os resultados experimentais confirmam que a adaptação dos modelos generativos ao domínio específico da sinalização conduz à criação de conteúdos mais persuasivos, concisos e visualmente apelativos. A integração de feedback humano e a flexibilidade na geração de conteúdos posicionam a contentAI como uma solução viável e inovadora para a criação dinâmica de conteúdos em tempo real com aplicabilidade em ambientes comerciais. Este trabalho estabelece as bases para investigação futura em sistemas generativos com potencial de aplicação em publicidade, retalho e comunicação pública.

Descrição

Palavras-chave

Natural Language Processing Large Language Models Diffusion Models Human in the Loop Content Generation Digital Signage

Contexto Educativo

Citação

Projetos de investigação

Unidades organizacionais

Fascículo

Editora

Licença CC