Logo do repositório
 
A carregar...
Miniatura
Publicação

Beam Diffusion Models for Decoding Multi-Shot Visual Sequences

Utilize este identificador para referenciar este registo.
Nome:Descrição:Tamanho:Formato: 
Fernandes_2025.pdf12.64 MBAdobe PDF Ver/Abrir

Resumo(s)

Images have become a powerful medium for communication, offering an intuitive way to convey concepts, instructions, and narratives. In domains such as education, design, and storytelling, sequences of images are often essential for expressing temporal or logical progressions. For instance, illustrating step-by-step guides or unfolding a visual story requires not only generating high-quality images but also maintaining coherence across the entire sequence. While Latent Diffusion Models (LDMs) have achieved impressive results in generating individual images, extending them to generate consistent and semantically aligned image sequences introduces significant challenges. A key limitation lies in their inability to retain visual and contextual continuity across multiple steps. Generated images may individually align with textual descriptions but fail to form a cohesive visual narrative, particularly when the semantics of one image depend on prior context. To overcome these challenges, we introduce a novel sequence decoding method inspired by beam search, designed to guide LDMs in generating coherent image sequences. At each generation step, the model samples multiple candidate images and evaluates them based on both their alignment with the current text and their consistency with prior visual context. A cross-attention mechanism further strengthens this process by integrating both local prompt information and cumulative visual history, allowing the model to reason over the evolving narrative. This iterative, contrastive selection process enables the model to explore a rich set of latent space candidates while pruning those that break narrative flow or introduce inconsistencies. The result is a visually and semantically consistent image sequence that better reflects the intended progression of instructions or events. We conduct both automatic and human evaluations to assess sequence coherence, align- ment with text, and visual clarity. Results demonstrate that our approach significantly improves sequence consistency over baseline LDMs, enabling more effective communi- cation of complex, multi-step concepts and improving the interpretability of generated content.
As imagens tornaram-se um meio poderoso de comunicação, oferecendo uma forma intuitiva de transmitir conceitos, instruções e narrativas. Em áreas como a educação, o design e a narração visual, as sequências de imagens são frequentemente essenciais para representar progressões temporais ou lógicas. Ilustrar guias passo a passo ou desenvolver uma história visual exige não só imagens de alta qualidade, mas também coerência ao longo de toda a sequência. Embora os Modelos de Difusão Latente (LDMs) tenham alcançado resultados impressionantes na geração de imagens isoladas, a sua aplicação à geração de sequências consistentes e semanticamente alinhadas apresenta desafios significativos. As imagens podem, individualmente, corresponder às descrições textuais, mas não formam necessariamente uma narrativa visual coesa, sobretudo quando a semântica de uma imagem depende do contexto anterior. Para superar estas limitações, propomos um novo método de descodificação sequencial inspirado na técnica de beam search, concebido para orientar os LDMs na geração de sequências de imagens coerentes. Em cada passo, o modelo avalia múltiplas imagens candidatas com base no seu alinhamento com o texto atual e na sua consistência com o contexto visual anterior. Um mecanismo de atenção cruzada reforça este processo, integrando a informação do prompt e o histórico visual acumulado. Este processo iterativo de seleção contrastiva permite explorar um espaço latente diversificado, descartando as opções que comprometem a continuidade da narrativa ou introduzem incoerências. O resultado é uma sequência visual e semanticamente coerente, que reflecte com maior fidelidade a progressão pretendida de instruções ou eventos. Realizámos avaliações automáticas e humanas para medir a coerência das sequências, o alinhamento com o texto e a clareza visual. Os resultados demonstram que a nossa abordagem melhora significativamente a consistência narrativa face aos modelos base, facilitando a comunicação de conceitos complexos.

Descrição

Palavras-chave

Latent Diffusion Models Visual Consistency Semantic Coherence Beam Search

Contexto Educativo

Citação

Projetos de investigação

Unidades organizacionais

Fascículo