| Nome: | Descrição: | Tamanho: | Formato: | |
|---|---|---|---|---|
| 12.64 MB | Adobe PDF |
Autores
Orientador(es)
Resumo(s)
Images have become a powerful medium for communication, offering an intuitive way to
convey concepts, instructions, and narratives. In domains such as education, design, and
storytelling, sequences of images are often essential for expressing temporal or logical
progressions. For instance, illustrating step-by-step guides or unfolding a visual story
requires not only generating high-quality images but also maintaining coherence across the
entire sequence. While Latent Diffusion Models (LDMs) have achieved impressive results
in generating individual images, extending them to generate consistent and semantically
aligned image sequences introduces significant challenges. A key limitation lies in their
inability to retain visual and contextual continuity across multiple steps. Generated
images may individually align with textual descriptions but fail to form a cohesive visual
narrative, particularly when the semantics of one image depend on prior context.
To overcome these challenges, we introduce a novel sequence decoding method
inspired by beam search, designed to guide LDMs in generating coherent image sequences.
At each generation step, the model samples multiple candidate images and evaluates them
based on both their alignment with the current text and their consistency with prior visual
context. A cross-attention mechanism further strengthens this process by integrating both
local prompt information and cumulative visual history, allowing the model to reason
over the evolving narrative. This iterative, contrastive selection process enables the model
to explore a rich set of latent space candidates while pruning those that break narrative
flow or introduce inconsistencies. The result is a visually and semantically consistent
image sequence that better reflects the intended progression of instructions or events.
We conduct both automatic and human evaluations to assess sequence coherence, align-
ment with text, and visual clarity. Results demonstrate that our approach significantly
improves sequence consistency over baseline LDMs, enabling more effective communi-
cation of complex, multi-step concepts and improving the interpretability of generated
content.
As imagens tornaram-se um meio poderoso de comunicação, oferecendo uma forma intuitiva de transmitir conceitos, instruções e narrativas. Em áreas como a educação, o design e a narração visual, as sequências de imagens são frequentemente essenciais para representar progressões temporais ou lógicas. Ilustrar guias passo a passo ou desenvolver uma história visual exige não só imagens de alta qualidade, mas também coerência ao longo de toda a sequência. Embora os Modelos de Difusão Latente (LDMs) tenham alcançado resultados impressionantes na geração de imagens isoladas, a sua aplicação à geração de sequências consistentes e semanticamente alinhadas apresenta desafios significativos. As imagens podem, individualmente, corresponder às descrições textuais, mas não formam necessariamente uma narrativa visual coesa, sobretudo quando a semântica de uma imagem depende do contexto anterior. Para superar estas limitações, propomos um novo método de descodificação sequencial inspirado na técnica de beam search, concebido para orientar os LDMs na geração de sequências de imagens coerentes. Em cada passo, o modelo avalia múltiplas imagens candidatas com base no seu alinhamento com o texto atual e na sua consistência com o contexto visual anterior. Um mecanismo de atenção cruzada reforça este processo, integrando a informação do prompt e o histórico visual acumulado. Este processo iterativo de seleção contrastiva permite explorar um espaço latente diversificado, descartando as opções que comprometem a continuidade da narrativa ou introduzem incoerências. O resultado é uma sequência visual e semanticamente coerente, que reflecte com maior fidelidade a progressão pretendida de instruções ou eventos. Realizámos avaliações automáticas e humanas para medir a coerência das sequências, o alinhamento com o texto e a clareza visual. Os resultados demonstram que a nossa abordagem melhora significativamente a consistência narrativa face aos modelos base, facilitando a comunicação de conceitos complexos.
As imagens tornaram-se um meio poderoso de comunicação, oferecendo uma forma intuitiva de transmitir conceitos, instruções e narrativas. Em áreas como a educação, o design e a narração visual, as sequências de imagens são frequentemente essenciais para representar progressões temporais ou lógicas. Ilustrar guias passo a passo ou desenvolver uma história visual exige não só imagens de alta qualidade, mas também coerência ao longo de toda a sequência. Embora os Modelos de Difusão Latente (LDMs) tenham alcançado resultados impressionantes na geração de imagens isoladas, a sua aplicação à geração de sequências consistentes e semanticamente alinhadas apresenta desafios significativos. As imagens podem, individualmente, corresponder às descrições textuais, mas não formam necessariamente uma narrativa visual coesa, sobretudo quando a semântica de uma imagem depende do contexto anterior. Para superar estas limitações, propomos um novo método de descodificação sequencial inspirado na técnica de beam search, concebido para orientar os LDMs na geração de sequências de imagens coerentes. Em cada passo, o modelo avalia múltiplas imagens candidatas com base no seu alinhamento com o texto atual e na sua consistência com o contexto visual anterior. Um mecanismo de atenção cruzada reforça este processo, integrando a informação do prompt e o histórico visual acumulado. Este processo iterativo de seleção contrastiva permite explorar um espaço latente diversificado, descartando as opções que comprometem a continuidade da narrativa ou introduzem incoerências. O resultado é uma sequência visual e semanticamente coerente, que reflecte com maior fidelidade a progressão pretendida de instruções ou eventos. Realizámos avaliações automáticas e humanas para medir a coerência das sequências, o alinhamento com o texto e a clareza visual. Os resultados demonstram que a nossa abordagem melhora significativamente a consistência narrativa face aos modelos base, facilitando a comunicação de conceitos complexos.
Descrição
Palavras-chave
Latent Diffusion Models Visual Consistency Semantic Coherence Beam Search
