Logo do repositório
 
A carregar...
Miniatura
Publicação

Minimum Viable Dataset: Towards Data-efficient Machine Learning

Utilize este identificador para referenciar este registo.
Nome:Descrição:Tamanho:Formato: 
Capelo_2025.pdf13.15 MBAdobe PDF Ver/Abrir

Resumo(s)

Healthcare generates petabytes of data each year, creating unique avenues for scientific progress, but also significant computational challenges for training Deep Learning models. Although performance has long followed the “scale-is-everything” paradigm, where larger datasets and models yield better results, emerging evidence shows that carefully curated smaller datasets can achieve comparable performance far more efficiently. This dissertation investigates how to compress large collections of healthcare data into smaller, efficient datasets that preserve task-relevant knowledge while easing com- putational demands. To this end, it introduces the Minimum Viable Dataset (MVD), a minimal yet highly informative subset of real data, optionally enriched with synthetic samples, designed to retain essential knowledge while substantially reducing training requirements. Previous work has focused on developing and benchmarking data summa- rization methods using performance metrics alone, which often overlook dataset diversity and representativeness. This dissertation takes a complementary approach, using data quality metrics to guide both the creation and evaluation of summarization methods, providing a more principled path toward efficient and reliable model training. The main contributions are threefold: (1) the formalization of the Minimum Viable Dataset (MVD) concept and its taxonomy; (2) a systematic study of data quality metrics for evaluating subsets; and (3) a hybrid strategy that leverages coreset-informed subsets to initialize dataset distillation methods. These approaches were primarily developed and validated on a dataset of hematological cell images, and further assessed across additional standardized biomedical image collections. The results show that MVDs provide a reproducible framework for efficient dataset construction and yield design directions for future dataset summarization methods. By retaining essential knowledge while reducing training requirements, MVDs are positioned as a step toward scalable and resource-conscious AI in healthcare, with particular relevance for low- and middle-income countries where computational resources are limited.
O setor da saúde gera petabytes de dados todos os anos, criando oportunidades para progresso científico, mas também desafios computacionais no treino de modelos de apren- dizagem profunda. Embora o desempenho dos modelos tenha seguido, por muito tempo, o paradigma de que o «tamanho é tudo», evidências recentes mostram que conjuntos de dados menores e cuidadosamente selecionados podem atingir desempenho comparável. Esta dissertação investiga como comprimir grandes coleções de dados de saúde em con- juntos menores e eficientes. Para tal, é introduzido o conceito de Minimum Viable Dataset (MVD), um subconjunto mínimo, mas altamente informativo, de dados reais, opcional- mente enriquecido com amostras sintéticas, concebido para reter conhecimento essencial e reduzir significativamente os requisitos de treino. Trabalhos anteriores concentram-se no desenvolvimento e avaliação de métodos de sumarização exclusivamente com base no desempenho. Esta dissertação adota uma abordagem complementar, recorrendo a métricas de qualidade dos dados na criação e avaliação de métodos de sumarização, oferecendo um método mais fundamentado para o treino eficiente e fiável de modelos. As principais contribuições são: (1) a formalização do conceito de MVD e a sua taxonomia; (2) um estudo sistemático das métricas de qualidade de dados para avaliação de subconjuntos; e (3) uma abordagem híbrida que utiliza subconjuntos estratégicos na inicialização de métodos de distilação de dados. Estas abordagens foram desenvolvidas e validadas principalmente num conjunto de imagens de células hematológicas e avaliadas posteriormente em conjuntos adicionais de dados biomédicos. Os resultados mostram que os MVDs fornecem um método reproduzível para a cons- trução eficiente de conjuntos de dados e orientações para futuros métodos de sumarização. Ao preservarem conhecimento essencial e reduzirem os requisitos de treino, os MVDs mostram-se promissores para soluções de Inteligência Artificial escaláveis e conscientes dos recursos na saúde, com especial relevância para países de baixo e médio rendimento, onde os recursos computacionais são limitados.

Descrição

Palavras-chave

Minimum Viable Dataset (MVD) Data-Centric AI Coreset Selection Dataset Distillation Data-efficient Machine Learning Artificial Intelligence in Healthcare

Contexto Educativo

Citação

Projetos de investigação

Unidades organizacionais

Fascículo