Logo do repositório
 
A carregar...
Miniatura
Publicação

Data Mining Project to improve Soft Skills Acquisition and Engineering Education. Evaluation of CTCT Course Results

Utilize este identificador para referenciar este registo.
Nome:Descrição:Tamanho:Formato: 
Dias_2024.pdf8.81 MBAdobe PDF Ver/Abrir

Resumo(s)

This dissertation explores the potential of educational data mining (EDM) to enhance the engineering curriculum, specifically within the Transversal Skills in Science and Technology mandatory program for first-year students at NOVA School of Science and Technology. It employs machine learning (ML) algorithms, including classification and re- gression, to analyze student performance data. Various research concerns were addressed, such as the impact of gender on course selection, the relationships between different assessment points, performance variability, and the predictive power of early-course out- comes. Some of these questions were resolved through statistical analysis, while others leveraged machine learning models. Key findings reveal a distinct gender-based difference in course selection, with male students typically opting for engineering fields like mechanical, electrical, and informatics, while female students gravitated towards biology and chemistry-related courses. Addi- tionally, activity points proved to be the most reliable predictor of final grades, whereas self and peer-assessment points exhibited lower correlations, indicating a shift in the weighting of these points in the evaluation system. A detailed analysis of demographic and performance data showed that male students had a higher rate of failure than female students, despite enrolling in larger numbers. While the clustering analysis identified potential trends in early-course data, it did not provide substantial actionable insights in isolation. However, its integration into predictive models could offer valuable contributions in forecasting student performance in future research. The machine learning models demonstrated the effectiveness of early-course data in predicting final grades, with Random Forest and CatBoost models consistently outperforming others. The dissertation emphasizes the technical capabilities of platforms such as Google Colaboratory, highlighting its cost-effectiveness and efficiency for conducting large-scale educational data analysis using mid-range Graphical Processing Units (GPUs). Moreover, the research underscores the importance of standardizing data collection through Learning Management Systems (LMS), specifically Moodle, which can enhance the precision and efficiency of educational data analysis. The research concludes with recommendations for future work, including the develop- ment of Moodle plugins to track student performance in real-time, further exploration of machine learning models for grade prediction, and an in-depth analysis of computational resource costs. This study contributes to the field of Educational Data Mining (EDM) and provides practical insights for improving Science, Technology, Engineering, and Mathe- matics (STEM) education through data-driven strategies and the integration of Artificial Intelligence (AI).
Esta dissertação explora as potencialidades da extração de dados educacionais (Educa- tional Data Mining, EDM) na melhoria do ensino em engenharia, com foco específico na disciplina obrigatória para alunos do primeiro ano da Faculdade de Ciências e Tecnologia da Universidade Nova de Lisboa: Competências Transversais em Ciência e Tecnologia, mais conhecida como CTCT. São utilizados algoritmos de aprendizagem automática (Ma- chine Learning, ML), incluindo técnicas de clustering (agregação), classificação e regressão, para analisar dados de desempenho dos alunos e são abordadas diversas questões de in- vestigação relacionadas com a população de alunos de CTCT e a sua evolução no contexto desta disciplina. Estas questões incluem aspetos como se a seleção do curso por parte do aluno tem relação com o sexo do mesmo, bem como o estudo de correlação entre os diversos pontos utilizados na avaliação dos alunos (resultados de atividades, pontos de participação e pontos de auto e heteroavaliação). Também se estuda a variabilidade do desempenho dos alunos em função de diversos fatores e tenta-se aferir o valor preditivo dos resultados das primeiras duas semanas da disciplina, resolvidas em parte com testes estatísticos e em parte com modelos de ML. As principais conclusões mostram uma clara diferença de género na seleção de cursos, com os estudantes do sexo masculino a escolherem predominantemente cursos de enge- nharia, como mecânica, elétrica e informática, enquanto as estudantes do sexo feminino optam por cursos mais orientados para a biologia e a química. Além disso, os pontos de atividade foram identificados como o indicador mais confiável das notas finais (como se esperava), enquanto os pontos de auto e heteroavaliação apresentaram diferentes níveis de correlação, sugerindo uma evolução no peso deste tipo de pontos ao longo da história da disciplina. A análise de clustering identificou possíveis tendências nos dados iniciais dos cursos, embora, isoladamente, não tenha fornecido informações suficientemente con- clusivas. No entanto, a sua integração em modelos preditivos pode oferecer contribuições valiosas para prever o desempenho dos estudantes em pesquisas futuras. Este estudo destaca as capacidades tecnológicas de plataformas como o Google Co- laboratory, que oferecem uma solução eficiente e economicamente viável para análises educacionais em larga escala, utilizando Unidades de Processamento Gráfico (Graphics Processing Units, GPUs) de gama intermédia. Além disso, realça a importância de padro- nizar a recolha de dados através da utilização de Sistemas de Gestão de Aprendizagem (Learning Management Systems, LMS), em particular o Moodle, que tem o potencial de melhorar significativamente a precisão e a eficácia da análise de dados educacionais. Esta pesquisa oferece recomendações para trabalhos futuros, incluindo o desenvolvi- mento de plug-ins para o Moodle que permitam acompanhar em tempo real o desempenho dos alunos, a investigação aprofundada de modelos de aprendizagem automática para a previsão de notas finais, e uma análise detalhada dos custos associados ao uso de recursos computacionais de uma das ferramentas usada neste trabalho: o Google Colaboratory, que funciona com Jupyter Notebooks. Este estudo contribui para o campo da EDM e oferece conselhos práticos para melhorar o ensino superior nas áreas de Ciência, Tecnologia, Engenharia e Matemática (STEM), através da integração de técnicas avançadas de análise de dados impulsionadas pela Inteligência Artificial (IA).

Descrição

Palavras-chave

Artificial Intelligence in Education Educational Data Mining Knowledge Discovery Google Colaboratory Machine Learning STEM Education

Contexto Educativo

Citação

Projetos de investigação

Unidades organizacionais

Fascículo

Editora

Licença CC