| Nome: | Descrição: | Tamanho: | Formato: | |
|---|---|---|---|---|
| 8.81 MB | Adobe PDF |
Autores
Orientador(es)
Resumo(s)
This dissertation explores the potential of educational data mining (EDM) to enhance
the engineering curriculum, specifically within the Transversal Skills in Science and
Technology mandatory program for first-year students at NOVA School of Science and
Technology. It employs machine learning (ML) algorithms, including classification and re-
gression, to analyze student performance data. Various research concerns were addressed,
such as the impact of gender on course selection, the relationships between different
assessment points, performance variability, and the predictive power of early-course out-
comes. Some of these questions were resolved through statistical analysis, while others
leveraged machine learning models.
Key findings reveal a distinct gender-based difference in course selection, with male
students typically opting for engineering fields like mechanical, electrical, and informatics,
while female students gravitated towards biology and chemistry-related courses. Addi-
tionally, activity points proved to be the most reliable predictor of final grades, whereas
self and peer-assessment points exhibited lower correlations, indicating a shift in the
weighting of these points in the evaluation system. A detailed analysis of demographic
and performance data showed that male students had a higher rate of failure than female
students, despite enrolling in larger numbers.
While the clustering analysis identified potential trends in early-course data, it did not
provide substantial actionable insights in isolation. However, its integration into predictive
models could offer valuable contributions in forecasting student performance in future
research. The machine learning models demonstrated the effectiveness of early-course
data in predicting final grades, with Random Forest and CatBoost models consistently
outperforming others.
The dissertation emphasizes the technical capabilities of platforms such as Google
Colaboratory, highlighting its cost-effectiveness and efficiency for conducting large-scale
educational data analysis using mid-range Graphical Processing Units (GPUs). Moreover,
the research underscores the importance of standardizing data collection through Learning
Management Systems (LMS), specifically Moodle, which can enhance the precision and
efficiency of educational data analysis. The research concludes with recommendations for future work, including the develop-
ment of Moodle plugins to track student performance in real-time, further exploration of
machine learning models for grade prediction, and an in-depth analysis of computational
resource costs. This study contributes to the field of Educational Data Mining (EDM) and
provides practical insights for improving Science, Technology, Engineering, and Mathe-
matics (STEM) education through data-driven strategies and the integration of Artificial
Intelligence (AI).
Esta dissertação explora as potencialidades da extração de dados educacionais (Educa- tional Data Mining, EDM) na melhoria do ensino em engenharia, com foco específico na disciplina obrigatória para alunos do primeiro ano da Faculdade de Ciências e Tecnologia da Universidade Nova de Lisboa: Competências Transversais em Ciência e Tecnologia, mais conhecida como CTCT. São utilizados algoritmos de aprendizagem automática (Ma- chine Learning, ML), incluindo técnicas de clustering (agregação), classificação e regressão, para analisar dados de desempenho dos alunos e são abordadas diversas questões de in- vestigação relacionadas com a população de alunos de CTCT e a sua evolução no contexto desta disciplina. Estas questões incluem aspetos como se a seleção do curso por parte do aluno tem relação com o sexo do mesmo, bem como o estudo de correlação entre os diversos pontos utilizados na avaliação dos alunos (resultados de atividades, pontos de participação e pontos de auto e heteroavaliação). Também se estuda a variabilidade do desempenho dos alunos em função de diversos fatores e tenta-se aferir o valor preditivo dos resultados das primeiras duas semanas da disciplina, resolvidas em parte com testes estatísticos e em parte com modelos de ML. As principais conclusões mostram uma clara diferença de género na seleção de cursos, com os estudantes do sexo masculino a escolherem predominantemente cursos de enge- nharia, como mecânica, elétrica e informática, enquanto as estudantes do sexo feminino optam por cursos mais orientados para a biologia e a química. Além disso, os pontos de atividade foram identificados como o indicador mais confiável das notas finais (como se esperava), enquanto os pontos de auto e heteroavaliação apresentaram diferentes níveis de correlação, sugerindo uma evolução no peso deste tipo de pontos ao longo da história da disciplina. A análise de clustering identificou possíveis tendências nos dados iniciais dos cursos, embora, isoladamente, não tenha fornecido informações suficientemente con- clusivas. No entanto, a sua integração em modelos preditivos pode oferecer contribuições valiosas para prever o desempenho dos estudantes em pesquisas futuras. Este estudo destaca as capacidades tecnológicas de plataformas como o Google Co- laboratory, que oferecem uma solução eficiente e economicamente viável para análises educacionais em larga escala, utilizando Unidades de Processamento Gráfico (Graphics Processing Units, GPUs) de gama intermédia. Além disso, realça a importância de padro- nizar a recolha de dados através da utilização de Sistemas de Gestão de Aprendizagem (Learning Management Systems, LMS), em particular o Moodle, que tem o potencial de melhorar significativamente a precisão e a eficácia da análise de dados educacionais. Esta pesquisa oferece recomendações para trabalhos futuros, incluindo o desenvolvi- mento de plug-ins para o Moodle que permitam acompanhar em tempo real o desempenho dos alunos, a investigação aprofundada de modelos de aprendizagem automática para a previsão de notas finais, e uma análise detalhada dos custos associados ao uso de recursos computacionais de uma das ferramentas usada neste trabalho: o Google Colaboratory, que funciona com Jupyter Notebooks. Este estudo contribui para o campo da EDM e oferece conselhos práticos para melhorar o ensino superior nas áreas de Ciência, Tecnologia, Engenharia e Matemática (STEM), através da integração de técnicas avançadas de análise de dados impulsionadas pela Inteligência Artificial (IA).
Esta dissertação explora as potencialidades da extração de dados educacionais (Educa- tional Data Mining, EDM) na melhoria do ensino em engenharia, com foco específico na disciplina obrigatória para alunos do primeiro ano da Faculdade de Ciências e Tecnologia da Universidade Nova de Lisboa: Competências Transversais em Ciência e Tecnologia, mais conhecida como CTCT. São utilizados algoritmos de aprendizagem automática (Ma- chine Learning, ML), incluindo técnicas de clustering (agregação), classificação e regressão, para analisar dados de desempenho dos alunos e são abordadas diversas questões de in- vestigação relacionadas com a população de alunos de CTCT e a sua evolução no contexto desta disciplina. Estas questões incluem aspetos como se a seleção do curso por parte do aluno tem relação com o sexo do mesmo, bem como o estudo de correlação entre os diversos pontos utilizados na avaliação dos alunos (resultados de atividades, pontos de participação e pontos de auto e heteroavaliação). Também se estuda a variabilidade do desempenho dos alunos em função de diversos fatores e tenta-se aferir o valor preditivo dos resultados das primeiras duas semanas da disciplina, resolvidas em parte com testes estatísticos e em parte com modelos de ML. As principais conclusões mostram uma clara diferença de género na seleção de cursos, com os estudantes do sexo masculino a escolherem predominantemente cursos de enge- nharia, como mecânica, elétrica e informática, enquanto as estudantes do sexo feminino optam por cursos mais orientados para a biologia e a química. Além disso, os pontos de atividade foram identificados como o indicador mais confiável das notas finais (como se esperava), enquanto os pontos de auto e heteroavaliação apresentaram diferentes níveis de correlação, sugerindo uma evolução no peso deste tipo de pontos ao longo da história da disciplina. A análise de clustering identificou possíveis tendências nos dados iniciais dos cursos, embora, isoladamente, não tenha fornecido informações suficientemente con- clusivas. No entanto, a sua integração em modelos preditivos pode oferecer contribuições valiosas para prever o desempenho dos estudantes em pesquisas futuras. Este estudo destaca as capacidades tecnológicas de plataformas como o Google Co- laboratory, que oferecem uma solução eficiente e economicamente viável para análises educacionais em larga escala, utilizando Unidades de Processamento Gráfico (Graphics Processing Units, GPUs) de gama intermédia. Além disso, realça a importância de padro- nizar a recolha de dados através da utilização de Sistemas de Gestão de Aprendizagem (Learning Management Systems, LMS), em particular o Moodle, que tem o potencial de melhorar significativamente a precisão e a eficácia da análise de dados educacionais. Esta pesquisa oferece recomendações para trabalhos futuros, incluindo o desenvolvi- mento de plug-ins para o Moodle que permitam acompanhar em tempo real o desempenho dos alunos, a investigação aprofundada de modelos de aprendizagem automática para a previsão de notas finais, e uma análise detalhada dos custos associados ao uso de recursos computacionais de uma das ferramentas usada neste trabalho: o Google Colaboratory, que funciona com Jupyter Notebooks. Este estudo contribui para o campo da EDM e oferece conselhos práticos para melhorar o ensino superior nas áreas de Ciência, Tecnologia, Engenharia e Matemática (STEM), através da integração de técnicas avançadas de análise de dados impulsionadas pela Inteligência Artificial (IA).
Descrição
Palavras-chave
Artificial Intelligence in Education Educational Data Mining Knowledge Discovery Google Colaboratory Machine Learning STEM Education
