Logo do repositório
 

ESTG - Mestrado em Ciência de Dados

URI permanente para esta coleção:

Navegar

Entradas recentes

A mostrar 1 - 10 de 56
  • Information Extraction from Safety Data Sheets
    Publication . Dinis, João Pedro Calado; Grilo, Carlos Fernando de Almeida; Miragaia, Rolando Lúcio Germano; Ribeiro, José Carlos Bregieiro; Pereira, António Manuel de Jesus
    Safety Data Sheets (SDS) are essential documents for ensuring the safe handling, storage, and transportation of chemical products. Despite their standardized structure, SDS documents are often distributed as semi-structured PDF files, making the automatic extraction of key information a challenging task. This work addresses the problem of information extraction from SDS documents, with the objective of developing and evaluating different Natural Language Processing (NLP) techniques for this purpose. A complete data processing pipeline was developed to transform SDS PDF files into a structured, model-ready dataset. This pipeline includes document collection, text extraction, section segmentation based on the standardized 16-section SDS format, and the construction of a question-answering dataset linking document context with target fields. Multiple extraction strategies were explored, ranging from rule-based methods using regular expressions to machine learning approaches based on Bidirectional encoder representations from transformers (BERT), and more recent approaches based on Large Language Models (LLM). The evaluation focused on a set of representative fields, including binary classification, single-label classification, and multi-label classification tasks. The results show that rule-based approaches perform well for highly structured patterns, such as hazard codes, while BERT-based models achieve strong performance in well-defined classification tasks, reaching an F1-score of 1.0 for binary classification and up to 0.86 for more complex classification scenarios. LLM-based approaches demonstrate competitive performance across all tasks, while offering greater flexibility and reducing the need for task-specific engineering, particularly in more complex cases. The results indicate that while older methods remain effective for specific scenarios, LLMs provide a more generalizable solution for information extraction from semi-structured documents. This work contributes a reproducible pipeline for SDS processing, a structured dataset for evaluation, and a comparative analysis of extraction methodologies, providing a foundation for future research and practical applications in automated document understanding.
  • Arquitetura Analítica Federada para Predição de Fratura Osteoporótica: Uma Prova de Conceito
    Publication . Manica, Santiago Andres Rodrigues; Grilo, Carlos Fernando de Almeida; Miragaia, Rolando Lúcio Germano; Rodrigues, Ana Maria Ferreira; Taveira-Gomes, Tiago Salgado de Magalhães
    A osteoporose representa um problema de saúde pública significativo, associado a fraturas de fragilidade que resultam em elevada morbilidade, mortalidade e custos económicos. A estratificação de risco tradicional, baseada em ferramentas como o FRAX, apresenta limitações na sua capacidade preditiva e generalização. Este trabalho propõe uma metodologia para a análise de dados de saúde em múltiplas instituições, focada na predição de fraturas osteoporóticas, que garante a reprodutibilidade e a segurança dos dados através da contentorização. O objetivo principal foi desenvolver e validar uma arquitetura analítica contentorizada (Docker + OMOP-CDM v5.4), assente no paradigma code-to-data e preparada para implementação federada em múltiplas instituições, em conformidade com o RGPD. Secundariamente, pretendeu-se implementar, sobre dados sintéticos de alta fidelidade, um pipeline de modelação preditiva e identificação de perfis de risco de fratura osteoporótica em adultos ≥50 anos, como prova de conceito para futura aplicação em dados clínicos reais. Foi desenvolvida uma infraestrutura analítica reprodutível e portátil, assente no paradigma code-to-data, que permite executar toda a análise de forma padronizada e segura em qualquer instituição de saúde, sem necessidade de transferência de dados sensíveis. O pipeline realiza a extração e pré-processamento de dados (formato OMOP-CDM), a modelação preditiva supervisionada (Random Forest, Gradient Boosting) e a análise de clustering não supervisionado (K-Means) para identificação de perfis de risco. A metodologia "trazer o código aos dados" (code-to-data) garante que os dados dos pacientes nunca saem da infraestrutura hospitalar, em conformidade com o RGPD. O resultado principal é um pacote de análise contentorizado, portátil e reprodutível, que permite a qualquer instituição com dados no formato OMOP-CDM executar um pipeline de análise de risco de fratura de forma padronizada. Os modelos de machine learning demonstraram capacidade para identificar fatores de risco complexos, enquanto o clustering permitiu a segmentação de pacientes em perfis de risco distintos. Validados sobre dados sintéticos, os modelos de machine learning demonstraram capacidade para identificar fatores de risco complexos e o clustering permitiu a segmentação em perfis de risco distintos. A arquitetura está preparada para implementação imediata com dados clínicos reais em ambiente federado. A metodologia de contentorização demonstrou ser uma solução eficaz e segura para a análise distribuída de dados de saúde, superando barreiras de privacidade e promovendo a investigação colaborativa. Este trabalho estabelece uma base técnica robusta para a implementação de estudos multicêntricos e de aprendizagem federada em Portugal, com potencial para melhorar a estratificação de risco e a prevenção de fraturas osteoporóticas.
  • Business Intelligence e Ciência de Dados Aplicados ao Mercado de Arrendamento Estudantil - Uniplaces
    Publication . Fernandes, Pedro Alexandre Pereira; Bernardino, Anabela Moreira; Bernardino, Eugénia Moreira
    O presente relatório descreve o trabalho desenvolvido no âmbito do Estágio Curricular do Mestrado em Ciência de Dados, realizado na empresa Uniplaces, integrando o departamento financeiro. O estágio teve como principal propósito a aplicação prática de competências analíticas na função de Data Analyst Intern, assumindo um papel transversal na otimização dos fluxos de informação e no suporte à tomada de decisão estratégica de todas as equipas da organização. A crescente importância da Ciência de Dados no panorama empresarial contemporâneo reside na capacidade de transformar vastos volumes de dados brutos em conhecimento estratégico. Através da implementação de processos analíticos e da automatização de fluxos de informação, torna-se possível mitigar a ambiguidade na tomada de decisão, otimizando recursos e identificando oportunidades de crescimento baseadas em evidências empíricas, fundamentais para a competitividade em mercados dinâmicos. As atividades técnicas centraram-se na gestão do ciclo de vida dos dados, desde a extração até à visualização final, servindo as necessidades de múltiplos departamentos. O trabalho envolveu a utilização de linguagem SQL (Structured Query Language) para a manutenção de bases de dados, bem como a criação de scripts de automação e lógicas complexas em folhas de cálculo (Google Sheets). Complementarmente, foram desenvolvidas soluções de Business Intelligence recorrendo a ferramentas como Looker Studio e Tableau. Destaca-se a intervenção na correção de scripts de extração, na resolução de inconsistências de dados e na estruturação de mecanismos automáticos para a priorização de tarefas. Os contributos do estágio traduziram-se num aumento significativo da integridade da informação corporativa e na eficiência dos processos de análise. Através da centralização de métricas e da automatização de relatórios, foi possível transformar grandes volumes de dados brutos em insights acionáveis para as diversas áreas de negócio. Este percurso permitiu consolidar conhecimentos técnicos em manipulação e visualização de dados, demonstrando o valor acrescentado da Ciência de Dados num contexto empresarial dinâmico.
  • Desenvolvimento de modelos preditivos de emoções musicais através de Text Mining
    Publication . Rodrigues, Marta Ferreira; Malheiro, Ricardo Manuel da Silva
    A Recuperação da Informação Musical (Music Information Retrieval - MIR) é uma área de investigação focada na organização e análise de informação extraída de música. Dentro deste domínio, o Reconhecimento de Emoções em Música (Music Emotion Recognition - MER) procura identificar as emoções expressas, nomeadamente através das letras. Este trabalho tem como principal objetivo explorar o contributo de características estilísticas, em particular metáforas, na deteção automática de emoções em letras de músicas, recorrendo a técnicas de Text Mining e Machine Learning. Para tal, foram desenvolvidos vários modelos de classificação para a deteção de metáforas, incluindo abordagens tradicionais e modelos de Deep Learning, como BERT e RoBERTa. O modelo que apresentou melhor desempenho foi o RoBERTa com fine-tuning, alcançando cerca de 92% de precisão na classificação de frases. A partir deste modelo, foram extraídas features relacionadas com a presença e distribuição de metáforas nas letras, que foram posteriormente integradas com outras características previamente definidas. Estas features foram utilizadas em diferentes modelos de classificação para prever o quadrante emocional das músicas. Os resultados demonstram uma ligeira melhoria no desempenho dos modelos tradicionais com a inclusão das features de metáforas. No entanto, nos modelos baseados em Deep Learning, verificou-se uma diminuição do desempenho na tarefa de classificação emocional.
  • Desenvolvimento de Programa de Integração de Dados e Modelos de Previsão Machine Learning e SARIMA
    Publication . Abraúl, Francisco de Oliveira Henriques; Bernardino, Eugénia Moreira; Bernardino, Anabela Moreira
    O presente relatório descreve o trabalho desenvolvido no âmbito da unidade curricular de Estágio do Mestrado em Ciência de Dados, da Escola Superior de Tecnologia e Gestão do Instituto Politécnico de Leiria, realizado na empresa InCentea – Technology For People, S.A., ao longo de 1080 horas. O objetivo é apresentar o trabalho desenvolvido, centrado na aplicação de técnicas de análise e previsão de dados para apoiar a tomada de decisão estratégica, recorrendo à informação disponibilizada pela área de Sistemas de Informação da empresa. O estágio envolveu três projetos distintos, iniciou-se pela construção de um processo ETL (Extract, Transform, and Load) robusto para integrar dados do sistema Dynamics 365 em SQL Server. Foi desenvolvido um programa em C# que atualiza automaticamente as tabelas de staging, recorrendo ainda a stored procedures e ficheiros de configuração JSON, para assegurar a normalização e a integridade dos dados. A segunda vertente centrou-se na previsão da margem de vendas, onde foram aplicados diferentes modelos de séries temporais e utilizou-se também a funcionalidade de forecast do Power BI para fazer previsões de outras empresas do grupo InCentea. Por fim, a terceira vertente dedicou-se à previsão do segmento de clientes, através de modelos de machine learning. O trabalho desenvolvido resultou na produção de datasets preparados para análise, relatórios de avaliação dos modelos, ficheiros Excel e dashboards em Power BI com as previsões para 2025. Estes produtos permitiram identificar tendências de vendas, projetar margens futuras e antecipar a evolução e importância de clientes. A realização deste estágio envolveu várias matérias da área de Ciência de Dados e constituiu um desafio enriquecedor, pela diversidade de metodologias aplicadas e tecnologias utilizadas. O projeto ETL, pela exigência de programação intensiva, e a previsão da margem de vendas devido à necessidade de adquirir conhecimentos específicos na área de séries temporais, apresentou obstáculos significativos, mas também oportunidades de aprendizagem. Como resultado, foram adquiridas novas competências técnicas e profissionais, aplicadas em contexto real de negócio e com impacto direto na organização.
  • Modelos de Machine Learning para a Deteção de Anomalias em Consumos Energéticos
    Publication . Santos, Beatriz Colaço dos; Miragaia, Rolando Lúcio Germano; Grilo, Carlos Fernando de Almeida; Sebastião, Fernando José do Nascimento
    O consumo de energia em edifícios institucionais é influenciado por múltiplos fatores e pode ser difícil de monitorizar de forma eficiente sem ferramentas adequadas de apoio à decisão. A previsão do consumo energético, quando realizada com elevada precisão, pode ser utilizada como referência de comportamento esperado, permitindo identificar desvios significativos que possam corresponder a anomalias operacionais. O presente trabalho, desenvolvido em continuidade com o trabalho de investigação de J. Sá, tem como objetivo o desenvolvimento de modelos de estimação do consumo diário de energia com um erro reduzido, de modo a poderem ser utilizados como suporte à deteção de anomalias no consumo energético. A metodologia seguida consiste na utilização de um modelo de previsão horária do consumo e na agregação dos valores previstos ao longo do dia, permitindo obter uma estimativa diária do consumo. Os resultados mostram que esta metodologia simples permite obter valores de erro extremamente baixos, deixando em aberto a possibilidade da sua utilização como suporte à deteção de anomalias no consumo. Foram utilizados os registos do Campus do Instituto Politécnico de Leiria, recolhidos entre 2015 e 2023, para avaliar o desempenho da metodologia proposta. Para tal, foram desenvolvidos e comparados seis modelos: MLP, LSTM, GRU, XGBoost, N-BEATS e N-HiTS. Os resultados demonstram que esta metodologia permite obter erros com MAPE médio entre 1,28% e 1,70%, evidenciando o bom desempenho preditivo dos modelos desenvolvidos.
  • Inferential Statistics with Python: Learning Statistics Through Interactive Python Tools
    Publication . Bedoya, Daniel Alexander Diaz; Felgueiras, Miguel Martins; Santos, Rui Filipe Vargas de Sousa
    Na era dos dados, a aprendizagem da estatística inferencial continua a ser fundamental. Este projeto apresenta uma aplicação de software de código aberto desenvolvida para apoiar o ensino de conceitos estatísticos fundamentais através de Python. O sistema organiza ferramentas essenciais em grandes módulos analíticos: diagnósticos de normalidade, testes de médias, medianas e proporções para uma ou múltiplas populações, tabelas de contingência e análise de correlação. Desenvolvido com uma Interface Gráfica de Utilizador (GUI) intuitiva, o software permite aos utilizadores avaliar conjuntos de dados CSV sem experiência em programação. Para reforçar a aprendizagem, cada interação exibe o código subjacente em tempo real, o que permite aos estudantes replicar a análise nos seus próprios ambientes. A plataforma é distribuída como um executável pré-compilado para uma implementação direta, sem necessidade de instalação. Este ambiente reduz as barreiras técnicas enquanto mantém o rigor metodológico, oferecendo uma estrutura focada que liga a teoria abstrata à prática computacional reprodutível.
  • Multimodal Machine Learning for Early Detection of Clinical Deterioration in Chronic Heart Failure
    Publication . Barbosa, Bruno Filipe Catarino; Craveiro, Olga Marina Freitas
    A Insuficiência Cardíaca Crónica (ICC) é uma das principais causas de hospitalização e mortalidade, sendo frequentes os episódios de deterioração clínica de curto prazo. Este projeto investiga a utilização de técnicas de Mineração de Dados, Machine Learning e Processamento de Linguagem Natural para apoiar a predição de deterioração clínica de curto prazo em doentes com ICC estabelecida, integrados num programa de monitorização remota. Uma Revisão Sistemática da Literatura, apoiada pela estrutura PRISMA 2020 (Preferred Reporting Items for Systematic Reviews and Meta-Analyses), estabeleceu o contexto clínico e metodológico. Seguindo a metodologia CRISP-DM (Cross-Industry Standard Process for Data Mining), foi desenvolvido um enquadramento multimodal utilizando dados de 181 doentes com ICC. Medições fisiológicas estruturadas e dados de alertas foram combinados com notas clínicas não estruturadas. O texto foi limpo e processado através da extração de conceitos clínicos baseada em regras, representações TF-IDF baseadas em uni-, bi- e trigramas, e embeddings contextuais gerados com o BioBERTpt-clin, um modelo linguístico clínico português baseado em BERT. Os sintomas, comorbilidades, tratamentos e outros indicadores derivados do texto foram agregados ao nível do doente e integrados com características fisiológicas numa matriz de risco clinicamente fundamentada. Foram desenvolvidos modelos de Regressão Logística regularizados para prever instabilidade clínica grave numa janela de 90 dias: um modelo base estruturado, baseado em indicadores fisiológicos, e um modelo integrado que incorporou conceitos derivados do texto. Um classificador Random Forest foi avaliado como referência comparativa não linear. A validação cruzada estratificada a cinco partições produziu valores de ROC-AUC de 0,855 para o modelo estruturado e 0,857 para o modelo integrado. Os indicadores de instabilidade fisiológica foram os preditores mais fortes, enquanto as características derivadas do texto acrescentaram contexto clínico. Apesar do enquadramento retrospetivo de implementação única, os resultados demonstram a viabilidade da estratificação de risco multimodal no apoio à decisão baseado em telemonitorização na gestão da ICC.
  • Da Análise dos Dados à Comunicação de Resultados: Uma Abordagem com Data Storytelling
    Publication . Correia, Fernando Cruz; Matias, Rosa Isabel Alves Cordeiro; Piedade, Maria Beatriz Guerra da
    O crescimento do comércio eletrónico tem levado a um aumento significativo do volume e da complexidade dos dados gerados pelas plataformas digitais, reforçando a necessidade de soluções de Business Intelligence (BI) capazes de transformar dados em informação relevante para suporte à tomada de decisão. Neste contexto, a integração entre processos de preparação, modelação e exploração de dados, visualização de informação e data storytelling assume um papel importante na interpretação estruturada do desempenho organizacional. O presente trabalho propõe o desenvolvimento de uma solução de BI orientada ao contexto de marketplaces digitais, estruturada em etapas de integração e transformação de dados, definição de indicadores-chave de desempenho e construção de dashboards interativos. A abordagem seguida combina modelação analítica e visualização de informação, permitindo uma análise integrada do desempenho do negócio. A metodologia é aplicada a um caso de estudo baseado no marketplace brasileiro Olist, permitindo validar a arquitetura da solução e os princípios de conceção definidos. A análise realizada evidencia padrões associados ao crescimento do negócio, à dinâmica da base de clientes e à relação entre eficiência logística e satisfação do consumidor. Para além do contexto específico analisado, a solução desenvolvida apresenta características adaptáveis a diferentes plataformas de e-commerce, demonstrando o potencial de generalização do modelo proposto. Conclui-se que a combinação entre processos de BI e data storytelling constitui uma abordagem eficaz de apoio à decisão estratégica, tática e operacional em ambientes digitais, contribuindo para uma comunicação mais estruturada e orientada ao negócio.
  • Day-Ahead Energy Consumption Forecasting in Academic Campi with Deep Learning Models
    Publication . Horta, Simão Matos Conceição; Grilo, Carlos Fernando de Almeida; Távora, Luís Miguel de Oliveira Pegado de Noronha e; Sousa, João Miguel Charrua de; Marques, Pedro José Franco
    Electricity is essential in today’s society, with global demand projected to increase 50% by 2050. However, there are significant inefficiencies in power systems throughout production, transmission and distribution. Therefore, to ensure an efficient energy supply it is important to accurately forecast the energy consumption since it allows to deliver only the necessary resources. Advances in data science have provided essential tools to address these challenges by improving the reliability of energy consumption forecasts. Based on these principles, the current project has developed a daily predictive model with a one-day horizon to support energy management decisions, with the goal to optimize the energy efficiency at Campus 2 of the Polytechnic Institute of Leiria (IPL). For this purpose, the historical energy consumption on the campus was used to optimize several models through the NeuralForecast framework. Models were developed using only the endogenous consumption variable, as well as models incorporating the exogenous variables Day Type (which distinguishes between weekdays, Saturdays, and Sundays/holidays) and Academic Calendar (which distinguishes between classes, evaluations, school breaks, and vacation periods). The performance of each model was then evaluated using the Mean Absolute Percentage Error (MAPE) and the computational performance of the model was measured by the Total Parameter Count (TPC). The results show that the best-performing model was N-BEATSx trained on both exogenous variables, achieving a MAPE of 4.92% and 806k total number of parameters. However, the model that best balances complexity and performance is the MultiLayer Perceptron (MLP) with both exogenous variables, with only around 51k parameters and a MAPE of 5.57%. In summary, this study developed robust neural networks for energy consumption forecasting, providing both theoretical and practical advances to support decision-making aimed at optimizing energy efficiency.