Logo do repositório
 
A carregar...
Miniatura
Publicação

Processamento de Linguagem Natural e Machine Learning na Categorização de Notícias

Utilize este identificador para referenciar este registo.

Resumo(s)

O crescimento exponencial de conteúdos digitais, especialmente notícias, artigos e publicações nas redes sociais, tem gerado grandes volumes de informação não estruturada, tornando a sua organização e análise progressivamente mais complexas. Neste contexto, o presente trabalho contribui para a simplificação e a otimização da classificação automática de notícias em português, por meio do desenvolvimento e da validação de abordagens de categorização que conciliem o elevado desempenho com a eficiência computacional. Para a recolha e análise de dados, realizou-se uma revisão da literatura, seguida da seleção de algoritmos e ferramentas adequadas, da análise exploratória dos dados e da implementação de vários modelos de classificação. Estas etapas visaram comparar criticamente metodologias tradicionais de Machine Learning e de Mineração de Texto com modelos recentes de Processamento de Linguagem Natural, incluindo arquiteturas baseadas em Transformers, nomeadamente o BERT, avaliando simultaneamente o desempenho e o custo computacional associados. Os resultados obtidos indicam que os modelos mais avançados de Processamento de Linguagem Natural, ao apresentarem uma maior capacidade de compreensão do contexto textual, alcançam um desempenho superior, embora impliquem um maior consumo de recursos computacionais. Em contrapartida, os modelos mais leves, baseados em representações otimizadas do texto, revelam um compromisso mais equilibrado entre a precisão e a eficiência computacional, mostrando-se adequados para cenários com restrições de hardware. O trabalho experimental desenvolvido demonstra, deste modo, a viabilidade da implementação de um modeloe experimental funcional de categorização automática de notícias em língua portuguesa, capaz de processar grandes volumes de texto de forma eficaz, assegurando simultaneamente o controlo da complexidade computacional. Em suma, este estudo evidencia que é possível conciliar o desempenho elevado com a eficiência computacional, oferecendo contributos relevantes para o desenvolvimento de modelos de classificação automática de notícias cada vez mais eficazes.
The exponential growth of digital content, particularly news articles, written publications, and social media posts, has led to large volumes of unstructured information, making its organization and analysis increasingly complex. In this context, this work contributes to the simplification and optimization of automatic news classification in the Portuguese language through the development and validation of categorization approaches that reconcile high performance with computational efficiency. For data collection and analysis, a literature review was conducted, followed by the selection of appropriate algorithms and tools, exploratory data analysis, and the implementation of several classification models. These stages aimed to critically compare traditional Machine Learning and Text Mining methodologies with recent Natural Language Processing models, including Transformer-based architectures, namely BERT, while simultaneously evaluating performance and associated computational costs. The results indicate that more advanced Natural Language Processing models, due to their greater ability to capture textual context, achieve superior performance, albeit at the expense of increased computational resource consumption. In contrast, lighter models based on optimized text representations exhibit a more balanced trade-off between accuracy and computational efficiency, making them suitable for scenarios with hardware constraints. The developed prototype thus demonstrates the feasibility of implementing a functional automatic news categorization system in the Portuguese language, capable of efficiently processing large volumes of text while ensuring control over computational complexity. In summary, this study shows that it is possible to reconcile high performance with computational efficiency, providing relevant contributions to the development of increasingly effective automatic news classification systems.

Descrição

Palavras-chave

Machine Learning Inteligência artificial BERT Classificação Categorização de Notícias Mineração de Texto Machine Learning Classification News Categorization Text Mining Artificial Intelligence

Contexto Educativo

Citação

Projetos de investigação

Unidades organizacionais

Fascículo