Utilizando conceitos como descritores de textos para o processo de identificação de conglomerados (clustering) de documentos
AUTOR(ES)
Wives, Leandro Krug
DATA DE PUBLICAÇÃO
2007
RESUMO
A descoberta e a análise de conglomerados textuais são processos muito importantes para a estruturação, organização e a recuperação de informações, assim como para a descoberta de conhecimento. Isto porque o ser humano coleta e armazena uma quantidade muito grande de dados textuais, que necessitam ser vasculhados, estudados, conhecidos e organizados de forma a fornecerem informações que lhe dêem o conhecimento para a execução de uma tarefa que exija a tomada de uma decisão. É justamente nesse ponto que os processos de descoberta e de análise de conglomerados (clustering) se insere, pois eles auxiliam na exploração e análise dos dados, permitindo conhecer melhor seu conteúdo e inter-relações. No entanto, esse processo, por ser aplicado em textos, está sujeito a sofrer interferências decorrentes de problemas da própria linguagem e do vocabulário utilizado nos mesmos, tais como erros ortográficos, sinonímia, homonímia, variações morfológicas e similares. Esta Tese apresenta uma solução para minimizar esses problemas, que consiste na utilização de “conceitos” (estruturas capazes de representar objetos e idéias presentes nos textos) na modelagem do conteúdo dos documentos. Para tanto, são apresentados os conceitos e as áreas relacionadas com o tema, os trabalhos correlatos (revisão bibliográfica), a metodologia proposta e alguns experimentos que permitem desenvolver determinados argumentos e comprovar algumas hipóteses sobre a proposta. As conclusões principais desta Tese indicam que a técnica de conceitos possui diversas vantagens, dentre elas a utilização de uma quantidade muito menor, porém mais representativa, de descritores para os documentos, o que torna o tempo e a complexidade do seu processamento muito menor, permitindo que uma quantidade muito maior deles seja analisada. Outra vantagem está no fato de o poder de expressão de conceitos permitir que os usuários analisem os aglomerados resultantes muito mais facilmente e compreendam melhor seu conteúdo e forma. Além do método e da metodologia proposta, esta Tese possui diversas contribuições, entre elas vários trabalhos e artigos desenvolvidos em parceria com outros pesquisadores e colegas.
ASSUNTO(S)
armazenamento : dados recuperacao : informacao descoberta : conhecimento agrupamento : informacao textual
ACESSO AO ARTIGO
http://hdl.handle.net/10183/4576Documentos Relacionados
- Metodologia de categorização de textos a partir de documentos não rotulados utilizando um processo de resolução de anáforas
- Construção de descritores para o processo de educação permanente em atenção básica
- Classificando regimes políticos utilizando análise de conglomerados
- Leer múltiples documentos para escribir textos académicos en la universidad: o cómo aprender a leer y escribir en el lenguaje de las disciplinas
- Identificação de descritores mínimos para caracterização de germoplasma de Capsicum spp.