Understanding ALS patients using Semantic Similarity

Teixeira, David Carriço

http://hdl.handle.net/10451/40236

Utilize este identificador para referenciar este registo.

Nome:	Descrição:	Tamanho:	Formato:
ulfc125369_tm_David_Teixeira.pdf		21.52 MB	Adobe PDF	Ver/Abrir

Contacte-nos

Autores

Teixeira, David Carriço

Orientador(es)

Pesquita, Cátia,1980-

Madeira, Sara Alexandra Cordeiro

Resumo(s)

As técnicas clássicas de prospecção de dados têm dificuldades a lidar com dados biomédicos não estruturados/ semiestruturados, pois estes contêm um significado semântico profundamente enraizado em palavras e frases que não é detectado através da extracção e análise diretas de recursos. Uma maneira de formalmente contextualizar dados é anotá-los com ontologias biomédicas e usar semelhança semântica sobre essas anotações para encontrar relações ocultas entre instâncias de dados. Deste modo, se os dados puderem ser enriquecidos com conhecimento externo, uma prospecção mais informada poderá, em princípio, retornar resultados mais precisos. Este projeto abordou este desafio desenvolvendo uma metodologia para analisar registos médicos de pacientes por meio da integração com recursos e software semânticos. Uma pipeline de três etapas cria uma rede semântica de ontologias que garante cobertura semântica sobre os dados alvo, calcula a semelhança semântica entre pacientes com a aplicação SML (Semantic Measures Library), e agrupa pacientes usando algoritmos de clustering do módulo Scikit-Learn do Python. Além disso, foi desenvolvida uma ferramenta para elaborar uma descrição resumida do conteúdo semântico de um agrupamento, destacando os seus elementos mais relevantes. Estes métodos foram avaliados usando um conjunto de dados de 1376 pacientes com esclerose lateral aiotrófica (ELA), possuindo uma forte componente textual e uma ampla heterogeneidade de sintomas entre pacientes. Os grupos de pacientes obtidos foram comparados, juntamente com uma baseline não-semântica, com grupos ground-truth de pacientes derivados das suas taxas de progressão de ELA. Foi demonstrado que a eficácia da metodologia proposta era fortemente dependente do número e da qualidade das anotações, mas também que os dados disponíveis não eram suficientes para detectar grupos de progressão. Apesar disso, as descrições de agrupamentos foram aplicadas com êxito em todas as abordagens, e forneceram informações úteis que evidenciaram pontos em comum entre o conteúdo semântico dos agrupamentos teste e da ground-truth. Por fim, esta metodologia pode ser generalizada para quaisquer entidades biomédicas que podem ser anotadas semanticamente com ontologias existentes.