Similarity corpus on microbial transcriptional regulation

Oscar Lithgow-Serrano; Socorro Gama-Castro; Cecilia Ishida-Gutiérrez; Citlalli Mejía-Almonte; Víctor H. Tierrafría; Sara Martínez-Luna; Alberto Santos-Zavaleta; David Velázquez-Ramírez; Julio Collado-Vides

doi:10.1186/s13326-019-0200-x

Journal of Biomedical Semantics (May 2019)

Similarity corpus on microbial transcriptional regulation

Oscar Lithgow-Serrano,
Socorro Gama-Castro,
Cecilia Ishida-Gutiérrez,
Citlalli Mejía-Almonte,
Víctor H. Tierrafría,
Sara Martínez-Luna,
Alberto Santos-Zavaleta,
David Velázquez-Ramírez,
Julio Collado-Vides

Affiliations

Oscar Lithgow-Serrano: Computational Genomics, Centro de Ciencias Genómicas, Universidad Nacional Autónoma de México (UNAM). A.P.
Socorro Gama-Castro: Computational Genomics, Centro de Ciencias Genómicas, Universidad Nacional Autónoma de México (UNAM). A.P.
Cecilia Ishida-Gutiérrez: Computational Genomics, Centro de Ciencias Genómicas, Universidad Nacional Autónoma de México (UNAM). A.P.
Citlalli Mejía-Almonte: Computational Genomics, Centro de Ciencias Genómicas, Universidad Nacional Autónoma de México (UNAM). A.P.
Víctor H. Tierrafría: Computational Genomics, Centro de Ciencias Genómicas, Universidad Nacional Autónoma de México (UNAM). A.P.
Sara Martínez-Luna: Computational Genomics, Centro de Ciencias Genómicas, Universidad Nacional Autónoma de México (UNAM). A.P.
Alberto Santos-Zavaleta: Computational Genomics, Centro de Ciencias Genómicas, Universidad Nacional Autónoma de México (UNAM). A.P.
David Velázquez-Ramírez: Computational Genomics, Centro de Ciencias Genómicas, Universidad Nacional Autónoma de México (UNAM). A.P.
Julio Collado-Vides: Computational Genomics, Centro de Ciencias Genómicas, Universidad Nacional Autónoma de México (UNAM). A.P.

DOI: https://doi.org/10.1186/s13326-019-0200-x
Journal volume & issue: Vol. 10, no. 1
pp. 1 – 14

Abstract

Read online

Abstract Background The ability to express the same meaning in different ways is a well-known property of natural language. This amazing property is the source of major difficulties in natural language processing. Given the constant increase in published literature, its curation and information extraction would strongly benefit from efficient automatic processes, for which corpora of sentences evaluated by experts are a valuable resource. Results Given our interest in applying such approaches to the benefit of curation of the biomedical literature, specifically that about gene regulation in microbial organisms, we decided to build a corpus with graded textual similarity evaluated by curators and that was designed specifically oriented to our purposes. Based on the predefined statistical power of future analyses, we defined features of the design, including sampling, selection criteria, balance, and size, among others. A non-fully crossed study design was applied. Each pair of sentences was evaluated by 3 annotators from a total of 7; the scale used in the semantic similarity assessment task within the Semantic Evaluation workshop (SEMEVAL) was adapted to our goals in four successive iterative sessions with clear improvements in the agreed guidelines and interrater reliability results. Alternatives for such a corpus evaluation have been widely discussed. Conclusions To the best of our knowledge, this is the first similarity corpus—a dataset of pairs of sentences for which human experts rate the semantic similarity of each pair—in this domain of knowledge. We have initiated its incorporation in our research towards high-throughput curation strategies based on natural language processing.

Published in Journal of Biomedical Semantics

ISSN: 2041-1480 (Online)
Publisher: BMC
Country of publisher: United Kingdom
LCC subjects: Medicine: Medicine (General): Computer applications to medicine. Medical informatics
Website: https://jbiomedsem.biomedcentral.com

About the journal

Abstract

Keywords