DELTA: Documentação de Estudos em Lingüística Teórica e Aplicada (Jul 2020)

O Corpus de Português Escrito em Periódicos - CoPEP

  • Tanara Zingano Kuhn,
  • José Pedro Ferreira

DOI
https://doi.org/10.1590/1678-460x2020360209
Journal volume & issue
Vol. 36, no. 2

Abstract

Read online Read online

RESUMO O presente estudo tem como objetivo descrever os desafios e soluções encontrados na compilação do Corpus de Português Escrito em Periódicos - CoPEP, que contém aproximadamente 40 milhões de palavras, é equilibrado entre as variedades português brasileiro e português europeu em número de palavras e cobre seis grandes áreas de conhecimento. Primeiramente, apresentaremos o contexto de criação do CoPEP, qual seja, a elaboração de um dicionário on-line de português para universitários, para o qual serviu como fonte primária de obtenção de evidências linguísticas. Assim, foram as características desse projeto lexicográfico que informaram os critérios de criação do desenho do CoPEP e as consequentes tomadas de decisão. A seguir, descreveremos a metodologia de aquisição de dados, com foco especial nos desafios enfrentados e nas soluções encontradas. Terminaremos com a descrição da fase final de compilação, na qual aplicamos uma série de procedimentos para obtenção de equilíbrio.

Keywords