Upload corpus_kikongo.txt
Browse filesKiKongo Corpus — Dataset para o Modelo KiKBERT
Autor: Henriques Fernando
Instituição: Universidade Metodista de Angola
Versão: v1.0
Língua: Kikongo
Domínio: Textos literários, religiosos, jornalísticos e comunicacionais
Descrição Geral
O KiKongo Corpus é o primeiro dataset de larga escala criado especificamente para o pré-treinamento e fine-tuning de modelos de PLN na língua Kikongo.
O corpus foi cuidadosamente compilado, limpo e normalizado a partir de múltiplas fontes de texto, com o objetivo de servir como base para o desenvolvimento do modelo KiKBERT — o primeiro Transformer monolíngue para Kikongo.
O dataset contém textos anotados e não anotados, abrangendo diferentes variedades regionais do Kikongo (Kisikongo, Kizombo, Kiyombe e Kiwoyo), o que o torna representativo da diversidade linguística e morfológica da língua.
Processo de Preparação
O pipeline de preparação dos dados envolveu as seguintes etapas:
Coleta de dados
Fontes: textos religiosos (Bíblia Kikongo), artigos jornalísticos locais, obras literárias e redes sociais.
Foram incluídos textos de domínio público e de autores com autorização prévia.
Limpeza e normalização
Remoção de ruído, duplicação e símbolos inválidos.
Uniformização ortográfica com base no dicionário Kikongo-Português (edição 2023).
Tokenização morfológica
Segmentação de radicais, prefixos e sufixos usando o modelo Unigram LM.
Preservação de contextos sintáticos e diacríticos.
Anotação manual supervisionada
12 linguistas e estudantes participaram no processo de anotação POS e dependências sintáticas.
Ferramentas: Prodigy, SpaCy Annotation Tool e Label Studio.
Validação e balanceamento
Distribuição equitativa de amostras por tipo e domínio.
Revisão final para eliminar viés de domínio.
- corpus_kikongo.txt +0 -0
|
The diff for this file is too large to render.
See raw diff
|
|
|