fhenrivx commited on
Commit
a0fab22
·
verified ·
1 Parent(s): cb5dc2e

Upload corpus_kikongo.txt

Browse files

KiKongo Corpus — Dataset para o Modelo KiKBERT

Autor: Henriques Fernando
Instituição: Universidade Metodista de Angola
Versão: v1.0
Língua: Kikongo
Domínio: Textos literários, religiosos, jornalísticos e comunicacionais

Descrição Geral

O KiKongo Corpus é o primeiro dataset de larga escala criado especificamente para o pré-treinamento e fine-tuning de modelos de PLN na língua Kikongo.
O corpus foi cuidadosamente compilado, limpo e normalizado a partir de múltiplas fontes de texto, com o objetivo de servir como base para o desenvolvimento do modelo KiKBERT — o primeiro Transformer monolíngue para Kikongo.
O dataset contém textos anotados e não anotados, abrangendo diferentes variedades regionais do Kikongo (Kisikongo, Kizombo, Kiyombe e Kiwoyo), o que o torna representativo da diversidade linguística e morfológica da língua.

Processo de Preparação

O pipeline de preparação dos dados envolveu as seguintes etapas:

Coleta de dados
Fontes: textos religiosos (Bíblia Kikongo), artigos jornalísticos locais, obras literárias e redes sociais.
Foram incluídos textos de domínio público e de autores com autorização prévia.
Limpeza e normalização
Remoção de ruído, duplicação e símbolos inválidos.
Uniformização ortográfica com base no dicionário Kikongo-Português (edição 2023).
Tokenização morfológica
Segmentação de radicais, prefixos e sufixos usando o modelo Unigram LM.
Preservação de contextos sintáticos e diacríticos.

Anotação manual supervisionada

12 linguistas e estudantes participaram no processo de anotação POS e dependências sintáticas.

Ferramentas: Prodigy, SpaCy Annotation Tool e Label Studio.

Validação e balanceamento

Distribuição equitativa de amostras por tipo e domínio.

Revisão final para eliminar viés de domínio.

Files changed (1) hide show
  1. corpus_kikongo.txt +0 -0
corpus_kikongo.txt ADDED
The diff for this file is too large to render. See raw diff