← Retour au registre
dataset linguistique · 1 min de lecture

Corpus numéral Mbede (Obamba) · nombres de 0 à 9 999

Référentiel de l’écriture des nombres en mbede (Obamba) · 0 à 9 999 (10 000 entrées)

Par Chantry Olanda-Eyiba · Ingenieur IA

v0.1
chiffres-lembamba-0-9999 - aperçu ● live
Signal agrégé - 16 dernières semaines 978 KB

Schéma

ColonneType
numeroint
numero_en_obambastring

Aperçu - 5 lignes

numeronumero_en_obamba
0Ogna'ah
1Om'mô
2Djèeley
3Tari
4Na

DOI 10.5281/octet.2026.0140 · Licence CC-BY 4.0 · 10000 lignes · CSV

La numération mbede suit une logique décimale additive très régulière, ce qui en fait un corpus de choix pour la génération automatique de parole, l'apprentissage des langues et la documentation linguistique.

Structure observée

Bases 0–9. Dix lexèmes fondamentaux : Ogna'ah (0), Om'mô (1), Djèeley (2), Tari (3), Na (4), Tâ'ani (5), Siami (6), Mpwo'môh (7), Ntsa'ami (8), Wâ (9).

Dizaines. Le marqueur « Koumi » porte la dizaine. De 11 à 19, on lie l'unité par « na » (Koumi na Om'mô = 11). À partir de 20, la base de la dizaine suit directement « Koumi » (Koumi Djèeley = 20, Koumi Tari = 30, Koumi Na = 40, Koumi Tâ'ani = 50).

Unités composées. Pour 21–29, 31–39, etc., on reprend la dizaine puis on lie l'unité par « na » (Koumi Djèeley na Om'mô = 21).

Exhaustivité du corpus

Le corpus complet est fourni au format JSONL (JSON Lines) et couvre tous les entiers de 0 à 9 999, soit un total de 10 000 entrées. Chaque ligne du fichier correspond à une entrée numérique distincte associant un entier à sa forme écrite en mbede.

Le corpus est ainsi conçu comme une ressource structurée pouvant être utilisée pour l'apprentissage automatique, la génération de nombres en langue mbede, les systèmes de synthèse et de reconnaissance de la parole, ainsi que pour la documentation et la préservation numérique de la langue.

Conservation de l'orthographe

Les diacritiques, accents et apostrophes glottales présents dans les formes lexicales sont conservés conformément à la transcription fournie par la source de référence. Aucune normalisation orthographique supplémentaire n'est appliquée dans le corpus afin de préserver fidèlement les formes documentées.

↓ Télécharger (978 KB) 1 téléchargements · 0 citations