# Sources des données (open source)

- **Mots + définitions en français + IPA** : Wiktionnaire français (https://fr.wiktionary.org), extrait structuré via **Kaikki.org / Wiktextract** (https://kaikki.org/frwiktionary/), dump du 2026-10-01. Licence : **CC BY-SA 3.0 + GFDL** (comme le Wiktionnaire). Fichiers locaux `data/<langue>-pN.json` (pages de 1500 mots) + `data/manifest.json` : **208 596 mots, 32 langues**, générés par `build_big.py` (noms communs/verbes/adjectifs, définitions FR de 3 à 140 caractères, exclusion des flexions et tautologies). Les petites langues (quechua 422, zoulou 650…) sont incluses en intégralité : c'est tout ce que le Wiktionnaire FR contient pour elles.
- **Prononciation humaine** : fichiers audio liés par le Wiktionnaire, hébergés sur **Wikimedia Commons**, majoritairement **Lingua Libre** (licences libres CC BY-SA / CC0 selon fichier). Champ `audio` = URL `mp3_url`/`ogg_url` transcoded de Commons. 285/320 mots en ont une ; le lecteur `<audio>` la joue.
- **Prononciation robot (fallback, 100% des mots)** : **Web Speech API** du navigateur (`speechSynthesis`, voix locales, gratuit, sans serveur), avec `lang` BCP47 par langue (ex. `ja-JP`, `wo-SN`). Aucune donnée à héberger.
- **Attribution requise** : conserver ce fichier + le lien footer dans `index.html` si réutilisation (clause BY de CC BY-SA). Partage dans les mêmes conditions (clause SA).

## Langues incluses (32)
Allemand, Anglais, Arabe, Bambara, Breton, Catalan, Chinois, Coréen, Espagnol, Grec, Haoussa, Hindi, Hébreu, Indonésien, Inuktitut, Islandais, Italien, Japonais, Lingala, Néerlandais, Occitan, Persan, Polonais, Portugais, Quechua, Russe, Suédois, Swahili, Turc, Vietnamien, Wolof, Zoulou.

## Régénérer
`python3 build_words.py` (nécessite internet vers kaikki.org).
