PlayPendium
WordChess · Matière à réflexion

Apprendre 149 000 mots à une machine, en 22 langues

Un jeu de lettres a besoin de plus qu'une liste de chaînes légales. Il lui faut dire ce que chacune signifie, et le sens est la chose la plus difficile à stocker.

Rédigé et édité en anglais. Cette version française a été produite par traduction automatique ; en cas de doute sur un point précis, l'original anglais fait foi. Lire l'original en anglais →

01 · Le lemme et ses ombres

Un mot, et toutes les formes qu'il prend

WordChess se joue sur un plateau de 25×25 avec un dictionnaire anglais de 148 941 mots 6, des entrées de 8,6 lettres en moyenne, la plus longue en comptant 27. C'est la partie facile. Une liste de mots légaux n'est qu'un ensemble de chaînes que le jeu acceptera. La partie intéressante consiste à dire au joueur ce que la chaîne posée sur le plateau signifie, et à le faire dans vingt-deux langues à la fois.

Les lexicographes tracent une ligne nette entre un lemme et ses formes fléchies. Le lemme est le mot-vedette que l'on consulte : run, house, be. Autour de lui gravite un paradigme de formes de surface : runs, ran, running. Chacune porte le même sens central, habillé pour un rôle grammatical différent. 3 Un dictionnaire consacre sa prose au lemme et laisse les ombres renvoyer vers lui.

Le nombre d'ombres qu'un mot projette dépend de la langue. L'anglais est analytique : il s'appuie sur l'ordre des mots et de petits auxiliaires, si bien qu'un verbe dépasse rarement une poignée de formes. Le finnois est agglutinant : il construit le sens en collant des suffixes sur un radical. Un seul nom finnois se décline selon une quinzaine de cas, au singulier et au pluriel, avant que les désinences possessives et les clitiques ne viennent s'empiler par-dessus ; le décompte pratique des formes distinctes se chiffre en milliers. 4 Le hongrois condense toute une locution anglaise, in my house, en un seul mot : házamban. 5

02 · Un dictionnaire écrit par tout le monde

Où vivent les définitions

Les définitions proviennent du Wiktionnaire, le dictionnaire libre que chacun peut modifier. Il est immense et multilingue : le projet couvre bien plus d'une centaine d'éditions linguistiques actives et des dizaines de millions d'entrées, rédigées collaborativement par des bénévoles plutôt que par un comité éditorial rémunéré. 1 Pour un jeu qui tourne en 22 langues, aucun autre lexique libre n'approche une telle couverture.

Mais une couverture sur le papier n'est pas une couverture que l'on peut donner à lire. Le Wiktionnaire stocke les formes fléchies d'une manière qui épargne aux contributeurs humains d'écrire dix mille fois la même glose. Au lieu d'énoncer une définition, une entrée non-lemme porte un modèle « forme de », un petit pointeur qui dit en substance : « ceci est une forme grammaticale particulière de tel lemme ». 2 L'entrée pour smoulders n'est pas de la prose ; c'est un modèle qui s'affiche comme « third-person singular simple present form of smoulder » (« forme de troisième personne du singulier du présent simple de smoulder »). 1

Ces pointeurs ne sont pas une erreur d'arrondi. Sur le Wiktionnaire anglais, sur environ 1,27 million de définitions, quelque 478 000 — bien plus du tiers — sont des définitions « forme de » plutôt que des sens rédigés. 1 La donnée est là. Elle est simplement repliée.

03 · Un problème d'analyse, non un manque de données

La glose, c'est le dépliage du modèle

Le défi qui comptait n'a donc jamais été « le mot manque ». C'était que le sens du mot logeait dans un modèle qu'un analyseur naïf aurait jeté. Les définitions de WordChess ont été construites en lisant les dumps bruts du Wiktionnaire et en développant les modèles de flexion langue par langue, en apprenant à l'analyseur ce que signifie chaque pointeur et en le réécrivant en une glose ordinaire. 6

Chaque langue cache ses formes derrière une machinerie différente. L'espagnol range les formes verbales derrière {{forma verbo}}, résolu en « forme verbale de X ». L'allemand utilise {{Grundformverweis Dekl/Konj}} pour les formes déclinées et conjuguées. Le finnois s'appuie sur {{taivutusmuoto}}. Le russe ne stocke souvent aucun modèle de forme : le mot fléchi est une simple redirection (собаки → собака) qu'il faut suivre pour retrouver une glose « forme de ». 6 Traitez chaque convention, et la couverture bondit.

Couverture des définitions, avant → après développement des modèles
LangueAvantAprèsGain
Allemand45%92%+47
Néerlandais58%90%+32
Finnois54%74%+20
Russe20%70%+50
Grec15%57%+42

Mesuré d'après les notes de conception et de construction de ce projet. Les pourcentages représentent la part des entrées du dictionnaire portant une définition exploitable ou une glose « forme de » résolue.

La donnée n'a jamais manqué. Elle était repliée dans un pointeur, et donner le mot à une machine, c'était apprendre à la déplier.

04 · Ce que « connaître un mot » signifie pour une machine

Une chaîne, et une phrase à son sujet

Il vaut la peine d'être honnête sur ce que le jeu détient désormais. Quand WordChess indique que собаки est une forme de собака, « chien », il n'a rien compris. Il a associé une chaîne à une autre chaîne, une glose, en suivant les mêmes pointeurs qu'un contributeur humain a laissés derrière lui. C'est la lemmatisation, cheville ouvrière du traitement automatique des langues : réduire une forme de surface à sa base pour qu'une machine ait moins d'objets distincts à suivre. 7

C'est une forme de savoir réelle et utile. Elle permet au jeu de répondre à « quel est ce mot ? » à Athènes comme à Amsterdam sans lexicographe attitré. Mais c'est un savoir-consultation, non un savoir-sens. La glose est la promesse qu'une personne, en la lisant, reconnaîtra le mot. La machine tient la promesse ; le lecteur fournit le sens.

Où se trouve le mur

Certaines langues butent sur un plafond qu'aucun analyseur ne peut soulever, parce que la donnée à déplier n'existe tout simplement pas. Les entrées hongroises ne portent souvent qu'une étymologie et un tableau de traductions, sans aucun texte de définition, si bien que même un lecteur parfait repart les mains vides. Les cas les plus difficiles se concentrent là où la linguistique est la plus ardue : les langues agglutinantes comme le finnois et le hongrois, qui engendrent d'énormes paradigmes, et les écritures cyrillique et grecque, où la couverture communautaire est au départ plus mince. Le grec est passé de 15 % à 57 % ; qu'il s'arrête bien en deçà des 92 % de l'allemand est un fait qui tient à la source, non au code. 6

Sources & notes
  1. Wikipedia, "Wiktionary", scale, multilingual structure, collaborative editing, and the "form of" definition counts (including the smoulders example). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", how non-lemma entries point back to a lemma on the definition line. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), analytic vs. agglutinative typology; the házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, template-expansion rules per language (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) and coverage figures. Measured from this project's design and build notes.
  7. Wikipedia, "Lemmatization", reducing inflected forms to a base form in NLP. en.wikipedia.org/wiki/Lemmatization
  8. Further reading on Wiktionary, [1011.1368] Transformation of Wiktionary entry structure into tables and relations in a relational database schema. arxiv.org.
  9. Further reading on Wiktionary, CEFR vocabulary level as a predictor of user interest in English Wiktionary entries. doi.org.
  10. Further reading on Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026