Un joc de cuvinte are nevoie de mai mult decât o listă de șiruri valide. Trebuie să spună ce înseamnă fiecare means, iar sensul este cea mai dificilă parte de stocat.
WordChess plays on a 25×25 board with a 148,941-word English dictionary6, intrări cu o medie de 8,6 litere, unele ajungând la 25. Aceasta este partea ușoară. O listă de cuvinte valide este doar un set de șiruri pe care jocul le va accepta. Partea interesantă este a-i spune unui jucător ce înseamnă șirul de pe tablă means, și a face acest lucru simultan în douăzeci și două de limbi.
Lexicografii trasează o linie clară între un lemă și formele sale flexionale. Lema este cuvântul de bază pe care îl cauți, a alerga, casă, a fi. În jurul lui orbitează un paradigm de forme de suprafață: aleargă, a alergat, alergând. Fiecare poartă același sens de bază, îmbrăcat pentru un rol gramatical diferit.3 Un dicționar își cheltuiește proza pe lemă și lasă umbrele să indice drumul spre casă.
Câte umbre aruncă un cuvânt depinde de limbă. Engleza este analitică: se bazează pe ordinea cuvintelor și pe mici cuvinte auxiliare, astfel încât un verb are rar mai mult decât câteva forme. Finlandeza este aglutinativă, construiește sensul prin lipirea sufixelor pe un radical. Un singur substantiv finlandez se declină în aproximativ cincisprezece cazuri, la singular și plural, înainte ca terminalele posesive și cliticele să se adauge; numărul practic de forme distincte ajunge la mii.4 Maghiara împachetează o întreagă frază în engleză, în casa mea, într-un singur cuvânt, házamban.5
Definițiile provin de la Wiktionary, dicționarul gratuit pe care oricine îl poate edita. Este uriaș și multilingv: proiectul cuprinde peste o sută de ediții active în limbi diferite și zeci de milioane de intrări, scrise colaborativ de voluntari, nu de un consiliu editorial plătit.1 Pentru un joc care rulează în 22 de limbi, niciun alt lexicon gratuit nu se apropie de această acoperire.
Dar acoperirea pe hârtie nu este acoperirea pe care o poți citi cu voce tare. Wiktionary stochează formele flexionate într-un mod care îi scutește pe editorii umani de a scrie aceeași glosă de zece mii de ori. În loc de a formula o definiție, o intrare care nu este lema poartă un șablon de formă, un mic indicator care spune, în esență, „aceasta este o formă gramaticală particulară a acelei leme”.2 Intrarea pentru smoulders nu este proză; este un șablon care se randează ca „forma de persoana a III-a singular la prezent simplu a verbului smoulder”.1
Aceste indicii nu sunt o eroare de rotunjire. Pe Wiktionary în limba engleză, din aproximativ 1,27 milioane de definiții, circa 478.000, adică bine peste o treime, sunt definiții de tip „formă a” și nu sensuri redactate integral.1 Datele sunt acolo. Sunt doar pliate.
Așadar, provocarea care conta nu a fost niciodată „cuvântul lipsește”. A fost faptul că sensul cuvântului se afla într-un șablon pe care un analizator naiv l-ar fi aruncat. Definițiile WordChess au fost construite prin citirea descărcărilor brute Wiktionary și desfășurarea șabloanelor de flexiune limbă cu limbă, învățând analizatorul ce înseamnă fiecare indiciu și rescriindu-l într-o glosă simplă.6
Fiecare limbă își ascunde formele în spate diferiți mecanisme. Spaniola ascunde formele verbale în spatele {{forma verbo}}, rezolvate în „formă verbală a lui X”. Germana folosește {{Grundformverweis Dekl/Konj}} pentru formele declinate și conjugate. Finlandeza se bazează pe {{taivutusmuoto}}. În rusă, adesea nu se stochează deloc un șablon de formă, iar cuvântul flexionat este un simplu redirecționare (собаки → собака) care trebuie urmat pentru a recupera o glosă de tip „formă a”.6 Tratați fiecare convenție, iar acoperirea crește brusc.
| Limbă | Înainte | După | Câștig |
|---|---|---|---|
| Germană | 45% | 92% | +47 |
| Olandeză | 58% | 90% | +32 |
| Finlandeză | 54% | 74% | +20 |
| Rusă | 20% | 70% | +50 |
| Greacă | 15% | 57% | +42 |
Măsurat din notele de proiectare și construcție ale acestui proiect. Procentele reprezintă cota intrărilor din dicționar care conțin o definiție utilizabilă sau o glosă de tip „formă a” rezolvată.
Datele nu au lipsit niciodată. Fuseseră pliate într-un indicator, iar a-i da mașinii cuvântul însemna a învăța să-l desfășoare.
Merită să fim onesti cu privire la ceea ce conține acum jocul. Când WordChess arată că собаки este o formă a собака, „câine”, nu a înțeles nimic. A mapat un șir de caractere pe alt șir de caractere, o glosă, urmând aceleași indicii pe care le-a lăsat un editor uman. Aceasta este lemmatizarea, motorul principal al procesării limbajului natural: reducerea unei forme de suprafață la forma de bază, astfel încât o mașină să aibă de urmărit mai puține entități distincte.7
Acesta este un tip real și util de cunoaștere. Permite jocului să răspundă la întrebarea „ce este acest cuvânt?” în Atena sau în Amsterdam, fără un lexicograf angajat. Dar este cunoaștere-ca-reperare, nu cunoaștere-ca-sens. Glosa este o promisiune că o persoană, citind-o, va recunoaște cuvântul. Mașina deține promisiunea; cititorul furnizează sensul.
Unele limbi ating un plafon pe care niciun analizator nu îl poate ridica, deoarece datele pur și simplu nu există pentru a se desfășura. Intrările din maghiară conțin adesea doar o etimologie și o tabelă de traduceri, fără nicio text de definiție, astfel încât chiar și un cititor perfect pleacă cu mâinile goale. Cazele cele mai dificile se concentrează acolo unde lingvistica este cea mai dificilă: limbile aglutinative, precum finlandeza și maghiara, care generează paradigme enorme, și scrierile chirilică și greacă, unde acoperirea comunității este mai slabă din start. Greaca a urcat de la 15% la 57%; faptul că se oprește mult sub 92% al germanei este un fapt despre sursă, nu despre cod. 6