PlayPendium
WordChess · Pagkain para sa Pag-iisip

Pagtuturo sa isang makina ng 149,000 salita, sa 22 wika

Ang isang laro ng salita ay nangangailangan ng higit sa isang listahan ng mga legal na string. Kailangan nito na sabihin kung ano ang bawat isa ang kahulugan, at ang kahulugan ang pinakamahirap na bagay na iimbak.

01 · Ang lemma at ang mga anino nito

Isang salita, at lahat ng hugis na ito ay tumatanggap

Ang WordChess ay naglalaro sa isang 25×25 na board gamit ang 148,941-salita Ingles diksyunaryo6, na may average na 8.6 na letra sa bawat entry, may ilang tumatagal hanggang 25. Ito ang madaling bahagi. Ang listahan ng mga legal na salita ay isang set lamang ng mga string na tatanggapin ng laro. Ang interesanteng bahagi ay ang pagpapaalam sa manlalaro kung ano ang kahuluganng string sa board, at ang paggawa nito sa dalawampung dalawang wika nang sabay-sabay.

Ang mga leksikografo ay gumuguhit ng malinaw na linya sa pagitan ng isang lemma at ang mga anyong nagbago nito. Ang lemma ang pangunahing salitang tinitingnan, run, house, be. Palibot nito ang isang parangma ng mga anyong ibinubunyag: runs, ran, running. Bawat isa ay may iisang pangunahing kahulugan, nakasuot para sa iba't ibang papel na gramatikal.3 Ginugol ng diksyunaryo ang kanyang mga talata sa lemma at iniwan ang mga anino upang ipakita ang tahanan.

Ilang anino ang ibinububong ng isang salita ay nakadepende sa wika. Ang Ingles ay analytic: nakadepende ito sa pagkakasunod-sunod ng mga salita at sa ilang mga salitang tagapagtulungan, kaya bihira ang may higit sa ilang anyon ang pandiwa. Ang Finnish ay agglutinative, itinatayo nito ang kahulugan sa pamamagitan ng pagkakabit ng mga suffix sa isang ugat. Isang iisang pangngalan sa Finnish nagbabago para sa humigit-kumulang limnapung kaso, sa singular at plural, bago ang mga possessive endings at clitics ay nakatayo sa itaas; ang praktikal na bilang ng magkakaibang anyos ay umabot sa libu-libo.4 Ang Hungarian ay naglalaman ng buong English na parirala, in my house, sa isang salita, házamban.5

02 · Isang diksyunaryo na isinulat ng lahat

Saan nakatira ang mga kahulugan

Manggagaling ang mga kahulugan sa Wiktionary, ang malayang diksyunaryo na maaaring i-edit ng sinuman. Ito ay malaki at multilingual: saklaw ng proyekto ay higit sa isang daang aktibong edisyon ng wika at libu-libong entry, na isinulat nang kolaboratibo ng mga boluntaryo sa halip na isang bayad na editorial board.1 Para sa isang laro na tumatakbo sa 22 wika, walang ibang malayang leksikon na malapit sa saklaw nito.

Ngunit ang saklaw sa papel ay hindi saklaw na mababasa nang malakas. Iniaimbak ng Wiktionary ang mga inflected forms sa paraang nagliligtas sa mga human editors mula sa pag-isulat ng parehong gloss na sampung libu beses. Sa halip na ibigay ang kahulugan, ang non-lemma entry ay may form-of template, isang maliit na pointer na nagsasabi, sa kabuuan, na "ito ay isang partikular na gramatikal na anyos ng lemma na iyon."2 Ang entry para sa smoulders ay hindi prosa; ito ay isang template na nagre-render bilang "third-person singular simple present of smoulder."1

Ang mga pointer na ito ay hindi simpleng pagkakamali sa pagbalot. Sa English Wiktionary, mula sa mga halos 1.27 milyong kahulugan, ang mga 478,000, na sobrang isang ikatlo, ay mga "form of" definition kaysa sa mga sinulat na kahulugan.1 Nandoon ang data. Ito ay nakatago lamang.

03 · Isang problema sa pag-parse, hindi kakulangan ng data

Ang gloss ay nag-unfold ng template

Kaya ang hamon na mahalaga ay hindi kailanman "kulang ang salita." Ito ay ang kahulugan ng salita ay nasa loob ng isang template na ibubuhos ng isang simpleng parser. Ang mga definition ng WordChess ay ginawa sa pamamagitan ng pagbabasa ng raw Wiktionary dumps at pag-expand ng mga inflection template wika-wika, pagtuturo sa parser ng kahulugan ng bawat pointer at pag-rewrite nito bilang isang simpleng gloss.6

Bawat wika ay nagtatago ng mga anyo nito sa likod ng iba't ibang mekanismo. Ang Spanish ay nagtatago ng mga anyo ng pandiwa sa likod ng {{forma verbo}}, na inresolba bilang "verbal form of X." Ang German ay gumagamit ng {{Grundformverweis Dekl/Konj}} para sa mga anyong nakadeklina at nakakonjugado. Ang Finnish ay nakadepende sa {{taivutusmuoto}}. Madalas, hindi naglalagay ang Russian ng anumang template ng anyo; ang nakababagong salita ay isang malusog redirect (собаки → собака) na dapat sundin upang maibalik ang "form of" gloss.6 Ihanda ang bawat konbensyon, at lalaki ang saklaw.

Saklaw ng kahulugan, bago → pagkatapos ng pagpapalawak ng template
WikaBagoPagkataposPagtaas
German45%92%+47
Dutch58%90%+32
Finnish54%74%+20
Russian20%70%+50
Greek15%57%+42

Sinukat mula sa mga tala ng disenyo at pagbuo ng proyektong ito. Ang mga porsyento ay bahagi ng mga entry sa diksyunaryo na may gamit na kahulugan o na-resolve na "form of" gloss.

Hindi kailanman nawawala ang datos. Ipinagkumpol ito sa isang pointer, at ang pagbibigay sa makina ng salita ay nangangahulugang natututo itong i-unfold nito.

04 · Ano ang ibig sabihin ng "pag-alam ng isang salita" sa isang makina

Isang string, at isang pangungusap tungkol dito

Worth it na maging tapat sa kung ano ang hawak ng laro ngayon. Kapag ipinapakita ng WordChess na собаки ay isang anyo ng собака, "aso," ay hindi nito maintindihan ang anumang bagay. Ipinagmapa lamang nito ang isang string sa ibang string, isang gloss, sa pamamagitan ng pagsumikap sa mga parehong pointer na iniwan ng isang human editor. Ito ay lemmatization, ang workhorse ng natural-language processing: pagbabawas ng isang surface form sa kanyang base upang may mas kaunting magkakaibang bagay na susundan ng isang makina.7

Ito ay isang tunay at makabuluhang uri ng pag-alam. Pinapayagan nito ang laro na sagutin ang "ano ang salitang ito?" sa Athens o Amsterdam nang walang lexicographer sa staff. Ngunit ito ay pag-alam-bilang-lookup, hindi pag-alam-bilang-kahulugan. Ang gloss ay isang pangakong ang isang tao, sa pagbabasa nito, ay kilalanin ang salita. Ang makina ang naghahawak ng pangako; ang mambabasa ang nagbibigay ng kahulugan.

Saan nasa pader

May mga wika na tumatama sa isang hangganan na hindi maaaring itaas ng alinmang parser, dahil ang data ay simpleng wala rito para unroll. Madalas ang mga entry ng Hungarian ay may etymology at isang talahanayan ng mga pagsasalin lamang, walang kahit anong teksto ng kahulugan, kaya kahit isang perpektong mambabasa ay nagpapaalala nang walang laman. Ang pinakamahirap na mga kaso ay nakakalat kung saan pinakamahirap ang linguistics: ang mga agglutinative na wika tulad ng Finnish at Hungarian, na nagpapatubo ng mga enormous na paradigm, at ang mga Cyrillic at Greek na script, kung saan ang community coverage ay mas manipis na simula pa. Tumataas ang Greek mula 15% patungo sa 57%; ang pagtigil nito nang malayo sa 92% ng German ay isang katotohanan tungkol sa source, hindi sa code. 6

Mga source & tala
  1. Wikipedia, "Wiktionary", scale, multilingual structure, collaborative editing, at ang mga bilang ng "form of" na kahulugan (kasama ang smoulders halimbawa). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", kung paano ang mga non-lemma na entry ay tumuturo pabalik sa isang lemma sa linya ng kahulugan. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", ang lemma bilang anyong sitasyon; ang paradigma ng mga anyong inflected. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", ang mga humigit-kumulang limnapung kaso, sa singular at plural, bago ang mga possessive suffix at clitics na nakatayo sa itaas. en.wikipedia.org/wiki/Finnish_noun_cases. Mas malawak na konteksto: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), ang analytic laban sa agglutinative na tipolohiya; ang házamban halimbawa. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, mga tuntunin sa pagpapalawak ng template bawat wika (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) at mga numero ng saklaw. Sinukat mula sa mga tala ng disenyo at pagbuo ng proyektong ito.
  7. Wikipedia, "Lemmatization", pagpapababa ng mga anyong inflected patungo sa isang base form sa NLP. en.wikipedia.org/wiki/Lemmatization
  8. Karagdagang pagbasa sa Wiktionary, [1011.1368] Transformation of Wiktionary entry structure into tables and relations in a relational database schema. arxiv.org.
  9. Karagdagang pagbasa sa Wiktionary, CEFR vocabulary level as a predictor of user interest in English Wiktionary entries. doi.org.
  10. Karagdagang pagbasa sa Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
← Back to WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Inspirations · © 2026