PlayPendium
WordChess · Alimento para el pensamiento

Enseñar a una máquina 149.000 palabras en 22 idiomas

Un juego de palabras necesita algo más que una lista de cadenas válidas. Necesita decir qué significa cada una, y el significado es lo más difícil de almacenar.

Redactado y editado en inglés. Esta versión en español se ha generado mediante traducción automática; cuando la precisión importe, la versión de referencia es el original en inglés. Leer el original en inglés →

01 · El lema y sus sombras

Una palabra y todas las formas que adopta

WordChess se juega en un tablero de 25×25 con un diccionario inglés de 148.941 palabras 6, con entradas de 8,6 letras de media y algunas de hasta 25. Esa es la parte fácil. Una lista de palabras válidas no es más que un conjunto de cadenas que el juego aceptará. Lo interesante es decirle al jugador qué significa la cadena que hay en el tablero, y hacerlo en veintidós idiomas a la vez.

Los lexicógrafos trazan una línea nítida entre un lema y sus formas flexionadas. El lema es la entrada que se consulta: run, house, be. A su alrededor orbita un paradigma de formas de superficie: runs, ran, running. Todas llevan el mismo sentido central, vestido para un papel gramatical distinto. 3 Un diccionario dedica su prosa al lema y deja que las formas derivadas remitan a él.

Cuántas sombras proyecta una palabra depende del idioma. El inglés es analítico: se apoya en el orden de las palabras y en pequeñas partículas auxiliares, de modo que un verbo rara vez tiene más de un puñado de formas. El finés es aglutinante: construye el significado pegando sufijos a una raíz. Un solo sustantivo finés se flexiona en unos quince casos, en singular y plural, antes de que se apilen encima las terminaciones posesivas y los clíticos; el recuento práctico de formas distintas asciende a millares. 4 El húngaro comprime toda una locución inglesa, in my house, en una sola palabra: házamban. 5

02 · Un diccionario escrito por todos

Dónde viven las definiciones

Las definiciones proceden de Wiktionary, el diccionario libre que cualquiera puede editar. Es enorme y multilingüe: el proyecto abarca bastante más de cien ediciones lingüísticas activas y decenas de millones de entradas, escritas en colaboración por voluntarios y no por un consejo editorial remunerado. 1 Para un juego que funciona en 22 idiomas, ningún otro léxico libre se le acerca en cobertura.

Pero la cobertura sobre el papel no es cobertura que puedas mostrar. Wiktionary guarda las formas flexionadas de un modo que evita a los editores humanos escribir diez mil veces la misma glosa. En lugar de redactar una definición, una entrada que no es lema lleva una plantilla de «forma de»: un pequeño puntero que viene a decir «esta es una forma gramatical concreta de aquel lema». 2 La entrada de smoulders no es prosa; es una plantilla que se muestra como «tercera persona del singular del presente simple de smoulder». 1

Estos punteros no son un error de redondeo. En el Wiktionary inglés, de aproximadamente 1,27 millones de definiciones, unas 478.000 —bastante más de un tercio— son definiciones de «forma de» y no sentidos redactados. 1 Los datos están ahí. Solo que están plegados.

03 · Un problema de análisis, no una brecha de datos

La glosa consiste en desplegar la plantilla

Así que el reto que importaba nunca fue «falta la palabra». Fue que el significado de la palabra estaba dentro de una plantilla que un analizador ingenuo habría descartado. Las definiciones de WordChess se construyeron leyendo los volcados en bruto de Wiktionary y expandiendo las plantillas de flexión idioma por idioma, enseñando al analizador qué significa cada puntero y reescribiéndolo como una glosa llana. 6

Cada idioma esconde sus formas tras una maquinaria distinta. El español guarda las formas verbales tras {{forma verbo}}, que se resuelve como «forma verbal de X». El alemán usa {{Grundformverweis Dekl/Konj}} para las formas declinadas y conjugadas. El finés se apoya en {{taivutusmuoto}}. El ruso a menudo no guarda plantilla alguna: la palabra flexionada es una simple redirección (собаки → собака) que hay que seguir para recuperar una glosa de «forma de». 6 Si se atiende a cada convención, la cobertura se dispara.

Cobertura de definiciones, antes → después de la expansión de plantillas
IdiomaAntesDespuésGanancia
Alemán45%92%+47
Neerlandés58%90%+32
Finés54%74%+20
Ruso20%70%+50
Griego15%57%+42

Medido a partir de las notas de diseño y construcción de este proyecto. Los porcentajes son la proporción de entradas del diccionario que llevan una definición utilizable o una glosa de «forma de» ya resuelta.

Los datos nunca faltaron. Estaban plegados dentro de un puntero, y darle la palabra a una máquina consistió en aprender a desplegarlo.

04 · Lo que significa "conocer una palabra" para una máquina

Una cadena y una frase que habla de ella

Conviene ser honesto sobre lo que el juego contiene ahora. Cuando WordChess muestra que собаки es una forma de собака, «perro», no ha entendido nada. Ha asociado una cadena con otra cadena, una glosa, siguiendo los mismos punteros que dejó puestos un editor humano. Esto es lematización, el caballo de batalla del procesamiento del lenguaje natural: reducir una forma de superficie a su base para que la máquina tenga menos elementos distintos que seguir. 7

Ese es un modo de saber real y útil. Permite que el juego responda «¿qué es esta palabra?» en Atenas o en Ámsterdam sin tener un lexicógrafo en plantilla. Pero es un saber por consulta, no un saber por significado. La glosa es la promesa de que una persona, al leerla, reconocerá la palabra. La máquina sostiene la promesa; el lector aporta el sentido.

Dónde está el muro

Algunos idiomas chocan con un techo que ningún analizador puede levantar, porque sencillamente no hay datos que desplegar. Las entradas húngaras llevan a menudo solo una etimología y una tabla de traducciones, sin texto de definición alguno, de modo que hasta un lector perfecto se queda con las manos vacías. Los casos más difíciles se concentran allí donde la lingüística es más difícil: lenguas aglutinantes como el finés y el húngaro, que generan paradigmas enormes, y los alfabetos cirílico y griego, donde la cobertura de la comunidad es más escasa de partida. El griego subió del 15 % al 57 %; que se quede muy por debajo del 92 % del alemán es un hecho sobre la fuente, no sobre el código. 6

Fuentes & notas
  1. Wikipedia, «Wiktionary», escala, estructura multilingüe, edición colaborativa y los recuentos de definiciones de «forma de» (incluido el ejemplo de smoulders ). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, «Wiktionary:Form-of templates», cómo las entradas no lema apuntan de vuelta a un lema en la línea de definición. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, «Lemma (morphology)», el lema como forma de citación; el paradigma de formas flexionadas. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, «Finnish noun cases», los aproximadamente quince casos, en singular y plural, antes de que los sufijos posesivos y los clíticos se apilen encima. en.wikipedia.org/wiki/Finnish_noun_cases. Contexto más amplio: en.wikipedia.org/wiki/Finnish_grammar
  5. «Morphology of Different Languages», Psychology of Language (BCcampus Open Textbook), tipología analítica frente a aglutinante; el házamban ejemplo. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. Pipeline de definición de WordChess, reglas de expansión de plantillas por idioma (español {{forma verbo}}, alemán {{Grundformverweis}}, finés {{taivutusmuoto}}, redirecciones al ruso) y cifras de cobertura. Medido a partir de las notas de diseño y construcción de este proyecto.
  7. Wikipedia, «Lemmatización», reducción de las formas flexionadas a una forma base en PLN. en.wikipedia.org/wiki/Lemmatization
  8. Lectura adicional en Wiktionary, [1011.1368] Transformación de la estructura de entradas de Wiktionary en tablas y relaciones en un esquema de base de datos relacional. arxiv.org.
  9. Lectura adicional en Wiktionary, el nivel de vocabulario CEFR como predictor del interés del usuario en las entradas de Wiktionary en inglés. doi.org.
  10. Lectura adicional sobre Lemmatización, BioLemmatizer: una herramienta de lematización para el procesamiento morfológico de texto biomédico - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
← Back to WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Inspirations · © 2026