Reducción de ruido en corpus textuales para mejorar la atribución de autoría mediante redes neuronales artificiales
Ponente(s): Eduardo Abraham Díaz Pérez
La atribución de autoría mediante métodos computacionales depende no sólo de la arquitectura y el entrenamiento del modelo, sino también de la calidad y uniformidad de los datos que conforman el corpus. En trabajos previos se desarrolló una red neuronal artificial para la clasificación de textos de acuerdo con su autor a partir de características cuantificables extraídas de las obras. El análisis posterior de los resultados permitió identificar posibles fuentes de ruido en el corpus utilizado, asociadas con diferencias entre los textos que no necesariamente corresponden al estilo de sus autores y que podrían haber influido en el desempeño del modelo.
A partir de estas observaciones, el trabajo actual se concentra en la construcción de un nuevo corpus mediante procedimientos de selección, normalización y limpieza de los textos, con el propósito de reducir factores ajenos a las características autorales que se pretende modelar. La mayor uniformidad del corpus permitirá controlar algunas de las variables presentes en los experimentos anteriores y evaluar con mayor precisión la capacidad de la red para identificar patrones asociados con la autoría.