Proyecto de investigación
Ciberbullying
Esta investigación aborda la detección de ciberbullying en publicaciones de Twitter escritas en español peruano mediante la creación y validación de un dataset y la comparación de cuatro modelos de machine learning.
El proyecto responde a una dificultad concreta: los sistemas de detección dependen del lenguaje con el que fueron desarrollados y evaluados. Las expresiones regionales, los usos locales y las formas implícitas de agresión requieren datos y criterios adecuados al contexto.
El problema
Detectar también exige comprender el lenguaje
La identificación automática del ciberbullying requiere reconocer expresiones explícitas, formas indirectas de agresión y usos lingüísticos que cambian entre países y comunidades. Un sistema entrenado sin atender estas diferencias puede interpretar de manera insuficiente las interacciones regionales.
Lenguaje regional
El español peruano incorpora expresiones y usos que deben ser reconocidos durante la construcción y anotación de los datos.
Datos contextualizados
La calidad de la detección depende de un dataset diseñado para la tarea y validado mediante criterios consistentes.
Comparación verificable
El desempeño de distintos modelos se analiza sobre una misma base para identificar sus capacidades y limitaciones.
Resultados del proyecto
Dos recursos centrales
El artículo científico y el manual metodológico forman una unidad: uno presenta la comparación de modelos y el otro documenta la creación y validación de los datos utilizados.
Comparativa de modelos de machine learning para detectar ciberbullying en Twitter en español peruano
El estudio compara cuatro clasificadores supervisados entrenados y evaluados sobre un dataset anotado para identificar categorías relacionadas con ciberbullying.
Autoría: Ximena M. Cuzcano y Victor H. Ayma · IJACSA, 2020.
Creación y validación de un dataset para la detección de ciberacoso en español peruano
El manual describe el proceso de construcción, validación y preprocesamiento de los datos, incluyendo decisiones vinculadas con el lenguaje regional y el procesamiento de lenguaje natural.
Manual realizado por Ximena Cuzcano-Chavez y publicado como parte de Situada.
Comparación de modelos
Una misma tarea, cuatro aproximaciones
La investigación entrenó y evaluó cuatro métodos tradicionales de aprendizaje supervisado sobre el mismo dataset anotado manualmente.
La comparación permite observar cómo distintas decisiones de clasificación responden ante una tarea lingüística específica y proporciona una base reproducible para investigaciones posteriores.
Naive Bayes
Clasificación probabilística basada en la relación entre características del texto.
Regresión logística multinomial
Estimación de probabilidades para distinguir entre distintas categorías.
Support Vector Machine
Separación de categorías mediante fronteras optimizadas en el espacio de características.
Random Forest
Conjunto de árboles de decisión aplicado a la clasificación de los textos.
Pertinencia regional
Datos y modelos vinculados con el contexto
La diversidad lingüística de América Latina y el Caribe influye directamente en la forma en que se construyen los datasets, se anotan los textos y se evalúa el desempeño de los sistemas automáticos.
Trabajar con español peruano permite documentar decisiones que suelen permanecer invisibles cuando los recursos se desarrollan a partir de variedades lingüísticas más representadas.
Un proyecto incorporado al archivo de Situada
Esta página reúne en un mismo lugar la investigación, el manual metodológico y la información necesaria para consultar y citar sus resultados.
