Proyecto de investigación

Ciberbullying

Desafíos lingüísticos en la detección de violencia digital en América Latina y el Caribe

Esta investigación aborda la detección de ciberbullying en publicaciones de Twitter escritas en español peruano mediante la creación y validación de un dataset y la comparación de cuatro modelos de machine learning.

El proyecto responde a una dificultad concreta: los sistemas de detección dependen del lenguaje con el que fueron desarrollados y evaluados. Las expresiones regionales, los usos locales y las formas implícitas de agresión requieren datos y criterios adecuados al contexto.

Procesamiento de lenguaje natural Machine learning Español peruano Seguridad digital

El problema

Detectar también exige comprender el lenguaje

La identificación automática del ciberbullying requiere reconocer expresiones explícitas, formas indirectas de agresión y usos lingüísticos que cambian entre países y comunidades. Un sistema entrenado sin atender estas diferencias puede interpretar de manera insuficiente las interacciones regionales.

Lenguaje regional

El español peruano incorpora expresiones y usos que deben ser reconocidos durante la construcción y anotación de los datos.

Datos contextualizados

La calidad de la detección depende de un dataset diseñado para la tarea y validado mediante criterios consistentes.

Comparación verificable

El desempeño de distintos modelos se analiza sobre una misma base para identificar sus capacidades y limitaciones.

Resultados del proyecto

Dos recursos centrales

El artículo científico y el manual metodológico forman una unidad: uno presenta la comparación de modelos y el otro documenta la creación y validación de los datos utilizados.

Primera página del artículo sobre modelos de clasificación para detectar ciberbullying en español peruano
Artículo científico

Comparativa de modelos de machine learning para detectar ciberbullying en Twitter en español peruano

El estudio compara cuatro clasificadores supervisados entrenados y evaluados sobre un dataset anotado para identificar categorías relacionadas con ciberbullying.

Autoría: Ximena M. Cuzcano y Victor H. Ayma · IJACSA, 2020.

Portada del manual de creación y validación de un dataset para detectar ciberacoso en español peruano
Manual metodológico

Creación y validación de un dataset para la detección de ciberacoso en español peruano

El manual describe el proceso de construcción, validación y preprocesamiento de los datos, incluyendo decisiones vinculadas con el lenguaje regional y el procesamiento de lenguaje natural.

Manual realizado por Ximena Cuzcano-Chavez y publicado como parte de Situada.

Comparación de modelos

Una misma tarea, cuatro aproximaciones

La investigación entrenó y evaluó cuatro métodos tradicionales de aprendizaje supervisado sobre el mismo dataset anotado manualmente.

La comparación permite observar cómo distintas decisiones de clasificación responden ante una tarea lingüística específica y proporciona una base reproducible para investigaciones posteriores.

MODELO 01

Naive Bayes

Clasificación probabilística basada en la relación entre características del texto.

MODELO 02

Regresión logística multinomial

Estimación de probabilidades para distinguir entre distintas categorías.

MODELO 03

Support Vector Machine

Separación de categorías mediante fronteras optimizadas en el espacio de características.

MODELO 04

Random Forest

Conjunto de árboles de decisión aplicado a la clasificación de los textos.

Resultado principal Support Vector Machine obtuvo el mejor desempeño entre los cuatro clasificadores evaluados.

Pertinencia regional

Datos y modelos vinculados con el contexto

La diversidad lingüística de América Latina y el Caribe influye directamente en la forma en que se construyen los datasets, se anotan los textos y se evalúa el desempeño de los sistemas automáticos.

Trabajar con español peruano permite documentar decisiones que suelen permanecer invisibles cuando los recursos se desarrollan a partir de variedades lingüísticas más representadas.

La detección automática puede contribuir a entornos digitales más seguros cuando sus datos, categorías y criterios responden al lenguaje de las comunidades donde será utilizada.

Autoría

Ximena Cuzcano-Chavez

El proyecto y el manual metodológico fueron desarrollados por Ximena Cuzcano-Chavez. El artículo científico fue realizado junto con Victor H. Ayma.

Referencia del artículo

Cuzcano, X. M., & Ayma, V. H. (2020). “A Comparison of Classification Models to Detect Cyberbullying in the Peruvian Spanish Language on Twitter”. International Journal of Advanced Computer Science and Applications, 11(10). DOI: 10.14569/IJACSA.2020.0111018.

Un proyecto incorporado al archivo de Situada

Esta página reúne en un mismo lugar la investigación, el manual metodológico y la información necesaria para consultar y citar sus resultados.

Volver a Situada  →
Scroll to Top