UAB y big data

Deedu / UAB

2015-2020

PHP, JavaScript, C#

Este es un proyecto que sigue en marcha, en colaboración con la UAB, y que combina algo que no suele ir junto habitualmente: gamificación y big data aplicados a investigación lingüística. La idea de fondo es construir un corpus del castellano actual tal como se usa de verdad, en el registro informal, para poder detectar fenómenos lingüísticos y geolocalizarlos — no el español de los libros de texto, sino el que la gente escribe y dice en su día a día.

Para eso hemos ido haciendo scraping de distintas redes sociales. Empezamos con Twitter, ahora también incluimos Bluesky, y estamos incorporando podcasts y YouTube como fuentes nuevas — cada plataforma con su propia lógica de extracción, porque lo que funciona para texto de redes sociales no sirve igual para transcribir audio de un podcast. Por debajo, el sistema usa PHP, JavaScript y C# según el componente: cada tecnología donde mejor encaja, sin obsesionarme con que todo esté hecho con la misma pila solo por coherencia.

La parte de análisis a gran escala y generación de mapas de resultados es donde entra lo interesante desde el punto de vista técnico: no basta con recopilar texto, hay que procesarlo, detectar patrones y poder representarlos geográficamente para que un investigador vea de un vistazo dónde se concentra tal expresión o tal construcción sintáctica. Es un proyecto a largo plazo por naturaleza — un corpus lingüístico no se termina nunca del todo, simplemente va creciendo y afinándose con el tiempo, y ahí seguimos.