Recursos esenciales para el periodista de datos (3). La limpieza de la información

—

image alt text

El periodismo de datos se ha convertido en una de las grandes oportunidades para esta profesión. Los grandes proyectos requieren una importante inversión, pero unos conocimientos básicos, interés y herramientas relativamente sencillas permiten realizar trabajos de gran valor.

Eso es lo que Antonio Delgado demostró en el taller de periodismo de datos que impartió en el módulo de Nuevas narrativas del Máster de Innovación en Periodismo (MIP) de la UMH. Aquí, como complemento o aperitivo, se apuntan algunos de los recursos esenciales para empezar a desenvolverse en esta innovadora especialidad.

Una vez localizada y scrapeada la información, comienza el proceso de depuración de datos. Este paso constituye uno de los más laboriosos y, al mismo, de los más determinantes para la correcta interpretación de los datos que después se quieren analizar y visualizar.

Cuando se captura información de una web y, sobre todo, de un pdf, lo más probable es que los campos de texto y de cifras presenten irregularidades e incorrecciones. El proceso de depuración puede realizarse manualmente y caso a caso, pero esto puede resultar muy laborioso e incluso inoperante cuando se trabaje con un gran número de datos. La principal herramienta para este cometido es Open Refine (antes, Google Refine).

Algunas de las principales operaciones a llevar a cabo son las siguientes:

  • Eliminar espacios consecutivos, al principio o al final de los campos.
  • Separar o unir columnas.
  • Filtrar y unificar datos.
  • Corregir erratas y agrupar registros a través de métodos como el clustering. Probablemente, ésta es la capacidad más potente de Open Refine.

Para hacerse una idea sobre este proceso, es posible ver la demostración que David Cabo realizó en la Segunda sesión formativa de periodismo de datos: Análisis y tratamiento de datos organizada por el Grupo de Periodismo de datos del Medialab Prado de Madrid.

Una vez depurados los datos, ya solo restan otros dos pasos:

  • El análisis de la información (4).
  • La visualización de los datos (5).

Todos ellos se irán desgranando, en breve y poco a poco, en este blog.

Entradas recientes

Nace ComunIA, un puente entre la universidad y el profesional ante el tsunami de la IA

Félix Arias
—

Diana Salinas, cofundadora de Cuestión Pública: “La IA es para el periodismo de investigación basado en datos como un Ferrari. Yo les digo a los míos: llegó la hora de montarnos en el Ferrari”

Miguel Carvajal
—

Antonio Delgado, cofundador de DATADISTA: “Es muy importante poner nombre y rostro a las historias que hay detrás de un Excel”

Jose A. García Avilés
—

Matthew Dicks, experto en storytelling: “Si contamos historias en clase, conseguimos que los estudiantes se concentren, estén atentos y recuerden mejor lo que explicamos”

Jose A. García Avilés
—

Siete medios que apuestan por un periodismo híbrido, multiplataforma y participativo donde prima la calidad

Jose A. García Avilés
—

Daniele Grasso, periodista de datos en El País: «La IA aplicada a la programación me ha dado superpoderes. Bien utilizada, sirve para hacer mejor periodismo»

Félix Arias
—

Universidad con Sello de Excelencia Europea

La Universidad Miguel Hernández de Elche consiguió el Sello de Excelencia Europea 500+ en 2004, y posteriormente fue renovada en dos ocasiones consecutivas, la primera en 2007 y la segunda en 2009.