El proyecto consisten en extraer información estructurada y no estructurada de la web, bajo criterios técnicos, científicos y normativos, para la identificación, riesgo y comunicación de posibles riesgos y amenazas a la bioseguridad sanitaria a través de un canal seguro para su atención y seguimiento.
La arquitectura propuesta hasta el momento, consta de 3 módulos a desarrollar:
El modulo extractor está diseñado para extraer información relevante sobre noticias o eventos de importancia nacional o internacional realcionados con temas zoosanitarios. Utilizando técnicas avanzadas de raspado web (Web Scraping), este módulo es capaz de obtener datos de diversas fuentes en línea mediante el uso de software especializado como crawlers y bots. Estas herramientas automatizadas reciben URLs específicas proporcionadas, recolectando textos y contenido significativo que luego se integra en el sistema para su análisis y difusión.
Una vez que la información ha sido extraída, el módulo de análisis procede a analizarla y transformarla en conocimiento estructurado de alto valor para el usuario. Empleano técnicas de machine learning para el tratamiento y normalización de datos, lo que nos permite identificar patrones, tendencias y obtener insights significativos.
Mostrar toda la información almacenada en la base de datos en una página web que permita al usuario ver el conocimiento extraído de los textos, así como realizar solicitudes de búsqueda al módulo extractor, entre otras funciones (por definirlas).
Se sugiere implementar la técnica de web scraping para la extracción eficiente de datos, la cual automatiza el proceso de recolección y almacenamiento de información de sitios web. Esta metodología opera a través de algoritmos especializados que navegan y examinan las páginas web, con el fin de obtener los datos requeridos. Para optimizar este proceso, se desarrollarán bots programados (spiders o crawlers) que realizarán el scraping de manera automática, capturando datos en formatos estructurados tales como CSV y JSON.
Es un bot que sistemáticamente navega por la web para indexar el contenido de los sitios web.
Su principal objetivo es descubrir y clasificar páginas para los motores de búsqueda. Los crawlers recopilan principalmente hipervínculos y metadatos de un sitio web.
Su función principal es rastrear y recopilar información de manera automatizada en la web.
Es un tipo de crawler, son el instrumento de los motores de búsqueda para rastrear la web y clasificar su contenido, ayudan a identificar nuevo material actualizando el existente o identificando las páginas que muestran mensajes de error.