Este proyecto fue desarrollado en VS-Code desde varios notebooks. Estos fueron separados por periodos para cada integrante del grupo. Se implementaron varias librerías para ordenar, analizar y graficar los datos, estas son: Pandas, Scikit‑Learn (sklearn) , Seaborn, Matplotlib y Numpy.
Esta es la fuente de los datos que extraimos para analizar. Acá se encuentran los datos de las pruebas desde la admisión 2004 - 2025. Son alrededor de 5.5 millones de datos.
Cada proceso tiene una gran información para el proyecto:
id_estudiante: Identificador único de resgistro (Anonimo)
dependencia_colegio: Tipo de dependencia del establecimiento de egreso
rama_educacional: Modalidad de egreso (Humanista-Científica, Técnico Profesional)
situacion_egreso: Condición del postulante al rendir la prueba
cod_region: Código de la región del establecimiento de egreso
cod_comuna: Código de la comuna del establecimiento de egreso
puntaje_lectora: Puntaje de la prueba Comprensión Lectora
puntaje_m1: Puntaje de la prueba de Competencia Matemática
id_colegio_rbd: Rol base de datos de los establecimientos
promedio_notas: Promedio de notas de enseñanza media
puntaje_nem: Puntaje asociado al promedio de notas de enseñanza media
puntaje_ranking: Puntaje asociado a una bonificación factor del desempeño del estudiante en su propio contexto escolar
Además nosotros agregamos dos columnas nuevas, las cuales son:
year_proceso: Año del proceso
%_de_logro_obligatorias: Procentaje del promedio de las pruebas obligatorias (Comprensión Lectora/Competencia Matemática)
Primero que nada subimos todos los archivos .CSV en una carpeta de google drive para optimizar el almacenamiento y la carga de estos mismos. Luego desde los notebooks de análisis los cargamos como dataframes gracias a las funciones de Pandas. Estos se ven de la siguente manera.
Cada fila es un estudiante que rindio la prueba.
Como lo habíamos mencionado separamos nuestro proyecto en 3 partes para cada integrante.
De tal modo que sea más ordenado y más facil de análizar por la gran cantidad de datos.
Luego de limpiar y analizar todos estos periodos, los volvimos a unir en un único dataframe para guardarlo. Esto nos facilitaba para pasar a la siguente etapa y tener todos el mismo conjunto de datos. Nuevamente separamos por partes nuestro trabajo y esta vez para poder responder las preguntas planteadas.