Disease Area
Pediatric Oncology — Hematologic Malignancies
Specific Research Focus
Genomic marker–driven leukemia subtype classification, MRD-based relapse prediction, and precision therapy matching in children and adolescents
Dataset Theme / Edition
Pediatric Leukemia AI Training Dataset, Cross-Sectional + Longitudinal Edition
Short Dataset Summary
A fully synthetic, biologically constrained pediatric leukemia dataset of 1,000 patients and 40,267 longitudinal clinical visits. Covers five diagnostic categories (ALL-B, ALL-T, AML, Mixed-lineage, No leukemia) with 41 cross-sectional features and 28 visit-level features per record, spanning demographics, hematology, genomics, and COG/BFM protocol-aligned treatment trajectories
Intended Research Applications
Leukemia subtype classification, MRD-based relapse prediction, treatment response modeling, CAR-T and BMT eligibility prediction, genomic biomarker explainability (SHAP/LIME), pediatric survival analysis, TimeGAN conditional data generation, federated learning simulation across children's hospital networks
Total Number of Patients
1,000 synthetic patients (90.2% leukemia-positive: ALL-B 545, AML 200, ALL-T 104, Mixed-lineage 53, No leukemia 98)
Number of Features / Parameters
69 unique features total — 41 cross-sectional (Part A) + 28 longitudinal visit-level (Part B); 20 static features + 19 normalized dynamic sequence features in ML-ready arrays
Data Modalities Included
Demographics & predisposition, clinical presentation, hematology & bone marrow (CBC, blast%, LDH), genomics & molecular profiling (fusion genes, chromosomal abnormalities, somatic mutations, immunophenotype, MRD), risk stratification, longitudinal CBC trends, treatment response & toxicity, temporal event flags
Recommended AI Tasks
Multi-class classification, binary detection, regression (risk/survival scoring), sequence modeling (LSTM / Transformer), TimeGAN synthetic generation, survival analysis (Cox/AFT), XAI/SHAP feature attribution, federated learning
Dataset Size
16.0 MB total across 9 files — CSV (Part A: 261 KB, Part B: 6.1 MB), NumPy padded array (1000 × 48 × 19, float32: 3.5 MB), attention mask, static/dynamic CSVs, and metadata JSON
Release Date
May 2026
Why This Dataset Exists
Real pediatric oncology data is extraordinarily difficult to access due to HIPAA/GDPR protections, pediatric consent requirements, and institutional data-sharing barriers. This dataset enables AI researchers, clinical data scientists, and startup teams to develop, benchmark, and validate leukemia ML models without requiring IRB approval or real patient data access
Real-World Problem Addressed
Each year ~400,000 children worldwide are diagnosed with cancer; leukemia is the most common. Late or misclassified diagnosis, failure to predict MRD-driven relapse, and suboptimal therapy matching are leading causes of treatment failure. This dataset directly supports AI development for earlier subtype identification, relapse risk stratification, and data-driven precision therapy selection in resource-constrained pediatric oncology settings