Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos