inference-optimization 2 vLLM and High-Throughput LLM Serving: PagedAttention and Continuous Batching Jul 9, 2026 GPU Optimization for ML Workloads: CUDA, Memory Management, and Parallelism Jun 30, 2026