Fine-tuned 170HX/H100 kernels Reduced RAM usage Fixed initialization failures Proper CUDA cleanup on exit