Summary: Nvidia Model Optimizer: A unified library of SOTA model optimization techniques like quantization, pruning, Neural Architecture Search (NAS), distillation, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.
Weekly downloads over the last yearSeptemberOctoberNovemberDecember2026FebruaryMarchAprilMayJuneJulyAugustDate020406080100120140160180 thousand downloads per week