应用介绍
大模型部署时推理慢、显存吃紧,量化、蒸馏、剪枝各有一套工具,组合起来很麻烦。NVIDIA Model Optimizer 是一个集成量化、蒸馏、剪枝、架构搜索和推测解码等前沿技术的模型优化库。
压缩后的模型可直接用于 TensorRT-LLM、TensorRT 和 vLLM 等推理框架,显著提升速度。
量化:FP8、INT4 等。
蒸馏剪枝:缩小模型。
推测解码:加速生成。
部署衔接:TensorRT-LLM、vLLM。
压缩后的模型可直接用于 TensorRT-LLM、TensorRT 和 vLLM 等推理框架,显著提升速度。
软件功能
量化:FP8、INT4 等。
蒸馏剪枝:缩小模型。
推测解码:加速生成。
部署衔接:TensorRT-LLM、vLLM。

