NVIDIA/Model-OptimizerPython3.9k
GitHubで見る →

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

技術情報

言語

Python

ライセンス

Apache-2.0

最終更新

2026-09-24

スター数

3,916

フォーク数

622

Issue数

417

関連リポジトリ