Quixi AI
Popular repositories Loading
Repositories
Showing 10 of 88 repositories
- Model-Optimizer Public Forked from NVIDIA/Model-Optimizer
A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.
- runpod-vllm Public
- dolphinflow-optimizer Public
People
This organization has no public members. You must be a member to see who’s a part of this organization.
Most used topics
Loading…