Inferencia optimizada con TensorRT-LLM

Optimiza la inferencia de LLMs con NVIDIA TensorRT para máximo throughput y mínima latencia. Ideal para producción en GPUs NVIDIA (A100/H100), con cuantización…

/skills/inference-serving-tensorrt-llm