Generación estructurada y servido con SGLang

Generación estructurada y servido rápido de LLMs con caché de prefijos RadixAttention. Ideal para salidas JSON/regex, decodificación restringida, flujos agénti…

/skills/inference-serving-sglang