Generación estructurada y servido con SGLang
Generación estructurada y servido rápido de LLMs con caché de prefijos RadixAttention. Ideal para salidas JSON/regex, decodificación restringida, flujos agénti…
Generación estructurada y servido rápido de LLMs con caché de prefijos RadixAttention. Ideal para salidas JSON/regex, decodificación restringida, flujos agénti…