Aceleración de inferencia con speculative decoding

Acelera la inferencia de LLMs con speculative decoding, cabezales múltiples Medusa y lookahead decoding, logrando 1.5-3.6x de aceleración. Cubre modelos borrad…

/skills/emerging-techniques-speculative-decoding