Aceleración de inferencia con speculative decoding
Acelera la inferencia de LLMs con speculative decoding, cabezales múltiples Medusa y lookahead decoding, logrando 1.5-3.6x de aceleración. Cubre modelos borrad…
Acelera la inferencia de LLMs con speculative decoding, cabezales múltiples Medusa y lookahead decoding, logrando 1.5-3.6x de aceleración. Cubre modelos borrad…