Cuantización AWQ

Cuantización de pesos consciente de las activaciones para comprimir LLM a 4 bits con hasta 3× de aceleración y mínima pérdida de precisión, ideal para desplega…

/skills/optimization-awq