llama.cpp

Ejecuta inferencia de LLMs en CPU, Apple Silicon y GPUs de consumo sin necesidad de hardware NVIDIA. Ideal para despliegue en el borde y Macs M1/M2/M3, con cua…

/skills/inference-serving-llama-cpp