Evaluación de modelos de código
Evalúa modelos de generación de código en HumanEval, MBPP, MultiPL-E y más de 15 benchmarks con métricas pass@k, el estándar del proyecto BigCode usado en los…
Evalúa modelos de generación de código en HumanEval, MBPP, MultiPL-E y más de 15 benchmarks con métricas pass@k, el estándar del proyecto BigCode usado en los…