Medir LLM cuantizados: qué se pierde al comprimir un modelo abierto
Casi 300 ficheros GGUF de decenas de familias, servidos con llama.cpp y puntuados en llamada a funciones, código y contexto largo, con velocidad y energía por tarjeta. La línea que más horas …
