Quantisierte LLMs messen: Was beim Komprimieren eines offenen Modells verloren geht
Fast 300 GGUF-Dateien aus Dutzenden Familien, mit llama.cpp bereitgestellt und in Funktionsaufrufen, Code und langem Kontext bewertet, mit Geschwindigkeit und Energie je Karte. Die Linie, …
