Quantisierung von LLMs erklärt: Große Modelle auf kleiner Hardware
Dieser ausführliche Leitfaden erklärt dir, wie Quantisierung große Sprachmodelle so weit verkleinert, dass sie auf Consumer-Hardware laufen. Du lernst die Grundlagen von fp32/fp16/bf16 bis int8/int4, verstehst Perplexity als Qualitätsmaß und bekommst einen klaren Überblick über die wichtigsten Formate und Methoden 2026: GGUF mit seinen K-Quants und I-Quants, GPTQ, AWQ und bitsandbytes/NF4. Wir klären den Unterschied zwischen Post-Training-Quantisierung und quantisierungsbewusstem Training, schauen uns den Trade-off Größe gegen Qualität mit handfesten Faustregeln an und du erzeugst und ziehst im Praxisteil selbst Modelle in verschiedenen Quants mit Ollama und llama.cpp.