Lokale LLM-Inferenz, Stand Juli 2026 — gemessen statt geglaubt: 8B-Modell, 4-Bit-Quantisierung, eine Workstation-GPU mit 24 GB. Ergebnis: 74 Tokens pro Sekunde im Schnitt bei 16k Kontext, Antwortqualitaet fuer interne Support-Faelle in 9 von 10 Faellen ausreichend, Stromkosten unter 20 Cent pro 1.000 Anfragen. Fuer DSGVO-kritische Workloads ist die Ausrede, Cloud sei alternativlos, damit endgueltig Geschichte.
#ai #mlops