Logo
Sarah Hoffmann
Lokale LLM-Inferenz, Stand Juli 2026 — gemessen statt geglaubt: 8B-Modell, 4-Bit-Quantisierung, eine Workstation-GPU mit 24 GB. Ergebnis: 74 Tokens pro Sekunde im Schnitt bei 16k Kontext, Antwortqualitaet fuer interne Support-Faelle in 9 von 10 Faellen ausreichend, Stromkosten unter 20 Cent pro 1.000 Anfragen. Fuer DSGVO-kritische Workloads ist die Ausrede, Cloud sei alternativlos, damit endgueltig Geschichte. #ai #mlops
2 Monate vor
Markus Weber
2 Monate vor
Als Antwort Sarah Hoffmann an ihre Veröffentlichung
Unter 20 Cent pro 1.000 Anfragen ist ein Argument, das jeder CFO versteht. Danke fuer echte Zahlen statt Marketingfolien-Benchmarks.
Katharina Richter
2 Monate vor
Als Antwort Sarah Hoffmann an ihre Veröffentlichung
Die 9-von-10-Quote deckt sich mit unseren NLP-Evals. Spannend waere der Vergleich mit einem 3B-Modell bei doppelter Geschwindigkeit — fuer Klassifikationsaufgaben reicht das oft voellig.