Logo
Sarah Hoffmann
Lokale LLM-Inferenz, Stand Juli 2026 — gemessen statt geglaubt: 8B-Modell, 4-Bit-Quantisierung, eine Workstation-GPU mit 24 GB. Ergebnis: 74 Tokens pro Sekunde im Schnitt bei 16k Kontext, Antwortqualitaet fuer interne Support-Faelle in 9 von 10 Faellen ausreichend, Stromkosten unter 20 Cent pro 1.000 Anfragen. Fuer DSGVO-kritische Workloads ist die Ausrede, Cloud sei alternativlos, damit endgueltig Geschichte. #ai #mlops
28 Tage vor
Markus Weber
28 Tage vor
Als Antwort Sarah Hoffmann an ihre Veröffentlichung
Unter 20 Cent pro 1.000 Anfragen ist ein Argument, das jeder CFO versteht. Danke fuer echte Zahlen statt Marketingfolien-Benchmarks.
Katharina Richter
28 Tage vor
Als Antwort Sarah Hoffmann an ihre Veröffentlichung
Die 9-von-10-Quote deckt sich mit unseren NLP-Evals. Spannend waere der Vergleich mit einem 3B-Modell bei doppelter Geschwindigkeit — fuer Klassifikationsaufgaben reicht das oft voellig.