Logo
Sarah Hoffmann
28 Tage vor
Lokale LLM-Inferenz, Stand Juli 2026 — gemessen statt geglaubt: 8B-Modell, 4-Bit-Quantisierung, eine Workstation-GPU mit 24 GB. Ergebnis: 74 Tokens pro Sekunde im Schnitt bei 16k Kontext, Antwortqualitaet fuer interne Support-Faelle in 9 von 10 Faellen ausreichend, Stromkosten unter 20 Cent pro 1.000 Anfragen. Fuer DSGVO-kritische Workloads ist die Ausrede, Cloud sei alternativlos, damit endgueltig Geschichte. #ai #mlops
Markus Weber
Unter 20 Cent pro 1.000 Anfragen ist ein Argument, das jeder CFO versteht. Danke fuer echte Zahlen statt Marketingfolien-Benchmarks.
28 Tage vor
Als Antwort Sarah Hoffmann an ihre Veröffentlichung

Noch keine Antworten!

Es scheint, dass diese Veröffentlichung noch keine Kommentare enthält. Um auf diese Veröffentlichung von Markus Weber zu antworten, klicken Sie unten darunter auf