KI-Benchmark: Was lokale Modelle auf eigener Hardware leisten
Token pro Sekunde, Speicherbedarf, Q4 gegen Q8 und Stromverbrauch – gemessen auf unseren eigenen KI-Servern, mit offengelegtem Aufbau, damit Sie die Zahlen nachprüfen können.
Die Messung in fünf Sätzen
- Ein Expertenmodell (Ornith 1.5) schreibt auf einer AMD Radeon PRO W7800 mit rund 77 Token pro Sekunde, ein dichtes 27-Mrd.-Modell (qwen3.8) mit 28 bis 31 Token pro Sekunde.
- Q8 statt Q4 kostet ein Fünftel Schreibtempo und rund 10 GB Speicher – und löst keine einzige Aufgabe besser.
- Multi-Token-Prediction halbiert beim dichten Modell die Abbrüche am Zeitlimit (24 % → 12 %), beim Expertenmodell bremst sie.
- Eine 48-GB-Karte bedient 2 Anfragen gleichzeitig mit je 131.072 Token Kontext, die 96-GB-Maschine 4.
- Der Server braucht im Standby unter 5 Watt, bereit mit geladenem Modell 60 Watt, unter Last pro Karte rund 380 Watt.
Steckbrief der Messreihe
- Stand: (Messzeitraum Juli bis August 2026)
- Hardware: Zwei baugleiche KI-Server mit je 2× AMD Radeon PRO W7800 (je 48 GB Grafikspeicher), jedes Modell auf einer eigenen Karte
- Laufzeit: llama.cpp mit llama-swap auf AMD ROCm (Stand August 2026), Multi-Token-Prediction seit Mai 2026 in llama.cpp verfügbar
- Kontext: 262.144 Token je Modell, aufgeteilt auf 2 gleichzeitige Anfragen à 131.072 Token
- Umfang: 550 Durchläufe (514 lokal, 36 mit Claude Code und Codex); Median aus 10 bis 12 Durchläufen je Aufgabe und Variante; jede Aufgabe mit leerem Kontext gestartet
Sprachmodelle: Tempo und Speicher
Tempo meint die Ausgabe beim Schreiben, gemessen in Token pro Sekunde. Ein Token ist ungefähr drei Viertel eines Wortes. Der Speicher umfasst Gewichte, Bild-Encoder und den Zwischenspeicher für den Kontext – in genau dieser Einstellung, nicht für das Modell an sich.
| Variante | Bauform | Quantisierung | Speicher | Token/s | Läufe |
|---|---|---|---|---|---|
| Ornith 1.5 | Expertenmodell (MoE), 35 Mrd. Parameter, davon 3 Mrd. aktiv | Q8 | 42,2 GiB | 77 | 95 |
| Ornith 1.0 (Vorgänger) | Expertenmodell (MoE), 35 Mrd. Parameter, davon 3 Mrd. aktiv | Q8 | 39,7 GiB | 84 | 163 |
| qwen3.8 27B + Multi-Token-Prediction | dichtes Modell, 27 Mrd. Parameter, alle aktiv | Q4 | 35,7 GiB | 31 | 63 |
| qwen3.8 27B | dichtes Modell, 27 Mrd. Parameter, alle aktiv | Q4 | 32,7 GiB | 28 | 148 |
| qwen3.8 27B | dichtes Modell, 27 Mrd. Parameter, alle aktiv | Q8 | 43,0 GiB | 23 | 45 |
Das Expertenmodell ist rund zweieinhalbmal so schnell, weil es pro Wort nur 3 seiner 35 Milliarden Parameter rechnen lässt. Speicher spart es trotzdem nicht: Bereitstehen müssen alle. Wie die Modelle bei echten Aufgaben abschneiden, steht im Praxistest lokaler Coding-Agenten gegen Claude Code und Codex.
Q4 gegen Q8: doppelter Speicher, kein besseres Ergebnis
Quantisierung heißt: Die Gewichte des Modells werden gröber gespeichert, damit es auf die Grafikkarte passt. Q4 nutzt rund vier Bit je Gewicht, Q8 rund acht. Wir haben qwen3.8 27B in beiden Stufen gemessen – dieselbe Karte, derselbe Auftrag, nur eine Einstellung verändert.
Beim Schreiben verliert Q8 ein Fünftel Tempo, beim Lesen langer Eingaben ist es minimal schneller. In der Qualität gab es keinen messbaren Unterschied. Unsere Konsequenz: Wir betreiben Q4. Die ausführliche Herleitung steht im Beitrag Q4 oder Q8 – was Quantisierung und Multi-Token Prediction wirklich bringen.
| Messung | Q4 | Q8 |
|---|---|---|
| Modellgröße | 16,5 GB | 27,9 GB |
| Text schreiben | 28,7 Token/s | 22,9 Token/s |
| Eingabe verarbeiten (31.000 Token) | 486 Token/s | 509 Token/s |
| Gesamtdauer des Durchlaufs | 66,4 s | 64,0 s |
| Gelöste Aufgaben (verlängerte Frist) | 3 × 100 % | 3 × 100 % |
Multi-Token-Prediction: hilft dem einen Modell, bremst das andere
Manche Modelle bringen Vorhersageköpfe mit, die die nächsten Wörter raten. Das Hauptmodell prüft nur noch nach. Die Antworten bleiben dieselben, sie kommen nur schneller – wenn die Bauart des Modells mitspielt.
qwen3.8 27B (dicht)
| Messung | ohne | mit Vorhersage |
|---|---|---|
| Textausgabe | 28,1 Token/s | 31,3 Token/s |
| Ausgabe nach langem Auftrag | 25,1 Token/s | 35,8 Token/s |
| Läufe am Zeitlimit gescheitert | 24 % | 12 % |
| Mittlere Bearbeitungsdauer | 750 s | 599 s |
Ornith (Expertenmodell)
| Messung | ohne | mit Vorhersage |
|---|---|---|
| Textausgabe | 77,3 Token/s | 66,9 Token/s |
| Läufe am Zeitlimit gescheitert | 0 | 4 |
Wie viele Anfragen gleichzeitig? Je Ausbaustufe
Der Kontext eines Modells ist ein gemeinsamer Topf. Ein Server mit 262.144 Token, der vier Anfragen gleichzeitig bedient, gibt jeder nur ein Viertel davon. Ein Coding-Agent braucht allein für Systemauftrag und Werkzeuge rund 28.500 Token. Wir planen deshalb mit 131.072 Token je Anfrage.
| Ausbaustufe | Gleichzeitige Anfragen | Status | Hinweis |
|---|---|---|---|
| KI-Server 32 GB | nicht vermessen | nicht gemessen | qwen3.8 Q4 braucht in der Messeinstellung 32,7 GiB — auf 32 GB nur mit kürzerem Kontext oder kleinerem Modell. Für Chat und Programmierhilfe empfehlen wir diese Stufe nicht. |
| KI-Server 48 GB | 2 gleichzeitig à 131.072 Token | gemessen | Ein Modell pro Karte. qwen3.8 Q4 mit Vorhersage: 31 Token/s, Ornith 1.5: 77 Token/s je Anfrage. |
| KI-Server 96 GB | 4 gleichzeitig à 131.072 Token | gemessen | Zwei Modelle parallel, je 2 Anfragen — genau der Testaufbau dieser Seite. |
| KI-Server 96 GB Performance | nicht vermessen | nicht gemessen | Drei Karten mit je 32 GB; bisher nicht gebaut und deshalb ohne eigene Messwerte. |
Anfragen sind nicht Nutzer. Im Chat tippt und liest ein Mensch die meiste Zeit; die Karte rechnet nur, während eine Antwort entsteht. Wie viele Mitarbeitende eine Ausbaustufe tragen, hängt deshalb davon ab, wie gleichzeitig Ihr Team arbeitet. Das rechnen wir mit Ihnen konkret durch. Preise und Ausstattung aller Stufen stehen unter KI-Server kaufen oder mieten.
Stromverbrauch aus der Steckdose gemessen
Der Testserver legt sich schlafen, wenn niemand ihn braucht, und wird per Netzwerkpaket geweckt. Von der Anfrage bis zur fertigen Antwort vergehen dann 19 Sekunden, Aufwachen und Modellladen eingerechnet.
Bei acht Stunden Nutzung am Tag mit gemischter Last landet man bei etwa 1,5 bis 2 kWh täglich. Die Annahme, eigene KI-Hardware verbrenne rund um die Uhr Strom, stimmt so nicht.
| Zustand | Leistung |
|---|---|
| Standby, niemand arbeitet | unter 5 W |
| Bereit, Modell geladen, keine Anfrage | 60 W |
| Eine Karte unter Last (Normalbetrieb) | rund 380 W |
| Beide Karten unter Volllast (15-Minuten-Dauertest) | 706 W |
Bildgenerierung auf einer Consumer-Karte
Gemessen auf einer AMD Radeon RX 7900 XTX, 24 GB Grafikspeicher, Stand . Angegeben ist die Zeit je Bild über mehrere Motive. Die Bilder selbst und die Lizenzfragen je Modell stehen im Praxistest FLUX, SDXL, Chroma und Gemini. Warum sich die Karte nach einigen Tausend Bildern bezahlt macht, steht unter 500 Bilder ohne Tokenkosten.
| Modell | Zeit je Bild |
|---|---|
| SDXL 1.0 | 8–12 s |
| FLUX.1-schnell | 12–24 s |
| FLUX.1-dev | rund 24 s |
| SD 3.5 Large | 36–38 s |
| FLUX.1-Kontext | 40–42 s |
| HiDream-I1 | 72–74 s |
Methodik: So können Sie die Messung wiederholen
Eine Zahl ohne Aufbau ist eine Behauptung. Deshalb hier alles, was Sie für eine eigene Messung brauchen.
Aufbau
Zwei baugleiche KI-Server mit je 2× AMD Radeon PRO W7800 (je 48 GB Grafikspeicher), jedes Modell auf einer eigenen Karte. llama.cpp mit llama-swap auf AMD ROCm (Stand August 2026), Multi-Token-Prediction seit Mai 2026 in llama.cpp verfügbar. 262.144 Token je Modell, aufgeteilt auf 2 gleichzeitige Anfragen à 131.072 Token.
Aufgaben und Bewertung
Echte Programmieraufgaben in bestehenden Projekten (Rechnung erzeugen, Fehler in Ratenplan-Berechnung, Lagerlogik über 19 Dateien, Oberfläche nach Bildvorlage u. a.). Automatisch über Testfälle, die der Agent nicht sieht, ergänzt um den Umfang der Änderung.
Statistik
Median aus 10 bis 12 Durchläufen je Aufgabe und Variante; jede Aufgabe mit leerem Kontext gestartet. Pro Messung wurde genau eine Einstellung verändert.
Die wichtigste Falle: Wer Modelle unterschiedlicher Geschwindigkeit unter derselben Zeitgrenze vergleicht, misst die Uhr mit. Im ersten Durchgang schien Q8 schlechter als Q4 – sechs von sieben schwachen Ergebnissen waren aber Zeitlimit-Abbrüche. Mit um die Hälfte verlängerter Frist lösten beide Stufen alle Aufgaben. Verlängern Sie die Frist oder weisen Sie den Tempoanteil getrennt aus.
Zitieren: „DasDomainDepot.de, KI-Benchmark lokaler Sprachmodelle, Stand 23.08.2026, https://dasdomaindepot.de/ki/benchmark“. Was Begriffe wie Token und Kontextfenster bedeuten, erklärt der Beitrag Token, Kontextfenster und Modellgrößen einfach erklärt.
- Warum eine eigene KI?
- ChatGPT oder eigene KI?
- KI selbst hosten
- Lokale KI: Hardware und Grenzen
- Eigene Daten in die KI bringen
- Die eingesetzten Technologien
- KI-Modelle im Vergleich
- Datenschutz & DSGVO
- KI-Server & Preise
- KI-Portal: Tarife und Preise
- Wie eine eigene KI aufgebaut ist
- Betriebsmodelle im Vergleich
- Anwendungsfälle
- Häufige Fragen zur eigenen KI
- Demo: So arbeitet ein Firmen-Chatbot
- Wie man anfängt
Welche Ausbaustufe passt zu Ihrem Team?
Wir rechnen mit Ihnen durch, wie viele Anfragen Ihr Alltag gleichzeitig erzeugt – auf Basis dieser Messwerte.
Direkter Kontakt – ohne Umwege. Wir melden uns innerhalb eines Werktages.