Die Messung in fünf Sätzen

  • Ein Expertenmodell (Ornith 1.5) schreibt auf einer AMD Radeon PRO W7800 mit rund 77 Token pro Sekunde, ein dichtes 27-Mrd.-Modell (qwen3.8) mit 28 bis 31 Token pro Sekunde.
  • Q8 statt Q4 kostet ein Fünftel Schreibtempo und rund 10 GB Speicher – und löst keine einzige Aufgabe besser.
  • Multi-Token-Prediction halbiert beim dichten Modell die Abbrüche am Zeitlimit (24 % → 12 %), beim Expertenmodell bremst sie.
  • Eine 48-GB-Karte bedient 2 Anfragen gleichzeitig mit je 131.072 Token Kontext, die 96-GB-Maschine 4.
  • Der Server braucht im Standby unter 5 Watt, bereit mit geladenem Modell 60 Watt, unter Last pro Karte rund 380 Watt.

Steckbrief der Messreihe

  • Stand: (Messzeitraum Juli bis August 2026)
  • Hardware: Zwei baugleiche KI-Server mit je 2× AMD Radeon PRO W7800 (je 48 GB Grafikspeicher), jedes Modell auf einer eigenen Karte
  • Laufzeit: llama.cpp mit llama-swap auf AMD ROCm (Stand August 2026), Multi-Token-Prediction seit Mai 2026 in llama.cpp verfügbar
  • Kontext: 262.144 Token je Modell, aufgeteilt auf 2 gleichzeitige Anfragen à 131.072 Token
  • Umfang: 550 Durchläufe (514 lokal, 36 mit Claude Code und Codex); Median aus 10 bis 12 Durchläufen je Aufgabe und Variante; jede Aufgabe mit leerem Kontext gestartet

Sprachmodelle: Tempo und Speicher

Tempo meint die Ausgabe beim Schreiben, gemessen in Token pro Sekunde. Ein Token ist ungefähr drei Viertel eines Wortes. Der Speicher umfasst Gewichte, Bild-Encoder und den Zwischenspeicher für den Kontext – in genau dieser Einstellung, nicht für das Modell an sich.

Median je Variante, Zwei baugleiche KI-Server mit je 2× AMD Radeon PRO W7800 (je 48 GB Grafikspeicher), jedes Modell auf einer eigenen Karte. Fett: heute bei uns im Betrieb.
Variante Bauform Quantisierung Speicher Token/s Läufe
Ornith 1.5 Expertenmodell (MoE), 35 Mrd. Parameter, davon 3 Mrd. aktiv Q8 42,2 GiB 77 95
Ornith 1.0 (Vorgänger) Expertenmodell (MoE), 35 Mrd. Parameter, davon 3 Mrd. aktiv Q8 39,7 GiB 84 163
qwen3.8 27B + Multi-Token-Prediction dichtes Modell, 27 Mrd. Parameter, alle aktiv Q4 35,7 GiB 31 63
qwen3.8 27B dichtes Modell, 27 Mrd. Parameter, alle aktiv Q4 32,7 GiB 28 148
qwen3.8 27B dichtes Modell, 27 Mrd. Parameter, alle aktiv Q8 43,0 GiB 23 45

Das Expertenmodell ist rund zweieinhalbmal so schnell, weil es pro Wort nur 3 seiner 35 Milliarden Parameter rechnen lässt. Speicher spart es trotzdem nicht: Bereitstehen müssen alle. Wie die Modelle bei echten Aufgaben abschneiden, steht im Praxistest lokaler Coding-Agenten gegen Claude Code und Codex.

Q4 gegen Q8: doppelter Speicher, kein besseres Ergebnis

Quantisierung heißt: Die Gewichte des Modells werden gröber gespeichert, damit es auf die Grafikkarte passt. Q4 nutzt rund vier Bit je Gewicht, Q8 rund acht. Wir haben qwen3.8 27B in beiden Stufen gemessen – dieselbe Karte, derselbe Auftrag, nur eine Einstellung verändert.

Beim Schreiben verliert Q8 ein Fünftel Tempo, beim Lesen langer Eingaben ist es minimal schneller. In der Qualität gab es keinen messbaren Unterschied. Unsere Konsequenz: Wir betreiben Q4. Die ausführliche Herleitung steht im Beitrag Q4 oder Q8 – was Quantisierung und Multi-Token Prediction wirklich bringen.

Messung Q4 Q8
Modellgröße 16,5 GB 27,9 GB
Text schreiben 28,7 Token/s 22,9 Token/s
Eingabe verarbeiten (31.000 Token) 486 Token/s 509 Token/s
Gesamtdauer des Durchlaufs 66,4 s 64,0 s
Gelöste Aufgaben (verlängerte Frist) 3 × 100 % 3 × 100 %

Multi-Token-Prediction: hilft dem einen Modell, bremst das andere

Manche Modelle bringen Vorhersageköpfe mit, die die nächsten Wörter raten. Das Hauptmodell prüft nur noch nach. Die Antworten bleiben dieselben, sie kommen nur schneller – wenn die Bauart des Modells mitspielt.

qwen3.8 27B (dicht)

Messung ohne mit Vorhersage
Textausgabe 28,1 Token/s 31,3 Token/s
Ausgabe nach langem Auftrag 25,1 Token/s 35,8 Token/s
Läufe am Zeitlimit gescheitert 24 % 12 %
Mittlere Bearbeitungsdauer 750 s 599 s

Ornith (Expertenmodell)

Messung ohne mit Vorhersage
Textausgabe 77,3 Token/s 66,9 Token/s
Läufe am Zeitlimit gescheitert 0 4

Wie viele Anfragen gleichzeitig? Je Ausbaustufe

Der Kontext eines Modells ist ein gemeinsamer Topf. Ein Server mit 262.144 Token, der vier Anfragen gleichzeitig bedient, gibt jeder nur ein Viertel davon. Ein Coding-Agent braucht allein für Systemauftrag und Werkzeuge rund 28.500 Token. Wir planen deshalb mit 131.072 Token je Anfrage.

Ausbaustufe Gleichzeitige Anfragen Status Hinweis
KI-Server 32 GB nicht vermessen nicht gemessen qwen3.8 Q4 braucht in der Messeinstellung 32,7 GiB — auf 32 GB nur mit kürzerem Kontext oder kleinerem Modell. Für Chat und Programmierhilfe empfehlen wir diese Stufe nicht.
KI-Server 48 GB 2 gleichzeitig à 131.072 Token gemessen Ein Modell pro Karte. qwen3.8 Q4 mit Vorhersage: 31 Token/s, Ornith 1.5: 77 Token/s je Anfrage.
KI-Server 96 GB 4 gleichzeitig à 131.072 Token gemessen Zwei Modelle parallel, je 2 Anfragen — genau der Testaufbau dieser Seite.
KI-Server 96 GB Performance nicht vermessen nicht gemessen Drei Karten mit je 32 GB; bisher nicht gebaut und deshalb ohne eigene Messwerte.

Anfragen sind nicht Nutzer. Im Chat tippt und liest ein Mensch die meiste Zeit; die Karte rechnet nur, während eine Antwort entsteht. Wie viele Mitarbeitende eine Ausbaustufe tragen, hängt deshalb davon ab, wie gleichzeitig Ihr Team arbeitet. Das rechnen wir mit Ihnen konkret durch. Preise und Ausstattung aller Stufen stehen unter KI-Server kaufen oder mieten.

Stromverbrauch aus der Steckdose gemessen

Der Testserver legt sich schlafen, wenn niemand ihn braucht, und wird per Netzwerkpaket geweckt. Von der Anfrage bis zur fertigen Antwort vergehen dann 19 Sekunden, Aufwachen und Modellladen eingerechnet.

Bei acht Stunden Nutzung am Tag mit gemischter Last landet man bei etwa 1,5 bis 2 kWh täglich. Die Annahme, eigene KI-Hardware verbrenne rund um die Uhr Strom, stimmt so nicht.

Zustand Leistung
Standby, niemand arbeitet unter 5 W
Bereit, Modell geladen, keine Anfrage 60 W
Eine Karte unter Last (Normalbetrieb) rund 380 W
Beide Karten unter Volllast (15-Minuten-Dauertest) 706 W

Bildgenerierung auf einer Consumer-Karte

Gemessen auf einer AMD Radeon RX 7900 XTX, 24 GB Grafikspeicher, Stand . Angegeben ist die Zeit je Bild über mehrere Motive. Die Bilder selbst und die Lizenzfragen je Modell stehen im Praxistest FLUX, SDXL, Chroma und Gemini. Warum sich die Karte nach einigen Tausend Bildern bezahlt macht, steht unter 500 Bilder ohne Tokenkosten.

Modell Zeit je Bild
SDXL 1.0 8–12 s
FLUX.1-schnell 12–24 s
FLUX.1-dev rund 24 s
SD 3.5 Large 36–38 s
FLUX.1-Kontext 40–42 s
HiDream-I1 72–74 s

Methodik: So können Sie die Messung wiederholen

Eine Zahl ohne Aufbau ist eine Behauptung. Deshalb hier alles, was Sie für eine eigene Messung brauchen.

Aufbau

Zwei baugleiche KI-Server mit je 2× AMD Radeon PRO W7800 (je 48 GB Grafikspeicher), jedes Modell auf einer eigenen Karte. llama.cpp mit llama-swap auf AMD ROCm (Stand August 2026), Multi-Token-Prediction seit Mai 2026 in llama.cpp verfügbar. 262.144 Token je Modell, aufgeteilt auf 2 gleichzeitige Anfragen à 131.072 Token.

Aufgaben und Bewertung

Echte Programmieraufgaben in bestehenden Projekten (Rechnung erzeugen, Fehler in Ratenplan-Berechnung, Lagerlogik über 19 Dateien, Oberfläche nach Bildvorlage u. a.). Automatisch über Testfälle, die der Agent nicht sieht, ergänzt um den Umfang der Änderung.

Statistik

Median aus 10 bis 12 Durchläufen je Aufgabe und Variante; jede Aufgabe mit leerem Kontext gestartet. Pro Messung wurde genau eine Einstellung verändert.

Die wichtigste Falle: Wer Modelle unterschiedlicher Geschwindigkeit unter derselben Zeitgrenze vergleicht, misst die Uhr mit. Im ersten Durchgang schien Q8 schlechter als Q4 – sechs von sieben schwachen Ergebnissen waren aber Zeitlimit-Abbrüche. Mit um die Hälfte verlängerter Frist lösten beide Stufen alle Aufgaben. Verlängern Sie die Frist oder weisen Sie den Tempoanteil getrennt aus.

Zitieren: „DasDomainDepot.de, KI-Benchmark lokaler Sprachmodelle, Stand 23.08.2026, https://dasdomaindepot.de/ki/benchmark“. Was Begriffe wie Token und Kontextfenster bedeuten, erklärt der Beitrag Token, Kontextfenster und Modellgrößen einfach erklärt.

Welche Ausbaustufe passt zu Ihrem Team?

Wir rechnen mit Ihnen durch, wie viele Anfragen Ihr Alltag gleichzeitig erzeugt – auf Basis dieser Messwerte.

Direkter Kontakt – ohne Umwege. Wir melden uns innerhalb eines Werktages.