Lieber ansehen statt lesen? Der Artikel als Video.

Grafikkarte für lokale KI: eine teure oder mehrere günstige?
Generiert mit KI (FLUX.1-schnell, Apache 2.0) · DasDomainDepot.de

Kurz gesagt:

  • Bei einem eigenen KI-Server entscheidet nicht die schnellste Grafikkarte, sondern was dein Team damit tut und wie viele Leute gleichzeitig anfragen.
  • Gemessen mit dem Modell Ornith: Eine einzelne Anfrage bekommt 67 Tokens pro Sekunde, zehn gleichzeitige Anfragen schaffen zusammen 168 Tokens pro Sekunde.
  • Parallel steigt der Gesamtdurchsatz um das Zweieinhalbfache, dafür wird jede einzelne Anfrage rund viermal langsamer.
  • Für ein Team lohnt sich dieser Tausch fast immer, für einen einzelnen Entwickler, der sofort eine Antwort braucht, eher nicht.

Die Preisfrage kommt zuerst, und sie ist die falsche

Wer einen eigenen KI-Server plant, fängt fast immer bei der Grafikkarte an. Das ist verständlich, denn dort sitzt das Geld. In unserer zweiten Podcast-Folge haben wir genau darüber gestritten, und die Zahlen liegen weit auseinander.

„Für eine 5090 wollen die ja 6.000 Euro haben. […] Dann kauf ich mir lieber für 1.700 Euro eine zweite AMD.“

Die Preise, über die wir gesprochen haben: rund 1.700 Euro für eine AMD-Karte mit 32 GB Grafikspeicher, etwa 6.000 Euro für eine RTX 5090 und rund 10.000 Euro für eine professionelle Nvidia-Karte mit 48 GB. Unser Eindruck: Der Leistungsunterschied ist deutlich kleiner als der Preisunterschied. Im Gespräch klang das so:

„Der Unterschied zwischen Nvidia und AMD ist halt überschaubar, und der Preisgap ist halt einfach unüberschaubar.“

Fairerweise gehört die Gegenposition dazu: Nvidia hat mit CUDA den reiferen Software-Unterbau, und bei gleicher Aufgabe rechnet eine Nvidia-Karte heute meist schneller als eine AMD-Karte mit ROCm. Die Frage ist nur, ob du diesen Vorsprung bezahlen musst.

Es kommt darauf an, was deine Leute damit tun

Die ehrliche Antwort auf „Wie viele Nutzer hält der Server aus?“ ist: Das hängt davon ab. Ein Server für zehn Entwickler mit Coding-Assistent braucht eine andere Ausstattung als einer, auf dem dreißig Leute ihre E-Mails glätten. Im Podcast haben wir das so formuliert:

„Es kommt drauf an: Was machen die Leute damit? Willst du Coder draufsetzen? Willst du Leute, die ihre E-Mails verbessern? Dafür brauchst du unterschiedliche Modelle, und dann können diese Modelle unterschiedlich viele parallele Anfragen abarbeiten.“

Ein Coding-Assistent arbeitet mit langen Texten und großen Modellen. Eine E-Mail-Korrektur kommt mit einem kleinen Modell aus und ist nach wenigen Sekunden fertig. Wie viele Anfragen gleichzeitig laufen, verändert die Rechnung stärker als die Wahl der Karte.

Die Messung: Mehr Durchsatz, langsamere Einzelanfrage

Während der Aufnahme haben wir nachgemessen, mit dem lokalen Sprachmodell Ornith auf AMD-Hardware. Einmal mit einer einzigen Anfrage, einmal mit zehn gleichzeitig:

Gleichzeitige Anfragen Tokens pro Sekunde gesamt Tokens pro Sekunde je Anfrage
1 67 67
10 168 knapp 17

Zehn gleichzeitige Nutzer bekommen zusammen gut das Zweieinhalbfache durch dieselbe Karte, jeder Einzelne wartet aber rund viermal so lange. Das widerspricht dem Bauchgefühl. Man würde erwarten, dass zehn Anfragen die Karte zehnmal so stark belasten und alles zehnmal so langsam wird.

Der Grund liegt darin, wie Sprachmodelle rechnen. Für jedes erzeugte Token, also jedes Wortstück, müssen die Gewichte des Modells aus dem Grafikspeicher gelesen werden. Der Engpass ist deshalb die Speicherbandbreite der Karte, nicht ihre Rechenleistung. Laufen mehrere Anfragen gleichzeitig, liest die Karte die Gewichte einmal und bedient damit alle. Moderne Inferenz-Server wie vLLM sind genau darauf gebaut. Die Grundlagen dazu stehen im Orca-Paper zur laufenden Stapelverarbeitung und in der Arbeit zu PagedAttention.

Eine Randnotiz, weil sie in der Folge vorkommt: Vorher hatten wir eine andere Zahl genannt, nämlich nur zehn bis fünfzehn Prozent Verlust bei zehn Nutzern. Die hat die Messung korrigiert. In diesem Artikel stehen nur die gemessenen Werte.

Und hier schließt sich der Kreis zur Preisfrage: Wenn viele Leute gleichzeitig arbeiten, zählt, wie viele Anfragen parallel durchgehen, und nicht, wie schnell eine einzelne fertig wird. Jede zusätzliche Karte bringt eigenen Grafikspeicher und eigene Bandbreite mit, also Platz für weitere parallele Anfragen. Genau diese Stärke spielt eine teure Einzelkarte nicht aus.

Was das für deine Entscheidung heißt

  1. Zähl die gleichzeitigen Nutzer, nicht alle Nutzer. Wer Zugang hat, fragt nicht ständig an. Entscheidend ist, wie viele Anfragen im selben Moment laufen.
  2. Leite aus dem Einsatzzweck das Modell ab. Erst das Modell bestimmt, wie viel Grafikspeicher du brauchst, und nicht umgekehrt.
  3. Rechne mit Durchsatz, nicht mit Spitzentempo. Für ein Team zählt, wie viel insgesamt durchgeht. Knapp 17 Tokens pro Sekunde sind schneller, als ein Mensch liest.
  4. Plan das Drumherum mit. Mehrere Karten brauchen ein stärkeres Netzteil, mehr Kühlung, genug Steckplätze mit ausreichender PCIe-Anbindung und manchmal ein zweites Mainboard. Dazu kommt der Strom im Dauerbetrieb. Das frisst einen Teil der Ersparnis.

Mehrere günstige Karten lohnen sich, wenn viele Leute parallel arbeiten. Eine teure Karte lohnt sich, wenn wenige Leute sehr schnell Antworten auf große Aufgaben brauchen. Mehr zum Speicherbedarf verschiedener Modelle steht in unserem Artikel Q4 oder Q8?, was Tokens überhaupt sind, erklärt dieser Beitrag.

Tipp: Bevor du Hardware kaufst, miss mit deinem echten Anwendungsfall. Zehn Kollegen, die eine Woche lang ein Testsystem nutzen, sagen dir mehr als jedes Datenblatt.

Große Modelle ohne große Karte

Ein Ausblick aus derselben Folge: Viele große Modelle sind heute als Mixture-of-Experts gebaut. Sie bestehen aus vielen Teilmodellen, von denen für jedes Token nur wenige gebraucht werden. Es gibt Werkzeuge, die genau diese Teile bei Bedarf von der SSD über den Arbeitsspeicher in den Grafikspeicher nachladen. Das ist deutlich langsamer, weil die Daten für jedes Token durch diese Engstelle müssen. Dafür werden Modelle nutzbar, die sonst gar nicht auf die Karte passen würden. Für einen Chat, auf den jemand wartet, taugt das nicht, für nächtliche Auswertungen oder Tests am Wochenende schon.

Zum Nachhören

Die ganze Diskussion gibt es in Folge 2 von „DREI ITler EIN PODCAST“. Die Hardware-Frage beginnt bei 50:10, die Messung bei 1:33:17.

Ob eine teure oder mehrere günstige Karten: Auf einem eigenen Server bleiben Prompts, Dokumente und Kundendaten im Haus. Wenn du ausprobieren willst, wie sich lokale KI im Alltag anfühlt, ohne gleich Hardware zu kaufen, lässt sich unser KI-Portal zwei Wochen kostenlos testen. Wer schon konkret plant, findet die Preise für eigene KI-Server bei uns. Warum sich Warten gerade nicht lohnt, steht in unserem Beitrag zu den Hardware-Preisen.

Kostenloses Erstgespräch

Was hier beschrieben ist,
lässt sich umsetzen.

Sie haben konkrete Fragen zum Einsatz von KI in Ihrem Unternehmen? Wir schauen uns gemeinsam an, was davon für Ihren Fall realistisch und sinnvoll ist.

  • 30 Minuten, kostenlos und unverbindlich
  • Konkrete Einschätzung für Ihr Unternehmen
  • Rückmeldung innerhalb eines Werktages
Jetzt anfragen Direkt Termin buchen

Kein Verkaufsgespräch. Kein Risiko.

Kommentare

Noch keine Kommentare. Sei der Erste!

Kommentar schreiben

Kommentare werden nach manueller Prüfung freigeschaltet.