Eine klare Architektur aus bewährten Open-Source-Komponenten – wartbar, erweiterbar und vollständig unter Ihrer Kontrolle.
Der Motor, der das Sprachmodell ausführt. Ollama eignet sich ideal für Prototyping und Einzelnutzer – Installation mit einem Befehl. vLLM ist der Produktionsstandard: Dank PagedAttention erreicht es bei vielen parallelen Nutzern bis zu 19-fach höheren Durchsatz.
Speichert Ihre Dokumente als semantische Vektoren für blitzschnelle Suche. Qdrant (in Rust geschrieben) für bis zu 10 Mio. Dokumente, Weaviate für funktionsreiche Enterprise-Pipelines, ChromaDB für schnellen Einstieg.
LlamaIndex ist auf schnelle Dokumentensuche und Q&A ausgelegt. LangChain deckt komplexe Workflows, KI-Agenten und Chat-Historien ab. In der Praxis werden beide oft kombiniert.
Beide Runtimes stellen eine OpenAI-kompatible REST-API bereit. Bestehende Anwendungen müssen nur die Base-URL ändern – die gesamte Logik funktioniert sofort mit dem lokalen Modell weiter.
Open WebUI bietet ein ChatGPT-ähnliches Interface, das komplett offline in Ihrem Netzwerk läuft. Multi-User-Management, Chat-Historien und direkter PDF-Upload inklusive. Oder: Integration als Widget in Ihre bestehende Anwendung.
Keycloak übernimmt Anmeldung und Rechteverwaltung und lässt sich an ein bestehendes Active Directory oder LDAP anbinden. Mitarbeitende melden sich mit ihrem gewohnten Firmen-Login an – niemand muss ein weiteres Passwort pflegen.
Ein LiteLLM-Proxy verteilt die Anfragen auf die vorhandenen GPU-Server, begrenzt Lastspitzen und protokolliert den Verbrauch. Fällt ein Server aus, leitet er automatisch auf die verbleibenden um.
Vollständige Protokollierung aller Anfragen und Antworten für Compliance-Anforderungen – nachvollziehbar, wer wann was gefragt hat.
Der häufigste Einwand gegen eine Firmen-KI lautet: „Dann sieht ja jeder alles." Berechtigt – wenn man das Wissen in einen einzigen Topf wirft. Wir tun das nicht.
Das Firmenwissen liegt nicht in einem gemeinsamen Index, sondern in getrennten Sammlungen je Gruppe: eine allgemein zugängliche und je eine für Personal, Technik, Geschäftsführung oder was bei Ihnen sinnvoll ist.
Stellt jemand eine Frage, durchsucht die KI ausschließlich die Sammlungen, für die diese Person freigeschaltet ist – die Gruppen kommen dabei direkt aus Ihrer Benutzerverwaltung. Ein Mitarbeiter aus der Technik bekommt Gehaltsdaten also nicht etwa „gefiltert" zu sehen: Sie sind für seine Anfrage schlicht nicht vorhanden.
Das ist ein Unterschied ums Ganze. Eine KI, die alles kennt und sich zurückhalten soll, ist eine Frage der Formulierung. Eine KI, die es gar nicht erst sieht, ist eine Frage der Architektur.
Eine KI, die im Arbeitsalltag genutzt wird, darf nicht an einem einzelnen Gerät hängen. Deshalb trennen wir die Aufgaben.
Oberfläche, Anmeldung und Lastverteilung laufen auf einem eigenen, günstigen Server ohne Grafikkarte. Die teuren GPU-Server tun nur eines: rechnen. Sie tragen weder die Weboberfläche noch die Benutzerverwaltung.
Fällt ein GPU-Server aus, verteilt der Proxy die Anfragen automatisch auf die verbleibenden. Für die Mitarbeitenden bedeutet das: Die KI antwortet langsamer, aber sie antwortet. Nichts steht still, und niemand muss etwas umstellen.
Für kleinere Installationen genügt selbstverständlich ein einzelner Server – wir bauen die Ausfallsicherheit nur dort ein, wo sie den Aufwand wert ist.
Der Flaschenhals ist der Grafikspeicher. Wie viel ein Modell davon belegt, hängt an seiner Größe und daran, wie stark es komprimiert ist. Die folgenden Modelle setzen wir selbst ein – die Zahlen haben wir auf unserem eigenen Server nachgemessen, sie stammen nicht aus einem Datenblatt. Unser Standard ist Mistral Small 3.2 aus Frankreich; wo es anspruchsvoller wird – beim Programmieren und bei kniffligen Fragen – nehmen wir Ornith. Alle Modelle sind quelloffen und laufen ohne Lizenzgebühren auf Ihrer Hardware.
Mistral Small 3.2 (24B), multimodal
Rechnungen, Scans, Formulare – auch mit Bildern.
Ornith 35B – belegt rund 41 GB
Code schreiben, prüfen, erklären. Behält ganze Projekte im Blick, weil es sich sehr viel Text auf einmal merken kann.
Ornith 35B
Entwickelt seinen Lösungsweg selbst und zeigt ihn, statt nur ein Ergebnis zu nennen.
Mistral Small 3.2 (24B)
Unser Standardmodell für den Alltag – schnell und sparsam im Speicher.
Mehrere Modelle nebeneinander
Chat, Coding und Dokumente parallel, für viele Nutzer.
Wichtig für die Planung: Nicht nur das Modell belegt Speicher, sondern auch das Gespräch selbst. Je länger die Unterhaltung, desto mehr Grafikspeicher geht dafür drauf. Ornith kann sich rund 128.000 Wörter merken – das entspricht einem dicken Buch – und genau dieser Puffer will ebenfalls in den Speicher. Deshalb rechnen wir nie knapp: Ein Modell, das „gerade so" passt, wird im Alltag langsam.
Für interne Werkzeuge und normale Last genügt ein einzelner GPU-Server. Er ist einfacher zu betreiben und zu warten – und günstiger.
Ohne Grafikkarte tröpfeln die Antworten Wort für Wort herein – ein Vielfaches langsamer als mit GPU. Zum Ausprobieren geht das, im Arbeitsalltag nicht.
Bei mehr Last kommen weitere GPU-Server dazu, die sich die Anfragen teilen. Die Oberfläche und die Anmeldung bleiben davon unberührt.
Auslastung, Antwortzeiten und Fehler werden überwacht. Alerts bei Problemen.
Wer hat was gefragt, welche Quellen wurden genutzt – auditierbar und nachvollziehbar.
Modell-Updates, Sicherheits-Patches und Erweiterungen der Wissensbasis werden laufend eingespielt.
Welche Hardware konkret? Wir bauen die Server selbst – mit AMD-Karten, weil eine vergleichbare NVIDIA-Ausstattung derzeit rund das Sechsfache kostet. Alle Größen und Preise stehen offen auf der Seite KI-Server kaufen oder mieten.
Wir gehen die Details durch – offen, konkret und ohne Blackbox.
Direkter Kontakt – ohne Umwege. Wir melden uns innerhalb eines Werktages.