Lokales LLM-Hosting

Wenn Daten das Unternehmen nicht verlassen dürfen, kommt das Sprachmodell zu den Daten. Wir betreiben offene Modelle mit vLLM, llama.cpp oder Ollama auf Ihrer eigenen Hardware oder in einem EU-Rechenzentrum und verbinden sie mit n8n, damit Ihre Automatisierungen und KI-Agenten sie wie eine Cloud-API nutzen. Die Daten bleiben im Haus, Antworten kommen schnell und die Kosten wachsen nicht mit jeder Anfrage.

Lokales LLM-Hosting

Wann es sich lohnt

  • Personenbezogene oder vertrauliche Daten, die nach der DSGVO in Ihrer eigenen Infrastruktur bleiben müssen
  • Viele Anfragen am Tag, bei denen sich die Token-Preise von Cloud-APIs summieren
  • Workflows, die schnelle Antworten brauchen, zum Beispiel im Service Desk

Der passende Modellserver

Wir binden Sie nicht an ein Werkzeug. Welcher Modellserver passt, hängt davon ab, wie viele Personen und Workflows ihn nutzen und welche Hardware vorhanden ist:

Modellserver Passt für Warum
vLLM Produktive Server mit vielen Nutzern und Workflows gleichzeitig Continuous Batching und PagedAttention für hohen Durchsatz, ein Modell über mehrere GPUs, eine OpenAI-kompatible API
llama.cpp CPUs, kleinere GPUs und Rechner am Edge Führt quantisierte Modelle im GGUF-Format mit wenig Speicher aus, mit oder ohne Grafikkarte
Ollama Pilotprojekte, Workstations und einen schnellen Start Lädt und startet ein Modell mit einem Befehl, gut zum Ausprobieren, bevor ein Modell in Produktion geht

Alle drei bieten eine API im Format von OpenAI. Workflows und Werkzeuge, die mit einem Cloud-Modell arbeiten, arbeiten auch mit dem lokalen.

Was wir einrichten

  • Den Modellserver auf Ihrer Hardware oder in einem EU-Rechenzentrum: vLLM für den produktiven Betrieb, llama.cpp oder Ollama, wo die Ressourcen klein sind
  • Modelle passend zur Aufgabe: kleine Modelle für Klassifizierung und Extraktion, größere offene Modelle wie gpt-oss, Llama, Mistral oder Qwen, wo mehr Denkarbeit nötig ist
  • n8n-Workflows, die das lokale Modell wie eine Cloud-API nutzen, mit Zugriffssteuerung und Protokollierung
  • Überwachung von Auslastung und Antwortzeiten

Wie wir die Hardware wählen

Wir gehen von den Aufgaben aus, nicht vom größten Modell. Wir sehen uns an, wie viele Anfragen es pro Tag gibt, wie viele gleichzeitig laufen und wie schnell die Antworten kommen müssen. Danach wählen wir Modellgrößen, Quantisierung und Hardware, die passen. Unser Beitrag LLMs lokal ausführen mit Ollama und n8n zeigt die Modellklassen und Hardware-Prüfungen, die wir verwenden. Wie der Kostenunterschied in einem echten Workflow aussieht, steht in unserem Kostenvergleich von Cloud- und lokalen LLMs.

Cloud und lokal zusammen

Nicht jede Aufgabe muss lokal laufen. Aufgaben mit sensiblen Daten laufen auf Ihrem eigenen Modell, andere können ein Cloud-Modell nutzen. n8n entscheidet pro Workflow, Sie müssen sich also nicht für alles auf eines festlegen.

Bereit, loszulegen?

Erzählen Sie uns, welchen Prozess Sie verbessern möchten. Wir sehen ihn gemeinsam an und schlagen vor, wie Sie beginnen.