Wann es sich lohnt
- Personenbezogene oder vertrauliche Daten, die nach der DSGVO in Ihrer eigenen Infrastruktur bleiben müssen
- Viele Anfragen am Tag, bei denen sich die Token-Preise von Cloud-APIs summieren
- Workflows, die schnelle Antworten brauchen, zum Beispiel im Service Desk
Der passende Modellserver
Wir binden Sie nicht an ein Werkzeug. Welcher Modellserver passt, hängt davon ab, wie viele Personen und Workflows ihn nutzen und welche Hardware vorhanden ist:
| Modellserver | Passt für | Warum |
|---|---|---|
| vLLM | Produktive Server mit vielen Nutzern und Workflows gleichzeitig | Continuous Batching und PagedAttention für hohen Durchsatz, ein Modell über mehrere GPUs, eine OpenAI-kompatible API |
| llama.cpp | CPUs, kleinere GPUs und Rechner am Edge | Führt quantisierte Modelle im GGUF-Format mit wenig Speicher aus, mit oder ohne Grafikkarte |
| Ollama | Pilotprojekte, Workstations und einen schnellen Start | Lädt und startet ein Modell mit einem Befehl, gut zum Ausprobieren, bevor ein Modell in Produktion geht |
Alle drei bieten eine API im Format von OpenAI. Workflows und Werkzeuge, die mit einem Cloud-Modell arbeiten, arbeiten auch mit dem lokalen.
Was wir einrichten
- Den Modellserver auf Ihrer Hardware oder in einem EU-Rechenzentrum: vLLM für den produktiven Betrieb, llama.cpp oder Ollama, wo die Ressourcen klein sind
- Modelle passend zur Aufgabe: kleine Modelle für Klassifizierung und Extraktion, größere offene Modelle wie gpt-oss, Llama, Mistral oder Qwen, wo mehr Denkarbeit nötig ist
- n8n-Workflows, die das lokale Modell wie eine Cloud-API nutzen, mit Zugriffssteuerung und Protokollierung
- Überwachung von Auslastung und Antwortzeiten
Wie wir die Hardware wählen
Wir gehen von den Aufgaben aus, nicht vom größten Modell. Wir sehen uns an, wie viele Anfragen es pro Tag gibt, wie viele gleichzeitig laufen und wie schnell die Antworten kommen müssen. Danach wählen wir Modellgrößen, Quantisierung und Hardware, die passen. Unser Beitrag LLMs lokal ausführen mit Ollama und n8n zeigt die Modellklassen und Hardware-Prüfungen, die wir verwenden. Wie der Kostenunterschied in einem echten Workflow aussieht, steht in unserem Kostenvergleich von Cloud- und lokalen LLMs.
Cloud und lokal zusammen
Nicht jede Aufgabe muss lokal laufen. Aufgaben mit sensiblen Daten laufen auf Ihrem eigenen Modell, andere können ein Cloud-Modell nutzen. n8n entscheidet pro Workflow, Sie müssen sich also nicht für alles auf eines festlegen.
Bereit, loszulegen?
Erzählen Sie uns, welchen Prozess Sie verbessern möchten. Wir sehen ihn gemeinsam an und schlagen vor, wie Sie beginnen.
