How To: LLMs lokal ausführen
Warum „Small-Footprint AI“ Ihr neuer Wettbewerbsvorteil ist
KI ist für Service Desks und Ops-Teams längst Pflichtprogramm. Doch jeder Cloud-Call kostet drei Dinge: Latenz, Geld und Compliance-Sicherheit. Kleine, hochoptimierte lokale Modelle drehen den Spieß um – du behältst die Kontrolle, reagierst schneller und senkst drastisch die Ausgaben.
Das Problem – Cloud-Reibung vs. On-Prem-Agilität
Ein einzelner Roundtrip zu einem Hyperscaler schlägt oft mit 600–800 ms zu Buche. Bei Tausenden Automationen pro Tag bedeutet das:
- Höhere Kosten: €0,02–€0,12 pro 1.000 Tokens
- Unsichere Compliance: Die DSGVO mag keine Cross-Border-Transfers
- Dev-Friction: Wandelnde APIs, Rate Limits, Vendor-Lock-in
Lokale LLMs lösen diese Blocker – aber: Welches Modell? Welche GPU? Wie als API für n8n exponieren?
Unsere Lösung – Ollama Registry + n8n Runners
S&S Technologies bündelt Ollama (leichter Modell-Server) mit gehärteten n8n Workflow-Runners. Ollama hostet Modelle on-prem; n8n orchestriert Prompts, Kontextfenster und Post-Processing. Zusammen liefern sie governed Automation at Scale. Automatisieren. Optimieren. Skalieren.
So funktioniert’s
1. Modellklassen & Use Cases
| Modellklasse | Typische Größe | Ideal für | Beispiel-Prompt |
|---|---|---|---|
| SLMs (Small Language Models) | 3–7 B Parameter | Echtzeit-Chat, Ticket-Triage | „Fasse dieses Ticket in 20 Wörtern zusammen und vergebe eine Priorität.“ |
| Vision-fähige LLMs | 7–13 B | OCR, Screenshot-Analyse, Rechnungs-QA | „Sag mir, ob auf dieser Rechnung eine PO-Nummer fehlt.“ |
| „Thinking“-Modelle (Reasoning-getuned) | 7–13 B mit größerem Kontext | Root-Cause-Analyse, Multi-Step-Automationen | „Gib anhand dieser Log-Auszüge eine Fehlerhypothese und nächste Schritte aus.“ |
2. Modellwahl
- Phi-3-mini-4K-instruct (4 B) – Turboschnelles SLM für Chat/Klassifikation
- Gemma-2-7B-it – Allzweck-„Thinking“-Modell mit 8K Kontext
- Llava-1.6-7B – Versteht Bilder; perfekt für GUI-Screenshot-QA
- OpenHermes-2.5-Mistral-7B – Starke Reasoning-Fähigkeiten, liefert gut strukturiertes JSON
Tipp: Halte ein SLM plus ein Vision-Modell immer resident; starte ein schwereres „Thinking“-Modell nur bei Bedarf.
3. Hardware-Check
- CPU-only Pilot: Moderner 8-Kern-Laptop; rechne mit 2–4 Tokens/s
- GPU-Mindestmaß: NVIDIA RTX 4060 (8 GB VRAM) oder besser; 15–25 Tokens/s bei 7B-Gewichten
- RAM: 16 GB für ein einzelnes Modell; 32 GB, wenn du mehrere hot-swappst
- Disk: .gguf-Dateien sind 1–2 GB groß – auf NVMe für schnelle Loads speichern
4. Ollama & n8n installieren – Quick Links
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# dann
ollama pull gemma:2-7b-it
ollama serve # http://localhost:11434
Vollständige Anleitung: siehe die Ollama-Installationsdokumentation.
n8n neben Ollama zu betreiben ist genauso simpel:
- Self-Host (Docker): Folge dem n8n Docker Quick-Start
- Cloud-Test: Starte eine 14-tägige SaaS-Instanz auf n8n Cloud
Beide Wege funktionieren – der einzige Unterschied ist, wo die Workflow-Engine läuft.
5. Verkabelung in n8n – eingebaute AI-Nodes
| # | Aktion | Warum es wichtig ist |
|---|---|---|
| 1 | In Credentials → Ollama Base URL auf http://localhost:11434 (oder Container-Namen) setzen. Dann einen Ollama Model-Node (Completions) oder Ollama Chat Model-Node (Chat) droppen. |
Native Node = keine Custom-HTTP-Calls und bessere Fehlerbehandlung |
| 2 | Single-Shot Prompts: Modell in Basic LLM Chain einwickeln.Multi-Tool Reasoning: Modell in einen AI Agent füttern und Tool-Nodes (Web Search, SQL, HTTP …) anhängen. | Repliziert LangChain-Patterns innerhalb von n8n |
| 3 | Chain/Agent-Output an dein Zielsystem binden – z. B. mit dem S&S Technologies Matrix42 n8n Node (vollständiges Tutorial unter MATRIX42ARTICLELINK). | Ein Node verwandelt KI-Insights in Ticket-Anreicherung |
Business Impact
| Metrik | Cloud-LLM | Lokales Ollama + n8n | Verbesserung |
|---|---|---|---|
| Ø-Antwortlatenz | 900 ms | 120 ms | ↓ 87 % |
| Kosten pro 1.000 Tokens | €0,06 | €0,004 (Energie) | ↓ 93 % |
| Datenresidenz-Risiko | Extern | On-Prem | Elimininiert |
Kund:innen berichten typischerweise von 30–50 % schnelleren Ticket-Lösungszeiten und ≈ 80 % niedrigeren KI-Kosten innerhalb des ersten Monats.
Nächste Schritte
One-Week Pilot Checklist
- Prüfe, ob Workstation oder Server die GPU/RAM-Ziele erfüllt
- Installiere Ollama; ziehe Phi-3-mini und Gemma-2-7B
- Baue deinen eigenen Workflow oder kontaktiere unser Team für einen schnellen Start
- Schicke Test-Tickets und Rechnungen durch die neuen Nodes
- Miss Latenz und Genauigkeit
- Produktions-Rollout entscheiden
Bereit, Speed, Souveränität und Budget zurückzuerobern? Kontaktiere unser Team und leg los!
Tags: workflow automation, n8n, AI agents, ITSM automation, Salzburg IT services, lokale LLMs, Ollama, DSGVO-konform
S & S Technologies GmbH – Haspingerstraße 4, 5550 Radstadt, Salzburg, Austria
UID-Nr: ATU 77676212 | FN: 571385y (LG Salzburg)
