How To: LLMs lokal ausführen

Alexander Schnabl
Alexander Schnabl ·

Warum „Small-Footprint AI“ Ihr neuer Wettbewerbsvorteil ist

KI ist für Service Desks und Ops-Teams längst Pflichtprogramm. Doch jeder Cloud-Call kostet drei Dinge: Latenz, Geld und Compliance-Sicherheit. Kleine, hochoptimierte lokale Modelle drehen den Spieß um – du behältst die Kontrolle, reagierst schneller und senkst drastisch die Ausgaben.


Das Problem – Cloud-Reibung vs. On-Prem-Agilität

Ein einzelner Roundtrip zu einem Hyperscaler schlägt oft mit 600–800 ms zu Buche. Bei Tausenden Automationen pro Tag bedeutet das:

  • Höhere Kosten: €0,02–€0,12 pro 1.000 Tokens
  • Unsichere Compliance: Die DSGVO mag keine Cross-Border-Transfers
  • Dev-Friction: Wandelnde APIs, Rate Limits, Vendor-Lock-in

Lokale LLMs lösen diese Blocker – aber: Welches Modell? Welche GPU? Wie als API für n8n exponieren?


Unsere Lösung – Ollama Registry + n8n Runners

S&S Technologies bündelt Ollama (leichter Modell-Server) mit gehärteten n8n Workflow-Runners. Ollama hostet Modelle on-prem; n8n orchestriert Prompts, Kontextfenster und Post-Processing. Zusammen liefern sie governed Automation at Scale. Automatisieren. Optimieren. Skalieren.


So funktioniert’s

1. Modellklassen & Use Cases

Modellklasse Typische Größe Ideal für Beispiel-Prompt
SLMs (Small Language Models) 3–7 B Parameter Echtzeit-Chat, Ticket-Triage „Fasse dieses Ticket in 20 Wörtern zusammen und vergebe eine Priorität.“
Vision-fähige LLMs 7–13 B OCR, Screenshot-Analyse, Rechnungs-QA „Sag mir, ob auf dieser Rechnung eine PO-Nummer fehlt.“
„Thinking“-Modelle (Reasoning-getuned) 7–13 B mit größerem Kontext Root-Cause-Analyse, Multi-Step-Automationen „Gib anhand dieser Log-Auszüge eine Fehlerhypothese und nächste Schritte aus.“

2. Modellwahl

  1. Phi-3-mini-4K-instruct (4 B) – Turboschnelles SLM für Chat/Klassifikation
  2. Gemma-2-7B-it – Allzweck-„Thinking“-Modell mit 8K Kontext
  3. Llava-1.6-7B – Versteht Bilder; perfekt für GUI-Screenshot-QA
  4. OpenHermes-2.5-Mistral-7B – Starke Reasoning-Fähigkeiten, liefert gut strukturiertes JSON

Tipp: Halte ein SLM plus ein Vision-Modell immer resident; starte ein schwereres „Thinking“-Modell nur bei Bedarf.

3. Hardware-Check

  • CPU-only Pilot: Moderner 8-Kern-Laptop; rechne mit 2–4 Tokens/s
  • GPU-Mindestmaß: NVIDIA RTX 4060 (8 GB VRAM) oder besser; 15–25 Tokens/s bei 7B-Gewichten
  • RAM: 16 GB für ein einzelnes Modell; 32 GB, wenn du mehrere hot-swappst
  • Disk: .gguf-Dateien sind 1–2 GB groß – auf NVMe für schnelle Loads speichern
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# dann
ollama pull gemma:2-7b-it
ollama serve            # http://localhost:11434

Vollständige Anleitung: siehe die Ollama-Installationsdokumentation.

n8n neben Ollama zu betreiben ist genauso simpel:

Beide Wege funktionieren – der einzige Unterschied ist, wo die Workflow-Engine läuft.

5. Verkabelung in n8n – eingebaute AI-Nodes

# Aktion Warum es wichtig ist
1 In Credentials → Ollama Base URL auf http://localhost:11434 (oder Container-Namen) setzen. Dann einen Ollama Model-Node (Completions) oder Ollama Chat Model-Node (Chat) droppen. Native Node = keine Custom-HTTP-Calls und bessere Fehlerbehandlung
2 Single-Shot Prompts: Modell in Basic LLM Chain einwickeln.Multi-Tool Reasoning: Modell in einen AI Agent füttern und Tool-Nodes (Web Search, SQL, HTTP …) anhängen. Repliziert LangChain-Patterns innerhalb von n8n
3 Chain/Agent-Output an dein Zielsystem binden – z. B. mit dem S&S Technologies Matrix42 n8n Node (vollständiges Tutorial unter MATRIX42ARTICLELINK). Ein Node verwandelt KI-Insights in Ticket-Anreicherung

Business Impact

Metrik Cloud-LLM Lokales Ollama + n8n Verbesserung
Ø-Antwortlatenz 900 ms 120 ms ↓ 87 %
Kosten pro 1.000 Tokens €0,06 €0,004 (Energie) ↓ 93 %
Datenresidenz-Risiko Extern On-Prem Elimininiert

Kund:innen berichten typischerweise von 30–50 % schnelleren Ticket-Lösungszeiten und ≈ 80 % niedrigeren KI-Kosten innerhalb des ersten Monats.


Nächste Schritte

One-Week Pilot Checklist

  1. Prüfe, ob Workstation oder Server die GPU/RAM-Ziele erfüllt
  2. Installiere Ollama; ziehe Phi-3-mini und Gemma-2-7B
  3. Baue deinen eigenen Workflow oder kontaktiere unser Team für einen schnellen Start
  4. Schicke Test-Tickets und Rechnungen durch die neuen Nodes
  5. Miss Latenz und Genauigkeit
  6. Produktions-Rollout entscheiden

Bereit, Speed, Souveränität und Budget zurückzuerobern? Kontaktiere unser Team und leg los!


Tags: workflow automation, n8n, AI agents, ITSM automation, Salzburg IT services, lokale LLMs, Ollama, DSGVO-konform


S & S Technologies GmbH – Haspingerstraße 4, 5550 Radstadt, Salzburg, Austria
UID-Nr: ATU 77676212 | FN: 571385y (LG Salzburg)