Cloud‑LLM vs. Local AI-Agent: Kostenvergleich mit Praxisbeispiel

Alexander Schnabl
Alexander Schnabl ·

Ein Dutzend Rechnungen landet im gemeinsamen Postfach. Unser n8n‑Workflow zieht die PDFs und Bilder ein, lässt ein lokales Small‑Language‑Model (SLM) rund 3 Millionen Tokens extrahieren und sortiert jedes Dokument nach Jahr → Monat → Lieferant ins ERP. Laufzeitkosten auf Ihrer kleinen RTX‑3060‑Workstation: ein paar Cent Strom. Derselbe Ablauf über die GPT‑4‑Turbo‑API kostet ≈ 30 € pro Ausführung – und überträgt vertrauliche Finanzdaten an einen Drittanbieter. Wie wir in unserem Beitrag zur Kleine Sprachmodelle (SLMs): Agentic AI für Ihre Workflow-Automatisierung gezeigt haben, braucht es für fokussierte Aufgaben wie die Rechnungsablage keine LLMs. Unser Leitfaden zu GDPR & KI: Sicheres lokales Hosting für LLMs erklärt außerdem, warum diese PDFs niemals Ihr Netzwerk verlassen sollten.


Das Problem: Token‑Gebühren & Datenrisiken

Cloud‑LLM‑Preise wirken harmlos - bis man die Token‑Sätze mit dokumentenlastigen Workflows multipliziert:

  • Volumen summiert sich schnell. Zwölf typische Rechnungen (eine Seite) erzeugen nach OCR bereits ≈ 3 Mio. Tokens.
  • 30 € pro Lauf werden für KMU, die 20–60 Rechnungen täglich verarbeiten, rasch zu 600–1 800 € pro Monat.
  • Positionspreise, IBANs und Lieferantenadressen passieren US‑Server – ein Risiko für DSGVO, ISO 27001 und Wirtschaftsprüfer.
  • Vendor‑Lock‑in und unvorhersehbare Rate‑Limits gefährden SLAs beim Periodenabschluss.

Unsere Lösung: Lokaler KI‑Agent von S&S Technologies

S&S Technologies kombiniert die Open‑Source‑Plattform n8n mit einem on‑prem SLM, das speziell auf Dokumentenextraktion trainiert ist. Das Ergebnis ist ein durchgängig abgesicherter Workflow, der

  1. Rechnungen erfasst – via E‑Mail, SFTP, Dateisystem, NAS oder Scanner.
  2. Text & Werte extrahiert – mit einem 13‑B‑Parameter‑Modell auf einer RTX 3060 (12 GB VRAM).
  3. Klassifiziert – nach Jahr, Monat und Lieferant.
  4. Speichert – PDF im ERP/DMS und Audit‑Trail im ITSM System.
  5. Absichert – RBAC, versionierte Assets, vollständiges Logging – komplett offline.

Hardware‑Basis: eine 1 800 €‑Workstation (Intel® Core™ i7, 32 GB RAM, Nvidia RTX GPU, 2 TB NVMe). Keine Zusatzlizenzen, keine Per-User-Gebühren.

So funktioniert es im Detail

  1. Ingestion – n8n überwacht das Postfach „Incoming‑Invoices“, Dateisystem‑Events oder jede beliebige Pipeline.
  2. Tokenisierung & Extraktion – Das lokale SLM verarbeitet Roh‑OCR mit ~250 k Tokens/s und liefert strukturiertes JSON.
  3. Klassifikation – Aus Lieferant und Rechnungsdatum entsteht der Pfad /Invoices/2025/07/LIEFERANT/, wo PDF und Metadaten abgelegt werden.
Szenario Tokens pro Lauf Kosten pro 1 M Tokens Laufkosten
OpenAI GPT‑4‑Turbo API 3 000 000 10 € 30,00 €
Lokales SLM auf RTX 3060 3 000 000 ~0 €* ≈ 0,02 € (Strom)

*Keine Vendor‑Gebühr; Strompreis 0,25 €/kWh, Verbrauch ~0,08 kWh pro Lauf.

ROI‑Snapshot

Angenommen, ein mittelständischer Hersteller verarbeitet 1 200 Rechnungen/Monat:

  • Cloud‑LLM: 100 Läufe × 30 € = 3 000 €/Monat
  • Lokales SLM: 100 Läufe × 0,02 € = 2 €/Monat
  • Hardware‑Invest: 1 800 €

Selbst bei 30 Läufen/Monat amortisiert sich die Hardware in < 3 Monaten; Vielnutzer erreichen den ROI in Wochen.

Business Impact

  • 10‑ bis 50‑fache Kostenreduktion für tokenlastige Workflows.
  • 60% kürzere Durchlaufzeit – der KI‑Agent verarbeitet Rechnungen in Minuten statt Tagen.
  • 0 manuelle Touchpoints bis zur Freigabe durch Finance.
  • Daten verbleiben im Unternehmen, erfüllen DSGVO und interne Compliance.
  • Governance by Design: versionierte Workflows, RBAC, fälschungssichere Logs.

Praktische nächste Schritte

Passt ein lokales LLM zu Ihrem Use Case? Prüfen Sie, ob Ihr Workflow …

  • > 100 k Tokens/Tag verarbeitet (Rechnungen, Verträge, Ausschreibungen),
  • personenbezogene oder finanzielle Daten enthält,
  • täglich oder häufiger läuft und
  • unter Rate‑Limits oder unvorhersehbaren API‑Kosten leidet.

Treffen zwei oder mehr Punkte zu, ist On‑Prem‑KI ein heißer Kandidat.

Unser Angebot: S&S Technologies startet einen zweiwöchigen Pilot: Wir analysieren Ihre aktuellen Kosten, deployen einen lokalen Agenten und liefern ein Einsparungsmodell samt Roadmap.

Automate. Optimize. Scale.

Kontaktieren Sie unser Team, um noch dieses Quartal einen Slot zu reservieren.


Tags: workflow automation, KI‑Agenten, ITSM‑Automation, n8n, ERP‑Integration

S&S Technologies GmbH — UID‑Nr: ATU 77676212 — FN: 571385y (LG Salzburg)
Haspingerstraße 4, 5550 Radstadt, Salzburg, Österreich