LLM-Finetuning mit LoRA

Manche Aufgaben brauchen ein Modell, das Ihr Vokabular, Ihre Dokumentformate oder Ihre Art zu antworten kennt. Wir passen offene Sprachmodelle mit LoRA und QLoRA an, die kleine Adapter-Schichten trainieren statt des ganzen Modells. Das braucht deutlich weniger GPU-Speicher und Zeit. Das Ergebnis kann auf Ihrer eigenen Hardware laufen.

LLM-Finetuning mit LoRA

Wann Fine-Tuning das richtige Werkzeug ist

Fine-Tuning verändert, wie ein Modell schreibt und entscheidet. Es passt, wenn das Modell ein festes Format einhalten, Ihre Fachbegriffe verwenden oder eine eng umrissene Aufgabe sehr zuverlässig erledigen soll, etwa Tickets klassifizieren oder Felder aus Dokumenten auslesen. Wenn das Modell vor allem aktuelle Fakten aus Ihren Dokumenten braucht, ist eine RAG-Wissensdatenbank meist die bessere Wahl.

Wie ein Projekt abläuft

  1. Wir legen die Aufgabe fest und wie Erfolg gemessen wird.
  2. Wir bereiten Trainingsdaten aus Ihren Beispielen auf und prüfen sie auf Qualität und personenbezogene Daten.
  3. Wir trainieren einen LoRA- oder QLoRA-Adapter auf einem offenen Modell wie Llama, Mistral oder Qwen, mit offenen Werkzeugen wie Hugging Face PEFT oder Unsloth.
  4. Wir vergleichen das Ergebnis mit dem Basismodell anhand Ihrer eigenen Testfälle.
  5. Das Modell kommt in Ihre Workflows, auf eigener Hardware oder in einem EU-Rechenzentrum. vLLM stellt den Adapter zusammen mit seinem Basismodell bereit; mehrere Adapter können sich ein Basismodell teilen.

Warum LoRA und QLoRA

LoRA trainiert einige Millionen Parameter statt Milliarden. QLoRA lädt das Basismodell zusätzlich mit 4-Bit-Genauigkeit, sodass auch größere Modelle auf eine einzelne GPU passen. Unser Beitrag LLM-Finetuning mit LoRA und QLoRA erklärt beide Methoden.

Bereit, loszulegen?

Erzählen Sie uns, welchen Prozess Sie verbessern möchten. Wir sehen ihn gemeinsam an und schlagen vor, wie Sie beginnen.