LLaMA Factory: Vollständiger Leitfaden zum LLM Fine-Tuning im Jahr 2026


2026-04-25


LLaMA Factory interface for fine-tuning large language models

LLaMA Factory hat sich im Jahr 2026 zu einem der am weitesten verbreiteten Open-Source-Frameworks für das Fine-Tuning von großen Sprachmodellen entwickelt. Mit über 70.600 GitHub-Sternen, 8.600 Forks und der Übernahme durch Organisationen wie Amazon, NVIDIA und Aliyun hat es sich als Go-to-Toolkit für Entwickler etabliert, die LLMs für domänenspezifische Aufgaben anpassen müssen (GitHub — hiyouga/LlamaFactory).

Aber Fine-Tuning ist nicht für jeden geeignet. Es erfordert GPU-Infrastruktur, Datensatzvorbereitung und tiefes technisches Fachwissen – Ressourcen, die die meisten Fachleute und Teams einfach nicht haben. Für diejenigen, die spezialisierte KI-Fähigkeiten benötigen, ohne Trainingspipelines verwalten zu müssen, bietet Jenova eine Alternative: eine Bibliothek von Experten-KI-Agenten – vom Academic Research Assistant bis zum Business Co-Pilot – jeder mit tiefem Domänenwissen ausgestattet und über ein einziges Gespräch zugänglich.

Dieser Leitfaden behandelt alles, was Sie über LLaMA Factory im April 2026 wissen müssen: was es tut, wie es funktioniert, welche Modelle es unterstützt und wann eine Plattform wie Jenova sinnvoller ist als der Aufbau eines eigenen Trainingsclusters.


Kurze Antwort: Was ist LLaMA Factory?

LLaMA Factory ist ein Open-Source-Framework für das Fine-Tuning von über 100 großen Sprachmodellen und Vision-Language-Modellen, ohne Trainingscode schreiben zu müssen. Es wurde auf der ACL 2024 vorgestellt und wird von Forschern der Beihang-Universität gepflegt (arXiv — LlamaFactory Paper).

  • Zero-Code Fine-Tuning über CLI und die LlamaBoard Web-UI
  • Unterstützt über 100 Modellarchitekturen, einschließlich LLaMA, Qwen3, DeepSeek, Gemma, Mistral und Phi
  • Mehrere Trainingsmethoden: SFT, RLHF, DPO, KTO, ORPO und kontinuierliches Pre-Training
  • Speichereffiziente Techniken: LoRA, QLoRA (2–8 Bit), DoRA, PiSSA, GaLore und OFT

Das Problem: Fine-Tuning ist leistungsstark, aber anspruchsvoll

Die Nachfrage nach maßgeschneiderten KI-Modellen war noch nie so hoch. Organisationen wollen LLMs, die ihre Terminologie verstehen, ihren Arbeitsabläufen folgen und domänengenaue Ergebnisse liefern. Fine-Tuning ist der Standardansatz – aber er bringt erhebliche Hürden mit sich.

Kosten für die GPU-Infrastruktur

Das Fine-Tuning selbst eines 7B-Parametermodells mit LoRA erfordert mindestens 16 GB VRAM. Das Full-Parameter-Fine-Tuning eines 70B-Modells benötigt 1.200 GB GPU-Speicher (GitHub — LlamaFactory Hardware Requirements). Während QLoRA die Anforderungen eines 7B-Modells auf bis zu 4 GB reduzieren kann, erfordert produktionsreifes Fine-Tuning im großen Maßstab immer noch Multi-GPU-Setups, die Tausende von Dollar pro Monat an Cloud-Rechenleistung kosten.

Das Fine-Tuning eines 7B-Modells kostet 2026 für einfache Durchläufe unter 5 US-Dollar, aber reale Produktionsworkflows mit größeren Modellen und iterativen Trainingszyklen lassen die Kosten schnell ansteigen. — Spheron Network, März 2026

Technische Komplexität

Trotz der No-Code-Web-UI von LLaMA Factory müssen Benutzer immer noch die Formatierung von Datensätzen (JSON-Struktur für Instruction-Tuning), die Auswahl von Hyperparametern, die Kompromisse bei der Quantisierung und die Konfiguration des LoRA-Rangs verstehen. Ein Vergleich von Fine-Tuning-Frameworks aus dem Jahr 2026 stellte fest, dass die Lernkurve selbst mit optimierten Werkzeugen für Nicht-ML-Fachleute steil bleibt.

Aufwand für die Datenvorbereitung

Jeder Fine-Tuning-Job erfordert kuratierte, formatierte Trainingsdaten. LLaMA Factory unterstützt mehrere Datenformate für SFT, DPO und RLHF, aber die Benutzer müssen Datensätze vorbereiten, dataset_info.json-Dateien aktualisieren und die Datenqualität vor Beginn des Trainings validieren (LLaMA Factory Documentation).

Wartung und Iteration

Ein feinabgestimmtes Modell ist kein fertiges Produkt. Es erfordert Evaluierung, erneutes Training, wenn sich die Basismodelle verbessern, und laufende Aktualisierungen der Datensätze. Organisationen, die LLaMA Factory in Fertigungs- und Bau-Workflows einsetzen, berichten, dass der operative Aufwand für die Wartung feinabgestimmter Modelle oft unterschätzt wird (Atomic Loops, April 2026).


LLaMA Factory: Funktionen und Fähigkeiten

Unterstützte Modelle

LLaMA Factory unterstützt eine breite Palette von Modellfamilien, mit Day-0- oder Day-1-Unterstützung für die neuesten Veröffentlichungen (GitHub — LlamaFactory):

Support-StufeModelle
Day 0 (Support am selben Tag)Qwen3, Qwen2.5-VL, Gemma 3, GLM-4.1V, InternLM 3, MiniCPM-o-2.6
Day 1 (Support am nächsten Tag)Llama 3, Llama 4, GLM-4, Mistral Small, PaliGemma2
Vollständiger KatalogBLOOM, DeepSeek, Falcon, Gemma, Granite, Phi-3/Phi-4, StarCoder 2, Yuan 2 und mehr

Das Framework unterstützt auch die Registrierung benutzerdefinierter Modelle, sodass Benutzer neue Architekturen hinzufügen können, indem sie der Modelldokumentation folgen (LLaMA Factory — Model Support).

Trainingsmethoden

MethodeBeschreibung
Pre-trainingKontinuierliches oder inkrementelles Pre-Training auf Domänenkorpora
SFTÜberwachtes Fine-Tuning mit Anweisungs-Antwort-Paaren
RLHFReinforcement Learning from Human Feedback über PPO
DPODirekte Präferenzoptimierung ohne Belohnungsmodelle
KTOKahneman-Tversky-Optimierung zur Präferenzabstimmung
ORPOOdds-Ratio-Präferenzoptimierung

Fine-Tuning-Techniken

LLaMA Factory hebt sich von Konkurrenten wie FastChat, LitGPT und LMFlow ab, indem es die größte Auswahl an parametereffizienten Methoden unterstützt (FPT Cloud — LLaMA Factory Feature Comparison):

FeatureLLaMA FactoryFastChatLitGPTLMFlow
LoRA
QLoRA
DoRA
LoRA+
PiSSA
GaLore
DPO
KTO
ORPO

Zusätzliche Optimierungen umfassen FlashAttention-2, Unsloth (170 % LoRA-Geschwindigkeitssteigerung), Liger Kernel, KTransformers (Fine-Tuning von 1.000B+ Modellen mit 2× RTX 4090 + CPU) und vLLM-Integration für 270 % schnellere Inferenz (GitHub — LlamaFactory Changelog).

Hardware-Anforderungen

MethodeBits7B14B70B
Full (bf16)32120GB240GB1.200GB
Full (pure_bf16)1660GB120GB600GB
LoRA/Freeze1616GB32GB160GB
QLoRA46GB12GB48GB
QLoRA24GB8GB24GB

NVIDIA DGX Spark Integration

Seit Februar 2026 hat NVIDIA ein offizielles LLaMA Factory Playbook für DGX Spark mit Blackwell-Architektur veröffentlicht, das LoRA-, QLoRA- und vollständige Fine-Tuning-Workflows mit PyTorch CUDA 13 demonstriert (NVIDIA — LLaMA Factory on DGX Spark).


Die Jenova-Alternative: Experten-KI ohne Fine-Tuning

LLaMA Factory ist das richtige Werkzeug, wenn Sie ein benutzerdefiniertes Modell benötigen, das auf proprietären Daten für eine spezifische Produktionspipeline trainiert wurde. Aber für die große Mehrheit der Fachleute – Vermarkter, Forscher, Studenten, Gründer, Analysten – ist das Ziel kein benutzerdefiniertes Modell. Das Ziel ist eine KI-Ausgabe auf Expertenniveau in einem spezifischen Bereich, die sofort geliefert wird.

Genau dafür wurde Jenova entwickelt.

Anstatt ein Basismodell selbst feinabzustimmen, bietet Jenova vorgefertigte Spezialisten-Agenten, die tiefes Domänenwissen mit Multi-Modell-Intelligenz kombinieren. Jeder Agent ist speziell für einen bestimmten Arbeitsablauf konzipiert und wird von Modellen wie GPT-5.4, Claude Opus 4.6 und Gemini 3.1 Pro Preview angetrieben – ohne Anbieterbindung.

DimensionLLaMA FactoryJenova
EinrichtungszeitStunden bis TageSofort
GPU erforderlichJa (6GB–1.200GB)Nein
Programmierung erforderlichCLI/YAML-Konfig.Keine — konversationell
ModellzugriffNur Open-Source-ModelleGPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro, xAI, DeepSeek
DomänenexpertiseSie bauen sie aufVorgefertigte Spezialisten-Agenten
GedächtnisPro SitzungSitzungsübergreifendes, persistentes Gedächtnis
Tool-IntegrationManuelle API-EinrichtungGmail, Calendar, Drive, Search, Notion und mehr über MCP

Spezialisierte KI-Agenten für jeden Bereich

📊 Forschung & Analyse

Academic Research Assistant — Literaturrecherche, Manuskripterstellung und Zitationsmanagement. Anstatt ein Modell auf wissenschaftlichen Arbeiten feinabzustimmen, bitten Sie den Forschungsassistenten, Erkenntnisse aus verschiedenen Quellen zu synthetisieren, Lücken in der Literatur zu identifizieren und Zitate zu formatieren.

  • Datenbankübergreifende Literatursuche
  • Methodikbewertung und -kritik
  • APA/MLA/Chicago-Zitierformatierung

Fundamental Stock Analyst — Aktienanalyse mit Gewinnanalyse, Bewertungsmodellierung und Interpretation von SEC-Einreichungen. Liefert die Art von domänenspezifischem Finanzdenken, das andernfalls ein Fine-Tuning auf Tausenden von 10-K-Einreichungen erfordern würde.

  • DCF- und Vergleichsunternehmensanalyse
  • Interpretation von Earnings-Call-Transkripten
  • Identifizierung von Risikofaktoren

💼 Business & Strategie

Business Co-Pilot — Strategischer Partner für Gründer, der Planung, Finanzmodellierung und Betrieb abdeckt. Bietet die Art von nuancierter Geschäftsberatung, für die ein feinabgestimmtes Modell umfangreiche Trainingsdaten benötigen würde, um sie anzunähern.

  • Marktgrößenbestimmung und Wettbewerbsanalyse
  • Finanzprognosemodellierung
  • Gestaltung von Betriebsabläufen

Marketing Strategist — Berater auf CMO-Ebene für Medienmix, Kanalstrategie, Budgetzuweisung und Kampagnenplanung.

  • Multi-Channel-Attributionsmodellierung
  • Empfehlungen zur Budgetzuweisung
  • Frameworks zur Kampagnenleistung

🎓 Bildung & Prüfungsvorbereitung

SAT/ACT Tutor — Adaptives Prüfungsvorbereitungscoaching, das den Schwierigkeitsgrad an die Leistung des Schülers anpasst. Die Art von personalisiertem Unterricht, die ein Fine-Tuning auf Tausenden von Schülerinteraktionsprotokollen erfordern würde.

  • Diagnostische Bewertungen und Punktzahlvorhersage
  • Abschnittsspezifisches Strategiecoaching
  • Zeitgesteuertes Üben mit Leistungsanalytik

LSAT Tutor — Spezialisierte Vorbereitung für logisches Denken, Logikspiele und Leseverständnis mit adaptiver Schwierigkeitsskalierung.

✍️ Inhalt & Schreiben

SEO Blog Generator — Forschungsgestützte Artikel mit Echtzeitstatistiken, korrekten Zitaten und Google-optimierter Struktur. Produziert Inhalte, die andernfalls ein auf SEO-Best-Practices und aktuellen Suchdaten feinabgestimmtes Modell erfordern würden.

  • Automatisierte Keyword-Recherche und -Integration
  • Ausrichtung auf Featured Snippets
  • E-E-A-T-Konformität

Creative Fiction Writer — Storytelling-Partner für Recherche, redaktionelle Einblicke und polierte Prosa in jedem Genre.

Testen Sie jeden Agent kostenlos – keine Kreditkarte erforderlich.


Wie LLaMA Factory funktioniert: Schritt-für-Schritt

Für diejenigen, die tatsächlich ein benutzerdefiniertes Fine-Tuning benötigen, hier ist, wie LLaMA Factory funktioniert:

1. Installieren Sie das Framework

Klonen Sie das Repository und installieren Sie die Abhängigkeiten:

"Klonen Sie das LlamaFactory-Repository, installieren Sie es mit pip und fügen Sie optional Metriken und DeepSpeed-Abhängigkeiten hinzu."

Das Framework erfordert Python 3.11+, PyTorch 2.6+ und CUDA 11.6+ (12.2+ empfohlen). Docker-Images sind auch für CUDA-, AMD ROCm- und Ascend NPU-Umgebungen verfügbar (GitHub — LlamaFactory Installation).

2. Bereiten Sie Ihren Datensatz vor

Formatieren Sie Trainingsdaten als JSON mit Anweisungs-Antwort-Paaren. Speichern Sie Datensätze im Verzeichnis /data und registrieren Sie sie in dataset_info.json. LLaMA Factory unterstützt Formate für SFT, DPO, RLHF und Pre-Training (LLaMA Factory — Data Preparation).

"Ich habe einen Kundensupport-Datensatz mit 10.000 Ticket-Lösungs-Paaren. Wie sollte ich ihn für SFT strukturieren?"

3. Konfigurieren Sie das Training

Verwenden Sie entweder die LlamaBoard Web-UI (llamafactory-cli webui) oder bereiten Sie eine YAML-Konfigurationsdatei vor, die Modell, Datensatz, Trainingsmethode, LoRA-Rang, Lernrate und Ausgabeverzeichnis angibt.

"Führe ein Fine-Tuning von Qwen3-7B mit LoRA auf meinem medizinischen Q&A-Datensatz mit 4-Bit-Quantisierung durch."

4. Führen Sie das Training aus

Führen Sie es über die CLI (llamafactory-cli train config.yaml) aus oder klicken Sie in der Web-UI auf „Start“. Die Trainingsdauer reicht von 30 Minuten bis zu 7+ Stunden, abhängig von der Modellgröße und dem Datensatz (NVIDIA — LLaMA Factory Playbook).

5. Zusammenführen und Bereitstellen

Für das LoRA-Training führen Sie die Adaptergewichte mit dem Basismodell zusammen, indem Sie den Export-Tab oder llamafactory-cli export verwenden. Stellen Sie es über eine OpenAI-ähnliche API mit einem vLLM- oder SGLang-Worker für die Produktionsinferenz bereit.


Ergebnisse & Anwendungsfälle

📊 Finanzanalyse

Szenario: Eine Investmentfirma benötigt eine KI, die ihr proprietäres Bewertungsframework versteht.

Fine-Tuning-Ansatz: Sammeln Sie über 5.000 Analystenberichte, formatieren Sie sie als Anweisungs-Antwort-Paare, führen Sie ein Fine-Tuning von Llama 3 70B mit LoRA durch. Erfordert ein Multi-GPU-Setup, 2–3 Wochen Datenvorbereitung und laufendes Neutraining.

Jenova-Ansatz: Verwenden Sie den Fundamental Stock Analyst für sofortige Aktienanalyse, kombiniert mit dem Macro Strategist für den Cross-Asset-Kontext. Laden Sie proprietäre Dokumente als Wissensdatenbank-Anhänge für eine dauerhafte Referenz hoch.

💼 Startup-Betrieb

Szenario: Ein Gründer benötigt KI-Unterstützung für Pitch Decks, Finanzmodelle und die Personalbeschaffung.

Fine-Tuning-Ansatz: Unpraktisch – würde separate Modelle für jeden Bereich erfordern, von denen jedes kuratierte Trainingsdaten benötigt.

Jenova-Ansatz: Verwenden Sie den Startup Advisor für strategische Anleitung, den Business Plan Writer für investorenreife Dokumente und den Interview Coach für die Einstellungsvorbereitung – alles von derselben Plattform mit gemeinsamem Gedächtnis.

📱 Mobile Forschung

Szenario: Ein Doktorand muss während des Pendelns Literatur sichten.

Fine-Tuning-Ansatz: Auf mobilen Geräten nicht durchführbar.

Jenova-Ansatz: Öffnen Sie den Academic Research Assistant in der Jenova Mobile App. Bitten Sie ihn, aktuelle Veröffentlichungen zu einem Thema zusammenzufassen, methodische Lücken zu identifizieren und Abschnitte für den Literaturüberblick zu entwerfen – alles mit einem persistenten Gedächtnis, das auf Desktop-Sitzungen übertragen wird.

🎓 Prüfungsvorbereitung

Szenario: Ein Bewerber für die juristische Fakultät benötigt eine LSAT-Vorbereitung, die sich an seine Schwächen anpasst.

Fine-Tuning-Ansatz: Würde Tausende von kommentierten LSAT-Fragen mit Schwierigkeitsmetadaten und Schülerleistungsdaten erfordern.

Jenova-Ansatz: Der LSAT Tutor bietet adaptive Diagnosen, abschnittsspezifische Strategien und zeitgesteuertes Üben mit Leistungsverfolgung – keine Trainingspipeline erforderlich.


FAQ

Wofür wird LLaMA Factory verwendet?

LLaMA Factory ist ein Open-Source-Framework für das Fine-Tuning von großen Sprachmodellen (LLMs) und Vision-Language-Modellen (VLMs) auf benutzerdefinierten Datensätzen. Es unterstützt überwachtes Fine-Tuning, RLHF, DPO und andere Trainingsmethoden für über 100 Modellarchitekturen, einschließlich LLaMA, Qwen, DeepSeek und Gemma. Es wird von Entwicklern und Forschern verwendet, die vortrainierte Modelle für domänenspezifische Aufgaben wie medizinische Diagnose, Kundensupport oder Inhaltsklassifizierung anpassen müssen (GitHub — LlamaFactory).

Benötige ich eine GPU, um LLaMA Factory zu verwenden?

Ja. Selbst die speichereffizienteste Methode (2-Bit-QLoRA) erfordert mindestens 4 GB VRAM für ein 7B-Modell. Das Full-Parameter-Fine-Tuning größerer Modelle erfordert Hunderte von Gigabyte GPU-Speicher. Wenn Sie KI-Fähigkeiten ohne GPU-Infrastruktur benötigen, bieten Plattformen wie Jenova spezialisierte Agenten, die von Spitzenmodellen angetrieben werden, ohne Hardwareanforderungen.

Wie schneidet LLaMA Factory im Vergleich zu Axolotl und Unsloth ab?

LLaMA Factory bietet den breitesten Funktionsumfang unter den Open-Source-Fine-Tuning-Frameworks, mit einzigartiger Unterstützung für DoRA, LoRA+, PiSSA, KTO und ORPO. Axolotl bietet tiefere Anpassungsmöglichkeiten für fortgeschrittene Benutzer, während sich Unsloth auf die reine Trainingsgeschwindigkeit konzentriert (bis zu 12-mal schnelleres MoE-Training). Die LlamaBoard Web-UI von LLaMA Factory macht es zur zugänglichsten Option für Benutzer, die eine No-Code-Schnittstelle bevorzugen (DEV Community — Fine-Tuning in 2026).

Ist LLaMA Factory kostenlos?

Ja. LLaMA Factory ist Open-Source unter der Apache-2.0-Lizenz. Sie müssen jedoch Ihre eigene GPU-Infrastruktur (lokal oder in der Cloud) bereitstellen und die individuellen Modelllizenzen für alle Modelle einhalten, die Sie feinabstimmen (z. B. haben Llama, Qwen, Gemma jeweils ihre eigenen Lizenzbedingungen).

Kann ich multimodale Modelle mit LLaMA Factory feinabstimmen?

Ja. LLaMA Factory unterstützt multimodales überwachtes Fine-Tuning für Vision-Language-Modelle wie LLaVA, Qwen2.5-VL, Qwen3-VL, PaliGemma2 und MiniCPM-o-2.6. Zu den Aufgaben gehören Bildverständnis, visuelle Verankerung, Videoerkennung und Audioverständnis (LLaMA Factory Documentation).

Was ist, wenn ich KI-Expertise benötige, aber kein Modell feinabstimmen möchte?

Jenova bietet spezialisierte KI-Agenten für die Bereiche Finanzen, Bildung, Forschung, Wirtschaft, Recht, Gesundheit und Kreativität. Jeder Agent kombiniert tiefes Domänenwissen mit dem Zugriff auf Spitzenmodelle wie GPT-5.4 und Claude Opus 4.6. Sie erhalten sofort KI-Ausgaben auf Expertenniveau – keine Datensätze, keine GPUs, keine Trainingspipelines.


Fazit

LLaMA Factory bleibt das funktionsreichste Open-Source-Framework für LLM-Fine-Tuning im Jahr 2026. Seine Unterstützung für über 100 Modelle, umfassende Trainingsmethoden und die LlamaBoard Web-UI haben ihm über 70.600 GitHub-Sterne und die Übernahme durch große Cloud-Anbieter eingebracht. Für Teams mit ML-Expertise, GPU-Infrastruktur und kuratierten Trainingsdaten ist es ein außergewöhnliches Werkzeug.

Für alle anderen – die Gründer, Forscher, Studenten, Analysten und Fachleute, die heute domänenexperte KI benötigen – liefert Jenova diese Expertise durch speziell entwickelte Agenten wie den Academic Research Assistant, den Fundamental Stock Analyst und den Business Co-Pilot. Kein Fine-Tuning erforderlich. Keine Infrastruktur zu verwalten. Nur Ergebnisse.

Entdecken Sie die vollständige Agenten-Bibliothek auf Jenova.