Tooling
llama.cpp: Open-Weight-Modelle lokal ohne APIs ausführen
llama.cpp ist eine quelloffene Inferenzplattform, die große Sprachmodelle direkt auf lokaler Hardware ausführt – Laptops, Desktops oder Cluster – ohne API-Aufrufe, Telemetrie oder externe Abhängigkeiten. Das Projekt unterstützt diverse Hardware von Apple Silicon bis zu NVIDIA und AMD GPUs mit optimierten Kernen für jede Plattform.
llama.cpp ist eine leichtgewichtige, quelloffene Inferenzlaufzeit, die große Sprachmodelle auf Benutzerhardware ausführt, ohne Cloud-Abhängigkeiten. Das Projekt hat über 123.500 Sterne auf GitHub gesammelt und bietet eine einheitliche Binärdatei, die über heterogene Plattformen läuft: Apple Silicon (M1–M Ultra), NVIDIA GPUs (RTX 3090, RTX 4090, RTX 5090, A100, H100), AMD Radeon und MI-Serie, Intel Arc, Google TPU Varianten, NVIDIA Jetson Edge-Geräte und Standard-CPUs.
Zu den Hauptmerkmalen gehören kostenlose lokale Ausführung (keine API-Schlüssel, keine Telemetrie), Speicherung von Modellen und Gesprächsdaten auf dem Gerät des Benutzers sowie plattformübergreifende Kompatibilität mit handoptimierten GPU- und CPU-Kernen. Die Installation ist über Shell-Skript, Paketmanager (Homebrew, Winget) oder vom Quellcode möglich.
Das Tool integriert sich mit dem Pi-Coding-Agent-Framework: Benutzer können `llama serve` ausführen, um ein Modell zu hosten, das pi-llama-Plugin installieren und Pi starten für automatische lokale Modellentdeckung ohne Konfigurationsaufwand. Unterstützte Modelle sind Qwen 3.6 (Alibabas multimodale Reasoning-Modelle), Gemma 4 und Gemma 3 (Googles quelloffene Modelle mit Unterstützung für über 140 Sprachen) und GPT-OSS (OpenAIs erste quelloffene Modelle seit GPT-2, optimiert für Reasoning und Function Calling).
Das Projekt richtet sich an einzelne Entwickler und Unternehmenscluster, die private, autonome KI-Inferenz ohne Vendor Lock-in suchen.
Leserforum
Noch keine Beiträge — eröffne die Debatte.
Starte die Diskussion
Kein Konto, kein Passwort nötig — gib einfach deine E-Mail-Adresse ein, wir senden dir einen einmaligen Anmelde-Link. Beim ersten Mal bist du damit automatisch angemeldet.
Deine Bewertung wird nach der Anmeldung automatisch übernommen.
Schau in dein Postfach
Wir haben einen Anmelde-Link an … gesendet. Öffne ihn auf diesem Gerät — dieser Tab meldet dich automatisch an.
Nichts angekommen? Wirf einen Blick in den Spam-Ordner — und markiere die Mail dort als „Kein Spam“, dann landet sie künftig direkt im Postfach.