llama.cpp est un moteur d'inférence léger et open-source qui exécute les grands modèles de langage sur le matériel de l'utilisateur sans dépendances cloud. Le projet a accumulé plus de 123 500 étoiles sur GitHub et fournit un binaire unique fonctionnant sur des plates-formes hétérogènes : Apple Silicon (M1–M Ultra), GPUs NVIDIA (RTX 3090, RTX 4090, RTX 5090, A100, H100), cartes AMD Radeon et MI-series, Intel Arc, variantes Google TPU, appareils NVIDIA Jetson edge, et CPUs standard.

Les fonctionnalités clés incluent l'exécution locale sans frais (sans clés API, sans télémétrie), la conservation des modèles et des données de conversation sur la machine de l'utilisateur, et une compatibilité multiplateforme avec des noyaux GPU et CPU optimisés à la main. L'installation est disponible via script shell, gestionnaires de paquets (Homebrew, Winget), ou à partir des sources.

L'outil s'intègre au framework d'agent de codage Pi : les utilisateurs peuvent exécuter `llama serve` pour héberger un modèle, installer le plugin pi-llama et lancer Pi pour la découverte automatique de modèles locaux sans configuration. Les modèles supportés incluent Qwen 3.6 (modèles de raisonnement multimodaux d'Alibaba), Gemma 4 et Gemma 3 (modèles open-source de Google avec support de plus de 140 langues), et GPT-OSS (premiers modèles open-weight d'OpenAI depuis GPT-2, optimisés pour le raisonnement et l'appel de fonctions).

Le projet cible à la fois les développeurs individuels et les clusters d'entreprise cherchant une inférence IA privée et autonome sans dépendance aux fournisseurs.