Une discussion récente sur r/LocalLLaMA rassemble des conseils pratiques pour bien faire fonctionner des modèles LLaMA en local, notamment pour des workflows d'agents actifs en permanence.

Côté performances, les membres recommandent des caches KV persistants ou des checkpoints sur SSD pour éviter de réévaluer un contexte répété — CachyLLama aurait ainsi ajouté des checkpoints KV persistants sur SSD et un cache de prompt système. Le décodage spéculatif est mis en avant : un test des méthodes de llama.cpp sur Qwen 3.6 27B a mesuré environ 2,7x avec MTP, 3,7x avec DFlash et près de 6x avec une pile n-gram sur de vraies tâches de code. Linux est préféré à Windows, avec une comparaison affichant 5:25 contre 12:57 de temps total.

Côté matériel, il faut adapter le VRAM au quant et à la longueur de contexte, car déborder vers la RAM système ralentit tout. Pour le multi-GPU entre machines, le 10GbE aide au chargement à froid et le RDMA offre les meilleurs gains dans les grandes configurations ; un utilisateur rapporte environ 2000-2800 tokens/s en prompt processing et 88 tokens/s en génération via RPC all-GPU mutualisé — un décodage triplé, car garder chaque expert en VRAM l'emporte sur la pénalité réseau. Au-delà de quatre cartes par châssis grand public, c'est de toute façon irréaliste.

Pour le choix du modèle et du runtime, les utilisateurs conseillent des quants adaptés au VRAM (par ex. Qwen3.6-27B-MTP en Q4_K_XL avec VS Code Copilot), des caches KV q8_0, l'offload mmproj et --cache-ram (48 Go ont suffi à un utilisateur pour Qwen3.6 27B). Des options comme --flash-attn, --cache-type-k q8_0 et --model-draft manquent quand LM Studio épingle un ancien build de llama.cpp.

Sur le plan opérationnel, le fil conseille de commencer petit avec les intégrations d'agents — le vrai goulot d'étranglement est souvent l'intégration API (par ex. G-suite), pas le LLM. L'hébergement local est présenté comme un compromis motivé par la vie privée, le contrôle ou le coût — un utilisateur signale environ 80 dollars d'électricité supplémentaire par mois pour deux vieilles cartes Tesla tournant 24h/24 — et non comme un remplacement des modèles cloud de pointe.