The Daily Commit · Édition de rubrique La une PHP AI Dev EN DE FR ES

TheModelDesk

8 juillet 2026
modèles, agents & inférence locale

Actus

Les LLM locaux ont besoin de RAG pour des réponses techniques précises

Un développeur a évalué les modèles locaux (Gemma, Qwen, Apple Intelligence) sur 7.648 questions techniques provenant de documentations populaires. Les modèles isolés ont donné de faibles résultats ; ajouter RAG avec récupération de documents a considérablement amélioré la précision. Le raisonnement étendu a apporté des gains minimes avec un coût de calcul élevé.

Un développeur a testé la précision de LLM locaux, notamment Qwen, Gemma QAT et le modèle AFM 2 3b d'Apple, via 7 648 questions à choix multiples. Ces questions ont été générées par deepseek-v4-flash à partir des documentations markdown de Node, TypeScript, Vue, Langchain.js et transformers.js.

Les tests révèlent que les modèles isolés sont peu performants. En revanche, l'intégration d'un système RAG (Retrieval-Augmented Generation) a considérablement augmenté la précision des réponses. Apple Intelligence (AFM 2 3b) a obtenu un score solide de 86 %, malgré une fenêtre de contexte limitée à 4k tokens, contre 32k pour les autres modèles.

L'activation des modes de raisonnement ("thinking") n'a apporté qu'un gain marginal d'environ 1 %, tout en augmentant massivement le temps de calcul. Ces travaux servent au développement de « Chatwise », une application d'apprentissage disponible sur l'App Store pour iPhone et macOS.

Lire la source originale (en anglais) ↗

Évaluer cet article : 0

Tribune des lecteurs

Pas encore de contributions — lance le débat.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Édition écran · Mentions légales · Politique de confidentialité