Un développeur a testé la précision de LLM locaux, notamment Qwen, Gemma QAT et le modèle AFM 2 3b d'Apple, via 7 648 questions à choix multiples. Ces questions ont été générées par deepseek-v4-flash à partir des documentations markdown de Node, TypeScript, Vue, Langchain.js et transformers.js.

Les tests révèlent que les modèles isolés sont peu performants. En revanche, l'intégration d'un système RAG (Retrieval-Augmented Generation) a considérablement augmenté la précision des réponses. Apple Intelligence (AFM 2 3b) a obtenu un score solide de 86 %, malgré une fenêtre de contexte limitée à 4k tokens, contre 32k pour les autres modèles.

L'activation des modes de raisonnement ("thinking") n'a apporté qu'un gain marginal d'environ 1 %, tout en augmentant massivement le temps de calcul. Ces travaux servent au développement de « Chatwise », une application d'apprentissage disponible sur l'App Store pour iPhone et macOS.