Un développeur a testé la précision de LLM locaux, notamment Qwen, Gemma QAT et le modèle AFM 2 3b d'Apple, via 7 648 questions à choix multiples. Ces questions ont été générées par deepseek-v4-flash à partir des documentations markdown de Node, TypeScript, Vue, Langchain.js et transformers.js.
Les tests révèlent que les modèles isolés sont peu performants. En revanche, l'intégration d'un système RAG (Retrieval-Augmented Generation) a considérablement augmenté la précision des réponses. Apple Intelligence (AFM 2 3b) a obtenu un score solide de 86 %, malgré une fenêtre de contexte limitée à 4k tokens, contre 32k pour les autres modèles.
L'activation des modes de raisonnement ("thinking") n'a apporté qu'un gain marginal d'environ 1 %, tout en augmentant massivement le temps de calcul. Ces travaux servent au développement de « Chatwise », une application d'apprentissage disponible sur l'App Store pour iPhone et macOS.
Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
En attente de ton clic …
·