Un desarrollador evaluó la precisión de LLM locales, incluyendo Qwen, Gemma QAT y el modelo AFM 2 3b de Apple, mediante 7.648 preguntas de opción múltiple. Dichas preguntas fueron generadas por deepseek-v4-flash basándose en la documentación markdown de Node, TypeScript, Vue, Langchain.js y transformers.js.

Los resultados indicaron que los modelos independientes tuvieron un desempeño deficiente. Sin embargo, la precisión mejoró drásticamente al integrar un sistema RAG (Generación Aumentada por Recuperación). Apple Intelligence (AFM 2 3b) logró un sólido 86%, a pesar de tener una ventana de contexto limitada a 4k tokens, frente a los 32k de los demás modelos.

El uso de modos de razonamiento ("thinking") solo aportó una mejora marginal del 1%, pero con un costo computacional significativamente mayor. Estos hallazgos se aplican a «Chatwise», una aplicación de aprendizaje disponible en la App Store para iPhone y macOS.