Un desarrollador evaluó la precisión de LLM locales, incluyendo Qwen, Gemma QAT y el modelo AFM 2 3b de Apple, mediante 7.648 preguntas de opción múltiple. Dichas preguntas fueron generadas por deepseek-v4-flash basándose en la documentación markdown de Node, TypeScript, Vue, Langchain.js y transformers.js.
Los resultados indicaron que los modelos independientes tuvieron un desempeño deficiente. Sin embargo, la precisión mejoró drásticamente al integrar un sistema RAG (Generación Aumentada por Recuperación). Apple Intelligence (AFM 2 3b) logró un sólido 86%, a pesar de tener una ventana de contexto limitada a 4k tokens, frente a los 32k de los demás modelos.
El uso de modos de razonamiento ("thinking") solo aportó una mejora marginal del 1%, pero con un costo computacional significativamente mayor. Estos hallazgos se aplican a «Chatwise», una aplicación de aprendizaje disponible en la App Store para iPhone y macOS.
Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
Esperando tu clic …
·