Noticias
Los LLM locales necesitan RAG para respuestas técnicas precisas
Un desarrollador evaluó modelos locales (Gemma, Qwen, Apple Intelligence) en 7.648 preguntas técnicas de documentación popular. Los modelos aislados funcionaron mal; agregar RAG con recuperación de documentos mejoró significativamente la precisión. El razonamiento extendido aportó ganancias mínimas con alto costo computacional.
Un desarrollador evaluó la precisión de LLM locales, incluyendo Qwen, Gemma QAT y el modelo AFM 2 3b de Apple, mediante 7.648 preguntas de opción múltiple. Dichas preguntas fueron generadas por deepseek-v4-flash basándose en la documentación markdown de Node, TypeScript, Vue, Langchain.js y transformers.js.
Los resultados indicaron que los modelos independientes tuvieron un desempeño deficiente. Sin embargo, la precisión mejoró drásticamente al integrar un sistema RAG (Generación Aumentada por Recuperación). Apple Intelligence (AFM 2 3b) logró un sólido 86%, a pesar de tener una ventana de contexto limitada a 4k tokens, frente a los 32k de los demás modelos.
El uso de modos de razonamiento ("thinking") solo aportó una mejora marginal del 1%, pero con un costo computacional significativamente mayor. Estos hallazgos se aplican a «Chatwise», una aplicación de aprendizaje disponible en la App Store para iPhone y macOS.
Tribuna de lectores
Aún no hay aportaciones — abre el debate.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
Esperando tu clic …
·