Ein Entwickler untersuchte die Genauigkeit lokaler LLMs, darunter Qwen, Gemma QAT und das Apple AFM 2 3b Modell. Hierzu wurden 7.648 Multiple-Choice-Fragen verwendet, die mit deepseek-v4-flash aus den Markdown-Dokumentationen von Node, TypeScript, Vue, Langchain.js und transformers.js erstellt wurden.

Die Ergebnisse zeigten, dass eigenständige Modelle eine schwache Leistung erbrachten. Die Genauigkeit stieg jedoch drastisch an, sobald die Modelle in ein RAG-System (Retrieval-Augmented Generation) integriert wurden. Apple Intelligence (AFM 2 3b) erreichte eine beachtliche Quote von 86 %, obwohl es mit einem Kontextfenster von nur 4k begrenzt war, während andere Modelle 32k nutzten.

Tests mit „Thinking“- oder Reasoning-Modi brachten lediglich eine minimale Verbesserung von etwa 1 %, verursachten jedoch einen erheblich höheren Rechenaufwand. Diese Erkenntnisse fließen in die App „Chatwise“ ein, die als Lernhilfe für iPhone und macOS entwickelt wurde.