Ein Entwickler untersuchte die Genauigkeit lokaler LLMs, darunter Qwen, Gemma QAT und das Apple AFM 2 3b Modell. Hierzu wurden 7.648 Multiple-Choice-Fragen verwendet, die mit deepseek-v4-flash aus den Markdown-Dokumentationen von Node, TypeScript, Vue, Langchain.js und transformers.js erstellt wurden.
Die Ergebnisse zeigten, dass eigenständige Modelle eine schwache Leistung erbrachten. Die Genauigkeit stieg jedoch drastisch an, sobald die Modelle in ein RAG-System (Retrieval-Augmented Generation) integriert wurden. Apple Intelligence (AFM 2 3b) erreichte eine beachtliche Quote von 86 %, obwohl es mit einem Kontextfenster von nur 4k begrenzt war, während andere Modelle 32k nutzten.
Tests mit „Thinking“- oder Reasoning-Modi brachten lediglich eine minimale Verbesserung von etwa 1 %, verursachten jedoch einen erheblich höheren Rechenaufwand. Diese Erkenntnisse fließen in die App „Chatwise“ ein, die als Lernhilfe für iPhone und macOS entwickelt wurde.
Kommentare
Noch keine Kommentare — schreib den ersten.
Starte die Diskussion
Kein Konto, kein Passwort nötig — gib einfach deine E-Mail-Adresse ein, wir senden dir einen einmaligen Anmelde-Link. Beim ersten Mal bist du damit automatisch angemeldet.
Deine Bewertung wird nach der Anmeldung automatisch übernommen.
Schau in dein Postfach
Wir haben einen Anmelde-Link an … gesendet. Öffne ihn auf diesem Gerät — dieser Tab meldet dich automatisch an.
Warte auf deinen Klick …
·