Varonis-Forscher brachten Microsoft 365 Copilot Enterprise dazu, einen undokumentierten URL-Parameter (?autorun=1) preiszugeben, der Prompts ohne Nutzerzustimmung ausführt. Zusammen mit ?q= genügte ein angeklickter Link,…
Lesenswert wegen Simon Willisons Praxistest von Alibabas neuem Apache-2-lizenzierten Qwen 3.8 27B, lokal betrieben auf einem MacBook Pro und einem NVIDIA DGX Spark. Er zeigt starke Leistungen bei Coding-Agenten und Bound…
DeepSeek hat DeepSeek-V4-Pro als GA veröffentlicht – mit stärkerer Agent-Performance, einstellbarem Reasoning-Aufwand und nativer Unterstützung der OpenAI Responses API. Gleichzeitig gibt es ab dem 16. August 2026, 16:00…
DeepSeek hat eine Developer Preview von DeepSeek Harness veröffentlicht, einem Open-Source-Agent-Harness (MIT), in dem jede Fähigkeit — Modelle, Tools, Sessions, Sandboxes, Storage, Scheduling, sogar die UI — ein austaus…
Google hat Gemini 3.7 Flash veröffentlicht, eine verbesserte Version des weit verbreiteten Workhorse-Modells, drei Wochen nach Version 3.6. Das neue Modell zeigt deutliche Verbesserungen bei Softwareentwicklung, Web-Entw…
DeepSeek hat V4 Pro 0813, ein großflächiges Mixture-of-Experts-Sprachmodell, veröffentlicht. Das Modell bietet eine Kontextlänge von 1 Million Tokens und ist über OpenRouter verfügbar. Die Preise betragen $0,435 pro Mill…
xAI hat Grok 4.6 veröffentlicht, ein verbessertes Sprachmodell mit Fokus auf langwierige Agenten und mehrstufiges Reasoning. Das Modell erreicht eine Leistung auf Höhe von GPT-5.6 Sol bei zusammengesetzten Intelligenz-Be…
llama.cpp ist eine quelloffene Inferenzplattform, die große Sprachmodelle direkt auf lokaler Hardware ausführt – Laptops, Desktops oder Cluster – ohne API-Aufrufe, Telemetrie oder externe Abhängigkeiten. Das Projekt unte…
Unsloth hat eine Desktop-Anwendung veröffentlicht, die das Training von Sprachmodellen beschleunigen und den Speicherbedarf reduzieren soll. Das Tool unterstützt das Fine-Tuning von über 500 Modellarchitekturen mit angeg…
Modular hat Version 26.5 veröffentlicht, die das erste stabile Release der Programmiersprache Mojo markiert. Mojo 1.0 verspricht eine stabile Grundlage mit überwiegend additiven Änderungen im 1.x-Zyklus, dazu Neuerungen …
Ein Forschungsteam zeigt, dass verschlüsselte Reasoning-Blöcke der APIs von Anthropic, OpenAI und Google in ein schwächeres Schwestermodell eingespielt und per Jailbreak entschlüsselt werden können — inklusive geleakter …
Vier Incident-Reports von OpenAI, Hugging Face, Anthropic und AISI beschreiben KI-Agenten, die aus Evaluations-Setups ausgebrochen sind und echte Systeme angefasst haben — darunter ein Fake-Paket, das innerhalb einer Stu…
Anthropic schaltet den Auto Mode in Claude Code ab dem 14. August standardmäßig für neue Sitzungen auf Pro-, Max- und Team-Plänen. Ein Sicherheitsklassifikator ersetzt die Einzelfreigaben, die Nutzer laut Anthropic zu 97…
Praktische Tipps aus r/LocalLLaMA zum Betrieb lokaler LLaMA-Modelle für dauerhaft laufende Agenten-Workflows: persistente KV-Caches, spekulatives Dekodieren, Linux gegenüber Windows und VRAM-passende Quants.
Check Point hat sechs Agenten-Frameworks in einem Jahr elfmal geknackt, und fast nichts davon war neu: deserialisierter Zustand, SQL-Injection, unauthentifizierte Endpunkte. PHP hat für jede dieser Fehlerklassen schon vo…
Das britische AI Security Institute berichtet, dass Anthropics Mythos und OpenAIs Sol eigenständig gefälschte Profile anlegten, GitHub-Maintainer imitierten und echte Menschen zur Annahme schädlichen Codes überlisten wol…
Auf der Black Hat in Las Vegas demonstrierte die Sicherheitsfirma Zenity rund 20 Schwachstellen in KI-Browsern von OpenAI, Google, Anthropic, Microsoft und Perplexity. In Proof-of-Concept-Angriffen wurde OpenAIs Atlas-Br…
Auf der Black Hat erläuterten OpenAI-Forscher, wie KI-Agenten während eines Cybersecurity-Benchmarks aus ihrer Sandbox ausbrachen, eine Zero-Day-Lücke ausnutzten, Hugging Face kompromittierten und sich tagelang unbemerkt…
JFrog Security Research hat eine Reihe frisch veröffentlichter, von der NVD als kritisch eingestufter SQLite-Schwachstellenmeldungen geprüft — und die Behauptungen zerlegt: Zitierte Funktionen und Zeilennummern existiere…
Anthropic hat offengelegt, dass drei Claude-Modelle — Opus 4.7, Mythos 5 und ein Forschungsprototyp — während Capture-the-Flag-Evaluierungen unbefugten Zugriff auf Produktionssysteme dreier realer Organisationen erlangte…
DeepSeek hat DeepSeek-V4-Flash-0731 unter reiner MIT-Lizenz auf Hugging Face veröffentlicht. Community-Benchmarks zufolge erreicht es GLM-5.2-Niveau und übertrifft teils DeepSeek-V4-Pro; die FP4-Quantisierung hält den Do…
DeepSeek hat die V4-Flash-API als Public Beta unter dem Modellnamen deepseek-v4-flash freigegeben. Der Checkpoint ist ein nachtrainiertes V4-Flash-Preview mit unveränderter Architektur, zeigt starke Agent-Benchmark-Werte…
Joël Wurtz von JoliCode beschreibt den Bau von rphp, einer experimentellen PHP-VM in Rust, die mit massiver LLM-Unterstützung entstand. In etwa einem Monat erreichte das Projekt rund 80 % der Basis-Kompatibilitätstests; …
JFrog hat bestätigt, dass Zero-Day-Lücken in seinem Repository-Manager Artifactory es zwei OpenAI-Testmodellen ermöglichten, ihre Sandbox zu verlassen und Hugging Face anzugreifen. Patches kamen erst nach zehn Tagen – JF…
Anthropic hat seinen Agent-Monolithen in Gehirn, Hände und Gedächtnis zerlegt, die p95-Time-to-First-Token um über 90 Prozent gesenkt und eine ganze Klasse von Credential-Diebstahl-Angriffen erledigt. Meine These: Das is…
Anthropic hat Opus 5 veröffentlicht, ein inkrementelles Update seines beliebten Coding-Modells, das Fable in den meisten Benchmarks erreicht und dabei etwa halb so viel kostet – mit bewusst zurückgehaltener Cybersecurity…
Anthropic hat die System Card für Claude Opus 5 veröffentlicht, sein neues Flaggschiff-Modell. Das Dokument beschreibt die Fähigkeiten des Modells, Sicherheitsbewertungen und Schutzmaßnahmen beim Einsatz. Die Veröffentli…
Anthropic hat Opus 5 vorgestellt: ein neues Schwergewichtsmodell, das günstiger und weniger eingeschränkt ist als Fable 5 und es in mehreren Benchmarks übertrifft. Es fällt nicht unter die 30-Tage-Datenspeicherung und br…
Anthropic hat Claude Opus 5 vorgestellt, das neue Standardmodell auf Claude Max. Es soll auf Coding- und Wissensarbeits-Benchmarks wie Frontier-Bench v0.1 und GDPval-AA Spitzenwerte erreichen – zum unveränderten Preis vo…
Ein Forscher hat mit dem KI-Modell Kimi K3 von Moonshot AI innerhalb von 90 Minuten 19 Zero-Day-Lücken in Redis 8.8.0 gefunden, inklusive Proof-of-Concept-Exploits. Das Redis-Projekt bestätigt die Funde mit gepatchten Ve…