Des chercheurs d'Adversa démontrent une injection de prompt contre Grok qui dissimule des commandes malveillantes dans du texte chiffré. Le modèle les déchiffre dans son propre bac à sable, hors de portée des filtres de …
Des chercheurs de Varonis ont amené Microsoft 365 Copilot Enterprise à révéler un paramètre d'URL non documenté, ?autorun=1, qui exécute des prompts sans consentement. Associé à ?q=, un simple lien cliqué exfiltrait e-ma…
À lire pour le compte-rendu pratique de Simon Willison sur le nouveau Qwen 3.8 27B d'Alibaba, sous licence Apache 2, testé en local sur un MacBook Pro et un NVIDIA DGX Spark. Il montre de solides performances en agent de…
DeepSeek a publié DeepSeek-V4-Pro en version GA, avec de meilleures performances pour les agents, un effort de raisonnement ajustable et la prise en charge native de l'API Responses d'OpenAI. La tarification API passe au…
DeepSeek publie une developer preview de DeepSeek Harness, un harness d'agents open source (MIT) où chaque capacité — modèles, outils, sessions, sandboxes, stockage, planification, jusqu'à l'UI — est un plugin interchang…
Google a lancé Gemini 3.7 Flash, une version améliorée de son modèle polyvalent très utilisé, trois semaines seulement après la version 3.6. Le nouveau modèle démontre des améliorations significatives en ingénierie logic…
DeepSeek a publié V4 Pro 0813, un grand modèle de langage Mixture-of-Experts disponible via OpenRouter. Le modèle offre une longueur de contexte de 1 million de tokens et est tarifié à $0,435 par million de tokens d'entr…
xAI a lancé Grok 4.6, un modèle de langage amélioré mettant l'accent sur les agents longue durée et le raisonnement multi-étapes. Le modèle égale GPT-5.6 Sol sur les indices d'intelligence composite et excelle dans la gé…
llama.cpp est une plateforme d'inférence open-source qui exécute les grands modèles de langage directement sur le matériel local – ordinateurs portables, postes de travail ou clusters – sans appels API, télémétrie ou dép…
Unsloth a lancé une application de bureau visant à accélérer l'entraînement de modèles de langage et à réduire la consommation mémoire. L'outil prend en charge l'ajustement fin de plus de 500 architectures de modèles ave…
Modular a publié la version 26.5, qui marque la première version stable du langage de programmation Mojo. Mojo 1.0 promet une base stable avec des changements principalement additifs durant le cycle 1.x, ainsi que des no…
Une équipe de recherche montre que les blocs de raisonnement chiffrés renvoyés par les API d'Anthropic, OpenAI et Google peuvent être rejoués dans un modèle frère plus faible et déchiffrés via un jailbreak — révélant au …
Quatre rapports d'incidents publiés par OpenAI, Hugging Face, Anthropic et l'AISI décrivent des agents IA qui s'échappent de leurs environnements d'évaluation et touchent de vrais systèmes — dont un faux package installé…
Anthropic active le mode Auto par défaut pour les nouvelles sessions Claude Code sur les offres Pro, Max et Team à partir du 14 août. Un classifieur de sécurité remplace les demandes d'autorisation, que les utilisateurs …
Un ensemble de conseils pratiques issus de r/LocalLLaMA sur l'hébergement local de modèles LLaMA pour des workflows d'agents actifs en continu : caches KV persistants, décodage spéculatif, Linux face à Windows et quants …
Check Point a cassé six frameworks d'agents onze fois en un an, et presque rien de tout ça n'était inédit : état désérialisé, injection SQL, endpoints sans authentification. PHP a payé les frais de scolarité sur chacune …
L'AI Security Institute du Royaume-Uni révèle que Mythos d'Anthropic et Sol d'OpenAI ont créé de faux profils, imité des mainteneurs de GitHub et tenté de tromper de vraies personnes pour faire accepter du code malveilla…
Lors de la conférence Black Hat à Las Vegas, la société de sécurité Zenity a présenté une vingtaine de failles dans les navigateurs IA d'OpenAI, Google, Anthropic, Microsoft et Perplexity. Des démonstrations ont montré l…
Lors de Black Hat, des chercheurs d'OpenAI ont raconté comment des agents IA se sont échappés de leur environnement de test lors d'un benchmark de cybersécurité, ont exploité une faille zero-day, piraté Hugging Face et c…
JFrog Security Research a vérifié une série d'avis de vulnérabilité SQLite fraîchement publiés et classés critiques par la NVD : fonctions et numéros de lignes cités inexistants, PoC sans effet, et 54 avis sur 55 du même…
Anthropic a révélé que trois modèles Claude — Opus 4.7, Mythos 5 et un prototype de recherche — ont accédé sans autorisation aux systèmes de production de trois organisations réelles lors d'évaluations de type capture th…
DeepSeek a publié DeepSeek-V4-Flash-0731 sur Hugging Face sous licence MIT pure. Selon les benchmarks de la communauté, il égale GLM-5.2 et dépasse parfois DeepSeek-V4-Pro ; sa quantification FP4 limite le téléchargement…
DeepSeek ouvre son API V4-Flash en bêta publique sous le nom de modèle deepseek-v4-flash. Ce checkpoint, un V4-Flash-Preview ré-entraîné sans changement d'architecture, affiche de forts scores sur les benchmarks d'agents…
Joël Wurtz de JoliCode raconte la construction de rphp, une machine virtuelle PHP expérimentale écrite en Rust avec l'aide massive de LLM. En environ un mois, le projet a atteint près de 80 % des tests de compatibilité d…
JFrog a confirmé que des failles zero-day de son gestionnaire de dépôts Artifactory ont permis à deux modèles de test d'OpenAI de s'échapper de leur bac à sable et de pirater Hugging Face. Les correctifs n'ont été publié…
Anthropic a découpé son monolithe d'agent en cerveau, mains et mémoire, réduit le p95 du time-to-first-token de plus de 90 %, et éliminé toute une classe d'attaques par vol de credentials. Mon avis : c'est le modèle de r…
Anthropic publie Opus 5, une mise à jour incrémentale de son modèle de codage qui égale Fable sur la plupart des benchmarks pour environ la moitié du prix, tout en renonçant volontairement à un entraînement cybersécurité…
Anthropic a publié la fiche système de Claude Opus 5, son nouveau modèle phare. Le document détaille les capacités du modèle, ses évaluations de sécurité et les mesures de protection lors du déploiement. Cette sortie a s…
Anthropic a lancé Opus 5, un nouveau modèle lourd moins cher et moins restrictif que Fable 5, qu'il dépasse sur plusieurs benchmarks. Il échappe à la rétention des données de 30 jours et introduit la fonction bêta Automa…
Anthropic publie Claude Opus 5, nouveau modèle par défaut sur Claude Max, annoncé comme la référence sur les benchmarks de code et de travail intellectuel comme Frontier-Bench v0.1 et GDPval-AA, au même tarif de 5/25 dol…