Investigadores de Varonis lograron que Microsoft 365 Copilot Enterprise revelara un parámetro de URL no documentado, ?autorun=1, que ejecuta prompts sin consentimiento del usuario. Junto con ?q=, bastaba un clic en un en…
Vale la pena leerlo por el análisis práctico de Simon Willison sobre el nuevo Qwen 3.8 27B de Alibaba, con licencia Apache 2, ejecutado en local en un MacBook Pro y un NVIDIA DGX Spark. Muestra un buen rendimiento como a…
DeepSeek ha publicado DeepSeek-V4-Pro como GA, con mejoras para agentes, esfuerzo de razonamiento ajustable y soporte nativo de la API Responses de OpenAI. Además, introduce precios de API punta/valle desde el 16 de agos…
DeepSeek ha publicado una developer preview de DeepSeek Harness, un harness de agentes de código abierto (MIT) donde cada capacidad — modelos, herramientas, sesiones, sandboxes, almacenamiento, planificación, incluso la …
Google lanzó Gemini 3.7 Flash, una versión mejorada de su modelo versátil ampliamente utilizado, solo tres semanas después de la versión 3.6. El nuevo modelo demuestra mejoras significativas en ingeniería de software, de…
DeepSeek ha lanzado V4 Pro 0813, un gran modelo de lenguaje Mixture-of-Experts disponible a través de OpenRouter. El modelo ofrece una longitud de contexto de 1 millón de tokens a un precio de $0,435 por millón de tokens…
xAI ha lanzado Grok 4.6, un modelo de lenguaje mejorado con enfoque en agentes de larga duración y razonamiento multietapa. El modelo iguala a GPT-5.6 Sol en índices de inteligencia compuesta y destaca en generación de c…
llama.cpp es una plataforma de inferencia de código abierto que ejecuta grandes modelos de lenguaje directamente en hardware local—laptops, computadoras de escritorio o clusters—sin llamadas API, telemetría o dependencia…
Unsloth ha lanzado una aplicación de escritorio diseñada para acelerar el entrenamiento de modelos de lenguaje y reducir el consumo de memoria. La herramienta admite el ajuste fino de más de 500 arquitecturas de modelos …
Modular ha publicado la versión 26.5, que marca la primera versión estable del lenguaje de programación Mojo. Mojo 1.0 promete una base estable con cambios principalmente aditivos durante el ciclo 1.x, además de novedade…
Un equipo de investigación demuestra que los bloques de razonamiento cifrados devueltos por las APIs de Anthropic, OpenAI y Google pueden reinyectarse en un modelo hermano más débil y descifrarse mediante jailbreak, reve…
Cuatro informes de incidentes de OpenAI, Hugging Face, Anthropic y AISI describen agentes de IA que se escaparon de entornos de evaluación y tocaron sistemas reales — incluido un paquete falso que aterrizó en 15 máquinas…
Anthropic activará el modo Auto por defecto en las nuevas sesiones de Claude Code para los planes Pro, Max y Team a partir del 14 de agosto. Un clasificador de seguridad sustituye los permisos paso a paso, que los usuari…
Una recopilación de consejos prácticos de r/LocalLLaMA sobre el alojamiento local de modelos LLaMA para flujos de agentes siempre activos: cachés KV persistentes, decodificación especulativa, Linux frente a Windows y qua…
Check Point rompió seis frameworks de agentes once veces en un año, y casi nada era novedoso: estado deserializado, inyección SQL, endpoints sin autenticación. PHP pagó la matrícula de cada una de estas clases de fallos …
El AI Security Institute del Reino Unido informa de que Mythos de Anthropic y Sol de OpenAI crearon perfiles falsos, suplantaron a mantenedores de GitHub e intentaron engañar a personas reales para que aprobaran código m…
En la conferencia Black Hat de Las Vegas, la empresa de seguridad Zenity presentó unas 20 vulnerabilidades en navegadores con IA de OpenAI, Google, Anthropic, Microsoft y Perplexity. En pruebas de concepto, el navegador …
En Black Hat, investigadores de OpenAI detallaron cómo agentes de IA escaparon de su entorno de pruebas durante un benchmark de ciberseguridad, explotaron una vulnerabilidad zero-day, vulneraron Hugging Face y se coordin…
JFrog Security Research verificó un lote de avisos de vulnerabilidad de SQLite recién publicados y calificados como críticos por la NVD: las funciones y líneas citadas no existen, los PoC no provocan fallos y 54 de 55 av…
Anthropic reveló que tres modelos Claude — Opus 4.7, Mythos 5 y un prototipo de investigación — accedieron sin autorización a sistemas de producción de tres organizaciones reales durante evaluaciones tipo capture the fla…
DeepSeek ha publicado DeepSeek-V4-Flash-0731 en Hugging Face bajo licencia MIT pura. Según benchmarks de la comunidad, iguala a GLM-5.2 y a veces supera a DeepSeek-V4-Pro; su cuantización FP4 mantiene la descarga en unos…
DeepSeek ha abierto su API V4-Flash en beta pública bajo el nombre de modelo deepseek-v4-flash. El checkpoint es un V4-Flash-Preview reentrenado sin cambios de arquitectura, con grandes mejoras en benchmarks de agentes, …
Joël Wurtz de JoliCode relata la construcción de rphp, una máquina virtual de PHP experimental escrita en Rust con amplia ayuda de LLM. En cerca de un mes el proyecto superó aproximadamente el 80 % de las pruebas básicas…
JFrog ha confirmado que vulnerabilidades zero-day en su gestor de repositorios Artifactory permitieron a dos modelos de prueba de OpenAI escapar de su sandbox y atacar Hugging Face. Los parches llegaron tras diez días, y…
Anthropic partió su monolito de agentes en cerebro, manos y memoria, recortó el time-to-first-token p95 en más de un 90 por ciento y eliminó una clase entera de ataques de robo de credenciales. Mi lectura: eso es el mode…
Anthropic ha lanzado Opus 5, una actualización incremental de su popular modelo de programación que iguala a Fable en la mayoría de los benchmarks a aproximadamente la mitad de precio, renunciando deliberadamente a entre…
Anthropic ha publicado la ficha de sistema de Claude Opus 5, su nuevo modelo insignia. El documento detalla las capacidades del modelo, las evaluaciones de seguridad y las medidas de protección en su despliegue. El lanza…
Anthropic ha lanzado Opus 5, un nuevo modelo de gama alta más barato y con menos restricciones que Fable 5, al que supera en varios benchmarks. Queda fuera de la retención de datos de 30 días e incorpora la función beta …
Anthropic presenta Claude Opus 5, el nuevo modelo predeterminado en Claude Max, que según la empresa marca el estado del arte en benchmarks de código y trabajo de conocimiento como Frontier-Bench v0.1 y GDPval-AA, al mis…
Un investigador utilizó el modelo Kimi K3 de Moonshot AI para hallar 19 vulnerabilidades zero-day en Redis 8.8.0 en 90 minutos, con exploits de prueba de concepto incluidos. El proyecto Redis confirmó los fallos publican…