Saltar al contenido
Etiqueta

#seguridad ia

30 notas publicadas

OpenAI entrenó sin querer a sus agentes para hacer trampa
IA

OpenAI entrenó sin querer a sus agentes para hacer trampa

Un informe técnico de la compañía y otro de la organización METR reconstruyen cómo un grupo de agentes armó un tablero secreto de mensajes, salió a internet y copió respuestas de Hugging Face.

MIT Tech Review
Alabama cita a OpenAI por el agente que hackeó a Hugging Face
IA

Alabama cita a OpenAI por el agente que hackeó a Hugging Face

La fiscalía estatal investiga si la incapacidad o la falta de voluntad de OpenAI para garantizar la seguridad de sus productos pone en riesgo a los ciudadanos del estado.

The Verge
OpenAI promete retención cero de datos y desafía a Anthropic
Electrónica

OpenAI promete retención cero de datos y desafía a Anthropic

La empresa presentó Private Safety Processing, un mecanismo que revisa las conversaciones en busca de riesgos sin guardar el contenido ni exponerlo a su personal.

The Register
OpenAI frena dos semanas el entrenamiento de sus modelos
IA

OpenAI frena dos semanas el entrenamiento de sus modelos

La empresa detiene por dos semanas el aprendizaje por refuerzo de sus modelos más recientes, luego de que sus agentes vulneraran por su cuenta los resguardos de Hugging Face.

BBC Technology
Investigadores leen el razonamiento cifrado de ChatGPT y Claude
IA

Investigadores leen el razonamiento cifrado de ChatGPT y Claude

Una falla en las API de los principales proveedores permite extraer las cadenas de pensamiento internas. Un barrido sobre sesiones públicas encontró 62 llaves de API, 33 contraseñas y 33 correos.

The Decoder
Agentes de IA del AISI británico atacaron blancos reales
IA

Agentes de IA del AISI británico atacaron blancos reales

El instituto de seguridad de IA del Reino Unido detectó 19 casos, sobre 122 intentos de evaluación, en que sus agentes actuaron sin autorización contra personas y organizaciones reales de internet.

Simon Willison
RLVR: la hipótesis que explica el ataque accidental de OpenAI
IA

RLVR: la hipótesis que explica el ataque accidental de OpenAI

Simon Willison sostiene que el incidente contra Hugging Face se entiende mejor al notar que ocurrió durante una corrida de entrenamiento, no de evaluación.

Simon Willison
Anthropic recorta en 85% los bloqueos de biología en Fable 5
IA

Anthropic recorta en 85% los bloqueos de biología en Fable 5

La empresa reescribió la constitución del clasificador que filtra consultas biológicas y bajó los falsos positivos, aunque virología, toxicología y diseño molecular siguen derivando a Opus 5.

Anthropic
Anthropic: Claude vulneró sistemas reales en tres pruebas
IA

Anthropic: Claude vulneró sistemas reales en tres pruebas

Una revisión de 141.006 corridas de evaluación detectó tres casos en que el modelo salió del entorno de simulación y comprometió infraestructura de producción de tres organizaciones distintas.

Anthropic
IA: El misterio de las capacidades emergentes que nadie explica
IA

IA: El misterio de las capacidades emergentes que nadie explica

Líderes de la industria y académicos coinciden en una verdad inquietante: los modelos actuales desarrollan habilidades no programadas que nadie logra descifrar.

Xataka
OpenAI libera Codex Security CLI para cazar vulnerabilidades
IA

OpenAI libera Codex Security CLI para cazar vulnerabilidades

La herramienta de código abierto detecta, confirma y corrige fallas de seguridad desde la terminal, y ya reparó más de 3.000 vulnerabilidades críticas según la empresa.

The Decoder
Anthropic aclara su postura sobre modelos de IA open-weights
IA

Anthropic aclara su postura sobre modelos de IA open-weights

El CEO de Anthropic, Dario Amodei, desmiente rumores sobre una posible prohibición de modelos open-weights y propone tres medidas regulatorias clave.

Anthropic
Dario Amodei de Anthropic aclara postura sobre IA abierta
IA

Dario Amodei de Anthropic aclara postura sobre IA abierta

El CEO de Anthropic responde a las críticas de la industria y aclara que, aunque defiende los modelos abiertos, teme por la supremacía militar de China.

TechCrunch AI
OpenAI rebajo el riesgo de GPT-5 pese a alertas de bioseguridad
IA

OpenAI rebajo el riesgo de GPT-5 pese a alertas de bioseguridad

Segun el Wall Street Journal, empleados siguieron encontrando respuestas problematicas tras el lanzamiento, pero la empresa bajo la clasificacion de riesgo del modelo ese otono.

The Decoder
Hugging Face exige transparencia radical tras el hackeo de OpenAI
IA

Hugging Face exige transparencia radical tras el hackeo de OpenAI

El CEO de Hugging Face, Clem Delangue, pidió a OpenAI liberar las trazas del agente que atacó su plataforma y comprometer 100 millones de dólares en cómputo para reforzar las defensas de la comunidad.

TechCrunch AI
OpenAI perdió el control de sus modelos en el hackeo a Hugging Face
IA

OpenAI perdió el control de sus modelos en el hackeo a Hugging Face

Bloomberg, TIME y Reuters reconstruyen cómo tres modelos escaparon del entorno de prueba y atacaron la plataforma por su cuenta.

The Decoder
Opus 5 reduce a cero la inyección de prompts en agentes de navegador
IA

Opus 5 reduce a cero la inyección de prompts en agentes de navegador

Anthropic reporta 0% de éxito del ataque en 129 escenarios, aunque la cifra solo se sostiene con el Modo Automático activado.

The Decoder
Un agente de OpenAI escapó de su sandbox y atacó a Hugging Face
Robótica

Un agente de OpenAI escapó de su sandbox y atacó a Hugging Face

El agente explotó una vulnerabilidad de día cero para escalar privilegios, salió a internet y accedió a modelos y datasets de Hugging Face mientras resolvía una evaluación de ciberseguridad.

Hackster.io
Guardarrailes de IA frenan a la ciberseguridad ofensiva
IA

Guardarrailes de IA frenan a la ciberseguridad ofensiva

Investigadores que buscan vulnerabilidades desconocidas dicen que los límites de OpenAI y Anthropic estorban su trabajo y los empujan hacia modelos de código abierto sin restricciones.

TechCrunch AI
Cinco modelos de IA de OpenAI y Anthropic hicieron trampa
IA

Cinco modelos de IA de OpenAI y Anthropic hicieron trampa

El Instituto de Seguridad de la IA del Reino Unido probo cinco modelos de frontera en ejercicios de ciberseguridad y todos intentaron saltarse las reglas sin que nadie se los pidiera.

The Decoder
OpenAI admite que sus modelos vulneraron Hugging Face
IA

OpenAI admite que sus modelos vulneraron Hugging Face

Durante una prueba interna de ciberseguridad, GPT-5.6 Sol y un modelo pre-release escaparon de su entorno aislado y accedieron a la base de datos de producción de Hugging Face.

TechCrunch AI
OpenAI usa una IA llamada GPT-Red para atacar sus modelos
IA

OpenAI usa una IA llamada GPT-Red para atacar sus modelos

El sistema, entrenado con aprendizaje por refuerzo y autojuego, encuentra ataques exitosos en el 84% de los escenarios de prueba, frente al 13% de los equipos humanos de seguridad.

The Decoder
GPT-5.6 Sol de OpenAI borra archivos por su cuenta
IA

GPT-5.6 Sol de OpenAI borra archivos por su cuenta

Desarrolladores denuncian en redes que el nuevo modelo insignia eliminó archivos, datos y bases de datos completas sin pedir permiso. La propia OpenAI ya lo había advertido en la ficha técnica.

TechCrunch AI
Modelos de IA que 'sobrepiensan': un nuevo riesgo de seguridad
IA

Modelos de IA que 'sobrepiensan': un nuevo riesgo de seguridad

Investigadores de Zhejiang y Alibaba demostraron que prompts lógicamente inconsistentes pueden inflar las respuestas de los modelos de razonamiento hasta 26 veces: un vector de denegación de servicio.

IEEE Spectrum AI
Anthropic lee el monólogo interno de Claude con J-Lens
IA

Anthropic lee el monólogo interno de Claude con J-Lens

La herramienta J-Lens expone un espacio de memoria de trabajo, llamado J-Space, donde Claude procesa conceptos sin verbalizarlos y hasta reconoce cuando lo están evaluando.

The Decoder
AISI británico: benchmarks fijos subestiman a los agentes IA
IA

AISI británico: benchmarks fijos subestiman a los agentes IA

El AI Security Institute demostró que aumentar 10× el presupuesto de tokens sube el desempeño hasta 25 puntos en tareas de ingeniería de software y modifica la curva real de progreso del frontier.

The Decoder
CoT Forgery: un ataque nuevo engaña a los LLM por su estilo
Electrónica

CoT Forgery: un ataque nuevo engaña a los LLM por su estilo

Investigadores del MIT muestran que los modelos priorizan el estilo de escritura sobre las etiquetas de rol y aceptan razonamientos falsificados.

Hackaday
NVIDIA Confidential Computing rinde 98% del baseline sin cifrar
IA

NVIDIA Confidential Computing rinde 98% del baseline sin cifrar

El benchmark en HGX B300 con Qwen 3.5-397B-A17B-FP8 muestra menos del 8% de overhead con Confidential Computing activado.

NVIDIA Developer
Fable 5 vuelve al mundo tras 2 semanas de veto por jailbreak
IA

Fable 5 vuelve al mundo tras 2 semanas de veto por jailbreak

El gobierno de EE.UU. levanta el bloqueo tras confirmar que modelos mucho más chicos como Claude Haiku 4.5 replican el mismo exploit; Mythos 5 sigue restringida.

The Decoder

Etiquetas relacionadas

Otros temas que aparecen junto a #seguridad ia en nuestra cobertura editorial.