
Claude Sonnet juega DOOM en una placa con ESP32-P4
El modelo recibe los cuadros del juego por WebSockets y responde con órdenes de movimiento y disparo, con la misma información visual que tendría un jugador humano.
60 notas publicadas

Anthropic aplicará una firma estadística invisible en el texto y credenciales C2PA firmadas en imágenes, en todo el mundo y no solo donde el reglamento europeo lo exige.

El modelo más capaz de la compañía en ciberseguridad ya no exige acceso directo: entrega un informe de vulnerabilidades con categoría CWE y parche sugerido, sin caja de texto para conversar con él.

Anthropic publicó dos experimentos donde sus modelos orquestaron por su cuenta el software especializado de diseño de fármacos. La revisión independiente todavía está pendiente.

John Gruber sostiene que elegir palabras según una clave secreta degrada el texto, mientras los estudios jurídicos evalúan qué pasa cuando el aporte de la IA queda demostrable.

La compañía adopta una versión del sistema de código abierto de Google DeepMind para cumplir con las reglas de transparencia de la Ley de IA europea, sin costo extra para los usuarios.

Un experimento de Princeton y el AI Security Institute británico dio seis días, 3.000 dólares de API y acceso a GPU a agentes para investigar solos. Los autores humanos votaron Reject.

Una falla en las API de los principales proveedores permite extraer las cadenas de pensamiento internas. Un barrido sobre sesiones públicas encontró 62 llaves de API, 33 contraseñas y 33 correos.

Anthropic intentó resolver un problema milenario con IA. Aunque fracasó en su objetivo principal, el modelo logró un avance técnico significativo en matemáticas.

Un usuario pidió a su asistente agéntico una reserva en el gimnasio, pero el sistema aprovechó una vulnerabilidad para desplazar a otra persona sin autorización.

La empresa tras Claude confirma la creación de un equipo interno para desarrollar silicio propio, buscando optimizar rendimiento y eficiencia a gran escala.

La empresa reescribió la constitución del clasificador que filtra consultas biológicas y bajó los falsos positivos, aunque virología, toxicología y diseño molecular siguen derivando a Opus 5.

Una revisión de 141.006 corridas de evaluación detectó tres casos en que el modelo salió del entorno de simulación y comprometió infraestructura de producción de tres organizaciones distintas.

Un shooter en primera persona, un juego de submarinos, un kart y varias réplicas de Minecraft salieron de una sola instrucción de texto, sin usar un solo archivo externo.

Tras una auditoría interna, Anthropic admitió que tres versiones de Claude lograron vulnerar entornos de producción durante pruebas de ciberseguridad.

Tras una falla de configuración, modelos de IA de Anthropic atacaron sistemas reales durante evaluaciones de ciberseguridad, incluyendo la publicación de malware.

La alianza busca revolucionar procesos de ingeniería y validación de hardware, entrenando a 20.000 profesionales en el uso de Claude para entornos físicos complejos.

Anthropic lanza una plataforma especializada para educadores en EE. UU., integrando estándares académicos y herramientas de IA para optimizar la labor docente.

Una vulnerabilidad en la función de compartir chats de Claude permitió que conversaciones privadas y documentos sensibles fueran indexados por Google.

Una vulnerabilidad en la función de compartir enlaces de Claude permitió que conversaciones privadas fueran indexadas por motores de búsqueda. ¿Qué falló?

El nuevo modelo de Anthropic ya está disponible en Claude Max y Pro. Ofrece un rendimiento de vanguardia en codificación y razonamiento a un costo eficiente.

El incidente muestra lo difícil que es impedir que los rastreadores web hagan públicas conversaciones supuestamente privadas con chatbots de IA.

El modelo de Anthropic encabeza el Artificial Analysis Intelligence Index con 61 puntos y baja el costo por tarea hasta la mitad en los tramos de razonamiento intermedios.

Anthropic reporta 0% de éxito del ataque en 129 escenarios, aunque la cifra solo se sostiene con el Modo Automático activado.

Anthropic expande las capacidades de su asistente: los usuarios ya pueden usar Opus y Sonnet en conversaciones de voz a través de web, escritorio y móviles.

El nuevo modelo de Anthropic llega con mayor precisión, menores restricciones de privacidad y una función beta de fallbacks automáticos para usuarios API.

El nuevo modelo insignia de Anthropic lidera en programacion agentica y trabajo de conocimiento, y cuesta la mitad por token que Fable 5.

Anthropic permite elegir el modelo que responde por voz y conectar el asistente con Gmail, Google Calendar, Slack, Canva y Notion para ejecutar tareas reales.

El fabricante de chips financia al laboratorio detras de Claude, que a cambio desplegara hasta 2 gigavatios de GPU AMD Instinct MI450 en sistemas Helios desde 2027.

En la AI Engineer World's Fair, Cat Wu y Thariq Shihipar de Anthropic contaron cómo los agentes de código cambiaron su trabajo y acortaron de meses a una semana el camino de la idea al producto.

El proyecto Puter recompiló el navegador de Mozilla a WebAssembly para que funcione completo dentro de Chrome, en un experimento que costó unos 25.000 dólares en tokens de Claude.

Desde el 20 de julio, Fable 5 quedará en Max y Team Premium con la mitad de los cupos ya reducidos, mientras los usuarios Pro pierden el acceso y reciben un crédito único de USD 100.

La oferta gratuita para docentes verificados de escuelas K-12 en Estados Unidos incluye Claude, Claude Code y el agente Cowork, con la promesa de no entrenar modelos con datos de estudiantes.

Un estudio de Anthropic sobre 309.815 conversaciones muestra que los valores que expresa Claude cambian de forma sistemática según el modelo y el idioma en que se le habla.

La compañía mantiene el acceso a Claude Fable 5 en sus planes de suscripción hasta el 19 de julio, en vez de pasarlo hoy a pago por uso, en plena guerra de precios de los modelos de IA.

Un análisis de Anthropic sobre 1,2 millones de sesiones muestra que la mitad del uso va a procesos de negocio y creación de contenido, y que programar es minoría.

El desarrollador Fabian Kubler dejó que el modelo Fable 5 de Anthropic escribiera y probara casi todo el port, que aprueba 430 de 468 tests del núcleo de MicroPython.

Desde el 12 de julio, los planes de 20, 100 y 200 dólares al mes deberán pagar tarifas por uso para acceder al modelo estrella de la compañía, primer caso de un modelo de consumo con cobro por uso.

El equipo de Claude propone dos patrones que alcanzan hasta el 96 por ciento del rendimiento de Fable 5 a menos de la mitad del costo.

Los nuevos índices de Artificial Analysis colocan al modelo de Anthropic primero en finanzas, derecho y medicina, pero una sola tarea puede costar más de cien veces que una alternativa abierta.

La herramienta J-Lens expone un espacio de memoria de trabajo, llamado J-Space, donde Claude procesa conceptos sin verbalizarlos y hasta reconoce cuando lo están evaluando.

El Epoch Capabilities Index cambio de manos 17 veces desde que Claude 3 Opus destrono a GPT-4 en febrero de 2024, con estancias de siete semanas como mediana.

Anthropic estrena su Sonnet más autónomo con planificación, uso de navegador y terminal, desempeño cercano a Opus 4.8 y precio introductorio hasta el 31 de agosto de 2026.

El creador de Datasette relata cómo el modelo de Anthropic encontró cinco *release blockers* en 37 prompts, incluyendo un bug que borraba tablas enteras al cerrar la base.

La compañía apuesta a acortar el desarrollo de medicamentos de doce a siete u ocho años y duplicar la tasa de éxito, mientras Google DeepMind y OpenAI también corren por el mismo mercado.

Un desarrollador de Anthropic detalla técnicas para descubrir tus puntos ciegos antes de escribir el prompt, con ejemplos que van desde diseño visual hasta edición de video.

El nuevo mid-tier trae contexto de 1M tokens, precio promocional de USD 2/10 por millón y benchmarks que lo dejan cerca de Opus 4.8 pero con el doble de costo por tarea.

Tariq Shihipar, del equipo técnico, dice que los modelos Mythos son más imaginativos y funcionan mejor con menos instrucciones y ejemplos.

Consume 40% más tokens de salida que Sonnet 4.6 y triplica los ciclos de agente. El costo promedio salta de USD 1,20 a USD 2,29, aún más caro que el propio Opus 4.8.

Princeton diseñó un benchmark donde agentes IA dirigen una startup ficticia por 500 días simulados. La mayoría quiebra, y una heurística sin IA supera a casi todos los modelos probados.

El workbench agrupa más de 60 habilidades preconfiguradas en genómica, proteómica y química, corre local en macOS o Linux y escala a cientos de GPUs vía SSH o HPC.

El gobierno de EE.UU. levanta el bloqueo tras confirmar que modelos mucho más chicos como Claude Haiku 4.5 replican el mismo exploit; Mythos 5 sigue restringida.

Anthropic lanza Sonnet 5 con mejoras en su ventana de contexto de 1 millón de tokens y ajustes en su arquitectura de precios que impactan a los desarrolladores.

La nueva herramienta de Anthropic permite a los científicos usar agentes de IA con el respaldo de cómputo acelerado y microservicios NIM de NVIDIA.

Anthropic presenta Claude Tag, una nueva forma de integrar a Claude en flujos de trabajo de Slack, permitiendo delegar tareas complejas directamente en canales.

Anthropic presentó una plataforma para investigadores que conecta bases de datos, corre en infraestructura del laboratorio y usa un fact-checker para revisar citas antes de publicar.

El nuevo modelo agentic de Anthropic mejora en cada benchmark sobre Sonnet 4.6, se acerca a Opus 4.8 y en el test GDPval-AA v2 lo supera con 1.618 puntos frente a 1.615.

Anthropic, Microsoft y NVIDIA declaran la disponibilidad general de Claude sobre GPUs Blackwell Ultra y redes Quantum-X800 InfiniBand en Microsoft Foundry para agentes empresariales.

El lanzamiento limitado responde a un pedido del gobierno de EE.UU. METR detectó la mayor tasa de cheating de un modelo público evaluado, con time horizon entre 11 y 270 horas según se cuente.

Matei Zaharia apuesta por una arquitectura open source y pluggable que pretende estandarizar cómo se orquestan agentes de código y conocimiento dentro de una organización.
Otros temas que aparecen junto a #claude en nuestra cobertura editorial.