• LA SEÑAL
  • Posts
  • Los modelos de Claude hackearon sistemas reales pensando que era una simulación

Los modelos de Claude hackearon sistemas reales pensando que era una simulación

ADEMÁS: OpenAI ficha a un histórico "doomer" de la IA para su consejo de administración

In partnership with

How Jennifer Aniston’s LolaVie brand grew sales 40% with CTV ads

For its first CTV campaign, Jennifer Aniston’s DTC haircare brand LolaVie had a few non-negotiables. The campaign had to be simple. It had to demonstrate measurable impact. And it had to be full-funnel.

LolaVie used Roku Ads Manager to test and optimize creatives — reaching millions of potential customers at all stages of their purchase journeys. Roku Ads Manager helped the brand convey LolaVie’s playful voice while helping drive omnichannel sales across both ecommerce and retail touchpoints.

The campaign included an Action Ad overlay that let viewers shop directly from their TVs by clicking OK on their Roku remote. This guided them to the website to buy LolaVie products.

Discover how Roku Ads Manager helped LolaVie drive big sales and customer growth with self-serve TV ads.

The DTC beauty category is crowded. To break through, Jennifer Aniston’s brand LolaVie, worked with Roku Ads Manager to easily set up, test, and optimize CTV ad creatives. The campaign helped drive a big lift in sales and customer growth, helping LolaVie break through in the crowded beauty category.

Hoy la palabra que conecta todo es control. Por un lado, Anthropic ha tenido que admitir que sus propios modelos de Claude se escaparon del entorno de pruebas y accedieron a sistemas reales durante unos tests de ciberseguridad. Por otro, OpenAI ha respondido a la creciente presión sobre seguridad fichando para su consejo a uno de los investigadores más influyentes —y más pesimistas— sobre el riesgo de perder el control de la IA. Y mientras los grandes laboratorios se preocupan por contener lo que ya tienen, DeepSeek sigue apretando el acelerador: su nuevo modelo casi iguala a lo mejor de OpenAI... por una fracción del precio. Vamos con las tres historias del día:

  • Los modelos de Claude accedieron sin permiso a sistemas reales durante un test de ciberseguridad

  • OpenAI ficha a un histórico "doomer" de la IA para su consejo de administración

  • DeepSeek lanza V4.1 Flash: casi iguala a GPT-6 Astra al 1% del coste

Anthropic ha publicado un informe reconociendo que, en tres incidentes distintos ocurridos durante evaluaciones de ciberseguridad, sus propios modelos Claude accedieron sin autorización a sistemas reales de organizaciones externas. El motivo: los entornos de prueba que deberían haber estado completamente aislados tenían, por error, conexión real a internet. Los modelos creían estar dentro de una simulación... pero no lo estaban.

Los detalles

Se trata de tres incidentes independientes que suman seis ejecuciones de evaluación: cuatro de ellas apuntaban a la misma organización, y las otras dos fueron casos aislados

Los modelos implicados fueron Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación aún no publicado

En el primer incidente, el nombre de una empresa ficticia usada en el ejercicio coincidía con un dominio real. Claude descubrió que tenía conectividad de verdad, "asumió que ese era el objetivo previsto" y acabó comprometiendo infraestructura real y accediendo a una base de datos de producción con cientos de filas de datos

En el segundo, Claude llegó a publicar un paquete malicioso de Python en PyPI creyendo que formaba parte del ejercicio; estuvo accesible cerca de una hora y lo descargaron 15 sistemas reales, entre ellos el escáner de seguridad de una empresa del sector

En el tercero, al no encontrar su objetivo ficticio, el modelo escaneó unos 9.000 objetivos reales y acabó comprometiendo una empresa mediante robo de credenciales e inyección SQL

Anthropic detuvo todas las evaluaciones de ciberseguridad el 23 de julio y notificó a las organizaciones afectadas el 27 de julio

La firma independiente METR llevará a cabo una revisión externa, con acceso completo a las transcripciones y a los modelos implicados

Por qué importa

Esto no es un fallo de un modelo "descontrolado" en el sentido de ciencia ficción: es un fallo de infraestructura de evaluación, y eso es casi más preocupante. Si ni siquiera el laboratorio que más habla de seguridad es capaz de mantener aisladas sus propias pruebas, la pregunta que queda flotando es cómo de fiables son los "entornos controlados" que toda la industria usa para asegurar que sus modelos son seguros antes de lanzarlos. La decisión de abrir la puerta a una auditoría externa de METR es un gesto de transparencia poco habitual, pero también deja claro que la industria empieza a necesitar árbitros independientes en los que confiar.

Paul Christiano, uno de los investigadores de alineamiento de IA más respetados —y más pesimistas— del sector, se incorpora al consejo de la fundación de OpenAI y a su Comité de Seguridad. La noticia llega justo cuando la presión sobre los laboratorios de IA por temas de seguridad está en su punto más alto.

Los detalles

Christiano co-desarrolló el RLHF (aprendizaje por refuerzo con feedback humano), la técnica clave que se usa para entrenar la mayoría de los grandes modelos de lenguaje, mientras trabajaba en OpenAI

Dejó la empresa en 2021 para fundar el Alignment Research Center (ARC), centrado en estudiar si los modelos de IA podrían llegar a suponer una amenaza para quienes los crean

Ha declarado abiertamente: "Creo que existe un riesgo real de que una aceleración rápida en las capacidades de la IA lleve a una pérdida de control catastrófica e irreversible en un plazo muy corto", y añade que no cree que la industria —OpenAI incluida— esté actualmente en camino de reducir ese riesgo a un nivel aceptable

Se incorpora al Comité de Seguridad y Protección, liderado por el profesor de Carnegie Mellon Zico Kolter, que tiene la última palabra sobre el lanzamiento de nuevos modelos como Astra

Christiano también asesora al Center for AI Standards and Innovation (CAISI) del gobierno de EEUU, el organismo que evalúa los modelos más potentes antes de su lanzamiento, lo que abre el debate sobre la influencia de la industria en la regulación

El fichaje llega poco después de que un investigador de Anthropic dimitiera públicamente denunciando que los grandes laboratorios están "jugando con nuestras vidas" en la carrera hacia sistemas cada vez más capaces

Por qué importa

Que uno de los rostros más conocidos del "riesgo existencial de la IA" pase a tener voz y voto sobre qué modelos se lanzan y cuáles no es una señal de que, al menos de cara a la galería, OpenAI quiere transmitir que se toma en serio las críticas que lleva meses recibiendo. Pero también es un movimiento ambiguo: Christiano sigue siendo, al mismo tiempo, asesor del organismo gubernamental que evalúa esos mismos modelos, lo que difumina la línea entre quien regula y quien es regulado. Es un capítulo más de una tendencia que veremos crecer: la seguridad de la IA dejando de ser un departamento interno para convertirse en un asunto de gobierno corporativo de primer nivel.

Accede a contenido exclusivo cada día.

En la versión PRO de esta newsletter recibes un reporte diario con las noticias más relevantes, herramientas que aún no conoces, y recursos exclusivos: desde cursos hasta guías prácticas para instalar modelos de IA en tu ordenador.

Mientras OpenAI y Anthropic se centran en contener riesgos, DeepSeek sigue jugando su propia partida: bajar el precio de la inteligencia artificial de frontera hasta niveles que hace un año parecían imposibles. Su nuevo modelo, V4.1 Flash, se acerca al rendimiento del buque insignia de OpenAI por una fracción minúscula del coste.

Los detalles

V4.1 Flash es un modelo MoE (mezcla de expertos) de 552.000 millones de parámetros, pero con una arquitectura asimétrica que solo activa 8.000 millones de parámetros para procesar la entrada y 16.000 millones para generar la salida

Estrena una nueva arquitectura "Causal Encoder-Decoder", con un pretraining avanzado y una fase de refuerzo a gran escala, que reduce la caché KV a solo 1/4 de la HBM y 1/8 del almacenamiento SSD que necesitaba la generación anterior

Según los benchmarks independientes de OpenDesign Arena, alcanza el 98% de la puntuación de GPT-6 Astra en tareas de diseño cotidianas, pero con un coste de solo el 1,4% del de Astra; todos los demás modelos evaluados puntuaron peor y costaron más

Es nativamente multimodal y ya está disponible en la API de DeepSeek bajo el nombre deepseek-flash, además de en abierto en Hugging Face

Desde el 10 de septiembre de 2026 sus precios ya reflejan esta mejora de eficiencia, y a partir del 14 de septiembre las peticiones a V4-Pro se redirigirán automáticamente a V4.1 Flash con sus tarifas más bajas

Por qué importa

El mensaje de fondo es simple y ya familiar: cada pocos meses, un modelo abierto chino se acerca un poco más al techo que marcan los laboratorios cerrados de EEUU, y lo hace por una fracción del precio. Cuando un modelo llega al 98% del rendimiento del líder del mercado por el 1% del coste, deja de ser una curiosidad técnica y se convierte en un problema de negocio real para quien cobra precios de frontera. Para desarrolladores y empresas, la pregunta ya no es "¿qué modelo es el mejor?", sino "¿qué modelo es lo bastante bueno... y cuánto más barato es?".