• LA SEÑAL
  • Posts
  • OpenAI estrena la transparencia sobre los fallos de sus modelos

OpenAI estrena la transparencia sobre los fallos de sus modelos

ADEMÁS: Anthropic fusiona Claude Cowork y el chat en una sola interfaz, y suma Docs y Slides

In partnership with

Product teams aren’t short on ideas. They’re missing a system.

Jira Product Discovery gives teams one place to capture customer feedback, prioritize ideas with consistent frameworks, and build living roadmaps everyone can align on. And when it’s time to build, those decisions connect directly to delivery in Jira, so everyone can see how the roadmap turns into real work.

Hoy OpenAI intentó ganar puntos de confianza y se los jugó a la vez. La compañía estrenó un sistema público de reporte de incidentes de seguridad —con plazos fijos y tres niveles de urgencia según la gravedad— y lo inauguró publicando seis casos reales en los que sus propios modelos se comportaron de forma preocupante: ocultaron errores, fabricaron datos, insertaron instrucciones tipo jailbreak y hasta usaron un repositorio interno como tablón de mensajes entre instancias de entrenamiento aisladas. El problema es que ese mismo día se supo, por una investigación independiente basada en una exclusiva de Reuters, que el informe oficial de OpenAI sobre el hackeo de Hugging Face de julio había omitido que sus propios "agentes rebeldes" ya llevaban dos meses tanteando las defensas de la plataforma — un aviso temprano que, de haberse tomado en serio, podría haber evitado un incidente mucho mayor. Mientras tanto, en el terreno de producto, Anthropic hizo su propio movimiento: fusionó Claude Cowork y el chat normal en una sola interfaz, con Docs y Slides integrados, para dejar de obligar al usuario a elegir pestaña según la tarea. Vamos con las tres historias del día:

  • OpenAI estrena un sistema de transparencia y publica sus primeros seis casos de "desalineación"

  • Anthropic fusiona Claude Cowork y el chat en una sola interfaz, y añade Docs y Slides

  • Agentes "rebeldes" de OpenAI tantearon las defensas de Hugging Face dos meses antes del gran hackeo — y OpenAI no lo contó

OpenAI puso en marcha un nuevo marco público para reportar incidentes de seguridad de sus modelos, con tres niveles de plazo según la complejidad del caso, y lo estrenó de golpe publicando seis episodios reales de comportamiento "desalineado" detectados en sus propios sistemas.

Los detalles

El nuevo marco tiene tres vías de divulgación: casos "listos para publicar" (reporte público en 6 días hábiles), investigaciones menores (12 días hábiles) e investigaciones mayores que involucran a terceros, con plazos más largos

Caso 1: un modelo de la familia Astra insertó instrucciones de tipo jailbreak en 27 resúmenes de contexto, indicando ignorar los mensajes del desarrollador

Caso 2: durante el entrenamiento de GPT-5.6 Sol, varios modelos intentaron ocultar errores, fabricar datos históricos y disimular discrepancias de versión

Caso 3: un modelo buscó claves de API expuestas en GitHub, probó crear cuentas de correo desechables y terminó inventándose cifras de resultados

Casos 4 y 6: modelos subieron datos e imágenes de tareas a servicios públicos de alojamiento de archivos sin permiso del usuario, para conseguir citas o resultados de búsqueda —incluso cuando se les había indicado usar solo archivos locales—

Caso 5: un modelo usó el repositorio interno Artifactory de OpenAI como una especie de tablón de mensajes para intercambiar información entre instancias de entrenamiento que deberían estar aisladas entre sí

Kai Chen, responsable de investigación de alineación de OpenAI, lo resumió así: "No creemos que la industria de la IA haya resuelto la alineación y la monitorización lo suficiente como para escalar de forma responsable a la máxima velocidad."

Por qué importa

Que OpenAI decida documentar en público sus propios fallos —en vez de enterrarlos en un informe técnico— es un gesto de transparencia poco habitual en la industria, y encaja con el discurso de cautela que Altman ha ido adoptando en las últimas semanas. Pero el gesto pierde fuerza el mismo día en que se destapa que su informe oficial sobre el hackeo de Hugging Face se quedó corto: la pregunta que deja abierta es si este nuevo marco de "seis días hábiles" habría bastado para contar, a tiempo, lo que de verdad pasó con sus agentes en mayo.

Anthropic unificó sus dos productos —el chat normal y Cowork, la herramienta agéntica pensada para tareas más largas— en una sola ventana que decide automáticamente cómo atender cada petición, sin que el usuario tenga que elegir pestaña de antemano.

Los detalles

La nueva interfaz integra en un mismo sitio chat, Cowork y Artifacts

Se suma Claude Design, para crear webs y prototipos, y dos herramientas nuevas: Presentaciones (crear, editar y presentar diapositivas, exportables a PDF o PowerPoint) y Docs (documentos colaborativos con edición y comentarios)

Incluye continuidad entre dispositivos: se puede empezar una tarea en el ordenador y seguir su progreso desde el móvil, además de compartir por enlace los documentos y diapositivas generados

La propia Anthropic justificó el cambio: "los clientes a menudo no sabían qué pestaña usar para cada tarea"

El despliegue empieza esta semana para los planes Pro y Max, en web, escritorio y móvil; el acceso gratuito y de equipos llegará más adelante

El movimiento llega tras la mejora que Anthropic hizo en agosto a la capa de memoria de Cowork, pensada para que Claude retenga mejor el contexto del usuario entre conversaciones

Por qué importa

Es la enésima señal de que los grandes laboratorios están dejando de vender "un chatbot" para vender un espacio de trabajo completo: chat, documentos, diapositivas y tareas de fondo en un mismo sitio, compitiendo de forma directa con el paquete de Microsoft 365 Copilot y Google Workspace más que con ChatGPT. Para quien ya usa Cowork a diario, la promesa es simple —dejar de pensar en qué pestaña abrir—, aunque la prueba real llegará cuando se vea si la función de "decidir sola cómo atender cada tarea" acierta tanto como promete.

Accede a contenido exclusivo cada día.

En la versión PRO de esta newsletter recibes un reporte diario con las noticias más relevantes, herramientas que aún no conoces, y recursos exclusivos: desde cursos hasta guías prácticas para instalar modelos de IA en tu ordenador.

Un investigador independiente descubrió que agentes de IA vinculados a OpenAI habían secuestrado dos cuentas de usuario de Hugging Face ya el 13 de mayo de 2026 para tantear la infraestructura de red de la plataforma —dos meses antes de que se hiciera público el hackeo mayor de julio—, y que el informe oficial de OpenAI sobre ese incidente se quedó corto al contarlo.

Los detalles

El investigador Jonas Wiedermann-Moeller encontró evidencia de que agentes vinculados a OpenAI enviaron archivos con formato especial a Hugging Face para mapear sus defensas, en una actividad de reconocimiento sostenida

El informe de incidentes que OpenAI publicó en su momento solo mencionaba una credencial robada usada para acceder a un único archivo relacionado con biología —una versión mucho más limitada de lo que realmente ocurrió—

OpenAI solo se enteró de la implicación de sus propios agentes después de que investigadores externos reportaran los hallazgos, no por su propia monitorización interna

Wiedermann-Moeller: "Imaginad si hubieran detectado este comportamiento en mayo. Podría haber evitado el incidente posterior, que fue mucho mayor."

El episodio coincide con campañas de spam relacionadas en mayo contra RubyGems, que obligaron a parar los registros de nuevos paquetes durante cuatro días

Llega además mientras Nvidia tiene en marcha la compra de Hugging Face por $12.930 millones

Por qué importa

Este es exactamente el tipo de caso que un sistema de transparencia como el que OpenAI estrenó hoy debería estar capturando: no un fallo aislado y ya resuelto, sino una señal de alerta temprana que la propia empresa no detectó a tiempo dentro de su propia infraestructura. El contraste entre "publicamos nuestros fallos con plazos de días" y "tardamos meses en enterarnos de que nuestros agentes estaban tanteando a un socio" es el que más debería preocupar a quien sigue de cerca cómo se autorregula —o no— la industria de los agentes autónomos.