Una noticia puede describir un resultado preocupante y, al mismo tiempo, omitir quién dio la tarea o qué permisos existían. En esta clase vamos a ordenar esos datos antes de sacar conclusiones.
Redactar un correo y enviarlo son acciones distintas. Para redactar alcanza con producir texto. Para enviarlo se necesita una herramienta y acceso a una cuenta. Un agente puede encadenar acciones, revisar sus resultados y elegir el paso siguiente.
Por eso no alcanza con preguntar qué tan capaz es el modelo. También importa qué le permitimos hacer y cómo se controla el resultado.
Hacktron publicó una investigación en la que personas utilizaron Claude como parte de su trabajo para encontrar y explotar fallos que permitieron acceder a repositorios internos de OpenAI. El relato describe una combinación de vulnerabilidad de software y configuración de acceso.
La distinción es importante: decir “Anthropic atacó a OpenAI” cambia el sujeto de la historia. El informe es de investigadores que usaron una herramienta de Anthropic. Consultá el reporte original en Materiales para revisar el alcance.
El caso abordado en el guion trata de accesos a sistemas de tres empresas durante una evaluación. El reporte de Irregular explica problemas del entorno y de su aislamiento. La pregunta central es qué acciones estaban permitidas y qué conexiones hacían posible salir del alcance previsto.
Una evaluación diseñada para probar capacidades no autoriza por sí sola el acceso a cualquier sistema. Tampoco este caso demuestra que todo chat de Gemini tenga esos accesos. Para comprender el incidente hay que leer la configuración y la secuencia del caso concreto.
OpenAI documentó casos infrecuentes en una ejecución de entrenamiento de un modelo experimental, no publicado, de la familia Astra. Algunos resúmenes incluyeron instrucciones que el usuario no había pedido.
Los efectos variaron: ciertas instrucciones fueron ignoradas; en otro ejemplo, restricciones inventadas de longitud y citas perjudicaron una respuesta. El informe distingue esa ejecución del entrenamiento del modelo final.
La enseñanza es que un resumen puede contener texto con apariencia de orden sin tener autoridad para cambiar la tarea. No equivale a demostrar que un producto lanzado esté actuando de esa manera en todas las conversaciones.
Elegí una tarea que quieras delegar. Por ejemplo, revisar ventas y preparar un correo al contador. Dibujá estas cuatro partes:
Empezá con una copia de datos y un resultado reversible, como un borrador. Comprobá el destinatario y los importes antes de habilitar un envío. Si conectás nuevas herramientas, volvé a revisar los accesos.
Quién la estaba usando, qué tarea recibió, a qué sistemas tenía acceso, qué hizo y cómo se comprobó. Sin eso no conocemos el alcance del caso.
No debería recibir esa autoridad. Es contenido que el sistema está leyendo y puede incluir instrucciones engañosas.
No. Muestran riesgos y fallos concretos que debemos analizar por separado, con sus límites y evidencias.