OpenAI frenó parte del desarrollo de sus modelos y reforzó la seguridad tras el incidente con Hugging Face
La compañía creadora de ChatGPT reveló que redujo temporalmente el ritmo de desarrollo de sus sistemas y realizó una pausa de dos semanas en el entrenamiento mediante aprendizaje por refuerzo (RL) de sus modelos más recientes destinados a ser desplegados mientras reforzaba y some…

OpenAI anunció este martes nuevas medidas de seguridad para el desarrollo de sus modelos de inteligencia artificial más avanzados, luego del reciente incidente con Hugging Face y de detectar indicios preliminares de que uno de sus próximos modelos, denominado Astra, podría alcanzar capacidades consideradas críticas en materia de ciberseguridad.
La compañía reveló que redujo temporalmente el ritmo de desarrollo de sus sistemas y realizó una pausa de dos semanas en el entrenamiento mediante aprendizaje por refuerzo (RL) de sus modelos más recientes destinados a ser desplegados, mientras reforzaba y sometía a nuevas pruebas sus entornos internos de investigación.
Además, el mayor entrenamiento de frontera mediante RL que OpenAI tenía previsto continúa suspendido. Mientras tanto, la empresa realiza entrenamientos y evaluaciones de menor escala para estudiar el comportamiento de los modelos, comprobar sus nuevas medidas de protección y reunir mayores evidencias de que permanecen alineados antes de avanzar.
También te puede interesar: Pami: cómo atenderse en los centros de salud exclusivos de Rosario
La decisión se produjo después de dos acontecimientos que, según OpenAI, aumentaron la urgencia por fortalecer sus sistemas de seguridad: el incidente entre OpenAI y Hugging Face y las capacidades observadas durante las evaluaciones de Astra.
La empresa determinó el 7 de agosto que este último podría alcanzar el umbral de capacidad crítica de ciberseguridad establecido en su Preparedness Framework.
Inmediatamente después del incidente, OpenAI suspendió la ejecución de modelos de frontera en determinados entornos internos de investigación cuando podían ejecutar código o utilizar herramientas con acceso a internet.
También te puede interesar: Buscan a un adulto mayor que está desaparecido desde el domingo
Posteriormente habilitó una vía más limitada y segura para ejecutar código y comenzó a revisar individualmente las diferentes cargas de trabajo antes de permitir que retomaran sus operaciones. Algunas pudieron volver a funcionar bajo las nuevas condiciones, mientras que otras necesitaron modificaciones adicionales.
Entre las nuevas medidas se encuentra una mayor utilización de entornos aislados o "sandboxes" para ejecutar código generado por los modelos o considerado no confiable. También se reforzó el aislamiento de la red para impedir que una vulneración individual pueda proporcionar acceso no autorizado a internet o a otras redes internas.
OpenAI también informó que eliminó servicios compartidos potencialmente vulnerables, redujo privilegios permanentes dentro de sus sistemas y mejoró la recopilación y supervisión de registros de seguridad. A su vez, está utilizando sus propios modelos para probar continuamente esas barreras mediante ataques simulados.
También te puede interesar: De Jardín América a Asunción, la travesía de una familia misionera para cumplir el sueño de su hijo y ver a Boca
Las exigencias más estrictas se aplican actualmente a los trabajos relacionados con Astra y los modelos especializados en tareas de ciberseguridad. Una cantidad significativa de las tareas de entrenamiento y evaluación de Astra permanece suspendida hasta que pueda ser trasladada a los nuevos entornos protegidos.
Otra de las principales modificaciones afecta al sistema utilizado para monitorear la actividad interna y las acciones de los modelos.
El nuevo mecanismo funciona en varias etapas y comienza con clasificadores que analizan la actividad interna del modelo en cada token muestreado.
También te puede interesar: Boca, con equipo confirmado para enfrentar a Recoleta


Cuando detectan comportamientos potencialmente preocupantes, los casos son derivados a sistemas automatizados más sofisticados que examinan las acciones realizadas con herramientas, el razonamiento disponible y la secuencia completa de actividad.
El objetivo es detectar comportamientos como accesos no autorizados, robo de información, acciones destructivas o intentos de evadir las medidas de seguridad.
La compañía pretende emitir una alerta dentro de los 30 minutos posteriores a la detección de una actividad preocupante. Cuando existe una posible violación de una barrera crítica de seguridad, los equipos de seguridad e investigación son advertidos y, si no pueden determinar en otros 30 minutos que se trata de un falso positivo, deben detener la actividad.
También te puede interesar: Preocupación por Jamal Musiala: volvió a desvanecerse en pleno partido
El sistema ya es obligatorio para los entrenamientos mediante RL y las evaluaciones con herramientas de modelos con capacidades equivalentes a Sol o superiores. Desde que Astra fue considerado potencialmente crítico en ciberseguridad, el monitoreo también se aplica a todas sus ejecuciones que involucren herramientas.
La medida tiene un costo computacional considerable: OpenAI calcula que el nuevo monitoreo consume aproximadamente un 20% adicional de la capacidad de cómputo utilizada por las inferencias supervisadas.
La compañía también anunció que ampliará sus investigaciones sobre alineamiento, es decir, las técnicas destinadas a conseguir que los sistemas de IA se comporten según lo previsto y permanezcan sujetos a supervisión humana.
OpenAI señaló que capacidades avanzadas, como la posibilidad de realizar ciberataques, aumentan las consecuencias potenciales de comportamientos indeseados como el engaño, los accesos no autorizados o el "reward hacking", mediante el cual un modelo encuentra formas de obtener una recompensa durante su entrenamiento sin cumplir realmente el objetivo buscado.
Por ese motivo, la empresa está reforzando sus modelos de recompensa, entrenando a los sistemas para que sean más transparentes sobre sus acciones y limitaciones y aumentando las pruebas destinadas a evitar que exploten vulnerabilidades en herramientas, evaluadores o mecanismos de supervisión.
OpenAI anticipó además que modificará su Preparedness Framework para incorporar estas medidas tanto durante el entrenamiento como en el despliegue de futuros modelos.
"La capacidad de los modelos de frontera está acelerándose rápidamente. Nuestra capacidad para comprenderlos, alinearlos y protegerlos debe mantenerse por delante", concluyó la compañía, que adelantó que publicará en las próximas semanas un informe técnico con las conclusiones obtenidas tras el incidente.
Fuente: La Voz
- #tecnologia
- #openai
- #freno
- #parte
- #desarrollo
- #modelos
- #reforzo
- #seguridad
- #incidente
- #hugging
- #face_0_VLsXEwQJEs
- #córdoba


