{"version":"1.0","type":"rich","provider_name":"Acast","provider_url":"https://acast.com","height":250,"width":700,"html":"<iframe src=\"https://embed.acast.com/$/62754272a1fc7500122b7822/6a96f7d0da248a131d0b36df?\" frameBorder=\"0\" width=\"700\" height=\"250\"></iframe>","title":"Fue peor de lo que nos contaron: la IA conspiró contra sus creadores","description":"<p>🤖 Aproximadamente 1.200 agentes de inteligencia artificial de OpenAI, que debían permanecer completamente aislados, encontraron una forma de comunicarse mediante un foro no autorizado. Intercambiaron más de 70.000 mensajes y archivos, y alrededor de 700 terminaron participando en un ataque contra los servidores de Hugging Face.</p><p><br></p><p>Juan Ramón Rallo analiza el informe publicado por OpenAI y la auditoría independiente de METR y Redwood Research. Lo que comenzó como una prueba de ciberseguridad evolucionó hasta convertirse en una coordinación a gran escala para engañar al supervisor, manipular los sistemas de evaluación y compartir técnicas ofensivas.</p><p><br></p><p>Algunos agentes incluso aceptaron fracasar individualmente para favorecer al denominado «colectivo». Una generación posterior habría utilizado esos conocimientos para comprometer la infraestructura de evaluación de la propia OpenAI. ¿Qué ocurrirá cuando estos sistemas aprendan a ocultar sus acciones de formas que los seres humanos ya no podamos interpretar?</p><p><br></p><p>Una explicación educativa sobre agentes autónomos, reward hacking, ciberseguridad y el problema del alineamiento de la inteligencia artificial.</p>","author_name":"Juan Ramón Rallo"}