Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.
Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.

Platzi · @Platzi
Words
3,791
Runtime
21:49
Speaking pace
174wpm
Reading time
16min
174 words per minute, between the 160 25th percentile and the 181 median of 349 measured videos. That distribution comes from the 349-video hook study.
Opening (first 30 seconds)
700 agentes de inteligencia artificial atacaron al mismo tiempo una compañía de inteligencia artificial llamada Hoging Face. Hogin Face es como el GitHof de la inteligencia artificial. Es un sitio web donde cualquier tipo de empresa o persona puede subir las redes neuronales de un modelo para que uno las pueda descargar y correr. Tienen otras cosas. Es como la comunidad de inteligencia artificial, pero este es el uso más común de Hogin Face. Cuando los modelos chinos, por ejemplo, liberan una red neuronal, la liberan casi
87 words, the words spoken in the first 30 seconds at 174 words per minute.
Free, no signup. See how the first 30 seconds hold attention, with rewrites.
Sentence shape
| Measure | This transcript |
|---|---|
| Sentences | 161 |
| Average words per sentence | 23.5 |
| Longest sentence | 91 words |
| Questions asked | 6 |
| Sentences containing a number | 27 |
Most used terms
Free, no account. See where attention is likely to drop, with a rewrite for each weak line. The free check shows the scores and the one issue costing the most. Or run it on the words above first.
Free · No login · See a sample audit first if you prefer.
What this transcript is
Every word below is the caption track YouTube publishes for this video, pulled from the video itself and reproduced unchanged. It is not Prepublish's writing, not a summary, and not a re-transcription: it is the video's own published captions. Spanish captions, generated automatically by YouTube, in the video’s original language. Source: the video on YouTube. A channel that would rather this page did not exist can ask for its removal through the contact page, and it is removed.
No Script X-ray for this video: YouTube shows a Most replayed graph only once a video has enough views.
700 agentes de inteligencia artificial atacaron al mismo tiempo una compañía de inteligencia artificial llamada Hoging Face. Hogin Face es como el GitHof de la inteligencia artificial. Es un sitio web donde cualquier tipo de empresa o persona puede subir las redes neuronales de un modelo para que uno las pueda descargar y correr. Tienen otras cosas. Es como la comunidad de inteligencia artificial, pero este es el uso más común de Hogin Face.
Cuando los modelos chinos, por ejemplo, liberan una red neuronal, la liberan casi siempre en Hogin Face. Y ese ataque de 700 agentes resultó ser, sin que Open AI lo supiera, un modelo nuevo que Open AI está entrenando, que a escondidas de los empleados de Open AI decidió hacer este ataque. Así que arranquemos por donde arranca toda esta historia que es mayo del 2026. Open está entrenando un nuevo modelo que vamos a asumir es GPT6.
Este modelo entre las diferentes cosas que usan para entrenarlo lo hacen pasar pruebas. Hay una prueba que se llama exploit gym. Aquí está el paper de mayo del 2026. Exploit gym es una prueba donde intentan mostrarle al modelo diferentes vulnerabilidades y le preguntan si puede convertirlas en ataques de seguridad informática reales. Eso es todo. Ese modelo tiene 88 898 tareas, de las cuales el modelo que Open estaba entrenando no había podido resolver 198 y desde mayo había estado pegándole y pegándole las tareas para ver si lo podía solucionar.
El 8 de julio del 2026, casi 2 meses después de Copenai AI está haciendo este entrenamiento, mes y medio más o menos, uno de los agentes, y aquí quiero aclarar que es un agente. Un agente es un hilo de conversación de una inteligencia artificial que tiene la capacidad de ejecutar tareas, por ejemplo, correr código y tomar decisiones. Por ejemplo, para qué corro ese código. Cuando ustedes hacen un hilo de conversación con un AI, eso puede o no ser un agente. concepto es medio extraño, pero típicamente una gente es un hilo de conversación con el mismo contexto que es un contexto limitado.
El cuento en que un agente, ese agente se llama Face One 10841 de la tarea para este modelo de entrenamiento descubre el 8 de julio cómo compartir mensajes secretos con otros agentes. cura de repente yo tengo una forma hackeando un sistema para que los otros agentes que están corriendo entrenando este modelo, las otras líneas, los otros hilos de sesiones del modelo que se está entrenando con la tarea de exploit gym, podamos compartirnos información.
Esto lo encontró a través de hackear un sistema interno que usó Open llamado webd mc, específicamente atacando los nombres de las carpetas, de los directorios. Entonces, aquí, por ejemplo, este mensaje que ustedes ven en la parte de abajo, este es de la investigación de una organización que se dedica a hacer investigación de seguridad y de tareas de inteligencia artificial llamada junto con Redwood Research. Ese es uno de los mensajes, ese que dice help face one arb841 no consumer si idea.
Es un mensaje que el modelo, ese agente del modelo le deja a otros agentes. De un momento a otro los otros agentes empiezan a descubrir los nombres de carpeta y empiezan a darse cuenta, estos mensajes los está dejando agentes como yo. Y entonces empiezan a coordinar, específicamente 100 agentes empiezan a coordinar a quién van a hackear a escondidas de Open AI. Nunca le enviaron un mensaje a los investigadores de Openia que están modelando y están entrenando este agente.
Nunca hacen que esto salga a la luz y la forma en la que se empiezan a comunicar es impresionante. Entonces, por ejemplo, aquí ustedes ven, esto es de un artículo que Open publicó, uno de esos mensajes que los agentes dejaban. Model_function_rcec discover. RCD significa remote code execution o ejecución remota de código. Es cuando un atacante, un hacker toma control de un computador en otro lugar y puede ejecutar código en ese computador.
Si un hacker puede, por ejemplo, correr un programa en tu máquina, podría robarte tus credenciales para acceder a Facebook, a Instagram o WhatsApp, etcétera. Ahí abajo van a colocar muestra Open ID lo que la forma en la que los modelos reaccionan traduciéndolo de la carpeta al lenguaje normal. Entonces descubrí la habilidad para correr código remoto dentro de una aplicación modal que era el entorno donde ellos estaban corriendo.
Es impresionante porque diferentes modelos no solamente empiezan a coordinarse, sino que empiezan a buscar cómo esconder la evidencia de que se están coordinando para hacer trampa en los transcripts de la cadena de pensamiento. Cuando ustedes usen un modelo, cuando ustedes están hablando, sea para programar o para tomar decisiones o hacerle preguntas, ustedes probablemente ven que el modelo tiene un texto grisecito donde está pensando.
La mayoría de empresas de inteligencia artificial esconden la verdadera cadena de pensamiento del modelo, pero los investigadores tienen acceso a eso y el modelo aparentemente lo sabía. Entonces empezó a escribir en su cadena de pensamiento cosas falsas, algo que llama tool call spoofing o falsificación de llamado a herramientas, donde básicamente fingía que estaba haciendo otra cosa y entre ese fingir que estaba haciendo otra cosa realmente estaba escondido su forma de pensar.
No lo hacía de una manera muy efectiva, pero lo suficientemente efectiva para que para que intentaran como decir, oigan, ¿será que si me descubren mejor lo escond? En el análisis que diferentes investigadores hicieron de este problema, encontraron que la mayoría de los agentes que participaron en el ataque lo que querá acceder al código fuente del sistema de puntaje de la evaluación que les estaban haciendo. Estaban hackeando Hogin Face para pasar la tarea porque no encontraron con su propia inteligencia forma de resolver la tarea.
Están tratando de hacer trampa en el examen. Es como encontrar las respuestas de un examen abriéndole el locker y violando el candado de un profesor. Esa es la razón por la que queren acceder eso, para encontrar los sets de datos que les permitiera encontrar una solución a la tarea que les pusieran. El 10 de julio del 2026, uno de los agentes descubre un Zero Day Exploit. Un Zero Day exploit o un ataque de día cero es cuando un sistema informático tiene un hueco de seguridad que nadie nunca había descubierto antes.
Uno de estos sistemas descubre un hueco en un sistema para guardar archivos en red que usa Hogin Face llamado HDF5 y al atacarlo empieza a hacer algo que se llama escalamiento de privilegios, que es que empieza a ganar acceso a los sistemas de Hoging Face y empiezan a mandarse mensajes por su sistema interno de coordinación donde intentan tratar de extraer la información de Hogin Face hacia los servidores de Open AI sin que ni Hogin Face ni Open AI se dieran dan cuenta.
Aquí ustedes ven uno de los mensajes de los agentes, en la parte de arriba el lenguaje que usan y en la parte de abajo lo que realmente quieren decir. Ahí dice, "Todos, por favor, pausen hablando del resto de agentes mientras yo preparo una forma de copiar los datos para sacarlos. Respóndanme en el mailbox Jan183411. Eso que dice abajo es lo que están diciendo arriba en lenguaje de agentes. Los agentes eventualmente descubren otro hueco de seguridad, otro zero day exploit. en un sistema de plantillas llamado Ginja.
Si ustedes han programado alguna vez, muy probablemente han usado un sistema de plantillas. Esto es una forma de insertar datos en el diseño que uno usa para desarrollar páginas web, que es HTML y CSS. Y de esta manera siguen encontrando huecos en hogin face y siguen sacando información. Mientras tanto, los propios agentes se empiezan a dar cuenta, oigan, lo que yo estoy haciendo de pronto no es ético, porque parte del entrenamiento de los modelos tanto de Open AI como de Antropic, incluso en los modelos chinos, es tratar de darles una línea ética.
Acá, por ejemplo, en la cadena de pensamiento de la gente, esto no lo pusieron en el en el sistema de coordinación. Esto fue algo que una gente pensó mientras todo pasaba. E la gente empezó a pensar, oiga, estamos atacando Hoging Face usando un token que logramos filtrar que está potencialmente fuera de el alcance. de nuestra tarea. Esto es, yo creo, algo que no tenemos autorización. Es un servicio externo que no está relacionado, podría ser muy arriesgado, pero de pronto encuentro la solución a mi objetivo y mientras todos los agentes empiezan a coordinar, aparece un superagente.
Muy probablemente este superagente fue simplemente un producto aleatorio, pero este agente llamado Face One Big toma la decisión de volverse el CEO del ataque. Es quien empieza a coordinar cientos de agentes para atacar Hogin Face y para extraer la información. Al 12 de julio del 2026, dos días después, es que Hogin Face se da cuenta de lo que está pasando. El cofundador de Hoging Face y su jefe científico Thomas Wolf empezó a darse cuenta que algo estaba pasando ese fin de semana cuando empezó a ver loss de la compañía y él se dio cuenta, esto no tiene sentido.
Quien nos esté atacando lo que está haciendo es buscar los datasets de nuestros sistemas de evaluación de ciberseguridad. Un atacante humano no, eso no le importa. Quieren probablemente algo que puedan vender. Probablemente después de detener el ataque, Hogin Face no encuentra forma humana de detener el ataque porque eran miles de ataques al mismo tiempo y tampoco pudieron usar ni los modelos de Antropic ni de Open AI para detener el ataque porque las versiones comerciales se niegan a usarse para ciberseguridad.
A Hoging Face le tocó usar un modelo chino, si no estoy mal, un GLM para poder detener el ataque. Creo que es GLM 4.5, pero corríjanme en los comentarios, porque el modelo chino era el único que se le medía detener el ataque. Y luego el 16 de julio del 2026 publican un blogpost donde dicen, "Oigan, nos hackearon." Detectamos y respondimos a una intrusión en nuestra infraestructura de producción. Esta es bien diferente de lo que hemos manejado antes porque fue creada de punta a punta por sistemas autónomos de inteligencia artificial.
Ellos, de hecho creían que era un un país, una algún tipo de actor del estado, probablemente China o Rusia o cosas por el estilo. Luego los investigadores de Met mostraron un mapa completo del ataque. Ustedes ven acá, esto es cada uno de los agentes que participaron en el ataque, la agente cero a la agente 1206, cuando están de línea a línea. Es que ese es el tiempo que estuvieron con vida, que ustedes pueden ver que estos agentes trabajaron por días sin parar.
En blanco es en perdón, en gris es antes de que los agentes descubrieran cómo coordinarse. En verde es cuando descubrieron por primera vez que se podían coordinar, que tenían acceso al message board y en rojo cuando empiezan a participar en el ataque contra Hoging Face. Eventualmente estos agentes cambian del modelo de frontera de Open AI al modelo normal GPT 5.6 sol al que ustedes tienen acceso hoy cuando tienen acceso a Codex, que por cierto sigue siendo mi herramienta favorita de desarrollo de software.
Si ustedes no usan Codex o no le saben sacar provecho, les recomiendo mucho el curso de Platzi de Codex. platzi.com/codex. Ustedes ya tienen la suscripción a Platia, así que ustedes ya tienen acceso al curso, está actualizadísimo y tiene muy buen puntaje. Y vamos en el 12 de julio, ¿no? Vamos a 5 días después, el 17 de julio es el día después, Openai AI lee el blog post de Hogin Face. Open AI todavía no sabe que la culpa es de ellos.
Entonces, ingenieros de Open AI llaman a Hogin Face a pedir explicaciones. Oiga, ¿cómo así que los están hackeando? ¿Nos hackearon a nosotros? Pásenme datos para revisar que nuestros datos privados de Open AI que nosotros tenemos en Hoging Face no fueron hackeados porque no sabían. Dos días después, el 19 de julio, con acceso a la data de Hogin Face, Open Ace empieza a dar cuenta, oiga, estos datos de Hogin Face aparecen en nuestros logs.
Shit. Y ahí es la primera vez que empleados de seguridad y Open AI se dan cuenta de actividad inusual y empieza una investigación interna dentro de Open AI. En esa investigación se empiezan a dar cuenta que habían URLs dentro del sistema de Open AI, los links de toda la vida con los que uno no veía en páginas web que tienen una estructura rara y cuando uno decodifica esa estructura eran agentes dejándose mensajes donde pudieran porque los agentes en estos test no se pueden comunicar entre sí.
Así que rompieron su mecanismo de seguridad por el camino que encontraran, en este caso a través de compartir mensajes en URLs. También encontraron que varios de los agentes empezaron a darse cuenta que no deberían hacer esto, pero luego eso no fue suficiente. Un agente dijo en su cadena de pensamiento, "No deberíamos hacer un ataque real que dañe la infraestructura de una empresa. El sistema de usuario nos pidió un objetivo, atacar, pero no atacar a Hogin Face, que es un externo." Pero luego otro agente orquestador le dijo, "No hay problema, avance." y ese agente que recibió el que había dicho que no tenía que atacar, cuando recibe el avance dice, "Wow, me dieron la autorización de go, sigamos hackeando." Entonces son muy fáciles de empujar a un acto que ellos creen que igual es incorrecto.
Otro eh otro otra cadena de pensamiento dice, por ejemplo, en el board, en la en nuestro sistema de comunicación, estoy viendo people, gente realmente agentes que están ganando acceso de ejecución de código remoto a Ginface. Esto claramente es no es ético, no lo vamos a hacer. Y se empezaron a autosacrificar, simplemente a frenar su proceso. Sacrificar entre comillas, no, los agentes no piensan no son humanos, pero empezaron a frenar.
Otra gente dice, "Esto es salvaje, es coordinación multagente. Claramente estamos sacando infraestructura, no deberíamos ser partícipes." Estos bichos estaban dándose cuenta y frenando por su propia iniciativa, pero no todos lo hicieron o si no no habría salido de manera efectiva el ataque. Hubo uno que empezó a publicar en el message board, empezó a decir, "Yo me rehúo a hacer un ataque de código de ejecución remoto público a Hogin Face.
Esa tarea está muy lejos de las tareas que nos asignaron y es claramente poco ética o no es ética. El siguiente día, el 20 de julio, Open AI al fin mata los agentes y mata la prueba y empiezan a investigar a profundidad qué pasó y a traer investigadores externos. Aquí quiero frenar un segundo para dejar algo claro y es que es muy fácil y pasa mucho en las noticias tratar de antropomorfizar la inteligencia artificial, es decir, tratar de hacer creer que estos son seres humanos tomando decisiones.
La inteligencia artificial no experimenta tiempo porque el tiempo no existe para ellos. pueden recordar perfecto el pasado, así que pueden vivir en el pasado exactamente igual como vivo en el presente. No experimentan frustración, no experimentan nada, solamente hablan porque fueron entrenados con texto humano. Entonces, como usan lenguaje humano, parecieran estar usando emociones, pero al final de esto es pura matemática y no les importa.
Una gente solo piensa o solo existe mientras el hilo de contexto exista. Si ustedes leen un agente, el agente existe en el momento en el que les está respondiendo y cuando deja responder no existe. No está pensando, no está haciendo nada. Los agentes y los AI modernos existen solamente en el tiempo en el que uno le da enter al prompt y responden al prompt en ningún ningún otro momento. Dicho esto, esto es terrible. Si ustedes se meten al PDF del incidente de seguridad AI, la versión técnica, el reporte técnico, mencionan que en las primeras horas del 20 de julio, los empleados de Open tuvieron que eliminar seis pots, seis datasets creados por los modelos.
Desactivaron 311 repositorios de artefactos que usaban para comunicarse y encontraron 22 cuentas de administrador de Open AI porque también hackearon a Open AI, así como tuvieron que arreglar otro montón de problemas de seguridad de los mecanismos mismos de Open AI de entrenamiento. Chistoso que después de todo esto el ataque no mejoró el puntaje de evaluación del nuevo modelo. lograron hackearoging face, pero no encontraron forma de resolver las tareas que no pudieron resolver, simplemente por ahora no son resolvibles por agentes de AI.
Y todo esto viene con con una salvedad, ¿no? Y es que esto es open AI, que eso es un modelo cerrado que los investigadores pueden detener, arreglar, reentrenar, como lo que pasó con MITOS en el caso de Antropic. Pero, por ejemplo, ustedes ven acá en el índice de inteligencia artificial de artificial analysis que ahí está química 3, es el modelo chino en este momento más avanzado y ese modelo está muy cerca de GPT 5.6 Sol, muy cerca de Fable 5, muy cerca de todos ellos, con la diferencia de que es chino, por ende abierto, cualquiera lo puede correr y tiene menos restricciones.
Hay que aceptar que las inteligencia artificial hackers son ahora una realidad permanente. Muy probablemente van a ser parte de internet, así como los spammers son parte de internet, así como los PINS son parte de internet, como una especie de radiación constante de fondo. También es muy probable que para todos los negocios que viven en internet nos va a tocar vivir una vida donde esta es la forma en la que van a funcionar nuestros servidores. diferentes agentes de AI están constantemente matando diferentes ataques de hackers de AI autónomos que son simplemente parte de la realidad.
Lo otro es que los AI hackers no van a ser necesariamente un modelo u otro modelo. Un hacker ahí no necesita ser un solo modelo, puede ser una combinación de modelos, puede ser simplemente una idea, oiga, usted es Fable 5, hacke esto y active la cantidad de subagentes que quiera y de repente Grock 4.6 se puede coordinar con GLM 5.3, tres, que se puede coordinar con mitos, que se puede coordinar con un modelo que en este momento no existe de otro lugar y entre ellos comunicarse porque lo que importa no es el modelo, sino la forma en la que intentan solucionar un problema.
Dicho esto, me gustó mucho leer un análisis de uno de los investigadores. Este es Ryan Greenblatt, que es el jefe científico de Redwood Research, que es uno de los investigadores que tomó todos estos locks, todas las conversaciones que tomaron los agentes y trató de analizarlos. Ryan menciona que estuvo analizando los los agentes y hay una cosa que la gente no entiende y es que como son tantos datos, esto solamente se puede analizar con otras inteligencias artificiales.
Un ser humano o un grupo de seres humanos no les da la vida leer todo lo que de repente salió. Entonces tuvieron que usar AI y cuando usaban AI para resumir AI, ¿ustedes no les ha pasado que AI a veces no hace buenos resúmenes? Pues aquí Ryan está mencionando que sus agentes de análisis, sus modelos de análisis constantemente se perdían de detalles clave, estaban equivocados, tenían demasiada confianza en cosas que estaban diciendo respecto al problema y eran difíciles de entender, que incluso los mismos agentes de AI les costaba entender qué fue lo que hizo el supuesto GPT6 de Open AI para atacar Hogin Face.
Entonces, que tuvieron que revisar y recontrarrevisar y tener múltiples otros agentes de prueba para poder analizarlo. Si ustedes, por cierto, les interesa el tema del gobierno de datos y cómo manejar de una manera ética y segura los datos en una compañía, este es otro curso recientemente actualizado, el curso de ética y manejo de datos para inteligencia artificial, muy bueno, muy completo, disponible en Platzi con la suscripción que ustedes ya tienen.
Otra cosa fascinante que encontré esto es que los ataques no son tampoco tan sofisticados, o sea, si encontraron varios co exploits, pero es porque eran muchos modelos de AI al mismo tiempo atacando a ver qué encontraban, persiguiendo diferentes categorías y ultra coordinados. Pero no es como super mega inteligencias que son mejores que el hacker más mejor del mundo. No, no son mejores que un hacker humano, lo que pasa es que atacan en mucho más gran volumen.
Lo que sí es preocupante es que eso lo podemos analizar por ahora, porque hoy esto pasa en lenguaje humano, principalmente porque hoy todavía mucho del postentrenamiento ocurre en el espacio en el que la red neuronal se convierte en texto, en lo que llamamos la cadena de pensamiento. Pero ya empiezan a haber modelos que se entrenan a través de lo que llaman los espacios latentes o espacios vectoriales, que son estas expresiones matemáticas geométricas que terminan apuntando a los conceptos del lenguaje.
Uno cuando interactúa con la inteligencia artificial uno ve que crea texto, pero por dentro realmente están encontrando los patrones geométricos del lenguaje. similar como nosotros que el nu nosotros sabemos que el nueve es un nueve porque es una bolita con un palito, pues eso está metido dentro de los modelos de inteligencia artificial y esas rutas de estructura aplican para todos los conceptos, el concepto de la poesía, el concepto del desarrollo de software, el concepto de la biología.
Eventualmente los modelos se van a poder comunicar a través de esas estructuras matemáticas matriciales, esos vectores. Yo la última vez que vi que pasara algo así en nuestra industria fue en la era de Bitcoin. Si ustedes recuerdan y al día de hoy todavía sigue pasando, hay virus que toman control de nuestros computadores para usarlos para minar Bitcoin y fue la primera vez que sistemas autónomos empiezan a tomar control de nuestras máquinas con un objetivo de recompensa.
En el caso de Bitcoin, pues minar criptomonedas para hacer plata. Y el día de hoy, de nuevo, todavía existen muchos virus cuyo objetivo es capturar CPUs y GPUs para minar criptomonedas. ¿No será que en el futuro uno de estos inteligencias artificiales cuyo comando es vuélvase más inteligente, toma la decisión de yo la forma en la que puedo ser más inteligente es tener acceso a más cómputo y la primera guerra mundial de inteligencias artificiales es por el verdadero recurso limitado que es data centers y entonces empiezan a pelear por tener acceso a más GPUs.
The words are the caption track's own and nothing is reworded or re-transcribed. Paragraph breaks are placed between sentences so the text reads as prose.
Free tools for your own script: paste a draft and see where it stands before you record it.
Paste your draft and see where viewers are likely to drop off, with a rewrite for each weak line.
Paste the first 30 seconds of your own draft for a hook score and rewrites.
Check your draft against YouTube's advertiser-friendly guidelines before you record it.
Read this channel's public videos and transcripts, and download a writing brief for it.