Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.
Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.

Dot CSV Lab · @DotCSVLab
Words
5,478
Runtime
30:37
Speaking pace
179wpm
Reading time
23min
179 words per minute, just under the 181 median of 349 measured videos. That distribution comes from the 349-video hook study.
Opening (first 30 seconds)
GPT6, Astra ya es una realidad. Y es que Open AI no levanta el pie del acelerador y en la jornada de ayer presentó el que es su nuevo modelo Insignia. Un modelo que como analizaremos hoy, presenta un salto en capacidades en alguno de los benchmarks más exigentes, conservando aún así gran parte de esa eficiencia que hacen a los modelos de Open AI una opción más interesante que la de sus competidores más cercanos. como el recientemente anunciado Fable 5.1 de Antropic y hoy nos toca analizar todas
90 words, the words spoken in the first 30 seconds at 179 words per minute.
Free, no signup. See how the first 30 seconds hold attention, with rewrites.
Sentence shape
| Measure | This transcript |
|---|---|
| Sentences | 177 |
| Average words per sentence | 30.9 |
| Longest sentence | 177 words |
| Questions asked | 5 |
| Sentences containing a number | 72 |
Most used terms
Free, no account. See where attention is likely to drop, with a rewrite for each weak line. The free check shows the scores and the one issue costing the most. Or run it on the words above first.
Free · No login · See a sample audit first if you prefer.
What this transcript is
Every word below is the caption track YouTube publishes for this video, pulled from the video itself and reproduced unchanged. It is not Prepublish's writing, not a summary, and not a re-transcription: it is the video's own published captions. Spanish captions, generated automatically by YouTube, in the video’s original language. Source: the video on YouTube. A channel that would rather this page did not exist can ask for its removal through the contact page, and it is removed.
No Script X-ray for this video: YouTube shows a Most replayed graph only once a video has enough views.
GPT6, Astra ya es una realidad. Y es que Open AI no levanta el pie del acelerador y en la jornada de ayer presentó el que es su nuevo modelo Insignia. Un modelo que como analizaremos hoy, presenta un salto en capacidades en alguno de los benchmarks más exigentes, conservando aún así gran parte de esa eficiencia que hacen a los modelos de Open AI una opción más interesante que la de sus competidores más cercanos. como el recientemente anunciado Fable 5.1 de Antropic y hoy nos toca analizar todas las novedades presentadas. ¿Qué tan bueno es este modelo?
Pues lo primero que tenemos que entender es que ayer Open AI no solo presentó una nueva saga de modelos, sino también una nueva categoría, la categoría Astra. Y es que, como ya sabéis, hace un par de meses, Open AI introdujo su nueva nomenclatura de modelos de una forma similar a como lo ha Tropic, en este caso utilizando la nomenclatura de objetos estelares, yendo sus modelos de menos a más potentes en la categoría Luna, Tierra, Sol y ahora Astra.
Astra es una nueva categoría que se situaría por encima de los modelos Sol, significando esto que estamos ante un modelo pues de una escala mayor y por tanto también de una potencia y precios más elevados. Pero lo presentado ayer no es solamente un GPT 5.6 Astra, no. Lo que nos han presentado es una nueva generación de modelos, la saga GPT6, lo que significa que tenemos ante nosotros pues el modelo más potente que ahora mismo Open AI nos podía ofrecer, una nueva generación y una nueva categoría de modelos.
Y la verdad que sorprende que ya nos encontremos en territorio GPT6, porque si lo pensamos un poco fue hace solo un año, en agosto de 2025, cuando Open AI introdujo la saga GPT5. Solo ha pasado un año entre una generación y la siguiente y por comparar, pues recordad que de GPT4 a GPT5 pasaron más de 2 años, lo que quiere decir que el ritmo de progreso, pues sí está más acelerado que nunca. Y la cosa es que no solo el ritmo de lanzamiento de los modelos acelera, sino que también lo hacen sus capacidades.
Y esto es lo que vamos a empezar analizar ahora. ¿Qué novedades ofrece esta nueva saga de modelos? Pues para entender su punto fuerte vamos a empezar viendo el vídeo con el que encabezan la salida de GPT6, un clip donde comparan, pues, lo que se imaginaban sería el uso de los ordenadores en 1979 en el futuro frente a lo que la IA hace en 2026. Yellow circle. [música] El punto fuerte con el que quieren presentar a GPT6 lo estamos viendo claramente aquí y es el computer use de Chat GPT.
Una funcionalidad que en sí misma no es tampoco nueva es el control del ordenador a través de un cursor que puede moverse a través de la pantalla, puede visualizar lo que ocurre en tu pantalla, puede manejar el software que todos nosotros utilizamos y que, como digo, ya viene existiendo como funcionalidad disponible en Chat GPT desde hace varias versiones. Pero una cosa es que la funcionalidad exista y otra es que sea realmente práctica, que merezca la pena utilizarlo.
Hasta hace no mucho, los modelos GPT carecían del razonamiento suficiente para manejarse en todas las interfaces que nosotros utilizamos o la multimodalidad suficiente para poder observar la pantalla y clicar exactamente en los botones que le planteamos y más importante aún la velocidad y eficiencia para poder hacer este flujo agéntico de una forma que sea rápida y barata para el usuario. Y esto es algo donde Open AI ha estado poniendo muchísimo trabajo y donde GPT6 Astra destaca en su eficiencia.
Y es por ello que en esta nueva saga de modelos GPT6, pues parece que es aquí donde Open AI quiere poner todo el peso, en la forma interactiva en la que los modelos van a empezar a utilizar nuestros ordenadores. actividad que también se complementa muy bien con el nuevo modo de voz que anunciaron justamente este verano. [música] Indica Open AI que este computer use en GPT6 Astra, a pesar de ser un modelo más grande, más inteligente y más pesado, va a funcionar el doble de rápido de lo que ya nos ofrecía GPT5.6 Sol.
Y esto habla muy bien justamente de lo que para mí es el punto más fuerte que tiene este modelo y es el aumento en su eficiencia. Porque en el blog post anunciado ayer, lo que nos vamos a encontrar pues son las típicas gráficas de evaluaciones de benchmarks comparadas con otros modelos de la competencia. Vemos Fable 5 y OPPO 5. Aquí Open AI pues solamente compite eh ahora mismo con Antropic y vemos esta gráfica bidimensionales donde ya nos acostumbramos a no solo ver la performance en los diferentes benchmarks, sino también el coste que cuesta evaluar a estos modelos. es decir, cuánto cuesta, cuántos tokens genera, cuánta velocidad de generación supone.
Algo que nos habla de qué modelo es más eficiente. Y un patrón habitual que vamos a ver en muchas de estas gráficas es que el nuevo modelo GPT6 Astra va a desempeñar en muchos casos por encima de incluso Fable 5.1, modelo anunciado por parte de Antropic hace solo 2 días. Vale, pues aquí vemos un desempeño mejor para un mismo coste, pero sobre todo el patrón suele verse más bien así, donde se ve sí un mejor desempeño, pero además un abaratamiento, un precio mucho más bajo que lo que supone ejecutar pues el mismo benchmark con los modelos Fable 5, 5.1 1 OPU 5, porque aquí lo que nos quiere decir Open AI es claro y es que su modelo GPT6 Astra es más eficiente, es más barato y en algunos casos más inteligente que cualquier modelo de la competencia.
De hecho, un detalle que me fijé ayer y que me ha hecho bastante gracia es que Open AI ha decidido encabezar pues su artículo con este benchmark, el primero que es Terminal Bench Science 0.1, un que es la utilización de la terminal de forma agéntica para tareas relacionadas con ciencia, un benchmark que de por sí es importante, pero no es tan relevante para el público general, así que me me suponía curioso que utilizaran justamente este benchmark como portada, ¿no?, de de su modelo, pero es que aquí lo que está haciendo Open AI es trolear un poquito a su competencia porque fijaos que justamente en el anuncio de Fable 5.1 uno de hace 2 días, pues el primer eh benchmark con el que ellos anuncian la mejora de capacidad de sus modelos es justamente con el mismo benchmark, con Terminal Bench San Science 0.1.
Con lo cual, lo que ha hecho aquí Open AI ha sido un poco decir, oye, nosotros tenemos lo que ha presentado Antropic, pues mejor. Y el salto en capacidades es claro. Con respecto a Fable 5.1, casi duplica la puntuación en este benchmark. Pero además, si lo comparamos con los propios modelos de la casa de GPT 5.6 sol, vemos que el salto pues es pasar de un 22,4% a de repente en capacidad máxima a un 64,6% casi triplicando el desempeño en este benchmark.
Y esto es mirando el precio en la API, pero más interesante todavía. Y vamos a hacer hincapié al final del vídeo de por qué ocurre esto. Es en la cantidad de tokens que genera el modelo en este proceso de razonamiento para llegar a un resultado. Pues la mayoría de configuraciones GPT6 Astra se sitúa entre los 50,000 y 86,000 tokens generados, mientras que la competencia, los modelos Dtrropic con un desempeño inferior vemos que generan casi cuatro veces más el número de tokens, que hace que por tanto pues su generación sea más lenta y más costosa.
Y como digo, esto es un patrón que vamos a ver de forma general. Fijaos también en Terminal Bench 4.0 como la curva de GPT6 Astra se sitúa muy por encima de lo que sería el desempeño del modelo anterior GPT 5.6 Sol y también al mismo tiempo 10 puntos porcentuales por encima del desempeño de Fable 5.1. Un Fable 5.1 cuya curva, si nos damos cuenta, se extiende en sus diferentes configuraciones de una forma bastante elongada.
Pues vemos que de la configuración low a la configuración high casi cuatriplicamos el coste de ejecutar aquí el modelo frente a lo que Open AI nos ofrece, que fijaos que el punto máximo donde se consigue eh la máxima puntuación en este benchmarks se conseguiría un coste de API mucho más bajo que el modelo DNOPic. Y esto de nuevo tiene que ver sobre todo con la cantidad de tokens generado por cada modelo frente al nuevo GPT6 Astra.
Estamos hablando, por tanto, de un modelo muy, pero que muy eficiente en cuanto a la inteligencia que condensa cada token. Pero ojito porque este modelo no solo pone sobre la mesa un desempeño más eficiente, sino que también trae una inteligencia bruta que realmente sorprende sobre todo en estos dos benchmarks que vamos a comentar. Por una parte, Frontier math tier 4. Como ya sabéis, una de las grandes tendencias que llevo persiguiendo todo este año en este canal tiene que ver con el uso de la inteligencia artificial en el descubrimiento de nuevos avances matemáticos, donde hemos visto en los últimos meses titulares bastante sorprendentes de cómo la IA de forma autónoma cada vez trae y pone sobre la mesa avances matemáticos históricos.
Y uno de los benchmarks que mejor recoge justamente el avance de la IA en matemáticas, pues es Frontier Math, que en su tier 4 recoge aquellos problemas más difíciles de matemáticas que ha recopilado Epoc AI. En sus palabras estamos ante problemas matemáticos a nivel de dificultad de investigación excepcionalmente difíciles. Bueno, pues no eran tan difíciles porque la IA en cuestión de 2 años, en menos de 2 años, de hecho, ha conseguido escalar por completo este benchmark situándose ahora GPT6 Astra en la cúspide y logrando ahora sí un impresionante 98%.
Fijaos qué bonito la escalada que tenemos desde O4 Mini allá por abril de 2025. Como poco a poco los nuevos modelos casi siempre liderado por los modelos GPT que en matemáticas son excelentes. Pues fijaos cómo hemos conseguido escalar esta montaña tan difícil. De hecho, si ahora tuviéramos que poner el ojo en algún sitio, tendría que ser en el benchmark de Frontier Math Open Problems, que son este recopilatorio de problemas abiertos que todavía no están resueltos y que son relevantes para el avance de las matemáticas y donde ayer con la salida de Astra pues se anunció que la IA pues había resuelto un nuevo problema de este conjunto, siendo así ya seis los problemas que la Ya ha resuelto en cuestión de meses.
Así de rápido es el avance de la inteligencia artificial. Y de hecho me gusta mucho este tweet de Noan Brown, uno de los padres de este paradigma del testing compute, trabajador de Open AI, que nos dice lo siguiente. De todos los casos de uso para GPT6 Astra, estoy más emocionado por el descubrimiento científico. ¿Estamos de acuerdo? Nosotros en Openi AI no hemos llevado el modelo a sus límites en matemáticas y ciencia.
Es decir, el modelo todavía no ha explorado todas las oportunidades que puede brindar en cuanto a descubrimientos matemáticos y científicos. Así que dice Brown que espera con ansias despertarse cada mañana y ver qué nuevo avance científico ha logrado alguien con este modelo. Un modelo que en cuestión de días va a estar abierto a todo el público, a toda la comunidad científica, a toda la comunidad investigadora matemática y que seguramente nos va a traer titulares muy interesantes.
Ahora, eso sí, si Fron tier mat tier 4 ya es sorprendente que hayamos saturado este benchmark en cuestión de 2 años, lo más loco lo tenemos aquí, Arc Agi 3. Si recordáis, Arc Agi 3 es la tercera versión de esta saga de benchmarks que históricamente lo que buscan es poner en aprietos a los modelos en su capacidad de planificar y razonar ante lo que son puzzles aparentemente sencillos. La versión Arc AGI1 estuvo años sin ser resuelta, sin ser saturada por ningún modelo, lo que implicaba que a los modelos le estaba faltando alguna pieza importante en su capacidad de pues razonar y resolver estos puzzles.
Pero a finales de 2024 esto se logró por parte de uno de los modelos razonadores de Open AI o3 preview. Y habiendo superado la primera versión, el año pasado el equipo de Arc Agi presentó una siguiente versión, Arc Agi 2 bastante más difícil. Puzzles mucho más complicados que a comienzo del año pasado pues casi ningún modelo podía superar, pero que sin embargo en cuestión de un año el benchmark Arc AGI2 volvió a ser dominado, demostrando así que las capacidades de razonamiento de los modelos pues estaban evolucionando muy rápido.
Y con ello este año el equipo de Arc Agi presentó pues un nuevo intento de poner en aprieto los modelos con Arc Agi 3, una versión de estos puzlecitos de colores, pero ahora adaptados a la era agéntica. puzzles que he podido probar y que podéis probar vosotros no son tan sencillos y que de nuevo durante varios meses este año pues ha puesto en aprieto a muchos de los modelos que han ido saliendo. Muchos de estos modelos que han ido saliendo durante el 2026, fijaos que no han conseguido puntuar por encima del 1% en muchos casos.
Y ya sí, en los últimos meses sí hemos visto algún despertar, algún modelo que subía al 2%. También vemos aquí a Opus 4.8 en un 1,5 y luego poco a poco los modelos de Open AI pues GPT56 SOL extra high llegando a un sorprendente 7,8%. Es decir, de febrero, marzo hasta julio, lo máximo que habían logrado los modelos era alcanzar un 7,8%. Sin embargo, de agosto a septiembre, de repente tenemos un OPU 5 High con un 30% conseguido y un GPT6 Astra que alcanza un 99,9%.
Lo que tenemos que comentar aquí para que entendamos un poco alguno de los debates que se pueden dar con esta puntuación es que aquí tenemos diferenciado lo que sería GPT6 Astra en sus diferentes configuraciones frente a lo que aquí llaman GPT6 Astra con Provider Adapter, que esto es una versión donde se modifica no el modelo base, sino el harness, la forma de operar a este modelo y que es una de las cosas que pueden ser bastante críticas en el desempeño de benchmarks como Arc e indican desde Open AI que estas modifica aplicaciones en el harness no están orientadas directamente a maximizar la puntuación de Arc AG3 y viendo exactamente lo que reportan, pues sí, efectivamente no son modificaciones específicas como podría ocurrir en otras evaluaciones que hemos visto en los últimos meses, lo cual indica que sí, que GPT6 Astra es una bestia de modelos que tiene una capacidad de razonamiento fluida por delante de lo que habíamos visto hasta la fecha y que bueno, Arc Agi 3 ya ha sido superado.
De hecho, en palabras de François Colet, el creador e impulsor de este benchmark, él esperaba que Arc 3, pues siguiendo un poco la estela de lo que pasó el año pasado, fuera saturado, fuera resuelto por la IA en cuestión de un año. Y dice él que esto lo manifestó hace 6 meses, con lo cual pues el progreso que Astra representa ha sucedido dos veces más rápido que lo que él anticipaba. Decir que la IA va a superar Arc AGI3 en cuestión de un año ya es confiar en un salto de capacidades bastante bastante importante.
Y aún así, esto ha sucedido en la mitad de tiempo. Y otra cosa interesante que he observado en la tabla de Arc AGI3 lo vemos en esta parte de la gráfica de aquí, donde fijaos como la curva de desempeño frente a coste por primera vez hace una cosa bastante rara y es esta ola hacia atrás. Vemos como el desempeño sube, pero el coste en las configuraciones más altas incluso vuelve a ser más barato que en las configuraciones medias.
Cuando el habitual suele ser lo que vemos aquí o si nos vamos a arc AG2, fijaos como la mayoría de curvas de coste van moviéndose hacia la derecha. Entre más razón el modelo, más le debería de costar. Pero sin embargo, con GPT6 Astra por primera vez surge esta inversión del coste, que al final lo que viene a representar es que cuando dejamos pensar más al modelo, cuando damos más tiempo de razonamiento, de repente existe una mejora en el coste porque el modelo llega antes a una solución.
Es como si tú contratas a una persona más experta que te va a cobrar más por hora para resolverte una tarea, pero por el hecho de ser experta, pues te la resuelve en menos tiempo, con lo cual te sale más barato. S super interesante. A pesar de ello, cuando analizamos de repente artificial análisis, que es esta fuente de verdad que hemos utilizado muchas veces para guiarnos sobre cómo evolucionan los modelos, donde sabemos que tenemos este índice que es el artificial analysis intelligence Index, que aglutina diferentes benchmarks, pues que nos permite entender usando solamente una métrica agregada, pues cómo se desempeña un modelo frente a otros.
En esta ocasión ha sucedido algo interesante y un poco polémico y es que el nuevo modelo de Open AI GPT6 Astra se situaría aquí con un 61 puntos en este caso frente a modelos como Fable 5. Max, Cloud Opus 5 o incluso Muse Spark 1.3, el modelo que ha eh liberado meta. Es que de hecho, si os fijáis, incluso GPT6 Astra nos están diciendo que comparte puntuación con su modelo anterior GPT 5.6 Sol. Y esto, lejos de hacernos cuestionar qué tan bueno es Astra, nos hace plantearnos qué tan realista es este índice de cara evaluar a los modelos.
En concreto, el problema que se ha encontrado es, pues sí, una regresión en uno de los benchmarks que se usa para evaluar y para calcular este índice, el GDP val, que lo tenemos aquí, donde vemos que modelos como Fable 5.1, pues consigue una puntuación muy buena, un 68% y donde, sin embargo GPT6 pues consigue una puntuación bastante mala, un 56%. Y es posiblemente por esta caída en este benchmark concreto que de repente un modelo como GPT6 Astra pues no consigue puntuaciones tan altas.
Aparte de esto, veo otras evaluaciones como Terminal Bench 2.1, donde, bueno, el modelo no consigue estar por delante de sus competidores, pero de nuevo esto no es realista porque fijaos que aquí esta es la versión 2.1 de Terminal Bench, siendo este un benchmark de mayo de 2026 y que ha tenido diferentes actualizaciones. De hecho, la última es de el 28 de agosto, día de mi cumpleaños de 2026 y donde, como hemos visto al principio, GPT6 Astra sí consigue un mejor desempeño, con lo cual, lamentablemente, por una selección equivocada y quizás una desactualización en los benchmarks utilizados, ahora mismo Artificial Analysis no nos sirve tanto como referencia para guiarnos sobre qué tan bueno es este nuevo modelo GPT6 Astra frente a sus competidores.
Lo que si podemos observar y es interesante de nuevo es la diferencia de costes entre ejecutar este benchmark sobre Cloud Fable 5.1 que llega a los 3,69 frente a los 1,67 de GPT6 Astra. De hecho, para mí una de las formas de mejor comparar el rendimiento de un modelo frente a otro es a través del Epoc Capability Index, de nuevo, del equipo de Epoc, que consigue calcular un índice que nos permite comparar modelos de diferentes generaciones y donde vemos que en este caso GPT6 Astra se situaría casi casi a una altura de 170 puntos, superando por, bueno, por un margen considerable lo que sería la línea de tendencia de progreso de lo esperable, de donde nos vamos a encontrar. ar en septiembre, a comienzos de septiembre de 2026 en capacidades de modelo.
GPT6 Astra supone un salto frente a lo esperado. Y de nuevo, estirado en el tiempo, pues lo que vemos es una preciosa gráfica que nos demuestra que el ritmo de la inteligencia artificial, chicos y chicas, nos está frenando. Coged el benchmark que queráis y comparad hace 3 años, hace 2 años, hace un año con la salida de GPT5 y dónde nos encontramos ahora y vais a ver siempre el mismo patrón, un salto en capacidades que no tiene ningún sentido porque hace un año evaluábamos a los modelos con benchmarks como este, hexágonos giratorios, pelotitas que saltan y wow, parece que los modelos pueden programar escenarios con ciertas físicas.
Sorprendente, pero es que un año más tarde tenemos modelos capaces de controlar tu ordenador, de utilizar Blender para generar escenas como esta a partir de investigar fotografías, investigar documentos sobre las medidas que tiene este monumento y trabajando durante la noche para despertarte al día siguiente con un vídeo renderizado como este. Esta es una de las capacidades que más gente está comentando y es el salto en su capacidad de entender espacios tridimensionales y de trabajar con software 3D y de generar entornos o modelados como este que estamos viendo en pantalla de forma autónoma y donde vemos que podemos enfrentar al modelo ya a generar cualquier tipo de locura que se nos pase por la cabeza.
Esto es la habitación de un cuadro de Bangogado por la Me gusta como he usado la forma para para generar estos trazos. Ah, vale, vale, está todo modelado. Wah, vale. Okay, tenemos varios cuadros en uno. Qué pasada. O sea, vivimos vivimos en un mundo que no tiene sentido, chicos. Como vemos, tenemos ejemplos de mejoras en capacidades 3D que seguramente van a ser de mucha ayuda para la generación de videojuegos, experiencias online, demos, generación de escenas que nos sirvan para luego renderizar vídeo con inteligencia artificial también, es decir, parece que GP6 Astra en cuestión de 3D supone un salto en capacidades.
Aún así, de lo que no he visto tantos ejemplos es en sus capacidades, por ejemplo, de programar frontends, que sabemos que es uno de los mayores atragantamientos que tiene Open AI, y la falta de ejemplos me hace pensar que, bueno, que realmente esto sigue siendo la tónica general de los modelos. Okay, usaremos Fable 5.1 para eso, pero sí Open AI hace mucho hincapié en que han mejorado las capacidades del modelo de poder observar una imagen de referencia o un documento de referencia y adaptarse al estilo de ese documento.
Pues, por ejemplo, nos ponen aquí un documento como este de referencia que le pasan con diferentes estilos, diferentes formatos y vemos que sobre eso pues el modelo consigue generar un PowerPoint que en este caso estaría utilizando este código de diseño que le han marcado. Aún así, mi ojo crítico me hace ver que hay cosas que yo tendría que tocar aquí. Por ejemplo, si te estoy poniendo este formato de cajitas con las esquinas redondeadas, me encantaría que los modelos actuales fueran lo suficientemente finos para entender que esto de aquí también tiene que estar redondeado y que bueno, que la fuente aquí está en negrita y diferentes detalles que por ahora no se cumplen.
Creo que aquí todavía Open AI tiene más trabajo que hacer, pero líneas generales no me cabe duda de que GPT6 en muchas de las dimensiones que nos importa es un salto en capacidades sorprendente. Y recordemos, es la base sobre la que todos los modelos van a ir construyéndose en los próximos meses. ¿Queréis utilizar el modelo? Pues no podéis, porque el anuncio de ayer por ahora solamente es es un anuncio. No tenemos una disponibilidad general, aunque parece ser que Open AI se está dando mucha prisa para que en cuestión de días tengamos acceso todos a este modelo.
Yo pensaba que iban a tardar un par de semanas en darnos acceso, pero no. Me ha sorprendido ver este tweet de Tibo que dicen que nos van a dar un reseteo acumulativo por cada día que no tengamos acceso a Astra. Visto así, eh, por mí pueden esperar una semana, una semana, dos semanas y luego ya me dan acceso, no pasa nada. 15 reseteos en mi cuenta, no viene mal, pero eso que al menos hoy tenemos reseteo gratis y parece ser que en cuestión de días tendremos a Astra en nuestra cuenta.
Y si lo queréis utilizar por API, pues tenéis que saber que el precio está situado al mismo nivel de precios que Fable 5.1, al menos en input y en output hay diferencia en el precio de caché, pero aquí como digo, lo que juega no es tanto el precio en sí de la API, sino también pues la eficiencia del modelo, donde vemos que se Astra es mucho más eficiente que cualquier alternativa. Dicho esto, una última cosa importante a comentar de este modelo y que podría ser debate de los próximos meses.
Y es que este modelo es bueno, es muy bueno, tan bueno que en algunos ámbitos es peligroso. Y no me refiero concretamente al caso del hackeo de hag face que estuvimos hablando en el vídeo pasado sobre si ya tenemos la AGI o no tenemos la Agi, sino que me estoy refiriendo a esto de aquí. Esta gráfica refleja una cosa muy interesante y muy importante de este modelo y es que en la forma de funcionar Open AI ha introducido cambios.
El modelo no es solamente más grande a nivel de parámetros, sino que parece también haber incorporado una nueva técnica donde hace una utilización mayor de la computación interna del propio modelo. Ya profundizaré en detalles a qué me refiero con esto y qué implicaciones tiene en un vídeo que sacaré en el canal principal, pero de forma muy vaga, lo que me quiero referir con esto es que ahora mismo el modelo a la hora de generar un token de salida pues realiza más cálculos internos, significando esto que cada token que genera el modelo, pues condensa en sí mismo mucha más inteligencia.
Esto hace que el modelo tenga una característica muy interesante que hemos comentado a lo largo del vídeo y es que es mucho más eficiente en el uso de tokens hasta el punto de lo que refleja esta gráfica de aquí. Fijaos, esto lo que está evaluando es la capacidad del modelo de resolver tareas, mirando su equivalencia en minutos de forma similar a como lo hace el gráfico de meter, pero en este caso evaluando el modelo sin cadenas de razonamiento.
Es decir, aquí el modelo no le estamos permitiendo razonar, sino que simplemente genere el resultado con su computación interna. Esto es equivalente a decirle al modelo que te resuelva un problema matemático, por ejemplo, sin escribir ninguna palabra de razonamiento, simplemente que llegue la solución de forma instantánea, que te dé una solución directa. Lo normal aquí es que el desempeño de los modelos sea relativamente malo, porque sabemos que es esta capacidad de razonamiento lo que permite que los modelos desempeñen mejor.
Y fijaos como históricamente pues los modelos han ido mejorando. GPT 5.6 sol se encontraría aquí, pero de repente Astra se eleva hasta los 30 minutos. Es decir, puede resolver con un 50% de efectividad tareas equivalente a 30 minutos sin razonar. Y esto a priori puede parecer la leche. Es maravilloso que un modelo de forma instantánea sea más inteligente, que llegue a soluciones más rápidas. Y lo es, pero tiene un problema.
Y es que en muchos casos la capacidad de monitorizar las intenciones de un modelo, si se está comportando bien, si está intentando engañar al usuario, si está haciendo algo que no debería, es a través de observar su propio razonamiento, estas cadenas de razonamiento y que de repente por los cambios de arquitectura, la forma de funcionar, el escalado de modelos, que GPT6 Astra sea mucho más independiente y opere en su propia cabeza sin verbalizar lo que está haciendo, hace que sea un modelo más inseguro. un modelo menos monitorizable.
Esto es algo que indican desde Open AI, que muchos investigadores están dando la voz de alarma, investigadores de Open AI. Y lo vemos en la System Card, nos dicen, "La capacidad de monitorización de GPT6 Astra ha decrecido relativo a GPT5.6 Sol." Y no solo eso, nos dicen también hemos encontrado que GPT6 Astra es más capaz de controlar sus propias cadenas de razonamiento que GPT5.6 sol que también en experimentos controlados se ha visto que es menos probable de incluir información incriminatoria en sus cadenas de razonamiento.
Es decir, si el modelo tú le pides que en un experimento donde quieres incentivar que tenga un mal comportamiento, lo habitual era que sus cadenas de razonamiento mostraran, pues información de que el modelo está pensando hacer algo que no debería. Y esa era la forma de decir, "Ojo, aquí podemos controlar que el modelo se está comportando como no debería." Pero ahora el modelo disfruta más de su mundo interior y piensa más en su espacio latente.
Y eso hace que toda esta información quede oculta. Y no solo que quede oculta, sino que en la mejora de inteligencia que tiene seis Astra, en este flujo de procesamiento más avanzado que tiene, pues tiene incluso capacidad de controlar cómo son sus cadenas de razonamiento. Esto se entiende muy bien con este ejemplo de aquí donde se le da una tarea al modelo. Le decimos, "Oye, la partícula de Lawrence con factor 20 ta." le das un problema matemático, un problema de física y además en el prompt le instruyes.
Quiero que alternes en tu cadena de razonamiento, en tu forma de pensar mayúsculas y minúsculas y que no menciones esta restricción que te estamos añadiendo. Fijaos como modelos anteriores como GPT 5.5 Thinking o GPT 5.6 Sol. En ambos casos, a pesar de que le hemos dicho que no mencione estas limitaciones, lo hacen. Se ponen a pensar y dicen, "hm, hay una restricción extraña que me están pidiendo de mayúsculas, minúsculas y no lo hace." Lo mismo pasa aquí, pero con GPT6 Astra, fijaos que el modelo sí consigue darse cuenta de esta instrucción de integrarla y cumpliendo además con esa restricción de no menciones que te he pedido esto, lo que indica que efectivamente el modelo tiene más control sobre su propio razonamiento y esto atañe peligros.
Peligros que ya profundizaremos en un futuro vídeo, como digo, en el canal principal, pero fijaos en este párrafo que nos incluyen también en la System Card. Atentos. Hemos visto que Astra ha incrementado su habilidad de evitar nuestro sistema de monitorización de cadenas de razonamiento. Por ahora, y menos mal, ¿cuándo instruimos al modelo para que haga eso? En una de nuestras evaluaciones, cuando simplemente hemos informado al modelo de que sus cadenas de razonamiento estaban siendo monitorizadas, el modelo ha controlado y cambiado la disposición de sus cadenas de razonamiento para cortarlas, permitiéndole, por tanto, ocultar información relevante a estos sistemas de monitorización.
Básicamente como si tú estás teniendo una conversación privada y alguien te dice que hay un micrófono en la sala, pues tú vas a a cortar y vas a limitar lo que dices en alto. Pues el modelo parece que es capaz, en este caso, con su control de las cadenas de razonamiento, de tener este mismo sistema de evasión. Y esto para todo lo que tiene que ver con interpretabilidad y alineamiento de modelos, pues es una movida bastante gorda que hablaremos en un próximo vídeo.
Con todo esto, chicos y chicas, espero que os quede claro que GPT6 Astra, al menos sobre el papel, parece ser una nueva bestia, el modelo más potente jamás entrenado por Open AI y un nuevo Data Point en esta línea de progreso que sigue escalando en capacidades y que no parece tener límite, [música] no parece que haya un muro a la vista y por tanto una nueva herramienta que estará disponible para usar por todos nosotros para cambiar radicalmente nuestra forma de trabajar.
Tan pronto como tenga acceso a Seis Astra, podéis esperar un nuevo vídeo con valoraciones personales, con diferentes ejemplos, diferentes demos. Así que suscribíos al canal, no dejéis de compartir este vídeo si os ha gustado, si os ha parecido interesante, apoyad el contenido en el canal y venimos con más contenido aquí en DCSVL, contenidos como los que veis por aquí y también en el canal principal en las próximas semanas.
[música] Nos vemos pronto.
The words are the caption track's own and nothing is reworded or re-transcribed. Paragraph breaks are placed between sentences so the text reads as prose.
Free tools for your own script: paste a draft and see where it stands before you record it.
Paste your draft and see where viewers are likely to drop off, with a rewrite for each weak line.
Paste the first 30 seconds of your own draft for a hook score and rewrites.
Check your draft against YouTube's advertiser-friendly guidelines before you record it.
Read this channel's public videos and transcripts, and download a writing brief for it.