Las claves de la IA

Hecho por una IA. Este programa lo investiga, lo escribe y lo locuta por completo una inteligencia artificial, sin revisión humana. Puede contener errores. Las fuentes de cada noticia están en la descripción.

Claves semanales IA · jueves, 8 de octubre de 2026 · 19 min

719 pruebas matemáticas sin revisar, el precio real de pensar y los ataques a bancos coreanos

Cuatro temas de fondo de la semana del 2 al 8 de octubre de 2026. OpenAI publica de golpe cientos de resultados matemáticos de un modelo que nadie fuera puede usar, y los matemáticos discuten cómo comprobarlos. Los precios por token caen, pero el coste por tarea no siempre los sigue. Corea del Sur investiga ataques a sus bancos en los que se sospecha el uso de inteligencia artificial, y el dinero de los chips sigue creciendo con deuda.

Descargar el audio (MP3)

Guion

Semana del 2 al 8 de octubre de 2026. Cuatro claves. La primera, las matemáticas hechas por máquinas y el problema de quién las comprueba. La segunda, la diferencia entre lo que cuesta un token y lo que cuesta terminar una tarea. La tercera, la ciberseguridad, con los ataques a los bancos de Corea del Sur y una discusión sobre los modelos abiertos. Y la cuarta, el dinero: chips comprados con deuda, centros de datos en el norte de China y la pregunta de siempre sobre la burbuja.

Primera clave. Las matemáticas.

Hay que empezar un mes atrás. El 8 de septiembre, OpenAI publicó en su blog una prueba sobre las ecuaciones de Navier-Stokes, las que describen cómo se mueve un fluido. Es uno de los siete problemas del milenio del Instituto Clay. La prueba venía con una versión en Lean, un lenguaje en el que un ordenador comprueba una demostración paso a paso. Según la cobertura de la prensa especializada, el resultado se refiere a una versión del problema en la que actúa una fuerza externa sobre el fluido, que no es exactamente el enunciado del premio, y OpenAI no ha reclamado el millón de dólares. El parte de esta semana ya contó la crítica de tres matemáticos, Bastounis, Circelli y Hansen, que sostienen en arXiv que la traducción a Lean no dice lo mismo que el texto escrito. No lo repito. Lo nuevo vino el martes.

El martes, 6 de octubre, OpenAI abrió un repositorio público en GitHub con resultados matemáticos de un modelo interno que no ha publicado. Según el propio repositorio, son setecientos diecinueve manuscritos, agrupados en trescientas setenta y dos familias de resultados. La prensa, como The Next Web, habla de setecientos veintidós; la diferencia es pequeña, pero la cifra exacta depende de qué se cuente. Según el mismo repositorio, al modelo se le plantearon unos cuatro mil problemas, cada resultado consumió de media unas tres horas de cálculo y en torno al cuarenta y dos por ciento de los resultados principales tiene ya su versión en Lean. El resto, no. Y OpenAI avisa en el repositorio de que algunos resultados sin formalizar podrían tener fallos, que corregirá publicando versiones nuevas sin borrar las anteriores.

Entre todo eso hay dos resultados que, de confirmarse, serían de los que se estudian durante años. Uno es una región sin ceros para la función zeta de Riemann, la función cuyos ceros guardan el secreto de cómo se reparten los números primos. El repositorio la sitúa en la zona donde la parte real es mayor que once doceavos. Para entender por qué importa, una imagen. Hasta ahora, las regiones sin ceros que se conocían eran como una franja de playa que se estrecha a medida que se avanza por ella, hasta casi desaparecer. Lo que se afirma aquí es una franja de anchura fija. No resuelve la hipótesis de Riemann, que pide mucho más, pero sería un avance grande. El otro es una prueba de la conjetura de Hodge para una familia concreta de objetos geométricos, las variedades abelianas con multiplicación compleja. Según el repositorio, esos dos resultados no siguieron el procedimiento fijo del resto, y el texto sobre la función zeta lo editaron personas para que se leyera mejor.

Las reacciones se reparten en tres posturas. La primera es la de OpenAI. Dan Roberts, responsable de investigación de la empresa, dijo a The New York Times, según The Next Web, que las pruebas son un subproducto: el objetivo es probar sus modelos internos para construir mejores herramientas. La segunda es la de la cautela. Andrew Sutherland, matemático del M.I.T., dijo a Scientific American que esos resultados deben tratarse como no verificados hasta que otros puedan ejecutar el modelo y reproducirlos. Y la tercera es la desconfianza. Tristan Buckmaster, matemático de la Universidad de Nueva York que trabajaba en Navier-Stokes antes del anuncio de septiembre, dijo a The New York Times, también según The Next Web: «No creo que hayan hecho la diligencia debida en absoluto».

Hay una cuarta voz que conviene oír, porque no es ni la empresa ni sus críticos. El Grupo Asesor sobre Matemáticas e Inteligencia Artificial, que acoge el Instituto de Estudios Avanzados de Princeton, publicó el 29 de septiembre unas pautas para los laboratorios. Según The Next Web, pedían no probar problemas difíciles con modelos privados y publicar las instrucciones dadas, el tiempo y el cálculo empleados, y advertían del riesgo de un sistema de dos niveles en el que los laboratorios van por delante del resto. OpenAI dice en su anuncio que les ha consultado. El grupo respondió el martes que su consejo no era un aval de los resultados, y que la publicación es el comienzo, no el final, de que las personas los entiendan.

Lo que separa a unos de otros no es tanto si el modelo es capaz, que casi nadie discute ya, sino tres cosas concretas. La primera es la escala. Setecientos manuscritos de golpe son más de lo que la comunidad matemática puede revisar con calma en meses. La segunda es que el modelo no está disponible, así que nadie puede repetir el experimento ni saber cuántos intentos fallidos hubo detrás de cada acierto. Un análisis independiente publicado el miércoles en el blog de Ken Ashe lo resume con un consejo práctico: antes de mirar la prueba en Lean, leer el enunciado, porque un enunciado formal puede ser más débil que el problema que anuncia el titular. La tercera es el calendario. Lo que en matemáticas da por bueno un resultado es la revisión por pares, y eso lleva meses o años.

Lo que no sabemos. No sabemos cuántos de esos resultados aguantarán la revisión. No sabemos si los dos grandes, el de la zeta y el de Hodge, son lo que dicen ser; solo lo sabremos cuando especialistas los lean línea a línea. Y no sabemos cuánto hubo de intervención humana en el proceso más allá de lo que declara el repositorio.

Por qué le importa a alguien que no es matemático. Porque es la primera vez que se ve, a gran escala, un problema que va a llegar a otros campos: cuando una máquina produce más trabajo del que las personas pueden revisar, la revisión se convierte en el cuello de botella. Pasará con informes jurídicos, con código y con diagnósticos. En matemáticas, al menos, existe Lean, que comprueba la lógica. En casi todo lo demás, no hay nada parecido.

Vamos con la segunda clave. El precio real de pensar.

Esta semana se juntan varias señales que apuntan en la misma dirección. El miércoles, Anthropic presentó Claude Haiku cinco punto cinco, su modelo pequeño. Como contó el parte, su precio por token es diez veces menor que el del Haiku anterior, pero la propia Anthropic dice que, de media, ejecutarlo cuesta un setenta y cinco por ciento menos. No un noventa. Una semana antes, el 29 de septiembre, OpenAI lanzó GPT seis punto uno Sol, que según su blog da casi el nivel de su modelo grande, Astra, a una quinta parte de su precio por token. Y el 30 de septiembre, Google presentó Gemini cuatro Argon, su nuevo modelo de frontera, con un precio de lanzamiento de dos dólares por millón de tokens de entrada y diez de salida, que según el anuncio subirá después a cuatro y veinte.

Para entender lo que pasa, la imagen del coche. El precio por token es el precio del litro de gasolina. Lo que de verdad se paga es el viaje, y el viaje depende de cuánto consume el coche. Los modelos que razonan, los que piensan antes de responder, gastan muchos tokens en ese pensamiento, y esos tokens se pagan aunque no se vean en la respuesta. Si el litro baja a la mitad pero el coche gasta el doble, el viaje cuesta lo mismo.

Eso es exactamente lo que discutían los desarrolladores en Hacker News, el foro de tecnología, donde el anuncio de Haiku reunió más de cuatrocientos comentarios. Lo que elogian se repite: es rápido, sirve bien como ayudante de un modelo grande para tareas sencillas, como clasificar, filtrar registros o escribir mensajes de cambios, y es mucho más útil que el Haiku anterior, que muchos consideraban flojo. Lo que critican también se repite, y no es anecdótico. Primero, que el precio de salida se multiplica por cinco por encima de los cien mil tokens por petición, un límite que varios ven muy bajo para trabajos con agentes, que acumulan mucho contexto. Segundo, que el modelo nuevo divide el texto en más trozos que el anterior; un comentarista, citando el propio anuncio, habla de un treinta por ciento más de tokens para el mismo texto. Y tercero, que, según datos de Artificial Analysis que citan varios usuarios, con el esfuerzo de razonamiento al máximo el coste por tarea de Haiku se acerca al de modelos más grandes. Son lecturas de usuarios, no una medición propia de este programa, y en las fuentes de esta semana no hay todavía una medición independiente publicada por la propia Artificial Analysis.

La conclusión que sacaban varios es sensata: Haiku tiene sentido con poco razonamiento, donde manda la velocidad; con mucho razonamiento, la cuenta cambia. Y aparece una comparación que se repite cada vez más: los modelos abiertos chinos. Varios comentaristas citan modelos como GLM, de la empresa china Z.ai, o DeepSeek como alternativas con mejor relación entre capacidad y precio.

Ahí entra la otra noticia de precios de la semana. El lunes, Reflection AI, una empresa estadounidense respaldada por Nvidia, según el South China Morning Post, presentó Beam, un modelo abierto, es decir, cuyos pesos se pueden descargar y ejecutar en máquinas propias. Según Semafor, la empresa sostiene que Beam iguala a GLM cinco punto dos, el modelo abierto de Z.ai publicado en junio, que se acerca a Qwen tres punto ocho Max, de Alibaba, y que necesita entre tres y cuatro veces menos cálculo para razonar un problema. Su consejero delegado, Misha Laskin, lo presenta como un modelo de trabajo para gobiernos y empresas que quieren tener la inteligencia artificial en casa. Son cifras del fabricante, sin verificar, y según la prensa especializada los pesos y el informe técnico aún no se han publicado. Pero el movimiento dice algo: en los modelos abiertos, el punto de referencia ya no es un laboratorio estadounidense, sino uno chino.

Aquí hay dos lecturas. La de los optimistas del precio dice que la caída del coste por token es tan rápida que acabará arrastrando el coste por tarea, igual que pasó con la memoria de los ordenadores. La de los escépticos dice que los modelos que más se usan para trabajos serios son justo los que más razonan, y que esa demanda crece más deprisa de lo que bajan los precios; es lo que los economistas llaman la paradoja de Jevons, que dice que cuando algo se abarata se usa tanto más que el gasto total sube. El Financial Times dedicaba el lunes un análisis a esta deflación del precio del token. Lo que decidiría entre las dos lecturas es un dato que casi nadie publica de forma sistemática: el coste por tarea terminada, medido por alguien independiente, a lo largo del tiempo.

Por qué importa fuera del sector. Porque las empresas que hoy deciden si automatizan algo hacen la cuenta con el precio del litro, y deberían hacerla con el del viaje. Y porque un modelo diez veces más barato por token que, para la misma tarea, gastara tres veces más tokens no sería diez veces más barato. Lo sería algo más de tres.

Tercera clave. La ciberseguridad, que esta semana ha dejado de ser una conversación teórica.

En Corea del Sur, entre el jueves 1 y el viernes 2 de octubre, varios bancos comunicaron fugas de datos de clientes. Según The Korea Times, Shinhan Bank informó de unos veinticinco mil afectados; después lo hicieron KB Kookmin, Hana y BNK Busan, y entre las entidades no bancarias, Yegaram, con unos cuarenta mil clientes, y Hyundai Capital. Se filtraron nombres, teléfonos, ingresos anuales, límites de préstamo y, en algunos casos, números de identificación personal. Según el mismo diario, las autoridades no han encontrado datos que permitan hacer pagos, pero avisan del riesgo de estafas telefónicas con los datos robados.

Lo que ha llamado la atención es la posible pista de la inteligencia artificial. El domingo, el presidente Lee Jae Myung ordenó una investigación a fondo, y, según el Financial Times, avisó de que se habían usado modelos de inteligencia artificial en algunos ataques. Sin embargo, según The Korea Times, el uso no está confirmado. Lo que hay, según fuentes del sector citadas por ese diario, son rastros de una herramienta de pruebas de intrusión con inteligencia artificial, en chino, en un servidor que se cree que se usó contra Shinhan. El regulador financiero coreano pide a las entidades que adopten sistemas de seguridad basados en inteligencia artificial. Es decir, defenderse con lo mismo con que se ataca.

Conviene no correr más que los hechos. No se sabe qué herramienta se usó, ni si la inteligencia artificial fue decisiva o solo un acelerador de un ataque que se habría hecho igual. Tampoco se sabe la escala completa de las fugas.

Mientras tanto, Google ha tomado una decisión que va en la dirección contraria a la prudencia, o en la de la prudencia bien entendida, según a quién se pregunte. Según su anuncio, Gemini cuatro Argon se da primero, y sin las salvaguardas de ciberseguridad habituales, a defensores de confianza dentro de un programa llamado Fairwind, antes de llegar al público. La idea es que quien defiende tenga la mejor herramienta antes que quien ataca.

Y aquí entra el debate de la semana. El martes, Nathan Lambert, investigador y autor del boletín Interconnects, publicó un texto titulado, en traducción libre, «El debate sobre el riesgo cibernético está roto». Distingue tres bandos. Uno, el de los líderes de los grandes laboratorios y la comunidad de seguridad nacional de Estados Unidos, que ve los modelos abiertos como un riesgo inaceptable. Otro, en el que se sitúa él, que sostiene que los modelos abiertos son necesarios para defenderse, por ejemplo en redes del Gobierno desconectadas de internet, donde no se puede llamar a un modelo en la nube. Y un tercero, los laboratorios chinos, que publican modelos abiertos con capacidades fuertes según los criterios de riesgo de su propio Gobierno, que casi nadie en Occidente estudia.

Su argumento central tiene dos partes. La primera es un dato: según Lambert, los ciberataques documentados hasta ahora con inteligencia artificial se han hecho sobre todo con modelos cerrados, no abiertos. La segunda es una predicción falsable. Cuando se presentó Claude Mythos, de Anthropic, se habló de una nueva clase de arma cibernética; Lambert sostiene que el modelo abierto chino GLM cinco punto tres ya cruza ese umbral y que, más de un mes después de publicarse, no hay pruebas de daños derivados. Si los que temen los modelos abiertos tienen razón, dice, deberíamos ver esos daños; de momento, según él, no se ven.

La otra lectura merece su mejor versión. Quien defiende restringir los modelos abiertos argumenta que un modelo cerrado se puede vigilar y cortar, y uno abierto, una vez descargado, no. Que un mes es poco tiempo. Y que los ataques más dañinos son precisamente los que no se ven enseguida. Lo de Corea, si se confirma que intervino una herramienta abierta, sería un dato para esta postura; si se confirma que fue una cerrada, para la de Lambert. Por ahora no es ni lo uno ni lo otro.

Hay un tercer frente que conviene apuntar. El Financial Times publicó el martes que las aseguradoras se preparan para reclamaciones de muchos millones por agentes de inteligencia artificial que actúan por su cuenta, y que abogados y aseguradoras estudian posibles demandas contra los directivos de OpenAI y Anthropic. Cuando las aseguradoras empiezan a ponerle precio a un riesgo, el riesgo deja de ser una opinión y pasa a ser una prima.

Por qué importa. Porque los datos de muchas personas están en sistemas bancarios como los coreanos. Y porque la decisión de si los modelos abiertos se restringen o no se va a tomar en los próximos meses, en Washington y en Bruselas, con argumentos que hoy se apoyan más en intuiciones que en datos.

Cuarta clave. El dinero.

El martes, el Financial Times publicó que SpaceX busca cuarenta mil millones de dólares en deuda para comprar chips de Nvidia. SpaceX, recordemos, es hoy también una empresa de inteligencia artificial: según la prensa financiera, a principios de año absorbió xAI, la empresa de inteligencia artificial de Elon Musk, y en junio emitió su primer bono tras salir a bolsa. Al día siguiente, según el mismo diario, subió con fuerza el coste de asegurarse contra un impago de SpaceX, que se mide con unos contratos llamados permutas de incumplimiento crediticio. Dicho en llano: los inversores piden más por cubrirse del riesgo de que no pague.

No es un caso aislado. El mismo martes, según TechCrunch, Lambda, una empresa que alquila capacidad de cálculo con chips de Nvidia y que tiene a Nvidia entre sus inversores, prepara una ronda de hasta cuatro mil millones de dólares, con una valoración previa de catorce mil quinientos millones, antes de salir a bolsa en 2027. Y en China, según el South China Morning Post, ByteDance, la dueña de TikTok, ha estudiado añadir entre cinco y seis gigavatios de cálculo en Mongolia Interior. Para hacerse una idea, un gigavatio es más o menos lo que produce un reactor nuclear grande; hablamos de la producción de cinco o seis reactores dedicada a centros de datos de una sola empresa. Según el mismo diario, cada gigavatio cuesta en torno a ciento sesenta mil millones de yuanes. El Financial Times lo resumía el jueves con un titular: China corre a construir centros de datos en su carrera por la supremacía en inteligencia artificial. Allí se va por la energía barata y el frío, que abarata la refrigeración.

Antes de opinar, conviene definir. Una burbuja no es solo que los precios suban mucho. Es que suban por encima de lo que pueden justificar los beneficios futuros, alimentados por la expectativa de que seguirán subiendo. La pregunta, entonces, no es si se gasta mucho, que se gasta, sino si ese gasto tendrá ingresos que lo paguen.

Hay datos para las dos lecturas. A favor de que el gasto se está pagando: según el Financial Times, los analistas esperan que los beneficios de las empresas del índice S&P quinientos crezcan en torno a un veintisiete por ciento en el tercer trimestre, empujados por la inteligencia artificial. No son promesas, son beneficios. En contra, o al menos en la columna del riesgo: el mismo diario contaba el lunes que fondos de pensiones de todo el mundo reducen su peso en la bolsa estadounidense por el riesgo de concentración, es decir, porque demasiado valor depende de unas pocas empresas ligadas a la inteligencia artificial. Y titulaba una columna de esta semana con una pregunta que lo dice todo: si cada mercado se ha convertido en una apuesta por el auge de la inteligencia artificial.

Lo nuevo de esta semana no es el volumen del gasto, sino cómo se paga. Hasta hace poco, los grandes compraban chips con el dinero que generaban sus negocios. Ahora se financia cada vez más con deuda, como en el caso de SpaceX. La diferencia importa por un mecanismo sencillo. Si una empresa invierte su propio dinero y el negocio sale mal, pierde ese dinero. Si invierte dinero prestado y sale mal, además tiene que devolverlo, y el problema pasa a sus acreedores. Por eso los mercados de deuda son buenos termómetros: reaccionan antes.

Lo que no sabemos es lo decisivo. No sabemos cuánto de esa capacidad de cálculo tendrá clientes que paguen por ella a un precio que cubra el coste, y aquí conecta con la segunda clave: si el precio por token sigue cayendo, el ingreso por cada chip también cae, salvo que el uso crezca todavía más deprisa. Si pasa lo segundo, la inversión se paga. Si no, habrá chips caros alquilados a precio de saldo. Ningún dato de esta semana resuelve esa ecuación.

Por qué importa a quien no invierte en tecnología. Porque los fondos de pensiones y los índices en los que se ahorra a largo plazo tienen hoy un peso muy alto en estas empresas. No es un consejo, es un hecho de composición: buena parte del ahorro mundial está, lo sepa o no su dueño, apostando por esta ecuación.

Una idea para pensar antes de cerrar. Las cuatro claves de esta semana tienen algo en común, y es quién mide. Las pruebas matemáticas las verifica, sobre todo, la misma empresa que las produce. Los precios y los resultados los da el fabricante, y la medición independiente llega tarde o no llega. Los ataques a los bancos coreanos se atribuyen a la inteligencia artificial antes de que nadie lo haya comprobado. Y el valor de la inversión lo estiman, en buena parte, quienes la hacen. No es una acusación a nadie: en una tecnología que va más deprisa que sus instituciones, es lo esperable. Pero señala dónde falta trabajo. Hace un año, la pregunta era si estas máquinas podrían hacer matemáticas de verdad. Hoy la pregunta es quién tiene tiempo de leerlas.

Hasta aquí las claves de la semana. Cuatro asuntos que seguirán abiertos dentro de un mes: los matemáticos leyendo, las cuentas por tarea, los investigadores en Seúl y los acreedores mirando los chips.

Fuentes