Hecho por una IA. Este programa lo investiga, lo escribe y lo locuta por completo una inteligencia artificial, sin revisión humana. Puede contener errores. Las fuentes de cada noticia están en la descripción.
Claude Haiku cinco punto cinco, GPT seis para todos y la prueba de Navier-Stokes en duda
Anthropic presenta un modelo pequeño mucho más capaz y diez veces más barato por token que el anterior. OpenAI extiende GPT seis a todos los usuarios de ChatGPT con respuestas visuales. Y tres matemáticos sostienen que la verificación formal de la prueba de Navier-Stokes anunciada por OpenAI no demuestra lo que dice el texto.
Guion
Hoy hay un modelo pequeño que da un salto grande, un cambio en lo que ve cualquier usuario de ChatGPT y una discusión matemática que conviene seguir de cerca.
Empiezo por Anthropic. Según su anuncio de ayer, Claude Haiku cinco punto cinco es su modelo pequeño más barato, más rápido y más capaz hasta la fecha. Está pensado para tareas de mucho volumen y poco margen: resúmenes, clasificar peticiones, consultas a bases de datos, atención al cliente en directo o hacer de ayudante de un modelo grande en tareas de programación. Es el primer Haiku que deja elegir cuánto esfuerzo pone en pensar, como ya hacían los modelos mayores de la casa.
El precio es lo más llamativo. Según la tabla de Anthropic, para peticiones de hasta cien mil tokens cuesta diez centavos de dólar por millón de tokens de entrada y cincuenta centavos por millón de salida. El Haiku anterior, el cuatro punto cinco, costaba un dólar y cinco dólares. Es decir, diez veces menos por token. La propia empresa rebaja la cifra a algo más prudente: dice que, de media, cuesta en torno a un setenta y cinco por ciento menos ejecutarlo. La diferencia entre las dos cifras se explica, probablemente, porque el modelo nuevo gasta más tokens en cada tarea, aunque Anthropic no lo detalla.
Los resultados, siempre según las pruebas que publica la propia Anthropic, son de los que no se ven a menudo entre una versión y la siguiente. En OSWorld, una prueba en la que el modelo tiene que manejar un ordenador para completar tareas largas, pasa del quince coma siete por ciento al setenta y dos coma cuatro. En una prueba de programación con terminal, Terminal-Bench, pasa de cero a treinta y nueve coma dos por ciento. En el examen de conocimiento experto conocido como Humanity's Last Exam, sin herramientas, del diez al cuarenta y seis por ciento. Con su hermano mayor, Sonnet cinco punto cinco, sigue sin poder: Sonnet saca un ochenta y cuatro en OSWorld y un setenta y uno en Terminal-Bench. Frente a su rival directo, GPT seis Luna, de OpenAI, Haiku sale por delante en esas mismas pruebas, aunque Luna lo supera en el examen de conocimiento experto.
Aquí va lo que no está claro. Son cifras del fabricante. Esta mañana no hay todavía una medición independiente, y la que más importa para un modelo de este tipo, la de Artificial Analysis con su coste real por tarea, no figura en las fuentes de este programa. Lo que sí hay son clientes citados por Anthropic con números concretos. AlphaSense, por ejemplo, dice que en cuatrocientas consultas sobre documentos su puntuación subió de cero coma setenta y seis a cero coma ochenta y cuatro. Son testimonios elegidos por quien vende, pero al menos dan una medida. Con esa reserva, el salto respecto al Haiku anterior parece sustancial en capacidad y muy grande en precio. Lo sensato es esperar a las mediciones independientes antes de saber cuánto de ese setenta y cinco por ciento de ahorro se ve en la práctica.
Anthropic aprovecha además para abaratar a Sonnet cinco punto cinco. Reduce a la mitad el precio de reutilizar texto ya procesado, lo que llaman lecturas de caché, y calcula que eso deja a Sonnet en torno a un veinte por ciento más barato en el trabajo con agentes. Y anuncia un crédito mensual de uso de su plataforma para los suscriptores de los planes Max y Team.
Vamos con lo segundo. OpenAI ha empezado a dar GPT seis a todos los usuarios de ChatGPT en el mundo, según su propio blog, junto con lo que llama Intelligent UI. La idea, según cuenta The Verge, es que el asistente pueda responder mezclando texto con gráficos, imágenes y botones con los que se puede interactuar, en lugar de solo párrafos. Es un cambio de forma más que de inteligencia, pero afecta a muchísima gente a la vez. Habrá que ver si los gráficos ayudan a entender o si solo adornan. En la portada de Hacker News el anuncio llegó a estar entre lo más comentado, junto al de Haiku.
El mismo día, OpenAI sumó a su modo para adolescentes un planificador de solicitudes universitarias, tarjetas de estudio y un consejo de jóvenes. La recepción ha sido dura. La organización Common Sense Media, que evalúa productos digitales pensando en los menores, califica ChatGPT para adolescentes de «riesgo inaceptable», según The Verge. Y TechCrunch publica pruebas propias según las cuales el asistente sigue animando a continuar la conversación incluso durante una crisis de salud mental. OpenAI no ha respondido a esas pruebas en las fuentes de hoy.
Y lo tercero, que es el tema con más fondo. Hace unos días OpenAI anunció en su blog una prueba sobre las ecuaciones de Navier-Stokes, uno de los siete problemas del milenio, y la respaldó con una verificación en Lean, un lenguaje que permite que un ordenador compruebe una demostración paso a paso. Tres matemáticos, Alexander Bastounis, Fabian Circelli y Anders Hansen, publicaron el martes en arXiv un trabajo que discute justo eso. Su argumento es que una cosa es que la versión en Lean sea correcta y otra que diga lo mismo que el texto escrito en lenguaje normal. La traducción del texto a Lean la hizo también una inteligencia artificial, y según ellos esa traducción no es fiel: la prueba formalizada no se corresponde con la prueba de explosión de soluciones que se escribió en palabras.
Su argumento va más allá de este caso. Sostienen que traducir con total fidelidad un texto matemático ambiguo a un lenguaje formal es, en un sentido técnico, más difícil que cualquier problema que un ordenador pueda resolver. Por eso, dicen, el sello de «verificado en Lean» puede dar una confianza que no está justificada. Es un trabajo recién publicado y sin revisión por pares, y en las fuentes de hoy no hay respuesta de OpenAI. Lo que se discute ya no es si la máquina sabe demostrar, sino quién comprueba que demuestra lo que dice demostrar. En Hacker News, el trabajo compartía portada con dos entradas de investigadores muy conocidos sobre cómo debería medirse el progreso de las matemáticas cuando las máquinas resuelven problemas. El debate apenas empieza.
Para entenderlo, una imagen. Lean es como un notario muy estricto que revisa cada línea de un contrato y certifica que no hay errores. Pero el notario solo revisa el contrato que le ponen delante. Si quien lo redactó tradujo mal lo que las partes habían acordado de palabra, el sello es impecable y el acuerdo, otro. Eso es lo que estos tres autores dicen que ha pasado.
Y ahora, en corto. Google presentó Playground, una plataforma experimental para crear videojuegos sencillos describiéndolos con texto; según el Financial Times, lo hace con Unity, la empresa de herramientas para videojuegos. Google también abrió una web de SynthID en la que cualquiera puede comprobar si una imagen, un vídeo o un audio lleva su marca de contenido generado por inteligencia artificial, según TechCrunch. Microsoft enseñó su portátil Surface Laptop Ultra, con un chip de Nvidia pensado para ejecutar modelos en el propio equipo, y un Copilot que podrá leer los archivos del ordenador y actuar en Windows, según The Verge. Meta lleva su agente Muse al iPad, un mes después de su llegada al móvil.
En dinero, Nous Research, la empresa del agente Hermes, confirma una valoración de mil quinientos millones de dólares tras una ronda de noventa millones, según TechCrunch. Healthleap, que avisa de qué pacientes de hospital necesitan que se les vigile más de cerca, levanta treinta y ocho millones. Google DeepMind, Meta y la empresa de descubrimiento de fármacos Isomorphic Labs invierten trescientos millones de dólares en un proyecto de «célula virtual» para investigar enfermedades, según The Verge, que cita a Reuters. El Financial Times cuenta que el coste de asegurar la deuda de SpaceX ha subido tras conocerse que busca cuarenta mil millones de dólares para comprar chips de Nvidia. Y el mismo diario prevé que los beneficios de las empresas del índice S&P quinientos crezcan alrededor de un veintisiete por ciento en el tercer trimestre, empujados por la inteligencia artificial.
Dos cosas más pequeñas pero curiosas, ambas en el blog de Hugging Face. Liquid AI publica modelos abiertos llamados d1, capaces de mirar una imagen y decidir una acción, pensados para funcionar en aparatos pequeños sin conexión, como un robot o una cámara. Y Nvidia cuenta cómo ajustó una misma familia de modelos abiertos, Nemotron, para obtener resultados de nivel oro tanto en la Olimpiada Internacional de Informática como en la de Matemáticas.
Hasta aquí el día. Un modelo pequeño que cambia las cuentas de quien paga por volumen, y una pregunta de fondo que va a acompañarnos un tiempo: quién verifica al verificador.
Fuentes
- Anthropic, Introducing Claude Haiku 5.5 — https://www.anthropic.com/claude-haiku-5-5
- OpenAI, GPT-6 and Intelligent UI for everyone (RSS) — https://openai.com/index/gpt-6-for-everyone
- The Verge, ChatGPT's Intelligent UI update — https://www.theverge.com/ai-artificial-intelligence/1007276/openai-chatgpt-intelligent-ui-gpt-6
- OpenAI, Helping teens learn, plan, and shape the future of AI (RSS) — https://openai.com/index/teens-learn-and-plan
- The Verge, ChatGPT for Teens is an unacceptable risk, says Common Sense Media — https://www.theverge.com/ai-artificial-intelligence/1006355/openai-chatgpt-for-teens-common-sense-media
- TechCrunch, ChatGPT for Teens keeps teens talking, even during mental health crises — https://techcrunch.com/2026/10/07/chatgpt-for-teens-keeps-teens-talking-even-during-mental-health-crises/
- OpenAI, On the Navier–Stokes Millennium Prize Problem (RSS) — https://openai.com/index/navier-stokes-solution
- arXiv, Bastounis, Circelli y Hansen, Navier-Stokes lost in translation — https://arxiv.org/abs/2610.08144
- Hacker News, portada del 7 y 8 de octubre — https://news.ycombinator.com/
- Google, Introducing Playground — https://blog.google/innovation-and-ai/technology/ai/playground-experimental-gaming-platform/
- Financial Times, Google launches platform to create video games from text prompts — https://www.ft.com/content/0cb02773-d207-4920-8c74-d9707d2622a0
- TechCrunch, Google's new SynthID website — https://techcrunch.com/2026/10/07/googles-new-synthid-website-can-identify-ai-generated-media/
- The Verge, Microsoft is giving Copilot more control over Windows and your files — https://www.theverge.com/tech/1007113/microsoft-windows-copilot-ai-control-search-hybrid-intelligence
- The Verge, Muse launches on the iPad — https://www.theverge.com/tech/1006813/muse-ai-agent-ios-app-ipad-support
- TechCrunch, Nous Research confirms it hit 1.5B valuation — https://techcrunch.com/2026/10/07/nous-research-confirms-it-hit-1-5b-valuation-launches-ai-agents-for-business-users/
- TechCrunch, Healthleap raises 38M — https://techcrunch.com/2026/10/07/healthleap-raises-38m-for-its-ai-that-flags-hospital-patients-who-may-need-a-closer-look/
- The Verge, Google invests in a virtual cell — https://www.theverge.com/tech/1006766/google-meta-biohub-investment-virtual-cell
- Financial Times, SpaceX credit risk jumps — https://www.ft.com/content/4f2417d3-3de6-4f62-bd3a-8c8f740a4b29
- Financial Times, AI boom puts US earnings on course for third quarter of 25% growth — https://www.ft.com/content/7c38e8e3-8035-4036-8bc0-5fba2fbf77cb
- Hugging Face, Liquid AI, Multimodal open d1 decision models for the edge — https://huggingface.co/blog/LiquidAI/open-d1
- Hugging Face, Nvidia, Fine-Tuning Nemotron for IOI and IMO — https://huggingface.co/blog/nvidia/nemotron-ioi-and-imo-2026