Blog
IA Aplicada2026-09-14· 6 min de lectura

«Tus datos mejoran el modelo». ¿Y eso qué significa exactamente?

Hace unos días OpenAI anunció que sus agentes habían resuelto uno de los problemas matemáticos más difíciles del mundo: el de la existencia y suavidad de las ecuaciones de Navier-Stokes, uno de los siete Problemas del Milenio, con un premio de un millón de dólares desde el año 2000.

Puede que te suene a ciencia ficción lejana, y en parte lo es. Pero hay una pelea dentro de esa historia que te toca de lleno, aunque nunca te haya interesado una ecuación diferencial en tu vida. Y es la pelea por los datos.

Qué anunció OpenAI

Según lo que han contado, un grupo de agentes, usando un modelo interno «significativamente más capaz» que GPT-6 Astra, llegó a una resolución en unas 88 horas. En total, en todos los problemas que intentaron, los agentes enviaron 4,9 millones de mensajes y gastaron unos 300.000 millones de tokens de salida. Solo en Navier-Stokes, 2,7 millones de mensajes y unos 130.000 millones de tokens.

Son números de otro planeta. Pero no es ahí donde está la historia que te importa.

La parte que te importa: dos matemáticos, y una pregunta sin respuesta

Tristan Buckmaster, profesor de matemáticas en la Universidad de Nueva York, cuenta que él y Levent Alpöge —un matemático que trabaja en Anthropic— llevaban casi un año trabajando en ese mismo problema. Usaban Claude y Codex, el modelo de OpenAI, sobre todo GPT-5.6 Sol. Y el 15 de agosto tuvieron un avance.

El rumor matemático se movió, y Buckmaster y Alpöge se enteraron de que OpenAI tenía un equipo trabajando en un problema relacionado, con un enfoque parecido. Así que les preguntaron. Y aquí está la conversación que lo cambia todo, en palabras de Buckmaster:

Pregunté cuándo se había enviado el primer prompt por su parte. No me lo respondieron directamente durante un tiempo. Al final se acordó que se había enviado en los últimos días, después de que la información sobre nuestro trabajo llegara a OpenAI.

Pregunté si el modelo se había entrenado con, o tenía acceso a, nuestras sesiones en Codex, donde habíamos estado poniendo todos nuestros borradores durante todo el proyecto. Me dijeron que el modelo no miró los datos de usuario. Volví a preguntar, sobre el entrenamiento, y no obtuve respuesta.

Fíjate en el detalle. La primera pregunta, sobre cuándo empezaron, tuvo respuesta. La segunda, sobre si habían visto sus sesiones, la primera respuesta fue «no miró datos de usuario». La pregunta de vuelta, la del entrenamiento, se quedó sin responder.

Y hay más. A Alpöge no lo invitaron como coautor del resultado, por la relación competitiva de OpenAI con su empleador, Anthropic.

Lo que dice Simon Willison

Willison lo lee así: OpenAI oyó que se habían resuelto problemas del Milenio usando modelos de lenguaje, y lo vio como una oportunidad para demostrar el poder de su último modelo, sin pensar demasiado en la óptica de adelantarse a un equipo que llevaba un año usando los propios modelos de OpenAI.

Y saca una conclusión que es la que te dejo, porque es la que te sirve:

El solo rumor de un bug es suficiente para encontrar un exploit de seguridad hoy en día... ¿es lo mismo ahora en matemáticas? Basta saber que existe una solución sin publicar para que se dispare un gasto de millones de dólares en LLMs para llegar primero.

Y luego, la pregunta que Willison lleva años haciéndose, y que ahora tiene un ejemplo concreto delante:

Si uso ChatGPT para ayudarme a resolver parcialmente un problema del Milenio, ¿cuáles son las probabilidades de que mi trabajo influya en el entrenamiento de modo que un modelo posterior...?

La pregunta para ti

Yo no trabajo en un problema del Milenio. Pero sí trabajo con empresas que tienen datos que no quieren que se vayan a ninguna parte: información de clientes, de pacientes, de pedidos, de stock, de negocio. Datos que, si se van, ya no vuelven.

Y la pregunta es la misma, solo que más pequeña y más real:

Cuando un laboratorio dice que tus datos «se usan para mejorar el rendimiento del modelo», ¿qué significa exactamente?

Willison lo pone en términos de negocio, y es la mejor forma de decirlo: si un día piensas en voz alta con un chat sobre una dirección nueva para tu empresa, ¿qué probabilidad hay de que dentro de seis meses un competidor pregunte «¿qué podría estar planeando la empresa X?» y se entere?

No es que yo sepa la respuesta. Es que ni siquiera el propio laboratorio la aclara, como se vio en esta historia. Y si ni ellos lo aclaran, ¿cómo lo vas a saber tú?

Cómo lo trato yo

Aquí es donde esto deja de ser una opinión y se convierte en una decisión de cómo se construye. Y por eso lo cuento.

Cuando hacemos software con IA para una empresa, hay una regla que no negociamos: la IA propone y la persona valida antes de que se toque nada. Ninguna acción se aplica sola. La IA consulta, redacta y sugiere, y alguien decide. No es por miedo, es que es la única forma de que un sistema de este tipo sea usable de verdad en un negocio.

Y hay una segunda regla, la del dato: la IA trabaja sobre los datos reales de la empresa, no sobre una copia de ayer, y cuanto menos salgan esos datos de casa, mejor. Eso no se resuelve con una promesa en la web, se resuelve tomando decisiones: dónde vive el dato, quién lo puede ver, si va cifrado y qué parte del proceso necesita salir a un servicio de fuera.

Porque la diferencia importante no es entre «IA buena» e «IA mala». Es entre una IA que solo contesta y una IA que trabaja con tus datos. Y si trabaja con tus datos, esos datos van a donde la IA esté. Ahí es donde tienes que elegir bien.

El consejo corto

Antes de meter tus datos en cualquier IA, pregunta tres cosas, y no aceptes una respuesta vaga:

  1. ¿Dónde se procesan mis datos? ¿En tu servidor, en la nube, en la de quién?
  2. ¿Se usan para entrenar el modelo? Y aquí, no aceptes un «no miramos datos de usuario». Pregunta por el entrenamiento.
  3. ¿Puedo borrarlos? Y si la respuesta es «depende», eso ya es una respuesta.

Porque en esta historia, la pregunta del entrenamiento se quedó sin responder. Y eso, para quien tiene datos que importan, es la única respuesta que necesitas.

¿Quieres que hablemos de dónde poner la IA cuando toca datos sensibles? Podemos revisar tu caso. [DATO: confirmar si esto es servicio ofrecido, con qué alcance y si lleva precio — si no, se quita la frase antes de publicar.]


Fuentes:

Compartir este artículo