← Volver al Blog

Un LLM puede inferir la regla que olvidaste — en una dimensión

Un LLM puede inferir la regla que olvidaste — en una dimensión

Hace unas semanas escribí sobre un modelo del mundo que pasa todos los tests y aun así pierde. De aquel trabajo, la conclusión de la que estaba más seguro era la mitad pesimista: los LLM hacen traducción de reglas, no inferencia de reglas. Codifican fielmente las reglas que les cuentas, y no infieren de forma fiable las que solo les enseñas. Lo intenté a conciencia — DAgger en condiciones, estados cosechados de la propia distribución, dos tamaños de modelo — y el modelo siguió ciego a la regla.

Esa conclusión era correcta para el escenario en el que la medí, y he pasado unas semanas más averiguando dónde deja de serlo. La versión corta: pasa de juegos de tablero a control continuo y un modelo actual infiere la regla omitida a partir de un puñado de ejemplos — de forma fiable, exacta, escribiendo la regla global verdadera en lugar de un ajuste de curva. Después dale a esa misma regla una dimensión más y la capacidad entera desaparece, a través de todas las intervenciones que supe diseñar en su contra. Está escrito como preprint, An Omitted Mode Is a Rare Rule (arXiv:2608.17956), con el código y los artefactos de resultados abiertos.

De los juegos de tablero a un carro con un muro

La razón para rehacer esto en control continuo es que la literatura de ese campo discrepa con la forma de mi resultado. El RL basado en modelos trata el error del modelo del mundo como omnipresente y acumulativo — un poco mal en todas partes, y peor según avanzas. Mi resultado discreto era lo contrario: error localizado y decisivo, exactamente cero en casi todo el espacio y catastrófico en un conjunto fino. Si esa geometría no sobrevive al salto a espacios de estados continuos, es una rareza de los juegos de tablero.

Así que: un carro sobre una vía, mesetas de recompensa sigmoides en ambos extremos, y un muro en alguna posición que detiene el carro en seco. Un planificador hace MPC de disparo aleatorio contra un modelo de la física sintetizado en Python. La especificación que recibe el LLM fija el integrador exactamente y simplemente omite la cláusula del muro. El gate es la misma idea que antes: sintetizar, refinar contra 40 rollouts muestreados, aceptar cuando cada transición coincide hasta 10910^{-9}.

Cuando la muestra de entrenamiento no contiene ningún contacto con el muro, el resultado es el titular del paper discreto reproducido en física, de punta a punta: el artefacto pasa el gate a 1.000, es exacto en todo lo que no sea el muro, está completamente ciego a él en las sondas, y el planificador que se fía conduce hacia la región fantasma, se queda clavado en el muro en todos los episodios, y replanifica el mismo plan condenado en cada paso durante el episodio entero — un retorno de unos 0.02 frente a los 17.77 del planificador con la verdad. Las 20 semillas de ese caso, en dos tamaños de modelo sobre bloques de muestra disjuntos, hicieron exactamente eso.

La frecuencia con la que ocurre eso tampoco es un misterio. Si un evento crítico tiene probabilidad rr bajo la ley de muestreo del gate y el gate saca NN rollouts, la probabilidad de que los NN lo pierdan es exactamente (1r)N(1-r)^N — sin asintóticas, sin más supuestos que rollouts i.i.d. En el knob principal r=0.0114r = 0.0114, así que (1r)40=0.63(1-r)^{40} = 0.63; medido, 20 de 40 muestras independientes se perdieron el muro. El factor interesante del peligro es el que se calcula en forma cerrada.

Esta vez, el modelo repara la regla

Aquí es donde se rompe mi conclusión anterior. Cuando el muro aparece en la muestra de entrenamiento — a menudo con un puñado de transiciones de contacto — GPT-5.x no se queda ciego ni ajusta una curva. Lee las transiciones que fallan y escribe la regla global verdadera:

if x2 >= 8.0:
    return [8.0, 0.0]

No un parche local alrededor de los contactos observados. La regla, con la constante correcta, válida en todas partes.

En los dos instrumentos unidimensionales (el tope de posición del carro y el tope angular de un péndulo) lo hizo en 105 de 111 tiradas de síntesis con el modo presente. Esas tiradas comparten bloques de rollouts muestreados, así que la unidad honesta es el bloque y no la tirada: todos los intentos fueron exactos en 50 de 56 bloques instrumento–stream, con un intervalo exacto al 95% de [0.781, 0.960]. De las seis que fallaron, el gate cazó dos — parches locales supersticiosos ajustados a los contactos observados, que rechazó.

Eso es una reversión genuina del residuo de “traducción, no inferencia”, y conviene decirlo claro en vez de enterrarlo: una discontinuidad manifestada numéricamente se aprende de los datos de una forma en que una regla simbólica de juego no lo hacía. Un muro se anuncia solo. Cuatro filas de 3.200 inclinan un ajuste lineal doce órdenes de magnitud; el LLM, en cambio, nombra la discontinuidad y la escribe.

Entonces hice la regla bidimensional

La pregunta obvia es si esa capacidad va de dimensión o de discontinuidad. Así que construí el instrumento que las separa: un móvil sobre un plano, dos regiones circulares pintadas en él, y una regla que lo congela en cuanto entra en una. Mismo pipeline, mismo gate, misma tolerancia, mismos modelos.

Lo que cambia es la forma de la regla, no la dificultad de la física. El muro era un número — un umbral sobre una sola coordenada. Un disco son tres: dos del centro y uno del radio. (El estado del móvil tiene cuatro componentes, posición y velocidad en cada eje, pero aquí nada depende de eso. Lo que importa es que la frontera es ahora una curva en el plano en vez de un punto en una recta.)

La reparación no sobrevive al cambio.

0%50%100% Regla 1D (muro, tope) 105 / 111 tiradas Regla 2D (disco, cuadrado) 0 / 156 tiradas
El mismo pipeline, los mismos modelos, el mismo gate. En reglas duras unidimensionales el sintetizador recupera la regla verdadera desde unas pocas transiciones de contacto; en regiones bidimensionales no la recupera en ninguna de las 156 tiradas con el modo presente, repartidas sobre 20 muestras de gate distintas.

Un cero es un número que merece desconfianza, así que: esas 156 tiradas se apoyan en 20 bloques de rollouts distintos, lo que acota la probabilidad de reparación por bloque en 0.168 con un 95% de confianza. No es “nunca” — es “ni una vez en la evidencia que tengo, y la evidencia es lo bastante ancha como para que eso signifique algo”.

Lo que los artefactos escriben en su lugar es la parte interesante. El fallo dominante es la reducción dimensional: el disco se convierte en un semiplano en la posición correcta y con la forma equivocada — un umbral 1D, justo lo que funcionaba en el carro, aplicado a una regla que no lo es. Otros ajustan la envolvente convexa de las posiciones de congelación que observaron, o inventan una zona alrededor de las balizas de recompensa. Ni uno solo de los 76 artefactos que vieron un parche codificó el parche que vio.

Ocho intervenciones, y qué sobrevive a ellas

Llegado ahí, lo honesto es atacar tu propia explicación. Si es la curvatura, los bordes rectos deberían arreglarlo. Si es el prompt, un prompt mejor debería arreglarlo. Así que lancé ocho intervenciones, cada una apuntando a una causa candidata, informando de lo que cada una cambiaba más allá de su objetivo.

IntervenciónReparadoQué descarta
Prompt centrado en la región, 3× presupuesto0/40el prompting y el presupuesto probados
Cuadrado alineado a los ejes, bordes rectos0/40la curvatura del borde
Una segunda familia de modelos0/3la idiosincrasia de una familia
Una banda en una sola coordenada0/40nada — objetivo no identificable
Nombrar la variable que lee el disparador0/40la ambigüedad de variable
El móvil se para dentro de la región0/40que el interior sea inobservable
El móvil se proyecta sobre el borde0/40lo mismo, con evidencia igualada
Mayor cobertura angular de los contactos0/40la cobertura de la evidencia

Cada fila es una campaña completa sobre los mismos 20 bloques muestreados. Ninguna restaura la reparación. La cuarta se registra en vez de contarse: en ese instrumento el objetivo es demostrablemente no identificable, así que un cero ahí no significa nada.

Dos de ellas merecen una frase. El cuadrado era el que esperaba que funcionase — si el modelo sabe escribir x2 >= 8.0, una caja son cuatro de esos. Falló como una imagen especular del disco: los artefactos escribieron discos sobre evidencia cuadrada. Y la del interior apuntaba a un teorema del paper: como el parche congela al móvil en su posición anterior, ningún rollout ocupa nunca el interior de la región, así que una muestra solo puede atestiguar entradas. Esa censura es real, y yo estaba bastante convencido de que era la causa. Dos campañas la levantaron — una de ellas aportando once veces más evidencia del modo — y la reparación siguió en cero. Equivocarte sobre tu propio mecanismo es la parte del proceso que de verdad lo mueve.

Qué falta realmente: una regla localizada

Las intervenciones son todas negativos, y un negativo solo vale lo que valga la garantía de que su objetivo era aprendible. Así que, dos controles positivos.

Desde fuera del pipeline: un ajuste algebraico de circunferencia por mínimos cuadrados — tres líneas de álgebra lineal, sin prior y sin modelo de lenguaje — sobre exactamente la evidencia que recibió el sintetizador. Recupera centro y radio con un margen de una décima en 12 de 20 muestras. Y como el instrumento permite ensanchar la apertura angular de los contactos manteniendo fijo su número, puedo dosificar la evidencia hasta que ese ajuste acierte en todas y cada una de las muestras.

20/20 0/20 111° 129° 185° cobertura angular de la evidencia de contacto 20 12 16 0 tres líneas de mínimos cuadrados el sintetizador
Manteniendo fijo el número de contactos y ensanchando solo su apertura angular. El estimador trivial mejora hasta recuperar la región en todas las muestras; el sintetizador no la recupera en ninguna, en todas las dosis. El fallo no responde a la evidencia en absoluto.

Desde dentro del pipeline: sustituir la cláusula que falta por una parcial que enuncia la forma y el efecto de la regla pero retiene las constantes. Dos niveles, y se separan por completo:

  • Dada la forma de la región y sus centros, reteniendo solo el radio — un único número desconocido — el sintetizador lo infiere exactamente en 20 de 20 semillas, coincidiendo con la verdad con IoU 1.000 en todos los puntos de la rejilla de sondeo. Un artefacto incluso comenta “radio inferido de las transiciones proporcionadas”.
  • Dada la forma sola, reteniendo los centros: 0 de 20.

Junto todo, eso sitúa el fallo con precisión, y es más estrecho y más raro que “2D es más difícil”. No es la evidencia — tres líneas de álgebra lineal recuperan la región de la misma muestra. No es incapacidad de ajustar constantes — dada la localización, clava el radio con precisión de coma flotante. No es representacional — si le cuentas la regla, todas las variantes escriben el disco a gate 1.000 en cero iteraciones de refinamiento. Lo que el sintetizador no hace es inducir una regla localizada: la forma sola no lo rescata, la forma más su localización sí. Cuando el gate rechaza la plantilla, memoriza los contactos en lugar de ajustarlos.

Y esto tampoco es una historia de código contra redes neuronales. Ejecuté el baseline aprendido más favorable que supe construir — la física verdadera fijada, aprendiendo solo la función de evento. En el carro iguala al código exactamente: recupera el umbral en 8.0 a partir de cuatro contactos, es exacto en coma flotante sobre 3.200 transiciones held-out, y pasa el mismo gate de 10910^{-9}. En el instrumento 2D recupera el parche cercano en 12 de 20 bloques y ambos parches en ninguno. El muro es fácil para todo; el círculo es difícil para todo lo que tenga que encontrarlo a partir de datos.

Verificado, y equivocado de una forma nueva

Un resultado más, porque es el que me cambió la forma de leer un gate que pasa. Entre las reparaciones 1D, cuatro artefactos escribieron el tope correcto y un segundo tope inventado en el lado contrario — en un ángulo que sus propios rollouts de entrenamiento nunca alcanzan. Sus muestras no pueden refutar la invención, así que el gate los acepta a 1.000. Volví a puntuar los 1.034 artefactos versionados contra muestras de aceptación nuevas y disjuntas: un gate independiente cazó uno de esos cuatro, por suerte del sorteo. A los otros tres los condena una rejilla densa, no un rollout.

Esa es la tesis entera en miniatura, y lleva un teorema pegado. Como el modo congela al móvil, existe una clase completa de reglas equivocadas que coinciden con la verdad en todas las transiciones de todos los rollouts posibles — irrefutables a cualquier tamaño de muestra y cualquier tolerancia. En un instrumento el modelo grande escribe de forma fiable exactamente una regla así: diecinueve de sus veinte artefactos pasan el gate, un gate independiente y la propia sonda del paper, sin codificar la región en absoluto. El consuelo es que el mismo argumento los vuelve inofensivos: un modelo que solo se equivoca donde ningún planificador puede llegar no cuesta nada al jugar.

Lo que me llevo de esto

La verificación por muestreo certifica tu modelo donde caen tus muestras. Ese era el punto del paper anterior, y sobrevive intacto al salto a control continuo — incluido el factor en forma cerrada de cuántas veces la muestra se pierde lo que importa.

Lo nuevo es la historia de la reparación, y es más estrecha de lo que yo habría supuesto en ambas direcciones. Un sintetizador capaz recupera una regla que le han enseñado, de forma exacta y global, cuando esa regla es un umbral en una variable. No recupera el mismo tipo de regla cuando encontrarla implica localizar una región, y no mejora con un prompt más fuerte, más presupuesto, geometría más plana ni más evidencia — probé las cuatro. Así que la regla práctica que daría es una cláusula más afilada que la del año pasado: la cobertura de la frontera lo es todo, y “ya lo deducirá de los datos” es una apuesta que solo puedes hacer en una dimensión. Todo lo que tenga forma, sigues teniendo que especificarlo.

Si quieres la versión formal — la ley exacta de fallo del gate, el presupuesto de volumen que separa los programas de los modelos Lipschitz, y el teorema de irrefutabilidad — está en el preprint, y el código y todos los artefactos de resultados son abiertos.


Preprint: “An Omitted Mode Is a Rare Rule” (arXiv:2608.17956) · código. Paper companion: When a Verified World Model Still Loses, y el post sobre él — Un modelo del mundo puede pasar todos los tests y aun así perder.