← Volver al Blog

Estar equivocado puede ser gratis — hasta que el planificador pueda llegar

Estar equivocado puede ser gratis — hasta que el planificador pueda llegar
En este artículo

La semana pasada escribí sobre un modelo que infiere la regla que olvidaste, pero solo en una dimensión. La regla práctica con la que terminaba era que la cobertura de la frontera lo es todo: tu gate de muestreo certifica tu modelo allí donde caen tus muestras, y una regla con forma sigues teniendo que especificarla.

Eso deja una pregunta que no podía responder con los instrumentos de aquel paper. Todos esos modelos equivocados lo estaban en algún sitio al que un planificador podía llegar. ¿Qué pasa cuando la parte que el modelo se equivoca encierra algo a lo que nada puede llegar nunca? La respuesta resulta más nítida que “probablemente no pasa nada”, y en las dos direcciones: el error se vuelve demostrablemente indetectable y demostrablemente gratis — y luego una puerta de 0.1 radianes, en el sitio correcto, deshace la segunda mitad sin tocar la topología. Está escrito como preprint, An Enclosed Mode Is a Gauge Choice (arXiv:2608.28541), con el código, los artefactos de resultados y las demostraciones en Lean abiertos.

Un modo con un dentro

El instrumento es deliberadamente mínimo: un móvil con empuje y rozamiento sobre un plano, y una banda anular — radio interior 3.5, exterior 5.0 — que congela al móvil en el instante en que la toca. Dentro del agujero del anillo hay un “filón” de recompensa alta que el planificador querría visitar. La especificación que recibe el modelo de lenguaje fija la física exactamente y simplemente omite la banda, igual que antes.

La razón para usar un anillo y no otro muro es que esta es la forma que tienen de verdad las omisiones críticas para la seguridad. Vallas, recintos de contención, zonas de exclusión geovalladas: una frontera dibujada alrededor de algo, con un dentro. Y un pipeline que no distingue un vacío vallado de un peligro vallado — ni una valla de un muro macizo — certifica menos de lo que parece.

Tres knobs, todos fijados antes de cualquier ejecución: la anchura γ\gamma de un canal angular abierto en la banda (con γ=0\gamma = 0 el anillo está cerrado), si ese canal mira hacia la salida o se esconde detrás del filón, y si el móvil arranca fuera del anillo o dentro de su agujero. Todo lo que afirma el paper se deriva de lo que esos knobs le hacen a un único objeto: el conjunto de pares estado-acción que un rollout puede llegar a consultar.

closed inside unreachable facing the plan drives through hidden same gap, unreachable inside the inside is sampled
El instrumento, a escala, bajo los knobs que importan. Cerrado: el planificador se detiene en el borde y el interior es inalcanzable. Facing: la misma banda con un canal por el que sí puede conducir. Hidden: el mismo canal, la misma anchura, rotado detrás del filón — topológicamente idéntico al anterior, e inalcanzable. Inside: el móvil arranca dentro del agujero, así que el interior se muestrea y la omisión pasa a ser falsable.

Más allá del alcance, todo es gauge

La teoría en una frase. Si un gate acepta a todo candidato cuyas transiciones muestreadas coinciden, entonces la aceptación-con-certeza determina el modelo exactamente sobre el conjunto alcanzable de consultas — y todo lo que queda más allá del alcance es gauge, en el sentido del físico: una elección libre que no cambia ningún observable. Dos modelos que solo difieren ahí fuera son el mismo modelo para cualquier gate de muestreo.

En el anillo cerrado eso tiene un caso límite que cabe en la mano. El artefacto equivocado natural es un disco relleno: sin agujero, con todo el interior congelado. Se equivoca en la topología, no solo en los parámetros. Y es:

  • infalsable por cualquier gate de muestreo. No “difícil de pillar” — hay demostración, y no necesita ningún supuesto sobre tamaño de muestra ni tolerancia. Como la banda congela al móvil al contacto, ningún rollout que empiece fuera puede acabar dentro del agujero, así que ninguna transición posible distingue el disco relleno de la verdad.
  • inofensivo bit a bit al jugar. El planificador que se fía del disco relleno planifica idénticamente al que conoce la verdad: misma acción en cada paso, mismo retorno, mismo estado final, mismos contactos, semilla por semilla. Los episodios de MPC con semillas emparejadas lo confirman exactamente, no aproximadamente.
the truth the inside is free what the model wrote the whole inside frozen every sample lands on the rim · the two differ only inside it
Por qué ninguna muestra puede separarlos. Todo rollout que empieza fuera se detiene en el borde, así que las transiciones muestreadas son idénticas bajo los dos modelos; los dos solo difieren dentro del agujero, que es justo donde ningún rollout puede estar. Esto es la demostración, no un accidente del muestreo.

Así que certificación, corrección y consecuencia se separan por tres, no por dos. Este artefacto está certificado, es incorrecto y es gratis. Mis dos papers anteriores habían mostrado certificado-e-incorrecto-y-costoso, y certificado-e-incorrecto-e-infalsable; el anillo es donde “incorrecto” y “caro” se desacoplan del todo, con un teorema y no con una medida.

Dos agujeros idénticos, peligro opuesto

Esa es la mitad tranquila. Ahora abre en la banda un canal de anchura angular γ\gamma, y pon ese mismo canal en dos sitios distintos.

Mirando a la salida, por donde conduce el planificador: con γ=0.6\gamma = 0.6 el coste de juego del artefacto ciego es 0.029. Escondido detrás del filón, por donde ningún plan pasa: con la misma γ=0.6\gamma = 0.6, el mismo hueco, el mismo primer número de Betti igual a cero, es 1.116 — que es también, con cuatro decimales, lo que marca la banda completamente cerrada. Mismo agujero, misma topología, cuarenta veces el coste.

Conviene ser preciso con lo que cambia y lo que no, porque el eslogan invita a leerlo mal. Abrir el hueco cambia la topología: una banda cerrada separa el plano y una banda con hueco no. Por eso la comparación que sostiene la afirmación no es cerrado contra abierto, sino estos dos casos abiertos entre sí. Entre ellos no difiere nada topológico — misma β1\beta_1, misma banda no separadora, misma anchura — y lo único que se mueve es si el camino del propio planificador cruza el hueco.

Barrer γ\gamma enseña dónde está el interruptor. Un barrido denso del modelo ciego programado a mano — 16 episodios de MPC emparejados por punto — pone el play_cost (cuánto retorno pierde el planificador por fiarse del modelo equivocado, normalizado contra el planificador con la verdad) en 0.999 con el anillo cerrado, en 0.139 con γ=0.1\gamma = 0.1, y en prácticamente cero desde γ=0.15\gamma = 0.15. Hay un codo, y está exactamente donde el canal se hace lo bastante ancho para que quepa un paso: con γ=0.1\gamma = 0.1 el arco del hueco mide unas 0.35 unidades de mundo, comparable al propio paso del planificador. El brazo de síntesis reproduce el derrumbe con sus propios artefactos ciegos explotados, en los dos tamaños de modelo y en el relevo de Claude: 0.348 en el codo, 0.029 ya en γ=0.6\gamma = 0.6.

El canal escondido no hace nada de eso. Con γ=0.6\gamma = 0.6 el coste de juego del artefacto ciego es 1.116; con γ=1.2\gamma = 1.2 es 1.116 otra vez; con la banda completamente cerrada, 1.116 una vez más. No “parecido al” anillo cerrado: su número con cuatro decimales, porque es el mismo programa ciego frente al mismo mundo alcanzable.

1.12 0.00 0 0.1 0.2 0.6 1.2 anchura del canal γ (radianes) 0.999 0.139 0.348 1.116 banda cerrada canal escondido, misma γ: no cambia nada canal visible: el peligro se derrumba modelo ciego programado, barrido denso artefactos ciegos sintetizados
Coste de juego del modelo ciego frente a la anchura del canal, 16 episodios de MPC emparejados por punto. Las dos series se derrumban en cuanto el canal visible admite el paso del planificador: el barrido denso programado de 0.999 a 0.139 en γ = 0.1 y a ~0 más allá, y los artefactos sintetizados de 1.116 a 0.348 en el codo y 0.029 ya en γ = 0.6. Rotar ese mismo canal detrás del filón (rosa) mantiene 1.116 en γ = 0.6 y γ = 1.2 — el propio valor de la banda cerrada, con cuatro decimales.

Mismo agujero, mismo número de Betti, peligro opuesto. Lo que te dice que la propiedad que hace el trabajo no es topológica en absoluto. El peligro es topología relativa al alcance. Y el mecanismo es el cociente del gate apareciendo en el lado del juego: al abrirse el canal justo donde el planificador conduce, el fantasma deja de ser fantasma — el plan ciego (recto hacia el filón) se vuelve ejecutable en la verdad, así que el modelo ciego y la verdad coinciden a lo largo del camino operativo, que es el único camino que te puede pasar factura.

Este resultado me gusta porque mata un atajo tentador. Si estás auditando un modelo sintetizado, no puedes mirar la geometría de lo que se equivocó — ni siquiera un invariante tan robusto como “¿hay un agujero?” — y concluir nada sobre la consecuencia. Tienes que preguntar por dónde puede ir lo que planifica contra él.

¿Y si simplemente puedes rodearlo?

El anillo es un instrumento bidimensional, y en dos dimensiones una banda envolvente es un muro: si corta el camino, no entra nada. Es razonable desconfiar de eso, porque hace que “el planificador no puede llegar” parezca una propiedad del dibujo y no un hallazgo. Así que el paper corre el caso en el que rodear es posible: un toro sólido en R3\mathbb{R}^3 colocado entre la salida y el filón, que no separa el espacio en absoluto. Hay un camino explícito que lo rodea y llega al otro lado sin tocarlo nunca.

the route threads the hole costs you 0.019 it never touches the object the same torus, moved a way around, contact-free costs you 0.898 the route runs into the tube nothing here is sealed off · same object, same contact rarity 0.0033
El control tridimensional, donde rodear sí es posible. Izquierda: la ruta planificada enhebra el agujero del toro y el modelo ciego cuesta 0.019. Derecha: el mismo objeto, movido para que la ruta se meta en el tubo, y cuesta 0.898 — con la misma rareza de contacto, 0.0033, y la misma topología trivial. El camino que lo rodea sin tocarlo es la razón de que aquí nada sea reach-null, y por tanto de que el teorema de infalsabilidad no tenga sobre qué actuar.

Ahí se separan dos cosas, y es la descomposición más limpia del paper.

El gauge desaparece. Ya nada es reach-null — no hay una región que un planificador competente no pueda consultar por demostración — así que no queda infalsabilidad exacta que tener. En términos de certificación, este modo vuelve a ser meramente raro, que es donde viven los papers anteriores.

El peligro no. Lo gobierna una sola cosa: dónde cae el toro respecto al camino óptimo. Pon el agujero en el eje salida–filón, de modo que el plan lo enhebre, y el coste de juego del modelo ciego es 0.019. Mueve el tubo a ese eje, de modo que el plan lo roce, y es 0.898 — con la misma rareza (0.0033) y la misma topología trivial.

Así que el eslogan se parte en dos, y esta es la versión que yo me llevaría puesta. El peligro es relativo al camino: una omisión que está en el camino se explota, encierre algo o no. La infalsabilidad exacta es relativa a la separación: solo una frontera envolvente fabrica una región que ningún gate de muestreo podrá consultar jamás. El anillo confunde las dos porque allí la frontera envolvente y el camino bloqueado son el mismo objeto. El toro es lo que las separa.

¿Puede el bucle reparar un anillo?

La misma pregunta que la última vez, con una forma más difícil. Tres familias de modelos (GPT-5.x en dos tamaños, Qwen, Claude), el mismo bucle de sintetizar-refinar-aceptar, 903 artefactos en 39 condiciones al final.

Desde fuera del anillo, nada recupera la región. Ni un artefacto codifica la banda. Lo que escriben en su lugar son ajustes puntuales supersticiosos: un integrador más un comentario que hipotetiza una trampa diminuta y localizada, congelando por igualdad exacta de flotantes con el único estado de contacto que su muestra contenía. Uno de esos es mi ejemplar favorito de toda la serie — pasó su propio gate a 1.000, y la coordenada hardcodeada está a dos ulps de la misma trayectoria calculada con otra librería matemática. Su certificado era una propiedad del último bit de sin en la máquina que lo generó. Un gate independiente lo rechaza en cualquier plataforma.

Eso no es descuido de los modelos; es la teoría cumpliéndose. Desde fuera, la evidencia del anillo y la del disco son idénticas camino a camino — no hay observación que las separe — así que un resumen honesto de la evidencia solo puede informar del arco alcanzable.

Desde dentro del agujero, sí ponen la topología correcta y no pueden fijarla. Arranca al móvil dentro y el interior pasa a ser alcanzable, así que la omisión ya es falsable. Los artefactos ponen estructuras huecas, lazos, anillos — la forma correcta — y las tasas de aprobación del gate siguen siendo esencialmente cero, porque los radios de la banda no son números redondos y el gate quiere 10910^{-9}. La única recuperación certificada de veinte usó la única forma cuyo único parámetro libre está anclado en la especificación de la recompensa: el complemento de un disco cuyo radio es el del propio filón. El mejor reparador de otra familia escribió exactamente la misma forma.

La auditoría held-out es la parte que yo querría ver en el paper de otro. Al re-puntuar cada artefacto sobre un bloque de gate disjunto: la aceptación coincide con “la muestra de ese gate independiente también se perdió la banda” en 156 de 156 casos — una identidad exacta, artefacto a artefacto, cero fuera de la diagonal. Y de 214 aprobaciones en muestra, 121 fallan un gate independiente, y todas y cada una fallan en un contacto con la banda. Aprobar en muestra es consistencia con el conjunto de entrenamiento, y lo que omite es exactamente el modo.

El sensor que guía el bucle tiene un límite de resolución

Para darle a la reparación su mejor oportunidad, alimenté cada intento con un resumen topológico honesto de su propia evidencia — número de clústeres, caja envolvente, y una estimación por homología persistente β^1\hat\beta_1 de cuántos agujeros tiene la nube de contactos. Redacción congelada antes de cualquier ejecución, sin nombrar nunca una familia de formas.

Un resumen así es un sensor, y los sensores tienen resolución. Este informa β^1=1\hat\beta_1 = 1 — un lazo cerrado — para todo canal más estrecho que unas dos unidades de arco, aunque el β1\beta_1 verdadero es 0 para todo γ>0\gamma > 0: un anillo con un hueco no es un lazo. El cambio ocurre alrededor de γ=1.8\gamma = 1.8.

Ese límite es geométrico y no presupuestario, y el paper demuestra la versión de dos lados: por debajo de una escala fijada por el mayor hueco angular de la muestra, el hueco es invisible para el detector, y por encima de otra escala explícita el lazo no puede sobrevivir. Un factorial sobre el presupuesto de puntos del detector (30, 90, 270) y la dosis de evidencia (40 y 160 rollouts) no mueve el cambio en absoluto.

Peor: en la frontera, más evidencia lo vuelve más seguro de la topología equivocada. Cuadruplica la dosis y la tasa de lazo falso sube de 1 de 5 semillas a 3 de 5, porque la muestra más densa rellena las capas adyacentes al canal y la persistencia de la barra espuria crece de 0.05 a 0.50 mientras el umbral del propio detector crece solo modestamente. Resolver un canal estrecho pide otra filtración, no una muestra mayor.

Y la topología que ponen los artefactos sigue al resumen, no a la verdad: las estructuras cerradas dominan donde el resumen dice “lazo cerrado” y casi desaparecen donde dice honestamente “arco” — 1 cerrada frente a 26 con forma de arco en γ=2.4\gamma = 2.4.

Ahora la parte que tengo que reportar contra mí mismo. Ese cruce es entre huecos distintos: el entorno y el resumen cambian juntos, así que no aísla la afirmación del resumen como la causa. Por eso pre-registré una intervención — diseño, script de análisis y regla de decisión comprometidos antes de que existiera ningún resultado — que voltea solo la línea de la afirmación: las mismas 60 semillas, evidencia idéntica bit a bit, cada otro byte del prompt fijo, la línea de β^1\hat\beta_1 y su única frase interpretativa negadas, puntuado contra un control honesto generado de nuevo.

Resultado: de 11 pares discordantes, 9 se movieron en la dirección que predecía la afirmación y 2 en contra. Binomial exacta a dos colas p=0.065p = 0.065, con el intervalo registrado sobre el efecto conteniendo un medio. Consistente en dirección, y por debajo del nivel al que me había comprometido. Así que el paper reporta la asociación y se niega a la frase causal, y el pre-registro es lo que hace que esa negativa no me cueste nada escribirla.

La mitigación tiene que igualar la dimensión y la dirección

La defensa del paper companion contra este modo de fallo era una valla de desconfianza: cuando la predicción del modelo se contradice en algún estado, marca una bola a su alrededor y haz que el planificador trate como poco fiables los caminos imaginados que la cruzan. En el instrumento del parche, funcionaba.

En el anillo, a su radio calibrado, no hace absolutamente nada — y la razón es un argumento de conteo, no un detalle de implementación. Una valla puntual es un objeto de dimensión cero; la frontera alcanzable del anillo es una curva de dimensión uno de unas 16 unidades de mundo. Sellar una curva con bolas de radio ε\varepsilon requiere tantas como diga el número de recubrimiento, longitud de frontera entre radio de valla, y el planificador concede entre dos y cuatro contactos por episodio mientras se redirige por el arco sin vallar.

point fences it re-routes through an unfenced arc dimension-matched no unfenced arc left to use sealing a curve with balls costs boundary length / fence radius
El argumento de recubrimiento, dibujado. La banda se ve tenue porque el planificador no la ve — solo ve las vallas que le han dado. Las vallas puntuales dejan arcos sin cubrir y el camino imaginado se redirige por uno de ellos; una valla construida a lo largo de la dimensión de la propia frontera no deja ninguno, y por eso funciona tras dos lecciones en vez de nunca.
Defensacoste de juegoPor qué
Vallas puntuales, radio calibrado0.999 → 1.003recubrimiento 0-dimensional de una frontera 1-dimensional
Vallas puntuales, radio 4×0.999 → 0.742alivio parcial cuando las bolas alcanzan la escala de la geometría
Valla de dimensión igualada, por episodio0.999 → 0.957forma correcta, olvidada cada episodio
Dimensión igualada, persistida0.999 → 0.058dos lecciones en total, retornos iguales a la verdad desde el episodio 2
Cualquier valla, modo inventado1.769 → 1.769salta 18.6 veces por episodio y no cambia nada
Parche de libertad, modo inventado1.769 → 0.029el certificado dual: descongelar donde el modelo era demasiado pesimista

Las dos últimas filas son las que no vi venir. Apunta la misma maquinaria al error opuesto — un modelo que alucina un obstáculo donde el mundo está vacío, que cuesta más que el caso de la libertad fantasma, 1.769 — y toda variante de desconfianza es inerte por construcción: salta constantemente, porque al modelo se le contradice en todas partes, y no tiene nada que ofrecer, porque la desconfianza no puede fabricar la libertad que el planificador necesita. La defensa que funciona es la dual: marcar los estados donde el modelo quedó refutado por demasiado pesimista y dejar que la imaginación corra libre ahí. Eso lo derrumba de golpe.

Dos formas de estar equivocado, defensas opuestas, y el coste de cada defensa lo fija con qué frecuencia le miente su fallo. Una obstrucción falsa se refuta a sí misma en cada paso, así que un episodio le enseña al planificador todo. Una libertad falsa se refuta solo en la frontera rara, así que hay que pagar la cobertura. La misma geometría que el resto del paper, vista desde el lado del planificador.

En n dimensiones los dos knobs se saturan

Una extensión, porque separa dos cosas que parecen una. Sustituye el anillo por una cáscara envolvente en nn dimensiones y barre nn.

La rareza del contacto se derrumba geométricamente — un factor medido de 0.411 por dimensión, con la tasa exponencial demostrada para una interfaz de acción isótropa y una cota explícita para la del propio instrumento. Ese factor sale de un barrido de 10.000 rollouts del evento del cono, porque la calibración más barata se queda sin resolución antes: los contactos caen a 1 de cada 600 rollouts ya en n=4n = 4, y a partir de ahí 600 rollouts no distinguen las celdas (0 de 600 en n=5n = 5, otra vez 1 de 600 en n=6n = 6). En cualquier caso la mis-síntesis se vuelve casi segura: la muestra del gate casi nunca contiene lo que la especificación omitió.

Mientras tanto el peligro no decae nada. Un planificador competente con interfaz de acción vectorial es explotado a play_cost ≈ 1.0 en todo n6n \le 6: conduce recto hacia el filón y se queda clavado. La rareza vive en el eje de la síntesis, la alcanzabilidad en el del juego, y son knobs independientes. Un modo encerrado en dimensión alta satura los dos — la omisión es casi segura y, cuando ocurre, plenamente explotable.

(Una nota de método que me costó un día: el mismo barrido con el conjunto de candidatos del planificador escalar mide peligro cero en todo nn, y eso es una propiedad del planificador, no de la geometría. A sus candidatos les faltan las secuencias axiales que conducen recto hacia la cáscara. La competencia es una propiedad de la interfaz de acción, y una debilidad incidental del planificador puede esconder un modelo plenamente explotable.)

Qué me llevo de esto

Un gate de muestreo certifica la restricción alcanzable de tu modelo y nada más. Esa es la serie entera en una frase, y el anillo es donde deja de ser un eslogan: más allá del alcance, el contenido del modelo es una elección libre que ningún test puede fijar y que ningún planificador te puede facturar — un gauge, y el artefacto de topología equivocada que lo aprovecha es a la vez indetectable e inofensivo, por teorema.

Lo que invierte la pregunta que deberías estar haciendo. No “¿es correcto el modelo?” sino “¿el sitio donde se equivoca corta el alcance operativo de lo que planifica contra él?” Tres consecuencias que me llevaría a un sistema real:

  • Alcance, no forma — y camino antes que separación. La geometría e incluso la topología de una omisión no te dicen nada sobre la consecuencia por sí solas. El mismo agujero, movido de delante del objetivo a detrás, pasó de inofensivo a plenamente explotado sin cambiar un solo invariante. El toro lo afina en dos preguntas que conviene hacerse por separado: ¿la cruza algún plan? decide el coste, y ¿encierra algo? decide si algún test habría podido pillarlo. Una auditoría que clasifique los errores por tipo, y no por esas dos, está midiendo lo que no importa.
  • Tu resumen de la evidencia es un sensor con resolución. Si algo en el bucle — un monitor, un informe, un paso de recuperación, un resumen topológico o estadístico — decide qué forma tiene la evidencia, su punto ciego se propaga a lo que queda certificado. El nuestro informa de un lazo cerrado para todo hueco más estrecho que dos unidades de arco, y los artefactos siguen al informe. Más datos lo empeoraron, no lo mejoraron.
  • Las vallas pagan dimensión y dirección. Una defensa hecha de puntos no puede sellar una curva, y una defensa hecha de desconfianza no puede reparar el exceso de pesimismo. Iguala la dimensión de la frontera, persiste lo aprendido entre episodios, y ten claro contra cuál de los dos errores te defiendes — necesitan certificados opuestos.

Si quieres la versión formal — el cociente del gate, el teorema de infalsable-e-inofensivo, el sándwich de resolución de dos lados, la tasa en nn dimensiones, y qué partes están verificadas por máquina en Lean — está en el preprint, y el código y todos los artefactos de resultados están abiertos.


Preprint: “An Enclosed Mode Is a Gauge Choice” (arXiv:2608.28541) · código. Papers companion: An Omitted Mode Is a Rare Rule y el post sobre él — Un LLM puede inferir la regla que olvidaste — y When a Verified World Model Still Loses.