Research · Generative Specification v5.0Investigación · Generative Specification v5.0

What the research establishedLo que estableció la investigación

Generative Specification is a method, not a slogan. These are the load-bearing findings from the v5.0 research cycle — each one measured, each one bounded by what we can honestly claim. Generative Specification es un método, no un eslogan. Estos son los hallazgos que cargan peso del ciclo de investigación v5.0 — cada uno medido, cada uno acotado por lo que podemos afirmar con honestidad.

Kidlin's Law, taken to the limit: write the problem down completely and you have already written the program. The code is only the residue the machine regenerates.La ley de Kidlin, llevada al límite: escribí el problema por completo y ya escribiste el programa. El código es solo el residuo que la máquina regenera.

The complete specification is the program; the code is regenerable residue.La spec completa es el programa; el código es residuo regenerable.

The inversionLa inversión

Intent-based programmingProgramación por intención

GS is declarative — but the declaration sits far above the usual level. You do not declare what the data looks like; you declare the intent and the constraints, and the executor derives the implementation. We call the aim maximum declarativity: declare the whole intent, let the machine derive the rest.GS es declarativo — pero la declaración está muy por encima del nivel habitual. No declarás cómo se ven los datos; declarás la intención y las restricciones, y el ejecutor deriva la implementación. Al objetivo lo llamamos máxima declaratividad: declarás la intención completa, la máquina deriva el resto.

The mechanismEl mecanismo

The funnel of restrictionEl embudo de la restricción

A model can generate any of a vast space of programs. Every constraint you add to the spec narrows that space — and a spec that is complete has narrowed it to the correct programs. Restriction is not bureaucracy; it is how you make correctness the only thing left to generate. This is the pragmatic core: the disciplines are the walls, and the walls are correctness.Un modelo puede generar cualquiera de un espacio enorme de programas. Cada restricción que agregás a la spec angosta ese espacio — y una spec completa lo angostó hasta los programas correctos. La restricción no es burocracia; es cómo hacés que la correctitud sea lo único que queda por generar. Este es el núcleo pragmático: las disciplinas son las paredes, y las paredes son la correctitud.

The bridge, restoredEl puente, restaurado

Ordered code is the constructive dual of the rubricEl código ordenado es el dual constructivo de la rúbrica

Building the bridge — ordering a codebase through the disciplines — naturally produces code that satisfies the seven properties. The disciplines are the constructive route; the properties are the evaluative description of the same order. Frontier models did not retire the bridge; they relocated it. Order still decides whether the machine can read, and it still shows up in what the rubric measures.Construir el puente — ordenar un código por medio de las disciplinas — produce naturalmente código que cumple las siete propiedades. Las disciplinas son la ruta constructiva; las propiedades son la descripción evaluativa del mismo orden. Los modelos frontier no retiraron el puente; lo reubicaron. El orden sigue decidiendo si la máquina puede leer, y sigue apareciendo en lo que mide la rúbrica.

Two leversDos palancas

Navigation and bounding are different problemsNavegar y acotar son problemas distintos

Chaos costs the machine in two independent ways. Navigation — finding the right slice — is fixed by the sentinel (a map both a clean and a messy codebase can carry). Bounding — the sheer inflated surface of duplicated and dead code — is not fixed by any map; only refactoring removes it. In our controlled twin study, giving both codebases the same map still left a structural residual on the inflated one: it took more tokens and more edits to make the same change. Layering alone does not make reading cheaper; de-inflating does.El caos le cuesta a la máquina de dos formas independientes. Navegar — encontrar la porción correcta — lo resuelve el sentinela (un mapa que tanto un código limpio como uno desordenado pueden llevar). Acotar — la superficie inflada de código duplicado y muerto — no lo resuelve ningún mapa; solo el refactor la quita. En nuestro estudio de gemelos controlado, darles a ambos el mismo mapa igual dejó un residuo estructural en el inflado: costó más tokens y más ediciones hacer el mismo cambio. Poner capas no abarata la lectura; desinflar sí.

The novel claimLa afirmación novedosa

Scaffolding is capacity-relativeEl andamiaje es relativo a la capacidad

The advantage of a disciplined spec is not constant. It grows as the model gets weaker. A frontier model can partly compensate for chaos; a smaller or local model cannot. The spec is the scaffolding that lets a weaker executor still land the correct program — which is exactly where cost lives in practice. This is the axis our cross-vendor flagship (AX2) is being built to measure directly.La ventaja de una spec disciplinada no es constante. Crece a medida que el modelo se debilita. Un modelo frontier puede compensar en parte el caos; uno más chico o local no. La spec es el andamiaje que le permite a un ejecutor más débil igual aterrizar el programa correcto — que es justo donde vive el costo en la práctica. Este es el eje que nuestro estudio insignia cross-vendor (AX2) se está construyendo para medir directamente.

On the numbers — honestlySobre los números — con honestidad

What we will and will not claimQué afirmamos y qué no

We report objective, tool-computed metrics: mutation score, real branch coverage, cyclomatic complexity, duplication and dead-code percentages, type health, security audit. We do not headline a single blanket "token reduction" figure — cost depends on model, task, and codebase, and an honest number is cost per accepted, correct output, not a percentage on a slide. Every conceded limit is reported next to its result.Reportamos métricas objetivas, calculadas por herramientas: mutation score, cobertura de ramas real, complejidad ciclomática, porcentajes de duplicación y código muerto, salud de tipos, auditoría de seguridad. No encabezamos con una única cifra general de "reducción de tokens" — el costo depende del modelo, la tarea y el código, y el número honesto es costo por salida aceptada y correcta, no un porcentaje en un slide. Cada límite admitido se reporta al lado de su resultado.