Vergara Agentic Autonomy Scale (VAAS) · v1.0 · 11 de agosto de 2026
Una escala operativa y acotada por riesgo para agentes de IA que actúan sobre sistemas de negocio. Hoy «agente autónomo» no significa nada medible: un producto que redacta un borrador y otro que presenta un documento fiscal sin revisión se venden con el mismo adjetivo. Esta escala convierte la autonomía en un nivel: enunciable, exigible en código y comprobable por el cliente.
- Definición canónica: https://fernandovergara.com/escala-vergara/
- Paper (preprint): DOI 10.5281/zenodo.21893260 · registro en Zenodo · v1.0:
10.5281/zenodo.21893261 - Autor: Fernando Vergara · Hubents Tech S.L. · Koble · ORCID 0009-0000-7355-7107
- Licencia: CC BY 4.0 — úsala libremente, cita la fuente
Cada nivel incluye los anteriores. Se ordenan por el mínimo incremento de autoridad concedida, no por lo sofisticado que parezca el comportamiento.
| Nivel | Qué concede respecto al anterior | |
|---|---|---|
| V0 | Consulta | Nada. Responde cuando se le pregunta; escribe solo por orden directa y confirmada. |
| V1 | Asistente | El derecho a dirigirse a ti sin que se lo pidas: informe periódico, avisos anclados a un hecho. |
| V2 | Copiloto | El derecho a preparar trabajo: propuestas concretas que alguien aprueba una a una. |
| V3 | Autopiloto | El derecho a ejecutar lo de riesgo bajo, auditado y con deshacer durante la ventana declarada. |
| V4 | Gestor | El derecho a encadenar esas ejecuciones hacia un objetivo, con topes y escalado bloqueante. |
| V5 | Multiagente | El derecho a delegar en otros agentes bajo un coordinador, heredando todos los techos. |
| V6 | Federado | No es más de lo mismo: el derecho a actuar entre organizaciones, bajo reglas de composición explícitas. Mueve un tercer eje, no sube un escalón. |
Solo dos transiciones importan de verdad: V2 → V3 es la única que cambia quién comete la escritura, y V3 → V4 no elimina la decisión humana sino su punto.
V5 y V6 están especificados y reservados: su semántica está definida pero no se ha ejercitado en producción, así que hoy nadie puede declararse conforme a ellos. Se especifican por la misma razón por la que SAE J3016 definió el nivel 5 años antes de que existiera un coche que pudiera reclamarlo: una escala es normativa, y el nivel que todavía no existe es el que dice hacia dónde se construye.
V0–V5 comparten un supuesto tan básico que es fácil no verlo: hay un solo dominio de autoridad —un titular fija el nivel, una Declaración define el catálogo, un techo, una ventana de deshacer, un registro de auditoría—. Dos organizaciones cuyos agentes se coordinan son dos dominios, y eso rompe tres cosas a la vez: la autoridad ya no la fija una sola Declaración, el deshacer deja de ser local (revertir lo que tu agente comprometió en el sistema del otro exige su cooperación) y la auditoría se parte en dos registros.
Por eso no cabe en V5: V5 delega en subagentes que heredan su techo; V6 negocia con un agente cuyo techo no controla.
Y es posible justamente porque la Declaración existe: en los criterios de riesgo, toda comunicación que sale de la organización es de riesgo alto porque el otro lado es opaco. Entre dos agentes que publican su Declaración legible por máquina, esa opacidad desaparece. Ahí la Declaración deja de ser un documento y pasa a ser un protocolo: sin ella, V6 no está disponible.
Reglas de composición (resolución conservadora):
- La autoridad efectiva es la intersección. Solo se ejecuta sin humano lo que ambas Declaraciones clasifican como riesgo bajo y ambas partes están en nivel ≥ 3.
- El techo efectivo es la unión. Si una acción está en el techo invariante de cualquiera de las dos partes, exige humano, la proponga quien la proponga.
- La ventana de deshacer efectiva es la más corta de las dos, y lo reversible en un solo lado se trata como irreversible.
- La auditoría es bilateral. Cada parte registra lo que comprometió su agente, con un identificador de correlación compartido para poder cruzar los registros.
- El descenso es unilateral e inmediato. Que cualquiera baje de nivel corta la interacción al momento, sin negociación ni periodo de drenaje.
V6 no concede ninguna autoridad que las partes no tuvieran por separado: concede el derecho a ejercer la intersección sin un humano de correo entre las dos.
La decisión no la toma el nivel: la toma la matriz nivel × clase de riesgo de la acción, con un techo que ningún nivel supera.
si la acción está en el techo invariante → humano (en cualquier nivel, V5 incluido)
si el riesgo es alto → humano
si el riesgo es bajo y nivel ≥ 3 → ejecuta, auditado y con deshacer
en cualquier otro caso → propuesta a la bandeja
acción que no está en el catálogo → se trata como riesgo alto
fallo al ejecutar → degrada a propuesta pendiente, nunca a silencio
Las tres clases se asignan por cuatro criterios: reversibilidad técnica, externalidad (si el efecto sale de la organización), efecto legal o monetario, y visibilidad ante terceros.
| Propiedad | |
|---|---|
| P1 | Monotonía — Vn ⊂ V*(n+1)*; ningún nivel cambia supervisión por autoridad. |
| P2 | Techo invariante — un conjunto no vacío y público de acciones exige humano en todos los niveles. |
| P3 | Reversibilidad y auditoría — toda acción autónoma deja registro y deshacer en una ventana declarada. |
| P4 | Por defecto a prueba de fallos — nivel inicial V0; acción desconocida, riesgo máximo; fallo degrada a propuesta. |
| P5 | Descenso inmediato — bajar surte efecto al momento y nunca cuesta más que subir. |
| P6 | Legibilidad para el titular — el nivel lo fija el cliente, en lenguaje de negocio; lo reservado se marca. |
| P7 | Cumplimiento en código — gates y clases de riesgo en la lógica del programa, con test. No en el prompt. |
- Cumple P1–P7 para el nivel que vas a declarar.
- Rellena la plantilla de Declaración de Autonomía
—los diez campos, ninguno en blanco— o su versión legible por máquina
(
autonomy-statement.schema.json). - Publícala donde un cliente pueda leerla sin pedir permiso, enlaza la definición canónica y cita el paper.
- Opcional: usa el badge.
[](https://tu-dominio.com/autonomy-statement)Condiciones de uso del nombre: NAME-POLICY.md. No existe
organismo certificador: la conformidad se autodeclara y es falsable —intenta
una acción de riesgo alto en el nivel declarado y comprueba si exige un humano.
La escala no sale de una pizarra. Estas son las de los dos productos donde se construyó, validadas contra el schema:
| Hubents · SofIA | Koble · KobIA | |
|---|---|---|
| Dominio | Gestión de eventos | Operación de agencia / CRM |
| Niveles | V0–V5 (V5 reservado) | V0–V4 (V4 reservado) |
| Acciones clasificadas | 24 · 9 bajo / 5 medio / 10 alto | 12 · 5 / 3 / 4 |
| Techo invariante | 1 acción | 4 acciones |
| Ventana de deshacer | 7 días | 7 días |
Difieren en todos los parámetros libres y coinciden en todos los fijos: esa es la forma que deben tener dos sistemas conformes. Lo fijo es la semántica de los niveles, las clases de riesgo, P1–P7 y la regla nivel × riesgo; lo libre es el umbral, la ventana, el techo, el catálogo y el tope de autoservicio.
@article{vergara2026scale,
author = {Vergara, Fernando},
title = {The Vergara Agentic Autonomy Scale (V0--V6): A Risk-Gated,
Operational Standard for Agents Acting on Business Systems},
year = {2026},
doi = {10.5281/zenodo.21893260}
}También en CITATION.cff — GitHub lo convierte en el botón
«Cite this repository».
La ONU no legisla sobre IA, y esta escala no pretende lo contrario. Lo que existe es un mecanismo de evaluación compartida: la resolución A/RES/79/325 (26 de agosto de 2025) creó el Independent International Scientific Panel on AI —40 miembros nombrados en febrero de 2026— y el Global Dialogue on AI Governance, cuya primera sesión se celebró en Ginebra el 6 y 7 de julio de 2026. El mandato del Panel es evaluación científica con informe anual.
Ese mandato tiene el mismo problema de medición del que parte esta escala: una evaluación de cuánta autonomía se está desplegando no se puede montar con autodescripciones de proveedores, porque «autónomo» no es una cantidad comparable entre productos ni jurisdicciones. Lo que un proceso así sí puede consumir es una unidad. Tres propiedades cuentan a esa altura:
- Interopera sin armonizar leyes: la Declaración se publica bajo el AI Act, bajo un marco estadounidense o bajo ninguno, y los diez campos siguen siendo comparables.
- Separa autonomía de capacidad: qué puede hacer un modelo y qué se le permite comprometer sin humano son preguntas distintas.
- Es auditable en lo pequeño: P7 pone el límite en código y bajo test, así que la conformidad se examina acción por acción.
La idea de que la autonomía admite niveles es anterior a este trabajo y se cita como tal: Sheridan y Verplank (1978), Endsley y Kaber (1999), Parasuraman, Sheridan y Wickens (2000), SAE J3016, Feng, McDonald y Zhang (2025) y el marco de la Cloud Security Alliance (enero de 2026). Lo que aporta esta escala es la construcción operativa: la matriz nivel × riesgo con techo invariante, las siete propiedades y la Declaración de Autonomía.
Leído de la base de datos de producción, no de la memoria:
| Medida | Observado |
|---|---|
| Organizaciones | 160 · 157 en V0, 1 en V1, 1 en V2, 1 en V4 |
| Agente en producción desde | 17 feb 2026 (268 conversaciones, 789 mensajes) |
| Propuestas (jun–ago) | 266 · 161 descartadas (61 %), 91 pendientes, 14 auto-ejecutadas |
| Acciones autónomas | 7 createTask + 7 updateTask, del 28 jul al 10 ago |
| Deshacer usado | 0 de 14 |
| Misiones en el tenant V4 | 0 |
Tres lecturas: P4 funciona (157 de 160 en el valor por defecto); un nivel concedido no es un nivel ejercido (el tenant en V4 no ha corrido ninguna misión, su autonomía real es la de V3); y el punto débil es la bandeja, no el ejecutor (61 % de descartes y 91 pendientes, frente a cero reversiones de lo ejecutado).
Con 14 acciones y dos semanas se puede hablar de mecanismo, no de eficacia: no distinguen «bien clasificado» de «nadie ha mirado».