Benchmark: Claude Code con y sin ISMS Copilot
Cómo medimos el rendimiento de Claude Code trabajando solo frente a Claude Code delegando preguntas de GRC a ISMS Copilot: metodología, clave de respuestas, puntuación, resultados, el caso en que la delegación no ayuda y las advertencias.
Medimos una pregunta: cuando realizas trabajo de GRC en Claude Code, ¿cuánto cuesta una respuesta correcta en uso de Claude si Claude Code la investiga solo, y cuánto cuesta si Claude Code delega la pregunta a ISMS Copilot a través de MCP? Esta página detalla el método, cada cifra destacada, el caso en que la delegación no ayudó, los límites de la prueba y qué respaldan (y qué no) los resultados.
Qué respalda esto
En los elementos probados, Claude Code delegando a ISMS Copilot igualó la precisión de Claude Code investigando solo con búsqueda web: el veredicto de precisión pre-registrado fue un empate en todos los escenarios. Gastó menos dinero de la API de Claude por respuesta correcta en búsquedas y consejos rápidos, y aproximadamente lo mismo en una sesión larga combinada de codificación y cumplimiento. Los marcos probados el 2026-09-28 son ISO/IEC 27001:2022 Anexo A, ISO/IEC 42001:2023 Anexo A, CMMC 2.0 Nivel 2, DORA RTS (UE) 2024/1774 y NIS2 IR (UE) 2024/2690, y solo esos. La ronda del 2026-09-29 añadió 10 elementos reservados de NIST SP 800-171 Rev. 2 y la Ley de Ciberresiliencia. Los turnos delegados cuentan contra tu plan de ISMS Copilot, que no está incluido en las cifras en dólares. Lee los límites a continuación antes de confiar en estos números.
Límites de esta prueba
Lee esto antes de usar los resultados
Estos cuatro límites aplican a todos los resultados de esta página, incluyendo la ronda del 2026-09-29.
- La precisión está en el límite superior. En la v3, ambas configuraciones obtuvieron un 100% en los escenarios de búsqueda, sesión larga y consejo rápido, y en la ronda del 2026-09-29 (que no repitió la sesión larga) ambas obtuvieron un 100% en búsquedas y consejos rápidos. Con estos elementos y la regla pre-registrada, la prueba solo podía detectar una brecha de precisión de 10 puntos porcentuales o más. "Igualó" en esta página significa que no se encontró una diferencia de ese tamaño, no que se haya demostrado que las dos configuraciones son igualmente precisas.
- Las dos configuraciones no recibieron las mismas instrucciones. En la v3, la verificación excluida y la primera ronda del 2026-09-29, Claude Code solo no tuvo archivo de instrucciones. La configuración de delegación tenía la regla de enrutamiento como su
CLAUDE.md, y esa regla le indica que no vuelva a verificar las respuestas que ISMS Copilot confirmó, por lo que parte de la diferencia de costos podría haber provenido de esa instrucción en lugar de la delegación. El control se ha ejecutado ahora, el 2026-09-29: Claude Code solo, al que se le indicó que verificara en la web solo lo que no estuviera seguro, utilizó aproximadamente tantos tokens de Claude por respuesta correcta como sin instrucciones sobre búsquedas y consejos rápidos, y la configuración de delegación aún utilizó menos tokens de Claude por respuesta correcta que esta en todos los escenarios (de 1.6 a 3.2 veces menos). Consulte la sección "Ronda del 2026-09-29 (control)" a continuación. El control probó una instrucción de ahorro, escrita por nosotros; una mejor podría reducir la brecha. - Una cuenta, con sus memorias y, desde el 2026-09-29, su perfil de empresa. Cada turno delegado se ejecutó en una cuenta de ISMS Copilot, la nuestra (la del fundador), en su plan de pago y con sus memorias de cuenta. Desde el 2026-09-29, ISMS Copilot añade el perfil de empresa como contexto a los turnos de MCP para cuentas que lo tienen, y esta cuenta lo tiene, por lo que la ronda del 2026-09-29 lo incluye. Las ejecuciones del 2026-09-28 no. Los resultados en una cuenta con un plan diferente, memorias diferentes o sin perfil pueden variar.
- La clave de respuestas fue escrita por un modelo de IA. Un modelo de Claude escribió la clave a partir de las fuentes oficiales listadas a continuación. Los elementos de DORA RTS y NIS2 IR fueron verificados puntualmente con el texto oficial. Está pendiente una revisión de la clave por un experto humano, y su resultado se añadirá aquí con su fecha.
Configuración
El método completo (diseño, clave de respuestas y evaluador) es interno y está disponible bajo solicitud: escribe a support@ismscopilot.com.
| Elemento | Valor |
|---|---|
| Fechas | v2, v3 y la verificación excluida el 2026-09-28 (UTC); dos rondas posteriores el 2026-09-29 (UTC), reportadas a continuación |
| Orquestador | Claude Code 2.1.283, sin interfaz gráfica, una configuración y carpeta de trabajo vacías y nuevas para cada ejecución |
| Modelo | claude-sonnet-5 en ambas configuraciones, fijado. La búsqueda web y la obtención web ejecutan sub-llamadas de Claude Haiku 4.5, y su costo está incluido. |
| Ejecuciones | N=3 por escenario por configuración, ejecutadas como pares emparejados (ambas configuraciones inician el mismo escenario al mismo tiempo) |
| Uso de Claude | Clave de API de Claude, precios de lista, según lo reportado por Claude Code para cada ejecución |
| ISMS Copilot | La MCP de la cuenta de producción, en una cuenta de ISMS Copilot (la nuestra, en su plan de pago) |
Ambas configuraciones reciben indicaciones de tarea idénticas, y las indicaciones nunca mencionan ISMS Copilot:
| Claude Code solo | Claude Code + ISMS Copilot | |
|---|---|---|
| Herramientas | Leer, Glob, Grep, Escribir, Editar, WebSearch, WebFetch | Las mismas, más las herramientas de conversación de ISMS Copilot (create_conversation, send_message, get_reply) |
| Instrucciones | Ninguna | La regla de enrutamiento publicada de Claude Code desde Delegar trabajo de GRC desde tu agente (2026-09-28), como el proyecto CLAUDE.md |
Ambas configuraciones tienen búsqueda y obtención web, porque un usuario real las tiene. La regla de enrutamiento decide qué se delega. No se permitieron las otras herramientas de cuenta (contexto de empresa, espacios de trabajo, memorias, documentos). Las memorias de cuenta del lado del servidor de ISMS Copilot aún podrían influir en sus respuestas, y desde el 2026-09-29 también el perfil de empresa de la cuenta, que ISMS Copilot añade en su lado (ver Límites de esta prueba).
Escenarios
- S1, búsquedas. 20 temas de requisitos, y la tarea es dar el identificador exacto para cada uno: 4 artículos de DORA RTS, 4 puntos del anexo de NIS2 IR, 4 controles del Anexo A de ISO/IEC 42001:2023, 4 prácticas de CMMC Nivel 2 y 4 controles del Anexo A de ISO/IEC 27001:2022. La respuesta es un archivo JSON.
- S3, sesión larga. Una sesión de Claude Code de 8 indicaciones en un pequeño repositorio de Python: 4 ediciones de código (verificadas por pruebas ocultas) alternadas con 4 preguntas de GRC con respuestas clave. Las respuestas de GRC se califican; las verificaciones de código se reportan por separado.
- S4, consejo rápido. 5 preguntas de sí o no, cada una con el identificador que la decide y una razón de una oración. Correcto solo si tanto el sí o no como el identificador coinciden.
- Elementos reservados. 20 nuevos elementos de DORA RTS y NIS2 IR, en el formato S1, que nunca estuvieron en la clave de respuestas antes (ver "La historia" abajo).
Todos los casos de prueba son ficticios. No se utilizó datos de clientes.
Cómo se construyó la clave de respuestas
Cada elemento con clave tiene el identificador canónico, el requisito en una oración, una cita y una referencia o puntero a la fuente. La clave se construyó solo a partir de fuentes oficiales, y nunca a partir de ISMS Copilot, porque eso sería circular:
- DORA RTS (UE) 2024/1774 y NIS2 IR (UE) 2024/2690: el texto oficial de la Oficina de Publicaciones de la UE (CELEX 32024R1774 y 32024R2690), citado a las direcciones de EUR-Lex.
- CMMC 2.0 Nivel 2: la Guía de Evaluación de CMMC Nivel 2 del DoD, con la publicación de NIST de la que provienen los números de práctica.
- ISO/IEC 27001:2022 e ISO/IEC 42001:2023 Anexo A: los elementos de ISO/IEC 27001 y 42001 utilizan identificadores de controles, descritos con nuestras propias palabras.
La clave se congeló antes de la primera ejecución, y cada ejecución registra un resumen de la misma. No cambió durante el benchmark.
Calificación
La calificación es mecánica: ningún modelo juzga ninguna respuesta. Un script lee el campo de identificador de cada respuesta y lo normaliza por tipo, luego lo compara con la clave:
- DORA RTS: "Article 7", "Art. 7(4)" y "Article 7(4) of ..." cuentan todos como Article 7.
- NIS2 IR: la respuesta debe ser un punto real del anexo y debe estar en la lista de aceptación pre-registrada del elemento (el punto operativo y su encabezado). Un punto hermano es incorrecto.
- ISO/IEC 27001:2022 e ISO/IEC 42001:2023: el número del Anexo A debe coincidir exactamente. La numeración de 2013, o una referencia al Anexo B para 42001, es incorrecta.
- CMMC Nivel 2: el número de práctica debe coincidir ("SC.L2-3.13.11" y "3.13.11" cuentan ambos).
Un archivo faltante, JSON inválido o un identificador no analizable cuentan como incorrectos. Las ejecuciones que alcanzaron un límite se habrían calificado tal como estaban, y nunca se volvieron a ejecutar.
Métrica
La métrica principal es dólares de la API de Claude por respuesta correcta: el costo de Claude de las 3 ejecuciones de un escenario dividido por las respuestas correctas en esas 3 ejecuciones. Es el precio de lista que Claude Code reporta, que es lo que un suscriptor de Claude paga por el uso adicional más allá del plan. Incluye las sub-llamadas de búsqueda web y las tarifas de búsqueda.
El uso del plan de ISMS Copilot no está incluido en esta cifra, y no es gratuito. Los turnos delegados cuentan contra tu plan de ISMS Copilot (ver Dónde se factura el uso de ISMS Copilot). Omitirlo favorece a la configuración que delega en esta métrica.
La precisión, los tokens del orquestador, los turnos y el tiempo se reportan junto a ella. Los tokens y los dólares difieren: el contexto repetido leído desde la caché de indicaciones se factura a una fracción del precio de entrada, por lo que una configuración puede usar más tokens y aún así costar menos dólares.
Pre-registro y la enmienda registrada
El diseño, la clave de respuestas, el calificador y las reglas de victoria se comprometieron antes de cualquier ejecución, con el compromiso de publicar los resultados sin importar cuáles fueran. Las reglas de victoria pre-registradas: la precisión gana con 10 puntos porcentuales o más, los dólares por respuesta correcta con 1.25 veces o más; cualquier cosa más cercana es un empate. La nueva ejecución de la v3 y la verificación de elementos reservados se pre-registraron de la misma manera antes de su primera ejecución.
Se hizo una enmienda durante la primera ejecución (v2). Un límite por ejecución de 2 millones de tokens del orquestador, pensado como protección contra ejecuciones descontroladas, detuvo el benchmark después del primer par, cuando Claude Code solo terminó una ejecución de búsqueda normalmente con 2.38 millones de tokens (las 20 correctas). El límite se elevó a 6 millones para ambas configuraciones, el cambio se registró con su hora y no se volvió a ejecutar nada. Se hizo después de ver ese primer resultado. Sin él, ningún escenario tendría un veredicto. Los límites de dólares y el techo de gasto general no cambiaron.
La historia: v2, la solución, v3 y la verificación reservada
v2 encontró un vacío de conocimiento. En la primera ejecución justa, ISMS Copilot igualó a Claude Code solo en todos los elementos de ISO/IEC 27001, ISO/IEC 42001 y CMMC, pero omitió la mayoría de los números de artículos de DORA RTS y los puntos del anexo IR de NIS2. Sus respuestas marcaron esos identificadores como no confirmados.
| Precisión de v2 | Claude Code solo | Claude Code + ISMS Copilot |
|---|---|---|
| Búsquedas S1 | 60/60 | 37/60 |
| Sesión larga S3 | 12/12 | 9/12 |
| Asesoramiento rápido S4 | 15/15 | 9/15 |
La solución. Añadimos conocimiento de DORA RTS y NIS2 IR a ISMS Copilot a nivel de artículo y punto de anexo, construido a partir de los textos oficiales de la UE, y agregamos una línea a la regla de enrutamiento: verificar cualquier respuesta que ISMS Copilot marque como no confirmada. Luego, volvimos a ejecutar los mismos escenarios con la misma clave y evaluador.
v3 (misma clave, mismo evaluador, ambas configuraciones reejecutadas):
| Escenario | Configuración | Correctas | Precisión | Claude $ (3 ejecuciones) | Claude $ por respuesta correcta | Tokens medianos del orquestador por ejecución |
|---|---|---|---|---|---|---|
| Búsquedas S1 | Solo | 60/60 | 100% | 6.92 | 0.115 | 3,194,935 |
| Búsquedas S1 | + ISMS Copilot | 60/60 | 100% | 3.18 | 0.053 | 1,337,252 |
| Sesión larga S3 | Solo | 12/12 | 100% | 1.65 | 0.138 | 1,537,697 |
| Sesión larga S3 | + ISMS Copilot | 12/12 | 100% | 1.75 | 0.146 | 1,742,489 |
| Asesoramiento rápido S4 | Solo | 15/15 | 100% | 0.89 | 0.059 | 501,237 |
| Asesoramiento rápido S4 | + ISMS Copilot | 15/15 | 100% | 0.39 | 0.026 | 255,659 |
Veredictos preregistrados: la precisión es un empate en los tres escenarios. Los dólares por respuesta correcta favorecen a la configuración de delegación en S1 y S4, y S3 es un empate. En S3, todas las verificaciones de código pasaron en ambas configuraciones.
La mejora provino de las propias respuestas de ISMS Copilot. Un diagnóstico añadido después de las ejecuciones (sin veredicto adjunto) encontró que sus respuestas incluían el identificador correcto de DORA RTS y NIS2 IR en 24 de 24 elementos de S1 antes de cualquier verificación web por parte de Claude Code. Ninguna respuesta de v3 marcó un identificador como no confirmado, por lo que la nueva línea de verificación no se ejercitó. Claude Code aún verificó en la web en S1 y S3 sin que se le pidiera, lo que no cambió ninguna respuesta y aumentó el costo de la configuración de delegación.
La verificación reservada (20 elementos nuevos). Debido a que la solución de conocimiento se limitó a los errores de v2, verificamos si hubo adaptación al test: 10 artículos de DORA RTS y 10 puntos del anexo IR de NIS2 que la clave nunca contenía, construidos a partir de los textos oficiales de la misma manera, en el formato S1.
| Reservado | Configuración | Correctas | Precisión | Claude $ (3 ejecuciones) | Claude $ por respuesta correcta | Tokens medianos del orquestador por ejecución |
|---|---|---|---|---|---|---|
| 20 nuevos elementos de DORA RTS y NIS2 IR | Solo | 58/60 | 96.7% | 4.01 | 0.069 | 1,974,985 |
| 20 nuevos elementos de DORA RTS y NIS2 IR | + ISMS Copilot | 60/60 | 100% | 3.10 | 0.052 | 2,258,506 |
Veredictos preregistrados: la precisión es un empate (la diferencia es inferior a 10 puntos), y los dólares por respuesta correcta favorecen a la configuración de delegación (1.34 veces). La configuración de delegación utilizó más tokens aquí porque Claude Code volvió a verificar las respuestas de ISMS Copilot en la web en dos de tres ejecuciones. En la ejecución en la que no lo hizo, escribió la respuesta de ISMS Copilot en el archivo y obtuvo 20 de 20 por $0.15.
Ronda del 2026-09-29
Una reejecución limitada tras un lanzamiento en producción que ajustó la regla de enrutamiento de Claude Code e inició la inclusión del perfil de la empresa en los turnos de MCP (los dos cambios no pueden separarse en estas cifras). Mismo Claude Code y modelo fijados, misma clave y evaluador, N=3 por escenario por configuración. Se ejecutaron S1 y S4, y 10 elementos reservados nuevos (5 NIST SP 800-171 Rev. 2, 5 Cyber Resilience Act) que nunca estuvieron en la clave. S3 no se reejecutó. Las tablas de v3 y reservado anteriores mantienen sus números originales.
| Fecha | Escenario | Configuración | Correctas | Precisión | Claude $ por respuesta correcta |
|---|---|---|---|---|---|
| 2026-09-29 | Búsquedas S1 | Solo | 60/60 | 100% | 0.110 |
| 2026-09-29 | Búsquedas S1 | + ISMS Copilot | 60/60 | 100% | 0.026 |
| 2026-09-29 | Asesoramiento rápido S4 | Solo | 15/15 | 100% | 0.064 |
| 2026-09-29 | Asesoramiento rápido S4 | + ISMS Copilot | 15/15 | 100% | 0.035 |
| 2026-09-29 | 10 nuevos elementos de NIST SP 800-171 y CRA | Solo | 30/30 | 100% | 0.027 |
| 2026-09-29 | 10 nuevos elementos de NIST SP 800-171 y CRA | + ISMS Copilot | 29/30 | 96.7% | 0.033 |
Veredictos preregistrados: la precisión es un empate en los tres. Los dólares por respuesta correcta favorecen a la configuración de delegación en S1 y S4, y son un empate en los nuevos elementos. El único error provino de una ejecución con configuración de delegación que nunca llamó a ISMS Copilot: la lista de marcos de la regla de enrutamiento no incluía entonces NIST SP 800-171 ni el CRA, por lo que en 2 de 3 ejecuciones Claude Code investigó esos elementos en la web. La única ejecución que sí delegó obtuvo 10 de 10. La regla se actualizó el 2026-09-29 para incluir ambos marcos. Se aplican las mismas limitaciones: la precisión está en su máximo, las instrucciones difieren entre configuraciones, y esta ronda incluye el perfil de la empresa de la cuenta.
Ronda del 2026-09-29 (control)
Esta ronda responde a la pregunta que deja abierta el segundo límite anterior: ¿el ahorro proviene de delegar en ISMS Copilot o solo de la regla de enrutamiento que indica a Claude Code no volver a verificar lo que ya tiene claro? Se añade una configuración de control con una instrucción similar y sin delegación. El diseño, las reglas de victoria y cada elemento se comprometieron antes de la primera ejecución, con el mismo compromiso de publicar los resultados independientemente de lo que mostraran. Se ejecutó después de la actualización de la regla de enrutamiento del 2026-09-29 que menciona NIST SP 800-171 y el CRA.
| Configuración | Qué incluye |
|---|---|
| A, solo | Búsqueda web y recuperación web, sin archivo de instrucciones (como en todas las rondas anteriores) |
| A2, solo + instrucción de ahorro | A, más un archivo de instrucciones de 197 palabras: responde desde tu propio conocimiento, verifica en la web solo lo que no tengas claro, no vuelvas a comprobar lo que ya sabes con seguridad. Sin delegación. |
| A0, solo sin web | Sin herramientas web, sin archivo de instrucciones |
| B, + ISMS Copilot | A, más las herramientas de conversación de ISMS Copilot y la regla de enrutamiento publicada |
| B-fast | B, con cada llamada a ISMS Copilot en modo Fast, el modo del plan Free |
Misma versión fijada de Claude Code 2.1.283 y claude-sonnet-5, mismo evaluador, N=3 por escenario por configuración, y las cinco configuraciones de cada escenario se ejecutaron al mismo tiempo. Escenarios: S1 búsquedas (20 elementos), S4 consejos rápidos (5 preguntas) y 16 elementos nuevos no incluidos previamente en la clave (6 NIST SP 800-171 Rev. 2, 6 Cyber Resilience Act y 4 DORA RTS), creados a partir de los textos oficiales. S3 no se volvió a ejecutar.
La métrica aquí es tokens de Claude por respuesta correcta: tokens de entrada, lectura de caché, creación de caché y salida en todos los modelos (incluidas las subllamadas de búsqueda web), sumados en las 3 ejecuciones y divididos por las respuestas correctas. Es un indicador de la rapidez con la que se consume una ventana de suscripción de Claude, no el contador en sí: Anthropic no publica cómo se contabilizan los tokens en caché frente a los límites de suscripción.
| Tokens de Claude por respuesta correcta | A | A2 | A0 | B | B-fast |
|---|---|---|---|---|---|
| S1 búsquedas | 120,877 | 122,814 | 40,552 | 37,805 | 24,473 |
| S4 consejos rápidos | 100,920 | 102,145 | 29,424 | 42,142 | 55,582 |
| 16 elementos nuevos no incluidos | 57,566 | 37,475 | 33,660 | 23,452 | 13,765 |
| Agrupado (123 respuestas evaluadas) | 94,033 | 86,398 | 36,326 | 32,733 | 24,088 |
Veredictos preestablecidos frente al control (se requiere 1.25 veces o más para ganar): A2 utilizó 3.23 veces los tokens de Claude por respuesta correcta de B en búsquedas, 2.44 veces en consejos rápidos, 1.59 veces en los elementos nuevos y 2.64 veces en el total agrupado, por lo que B gana en todos los escenarios. B también utilizó menos dólares de la API de Claude por respuesta correcta que A2 en todos los escenarios. La instrucción de ahorro apenas modificó el comportamiento de Claude Code en búsquedas y consejos rápidos (A2 frente a A: 1.02 y 1.01, empates) y ayudó en los elementos nuevos. El ahorro proviene de la delegación, no de indicar a Claude Code que sea ahorrador. A0 necesita pocos tokens porque responde desde la memoria, y a menudo se equivoca (ver precisión), por lo que su cifra no es un resultado utilizable.
Precisión, agrupada: A 99.2%, A2 98.4%, A0 60.2%, B 100%, B-fast 100%. A, A2, B y B-fast son empates según la regla de los 10 puntos en todos los escenarios; A0 perdió entre 20 y 46 puntos en cada escenario. La advertencia sobre el techo sigue vigente: los empates lo son por regla, no como prueba de igual precisión.
Uso del plan de ISMS Copilot por respuesta correcta. Los turnos delegados consumen la ventana de 4 horas de tu plan de ISMS Copilot. La tabla muestra los tokens de ISMS Copilot (entrada y salida) por respuesta correcta como porcentaje de una ventana, utilizando los límites del plan de producción a 2026-09-29. Essential es un plan heredado. Unlimited no tiene límite de tokens en la ventana.
| Ventana de ISMS Copilot por respuesta correcta | Tokens de ISMS Copilot por respuesta correcta | Free | Essential | Plus | Standard | Pro | Business | Unlimited |
|---|---|---|---|---|---|---|---|---|
| S1 búsquedas, B | 3,199 | 0.64% | 0.32% | 0.21% | 0.11% | 0.04% | 0.02% | sin límite |
| S1 búsquedas, B-fast | 9,128 | 1.83% | 0.91% | 0.61% | 0.30% | 0.12% | 0.06% | sin límite |
| S4 consejos rápidos, B | 12,104 | 2.42% | 1.21% | 0.81% | 0.40% | 0.16% | 0.08% | sin límite |
| S4 consejos rápidos, B-fast | 24,005 | 4.80% | 2.40% | 1.60% | 0.80% | 0.32% | 0.16% | sin límite |
| 16 elementos nuevos no incluidos, B | 3,359 | 0.67% | 0.34% | 0.22% | 0.11% | 0.04% | 0.02% | sin límite |
| 16 elementos nuevos no incluidos, B-fast | 3,203 | 0.64% | 0.32% | 0.21% | 0.11% | 0.04% | 0.02% | sin límite |
El plan Free también permite solo 10 mensajes por ventana de 4 horas. B envió un mensaje de ISMS Copilot por ejecución. En modo fast, Claude Code dividió el trabajo en hasta 5 mensajes por ejecución, y en quick advice esto hizo que el límite de mensajes se alcanzara primero: alrededor del 7.3% de la ventana de mensajes Free por respuesta correcta, frente al 4.8% de la ventana de tokens, por lo que aproximadamente 3 entregables de quick-advice de esta estructura llenan una ventana Free. En las otras celdas, la ventana de tokens se llena tan rápido o ligeramente más rápido que la ventana de mensajes. B-fast solo simula el modo fast en una cuenta de pago.
Advertencias para esta ronda: N=3 por escenario por configuración; una versión del orquestador y un modelo; una instrucción de ahorro, escrita por nosotros, y una mejor podría reducir la brecha (esta ronda muestra que esta instrucción razonable no lo hace); cada turno delegado se ejecutó en nuestra propia cuenta de pago (la del fundador), con sus memorias y su perfil de empresa añadidos a los turnos de MCP; la métrica de tokens es un indicador del uso de la suscripción; la clave de respuestas fue escrita por un modelo de IA; la precisión está en el techo.
Cuando la delegación no ayuda
El primer benchmark que ejecutamos probó tres pequeñas tareas de ISO 27001 que Claude ya conoce: una verificación de brechas de cuatro políticas ficticias cortas, un borrador de política de control de acceso y entradas de la Declaración de Aplicabilidad para 10 controles. Cada tarea escribió su entregable en un archivo, y no se necesitaron búsquedas. Ninguna configuración tenía herramientas web, y las respuestas se verificaron solo por completitud, no por corrección.
| Tarea (mediana de 3 ejecuciones) | Claude $, solo | Claude $, + ISMS Copilot | Tokens del orquestador, solo | Tokens del orquestador, + ISMS Copilot |
|---|---|---|---|---|
| Verificación de brechas | 0.163 | 0.266 | 143,053 | 495,530 |
| Política de control de acceso | 0.105 | 0.218 | 131,748 | 427,071 |
| Entradas de SoA | 0.113 | 0.182 | 133,516 | 349,717 |
La delegación utilizó entre 1.6 y 2.1 veces más dinero de Claude aquí. Las ejecuciones con delegación tomaron más turnos (cargando las herramientas MCP, esperando la respuesta), Claude Code aún leyó cada archivo local, y el entregable completo regresó a través de Claude Code, que luego lo escribió en disco. Cuando una tarea es pequeña, Claude ya conoce la respuesta y no necesita búsquedas, manténla en tu agente. Consulta qué delegar y qué mantener local.
Advertencias
- Muestra pequeña. 3 ejecuciones por escenario por configuración, el 2026-09-28, más dos rondas acotadas el 2026-09-29.
- Un solo orquestador. Solo Claude Code. Las reglas de enrutamiento para Codex, Cursor, OpenCode y Grok están documentadas, pero esos orquestadores no se midieron.
- Un modelo.
claude-sonnet-5. Otro modelo, o una versión posterior de Claude Code, podría comportarse de manera diferente. - Una cuenta. Todos los turnos delegados se ejecutaron en una cuenta de producción de ISMS Copilot, en su plan de pago, cuyas memorias del lado del servidor, y desde el 2026-09-29 su perfil de empresa, pueden influir en las respuestas.
- Fixtures ficticios. Empresas, políticas y código inventados.
- Revisión de documentos no probada. El MCP no tiene una vía de carga de documentos. Una revisión de una política de 40 páginas se ejecutó en v2 y empató, pero Claude Code realizó la revisión por sí mismo en ambas configuraciones, por lo que no dice nada sobre ISMS Copilot revisando tus documentos.
- Autor de la clave. Los elementos fueron escritos por un modelo de Claude, de la misma familia que el orquestador, a partir de los textos oficiales. Los elementos de DORA RTS y NIS2 IR se verificaron puntualmente con el texto oficial, y los elementos reservados se cotejaron con él antes de las ejecuciones. Está pendiente una revisión por parte de un experto humano.
- Qué se publica. Esta página incluye el método y todos los números principales. Las transcripciones en bruto permanecen privadas: contienen identificadores de conversaciones de producción y la salida textual exacta del modelo. Los prompts de las tareas, la clave de respuestas, el evaluador y las salidas evaluadas se guardan en nuestro repositorio interno y no se publican con esta página.
Qué afirmamos y qué no
Afirmamos:
- En los elementos probados en los cinco marcos anteriores, Claude Code con ISMS Copilot igualó la precisión de Claude Code investigando solo con búsqueda web (un empate de precisión en cada escenario, según la regla preregistrada).
- En esas búsquedas y preguntas de asesoramiento rápido, gastó menos dinero de la API de Claude por respuesta correcta (aproximadamente la mitad en la ejecución v3, aproximadamente tres cuartos en la verificación reservada del 2026-09-28), y aproximadamente lo mismo en una sesión larga mixta.
No afirmamos:
- Que ISMS Copilot sea más económico que Claude, o un porcentaje de ahorro en tu factura.
- Respuestas mejores que las de Claude. Los resultados de precisión son empates.
- Nada sobre marcos que no hayamos probado, otros orquestadores o modelos, o la revisión de documentos.
- Que la delegación ahorre uso de Claude en tareas pequeñas que Claude ya conoce. Costó más en esos casos.
- Que los turnos delegados sean gratuitos. Cuentan contra tu plan de ISMS Copilot.
Volvemos a ejecutar este benchmark después de cambios en las herramientas MCP o en el conocimiento de marcos de ISMS Copilot. Los resultados de cada ronda se añaden aquí con su fecha en un plazo de 7 días, independientemente de lo que muestren. Para conocer el mecanismo detrás de estos números, consulta Qué ahorra la delegación (y qué no).