Benchmark : Claude Code avec et sans ISMS Copilot
Comment nous avons mesuré les performances de Claude Code travaillant seul par rapport à Claude Code déléguant les questions GRC à ISMS Copilot : méthodologie, clé de réponse, notation, résultats, les cas où la délégation n'aide pas, et les réserves.
Nous avons mesuré une question : lorsque vous effectuez un travail GRC dans Claude Code, quel est le coût en utilisation de Claude d'une réponse correcte si Claude Code fait la recherche seul, et quel est ce coût si Claude Code transmet la question à ISMS Copilot via MCP ? Cette page présente la méthode, tous les chiffres clés, le cas où la délégation n'a pas aidé, les limites du test, ainsi que ce que les résultats soutiennent et ne soutiennent pas.
Ce que cela soutient
Sur les éléments testés, Claude Code déléguant à ISMS Copilot a égalé la précision de Claude Code effectuant seul la recherche avec la recherche web : le verdict de précision préenregistré était une égalité dans chaque scénario. Il a dépensé moins d'argent via l'API Claude par réponse correcte pour les recherches et les conseils rapides, et environ la même somme pour une longue session mixte de codage et de conformité. Les cadres testés le 2026-09-28 sont l'ISO/IEC 27001:2022 Annexe A, l'ISO/IEC 42001:2023 Annexe A, le CMMC 2.0 Niveau 2, le DORA RTS (UE) 2024/1774 et le NIS2 IR (UE) 2024/2690, et uniquement ceux-ci. Le tour du 2026-09-29 a ajouté 10 éléments mis de côté issus de la NIST SP 800-171 Rev. 2 et du Cyber Resilience Act. Les tours délégués comptent dans votre plan ISMS Copilot, ce qui n'est pas inclus dans les chiffres en dollars. Lisez les limites ci-dessous avant de vous fier à ces chiffres.
Limites de ce test
Lisez ceci avant d'utiliser les résultats
Ces quatre limites s'appliquent à tous les résultats de cette page, y compris le tour du 2026-09-29.
- La précision est au plafond. Dans la version v3, les deux configurations ont obtenu 100 % dans les scénarios de recherche, de session longue et de conseils rapides, et dans le tour du 2026-09-29 (qui n'a pas relancé la session longue), les deux ont obtenu 100 % sur les recherches et les conseils rapides. Avec ces éléments et la règle préenregistrée, le test ne pouvait détecter un écart de précision de 10 points de pourcentage ou plus. « Égalé » sur cette page signifie qu'aucune différence de cette ampleur n'a été trouvée, et non que les deux configurations sont prouvées également précises.
- Les deux configurations n'ont pas reçu les mêmes instructions. Dans la version 3, le contrôle mis de côté et le premier tour du 2026-09-29, Claude Code seul n'avait pas de fichier d'instructions. La configuration avec délégation avait la règle de routage comme
CLAUDE.md, et cette règle lui indique de ne pas revérifier les réponses confirmées par ISMS Copilot, donc une partie de la différence de coût pourrait provenir de cette instruction plutôt que de la délégation. Le contrôle a maintenant été effectué, le 2026-09-29 : Claude Code seul, invité à vérifier sur le web uniquement ce dont il n'est pas sûr, a utilisé environ autant de tokens Claude par réponse correcte qu'avec aucune instruction sur les recherches et les conseils rapides, et la configuration avec délégation a toujours utilisé moins de tokens Claude par réponse correcte que lui dans tous les scénarios (1.6 à 3.2 fois moins). Voir la section "Tour du 2026-09-29 (contrôle)" ci-dessous. Le contrôle a testé une instruction d'économie rédigée par nous ; une meilleure pourrait réduire l'écart. - Un seul compte, avec ses souvenirs et, depuis le 2026-09-29, son profil d'entreprise. Chaque tour délégué s'est exécuté sur un seul compte ISMS Copilot, le nôtre (celui du fondateur), sur son plan payant et avec ses souvenirs de compte. Depuis le 2026-09-29, ISMS Copilot ajoute le profil d'entreprise en arrière-plan aux tours MCP pour les comptes qui en ont un, et ce compte en a un, donc le tour du 2026-09-29 l'inclut. Les exécutions du 2026-09-28 ne l'incluaient pas. Les résultats sur un compte avec un plan différent, des souvenirs différents ou sans profil peuvent différer.
- La clé de réponse a été rédigée par un modèle d'IA. Un modèle Claude a rédigé la clé à partir des sources officielles listées ci-dessous. Les éléments DORA RTS et NIS2 IR ont été vérifiés ponctuellement par rapport au texte officiel. Une révision de la clé par un expert humain est en attente, et son résultat sera ajouté ici avec sa date.
Configuration
La méthode complète (conception, clé de réponse et évaluateur) est interne et disponible sur demande : écrivez à support@ismscopilot.com.
| Élément | Valeur |
|---|---|
| Dates | v2, v3 et le contrôle mis de côté le 2026-09-28 (UTC) ; deux tours ultérieurs le 2026-09-29 (UTC), rapportés ci-dessous |
| Orchestrateur | Claude Code 2.1.283, en mode headless, une configuration et un dossier de travail vides et frais pour chaque exécution |
| Modèle | claude-sonnet-5 dans les deux configurations, verrouillé. La recherche web et la récupération web exécutent des sous-appels Claude Haiku 4.5, et leur coût est inclus. |
| Exécutions | N=3 par scénario par configuration, exécutées en paires appariées (les deux configurations commencent le même scénario en même temps) |
| Utilisation de Claude | Clé API Claude, prix publics, tels que rapportés par Claude Code pour chaque exécution |
| ISMS Copilot | Le MCP du compte de production, sur un seul compte ISMS Copilot (le nôtre, sur son plan payant) |
Les deux configurations reçoivent des invites de tâche identiques, et les invites ne mentionnent jamais ISMS Copilot :
| Claude Code seul | Claude Code + ISMS Copilot | |
|---|---|---|
| Outils | Lire, Glob, Grep, Écrire, Modifier, WebSearch, WebFetch | Les mêmes, plus les outils de conversation ISMS Copilot (create_conversation, send_message, get_reply) |
| Instructions | Aucune | La règle de routage Claude Code publiée dans Déléguer le travail GRC depuis votre agent (2026-09-28), en tant que CLAUDE.md du projet |
Les deux configurations disposent de la recherche et de la récupération web, car un utilisateur réel en dispose. La règle de routage décide de ce qui est délégué. Les autres outils de compte (contexte d'entreprise, espaces de travail, souvenirs, documents) n'étaient pas autorisés. Les souvenirs de compte côté serveur d'ISMS Copilot pouvaient tout de même influencer ses réponses, et depuis le 2026-09-29, le profil d'entreprise du compte également, qu'ISMS Copilot ajoute de son côté (voir Limites de ce test).
Scénarios
- S1, recherches. 20 thèmes d'exigences, et la tâche consiste à donner l'identifiant exact pour chacun : 4 articles du DORA RTS, 4 points de l'annexe du NIS2 IR, 4 contrôles de l'ISO/IEC 42001:2023 Annexe A, 4 pratiques du CMMC Niveau 2 et 4 contrôles de l'ISO/IEC 27001:2022 Annexe A. La réponse est un fichier JSON.
- S3, session longue. Une session Claude Code de 8 invites sur un petit dépôt Python : 4 modifications de code (vérifiées par des tests cachés) alternant avec 4 questions GRC avec des réponses clés. Les réponses GRC sont notées ; les vérifications de code sont rapportées séparément.
- S4, conseils rapides. 5 questions oui ou non, chacune avec l'identifiant qui la détermine et une raison en une phrase. Correct uniquement si le oui ou non et l'identifiant correspondent.
- Éléments mis de côté. 20 nouveaux éléments des DORA RTS et NIS2 IR, au format S1, qui n'ont jamais fait partie de la clé de réponse auparavant (voir « L'histoire » ci-dessous).
Tous les fixtures sont fictifs. Aucune donnée client n'a été utilisée.
Comment la clé de réponse a été construite
Chaque élément clé possède l'identifiant canonique, l'exigence en une phrase, une citation et une citation ou un pointeur vers la source. La clé a été construite uniquement à partir de sources officielles, et jamais à partir d'ISMS Copilot, car cela aurait été circulaire :
- DORA RTS (UE) 2024/1774 et NIS2 IR (UE) 2024/2690 : le texte officiel du Bureau des publications de l'UE (CELEX 32024R1774 et 32024R2690), cité aux adresses EUR-Lex.
- CMMC 2.0 Niveau 2 : le guide d'évaluation CMMC Niveau 2 du DoD, avec la publication NIST dont proviennent les numéros de pratiques.
- ISO/IEC 27001:2022 et ISO/IEC 42001:2023 Annexe A : les identifiants des contrôles des normes ISO/IEC 27001 et 42001, décrits avec nos propres termes.
La clé a été figée avant la première exécution, et chaque exécution enregistre un condensé de celle-ci. Elle n'a pas changé pendant le benchmark.
Notation
La notation est mécanique : aucun modèle ne juge une réponse. Un script lit le champ identifiant de chaque réponse et le normalise par type, puis le compare avec la clé :
- DORA RTS : « Article 7 », « Art. 7(4) » et « Article 7(4) de ... » comptent tous comme Article 7.
- NIS2 IR : la réponse doit être un point d'annexe réel et doit figurer dans la liste d'acceptation préenregistrée de l'élément (le point opérationnel et son intitulé). Un point frère est incorrect.
- ISO/IEC 27001:2022 et ISO/IEC 42001:2023 : le numéro de l'Annexe A doit correspondre exactement. La numérotation de 2013, ou une référence à l'Annexe B pour 42001, est incorrecte.
- CMMC Niveau 2 : le numéro de pratique doit correspondre (« SC.L2-3.13.11 » et « 3.13.11 » comptent tous les deux).
Un fichier manquant, un JSON invalide ou un identifiant impossible à analyser compte comme incorrect. Les exécutions qui ont atteint une limite auraient été notées telles quelles, et n'ont jamais été relancées.
Métrique
La métrique principale est les dollars de l'API Claude par réponse correcte : le coût Claude des 3 exécutions d'un scénario divisé par les réponses correctes sur ces 3 exécutions. Il s'agit du prix public que rapporte Claude Code, ce qu'un abonné Claude paie pour une utilisation supplémentaire au-delà du plan. Cela inclut les sous-appels de recherche web et les frais de recherche.
L'utilisation du plan ISMS Copilot n'est pas incluse dans ce chiffre, et elle n'est pas gratuite. Les tours délégués comptent dans votre plan ISMS Copilot (voir Où l'utilisation d'ISMS Copilot est facturée). L'exclure favorise la configuration de délégation sur cette métrique.
La précision, les jetons de l'orchestrateur, les tours et le temps sont rapportés en parallèle. Les jetons et les dollars diffèrent : le contexte répété lu depuis le cache d'invite est facturé à une fraction du prix d'entrée, donc une configuration peut utiliser plus de jetons et coûter moins cher en dollars.
Pré-enregistrement et l'amendement consigné
La conception, la clé de réponse, le système de notation et les règles de victoire ont été engagés avant toute exécution, avec l'engagement de publier les résultats quels qu'ils soient. Les règles de victoire préenregistrées : la précision l'emporte à 10 points de pourcentage ou plus, les dollars par réponse correcte à 1.25 fois ou plus ; tout ce qui est plus proche est une égalité. La réexécution v3 et la vérification des éléments mis de côté ont chacune été préenregistrées de la même manière avant leur première exécution.
Un amendement a été apporté lors de la première exécution (v2). Une limite de 2 millions de jetons de l'orchestrateur par exécution, destinée à prévenir les dépassements, a arrêté le benchmark après la première paire, lorsque Claude Code seul a terminé normalement une exécution de recherche à 2.38 millions de jetons (toutes les 20 réponses correctes). La limite a été relevée à 6 millions pour les deux configurations, le changement a été consigné avec son heure, et rien n'a été relancé. Il a été fait après que ce premier résultat ait été vu. Sans cela, aucun scénario n'aurait eu de verdict. Les limites de dollars et le plafond de dépenses global n'ont pas changé.
L'histoire : v2, la correction, v3 et la vérification mise de côté
v2 a révélé une lacune de connaissances. Lors de la première exécution équitable, ISMS Copilot a égalé Claude Code seul sur chaque élément des normes ISO/IEC 27001, ISO/IEC 42001 et CMMC, mais a manqué la plupart des numéros d'articles du DORA RTS et des points de l'annexe IR de la NIS2. Ses réponses marquaient ces identifiants comme non confirmés.
| Précision de v2 | Claude Code seul | Claude Code + ISMS Copilot |
|---|---|---|
| Recherches S1 | 60/60 | 37/60 |
| Session longue S3 | 12/12 | 9/12 |
| Conseils rapides S4 | 15/15 | 9/15 |
La correction. Nous avons ajouté les connaissances du DORA RTS et de la NIS2 IR à ISMS Copilot au niveau des articles et des points d'annexe, construites à partir des textes officiels de l'UE, et avons ajouté une ligne à la règle de routage : vérifier toute réponse marquée comme non confirmée par ISMS Copilot. Ensuite, nous avons relancé les mêmes scénarios avec la même clé et le même évaluateur.
v3 (même clé, même évaluateur, les deux configurations relancées) :
| Scénario | Configuration | Correct | Précision | Coût Claude $ (3 exécutions) | Coût Claude $ par réponse correcte | Jetons médians de l'orchestrateur par exécution |
|---|---|---|---|---|---|---|
| Recherches S1 | Seul | 60/60 | 100% | 6.92 | 0.115 | 3,194,935 |
| Recherches S1 | + ISMS Copilot | 60/60 | 100% | 3.18 | 0.053 | 1,337,252 |
| Session longue S3 | Seul | 12/12 | 100% | 1.65 | 0.138 | 1,537,697 |
| Session longue S3 | + ISMS Copilot | 12/12 | 100% | 1.75 | 0.146 | 1,742,489 |
| Conseils rapides S4 | Seul | 15/15 | 100% | 0.89 | 0.059 | 501,237 |
| Conseils rapides S4 | + ISMS Copilot | 15/15 | 100% | 0.39 | 0.026 | 255,659 |
Verdicts préenregistrés : la précision est à égalité dans les trois scénarios. Le coût par réponse correcte favorise la configuration avec délégation sur S1 et S4, et S3 est à égalité. Sur S3, chaque vérification de code a réussi dans les deux configurations.
Le gain provenait des réponses d'ISMS Copilot lui-même. Un diagnostic ajouté après les exécutions (sans verdict associé) a révélé que ses réponses contenaient le bon identifiant DORA RTS et NIS2 IR pour 24 des 24 éléments de S1 avant toute vérification web par Claude Code. Aucune réponse de v3 n'a marqué un identifiant comme non confirmé, donc la nouvelle ligne de vérification n'a pas été utilisée. Claude Code a tout de même vérifié sur le web dans S1 et S3 sans y être invité, ce qui n'a modifié aucune réponse et a augmenté le coût de la configuration avec délégation.
La vérification mise de côté (20 nouveaux éléments). Comme la correction des connaissances était basée sur les erreurs de v2, nous avons vérifié si nous avions adapté le test aux données : 10 articles du DORA RTS et 10 points de l'annexe IR de la NIS2 que la clé ne contenait jamais, construits de la même manière à partir des textes officiels, dans le format S1.
| Mise de côté | Configuration | Correct | Précision | Coût Claude $ (3 exécutions) | Coût Claude $ par réponse correcte | Jetons médians de l'orchestrateur par exécution |
|---|---|---|---|---|---|---|
| 20 nouveaux éléments DORA RTS et NIS2 IR | Seul | 58/60 | 96.7% | 4.01 | 0.069 | 1,974,985 |
| 20 nouveaux éléments DORA RTS et NIS2 IR | + ISMS Copilot | 60/60 | 100% | 3.10 | 0.052 | 2,258,506 |
Verdicts préenregistrés : la précision est à égalité (la différence est inférieure à 10 points), et le coût par réponse correcte favorise la configuration avec délégation (1.34 fois). La configuration avec délégation a utilisé plus de jetons ici parce que Claude Code a revérifié les réponses d'ISMS Copilot sur le web dans deux des trois exécutions. Dans l'exécution où il ne l'a pas fait, il a écrit la réponse d'ISMS Copilot dans le fichier et a obtenu 20 sur 20 pour 0.15 $.
Tour du 2026-09-29
Une nouvelle exécution limitée après une mise en production qui a resserré la règle de routage de Claude Code et a commencé à ajouter le profil de l'entreprise aux tours MCP (les deux modifications ne peuvent pas être séparées dans ces chiffres). Même version fixe de Claude Code et même modèle, même clé et même évaluateur, N=3 par scénario par configuration. Elle a exécuté S1 et S4, ainsi que 10 nouveaux éléments mis de côté (5 NIST SP 800-171 Rev. 2, 5 Cyber Resilience Act) qui n'ont jamais été dans la clé. S3 n'a pas été relancé. Les tableaux v3 et mis de côté ci-dessus conservent leurs chiffres originaux.
| Date | Scénario | Configuration | Correct | Précision | Coût Claude $ par réponse correcte |
|---|---|---|---|---|---|
| 2026-09-29 | Recherches S1 | Seul | 60/60 | 100% | 0.110 |
| 2026-09-29 | Recherches S1 | + ISMS Copilot | 60/60 | 100% | 0.026 |
| 2026-09-29 | Conseils rapides S4 | Seul | 15/15 | 100% | 0.064 |
| 2026-09-29 | Conseils rapides S4 | + ISMS Copilot | 15/15 | 100% | 0.035 |
| 2026-09-29 | 10 nouveaux éléments NIST SP 800-171 et CRA | Seul | 30/30 | 100% | 0.027 |
| 2026-09-29 | 10 nouveaux éléments NIST SP 800-171 et CRA | + ISMS Copilot | 29/30 | 96.7% | 0.033 |
Verdicts préenregistrés : la précision est à égalité dans les trois cas. Le coût par réponse correcte favorise la configuration avec délégation sur S1 et S4, et est à égalité sur les nouveaux éléments. La seule erreur provenait d'une exécution en configuration avec délégation qui n'a jamais appelé ISMS Copilot : la liste des cadres de la règle de routage ne mentionnait alors pas NIST SP 800-171 ni le CRA, donc dans 2 des 3 exécutions, Claude Code a recherché ces éléments sur le web à la place. L'exécution qui a délégué a obtenu 10 sur 10. La règle a été mise à jour le 2026-09-29 pour inclure les deux cadres. Les mêmes limites s'appliquent : la précision est au plafond, les instructions diffèrent entre les configurations, et ce tour inclut le profil de l'entreprise du compte.
Tour du 2026-09-29 (contrôle)
Ce tour répond à la question laissée ouverte par la deuxième limite ci-dessus : l'économie provient-elle de la délégation à ISMS Copilot, ou uniquement de la règle de routage indiquant à Claude Code de ne pas revérifier ce dont il est sûr ? Elle ajoute une configuration de contrôle avec une instruction similaire et sans délégation. La conception, les règles de victoire et chaque élément ont été validés avant la première exécution, avec le même engagement de publier les résultats, quels qu'ils soient. Elle a été exécutée après la mise à jour de la règle de routage du 2026-09-29 qui mentionne NIST SP 800-171 et le CRA.
| Configuration | Ce qu'elle inclut |
|---|---|
| A, seule | Recherche web et récupération web, pas de fichier d'instruction (comme dans tous les tours ci-dessus) |
| A2, seule + instruction d'économie | A, plus un fichier d'instruction de 197 mots : répondez à partir de vos propres connaissances, vérifiez sur le web uniquement ce dont vous n'êtes pas sûr, ne revérifiez pas ce dont vous êtes certain. Pas de délégation. |
| A0, seule sans web | Pas d'outils web, pas de fichier d'instruction |
| B, + ISMS Copilot | A, plus les outils de conversation ISMS Copilot et la règle de routage publiée |
| B-fast | B, avec chaque appel à ISMS Copilot en mode Fast, le mode du plan Free |
Même version épinglée de Claude Code 2.1.283 et claude-sonnet-5, même évaluateur, N=3 par scénario par configuration, et les cinq configurations de chaque scénario exécutées en même temps. Scénarios : S1 recherches (20 éléments), S4 conseils rapides (5 questions) et 16 nouveaux éléments mis de côté qui n'ont jamais fait partie de la clé (6 NIST SP 800-171 Rev. 2, 6 Cyber Resilience Act et 4 DORA RTS), construits à partir des textes officiels. S3 n'a pas été réexécuté.
La métrique ici est les tokens Claude par réponse correcte : tokens d'entrée, lecture de cache, création de cache et tokens de sortie sur tous les modèles (y compris les sous-appels de recherche web), sommés sur les 3 exécutions et divisés par les réponses correctes. C'est un indicateur de la vitesse à laquelle une fenêtre d'abonnement Claude est consommée, pas le compteur lui-même : Anthropic ne publie pas comment les tokens en cache comptent dans les limites d'abonnement.
| Tokens Claude par réponse correcte | A | A2 | A0 | B | B-fast |
|---|---|---|---|---|---|
| S1 recherches | 120,877 | 122,814 | 40,552 | 37,805 | 24,473 |
| S4 conseils rapides | 100,920 | 102,145 | 29,424 | 42,142 | 55,582 |
| 16 nouveaux éléments mis de côté | 57,566 | 37,475 | 33,660 | 23,452 | 13,765 |
| Regroupés (123 réponses notées) | 94,033 | 86,398 | 36,326 | 32,733 | 24,088 |
Verdicts préenregistrés contre le contrôle (une victoire nécessite 1.25 fois ou plus) : A2 a utilisé 3.23 fois plus de tokens Claude par réponse correcte que B pour les recherches, 2.44 fois pour les conseils rapides, 1.59 fois pour les nouveaux éléments et 2.64 fois regroupés, donc B l'emporte dans chaque scénario. B a également utilisé moins de dollars de l'API Claude par réponse correcte que A2 dans chaque scénario. L'instruction d'économie à elle seule a à peine modifié le comportement de Claude Code pour les recherches et les conseils rapides (A2 contre A : 1.02 et 1.01, ex æquo) et a aidé pour les nouveaux éléments. L'économie provient de la délégation, pas de l'instruction demandant à Claude Code d'être économe. A0 nécessite peu de tokens car il répond de mémoire, et il se trompe souvent (voir la précision), donc son résultat n'est pas utilisable.
Précision, regroupée : A 99.2%, A2 98.4%, A0 60.2%, B 100%, B-fast 100%. A, A2, B et B-fast sont ex æquo selon la règle des 10 points dans chaque scénario ; A0 a perdu 20 à 46 points dans chaque scénario. La mise en garde concernant le plafond ci-dessus reste valable : les ex æquo le sont par règle, pas une preuve d'une précision égale.
Utilisation du plan ISMS Copilot par réponse correcte. Les tours délégués consomment la fenêtre de 4 heures de votre plan ISMS Copilot. Le tableau indique les tokens ISMS Copilot (entrée et sortie) par réponse correcte en tant que part d'une fenêtre, en utilisant les limites du plan de production au 2026-09-29. Essential est un plan hérité. Unlimited n'a pas de limite de tokens dans la fenêtre.
| Fenêtre ISMS Copilot par réponse correcte | Tokens ISMS Copilot par réponse correcte | Free | Essential | Plus | Standard | Pro | Business | Unlimited |
|---|---|---|---|---|---|---|---|---|
| S1 recherches, B | 3,199 | 0.64% | 0.32% | 0.21% | 0.11% | 0.04% | 0.02% | sans plafond |
| S1 recherches, B-fast | 9,128 | 1.83% | 0.91% | 0.61% | 0.30% | 0.12% | 0.06% | sans plafond |
| S4 conseils rapides, B | 12,104 | 2.42% | 1.21% | 0.81% | 0.40% | 0.16% | 0.08% | sans plafond |
| S4 conseils rapides, B-fast | 24,005 | 4.80% | 2.40% | 1.60% | 0.80% | 0.32% | 0.16% | sans plafond |
| 16 nouveaux éléments mis de côté, B | 3,359 | 0.67% | 0.34% | 0.22% | 0.11% | 0.04% | 0.02% | sans plafond |
| 16 nouveaux éléments mis de côté, B-fast | 3,203 | 0.64% | 0.32% | 0.21% | 0.11% | 0.04% | 0.02% | sans plafond |
Le plan Free permet également seulement 10 messages par fenêtre de 4 heures. B a envoyé un message ISMS Copilot par exécution. En mode fast, Claude Code a divisé le travail en jusqu'à 5 messages par exécution, et pour le quick advice, cela a fait que la limite de messages a été atteinte en premier : environ 7.3% de la fenêtre de messages Free par réponse correcte, contre 4.8% de la fenêtre de tokens, donc environ 3 livrables de quick advice de cette forme remplissent une fenêtre Free. Dans les autres cellules, la fenêtre de tokens se remplit aussi vite ou légèrement plus vite que la fenêtre de messages. B-fast simule uniquement le mode fast sur un compte payant.
Mises en garde pour ce tour : N=3 par scénario par configuration ; une version de l'orchestrateur et un modèle ; une instruction d'économie, rédigée par nous, et une meilleure pourrait réduire l'écart (ce tour montre que celle-ci, raisonnable, ne le fait pas) ; chaque tour délégué s'est exécutée sur notre propre compte payant (celui du fondateur), avec ses souvenirs et son profil d'entreprise ajoutés aux tours MCP ; la métrique des tokens est un indicateur de l'utilisation de l'abonnement ; la clé de réponse a été rédigée par un modèle d'IA ; la précision est plafonnée.
Quand la délégation n'aide pas
Le premier benchmark que nous avons exécuté a testé trois petites tâches ISO 27001 que Claude connaît déjà : une vérification des écarts de quatre courtes politiques fictives, un projet de politique de contrôle d'accès et des entrées de Déclaration d'Applicabilité pour 10 contrôles. Chaque tâche a écrit son livrable dans un fichier, et aucune recherche n'était nécessaire. Aucune des configurations n'avait d'outils web, et les réponses ont été vérifiées uniquement pour leur exhaustivité, pas pour leur exactitude.
| Tâche (médiane de 3 exécutions) | Coût Claude $, seul | Coût Claude $, + ISMS Copilot | Jetons de l'orchestrateur, seul | Jetons de l'orchestrateur, + ISMS Copilot |
|---|---|---|---|---|
| Vérification des écarts | 0.163 | 0.266 | 143,053 | 495,530 |
| Politique de contrôle d'accès | 0.105 | 0.218 | 131,748 | 427,071 |
| Entrées de la Déclaration d'Applicabilité | 0.113 | 0.182 | 133,516 | 349,717 |
La délégation a utilisé 1.6 à 2.1 fois plus d'argent Claude ici. Les exécutions avec délégation ont pris plus de tours (chargement des outils MCP, attente de la réponse), Claude Code a tout de même lu chaque fichier local, et le livrable complet est revenu par l'intermédiaire de Claude Code, qui l'a ensuite écrit sur le disque. Lorsqu'une tâche est petite, que Claude connaît déjà la réponse et que rien ne nécessite de recherche, gardez-la dans votre agent. Voir quoi déléguer et quoi garder localement.
Mises en garde
- Petit échantillon. 3 exécutions par scénario par configuration, le 2026-09-28, plus deux tours ciblés le 2026-09-29.
- Un seul orchestrateur. Claude Code uniquement. Les règles de routage pour Codex, Cursor, OpenCode et Grok sont documentées, mais ces orchestrateurs n'ont pas été mesurés.
- Un seul modèle.
claude-sonnet-5. Un autre modèle, ou une version ultérieure de Claude Code, pourrait se comporter différemment. - Un seul compte. Tous les tours délégués ont été exécutés sur un seul compte de production ISMS Copilot, sur son plan payant, dont les mémoires côté serveur, et à partir du 2026-09-29 son profil d'entreprise, peuvent influencer les réponses.
- Fixtures fictives. Entreprises, politiques et code inventés.
- Revue de documents non testée. Le MCP n'a pas de chemin de téléchargement de documents. Une revue de politique de 40 pages a été exécutée en v2 et a abouti à une égalité, mais Claude Code a effectué la revue lui-même dans les deux configurations, donc cela ne dit rien sur la capacité d'ISMS Copilot à examiner vos documents.
- Auteur de la clé. Les éléments ont été rédigés par un modèle Claude, de la même famille que l'orchestrateur, à partir des textes officiels. Les éléments du DORA RTS et de la NIS2 IR ont été vérifiés ponctuellement par rapport au texte officiel, et les éléments mis de côté ont été vérifiés avant les exécutions. Une revue par un expert humain de la clé est en attente.
- Ce qui est publié. Cette page contient la méthode et tous les chiffres principaux. Les transcriptions brutes restent privées : elles contiennent des identifiants de conversation de production et le résultat textuel exact des modèles. Les invites de tâche, la clé de réponse, l'évaluateur et les sorties évaluées sont conservés dans notre dépôt interne et ne sont pas publiés avec cette page.
Ce que nous affirmons et ce que nous n'affirmons pas
Nous affirmons :
- Sur les éléments testés dans les cinq cadres ci-dessus, Claude Code avec ISMS Copilot a égalé la précision de Claude Code effectuant des recherches seul avec une recherche web (une égalité de précision dans chaque scénario, selon la règle préenregistrée).
- Sur ces recherches et questions de conseils rapides, il a dépensé moins d'argent via l'API Claude par réponse correcte (environ la moitié lors de l'exécution v3, environ les trois quarts lors de la vérification mise de côté du 2026-09-28), et à peu près la même chose lors d'une session longue mixte.
Nous n'affirmons pas :
- Qu'ISMS Copilot est moins cher que Claude, ou qu'il permet une économie en pourcentage sur votre facture.
- Des réponses meilleures que celles de Claude. Les résultats de précision sont à égalité.
- Quoi que ce soit concernant les cadres que nous n'avons pas testés, d'autres orchestrateurs ou modèles, ou la revue de documents.
- Que la délégation permet d'économiser l'utilisation de Claude sur de petites tâches que Claude connaît déjà. Cela a coûté plus cher dans ce cas.
- Que les tours délégués sont gratuits. Ils sont comptabilisés dans votre plan ISMS Copilot.
Nous relançons ce benchmark après des modifications des outils MCP ou des connaissances des cadres d'ISMS Copilot. Les résultats de chaque tour sont ajoutés ici avec leur date dans les 7 jours, quels qu'ils soient. Pour le mécanisme derrière ces chiffres, voir Ce que la délégation permet d'économiser (et ce qu'elle ne permet pas).