Benchmark: Claude Code met en zonder ISMS Copilot
Hoe we hebben gemeten hoe Claude Code alleen werkt tegenover Claude Code die GRC-vragen delegeert aan ISMS Copilot: methode, antwoordsleutel, scoring, resultaten, het geval waarin delegatie niet helpt, en de kanttekeningen.
We hebben één vraag gemeten: wat kost een correct antwoord in Claude-gebruik als je GRC-werk doet in Claude Code, wanneer Claude Code het zelf onderzoekt, en wat kost het als Claude Code de vraag doorgeeft aan ISMS Copilot via MCP? Deze pagina geeft de methode, alle belangrijke cijfers, de run waarbij delegatie niet hielp, de beperkingen van de test, en wat de resultaten wel en niet ondersteunen.
Wat dit ondersteunt
Bij de geteste items bereikte Claude Code die delegeerde aan ISMS Copilot dezelfde nauwkeurigheid als Claude Code die zelf onderzoek deed met websearch: het vooraf geregistreerde nauwkeurigheidsoordeel was in elk scenario gelijk. Het besteedde minder Claude API-geld per correct antwoord voor opzoekingen en snelle adviezen, en ongeveer evenveel voor een lange gemengde sessie met coderen en compliance. De frameworks die op 2026-09-28 zijn getest, zijn ISO/IEC 27001:2022 Bijlage A, ISO/IEC 42001:2023 Bijlage A, CMMC 2.0 Niveau 2, DORA RTS (EU) 2024/1774 en NIS2 IR (EU) 2024/2690, en alleen deze. De ronde van 2026-09-29 voegde 10 achtergehouden items toe uit NIST SP 800-171 Rev. 2 en de Cyber Resilience Act. Gedelegeerde beurten tellen mee voor je ISMS Copilot-abonnement, wat niet is opgenomen in de dollarbedragen. Lees de beperkingen hieronder voordat je op deze cijfers vertrouwt.
Beperkingen van deze test
Lees deze voordat je de resultaten gebruikt
Deze vier beperkingen gelden voor elk resultaat op deze pagina, inclusief de ronde van 2026-09-29.
- Nauwkeurigheid ligt aan het plafond. In v3 scoorden beide opstellingen 100% op de opzoek-, lange-sessie- en snelle-adviescenario's, en in de ronde van 2026-09-29 (die de lange sessie niet herhaalde) scoorden beide 100% op opzoekingen en snelle adviezen. Met deze items en de vooraf geregistreerde regel kon de test alleen een nauwkeurigheidsverschil van 10 procentpunten of meer detecteren. "Gelijk" op deze pagina betekent dat er geen verschil van die grootte is gevonden, niet dat de twee opstellingen bewezen even nauwkeurig zijn.
- De twee opstellingen hebben niet dezelfde instructies gekregen. In v3 hadden de uitgezonderde controle en de eerste ronde van 2026-09-29 alleen Claude Code geen instructiebestand. De delegerende opstelling had de routeringsregel als zijn
CLAUDE.md, en die regel vertelt hem om antwoorden die ISMS Copilot heeft bevestigd niet opnieuw te controleren. Een deel van het kostenverschil kan dus voortkomen uit die instructie in plaats van uit delegatie. De controle is nu uitgevoerd, op 2026-09-29: alleen Claude Code, geïnstrueerd om op het web alleen te verifiëren waar hij onzeker over is, gebruikte ongeveer evenveel Claude-tokens per correct antwoord als zonder instructie over opzoeken en snelle adviezen. De delegerende opstelling gebruikte nog steeds minder Claude-tokens per correct antwoord dan deze in elk scenario (1.6 tot 3.2 keer minder). Zie de sectie "Ronde van 2026-09-29 (controle)" hieronder. De controle testte één zuinigheidsinstructie, door ons geschreven; een betere instructie zou het verschil kunnen verkleinen. - Eén account, met zijn herinneringen en, vanaf 2026-09-29, zijn bedrijfsprofiel. Elke gedelegeerde beurt werd uitgevoerd op één ISMS Copilot-account, het onze (van de oprichter), op zijn betaald abonnement en met zijn accountherinneringen. Sinds 2026-09-29 voegt ISMS Copilot het bedrijfsprofiel toe als achtergrond voor MCP-beurten voor accounts die er een hebben, en dit account heeft er een, dus de ronde van 2026-09-29 bevat dit. De runs van 2026-09-28 niet. Resultaten op een account met een ander abonnement, andere herinneringen of geen profiel kunnen verschillen.
- Het antwoordsleutel is geschreven door een AI-model. Een Claude-model heeft de sleutel geschreven op basis van de officiële bronnen die hieronder worden vermeld. De DORA RTS- en NIS2 IR-items zijn steekproefsgewijs gecontroleerd aan de hand van de officiële tekst. Een beoordeling van de sleutel door een menselijke expert is in afwachting, en het resultaat daarvan wordt hier met de datum toegevoegd.
Opstelling
De volledige methode (ontwerp, antwoordsleutel en beoordelaar) is intern en op aanvraag beschikbaar: schrijf naar support@ismscopilot.com.
| Item | Waarde |
|---|---|
| Data | v2, v3 en de uitgezonderde controle op 2026-09-28 (UTC); twee latere rondes op 2026-09-29 (UTC), hieronder gerapporteerd |
| Orchestrator | Claude Code 2.1.283, headless, een verse lege configuratie en werkmap voor elke run |
| Model | claude-sonnet-5 in beide opstellingen, vastgezet. Websearch en web fetch voeren Claude Haiku 4.5 sub-calls uit, en hun kosten zijn inbegrepen. |
| Runs | N=3 per scenario per opstelling, uitgevoerd als gematchte paren (beide opstellingen starten hetzelfde scenario tegelijkertijd) |
| Claude-gebruik | Claude API-sleutel, lijstprijzen, zoals gerapporteerd door Claude Code voor elke run |
| ISMS Copilot | Het productie-account MCP, op één ISMS Copilot-account (het onze, op zijn betaald abonnement) |
De twee opstellingen krijgen identieke taakprompts, en de prompts vermelden nooit ISMS Copilot:
| Claude Code alleen | Claude Code + ISMS Copilot | |
|---|---|---|
| Tools | Read, Glob, Grep, Write, Edit, WebSearch, WebFetch | Dezelfde, plus de ISMS Copilot-conversatietools (create_conversation, send_message, get_reply) |
| Instructies | Geen | De gepubliceerde Claude Code-routeringsregel uit GRC-werk delegeren vanuit je agent (2026-09-28), als het project CLAUDE.md |
Beide opstellingen hebben websearch en fetch, omdat een echte gebruiker deze ook heeft. De routeringsregel bepaalt wat wordt gedelegeerd. De andere accounttools (bedrijfscontext, werkruimten, herinneringen, documenten) waren niet toegestaan. De server-side accountherinneringen van ISMS Copilot konden nog steeds de antwoorden beïnvloeden, en vanaf 2026-09-29 gold dat ook voor het bedrijfsprofiel van het account, dat ISMS Copilot aan zijn kant toevoegt (zie Beperkingen van deze test).
Scenario's
- S1, opzoekingen. 20 vereiste thema's, en de taak is om de exacte identifier voor elk te geven: 4 DORA RTS-artikelen, 4 NIS2 IR-bijlagepunten, 4 ISO/IEC 42001:2023 Bijlage A-controles, 4 CMMC Niveau 2-praktijken en 4 ISO/IEC 27001:2022 Bijlage A-controles. Het antwoord is een JSON-bestand.
- S3, lange sessie. Eén Claude Code-sessie van 8 prompts op een kleine Python-repository: 4 codebewerkingen (gecontroleerd door verborgen tests) afgewisseld met 4 GRC-vragen met gesleutelde antwoorden. De GRC-antwoorden worden gescoord; de codecontroles worden apart gerapporteerd.
- S4, snel advies. 5 ja-of-nee-vragen, elk met de identifier die het bepaalt en een reden van één zin. Alleen correct als zowel het ja of nee als de identifier overeenkomen.
- Achtergehouden. 20 nieuwe items uit DORA RTS en NIS2 IR, in het S1-formaat, die nog nooit eerder in de antwoordsleutel stonden (zie "Het verhaal" hieronder).
Alle voorbeelden zijn fictief. Er zijn geen klantgegevens gebruikt.
Hoe de antwoordsleutel is opgebouwd
Elk gesleuteld item heeft de canonieke identifier, de vereiste in één zin, een citaat en een quote of verwijzing naar de bron. De sleutel is alleen opgebouwd uit officiële bronnen, en nooit uit ISMS Copilot, omdat dat circulair zou zijn:
- DORA RTS (EU) 2024/1774 en NIS2 IR (EU) 2024/2690: de officiële tekst van het EU Publicatiebureau (CELEX 32024R1774 en 32024R2690), geciteerd naar de EUR-Lex-adressen.
- CMMC 2.0 Niveau 2: de DoD CMMC Niveau 2 Beoordelingsgids, met de NIST-publicatie waar de praktijknummers vandaan komen.
- ISO/IEC 27001:2022 en ISO/IEC 42001:2023 Bijlage A: ISO/IEC 27001- en 42001-items gebruiken controlenummers, in eigen bewoording beschreven.
De sleutel was bevroren voor de eerste run, en elke run registreert een digest ervan. Hij is niet gewijzigd tijdens de benchmark.
Scoring
De scoring is mechanisch: geen enkel model beoordeelt een antwoord. Een script leest het identifier-veld van elk antwoord en normaliseert het per soort, waarna het wordt vergeleken met de sleutel:
- DORA RTS: "Article 7", "Art. 7(4)" en "Article 7(4) of ..." tellen allemaal als Artikel 7.
- NIS2 IR: het antwoord moet een echt bijlagepunt zijn en moet in de vooraf geregistreerde acceptatielijst van het item staan (het operationele punt en zijn kop). Een zusterpunt is fout.
- ISO/IEC 27001:2022 en ISO/IEC 42001:2023: het Bijlage A-nummer moet exact overeenkomen. Nummering uit 2013, of een Bijlage B-verwijzing voor 42001, is fout.
- CMMC Niveau 2: het praktijknummer moet overeenkomen ("SC.L2-3.13.11" en "3.13.11" tellen beide).
Een ontbrekend bestand, ongeldige JSON of een onleesbare identifier telt als fout. Runs die een limiet bereikten, zouden worden gescoord zoals ze waren, en nooit opnieuw worden uitgevoerd.
Metriek
De primaire metriek is Claude API-dollars per correct antwoord: de Claude-kosten van de 3 runs van een scenario gedeeld door de correcte antwoorden over die 3 runs. Het is de lijstprijs die Claude Code rapporteert, wat een Claude-abonnee betaalt voor extra gebruik bovenop het abonnement. Het omvat de websearch sub-calls en zoekkosten.
ISMS Copilot-abonnementsgebruik is niet opgenomen in dit cijfer, en het is niet gratis. Gedelegeerde beurten tellen mee voor je ISMS Copilot-abonnement (zie Waar ISMS Copilot-gebruik wordt gefactureerd). Het weglaten ervan bevoordeelt de delegerende opstelling op deze metriek.
Nauwkeurigheid, orchestrator-tokens, beurten en tijd worden daarnaast gerapporteerd. Tokens en dollars verschillen: herhaalde context die uit de promptcache wordt gelezen, wordt gefactureerd tegen een fractie van de invoerprijs, dus een opstelling kan meer tokens gebruiken en toch minder dollars kosten.
Voorafgaande registratie en de gelogde wijziging
Het ontwerp, de antwoordsleutel, de scorer en de winregels waren vastgelegd voordat er een run werd uitgevoerd, met de toezegging om de resultaten te publiceren, wat ze ook zouden laten zien. De vooraf geregistreerde winregels: nauwkeurigheid wint bij 10 procentpunten of meer, dollars per correct antwoord bij 1.25 keer of meer; alles wat dichterbij ligt, is gelijkspel. De v3-herhaling en de achtergehouden controle waren elk op dezelfde manier vooraf geregistreerd voor hun eerste run.
Eén wijziging werd aangebracht tijdens de eerste run (v2). Een per-run limiet van 2 miljoen orchestrator-tokens, bedoeld als beveiliging tegen runaways, stopte de benchmark na het eerste paar, toen Claude Code alleen een opzoekrun normaal voltooide op 2.38 miljoen tokens (alle 20 correct). De limiet werd verhoogd naar 6 miljoen voor beide opstellingen, de wijziging werd gelogd met de tijd, en niets werd opnieuw uitgevoerd. Dit werd gedaan nadat dat eerste resultaat was gezien. Zonder deze wijziging zou geen enkel scenario een oordeel hebben gehad. Dollarlimieten en het algemene uitgavenplafond zijn niet gewijzigd.
Het verhaal: v2, de oplossing, v3 en de achtergehouden controle
v2 vond een kennislacune. In de eerste eerlijke run presteerde ISMS Copilot gelijk aan Claude Code alleen op elk ISO/IEC 27001-, ISO/IEC 42001- en CMMC-item, maar miste de meeste DORA RTS-artikelnummers en NIS2 IR-bijlagepunten. De antwoorden markeerden deze identificatoren als onbevestigd.
| v2-nauwkeurigheid | Claude Code alleen | Claude Code + ISMS Copilot |
|---|---|---|
| S1-opzoeken | 60/60 | 37/60 |
| S3-lange sessie | 12/12 | 9/12 |
| S4-snelle adviezen | 15/15 | 9/15 |
De oplossing. We hebben DORA RTS- en NIS2 IR-kennis toegevoegd aan ISMS Copilot op artikelniveau en bijlagepunt-niveau, gebaseerd op de officiële EU-teksten, en een regel toegevoegd aan de routeringsregel: verifieer elk antwoord dat ISMS Copilot als onbevestigd markeert. Vervolgens hebben we dezelfde scenario's opnieuw uitgevoerd met dezelfde sleutel en beoordelaar.
v3 (zelfde sleutel, dezelfde beoordelaar, beide opstellingen opnieuw uitgevoerd):
| Scenario | Opstelling | Correct | Nauwkeurigheid | Claude $ (3 runs) | Claude $ per correct | Mediaan orchestrator-tokens per run |
|---|---|---|---|---|---|---|
| S1-opzoeken | Alleen | 60/60 | 100% | 6.92 | 0.115 | 3,194,935 |
| S1-opzoeken | + ISMS Copilot | 60/60 | 100% | 3.18 | 0.053 | 1,337,252 |
| S3-lange sessie | Alleen | 12/12 | 100% | 1.65 | 0.138 | 1,537,697 |
| S3-lange sessie | + ISMS Copilot | 12/12 | 100% | 1.75 | 0.146 | 1,742,489 |
| S4-snelle adviezen | Alleen | 15/15 | 100% | 0.89 | 0.059 | 501,237 |
| S4-snelle adviezen | + ISMS Copilot | 15/15 | 100% | 0.39 | 0.026 | 255,659 |
Vooraf geregistreerde uitspraken: de nauwkeurigheid is gelijk in alle drie de scenario's. Dollars per correct antwoord zijn in het voordeel van de delegerende opstelling bij S1 en S4, en S3 is gelijk. Bij S3 slaagde elke codecontrole in beide opstellingen.
De winst kwam van ISMS Copilot's eigen antwoorden. Een diagnostiek die na de runs werd toegevoegd (zonder gekoppelde uitspraak) stelde vast dat de antwoorden de juiste DORA RTS- en NIS2 IR-identificator bevatten bij 24 van de 24 S1-items voordat Claude Code een webcontrole uitvoerde. Geen enkel v3-antwoord markeerde een identificator als onbevestigd, dus de nieuwe verificatieregel werd niet toegepast. Claude Code controleerde nog steeds op het web in S1 en S3 zonder dat dit werd gevraagd, wat geen antwoord veranderde en de kosten van de delegerende opstelling verhoogde.
De achtergehouden controle (20 nieuwe items). Omdat de kennisaanpassing was afgestemd op de missers van v2, hebben we gecontroleerd op "teaching to the test": 10 DORA RTS-artikelen en 10 NIS2 IR-bijlagepunten die de sleutel nooit bevatte, op dezelfde manier opgebouwd uit de officiële teksten, in het S1-formaat.
| Achtergehouden | Opstelling | Correct | Nauwkeurigheid | Claude $ (3 runs) | Claude $ per correct | Mediaan orchestrator-tokens per run |
|---|---|---|---|---|---|---|
| 20 nieuwe DORA RTS- en NIS2 IR-items | Alleen | 58/60 | 96.7% | 4.01 | 0.069 | 1,974,985 |
| 20 nieuwe DORA RTS- en NIS2 IR-items | + ISMS Copilot | 60/60 | 100% | 3.10 | 0.052 | 2,258,506 |
Vooraf geregistreerde uitspraken: de nauwkeurigheid is gelijk (het verschil is minder dan 10 punten), en dollars per correct antwoord zijn in het voordeel van de delegerende opstelling (1.34 keer). De delegerende opstelling gebruikte hier meer tokens omdat Claude Code de antwoorden van ISMS Copilot in twee van de drie runs opnieuw op het web controleerde. In de run waarin dit niet gebeurde, schreef het het antwoord van ISMS Copilot naar het bestand en scoorde 20 van 20 voor $0.15.
Ronde van 2026-09-29
Een beperkte herhaling na een productierelease die de Claude Code-routeringsregel aanscherpte en het bedrijfsprofiel begon toe te voegen aan MCP-beurten (de twee wijzigingen kunnen in deze cijfers niet worden gescheiden). Dezelfde vaste Claude Code en model, dezelfde sleutel en beoordelaar, N=3 per scenario per opstelling. Er werden S1 en S4 uitgevoerd, en 10 nieuwe achtergehouden items (5 NIST SP 800-171 Rev. 2, 5 Cyber Resilience Act) die nooit in de sleutel stonden. S3 werd niet opnieuw uitgevoerd. De v3- en achtergehouden tabellen hierboven behouden hun oorspronkelijke cijfers.
| Datum | Scenario | Opstelling | Correct | Nauwkeurigheid | Claude $ per correct |
|---|---|---|---|---|---|
| 2026-09-29 | S1-opzoeken | Alleen | 60/60 | 100% | 0.110 |
| 2026-09-29 | S1-opzoeken | + ISMS Copilot | 60/60 | 100% | 0.026 |
| 2026-09-29 | S4-snelle adviezen | Alleen | 15/15 | 100% | 0.064 |
| 2026-09-29 | S4-snelle adviezen | + ISMS Copilot | 15/15 | 100% | 0.035 |
| 2026-09-29 | 10 nieuwe NIST SP 800-171- en CRA-items | Alleen | 30/30 | 100% | 0.027 |
| 2026-09-29 | 10 nieuwe NIST SP 800-171- en CRA-items | + ISMS Copilot | 29/30 | 96.7% | 0.033 |
Vooraf geregistreerde uitspraken: de nauwkeurigheid is gelijk in alle drie de scenario's. Dollars per correct antwoord zijn in het voordeel van de delegerende opstelling bij S1 en S4, en zijn gelijk bij de nieuwe items. De ene misser kwam van een delegerende-opstelling-run die ISMS Copilot nooit heeft aangeroepen: de routeringsregel bevatte toen nog niet de frameworks NIST SP 800-171 of de CRA in de lijst, dus in 2 van de 3 runs onderzocht Claude Code deze items op het web. De ene run die wel delegeerde, scoorde 10 van 10. De regel is op 2026-09-29 bijgewerkt om beide frameworks te vermelden. Dezelfde beperkingen gelden: de nauwkeurigheid zit aan het plafond, de instructies verschillen tussen de opstellingen, en deze ronde bevat het bedrijfsprofiel van de account.
Ronde van 2026-09-29 (controle)
Deze ronde beantwoordt de vraag die de tweede limiet hierboven openlaat: komt de besparing voort uit het delegeren aan ISMS Copilot, of alleen uit de routeringsregel die Claude Code instrueert om niet opnieuw te controleren waar het vertrouwen in heeft? Er is een controleopstelling toegevoegd met een vergelijkbare instructie en zonder delegatie. Het ontwerp, de winstregels en elk item werden vastgelegd vóór de eerste run, met dezelfde toezegging om de resultaten te publiceren, ongeacht de uitkomst. De ronde werd uitgevoerd na de routeringsregelupdate van 2026-09-29 die NIST SP 800-171 en de CRA benoemt.
| Opstelling | Wat het bevat |
|---|---|
| A, alleen | Websearch en webfetch, geen instructiebestand (zoals in elke ronde hierboven) |
| A2, alleen + zuinigheidsinstructie | A, plus een instructiebestand van 197 woorden: antwoord vanuit je eigen kennis, verifieer op het web alleen waar je onzeker over bent, controleer niet opnieuw waar je vertrouwen in hebt. Geen delegatie. |
| A0, alleen zonder web | Geen webtools, geen instructiebestand |
| B, + ISMS Copilot | A, plus de ISMS Copilot conversatietools en de gepubliceerde routeringsregel |
| B-fast | B, waarbij elke ISMS Copilot-aanroep in fast mode gebeurt, de modus van het Gratis abonnement |
Dezelfde vastgezette Claude Code 2.1.283 en claude-sonnet-5, dezelfde scorer, N=3 per scenario per opstelling, en de vijf opstellingen van elk scenario werden tegelijkertijd uitgevoerd. Scenario's: S1-opzoeken (20 items), S4-snelle adviezen (5 vragen) en 16 nieuwe, achtergehouden items die nooit in de sleutel stonden (6 NIST SP 800-171 Rev. 2, 6 Cyber Resilience Act en 4 DORA RTS), gebouwd op basis van de officiële teksten. S3 werd niet opnieuw uitgevoerd.
De metric hier is Claude tokens per correct antwoord: input, cache read, cache creation en output tokens over alle modellen (inclusief websearch sub-calls), opgeteld over de 3 runs en gedeeld door het aantal correcte antwoorden. Het is een proxy voor hoe snel een Claude-abonnementsvenster verbruikt wordt, niet de meter zelf: Anthropic publiceert niet hoe gecachte tokens meetellen voor abonnementslimieten.
| Claude tokens per correct antwoord | A | A2 | A0 | B | B-fast |
|---|---|---|---|---|---|
| S1-opzoeken | 120,877 | 122,814 | 40,552 | 37,805 | 24,473 |
| S4-snelle adviezen | 100,920 | 102,145 | 29,424 | 42,142 | 55,582 |
| 16 nieuwe, achtergehouden items | 57,566 | 37,475 | 33,660 | 23,452 | 13,765 |
| Gecombineerd (123 gescoorde antwoorden) | 94,033 | 86,398 | 36,326 | 32,733 | 24,088 |
Vooraf vastgestelde uitspraken ten opzichte van de controle (een overwinning vereist 1.25 keer of meer): A2 gebruikte 3.23 keer de Claude tokens per correct antwoord van B bij lookups, 2.44 keer bij quick advice, 1.59 keer bij de nieuwe items en 2.64 keer gecombineerd, dus B wint in elk scenario. B gebruikte ook minder Claude API-dollars per correct antwoord dan A2 in elk scenario. De zuinigheidsinstructie alleen had nauwelijks effect op Claude Code bij lookups en quick advice (A2 tegen A: 1.02 en 1.01, gelijke stand) en hielp bij de nieuwe items. De besparing komt voort uit delegatie, niet uit het instrueren van Claude Code om zuinig te zijn. A0 heeft weinig tokens nodig omdat het vanuit het geheugen antwoordt, en het is vaak onjuist (zie nauwkeurigheid), dus het cijfer is geen bruikbaar resultaat.
Nauwkeurigheid, gecombineerd: A 99.2%, A2 98.4%, A0 60.2%, B 100%, B-fast 100%. A, A2, B en B-fast zijn gelijke stand volgens de 10-puntenregel in elk scenario; A0 verloor 20 tot 46 punten in elk scenario. De opmerking over het plafond blijft staan: gelijke stand is gelijke stand volgens de regel, geen bewijs van gelijke nauwkeurigheid.
ISMS Copilot-plangebruik per correct antwoord. Gedelegeerde beurten gebruiken het 4-uursvenster van je ISMS Copilot-plan. De tabel toont ISMS Copilot-tokens (input en output) per correct antwoord als aandeel van één venster, gebaseerd op de productieplanlimieten van 2026-09-29. Essential is een overgangsplan. Unlimited heeft geen tokenlimiet in het venster.
| ISMS Copilot-venster per correct antwoord | ISMS Copilot-tokens per correct antwoord | Free | Essential | Plus | Standard | Pro | Business | Unlimited |
|---|---|---|---|---|---|---|---|---|
| S1-opzoeken, B | 3,199 | 0.64% | 0.32% | 0.21% | 0.11% | 0.04% | 0.02% | geen limiet |
| S1-opzoeken, B-fast | 9,128 | 1.83% | 0.91% | 0.61% | 0.30% | 0.12% | 0.06% | geen limiet |
| S4-snelle adviezen, B | 12,104 | 2.42% | 1.21% | 0.81% | 0.40% | 0.16% | 0.08% | geen limiet |
| S4-snelle adviezen, B-fast | 24,005 | 4.80% | 2.40% | 1.60% | 0.80% | 0.32% | 0.16% | geen limiet |
| 16 nieuwe, achtergehouden items, B | 3,359 | 0.67% | 0.34% | 0.22% | 0.11% | 0.04% | 0.02% | geen limiet |
| 16 nieuwe, achtergehouden items, B-fast | 3,203 | 0.64% | 0.32% | 0.21% | 0.11% | 0.04% | 0.02% | geen limiet |
Het Free-plan staat ook slechts 10 berichten per 4-uursvenster toe. B stuurde één ISMS Copilot-bericht per run. In fast-modus splitste Claude Code het werk in maximaal 5 berichten per run, en bij quick advice werd de berichtenlimiet als eerste bereikt: ongeveer 7.3% van het berichtenvenster van Free per correct antwoord, tegenover 4.8% van het tokenvenster. Hierdoor vullen ongeveer 3 quick-advice-leveringen van deze omvang een Free-venster. In de andere cellen raakt het tokenvenster even snel of iets sneller vol dan het berichtenvenster. B-fast simuleert alleen fast-modus op een betaald account.
Opmerkingen bij deze ronde: N=3 per scenario per opstelling; één orchestratorversie en één model; één zuinigheidsinstructie, door ons geschreven, en een betere zou het verschil kunnen verkleinen (deze ronde laat zien dat deze redelijke instructie dat niet doet); elke gedelegeerde beurt werd uitgevoerd op ons eigen (van de oprichter) betaalde account, met zijn herinneringen en zijn bedrijfsprofiel toegevoegd aan MCP-beurten; de tokenmetric is een proxy voor abonnementsgebruik; de antwoordsleutel is geschreven door een AI-model; nauwkeurigheid ligt aan het plafond.
Waar delegatie niet helpt
De eerste benchmark die we uitvoerden, testte drie kleine ISO 27001-taken die Claude al kent: een gap-check van vier korte fictieve beleidsdocumenten, een ontwerp voor een toegangsbeheerbeleid en Statement of Applicability-items voor 10 controls. Elke taak schreef het resultaat naar een bestand, en er waren geen opzoeken nodig. Geen van beide opstellingen had webtools, en antwoorden werden alleen op volledigheid gecontroleerd, niet op juistheid.
| Taak (mediaan van 3 runs) | Claude $, alleen | Claude $, + ISMS Copilot | Orchestrator-tokens, alleen | Orchestrator-tokens, + ISMS Copilot |
|---|---|---|---|---|
| Gap-check | 0.163 | 0.266 | 143,053 | 495,530 |
| Toegangsbeheerbeleid | 0.105 | 0.218 | 131,748 | 427,071 |
| SoA-items | 0.113 | 0.182 | 133,516 | 349,717 |
Delegatie kostte hier 1.6 tot 2.1 keer meer Claude-geld. De delegerende runs namen meer beurten in beslag (laden van de MCP-tools, wachten op het antwoord), Claude Code las nog steeds elk lokaal bestand, en het volledige resultaat kwam terug via Claude Code, dat het vervolgens naar schijf schreef. Als een taak klein is, Claude het antwoord al kent en er niets opgezocht hoeft te worden, houd het dan in je agent. Zie wat te delegeren en wat lokaal te houden.
Beperkingen
- Kleine N. 3 runs per scenario per opstelling, op 2026-09-28, plus twee afgebakende rondes op 2026-09-29.
- Eén orchestrator. Alleen Claude Code. Routeringsregels voor Codex, Cursor, OpenCode en Grok zijn gedocumenteerd, maar deze orchestratoren zijn niet gemeten.
- Eén model.
claude-sonnet-5. Een ander model, of een latere versie van Claude Code, kan zich anders gedragen. - Eén account. Alle gedelegeerde beurten werden uitgevoerd op één productie-ISMS Copilot-account, op het betaalde abonnement, waarvan de server-side herinneringen, en vanaf 2026-09-29 het bedrijfsprofiel, de antwoorden kunnen beïnvloeden.
- Fictieve voorbeelden. Verzonnen bedrijven, beleidsdocumenten en code.
- Documentbeoordeling niet getest. De MCP heeft geen mogelijkheid om documenten te uploaden. Een beoordeling van een beleidsdocument van 40 pagina's werd uitgevoerd in v2 en eindigde gelijk, maar Claude Code voerde de beoordeling zelf uit in beide opstellingen, dus dit zegt niets over ISMS Copilot die jouw documenten beoordeelt.
- Sleutelauteur. De items zijn geschreven door een Claude-model, uit dezelfde familie als de orchestrator, op basis van de officiële teksten. De DORA RTS- en NIS2 IR-items zijn steekproefsgewijs gecontroleerd aan de hand van de officiële tekst, en de achtergehouden items zijn gecontroleerd voordat de runs werden uitgevoerd. Een beoordeling door een menselijke expert van de sleutel staat nog uit.
- Wat gepubliceerd is. Deze pagina bevat de methode en alle hoofdgetallen. De ruwe transcripties blijven privé: ze bevatten productieconversatie-identificatoren en letterlijke modeloutput. De taakprompts, antwoordsleutel, beoordelaar en beoordeelde outputs worden bewaard in ons interne repository en worden niet samen met deze pagina gepubliceerd.
Wat we beweren en wat we niet beweren
We beweren:
- Op de geteste items in de vijf bovenstaande frameworks presteerde Claude Code met ISMS Copilot even nauwkeurig als Claude Code die alleen met websearch onderzoekt (een nauwkeurigheidsgelijkheid in elk scenario, volgens de vooraf geregistreerde regel).
- Bij die opzoekingen en snelle-adviesvragen gaf het minder Claude API-geld uit per correct antwoord (ongeveer de helft in de v3-run, ongeveer driekwart bij de achtergehouden controle van 2026-09-28), en ongeveer hetzelfde bij een lange gemengde sessie.
We beweren niet:
- Dat ISMS Copilot goedkoper is dan Claude, of een bepaald percentage besparing op je rekening.
- Betere antwoorden dan Claude. De nauwkeurigheidsresultaten zijn gelijk.
- Iets over frameworks die we niet hebben getest, andere orchestratoren of modellen, of documentbeoordeling.
- Dat delegatie Claude-gebruik bespaart bij kleine taken die Claude al kent. Het kostte daar meer.
- Dat gedelegeerde beurten gratis zijn. Ze worden afgetrokken van je ISMS Copilot-abonnement.
We voeren deze benchmark opnieuw uit na wijzigingen in de MCP-tools of in de frameworkkennis van ISMS Copilot. De resultaten van elke ronde worden hier binnen 7 dagen toegevoegd met hun datum, wat ze ook laten zien. Voor het mechanisme achter deze cijfers, zie Wat delegatie bespaart (en wat niet).