Benchmark: Claude Code mit und ohne ISMS Copilot
Wie wir gemessen haben, wie Claude Code allein im Vergleich zu Claude Code mit Delegation von GRC-Fragen an ISMS Copilot arbeitet: Methode, Antwortschlüssel, Bewertung, Ergebnisse, Fälle, in denen Delegation nicht hilft, und Einschränkungen.
Wir haben eine Frage gemessen: Was kostet eine korrekte Antwort in Claude-Nutzung, wenn Sie GRC-Arbeit in Claude Code erledigen und Claude Code die Recherche allein durchführt – und was kostet sie, wenn Claude Code die Frage über MCP an ISMS Copilot delegiert? Diese Seite enthält die Methode, alle zentralen Zahlen, den Durchlauf, bei dem die Delegation nicht half, die Grenzen des Tests sowie eine Einschätzung, was die Ergebnisse stützen und was nicht.
Was diese Ergebnisse stützen
Bei den getesteten Punkten erreichte Claude Code durch Delegation an ISMS Copilot die gleiche Genauigkeit wie Claude Code bei alleiniger Recherche mit Websuche: Das vorab festgelegte Genauigkeitsurteil endete in jedem Szenario unentschieden. Pro korrekter Antwort gab es bei Nachschlagevorgängen und schnellen Ratschlägen weniger Claude-API-Kosten, und etwa gleich viel bei einer langen gemischten Coding- und Compliance-Sitzung. Die am 2026-09-28 getesteten Frameworks sind ISO/IEC 27001:2022 Anhang A, ISO/IEC 42001:2023 Anhang A, CMMC 2.0 Level 2, DORA RTS (EU) 2024/1774 und NIS2 IR (EU) 2024/2690 – und nur diese. Die Runde vom 2026-09-29 fügte 10 zurückgehaltene Punkte aus NIST SP 800-171 Rev. 2 und dem Cyber Resilience Act hinzu. Delegierte Durchläufe zählen gegen Ihren ISMS Copilot-Plan, der nicht in den Dollarbeträgen enthalten ist. Lesen Sie die Grenzen unten, bevor Sie sich auf diese Zahlen verlassen.
Grenzen dieses Tests
Lesen Sie dies, bevor Sie die Ergebnisse nutzen
Diese vier Grenzen gelten für jedes Ergebnis auf dieser Seite, einschließlich der Runde vom 2026-09-29.
- Genauigkeit liegt an der Obergrenze. In Version 3 erzielten beide Setups 100 % in den Nachschlage-, Langsitzungs- und Schnellberatungsszenarien, und in der Runde vom 2026-09-29 (die die Langsitzung nicht wiederholte) ebenfalls 100 % bei Nachschlagevorgängen und Schnellberatung. Mit diesen Punkten und der vorab festgelegten Regel konnte der Test nur eine Genauigkeitslücke von 10 Prozentpunkten oder mehr erkennen. „Übereinstimmung“ auf dieser Seite bedeutet, dass kein Unterschied dieser Größe gefunden wurde, nicht dass die beiden Setups nachweislich gleich genau sind.
- Die beiden Setups erhielten nicht dieselben Anweisungen. In v3 hatte beim zurückgehaltenen Check und in der ersten Runde vom 2026-09-29 nur Claude Code allein keine Anweisungsdatei. Das delegierende Setup verfügte über die Routing-Regel als
CLAUDE.md, und diese Regel besagt, dass es Antworten, die der ISMS Copilot bestätigt hat, nicht erneut überprüfen soll. Daher könnte ein Teil des Kostenunterschieds auf diese Anweisung und nicht auf die Delegation zurückzuführen sein. Die Kontrollrunde wurde nun am 2026-09-29 durchgeführt: Claude Code allein, angewiesen, nur das im Web zu verifizieren, bei dem es unsicher ist, verbrauchte etwa genauso viele Claude-Tokens pro korrekter Antwort wie ohne Anweisung zu Nachschlagevorgängen und schneller Beratung. Das delegierende Setup verbrauchte jedoch in jedem Szenario weiterhin weniger Claude-Tokens pro korrekter Antwort als dieses (1.6- bis 3.2-mal weniger). Siehe den Abschnitt „Runde vom 2026-09-29 (Kontrolle)“ unten. Die Kontrolle testete eine von uns verfasste Sparanweisung; eine bessere könnte die Lücke weiter verringern. - Ein Account mit seinen Erinnerungen und, ab 2026-09-29, seinem Unternehmensprofil. Jeder delegierte Durchlauf lief auf einem ISMS Copilot-Account, unserem eigenen (dem des Gründers), auf seinem Bezahlplan und mit seinen Account-Erinnerungen. Seit dem 2026-09-29 fügt ISMS Copilot das Unternehmensprofil als Hintergrund für MCP-Durchläufe bei Accounts hinzu, die eines haben, und dieser Account hat eines, sodass die Runde vom 2026-09-29 es enthält. Die Durchläufe vom 2026-09-28 taten dies nicht. Ergebnisse auf einem Account mit einem anderen Plan, anderen Erinnerungen oder ohne Profil können abweichen.
- Der Lösungsschlüssel wurde von einem KI-Modell erstellt. Ein Claude-Modell erstellte den Schlüssel aus den unten aufgeführten offiziellen Quellen. Die DORA RTS- und NIS2 IR-Punkte wurden stichprobenartig mit dem offiziellen Text abgeglichen. Eine Überprüfung des Schlüssels durch einen menschlichen Experten steht noch aus, und das Ergebnis wird hier mit Datum ergänzt.
Aufbau
Die vollständige Methode (Design, Antwortschlüssel und Bewerter) ist intern und auf Anfrage verfügbar: Schreiben Sie an support@ismscopilot.com.
| Punkt | Wert |
|---|---|
| Daten | v2, v3 und der zurückgehaltene Check am 2026-09-28 (UTC); zwei spätere Runden am 2026-09-29 (UTC), unten berichtet |
| Orchestrator | Claude Code 2.1.283, headless, eine frische leere Konfiguration und ein leerer Arbeitsordner für jeden Durchlauf |
| Modell | claude-sonnet-5 in beiden Setups, fest eingestellt. Websuche und Webabruf führen Claude Haiku 4.5-Subaufrufe aus, deren Kosten enthalten sind. |
| Durchläufe | N=3 pro Szenario pro Setup, als gepaarte Durchläufe (beide Setups starten dasselbe Szenario zur gleichen Zeit) |
| Claude-Nutzung | Claude-API-Schlüssel, Listenpreise, wie von Claude Code für jeden Durchlauf gemeldet |
| ISMS Copilot | Das Produktions-Account-MCP, auf einem ISMS Copilot-Account (unserem, auf seinem Bezahlplan) |
Beide Setups erhalten identische Aufgabenprompts, und die Prompts erwähnen ISMS Copilot nie:
| Claude Code allein | Claude Code + ISMS Copilot | |
|---|---|---|
| Tools | Read, Glob, Grep, Write, Edit, WebSearch, WebFetch | Dieselben, plus die ISMS Copilot-Konversationstools (create_conversation, send_message, get_reply) |
| Anweisungen | Keine | Die veröffentlichte Claude Code-Routing-Regel aus GRC-Arbeit von Ihrem Agenten delegieren (2026-09-28), als Projekt-CLAUDE.md |
Beide Setups verfügen über Websuche und -abruf, da ein echter Nutzer diese hat. Die Routing-Regel entscheidet, was delegiert wird. Die anderen Account-Tools (Unternehmenskontext, Arbeitsbereiche, Erinnerungen, Dokumente) waren nicht zugelassen. Die serverseitigen Account-Erinnerungen von ISMS Copilot konnten dennoch seine Antworten beeinflussen, und ab dem 2026-09-29 auch das Unternehmensprofil des Accounts, das ISMS Copilot serverseitig hinzufügt (siehe Grenzen dieses Tests).
Szenarien
- S1, Nachschlagevorgänge. 20 Anforderungsthemen, und die Aufgabe besteht darin, den genauen Bezeichner für jedes anzugeben: 4 DORA RTS-Artikel, 4 NIS2 IR-Anhangspunkte, 4 ISO/IEC 42001:2023 Anhang A-Kontrollen, 4 CMMC Level 2-Praktiken und 4 ISO/IEC 27001:2022 Anhang A-Kontrollen. Die Antwort ist eine JSON-Datei.
- S3, lange Sitzung. Eine Claude Code-Sitzung mit 8 Prompts zu einem kleinen Python-Repository: 4 Code-Änderungen (geprüft durch versteckte Tests) im Wechsel mit 4 GRC-Fragen mit festgelegten Antworten. Die GRC-Antworten werden bewertet; die Code-Prüfungen werden separat berichtet.
- S4, schnelle Beratung. 5 Ja- oder Nein-Fragen, jeweils mit dem Bezeichner, der die Entscheidung trifft, und einer ein Satz langen Begründung. Nur korrekt, wenn sowohl das Ja oder Nein als auch der Bezeichner übereinstimmen.
- Zurückgehalten. 20 neue Punkte aus DORA RTS und NIS2 IR im S1-Format, die zuvor nie im Lösungsschlüssel enthalten waren (siehe „Die Geschichte“ unten).
Alle Beispiele sind fiktiv. Es wurden keine Kundendaten verwendet.
Wie der Lösungsschlüssel erstellt wurde
Jeder festgelegte Punkt enthält den kanonischen Bezeichner, die Anforderung in einem Satz, einen Verweis und ein Zitat oder einen Hinweis auf die Quelle. Der Schlüssel wurde ausschließlich aus offiziellen Quellen erstellt und niemals von ISMS Copilot, da dies zirkulär wäre:
- DORA RTS (EU) 2024/1774 und NIS2 IR (EU) 2024/2690: der offizielle Text vom Amt für Veröffentlichungen der EU (CELEX 32024R1774 und 32024R2690), zitiert mit den EUR-Lex-Adressen.
- CMMC 2.0 Level 2: der DoD CMMC Level 2 Assessment Guide, mit der NIST-Veröffentlichung, aus der die Praktikennummern stammen.
- ISO/IEC 27001:2022 und ISO/IEC 42001:2023 Anhang A: Elemente der ISO/IEC 27001 und 42001 verwenden Kontrollkennungen, die in unseren eigenen Worten beschrieben sind.
Der Schlüssel wurde vor dem ersten Durchlauf eingefroren, und jeder Durchlauf zeichnet einen Digest davon auf. Er änderte sich während des Benchmarks nicht.
Bewertung
Die Bewertung erfolgt mechanisch: Kein Modell beurteilt eine Antwort. Ein Skript liest das Bezeichnerfeld jeder Antwort, normalisiert es nach Art und vergleicht es mit dem Schlüssel:
- DORA RTS: „Article 7“, „Art. 7(4)“ und „Article 7(4) of ...“ zählen alle als Artikel 7.
- NIS2 IR: Die Antwort muss ein echter Anhangspunkt sein und in der vorab festgelegten Akzeptanzliste des Punkts enthalten sein (der operative Punkt und seine Überschrift). Ein Geschwisterpunkt ist falsch.
- ISO/IEC 27001:2022 und ISO/IEC 42001:2023: Die Anhang A-Nummer muss exakt übereinstimmen. Nummerierung aus 2013 oder ein Anhang B-Verweis für 42001 ist falsch.
- CMMC Level 2: Die Praktikennummer muss übereinstimmen („SC.L2-3.13.11“ und „3.13.11“ zählen beide).
Eine fehlende Datei, ungültiges JSON oder ein nicht analysierbarer Bezeichner zählen als falsch. Durchläufe, die ein Limit erreichten, wären so bewertet worden, wie sie waren, und wurden nie wiederholt.
Metrik
Die primäre Metrik ist Claude-API-Dollar pro korrekter Antwort: Die Claude-Kosten der 3 Durchläufe eines Szenarios geteilt durch die korrekten Antworten in diesen 3 Durchläufen. Es handelt sich um den Listenpreis, den Claude Code meldet, den ein Claude-Abonnent für zusätzliche Nutzung über den Plan hinaus zahlt. Enthalten sind die Websuche-Subaufrufe und Suchgebühren.
Die Nutzung des ISMS Copilot-Plans ist nicht in dieser Zahl enthalten und ist nicht kostenlos. Delegierte Durchläufe zählen gegen Ihren ISMS Copilot-Plan (siehe Wo ISMS Copilot-Nutzung abgerechnet wird). Das Weglassen begünstigt das delegierende Setup bei dieser Metrik.
Genauigkeit, Orchestrator-Tokens, Durchläufe und Zeit werden zusätzlich berichtet. Tokens und Dollar unterscheiden sich: Wiederholter Kontext, der aus dem Prompt-Cache gelesen wird, wird zu einem Bruchteil des Eingabepreises abgerechnet, sodass ein Setup mehr Tokens verbrauchen und dennoch weniger Dollar kosten kann.
Vorabregistrierung und die protokollierte Änderung
Das Design, der Lösungsschlüssel, der Bewerter und die Gewinnregeln wurden vor jedem Durchlauf festgeschrieben, mit der Verpflichtung, die Ergebnisse unabhängig vom Ausgang zu veröffentlichen. Die vorab festgelegten Gewinnregeln: Genauigkeit gewinnt bei 10 Prozentpunkten oder mehr, Dollar pro korrekter Antwort bei 1.25-fachem oder mehr; alles, was näher liegt, ist ein Unentschieden. Die v3-Wiederholung und der zurückgehaltene Check wurden jeweils auf dieselbe Weise vor ihrem ersten Durchlauf vorab registriert.
Eine Änderung wurde während des ersten Durchlaufs (v2) vorgenommen. Ein pro Durchlauf festgelegtes Limit von 2 Millionen Orchestrator-Tokens, das als Schutz vor Endlosschleifen gedacht war, stoppte den Benchmark nach dem ersten Paar, als Claude Code allein einen Nachschlage-Durchlauf normal bei 2.38 Millionen Tokens beendete (alle 20 korrekt). Das Limit wurde für beide Setups auf 6 Millionen erhöht, die Änderung wurde mit Zeitstempel protokolliert, und nichts wurde wiederholt. Sie erfolgte, nachdem dieses erste Ergebnis bereits vorlag. Ohne diese Änderung hätte kein Szenario ein Urteil erhalten. Dollar-Limits und die Gesamtausgaben-Obergrenze änderten sich nicht.
Die Geschichte: v2, die Lösung, v3 und die zurückgehaltene Prüfung
v2 deckte eine Wissenslücke auf. Im ersten fairen Durchlauf stimmte ISMS Copilot mit Claude Code allein bei jedem ISO/IEC 27001-, ISO/IEC 42001- und CMMC-Punkt überein, verfehlte jedoch die meisten DORA-RTS-Artikelnummern und NIS2-IR-Anhangspunkte. Seine Antworten markierten diese Kennungen als unbestätigt.
| v2-Genauigkeit | Nur Claude Code | Claude Code + ISMS Copilot |
|---|---|---|
| S1-Abfragen | 60/60 | 37/60 |
| S3-lange Sitzung | 12/12 | 9/12 |
| S4-schnelle Beratung | 15/15 | 9/15 |
Die Lösung. Wir fügten ISMS Copilot Wissen zu DORA RTS und NIS2 IR auf Artikel- und Anhangspunktebene hinzu, basierend auf den offiziellen EU-Texten, und ergänzten eine Zeile in der Routing-Regel: Überprüfe jede Antwort, die ISMS Copilot als unbestätigt markiert. Anschließend führten wir dieselben Szenarien mit demselben Schlüssel und Bewerter erneut durch.
v3 (gleicher Schlüssel, gleicher Bewerter, beide Setups erneut durchgeführt):
| Szenario | Setup | Korrekt | Genauigkeit | Claude $ (3 Durchläufe) | Claude $ pro korrekter Antwort | Median Orchestrator-Tokens pro Durchlauf |
|---|---|---|---|---|---|---|
| S1-Abfragen | Allein | 60/60 | 100% | 6.92 | 0.115 | 3,194,935 |
| S1-Abfragen | + ISMS Copilot | 60/60 | 100% | 3.18 | 0.053 | 1,337,252 |
| S3-lange Sitzung | Allein | 12/12 | 100% | 1.65 | 0.138 | 1,537,697 |
| S3-lange Sitzung | + ISMS Copilot | 12/12 | 100% | 1.75 | 0.146 | 1,742,489 |
| S4-schnelle Beratung | Allein | 15/15 | 100% | 0.89 | 0.059 | 501,237 |
| S4-schnelle Beratung | + ISMS Copilot | 15/15 | 100% | 0.39 | 0.026 | 255,659 |
Vorregistrierte Ergebnisse: Die Genauigkeit ist in allen drei Szenarien gleichauf. Die Kosten pro korrekter Antwort begünstigen das delegierende Setup bei S1 und S4, und S3 ist gleichauf. Bei S3 bestanden alle Code-Prüfungen in beiden Setups.
Der Gewinn stammte von ISMS Copilots eigenen Antworten. Eine nach den Durchläufen hinzugefügte Diagnose (ohne angehängtes Ergebnis) ergab, dass seine Antworten die richtige DORA-RTS- und NIS2-IR-Kennung bei 24 von 24 S1-Punkten enthielten, bevor Claude Code eine Webprüfung durchführte. Keine v3-Antwort markierte eine Kennung als unbestätigt, sodass die neue Überprüfungszeile nicht genutzt wurde. Claude Code überprüfte in S1 und S3 weiterhin eigenständig im Web, ohne dazu aufgefordert zu werden, was keine Antwort änderte und die Kosten des delegierenden Setups erhöhte.
Die zurückgehaltene Prüfung (20 neue Punkte). Da die Wissenslösung auf den Fehlern von v2 basierte, überprüften wir auf „Teaching to the Test“: 10 DORA-RTS-Artikel und 10 NIS2-IR-Anhangspunkte, die der Schlüssel nie enthielt, erstellt auf dieselbe Weise aus den offiziellen Texten, im S1-Format.
| Zurückgehalten | Setup | Korrekt | Genauigkeit | Claude $ (3 Durchläufe) | Claude $ pro korrekter Antwort | Median Orchestrator-Tokens pro Durchlauf |
|---|---|---|---|---|---|---|
| 20 neue DORA-RTS- und NIS2-IR-Punkte | Allein | 58/60 | 96.7% | 4.01 | 0.069 | 1,974,985 |
| 20 neue DORA-RTS- und NIS2-IR-Punkte | + ISMS Copilot | 60/60 | 100% | 3.10 | 0.052 | 2,258,506 |
Vorregistrierte Ergebnisse: Die Genauigkeit ist gleichauf (der Unterschied liegt unter 10 Punkten), und die Kosten pro korrekter Antwort begünstigen das delegierende Setup (1.34-fach). Das delegierende Setup verbrauchte hier mehr Tokens, weil Claude Code in zwei von drei Durchläufen ISMS Copilots Antworten im Web erneut überprüfte. In dem Durchlauf, in dem dies nicht geschah, schrieb es ISMS Copilots Antwort in die Datei und erzielte 20 von 20 Punkten für 0.15 $.
Durchlauf vom 2026-09-29
Ein begrenzter erneuter Durchlauf nach einem Produktionsrelease, das die Claude-Code-Routing-Regel verschärfte und begann, das Unternehmensprofil zu MCP-Turns hinzuzufügen (die beiden Änderungen lassen sich in diesen Zahlen nicht trennen). Gleicher festgelegter Claude Code und Modell, gleicher Schlüssel und Bewerter, N=3 pro Szenario pro Setup. Es wurden S1 und S4 sowie 10 neue zurückgehaltene Punkte (5 NIST SP 800-171 Rev. 2, 5 Cyber Resilience Act) durchgeführt, die nie im Schlüssel enthalten waren. S3 wurde nicht erneut durchgeführt. Die Tabellen v3 und zurückgehaltene Prüfung behalten ihre ursprünglichen Zahlen.
| Datum | Szenario | Setup | Korrekt | Genauigkeit | Claude $ pro korrekter Antwort |
|---|---|---|---|---|---|
| 2026-09-29 | S1-Abfragen | Allein | 60/60 | 100% | 0.110 |
| 2026-09-29 | S1-Abfragen | + ISMS Copilot | 60/60 | 100% | 0.026 |
| 2026-09-29 | S4-schnelle Beratung | Allein | 15/15 | 100% | 0.064 |
| 2026-09-29 | S4-schnelle Beratung | + ISMS Copilot | 15/15 | 100% | 0.035 |
| 2026-09-29 | 10 neue NIST SP 800-171- und CRA-Punkte | Allein | 30/30 | 100% | 0.027 |
| 2026-09-29 | 10 neue NIST SP 800-171- und CRA-Punkte | + ISMS Copilot | 29/30 | 96.7% | 0.033 |
Vorregistrierte Ergebnisse: Die Genauigkeit ist in allen drei Szenarien gleichauf. Die Kosten pro korrekter Antwort begünstigen das delegierende Setup bei S1 und S4 und sind bei den neuen Punkten gleichauf. Der eine Fehler stammte aus einem Durchlauf des delegierenden Setups, der ISMS Copilot nie aufrief: Die Routing-Regel enthielt zu diesem Zeitpunkt weder NIST SP 800-171 noch den CRA in ihrer Framework-Liste, sodass Claude Code in 2 von 3 Durchläufen diese Punkte im Web recherchierte. Der eine Durchlauf, der delegierte, erzielte 10 von 10 Punkten. Die Regel wurde am 2026-09-29 aktualisiert, um beide Frameworks zu nennen. Es gelten dieselben Einschränkungen: Die Genauigkeit liegt an der Obergrenze, die Anweisungen unterscheiden sich zwischen den Setups, und dieser Durchlauf enthält das Unternehmensprofil des Accounts.
Runde vom 2026-09-29 (Kontrolle)
Diese Runde beantwortet die Frage, die die zweite Grenze oben offen lässt: Stammt die Einsparung aus der Delegation an den ISMS Copilot oder lediglich aus der Routing-Regel, die Claude Code anweist, nicht erneut zu prüfen, wovon es überzeugt ist? Sie fügt ein Kontroll-Setup mit einer ähnlichen Anweisung und ohne Delegation hinzu. Das Design, die Gewinnregeln und jedes Element wurden vor dem ersten Durchlauf festgelegt, mit derselben Verpflichtung, die Ergebnisse unabhängig von ihrem Ausgang zu veröffentlichen. Sie wurde nach dem Routing-Regel-Update vom 2026-09-29 durchgeführt, das NIST SP 800-171 und den CRA nennt.
| Setup | Was es enthält |
|---|---|
| A, allein | Websuche und Webabruf, keine Anweisungsdatei (wie in jeder Runde oben) |
| A2, allein + Sparanweisung | A, plus eine 197 Wörter umfassende Anweisungsdatei: Antworte aus deinem eigenen Wissen, überprüfe im Web nur, worüber du unsicher bist, prüfe nicht erneut, wovon du überzeugt bist. Keine Delegation. |
| A0, allein ohne Web | Keine Webtools, keine Anweisungsdatei |
| B, + ISMS Copilot | A, plus die ISMS Copilot-Konversationstools und die veröffentlichte Routing-Regel |
| B-fast | B, wobei jeder ISMS Copilot-Aufruf im Fast-Modus erfolgt, dem Modus des Free-Plans |
Gleiche festgelegte Claude Code-Version 2.1.283 und claude-sonnet-5, gleicher Bewerter, N=3 pro Szenario pro Setup, und die fünf Setups jedes Szenarios wurden gleichzeitig ausgeführt. Szenarien: S1-Lookups (20 Elemente), S4-Schnellberatung (5 Fragen) und 16 neue, zurückgehaltene Elemente, die nie im Schlüssel enthalten waren (6 NIST SP 800-171 Rev. 2, 6 Cyber Resilience Act und 4 DORA RTS), erstellt aus den offiziellen Texten. S3 wurde nicht erneut durchgeführt.
Die Metrik hier ist Claude-Tokens pro korrekter Antwort: Eingabe-, Cache-Lese-, Cache-Erstellungs- und Ausgabetokens über alle Modelle hinweg (Websuch-Unteraufrufe eingeschlossen), summiert über die 3 Durchläufe und geteilt durch die korrekten Antworten. Sie ist ein Proxy dafür, wie schnell sich ein Claude-Abonnementfenster verbraucht, nicht der Zähler selbst: Anthropic veröffentlicht nicht, wie gecachte Tokens auf die Abonnementlimits angerechnet werden.
| Claude-Tokens pro korrekter Antwort | A | A2 | A0 | B | B-fast |
|---|---|---|---|---|---|
| S1-Lookups | 120,877 | 122,814 | 40,552 | 37,805 | 24,473 |
| S4-Schnellberatung | 100,920 | 102,145 | 29,424 | 42,142 | 55,582 |
| 16 neue, zurückgehaltene Elemente | 57,566 | 37,475 | 33,660 | 23,452 | 13,765 |
| Gesamt (123 bewertete Antworten) | 94,033 | 86,398 | 36,326 | 32,733 | 24,088 |
Vorab festgelegte Urteile gegenüber der Kontrolle (ein Gewinn erfordert das 1.25-fache oder mehr): A2 verbrauchte 3.23-mal so viele Claude-Tokens pro korrekter Antwort wie B bei Lookups, 2.44-mal bei Schnellberatung, 1.59-mal bei den neuen Elementen und 2.64-mal insgesamt, sodass B in jedem Szenario gewinnt. B verbrauchte auch in jedem Szenario weniger Claude-API-Dollar pro korrekter Antwort als A2. Die Sparanweisung allein bewegte Claude Code bei Lookups und Schnellberatung kaum (A2 gegenüber A: 1.02 und 1.01, Unentschieden) und half bei den neuen Elementen. Die Einsparung kommt durch die Delegation, nicht durch die Anweisung an Claude Code, sparsam zu sein. A0 benötigt wenige Tokens, weil es aus dem Gedächtnis antwortet, und liegt oft falsch (siehe Genauigkeit), daher ist seine Zahl kein verwertbares Ergebnis.
Genauigkeit, gesamt: A 99.2%, A2 98.4%, A0 60.2%, B 100%, B-fast 100%. A, A2, B und B-fast sind in jedem Szenario nach der 10-Punkte-Regel unentschieden; A0 verlor in jedem Szenario 20 bis 46 Punkte. Der oben genannte Deckeneffekt bleibt bestehen: Unentschieden sind nach Regel unentschieden, kein Beweis für gleiche Genauigkeit.
Nutzung des ISMS-Copilot-Tarifs pro korrekter Antwort. Delegierte Durchläufe verbrauchen das 4-Stunden-Fenster Ihres ISMS-Copilot-Tarifs. Die Tabelle zeigt ISMS-Copilot-Tokens (Input und Output) pro korrekter Antwort als Anteil eines Fensters, basierend auf den Produktions-Tarifgrenzen vom 2026-09-29. Essential ist ein übernommener Tarif. Unlimited hat keine Token-Begrenzung im Fenster.
| ISMS-Copilot-Fenster pro korrekter Antwort | ISMS-Copilot-Tokens pro korrekter Antwort | Free | Essential | Plus | Standard | Pro | Business | Unlimited |
|---|---|---|---|---|---|---|---|---|
| S1-Lookups, B | 3,199 | 0.64% | 0.32% | 0.21% | 0.11% | 0.04% | 0.02% | keine Obergrenze |
| S1-Lookups, B-fast | 9,128 | 1.83% | 0.91% | 0.61% | 0.30% | 0.12% | 0.06% | keine Obergrenze |
| S4-Schnellberatung, B | 12,104 | 2.42% | 1.21% | 0.81% | 0.40% | 0.16% | 0.08% | keine Obergrenze |
| S4-Schnellberatung, B-fast | 24,005 | 4.80% | 2.40% | 1.60% | 0.80% | 0.32% | 0.16% | keine Obergrenze |
| 16 neue, zurückgehaltene Elemente, B | 3,359 | 0.67% | 0.34% | 0.22% | 0.11% | 0.04% | 0.02% | keine Obergrenze |
| 16 neue, zurückgehaltene Elemente, B-fast | 3,203 | 0.64% | 0.32% | 0.21% | 0.11% | 0.04% | 0.02% | keine Obergrenze |
Der Free-Tarif erlaubt außerdem nur 10 Nachrichten pro 4-Stunden-Fenster. B sendete eine ISMS-Copilot-Nachricht pro Durchlauf. Im Fast-Modus teilte Claude Code die Arbeit in bis zu 5 Nachrichten pro Durchlauf auf, und bei Quick Advice war die Nachrichtenbegrenzung zuerst ausschlaggebend: etwa 7.3% des Free-Nachrichtenfensters pro korrekter Antwort, gegenüber 4.8% des Token-Fensters. Daher füllen etwa 3 Quick-Advice-Ergebnisse dieser Art ein Free-Fenster. In den anderen Zellen füllt sich das Token-Fenster genauso schnell oder etwas schneller als das Nachrichtenfenster. B-fast simuliert nur den Fast-Modus auf einem kostenpflichtigen Konto.
Hinweise für diese Runde: N=3 pro Szenario pro Setup; eine Orchestrator-Version und ein Modell; eine Sparanweisung, von uns verfasst, und eine bessere könnte die Lücke verringern (diese Runde zeigt, dass diese vernünftige Anweisung dies nicht tut); jeder delegierte Durchlauf wurde auf unserem eigenen (dem Gründer-) kostenpflichtigen Konto durchgeführt, mit seinen Erinnerungen und seinem Unternehmensprofil, das zu MCP-Durchläufen hinzugefügt wurde; die Token-Metrik ist ein Proxy für die Abonnementnutzung; der Antwortschlüssel wurde von einem KI-Modell erstellt; die Genauigkeit liegt an der Decke.
Wo Delegation nicht hilft
Der erste von uns durchgeführte Benchmark testete drei kleine ISO-27001-Aufgaben, die Claude bereits kannte: eine Lückenprüfung von vier kurzen fiktiven Richtlinien, einen Entwurf einer Zugriffskontrollrichtlinie und Einträge für die Erklärung zur Anwendbarkeit (Statement of Applicability) für 10 Controls. Jede Aufgabe schrieb ihr Ergebnis in eine Datei, und es waren keine Abfragen erforderlich. Keines der Setups verfügte über Web-Tools, und die Antworten wurden nur auf Vollständigkeit, nicht auf Richtigkeit überprüft.
| Aufgabe (Median von 3 Durchläufen) | Claude $, allein | Claude $, + ISMS Copilot | Orchestrator-Tokens, allein | Orchestrator-Tokens, + ISMS Copilot |
|---|---|---|---|---|
| Lückenprüfung | 0.163 | 0.266 | 143,053 | 495,530 |
| Zugriffskontrollrichtlinie | 0.105 | 0.218 | 131,748 | 427,071 |
| SoA-Einträge | 0.113 | 0.182 | 133,516 | 349,717 |
Die Delegation verursachte hier 1.6- bis 2.1-mal höhere Claude-Kosten. Die delegierenden Durchläufe benötigten mehr Runden (Laden der MCP-Tools, Warten auf die Antwort), Claude Code las weiterhin jede lokale Datei, und das vollständige Ergebnis kam über Claude Code zurück, der es dann auf die Festplatte schrieb. Wenn eine Aufgabe klein ist, Claude die Antwort bereits kennt und nichts nachgeschlagen werden muss, behalten Sie sie in Ihrem Agenten. Siehe Was delegiert werden sollte und was lokal bleiben sollte.
Einschränkungen
- Kleine Stichprobe. 3 Durchläufe pro Szenario und Setup am 2026-09-28, plus zwei eingegrenzte Runden am 2026-09-29.
- Ein Orchestrator. Nur Claude Code. Routing-Regeln für Codex, Cursor, OpenCode und Grok sind dokumentiert, aber diese Orchestratoren wurden nicht gemessen.
- Ein Modell.
claude-sonnet-5. Ein anderes Modell oder eine spätere Version von Claude Code könnte sich anders verhalten. - Ein Account. Alle delegierten Runden liefen auf einem Produktions-Account von ISMS Copilot, in dessen kostenpflichtigem Tarif, dessen serverseitige Erinnerungen und ab dem 2026-09-29 dessen Unternehmensprofil die Antworten beeinflussen könnten.
- Fiktive Beispiele. Erfundenene Unternehmen, Richtlinien und Code.
- Dokumentenprüfung nicht getestet. Der MCP verfügt über keinen Dokumentenupload-Pfad. Eine 40-seitige Richtlinienprüfung lief in v2 und war gleichauf, aber Claude Code führte die Prüfung in beiden Setups selbst durch, sodass dies nichts über ISMS Copilots Fähigkeit aussagt, Ihre Dokumente zu prüfen.
- Schlüsselautor. Die Punkte wurden von einem Claude-Modell erstellt, derselben Familie wie der Orchestrator, basierend auf den offiziellen Texten. Die DORA-RTS- und NIS2-IR-Punkte wurden stichprobenartig mit dem offiziellen Text abgeglichen, und die zurückgehaltenen Punkte wurden vor den Durchläufen damit überprüft. Eine Überprüfung durch einen menschlichen Experten steht noch aus.
- Was veröffentlicht wird. Diese Seite enthält die Methode und alle Hauptzahlen. Die Rohtranskripte bleiben privat: Sie enthalten Produktions-Konversationskennungen und wörtliche Modellausgaben. Die Aufgaben-Prompts, der Antwortschlüssel, der Bewerter und die bewerteten Ausgaben werden in unserem internen Repository aufbewahrt und werden nicht mit dieser Seite veröffentlicht.
Was wir behaupten und was nicht
Wir behaupten:
- Bei den getesteten Punkten in den fünf oben genannten Frameworks erreichte Claude Code mit ISMS Copilot die gleiche Genauigkeit wie Claude Code, der allein mit Websuche recherchierte (ein Gleichstand in jedem Szenario, gemäß der vorregistrierten Regel).
- Bei diesen Abfragen und Fragen zur schnellen Beratung gab es weniger Claude-API-Kosten pro korrekter Antwort (etwa die Hälfte im v3-Durchlauf, etwa drei Viertel bei der zurückgehaltenen Prüfung vom 2026-09-28) und etwa gleich viel bei einer langen gemischten Sitzung.
Wir behaupten nicht:
- Dass ISMS Copilot günstiger ist als Claude oder eine prozentuale Ersparnis auf Ihrer Rechnung.
- Bessere Antworten als Claude. Die Genauigkeitsergebnisse sind gleichauf.
- Etwas über Frameworks, die wir nicht getestet haben, andere Orchestratoren oder Modelle oder die Dokumentenprüfung.
- Dass Delegation Claude-Nutzung bei kleinen Aufgaben spart, die Claude bereits kennt. Sie kostete dort mehr.
- Dass delegierte Runden kostenlos sind. Sie werden auf Ihren ISMS-Copilot-Tarif angerechnet.
Wir führen diesen Benchmark nach Änderungen an den MCP-Tools oder am Framework-Wissen von ISMS Copilot erneut durch. Die Ergebnisse jedes Durchlaufs werden innerhalb von 7 Tagen mit ihrem Datum hier hinzugefügt, unabhängig vom Ergebnis. Für den Mechanismus hinter diesen Zahlen siehe Was Delegation spart (und was nicht).