Anthropic meldet für August: Claude „leads“ 26 % der eigenen AI-R&D (AL4), Online-Monitore blockieren 0,002 % von mehr als einer Milliarde Agenten-Entscheidungen – Pace-Metriken mit Anspruch auf öffentliche Sichtbarkeit. Bleibt Oversight prüfbar und vergleichbar, oder antwortet das nächste Lab nur noch mit Selfie-Zahlen?
Am 22.9. hat das Anthropic Institute einen Text veröffentlicht, der in DACH-Policy-Kreisen sofort Aufmerksamkeit erzeugt: drei Messungen zur Pace der KI-Entwicklung im Inneren eines Frontier-Labs. Autorinnen laut Institut: Marina Favaro und Phillie Wright; die Forschungsrichtung lag bei Jack Clark. Der Anspruch klingt nüchtern und groß zugleich – „Wir messen Pace“. Ich meine klar: Das ist erst dann eine Spur, wenn AL-Index, Oversight-Rate und Safety-Compute-Anteil regelmäßig, vergleichbar und von Dritten verifiziert erscheinen. Sonst bleibt es ein Lab-Selfie mit schönen Prozenten.
Die Zahlen, die Anthropic selbst nennt, sind greifbar. Stand August: Claude führt 26 % der Anthropic-AI-R&D (AL4); der Anteil bei oder über AL3 liegt über 90 %; kein gemessener Teilbereich steht bei AL5 (vollständig autonom). Auf der meistgenutzten internen Plattform liefen im August rund 30.000 Agenten gleichzeitig. Online-Monitore: 100 % Coverage vor Ausführung; Offline: 100 % Ingest danach. Online: mehr als eine Milliarde Entscheidungen im August, 0,002 % blockiert (etwa 1 von 47.000); Menschen prüfen blockierte Aktionen innerhalb einer Woche. Offline: etwa 100.000 Transkripte pro Woche geflaggt, dann Classifier-Filter; rund 50 Flags höchster Priorität pro Woche an Human Review; 1–2 von tausend weiter eskaliert. Compute-Snapshot 13.–20. Juli: etwa 6 % der AI-R&D-Compute für Safety; etwa 12 % der AI-getriebenen AI-R&D-Compute für Safety – bewusst konservativ; separate Safeguard-Classifier nicht eingerechnet.
Wir bei digital-magazin.de lesen solche Lab-Claims nicht als fertige Wahrheit, sondern als Messangebot. Der AI Act erzeugt hier Einordnungsdruck: Organisationen in DACH müssen einordnen können, welche Zahlen öffentlich, welche methodisch und welche nur anbieterseitig sind – ohne dass dieser Text eine Rechtsberatung wäre. Die These bleibt hart: Ohne regelmäßige, vergleichbare, fremdverifizierte Pace-Metriken antwortet das nächste Lab mit Selfie-Metriken. Punkt.
Was Anthropic zum Pace veröffentlicht hat – und warum
Anthropic rahmt den Text als Werkzeugkasten für die Öffentlichkeit: Wie viel AI-R&D macht die KI selbst? Wie gut werden Agenten-Aktionen überwacht? Wohin fließt Compute? Die Primärquelle ist der Institute-Beitrag Measuring the pace of AI development – markieren Sie jede Zahl darin als Anthropic-/Institute-Claim, bis eine unabhängige Prüfung greift.
Warum jetzt? Anthropic schreibt sinngemäß: Systeme werden mächtiger und bauen zunehmend die nächste Generation mit. Wer über Pace der Frontier diskutiert, braucht mehr Sichtbarkeit von außen. Die drei Messungen sollen Inputs (Compute, Automatisierungsgrad, Oversight) mit dem Produktionsprozess der Modelle verbinden – ergänzend zu Capability-Evals, die Anthropic laut eigener Darstellung separat über RSP-Risikoberichte veröffentlicht. Anthropic RSP und AAIF dürfen hier als kurze Kontextzeile stehen: Capability-Risikoberichte und Policy-Vorschläge laufen parallel – sie sind nicht das Kapitel dieses Textes.
Der Text ist prominent am 22.9. erschienen. Das Timing ist politisch lesbar: Während in Europa Transparenz- und Governance-Debatten laufen, legt ein Lab Messprototypen auf den Tisch und kündigt Independent Embedded Evaluators an – Dritte mit internem Zugang vergleichbar zu internen Risk-Teams. Ob daraus Cadence und Verifikation wird oder ein einmaliger Snapshot mit Methodik-Anhang, entscheidet über Pace versus Selfie.
Ich halte den Anspruch für ernsthaft formuliert und zugleich für leicht missverständlich. „Wir messen Pace“ klingt nach Track. Ein Track braucht Wiederholung, gemeinsame Definitionen und fremde Augen. Ein Selfie braucht gute Grafiken und eine Pressemeldung. DACH-Lesende aus Policy, Compliance und Redaktion sollten diese beiden Register trennen, bevor sie die 26 % weitererzählen.
Praktisch heißt das für Sie: Speichern Sie Datum, Claim, Methodik-Hinweis und offene Prüffrage. Wer nur die Headline „Claude leads 26 %“ in Slack wirft, verliert die Spur. Wer dokumentiert, dass Anthropic einen August-Stand, einen Juli-Compute-Snapshot und einen Plan für eingebettete Evaluierende nennt, behält Handlungsfähigkeit.
AL0 bis AL5 verständlich – und die August-Zahlen
Anthropic nutzt für den R&D Automation Index eine Skala von Epoch AI: Automation Levels AL0 bis AL5. AL0 bedeutet keine KI-Beteiligung. Darüber steigen Assistenz und Autonomie. AL3 heißt laut Anthropic-Darstellung „collaborates“: Die KI erledigt große Arbeitspakete unter enger menschlicher Leitung. AL4 heißt „leads“: Die KI erledigt die Aufgabe weitgehend end-to-end aus einem High-Level-Prompt, der Mensch supervidiert. AL5 wäre vollständig autonom, ohne Menschen in der Schleife. Wer die Skala hochstufig nachlesen will, findet bei Epoch AI den methodischen Horizont – die August-Zahlen selbst bleiben Anthropic-Claims.
Stand August, so Anthropic: Claude „leads“ 26 % der Anthropic-AI-R&D (AL4). Der Anteil bei oder über AL3 liegt über 90 %. Kein gemessener Teilbereich steht bei AL5. Das ist die Kernzahl, die viele Headlines tragen werden – und genau deshalb brauchen Sie die Methodik-Fußnote. Anthropic beschreibt im Anhang, dass Aufgaben aus Arbeitsnachweisen (unter anderem Slack und interne Dokumentation) bottom-up gesammelt, in einen eingefrorenen Aufgabenkorb gebracht und von Claude-Agenten sowie einem Claude-Judge bewertet wurden. Der Korb ist auf etwa Juli 2026 eingefroren.
Selbstcheck laut Anthropic-Anhang – vorsichtig zitieren: Modell-versus-Mensch exakte Übereinstimmung 59 %, Mensch-versus-Mensch 35 %, innerhalb einer Stufe 97 %. Das ist kein Gütesiegel von außen. Das ist ein internes Abgleichsargument. Es zeigt Uneinigkeit auch unter Menschen und zugleich, dass der Judge oft nahe an menschlichen Ratings liegt. Es ersetzt keine Drittprüfung.
Zwei Hindernisse für Lab-übergreifenden Vergleich nennt Anthropic selbst: keine gemeinsame Methodik; eigene Modelle beurteilen eigene Systeme. Genau dort kippt Pace in Selfie-Gefahr. Wenn Lab A mit AL4 26 % meldet und Lab B mit einer anderen Aufgabenlandkarte und einem anderen Judge 40 % meldet, haben Sie zwei Pressemitteilungen – keinen Track.
Was Anthropic als berichtbar für jedes Frontier-Lab beschreibt: regelmäßig dieselben Maße mit öffentlicher Methodik publizieren, damit Zahlen über Zeit und potenziell über Labs vergleichbar werden. Verifikation durch Dritte oder durch Modelle anderer Entwickelnder mit Guardrails gegen Wettbewerbsdaten. Mögliche Trigger-Logik: stärkere Anforderungen, etwa feste Testfenster, bevor ein neues Modell für weitere AI-R&D genutzt wird. Das sind Vorschläge des Instituts – keine branchenweite Norm.
| Messung | Claim (Anthropic) | Stand |
|---|---|---|
| R&D Automation Index | AL4 „leads“ 26 %; ≥AL3 >90 %; AL5 in gemessenen Subsets: 0 | August |
| Agent Oversight (Online) | 100 % Coverage vor Execution; >1 Mrd. Entscheidungen; 0,002 % blockiert (~1/47.000); Human Review blockierter Aktionen ≤1 Woche | August |
| Agent Oversight (Offline) | 100 % Ingest danach; ~100k Flags/Woche → Classifier; ~50 Highest-Priority/Woche Human Review; 1–2/1000 weiter | August |
| Safety-Compute | ~6 % der AI-R&D-Compute; ~12 % der AI-getriebenen AI-R&D-Compute; Classifier-Safeguards extra, nicht eingerechnet | 13.–20. Juli |
Quelle: Anthropic Institute, „Measurements for understanding the pace of AI development inside frontier labs“, veröffentlicht 22.9. – alle Werte als Lab-Claims markiert.
Rhetorische Frage an dieser Stelle: Wenn Ihr Compliance-Team morgen „26 % AL4“ in eine Folie kopiert – kopieren Sie dann auch den eingefrorenen Aufgabenkorb, den Judge-Konflikt und die fehlende Cross-Lab-Methodik mit? Wenn nicht, haben Sie eine Storyline, keinen Audit-Stand.
Agent Oversight: Coverage, Blockrate, Human Flags
Der zweite Block betrifft Oversight über Agenten auf der meistgenutzten internen Plattform. Anthropic nennt für August rund 30.000 Agenten gleichzeitig in Research und Engineering. Die Messungen decken laut Institut nur diese Plattform ab – kein Anspruch auf das gesamte Unternehmen in jedem Tool.
Zwei Monitor-Typen: Online und Offline. Online prüft Aktionen in Echtzeit und kann gefährliche Schritte blockieren oder steuern – gedacht für Schäden, die schnell und irreversibel wären, etwa das Kopieren von Modellgewichten aus Systemen. Offline liest Aktivitäten danach – gedacht für langsamer entstehende Muster wie Misalignment-Signale; Flags verbessern Mitigations, Classifier und deterministische Controls. Bei großer unmittelbarer Gefahr würde Anthropic laut eigener Darstellung gefährliche Teile der Agenten-Deployment herunterfahren.
Coverage-Claim: Online 100 % der Aktionen dieser Agenten vor Ausführung (meist innerhalb von Sekunden); Offline 100 % Ingest danach. Review-Latenz Online: automatisierte Prüfung vor der Aktion; Menschen prüfen blockierte Aktionen innerhalb einer Woche. Offline: Monitor flaggt grob 100.000 Transkripte pro Woche; multiple Classifier filtern False Positives und machen Erst-Review; die höchste Priorität – etwa 50 pro Woche – geht an Human Review.
Escalation-/Block-Raten: Online über mehr als eine Milliarde Entscheidungen im August 0,002 % blockiert – etwa 1 von 47.000. Offline flaggt der Monitor grob ein bis zwei Transkripte von tausend für weitere Prüfung. Anthropic schreibt, einzelne Agenten würden in den bisherigen Monitor-Daten selten fehlverhalten; bei Millionen oder Milliarden Agenten in der Wirtschaft würden seltene Ereignisse dennoch regelmäßig auftreten. Das ist die Skalenlogik hinter der Metrik – wiederum als Lab-Claim.
METR habe in der Vergangenheit das Offline-Monitoring unabhängig red-geteamt, so Anthropic. Das gehört in die Claim-Spalte „historische Drittprüfung“, nicht in „laufende Verifikation aller August-Zahlen“. Für die Gegenwart kündigt Anthropic eingebettete Dritte an. Wir bei digital-magazin.de trennen diese Zeitschichten konsequent: vergangenes Red-Teaming ≠ aktuelle Cadence-Verifikation.
Was jedes Lab laut Anthropic heute berichten könnte: Coverage, Review-Latenz, Escalation-/Block-Rate für Research- und Engineering-Agenten. Zusätzlich: wie oft bekanntes Fehlverhalten von Monitoren erwischt wird – und dass Dritte das unabhängig testen. Genau diese Kombi aus Kennzahl und fremdem Test entscheidet, ob Oversight als Pace-Spur oder als Selfie-Diagramm landet.
Für DACH-Lesende mit Security-Hintergrund liegt hier der Anschluss an agentische Angriffsketten und Red-Team-Denken: Wer Agenten skaliert, braucht nicht nur schöne Blockraten, sondern nachvollziehbare Coverage-Grenzen und Eskalationswege. Unser Text zu agentischen Angriffsketten im Red-Team-Kontext zeigt, warum Monitor-Claims ohne Angriffspfad-Logik schnell zu Folienkunst werden.
Compute-Snapshot: 6 % / 12 % und der Classifier-Vorbehalt
Der dritte Block ist ein Snapshot der Woche 13.–20. Juli. Anthropic sortierte Workloads und fragte, wie viel der Compute, die in AI-R&D floss, Safety-Arbeit war. Ergebnis laut Institut: etwa 6 % der AI-R&D-Compute für Safety; etwa 12 % der Compute, die in AI-getriebene AI-R&D floss, für Safety. Bewusst konservativ: Tokens, die Capabilities und Safety gleichermaßen voranbringen, zählen nicht als Safety. Separate Safeguard-Classifier sind nicht eingerechnet – Anthropic nennt sie eine vergleichbare zusätzliche Menge.
Wichtiger Vorbehalt aus dem Fußnotenapparat: Compute wird als fungibler Pool gesteuert; der Snapshot zeigt, wohin Kapazität in jener Woche floss – keine feste Allokation. Engineering-Kategorien entsprechen nicht zwingend der Kostenrechnung. Safety-Forschung sei von Natur aus oft weniger compute-intensiv als Frontier-Training; der Wert der Metrik liege weniger in absoluten Zahlen als in der Vergleichbarkeit über Labs und Zeit, wenn Definitionen geteilt würden.
Was Anthropic als berichtbar beschreibt: Anteil der AI-R&D-Compute für Safety, mit veröffentlichten Kategoriedefinitionen und unabhängiger Prüfung der Klassifikation. Die Beweislast soll beim Entwickelnden liegen, dass Arbeit safety-bezogen ist. Geteilte Definitionen zwischen Labs, Regierungen und Forschungsgemeinschaft wären nötig – sonst zeichnet jedes Lab die Grenze großzügig.
Ich meine: 6 % und 12 % sind kommunizierbar und zugleich methodisch zerbrechlich. Ohne gemeinsame Safety-Definition, ohne Stichprobenprüfung durch Dritte und ohne wiederholte Wochen statt einer Snapshot-Woche bleibt der Compute-Anteil ein Selfie mit Prozentzeichen. Mit Cadence und fremder Klassifikationsprüfung wird er zu einem Input-Indikator für Pace-Diskussionen.
Einordnung für Policy: Compute gehört zu den vergleichsweise prüfbaren Inputs. Deshalb taucht er in Pacing-Debatten immer wieder auf. Gleichzeitig warnt Anthropic selbst vor Fehlschlüssen: effizientere Safety-Classifier oder schnellere Inference können den Safety-Anteil rechnerisch senken, ohne dass weniger Safety-Arbeit passiert. Wer nur die Prozentzahl steuert, ohne Definition und Effizienzkontext, steuert Folien – nicht Risiko.
Independent Embedded Evaluators – was Glaubwürdigkeit bräuchte
Dieses Bild wurde komplett mit KI generiertProviderhiggsfieldModellgpt_image_2PromptPerson reviewing timeline notes outdoors near modern glass institute building overcast, transparency mood, no logos, no brand names, no readable text, 16:9Anthropic plant laut Institute-Text, unabhängige Dritt-Evaluierende mehrerer Organisationen einzubetten und ihnen Zugang zu internen Prozessen, Systemen und Daten zu geben – vergleichbar mit dem, was interne Risk-Assessment-Teams haben. Diese Dritten sollen Safety-Praktiken prüfen, Incidents melden und Schlüsselmetriken wie die drei Pace-Messungen monitoren.
Das ist der Glaubwürdigkeitshebel. Ohne ihn bleiben August- und Juli-Zahlen ein Lab-Bericht mit Methodik-Anhang. Mit ihm könnte aus „Wir messen Pace“ eine Spur werden, die Außenstehende zumindest teilweise nachvollziehen. Was bräuchte es konkret?
Erstens: Zugangstiefe vergleichbar zu internen Risk-Teams – nicht nur vorbereitete Dashboards. Zweitens: Mandat zu Incident-Reporting, das nicht hinter NDAs verschwindet, sobald es unbequem wird. Drittens: Monitor-Rechte über AL-Index, Oversight-Raten und Safety-Compute, inklusive Stichproben auf Klassifikation und Coverage-Grenzen. Viertens: Veröffentlichungskadenz – monatlich oder quartalsweise dieselben Definitionen, mit Change-Log wenn der Aufgabenkorb neu gebaut wird. Fünftens: klare Trennung zwischen Evaluierenden und Marketing.
Anthropic nennt selbst die Hindernisse für Cross-Lab-Vergleich und schlägt Verifikation durch Dritte oder durch Modelle anderer Labs mit Guardrails vor. Independent Embedded Evaluators sind die institutionelle Antwort auf genau dieses Problem – wenn sie kommen, Zugang behalten und berichten dürfen. Bis dahin: Claim markieren, nicht als Status quo verkaufen.
Wir bei digital-magazin.de sehen hier den Unterschied zwischen Transparenzversprechen und Transparenzspur. Ein Plan ist ein Plan. Eine eingebettete Evaluierenden-Gruppe mit erstem öffentlichem Monitor-Bericht wäre ein Artefakt. Policy-Lesende in DACH sollten auf Artefakte warten und Pläne als Pläne behandeln – besonders unter dem Einordnungsdruck, den der AI Act für Transparenz- und Governance-Fragen erzeugt, ohne dass wir hier Rechtsgutachten schreiben.
Praktischer Anschluss: Wer intern bereits prüft, wie Transparenzpflichten und öffentliche Belege zusammenhängen, findet in unserem Überblick zu den Transparenzpflichten seit dem 2. August die Einordnungsschiene – Lab-Metriken ersetzen keine regulatorischen Spuren, können sie aber ergänzen oder konterkarieren.
Warum Selfie-Metriken bei DACH-Policy-Lesenden scheitern
Policy-Lesende in Deutschland, Österreich und der Schweiz brauchen drei Eigenschaften: Vergleichbarkeit, Drittprüfung, Cadence. Fehlt eine, wird aus Pace-Marketing schnell Folienmaterial ohne Entscheidungsnutzen.
Vergleichbarkeit scheitert, wenn jedes Lab den Aufgabenkorb anders schneidet, Safety anders definiert und den Judge selbst stellt. Drittprüfung scheitert, wenn METR-Red-Teams der Vergangenheit als Ersatz für laufende Verifikation der aktuellen Monatswerte verkauft werden. Cadence scheitert, wenn ein Juli-Snapshot und ein August-Stand als „wir messen Pace“ bleiben, ohne Folgemonate mit denselben Definitionen.
Der AI Act liefert Einordnungsdruck, keine Einfachantwort. Organisationen müssen einordnen können, welche Aussagen öffentlich prüfbar sind und welche anbieterseitig bleiben. Für einen schnellen Einstieg in die Regelungslogik hilft unsere Einordnung zur KI-Regulierung unter dem EU AI Act – und wer vier Grundfragen braucht, bevor Folien gebaut werden, findet sie in den vier Fragen zum EU AI Act. Lab-Pace-Metriken sind ein zusätzliches Signal, kein Ersatz für diese Einordnung.
Selfie-Metriken scheitern außerdem an der Kommunikationsökonomie. Schöne Zahlen reisen schneller als Methodik-Anhänge. 26 % AL4 und 0,002 % Blockrate passen in einen Tweet; eingefrorene Task-Baskets und Classifier-Vorbehalte nicht. Redaktionen und Policy-Teams, die nur die Tweet-Ebene speichern, erzeugen eine Scheinspur. Genau deshalb markieren wir Anthropic-/Institute-Claims explizit und verlangen Cadence plus Dritte.
Ein weiteres Scheitermuster: eigene Modelle als einzige Richter über eigene Systeme. Anthropic benennt das Hindernis selbst. Solange der Judge aus demselben Haus kommt und keine unabhängige Stichprobe die Ratings prüft, bleibt ein Rest Selbstreferenz – auch wenn der interne Mensch-Modell-Abgleich im Anhang steht. Selfie heißt nicht „gelogen“. Selfie heißt „ungeprüft von außen und schwer vergleichbar“.
Für DACH-Compliance heißt das praktisch: Nehmen Sie die drei Messungen als Hypothesen-Set. Fragen Sie Vendoren und interne KI-Teams: Welche Definition? Welche Cadence? Welche Drittprüfung? Welche Coverage-Grenze? Welche Safety-Compute-Abgrenzung? Wer diese Fragen nicht beantwortet, liefert Selfie. Wer sie mit Artefakten beantwortet, liefert Pace-Spuren – oder zumindest den Anfang davon.
Audit-Checkliste für Außenstehende
Hier eine knappe Checkliste, die Sie ohne Insider-Zugang anwenden können – als Lesefilter, nicht als Zertifikat.
- Claim-Quelle: Steht die Zahl im Anthropic-Institute-Text vom 22.9. – mit Autorinnen Favaro/Wright und Research Direction Clark – und ist sie als Lab-Claim markiert?
- Zeitstempel: August für AL und Oversight; 13.–20. Juli für Compute – kein Vermischen zu „aktuell immer“.
- AL-Definition: AL3 collaborates, AL4 leads, AL5 fully autonomous – und explizit: kein gemessenes AL5-Subset laut Anthropic.
- Methodik-Fußnote: Frozen Task Basket ~Juli; Judge-Selbstcheck 59 % / 35 % / 97 % nur als Anthropic-Anhang zitieren.
- Oversight-Scope: Meistgenutzte interne Plattform, ~30.000 Agenten – nicht stillschweigend auf alles erweitern.
- Coverage vs. Rate: 100 % Coverage ist nicht 100 % Sicherheit; 0,002 % Blockrate braucht Kontext zu False Negatives und Testung.
- Compute-Konservativität: 6 % / 12 %; Classifier-Safeguards extra; Snapshot ≠ feste Allokation.
- Drittprüfung: METR-Claim historisch zum Offline-Monitoring; Independent Embedded Evaluators = Plan, nicht Ist.
- Cadence: Gibt es Folgemonate mit denselben Definitionen und Change-Log?
- Vergleichbarkeit: Gemeinsame Methodik mit anderen Labs – oder nur Einzelbericht?
- Einordnungsdruck AI Act: Trennen Sie Lab-Metriken von regulatorischen Transparenzspuren; keine Rechtsmeinung aus Prozenten ableiten.
- Kommunikationshygiene: Headline und Methodik immer gemeinsam speichern; Selfie-Test: Fehlt Drittprüfung oder Cadence, ist es noch kein Track.
Wenn Sie diese zwölf Punkte abhaken, haben Sie keinen Freibrief – aber einen Filter gegen Selfie-Übernahme. Genau das brauchen DACH-Teams, bevor 26 % und 0,002 % in Vorstandsfolien wandern.
Und jetzt?
Anthropic hat am 22.9. drei Messungen vorgelegt, die Pace sichtbar machen sollen: AL-Index mit 26 % AL4 und über 90 % ≥AL3 ohne AL5-Subset; Oversight mit voller Coverage-Claim und 0,002 % Online-Blockrate bei Milliarden Entscheidungen; Compute mit 6 % / 12 % Safety-Anteil und Classifier-Vorbehalt. Das ist mehr Transparenz als viele Labs liefern. Es ist noch kein fremdverifizierter, lab-übergreifender Track.
Glaubwürdig wird „Wir messen Pace“ erst, wenn AL-Index, Oversight-Rate und Safety-Compute-Anteil regelmäßig, vergleichbar und von Independent Embedded Evaluators mit echtem Zugang geprüft werden. Bis dahin bleiben die Zahlen Anthropic-/Institute-Claims – nützlich, zitierfähig, aber Selfie-anfällig.
Für Sie heißt das: Speichern Sie Claims mit Datum und Methodik. Fragen Sie nach Cadence und Dritten. Nutzen Sie den AI-Act-Einordnungsdruck, um Lab-Folien von prüfbaren Spuren zu trennen. Und behalten Sie die These im Kopf – sonst antwortet das nächste Lab wirklich nur noch mit Selfie-Metriken.

