claude plugin eval prueft, ob der fehlende Agent-Runner fuer einen Harness schon existiert
#80
Reference in New Issue
Block a user
Delete Branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
Ausgangslage
EVALS.md§ "The agent runner, and why it is not here yet" (Z. 432-459) haelt fest: die fehlende Haelfte der Evaluation ist ein Runner, der einen Harness gegen eine Aufgabe startet, mehrfach, und eine Pass-Rate meldet. Das Design steht dort ausformuliert. Gebaut ist es nicht, und der genannte Grund ist konkret:Die Statustabelle (Z. 430) fuehrt entsprechend "Agent runner (
eval run) and L3 - designed below, not built".Was neu ist
Claude Code bringt inzwischen
claude plugin evalmit (verifiziert in 2.1.257):Drei Dinge daran treffen genau das, was
EVALS.mdals fehlend beschreibt: es startet Laeufe, es bewertet sie, und es zieht eine Baseline ohne das Plugin - wasEVALS.mdals Voraussetzung nennt ("Establish baseline: measure performance without the Skill", ueber Anthropics Evaluation-driven development). Und es laeuft ueber die vorhandene Claude-Code-Authentifizierung, umgeht also den Credential-Blocker fuer einen der drei Harnesses.Was es nicht ist: eine Pruefung der Authoring-Qualitaet. Es fuehrt selbstgeschriebene Faelle aus - die Faelle sind die eigentliche Arbeit, nicht das Werkzeug.
Zu klaeren
.claude/skills/fuerplugin evalein gueltiges Target ist.claude plugin initlegt unter~/.claude/skills/<name>/an und laedt als<name>@skills-dir; die publizierten Skills hier liegen im Projekt, nicht dort.claude plugin listmeldet in diesem Checkout "No plugins installed".EVALS.mdgenuegt, das drei Harnesses vergleichen will - oder ob er als erste Stufe zaehlt, die die Faelle und das Scoring-Format erarbeitet, bevor die anderen zwei folgen.wikitool eval score(L1/L2 ueber Traces) verhaelt: zwei Bewertungswege oder einer, der den anderen fuettert.instructions/dev/.Akzeptanzkriterien
claude plugin evalgegen die publizierten Skills dieses Repos ueberhaupt laeuft - mit dem tatsaechlichen Kommando und seiner Ausgabe als Beleg, nicht als Vermutung.EVALS.md§ "The agent runner" sagt, was dieses Werkzeug abdeckt und was es offen laesst - der heutige Absatz ("a live run cannot be executed") ist dann in dieser Form nicht mehr wahr.EVALS.mdhaelt die Reihenfolge fest ("comprehension, then specification, then generalization"), und Faelle vor der Frage sind der Proxy, vor dem der Abschnitt warnt.Nicht Gegenstand
Anthropics Checklistenpunkte "At least three evaluations created" und "Tested with Haiku, Sonnet, and Opus" als eigener Missstand. Sie beschreiben dieselbe Luecke, die
EVALS.mdbereits fuehrt - kein zweites Issue dafuer.Herkunft
Aufgefallen bei der Analyse aus #65, Sitzung 2026-09-09, waehrend der Suche nach einem Werkzeug fuer die Skill-Qualitaetspruefung.
/skill-doctorschied dabei aus - er liefert Usage-Telemetrie, keine Authoring-Pruefung, und meldet in diesem Setup "Skill usage reports are not available on this connection".torben referenced this issue2026-09-09 14:28:20 +00:00