claude plugin eval prueft, ob der fehlende Agent-Runner fuer einen Harness schon existiert #80

Open
opened 2026-09-09 09:03:52 +00:00 by torben · 0 comments
Owner

Ausgangslage

EVALS.md § "The agent runner, and why it is not here yet" (Z. 432-459) haelt fest: die fehlende Haelfte der Evaluation ist ein Runner, der einen Harness gegen eine Aufgabe startet, mehrfach, und eine Pass-Rate meldet. Das Design steht dort ausformuliert. Gebaut ist es nicht, und der genannte Grund ist konkret:

"No provider credentials are configured on this machine - Vibe's providers declare an api_key_env_var and none of those variables is set - so a live run cannot be executed, let alone verified."

Die Statustabelle (Z. 430) fuehrt entsprechend "Agent runner (eval run) and L3 - designed below, not built".

Was neu ist

Claude Code bringt inzwischen claude plugin eval mit (verifiziert in 2.1.257):

"Run eval cases (<eval dir>/**/case.yaml or prompt.md + graders/*.md; the eval dir is evals/ unless --eval-dir or the manifest says otherwise) against a plugin and report scored results. Target is a path, a plugin name, or a plugin@marketplace id - installed and skills-dir plugins both resolve (and add a no-plugin baseline arm)."

Drei Dinge daran treffen genau das, was EVALS.md als fehlend beschreibt: es startet Laeufe, es bewertet sie, und es zieht eine Baseline ohne das Plugin - was EVALS.md als Voraussetzung nennt ("Establish baseline: measure performance without the Skill", ueber Anthropics Evaluation-driven development). Und es laeuft ueber die vorhandene Claude-Code-Authentifizierung, umgeht also den Credential-Blocker fuer einen der drei Harnesses.

Was es nicht ist: eine Pruefung der Authoring-Qualitaet. Es fuehrt selbstgeschriebene Faelle aus - die Faelle sind die eigentliche Arbeit, nicht das Werkzeug.

Zu klaeren

  • Ob Chemenus .claude/skills/ fuer plugin eval ein gueltiges Target ist. claude plugin init legt unter ~/.claude/skills/<name>/ an und laedt als <name>@skills-dir; die publizierten Skills hier liegen im Projekt, nicht dort. claude plugin list meldet in diesem Checkout "No plugins installed".
  • Ob ein Claude-Code-only-Runner dem Anspruch von EVALS.md genuegt, das drei Harnesses vergleichen will - oder ob er als erste Stufe zaehlt, die die Faelle und das Scoring-Format erarbeitet, bevor die anderen zwei folgen.
  • Wie sich das zum vorhandenen wikitool eval score (L1/L2 ueber Traces) verhaelt: zwei Bewertungswege oder einer, der den anderen fuettert.
  • Ob die Faelle im Repo liegen und damit ausgeliefert werden, oder ob sie dev-only sind wie instructions/dev/.

Akzeptanzkriterien

  • Es ist geprueft und schriftlich festgehalten, ob claude plugin eval gegen die publizierten Skills dieses Repos ueberhaupt laeuft - mit dem tatsaechlichen Kommando und seiner Ausgabe als Beleg, nicht als Vermutung.
  • Falls ja: EVALS.md § "The agent runner" sagt, was dieses Werkzeug abdeckt und was es offen laesst - der heutige Absatz ("a live run cannot be executed") ist dann in dieser Form nicht mehr wahr.
  • Falls nein: der Grund steht dort, damit die Frage nicht ein zweites Mal gestellt wird.
  • Die Entscheidung ueber den Ablageort der Faelle (ausgeliefert oder dev-only) ist getroffen und begruendet.
  • Kein Eval-Fall wird angelegt, bevor die Zielfrage beantwortet ist - EVALS.md haelt die Reihenfolge fest ("comprehension, then specification, then generalization"), und Faelle vor der Frage sind der Proxy, vor dem der Abschnitt warnt.

Nicht Gegenstand

Anthropics Checklistenpunkte "At least three evaluations created" und "Tested with Haiku, Sonnet, and Opus" als eigener Missstand. Sie beschreiben dieselbe Luecke, die EVALS.md bereits fuehrt - kein zweites Issue dafuer.

Herkunft

Aufgefallen bei der Analyse aus #65, Sitzung 2026-09-09, waehrend der Suche nach einem Werkzeug fuer die Skill-Qualitaetspruefung. /skill-doctor schied dabei aus - er liefert Usage-Telemetrie, keine Authoring-Pruefung, und meldet in diesem Setup "Skill usage reports are not available on this connection".

## Ausgangslage `EVALS.md` § "The agent runner, and why it is not here yet" (Z. 432-459) haelt fest: die fehlende Haelfte der Evaluation ist ein Runner, der einen Harness gegen eine Aufgabe startet, mehrfach, und eine Pass-Rate meldet. Das Design steht dort ausformuliert. Gebaut ist es nicht, und der genannte Grund ist konkret: > "No provider credentials are configured on this machine - Vibe's providers declare an `api_key_env_var` and none of those variables is set - so a live run cannot be executed, let alone verified." Die Statustabelle (Z. 430) fuehrt entsprechend "Agent runner (`eval run`) and L3 - designed below, not built". ## Was neu ist Claude Code bringt inzwischen `claude plugin eval` mit (verifiziert in 2.1.257): > "Run eval cases (`<eval dir>/**/case.yaml` or `prompt.md` + `graders/*.md`; the eval dir is `evals/` unless `--eval-dir` or the manifest says otherwise) against a plugin and report scored results. Target is a path, a plugin name, or a `plugin@marketplace` id - installed and skills-dir plugins both resolve (and add a no-plugin baseline arm)." Drei Dinge daran treffen genau das, was `EVALS.md` als fehlend beschreibt: es startet Laeufe, es bewertet sie, und es zieht eine **Baseline ohne das Plugin** - was `EVALS.md` als Voraussetzung nennt ("Establish baseline: measure performance without the Skill", ueber Anthropics Evaluation-driven development). Und es laeuft ueber die vorhandene Claude-Code-Authentifizierung, umgeht also den Credential-Blocker fuer einen der drei Harnesses. Was es **nicht** ist: eine Pruefung der Authoring-Qualitaet. Es fuehrt selbstgeschriebene Faelle aus - die Faelle sind die eigentliche Arbeit, nicht das Werkzeug. ## Zu klaeren - Ob Chemenus `.claude/skills/` fuer `plugin eval` ein gueltiges Target ist. `claude plugin init` legt unter `~/.claude/skills/<name>/` an und laedt als `<name>@skills-dir`; die publizierten Skills hier liegen im Projekt, nicht dort. `claude plugin list` meldet in diesem Checkout "No plugins installed". - Ob ein Claude-Code-only-Runner dem Anspruch von `EVALS.md` genuegt, das drei Harnesses vergleichen will - oder ob er als erste Stufe zaehlt, die die Faelle und das Scoring-Format erarbeitet, bevor die anderen zwei folgen. - Wie sich das zum vorhandenen `wikitool eval score` (L1/L2 ueber Traces) verhaelt: zwei Bewertungswege oder einer, der den anderen fuettert. - Ob die Faelle im Repo liegen und damit ausgeliefert werden, oder ob sie dev-only sind wie `instructions/dev/`. ## Akzeptanzkriterien - [ ] Es ist geprueft und schriftlich festgehalten, ob `claude plugin eval` gegen die publizierten Skills dieses Repos ueberhaupt laeuft - mit dem tatsaechlichen Kommando und seiner Ausgabe als Beleg, nicht als Vermutung. - [ ] Falls ja: `EVALS.md` § "The agent runner" sagt, was dieses Werkzeug abdeckt und was es offen laesst - der heutige Absatz ("a live run cannot be executed") ist dann in dieser Form nicht mehr wahr. - [ ] Falls nein: der Grund steht dort, damit die Frage nicht ein zweites Mal gestellt wird. - [ ] Die Entscheidung ueber den Ablageort der Faelle (ausgeliefert oder dev-only) ist getroffen und begruendet. - [ ] Kein Eval-Fall wird angelegt, bevor die Zielfrage beantwortet ist - `EVALS.md` haelt die Reihenfolge fest ("comprehension, then specification, then generalization"), und Faelle vor der Frage sind der Proxy, vor dem der Abschnitt warnt. ## Nicht Gegenstand Anthropics Checklistenpunkte "At least three evaluations created" und "Tested with Haiku, Sonnet, and Opus" als eigener Missstand. Sie beschreiben dieselbe Luecke, die `EVALS.md` bereits fuehrt - kein zweites Issue dafuer. ## Herkunft Aufgefallen bei der Analyse aus #65, Sitzung 2026-09-09, waehrend der Suche nach einem Werkzeug fuer die Skill-Qualitaetspruefung. `/skill-doctor` schied dabei aus - er liefert Usage-Telemetrie, keine Authoring-Pruefung, und meldet in diesem Setup "Skill usage reports are not available on this connection".
torben added the prio/plannedsize/Marea/processkind/decision labels 2026-09-09 09:03:52 +00:00
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: torben/chemenu#80