EVALS.md § "The agent runner, and why it is not here yet" (Z. 432-459) haelt fest: die fehlende Haelfte der Evaluation ist ein Runner, der einen Harness gegen eine Aufgabe startet, mehrfach, und eine Pass-Rate meldet. Das Design steht dort ausformuliert. Gebaut ist es nicht, und der genannte Grund ist konkret:
"No provider credentials are configured on this machine - Vibe's providers declare an api_key_env_var and none of those variables is set - so a live run cannot be executed, let alone verified."
Die Statustabelle (Z. 430) fuehrt entsprechend "Agent runner (eval run) and L3 - designed below, not built".
Was neu ist
Claude Code bringt inzwischen claude plugin eval mit (verifiziert in 2.1.257):
"Run eval cases (<eval dir>/**/case.yaml or prompt.md + graders/*.md; the eval dir is evals/ unless --eval-dir or the manifest says otherwise) against a plugin and report scored results. Target is a path, a plugin name, or a plugin@marketplace id - installed and skills-dir plugins both resolve (and add a no-plugin baseline arm)."
Drei Dinge daran treffen genau das, was EVALS.md als fehlend beschreibt: es startet Laeufe, es bewertet sie, und es zieht eine Baseline ohne das Plugin - was EVALS.md als Voraussetzung nennt ("Establish baseline: measure performance without the Skill", ueber Anthropics Evaluation-driven development). Und es laeuft ueber die vorhandene Claude-Code-Authentifizierung, umgeht also den Credential-Blocker fuer einen der drei Harnesses.
Was es nicht ist: eine Pruefung der Authoring-Qualitaet. Es fuehrt selbstgeschriebene Faelle aus - die Faelle sind die eigentliche Arbeit, nicht das Werkzeug.
Zu klaeren
Ob Chemenus .claude/skills/ fuer plugin eval ein gueltiges Target ist. claude plugin init legt unter ~/.claude/skills/<name>/ an und laedt als <name>@skills-dir; die publizierten Skills hier liegen im Projekt, nicht dort. claude plugin list meldet in diesem Checkout "No plugins installed".
Ob ein Claude-Code-only-Runner dem Anspruch von EVALS.md genuegt, das drei Harnesses vergleichen will - oder ob er als erste Stufe zaehlt, die die Faelle und das Scoring-Format erarbeitet, bevor die anderen zwei folgen.
Wie sich das zum vorhandenen wikitool eval score (L1/L2 ueber Traces) verhaelt: zwei Bewertungswege oder einer, der den anderen fuettert.
Ob die Faelle im Repo liegen und damit ausgeliefert werden, oder ob sie dev-only sind wie instructions/dev/.
Akzeptanzkriterien
Es ist geprueft und schriftlich festgehalten, ob claude plugin eval gegen die publizierten Skills dieses Repos ueberhaupt laeuft - mit dem tatsaechlichen Kommando und seiner Ausgabe als Beleg, nicht als Vermutung.
Falls ja: EVALS.md § "The agent runner" sagt, was dieses Werkzeug abdeckt und was es offen laesst - der heutige Absatz ("a live run cannot be executed") ist dann in dieser Form nicht mehr wahr.
Falls nein: der Grund steht dort, damit die Frage nicht ein zweites Mal gestellt wird.
Die Entscheidung ueber den Ablageort der Faelle (ausgeliefert oder dev-only) ist getroffen und begruendet.
Kein Eval-Fall wird angelegt, bevor die Zielfrage beantwortet ist - EVALS.md haelt die Reihenfolge fest ("comprehension, then specification, then generalization"), und Faelle vor der Frage sind der Proxy, vor dem der Abschnitt warnt.
Nicht Gegenstand
Anthropics Checklistenpunkte "At least three evaluations created" und "Tested with Haiku, Sonnet, and Opus" als eigener Missstand. Sie beschreiben dieselbe Luecke, die EVALS.md bereits fuehrt - kein zweites Issue dafuer.
Herkunft
Aufgefallen bei der Analyse aus #65, Sitzung 2026-09-09, waehrend der Suche nach einem Werkzeug fuer die Skill-Qualitaetspruefung. /skill-doctor schied dabei aus - er liefert Usage-Telemetrie, keine Authoring-Pruefung, und meldet in diesem Setup "Skill usage reports are not available on this connection".
## Ausgangslage
`EVALS.md` § "The agent runner, and why it is not here yet" (Z. 432-459) haelt fest: die fehlende Haelfte der Evaluation ist ein Runner, der einen Harness gegen eine Aufgabe startet, mehrfach, und eine Pass-Rate meldet. Das Design steht dort ausformuliert. Gebaut ist es nicht, und der genannte Grund ist konkret:
> "No provider credentials are configured on this machine - Vibe's providers declare an `api_key_env_var` and none of those variables is set - so a live run cannot be executed, let alone verified."
Die Statustabelle (Z. 430) fuehrt entsprechend "Agent runner (`eval run`) and L3 - designed below, not built".
## Was neu ist
Claude Code bringt inzwischen `claude plugin eval` mit (verifiziert in 2.1.257):
> "Run eval cases (`<eval dir>/**/case.yaml` or `prompt.md` + `graders/*.md`; the eval dir is `evals/` unless `--eval-dir` or the manifest says otherwise) against a plugin and report scored results. Target is a path, a plugin name, or a `plugin@marketplace` id - installed and skills-dir plugins both resolve (and add a no-plugin baseline arm)."
Drei Dinge daran treffen genau das, was `EVALS.md` als fehlend beschreibt: es startet Laeufe, es bewertet sie, und es zieht eine **Baseline ohne das Plugin** - was `EVALS.md` als Voraussetzung nennt ("Establish baseline: measure performance without the Skill", ueber Anthropics Evaluation-driven development). Und es laeuft ueber die vorhandene Claude-Code-Authentifizierung, umgeht also den Credential-Blocker fuer einen der drei Harnesses.
Was es **nicht** ist: eine Pruefung der Authoring-Qualitaet. Es fuehrt selbstgeschriebene Faelle aus - die Faelle sind die eigentliche Arbeit, nicht das Werkzeug.
## Zu klaeren
- Ob Chemenus `.claude/skills/` fuer `plugin eval` ein gueltiges Target ist. `claude plugin init` legt unter `~/.claude/skills/<name>/` an und laedt als `<name>@skills-dir`; die publizierten Skills hier liegen im Projekt, nicht dort. `claude plugin list` meldet in diesem Checkout "No plugins installed".
- Ob ein Claude-Code-only-Runner dem Anspruch von `EVALS.md` genuegt, das drei Harnesses vergleichen will - oder ob er als erste Stufe zaehlt, die die Faelle und das Scoring-Format erarbeitet, bevor die anderen zwei folgen.
- Wie sich das zum vorhandenen `wikitool eval score` (L1/L2 ueber Traces) verhaelt: zwei Bewertungswege oder einer, der den anderen fuettert.
- Ob die Faelle im Repo liegen und damit ausgeliefert werden, oder ob sie dev-only sind wie `instructions/dev/`.
## Akzeptanzkriterien
- [ ] Es ist geprueft und schriftlich festgehalten, ob `claude plugin eval` gegen die publizierten Skills dieses Repos ueberhaupt laeuft - mit dem tatsaechlichen Kommando und seiner Ausgabe als Beleg, nicht als Vermutung.
- [ ] Falls ja: `EVALS.md` § "The agent runner" sagt, was dieses Werkzeug abdeckt und was es offen laesst - der heutige Absatz ("a live run cannot be executed") ist dann in dieser Form nicht mehr wahr.
- [ ] Falls nein: der Grund steht dort, damit die Frage nicht ein zweites Mal gestellt wird.
- [ ] Die Entscheidung ueber den Ablageort der Faelle (ausgeliefert oder dev-only) ist getroffen und begruendet.
- [ ] Kein Eval-Fall wird angelegt, bevor die Zielfrage beantwortet ist - `EVALS.md` haelt die Reihenfolge fest ("comprehension, then specification, then generalization"), und Faelle vor der Frage sind der Proxy, vor dem der Abschnitt warnt.
## Nicht Gegenstand
Anthropics Checklistenpunkte "At least three evaluations created" und "Tested with Haiku, Sonnet, and Opus" als eigener Missstand. Sie beschreiben dieselbe Luecke, die `EVALS.md` bereits fuehrt - kein zweites Issue dafuer.
## Herkunft
Aufgefallen bei der Analyse aus #65, Sitzung 2026-09-09, waehrend der Suche nach einem Werkzeug fuer die Skill-Qualitaetspruefung. `/skill-doctor` schied dabei aus - er liefert Usage-Telemetrie, keine Authoring-Pruefung, und meldet in diesem Setup "Skill usage reports are not available on this connection".
Blocking a user prevents them from interacting with repositories, such as opening or commenting on pull requests or issues. Learn more about blocking a user.
Ausgangslage
EVALS.md§ "The agent runner, and why it is not here yet" (Z. 432-459) haelt fest: die fehlende Haelfte der Evaluation ist ein Runner, der einen Harness gegen eine Aufgabe startet, mehrfach, und eine Pass-Rate meldet. Das Design steht dort ausformuliert. Gebaut ist es nicht, und der genannte Grund ist konkret:Die Statustabelle (Z. 430) fuehrt entsprechend "Agent runner (
eval run) and L3 - designed below, not built".Was neu ist
Claude Code bringt inzwischen
claude plugin evalmit (verifiziert in 2.1.257):Drei Dinge daran treffen genau das, was
EVALS.mdals fehlend beschreibt: es startet Laeufe, es bewertet sie, und es zieht eine Baseline ohne das Plugin - wasEVALS.mdals Voraussetzung nennt ("Establish baseline: measure performance without the Skill", ueber Anthropics Evaluation-driven development). Und es laeuft ueber die vorhandene Claude-Code-Authentifizierung, umgeht also den Credential-Blocker fuer einen der drei Harnesses.Was es nicht ist: eine Pruefung der Authoring-Qualitaet. Es fuehrt selbstgeschriebene Faelle aus - die Faelle sind die eigentliche Arbeit, nicht das Werkzeug.
Zu klaeren
.claude/skills/fuerplugin evalein gueltiges Target ist.claude plugin initlegt unter~/.claude/skills/<name>/an und laedt als<name>@skills-dir; die publizierten Skills hier liegen im Projekt, nicht dort.claude plugin listmeldet in diesem Checkout "No plugins installed".EVALS.mdgenuegt, das drei Harnesses vergleichen will - oder ob er als erste Stufe zaehlt, die die Faelle und das Scoring-Format erarbeitet, bevor die anderen zwei folgen.wikitool eval score(L1/L2 ueber Traces) verhaelt: zwei Bewertungswege oder einer, der den anderen fuettert.instructions/dev/.Akzeptanzkriterien
claude plugin evalgegen die publizierten Skills dieses Repos ueberhaupt laeuft - mit dem tatsaechlichen Kommando und seiner Ausgabe als Beleg, nicht als Vermutung.EVALS.md§ "The agent runner" sagt, was dieses Werkzeug abdeckt und was es offen laesst - der heutige Absatz ("a live run cannot be executed") ist dann in dieser Form nicht mehr wahr.EVALS.mdhaelt die Reihenfolge fest ("comprehension, then specification, then generalization"), und Faelle vor der Frage sind der Proxy, vor dem der Abschnitt warnt.Nicht Gegenstand
Anthropics Checklistenpunkte "At least three evaluations created" und "Tested with Haiku, Sonnet, and Opus" als eigener Missstand. Sie beschreiben dieselbe Luecke, die
EVALS.mdbereits fuehrt - kein zweites Issue dafuer.Herkunft
Aufgefallen bei der Analyse aus #65, Sitzung 2026-09-09, waehrend der Suche nach einem Werkzeug fuer die Skill-Qualitaetspruefung.
/skill-doctorschied dabei aus - er liefert Usage-Telemetrie, keine Authoring-Pruefung, und meldet in diesem Setup "Skill usage reports are not available on this connection".torben referenced this issue2026-09-09 14:28:20 +00:00