18ae28f918
Chemenu kompiliert Rohnotizen zu einem verlinkten, quellengebundenen Wiki: raw/ -> types/ + tools/ -> kb/ -> reports/. Was mechanisch ist, macht tools/wikitool; was Urteil braucht, macht ein Agent unter Contracts, deren Grenzen in Code durchgesetzt sind statt im Prompt. Dieser Commit ist der Startpunkt der oeffentlichen Historie. Die vorherige Entwicklung fand in einer privaten Instanz statt und ist nicht Teil dieses Repositorys; ihre Erzaehlung steht vollstaendig in CHANGES.md, das mit 44 Eintraegen von 0.1.0 bis 2.1.0 erhalten geblieben ist. Der mitgelieferte Korpus ist ein Testbett und eine Demo: 170 Seiten ueber den Stack selbst - Gates, Lint, Versionierung, Suche, das Wiki-Muster. Er dokumentiert das Werkzeug mit den eigenen Mitteln des Werkzeugs. Lizenz: AGPL-3.0 fuer den Stack (tools/, types/), CC-BY-4.0 fuer die Inhalte. Die Grenze zwischen beiden ist der Dateiplan, den dist export berechnet - siehe NOTICE.
131 lines
4.8 KiB
Markdown
131 lines
4.8 KiB
Markdown
---
|
|
type: types/concept.md
|
|
concept_type: pattern
|
|
tags: [confidence, scoring, reliability, knowledge-management]
|
|
created: 2026-07-26
|
|
modified: 2026-08-29
|
|
related: [Memory Lifecycle, LLM Wiki Pattern]
|
|
sources: [Source - LLM Wiki v2]
|
|
confidence: 0.95
|
|
confidence_base: 0.95
|
|
provenance: sourced
|
|
summary: Mechanismus, der faktischen Aussagen quantitative Werte nach Quellenzahl, Aktualität, Qualität und Bestätigung zuweist, um gut gestütztes Wissen zu erkennen.
|
|
---
|
|
# Confidence Scoring
|
|
|
|
**Typ:** Pattern (Wissens-Zuverlässigkeitsbeurteilung)
|
|
|
|
## Definition
|
|
|
|
Confidence Scoring ist ein Mechanismus zur Zuweisung einer **quantitativen Konfidenz-Bewertung** zu jedem faktische Aussage im Wiki, der es dem LLM ermöglicht, zwischen gut gestütztem Wissen und vorläufigen Beobachtungen zu unterscheiden. Dies ist eine Kernkomponente der [[Memory Lifecycle]]-Verwaltung.
|
|
|
|
## Kernpunkte
|
|
|
|
### Die Scoring-Formel
|
|
|
|
Die Konfidenz-Bewertung jedes faktischen Aussage wird berechnet aus:
|
|
|
|
| Faktor | Gewichtung | Beschreibung |
|
|
|--------|--------|-------------|
|
|
| Basis-Konfidenz | +0.5 | Standard für jeden Aussage aus einer einzigen Quelle |
|
|
| Quellenanzahl | +0.2 pro Quelle (max +0.6) | Mehr Quellen = höhere Konfidenz |
|
|
| Aktualität | +0.2 (<30 Tage), +0.1 (<90 Tage) | Aktuelle Bestätigungen erhöhen Konfidenz |
|
|
| Quellenqualität | +0.1 (Amtliche Dokumente), +0.05 (Reputabel) | Bessere Quellen = höhere Konfidenz |
|
|
| Bestätigung | +0.1 | Mehrere unabhängige Quellen stimmen überein |
|
|
| **Maximum** | **1.0** | Vollständige Konfidenz (selten) |
|
|
|
|
### Konfidenz-Verfall
|
|
|
|
Die Konfidenz **verfällt um 1% pro Monat** seit der letzten Bestätigung, mit einem **Minimum von 0.2**.
|
|
|
|
Dies modelliert die natürliche Erosion der Wissenssicherheit im Laufe der Zeit.
|
|
|
|
### Konfidenz-Schwellwerte für Sprache
|
|
|
|
Bei der Synthese von Antworten sollte der LLM Konfidenz-Bewertungen verwenden, um Aussagen zu qualifizieren:
|
|
|
|
- **Konfidenz ≥ 0.6:** Als Tatsache angeben („Projekt X verwendet Redis")
|
|
- **0.4 ≤ Konfidenz < 0.6:** Versuchsweise Sprache verwenden („möglicherweise", „kann")
|
|
- **0.2 ≤ Konfidenz < 0.4:** Als unsicher markieren („unsicher", „unbestätigt")
|
|
- **Konfidenz < 0.2:** Sollte nicht in Antworten verwendet werden
|
|
|
|
## Implementierung
|
|
|
|
### Zu verfolgbende Metadaten
|
|
|
|
Für jede Aussage speichern:
|
|
```yaml
|
|
source: [list of source IDs]
|
|
source_dates: [list of dates]
|
|
last_confirmed: YYYY-MM-DD
|
|
confidence: 0.XX
|
|
quality_flags: [official, reputable, etc.]
|
|
```
|
|
|
|
### Automation
|
|
|
|
Confidence Scoring funktioniert am besten mit [[Event-Driven Automation]]:
|
|
|
|
- **Bei Quellenaufnahme:** Anfängliche Konfidenz für extrahierte Aussagen berechnen
|
|
- **Bei Zugriff auf Aussagen:** Konfidenz erhöhen (Verstärkung)
|
|
- **Bei neuer bestätigender Quelle:** Konfidenz erhöhen, Quellen aktualisieren
|
|
- **Bei Widerspruch:** [[Supersession]] oder [[Contradiction Resolution]] auslösen
|
|
- **Nach Zeitplan (monatlich):** Alle Konfidenz-Scores verfallen lassen
|
|
|
|
## Beispiele
|
|
|
|
Aussage: „Das CI-System verwendet BuildKit auf Port 1234"
|
|
|
|
- **Quelle 1:** Interne Dokumentation (Amtlich) - datiert 2026-07-01
|
|
- **Quelle 2:** Team-Besprechungsnotizen (Reputabel) - datiert 2026-07-15
|
|
- **Zuletzt bestätigt:** 2026-07-20
|
|
- **Aktuelles Datum:** 2026-07-26
|
|
|
|
Berechnung:
|
|
- Basis: +0.5
|
|
- Quellenanzahl (2): +0.4 (begrenzt auf +0.6, also +0.4)
|
|
- Aktualität: +0.2 (Quelle 2 < 30 Tage)
|
|
- Quellenqualität: +0.1 (Quelle 1 ist Amtlich)
|
|
- **Zwischensumme:** 1.2 → **Begrenzt auf 1.0**
|
|
- Verfall: 6 Tage seit letzter Bestätigung ≈ 0.2% Verfall
|
|
- **Endgültige Konfidenz:** 0.996 ≈ **0.996**
|
|
|
|
Aussage: „Das CI-System verwendet BuildKit auf Port 1234." (als Tatsache angegeben)
|
|
|
|
## Vorteile
|
|
|
|
- **Transparenz:** Benutzer wissen, wie zuverlässig jeder Aussage ist
|
|
- **Priorisierung:** Hochkonfidenz-Informationen erscheinen zuerst
|
|
- **Vertrauen:** Stärkt das Vertrauen der Benutzer in die Wiki-Genauigkeit
|
|
- **Selbstkorrektur:** Aussagen mit niedriger Konfidenz erhalten Aufmerksamkeit zur Überprüfung
|
|
|
|
## Wann zu verwenden
|
|
|
|
- Alle faktischen Aussagen im Wiki
|
|
- Besonders wichtig für:
|
|
- Technische Spezifikationen
|
|
- Architekturentscheidungen
|
|
- Sicherheitsbezogene Informationen
|
|
- Zeitempfindliches Wissen
|
|
|
|
## Wann NICHT zu verwenden
|
|
|
|
- Meinungen oder subjektive Aussagen
|
|
- Definitionen, die sich nicht ändern
|
|
- Reine deskriptive Metadaten
|
|
|
|
## Verwandte Concepts
|
|
|
|
- [[Memory Lifecycle]] - Übergeordnetes Konzept
|
|
- [[Supersession]] - Umgang mit widersprochenen Aussagen
|
|
- [[Forgetting]] - Komplementärer Mechanismus für alte Aussagen
|
|
- [[LLM Wiki Pattern]] - Gesamtmuster
|
|
- [[Agent Memory]] - Produktionsimplementierung
|
|
- [[Quality Scoring]] - Komplementäre Qualitätsmetriken
|
|
|
|
## Siehe auch
|
|
|
|
- [[Event-Driven Automation]] (für automatisierte Konfidenz-Updates)
|
|
- [[Contradiction Resolution]] (für Konfliktbehandlung)
|
|
- [[Self-Healing]] (für automatisierte Konfidenz-Reparatur)
|