
MCP-Server: Claude-Skills vor Installation prüfen
Die Installation eines Claude-Skills ist ein Vertrauensvorschuss. Man findet eine SKILL.md auf GitHub, das README klingt überzeugend, die Anzahl der Sterne wirkt beruhigend, und man kopiert sie nach ~/.claude/skills/. Ob der Skill tatsächlich nützlich ist, stellt sich erst später heraus – meist mitten in der Arbeit, die man eigentlich erledigen wollte.
Wir verbringen unsere Tage damit, diese Lücke manuell zu schließen: Wir installieren den Skill, führen eine reale Aufgabe zweimal aus – einmal mit und einmal ohne Skill – und veröffentlichen den Unterschied. Bisher 743 Skills. Der schwierige Teil war immer die letzte Meile. Die Testergebnisse standen auf einer Website, und Websites sind für Menschen. Das System, das Ihre Skills installiert, ist ein Agent.
Daher stellen wir die Testergebnisse nun dort bereit, wo der Agent bereits ist.
Eine Zeile
claude mcp add skillproof -- npx -y skillproof-mcp
Das ist die gesamte Einrichtung. Kein API-Schlüssel, kein Konto, keine Konfigurationsdatei, die manuell bearbeitet werden muss. Es funktioniert in jedem MCP-Client – Claude Code, Claude Desktop, Cursor, Windsurf, Zed.
Bevor Ihr Agent nun etwas klont, kann er nachfragen.
Was es tatsächlich beantwortet
Der Server stellt zwei Tools zur Verfügung, die den beiden häufigsten Fragen von Nutzern entsprechen.
find_skill – „Gibt es hierfür einen getesteten Skill?“ Man beschreibt die Aufgabe und erhält passende Ergebnisse, geordnet nach ihrer Bewertung. Jedes Ergebnis enthält das Testergebnis, die Punktzahl von /10, unsere Testerkenntnisse und den Installationsbefehl.
check_skill – „Mir wurde dieser Skill empfohlen, ist er gut?“ Man nennt einen Skill, einen Slug oder ein GitHub-Repo und erhält unser Testergebnis dazu oder die ehrliche Antwort: „Wir haben diesen Skill nicht getestet – behandeln Sie ihn als ungeprüft.“
Jede Antwort enthält eines von drei möglichen Testergebnissen:
- pass – ließ sich fehlerfrei installieren, wurde korrekt ausgelöst und übertraf das normale Claude bei einer realen Aufgabe.
- setup – liefert Ergebnisse, aber nicht ohne Vorkonfiguration. Der Hinweis beschreibt genau, was zuerst zu tun ist.
- didn't pass – schnitt schlechter ab als die Baseline ohne Skill. Entweder konnte der Skill gar nicht ausgeführt werden, oder die Ausführung führte zu einem schlechteren Ergebnis als ohne Installation.
Dieses dritte Ergebnis ist der Grund, warum sich die Installation lohnt.
Ein aussagekräftiges Ergebnis
Fragt man den Server nach einem Skill, der Markdown in Confluence-Wiki-Markup umwandelt, erhält man folgende Antwort:
Confluence – DIDN'T PASS Ergebnis unseres Tests: Die gebündelte Datei
convert_markdown_to_wiki.pywurde auf ein reales Beispieldokument angewendet. Sie wandelt**bold**-Text unbemerkt in kursiven Wiki-Text um – ein echter Regex-Bug, keine Stilentscheidung – und lässt standardmäßige Tabellen im GitHub-Stil vollständig unkonvertiert, obwohlSKILL.md„Tabellen“ explizit unter den unterstützten Elementen auflistet.
Ein Verzeichnis, das nur Gewinner auflistet, hätte Ihnen diesen Skill mit einer freundlichen Beschreibung angezeigt und Sie den Bug, bei dem aus fett kursiv wird, selbst finden lassen – in einem Dokument, das Sie bereits an Ihr Team gesendet hätten. Unser System teilt Ihrem Agenten mit, sich die Mühe zu sparen.
Derzeit gibt es 31 solcher Skills im Katalog – getestet, veröffentlicht und rot markiert. Weitere 59 erreichen ein Unentschieden mit dem normalen Claude: Sie laufen, erzeugen ein Ergebnis, und dieses Ergebnis ist nicht besser als das, was man ohnehin erhalten hätte. Niemand sonst veröffentlicht eine dieser beiden Zahlen, da keine von beiden dem Ökosystem schmeichelt.
Woher die Daten stammen
Der Server selbst speichert keine Daten. Er liest skillproof.dev/api/skills.json – denselben Live-Katalog, den die Website rendert – und speichert ihn für fünfzehn Minuten im Cache. Wenn ein Skill nach einem Claude-Release erneut getestet wird, ändert sich die Antwort, die Ihr Agent erhält, entsprechend. Es muss nichts aktualisiert oder neu installiert werden.
Das Bewertungsschema ist öffentlich: Installation /5, Auslösung /5, Ergebnis-vs-Baseline /10, Doku und Ehrlichkeit /5, normalisiert auf eine Punktzahl von zehn. Es ist vollständig auf unserer Seite zur Methodik beschrieben, einschließlich der Begründung, warum das Ergebnis so viel wiegt wie alle anderen Kriterien zusammen.
Wenn Sie eigene Tools entwickeln, können Sie den Katalog unter CC BY nutzen – verwenden Sie die JSON-Datei oder den gesamten Katalog als reinen Text und nennen Sie skillproof.dev als Quelle.
Was das System nicht leistet
Zwei Dinge leistet dieses System nicht.
Es deckt nicht alles ab. Wir haben 743 der 16.682 von uns indizierten Skills getestet – den obersten Teil, gefiltert nach Sternen und durch unser automatisiertes Screening. Wenn Ihre Aufgabe eine Nische ist, kann die Antwort durchaus „bisher kein passender Skill getestet“ lauten, und der Server gibt genau das zurück, anstatt eine Empfehlung zu erfinden. Wir geben lieber kein Ergebnis zurück, als für etwas zu bürgen, das wir nie ausgeführt haben.
Und jedes Testergebnis hat ein Datum. Skills verändern sich; ein Skill, der im Juni bestanden hat, kann fehlschlagen, wenn sich eine Abhängigkeit ändert. Jede Karte enthält das Datum unseres Tests, und der Server gibt dieses Datum weiter. Veraltete Testergebnisse sind eine Tatsache und kein Bug, den wir beheben könnten – aber Sie wissen immer, wie alt das Ergebnis ist, das Sie gerade sehen.
Einrichten und nicht mehr daran denken
Im besten Fall denken Sie nie wieder darüber nach. Ihr Agent prüft Skills unbemerkt vor der Installation, überspringt die drei, die Ihnen den Abend ruiniert hätten, und wählt denjenigen aus, der tatsächlich für die anstehende Aufgabe getestet wurde.
claude mcp add skillproof -- npx -y skillproof-mcp
Der Quellcode ist auf GitHub verfügbar und unterliegt der MIT-Lizenz. Er ist im offiziellen MCP-Verzeichnis als io.github.Skillproofdev/skillproof gelistet. Wenn Sie eine falsche Antwort erhalten, ist das ein Fehler in unserem Testverfahren, nicht in der technischen Umsetzung – geben Sie uns Bescheid, und wir werden den Skill erneut testen.
★ 9.6/10 × 3
Das kostenlose Starterpaket
Die 3 Skills mit unseren besten Testergebnissen plus die Install-Checkliste — das Setup, das wir auf einen frischen Rechner packen würden. Kostenlos, per E-Mail.