
GitHub-Stars vs. Test-Score: Sagt Popularität Qualität voraus?
GitHub-Stars vs. getestete Leistung: Eine schwache Korrelation bei Claude-Skills
Als Entwickler nutzen wir Heuristiken, um die überwältigende Menge an Open-Source-Tools zu bewältigen. Eine der häufigsten ist die Popularität eines Repositorys. Wenn man vor mehreren Optionen steht, erscheint das Sortieren nach der Anzahl der GitHub-Stars als ein rationaler erster Schritt. Die Annahme ist, dass Stars ein Indikator für Qualität sind, ein Signal der Schwarmintelligenz, das anzeigt, dass ein Projekt nützlich, stabil und gewartet ist. Für etablierte Ökosysteme wie Web-Frameworks oder Datenbanken trifft diese Heuristik oft zu. Bei Claude-Skills versagt sie laut unseren Daten jedoch häufig.
Bei SkillProof haben wir keinen Zugriff auf private Installationszahlen von Skills. Tatsächlich hat niemand außerhalb der Plattformanbieter diese Daten, was jede Diskussion über claude skill install numbers meaning rein spekulativ macht. Was wir jedoch haben, ist die öffentliche Anzahl der Stars für jeden von uns getesteten Skill und unser eigenes Testergebnis. Nachdem wir 1416 Skills für standardisierte Aufgaben installiert und ausgeführt haben, können wir mit Sicherheit feststellen, dass es eine schwache und oft irreführende Korrelation zwischen der Anzahl der Stars eines Skills und seiner tatsächlichen, getesteten Leistung gibt.
Dieser Artikel untersucht diese Diskrepanz. Wir werden uns ansehen, warum populäre Skills oft nicht die erwartete Leistung erbringen und warum einige der besten Skills im Long Tail der Unbekanntheit zu finden sind. Die zentrale Frage ist nicht nur, ob populäre Claude-Skills gut sind, sondern ob Popularität selbst eine nützliche Metrik für Qualität in diesem Ökosystem ist. Unsere Ergebnisse deuten darauf hin, dass dies nicht der Fall ist.
Der Reiz des Social Proof
Es ist leicht zu verstehen, warum Stars die Standardmetrik für die Entdeckung neuer Tools sind. Eine hohe Anzahl an Stars deutet darauf hin, dass ein Projekt die Aufmerksamkeit vieler anderer Entwickler auf sich gezogen hat. Dieser Social Proof impliziert einige Dinge: Das Konzept ist wertvoll, der Code wurde von vielen Augen geprüft und es existiert eine Community, die Unterstützung bietet. Theoretisch führen mehr Nutzer zu mehr Bug-Reports, mehr Pull-Requests und mit der Zeit zu einem robusteren Tool.
Diese Logik liegt den meisten Software-Ökosystemen zugrunde. Das Ökosystem der Claude-Skills weist jedoch einzigartige Merkmale auf, die dieses Modell untergraben. Die Eintrittsbarriere ist niedrig, was zu einer Flut von Skills führt, die experimentell, unvollständig oder nur Wrapper um einen einzelnen Prompt sind. Das Tempo der Veränderungen bei den zugrundeliegenden Modellen ist hoch, was bedeutet, dass ein Skill, der vor sechs Monaten funktionierte, heute aufgrund veralteter Abhängigkeiten (Dependency Rot) oder Änderungen im Verhalten des Basismodells fehlerhaft oder, schlimmer noch, suboptimal sein kann.
Darüber hinaus können Stars ein nachlaufender Indikator für Qualität sein oder eher Hype als Nutzen anzeigen. Ein cleveres README.md oder ein viraler Post in den sozialen Medien kann Tausende von Stars für ein Projekt generieren, das kaum mehr als ein Konzept ist. Die Stars bleiben, lange nachdem die anfängliche Aufregung verflogen ist und das Repository brachliegt. Das ist die Realität, der wir täglich begegnen.
Was 1416 getestete Skills aufzeigen
Unser Prozess ist einfach: Wir finden einen Skill, installieren ihn und führen ihn für eine reale Aufgabe aus, die in unserer Testmethodik definiert ist. Der Skill besteht den Test, erfordert eine manuelle Einrichtung, die über die dokumentierten Anweisungen hinausgeht, oder er schlägt fehl. Ein Fehlschlag kann bedeuten, dass er einen Fehler erzeugt, ein Timeout auftritt oder – was am kritischsten ist – ein Ergebnis liefert, das messbar schlechter ist als die Verwendung von Claude ohne Skill für dieselbe Aufgabe.
Hier ist die übergeordnete Aufschlüsselung unserer Ergebnisse von den bisher 1416 getesteten Skills:
- 889 bestanden (63 %): Der Skill lässt sich installieren und führt die beworbene Funktion in unserem Testfall korrekt aus.
- 467 benötigen Konfiguration (33 %): Der Skill funktioniert nicht standardmäßig, kann aber mit erheblichem Aufwand zum Laufen gebracht werden, z. B. durch manuelle Installation von Abhängigkeiten, Code-Änderungen oder undokumentierte Konfiguration.
- 60 fehlgeschlagen (4 %): Der Skill ist defekt oder seine Ausgabe ist schlechter als die des Basismodells. Wir stufen diese als Netto-Negativ ein; es ist besser, sie nicht zu installieren.
Die wichtigste Erkenntnis ist, dass über ein Drittel der Skills in unserem Katalog bei der Installation nicht wie beworben funktionieren. Darunter befindet sich eine beträchtliche Anzahl von Repositories mit einer hohen Anzahl an Stars. Das einfache Sortieren nach Popularität auf einer Plattform wie GitHub fördert unweigerlich Skills zutage, die Abandonware sind, eine Einrichtung auf Expertenniveau erfordern oder einfach defekt sind.
Anatomie eines populären Fehlschlags
Obwohl wir in diesem Kontext keine spezifischen Skills nennen, sind die Fehlermuster bei populären Repositories konsistent. Dies sind keine Einzelfälle; es sind wiederkehrende Archetypen der Diskrepanz zwischen Popularität und Leistung.
Ein häufiger Archetyp ist das übervermarktete Konzept. Wir haben mehrere Skills mit Tausenden von Stars getestet, die versprechen, einen Workflow wie das Frontend-Design zu revolutionieren. Wenn wir unseren Test durchführen, erzeugt der Skill syntaktisch ungültigen Code, verwendet veraltete Muster oder generiert ein Design, das weniger kohärent ist als das, was ein einfacher, gut formulierter Prompt an das Basismodell liefert. Die hohe Anzahl an Stars spiegelt die Begeisterung für die Idee des Skills wider, nicht die Qualität seiner Ausführung. Dies ist ein Schlüsselfaktor bei der Betrachtung von frontend-design skill install count quality – die wahrgenommene Popularität garantiert kein funktionierendes Produkt.
Ein anderer ist der schlafende Riese. Dies war zum Zeitpunkt seiner Erstellung ein gut gebauter, wirklich nützlicher Skill. Er gewann eine große Anhängerschaft und viele Stars. Dann hat sich der Maintainer anderen Dingen zugewandt. Zwei Jahre später sind seine Abhängigkeiten veraltet, er ruft APIs auf, die nicht mehr existieren, und er funktioniert nicht mehr mit der aktuellen Version der Claude-Plattform. Die Stars bleiben und dienen als Falle für neue Nutzer, die annehmen, das Projekt sei noch aktiv und zuverlässig.
Die vielleicht besorgniserregendste Kategorie ist der Skill, der die Leistung aktiv beeinträchtigt. Wir haben 60 Skills getestet, die unter der Basisleistung von Claude ohne Skill abschnitten. Beispielsweise könnte ein Skill für Code-Refactoring starre, veraltete Linting-Regeln anwenden, die den Code weniger lesbar machen, oder ein Datenanalyse-Skill könnte API-Aufrufe für Bibliotheken halluzinieren, auf die er keinen Zugriff hat. Diese Skills helfen nicht nur nicht, sie verschlechtern die Ausgabe aktiv. Viele dieser leistungsschwachen Skills haben Hunderte oder sogar Tausende von Stars.
Im Long Tail: Unbekannte Gewinner finden
Umgekehrt haben einige der effektivsten und zuverlässigsten Skills in unserem Verzeichnis weniger als 50 Stars. Dies sind oft gezielte Werkzeuge, die von Entwicklern entwickelt wurden, um ein spezifisches, persönliches Problem zu lösen. Sie erledigen eine Aufgabe und das außergewöhnlich gut.
Diese versteckten Juwelen haben nicht den Marketing-Druck ihrer populäreren Gegenstücke. Ihr README.md mag spärlich sein, und sie haben vielleicht kein schickes Logo. Was sie jedoch haben, ist sauberer, funktionaler Code, der durch praktische Anwendung verfeinert wurde. Wir haben einen Skill mit nur einer Handvoll Stars gefunden, der den Prozess der Konvertierung komplexer JSON-Objekte in übersichtliche Markdown-Tabellen perfekt automatisiert und in unseren Tests eine 9/10 erreichte. Ein anderes, ein Nischen-Tool zur Generierung von Datenbank-Migrationsskripten, hat unsere Tests fehlerfrei bestanden, während größere, populärere Tools mit verschiedenen SQL-Dialekten zu kämpfen hatten.
Diese Erfolge verdeutlichen das Kernproblem bei der Verwendung von Popularität als Filter: Sie optimiert auf Sichtbarkeit, nicht auf Nutzen. Die sichtbarsten Projekte sind nicht immer die wertvollsten. Der wahre Wert liegt oft im Long Tail der spezialisierten Tools, aber ihre Entdeckung erfordert einen systematischen, evidenzbasierten Ansatz – nicht ein einfaches Sortieren nach Stars.
Von Social Proof zur Ground Truth: Eine bessere Metrik
Wenn Stars ein unzuverlässiger Indikator sind, was ist die Alternative? Das einzig wahre Maß für die Qualität eines Skills ist seine Leistung bei einer realen Aufgabe. Das ist die Ground Truth. Die Herausforderung besteht darin, dass die Feststellung dieser Wahrheit selbst für einen einzigen Skill Zeit und Mühe erfordert: das Klonen des Repos, das Erstellen einer Testumgebung, das Entwerfen eines Testfalls und das Ausführen des Skills.
Das ist die Arbeit, die wir bei SkillProof leisten. Unsere /10-Bewertung ist kein Ausdruck unserer Meinung. Sie ist eine Aufzeichnung eines getesteten Ergebnisses. Eine hohe Punktzahl bedeutet, dass der Skill einen wiederholbaren, objektiven Test bestanden hat. Eine niedrige Punktzahl bedeutet, dass er fehlgeschlagen ist.
So vergleichen sich die beiden Metriken in der Praxis:
| Metrik | Was sie suggeriert | Was sie in der Realität oft bedeutet |
|---|---|---|
| Hohe Anzahl an Stars | "Dies ist ein hochwertiger, vertrauenswürdiger Skill." | "Dies war irgendwann populär; funktioniert möglicherweise heute nicht mehr." |
| SkillProof Score > 7/10 | "Dieser Skill funktioniert mit hoher Wahrscheinlichkeit." | "Wir haben diesen Skill für eine reale Aufgabe installiert und ausgeführt, und er hat bestanden." |
| SkillProof-Urteil: Fehlgeschlagen | "Dieser Skill hat einen Bug." | "Dieser Skill hat in unserem Test schlechter abgeschnitten als Claude ohne Skill." |
Bei der Entscheidung, ob ein Skill installiert werden soll, lautet die Frage nicht „Ist er populär?“, sondern „Funktioniert er?“. Die 60 Skills, die unter dem Niveau des Basismodells abschnitten, sind eine deutliche Mahnung, dass Popularität aktiv irreführend sein kann.
Ein praktischer Rahmen zur Bewertung von Skills
Angesichts der Unzuverlässigkeit von Popularitätsmetriken benötigen Entwickler einen robusteren Rahmen zur Bewertung von Claude-Skills. Sich auf ein Verzeichnis zu verlassen, das die Tests bereits durchgeführt hat, ist der effizienteste Weg. Wenn man einen Skill jedoch selbst bewertet, ist eine gesunde Dosis Skepsis das beste Werkzeug.
Erstens: Die Anzahl der Stars sollte als historisches Artefakt und nicht als aktuelle Empfehlung betrachtet werden. Sie zeigt vergangenes Interesse, nicht heutige Qualität. Man sollte genauer hinschauen.
Zweitens: Die Aktivität des Repositorys sollte geprüft werden. Man sollte das Datum des letzten Commits prüfen. Gibt es aktuelle, sinnvolle Änderungen, oder war das letzte Update vor zwei Jahren? Man sollte die offenen Issues lesen. Melden Nutzer kritische Fehler? Reagiert der Maintainer? Ein lebhafter Issue-Tracker mit aktiver Diskussion ist ein weitaus besseres Gesundheitszeichen als eine hohe Anzahl an Stars bei einem stillen Repository.
Drittens: Wenn möglich, sollte der Quellcode gelesen werden. Viele Skills sind recht klein. Oft kann man sich in wenigen Minuten einen Eindruck von der Codequalität und dem gewählten Ansatz verschaffen. Man sollte sich die Datei SKILL.md ansehen. Wirkt das Prompt-Engineering durchdacht, oder handelt es sich um eine einfache Vorlage, die man leicht selbst erstellen könnte?
Letztendlich kann man nur sicher sein, wenn man den Skill selbst an einer unkritischen Aufgabe testet. Dieser Prozess – Klonen, Installieren, Konfigurieren, Testen, Evaluieren – ist die Grundlage einer zuverlässigen Bewertung. Er ist auch eine erhebliche Zeitinvestition, insbesondere wenn er für Dutzende potenzieller Skills wiederholt wird.
Weiterführende Lektüre: wie viele indizierte Skills tatsächlich laufen · die Skills, die eine Top-Bewertung erhielten.
Wir haben SkillProof entwickelt, weil wir glauben, dass dieser Verifizierungsschritt unerlässlich ist, und wir wissen, dass die meisten Entwickler nicht die Zeit haben, ihn für jedes in Betracht gezogene Tool selbst durchzuführen. Wir haben die Tests für 1416 Skills durchgeführt, damit andere es nicht tun müssen. Durchsuchen Sie alle 889 bestandenen Skills in unserem Katalog, um verifiziert funktionierende Tools zu finden, oder erwerben Sie unser kuratiertes Paket der 10 besten getesteten Allzweck-Skills zum einmaligen Preis von 10 $.
★ 9.6/10 × 3
Das kostenlose Starterpaket
Die 3 Skills mit unseren besten Testergebnissen plus die Install-Checkliste — das Setup, das wir auf einen frischen Rechner packen würden. Kostenlos, per E-Mail.