Scrape Analyze Page

Extraherar varje fält + värde från en sparad HTML-sida, eventuellt mot ett JSON-schema.

av zytedata · zytedata/claude-skills

Fungerar med konfiguration ★ 8.0/10

Scrape Analyze Page — Extraherar varje fält + värde från en sparad HTML-sida, eventuellt mot ett JSON-schema.

Vad den gör

Rensar en lokalt sparad HTML-fil, hämtar strukturerad metadata (JSON-LD/OpenGraph/microdata) via extruct-biblioteket, och slår samman den med synliga sidfält till en typad JSON-utdata. Triggers endast på redan nedladdade filer (avvisar URL:er) och stöder ett schema-styrd strikt extraktionsläge.

Testrapport

Körde den live på en fixture-produktsida med JSON-LD: clean_html.py + extract_metadata.py (kräver uv) delade korrekt synlig DOM från strukturerad metadata och den sammanslagna extraktionen matchade en handgjord baslinje fält för fält — men SKILL.md kodar hårt ${CLAUDE_SKILL_DIR}/../scrape/references/python-environments.md, en syskon-skillfil som inte existerar efter en ordagrann enkel-skill-kopia.

Testad: 2026-07-15 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/zytedata/claude-skills
cd claude-skills
mkdir -p ~/.claude/skills
cp -r skills/scrape-analyze-page ~/.claude/skills/scrape-analyze-page

Kommandon och exempelprompter

  • /scrape-analyze-pageExtraherar varje fält + värde från en sparad HTML-sida, eventuellt mot ett JSON-schema.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Extract every field from this saved page product1.html into JSON
  • I downloaded this listing as listing.html, pull out every field and value
  • Analyze data.html against my schema.json in strict extraction mode