Scrape Analyze Page

Ekstraherer hvert felt + verdi fra en lagret HTML-side, valgfritt mot et JSON-skjema.

av zytedata · zytedata/claude-skills

Krever oppsett ★ 8.0/10

Scrape Analyze Page — Ekstraherer hvert felt + verdi fra en lagret HTML-side, valgfritt mot et JSON-skjema.

Hva den gjør

Renser en lokalt lagret HTML-fil, trekker ut strukturert metadata (JSON-LD/OpenGraph/microdata) via extruct-biblioteket, og slår det sammen med synlige sidefelt til en typet JSON-utgang. Utløses kun på allerede nedlastede filer (avviser URL-er) og støtter en skjema-styrt streng ekstraksjonsmodus.

Testrapport

Kjørte den live på en fixtur-produktside med JSON-LD: clean_html.py + extract_metadata.py (trenger uv) delte korrekt synlig DOM fra strukturert metadata og den sammenslåtte ekstraksjonen matchet en håndlaget baseline felt for felt — men SKILL.md hardkoder `${CLAUDE_SKILL_DIR}/../scrape/references/python-environments.md`, en søsken-skill-fil som ikke eksisterer etter en ordrett enkelt-skill-kopi.

Testet på: 2026-07-15 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/zytedata/claude-skills
cd claude-skills
mkdir -p ~/.claude/skills
cp -r skills/scrape-analyze-page ~/.claude/skills/scrape-analyze-page

Kommandoer og eksempelprompter

  • /scrape-analyze-pageEkstraherer hvert felt + verdi fra en lagret HTML-side, valgfritt mot et JSON-skjema.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Extract every field from this saved page product1.html into JSON
  • I downloaded this listing as listing.html, pull out every field and value
  • Analyze data.html against my schema.json in strict extraction mode