templates/capture-workflow.sh
templates/capture-workflow.shBrowse 14 files
459 tokens
1,825 bytes
Token encoding: o200k_base
Snapshot aff6125
← Back to SKILL.md
1#!/bin/bash2# Template: Content Capture Workflow3# Purpose: Extract content from web pages (text, screenshots, PDF)4# Usage: ./capture-workflow.sh <url> [output-dir]5#6# Outputs:7# - page-full.png: Full page screenshot8# - page-structure.txt: Page element structure with refs9# - page-text.txt: All text content10# - page.pdf: PDF version11#12# Optional: Load auth state for protected pages13 14set -euo pipefail15 16TARGET_URL="${1:?Usage: $0 <url> [output-dir]}"17OUTPUT_DIR="${2:-.}"18 19echo "Capturing: $TARGET_URL"20mkdir -p "$OUTPUT_DIR"21 22# Optional: Load authentication state23# if [[ -f "./auth-state.json" ]]; then24# echo "Loading authentication state..."25# agent-browser state load "./auth-state.json"26# fi27 28# Navigate to target29agent-browser open "$TARGET_URL"30agent-browser wait --load load31 32# Get metadata33TITLE=$(agent-browser get title)34URL=$(agent-browser get url)35echo "Title: $TITLE"36echo "URL: $URL"37 38# Capture full page screenshot39agent-browser screenshot --full "$OUTPUT_DIR/page-full.png"40echo "Saved: $OUTPUT_DIR/page-full.png"41 42# Get page structure with refs43agent-browser snapshot -i > "$OUTPUT_DIR/page-structure.txt"44echo "Saved: $OUTPUT_DIR/page-structure.txt"45 46# Extract all text content47agent-browser get text body > "$OUTPUT_DIR/page-text.txt"48echo "Saved: $OUTPUT_DIR/page-text.txt"49 50# Save as PDF51agent-browser pdf "$OUTPUT_DIR/page.pdf"52echo "Saved: $OUTPUT_DIR/page.pdf"53 54# Optional: Extract specific elements using refs from structure55# agent-browser get text @e5 > "$OUTPUT_DIR/main-content.txt"56 57# Optional: Handle infinite scroll pages58# for i in {1..5}; do59# agent-browser scroll down 100060# agent-browser wait 100061# done62# agent-browser screenshot --full "$OUTPUT_DIR/page-scrolled.png"63 64# Cleanup65agent-browser close66 67echo ""68echo "Capture complete:"69ls -la "$OUTPUT_DIR"70