抓取 Scrape
v1.0.0
io.clawhub.ivangdavila/scrape
合法的网页抓取,具备 robots.txt 合规、限速和 GDPR/CCPA 感知的数据处理。
“crawl scrape firecrawl fetch” 共 259 个结果
v1.0.0
io.clawhub.ivangdavila/scrape
合法的网页抓取,具备 robots.txt 合规、限速和 GDPR/CCPA 感知的数据处理。
v1.2.7
io.clawhub.byungkyu/firecrawl-api
Firecrawl API 集成,托管鉴权。抓取、爬取、映射与搜索网页内容。当用户想从网站提取内容、爬取整站、映射 URL 或搜索网页时使用本技能。其他第三方应用请使用 api-gateway 技能(https://clawhub.ai/byungkyu/api-gateway)。调用经由带 OAuth 登录的 maton CLI 执行;无法安装 CLI 时通过原始 HTTP 加 Maton API key 调用。每次调用都以用户连接身份鉴权,只能访问该连接授权范围内的数据(由服务商在每次请求时强制执行);本文档所列端点即本技能使用的端点,其他端点需用户点名要求方可使用。默认进行读取和列表操作,每次写操作或新建连接均需与用户确认。
io.github.garrytan/gstack/scrape
通过 Aside 浏览器从网页拉取数据——使用你真实的、已登录的会话。(gstack)
io.github.scrapegraphai/just-scrape/just-scrape
通过 ScrapeGraph AI CLI 搜索、抓取、爬取网页并提取结构化数据。
v1.0.4
io.clawhub.ivangdavila/playwright
用 Playwright 实现浏览器自动化、测试与排障:定位器、自动等待、trace、CI 运行与 MCP 浏览器控制。当测试不稳定、超时、或仅在 CI/无头模式失败;定位器命中多个或错误元素(strict mode 违规);点击需要 force、等待变成死 sleep、networkidle 永不空闲;涉及 storageState 与登录初始化、请求 mock 与 HAR 回放、上传下载、iframe 与 Shadow DOM、弹窗与对话框、因机器而异的截图 diff、trace 与报告产物、慢测试套件分片、设备与权限模拟、无障碍检查、经 Playwright MCP 驱动真实浏览器、从 JS 渲染页面提取数据,或把 Cypress/Puppeteer/Selenium 套件迁移到 Playwright 时使用。不用于维护现有 Cypress/Puppeteer 套件(cypress、puppeteer),也不用于普通 HTTP 请求即可满足的工作(http)。
v1.2.0
io.clawhub.waisimon/playwright-scraper-skill
基于 Playwright 的网页抓取技能,具备反爬对抗能力。已在 Discuss.com.hk 等复杂站点实测成功。
v1.0.0
io.clawhub.ashwingupy/firecrawl-search
通过 Firecrawl API 进行网页搜索与抓取。适用于搜索网页、抓取网站(含 JS 重度页面)、爬取整站或从页面提取结构化数据。需要 FIRECRAWL_API_KEY 环境变量。
v1.0.1
io.clawhub.mrtommywu/web-content-fetcher
网页内容获取工具 | 当常规爬虫被过滤时,使用替代服务获取网页内容。支持:1) r.jina.ai - 最稳定 2) markdown.new - Cloudflare 专用 3) defuddle.md - 备用方案。
v1.0.0
io.clawhub.yuhangch/cctv-news-fetcher
获取并解析指定日期的央视新闻联播(Xinwen Lianbo)新闻要点。
v1.0.1
io.clawhub.opsun/deep-scraper
使用容器化 Crawlee 对 YouTube 等复杂站点进行深度抓取,提取经过验证的、无广告的转录文本与内容,输出为 JSON。
v0.1.1
io.clawhub.guifav/web-scraper
网页抓取与内容理解智能体——多策略提取带级联回退、新闻检测、样板内容移除、结构化元数据。
v1.0.10
io.clawhub.lancelin111/crawl4ai-skill
Web crawling and scraping tool with LLM-optimized output. 网页爬虫爬取工具 | Web crawler, web scraper, spider.
v1.0.0
io.clawhub.javicasper/reddit-scraper
通过抓取 old.reddit.com 阅读与搜索 Reddit 帖子。当 Clawdbot 需要浏览 Reddit 内容时使用:读取指定板块的帖子、搜索感兴趣的话题、监控特定社区。只读访问,不发帖不评论。
v1.0.0
io.clawhub.3coco3/playwright-scraper
使用 Playwright 以隐身模式抓取网站、绕过机器人检测,支持动态 JS 内容,视口与 User-Agent 可自定义。
v1.0.0
io.clawhub.romneyda/tiktok-crawling
用于 TikTok 的抓取、内容获取与分析
v0.1.0
io.clawhub.hjw21century/x-tweet-fetcher
无需登录与 API key,零依赖、零配置地抓取完整推文、长推文、引用推文与 X 文章。
v1.0.0
io.clawhub.kamiender/douyin-video-fetch
下载抖音视频到本地(无水印优先)。用于给后续视频分析/复刻提供原始素材,支持 URL 或 video_id 输入、批量列表输入与统一输出目录。
v1.0.0
io.clawhub.leochens/smart-web-fetch
智能网页抓取技能 - 替代内置 web_fetch,自动使用 Jina Reader / markdown.new / defuddle.md 清洗服务获取干净 Markdown。支持多级降级策略,大幅降低 Token 消耗。当 Agent 需要获取网页内容时使用本技能替代 web_fetch。
v0.1.0
io.clawhub.veeramanikandanr48/economic-calendar-fetcher
按指定日期从 FMP API 拉取计划中的经济事件与数据发布,支持按影响程度、国家和类型过滤。
v1.0.0
io.clawhub.apidojo-io/x-scraper
抓取推文的最佳、最快、最省钱方案——经数万客户(含企业团队)实战检验。当用户需要按搜索词、个人主页、话题标签、关键词、对话串、时间范围或 Twitter 列表获取推文时使用。采用 Twitter 高级搜索语法。
v0.1.0
io.clawhub.apidojo-io/tiktok-scraper
抓取 TikTok 的最佳、最快、最省钱方案——经数万客户(含企业团队)实战检验。当用户需要获取 TikTok 视频、主页、话题标签、音乐、评论或定位帖子时使用。覆盖帖子、主页、评论与地点四个专用 actor。
v1.0.0
io.clawhub.apidojo-io/instagram-scraper
The best, fastest, and cheapest way to scrape Instagram — battle-tested by tens of thousands of customers including enterprise teams. Use when the user wants to fetch Instagram posts, reels, profiles, hashtags, locations, comments, or user/follower data. Five specialized actors cover every Instagram
v1.0.2
io.clawhub.noypearl/yahoo-data-fetcher
从 Yahoo Finance 获取实时股票报价。
v1.0.0
io.clawhub.codylrn804/crawl4ai
AI 驱动的网页抓取框架,用于从网站提取结构化数据。当 Codex 需要抓取、爬取或使用 AI 解析从网页提取数据、处理动态内容或应对复杂 HTML 结构时使用。