抓取 Scrape
v1.0.0
io.clawhub.ivangdavila/scrape
合法的网页抓取,具备 robots.txt 合规、限速和 GDPR/CCPA 感知的数据处理。
“scrape” 共 42 个结果
v1.0.0
io.clawhub.ivangdavila/scrape
合法的网页抓取,具备 robots.txt 合规、限速和 GDPR/CCPA 感知的数据处理。
v1.0.4
io.clawhub.ivangdavila/playwright
用 Playwright 实现浏览器自动化、测试与排障:定位器、自动等待、trace、CI 运行与 MCP 浏览器控制。当测试不稳定、超时、或仅在 CI/无头模式失败;定位器命中多个或错误元素(strict mode 违规);点击需要 force、等待变成死 sleep、networkidle 永不空闲;涉及 storageState 与登录初始化、请求 mock 与 HAR 回放、上传下载、iframe 与 Shadow DOM、弹窗与对话框、因机器而异的截图 diff、trace 与报告产物、慢测试套件分片、设备与权限模拟、无障碍检查、经 Playwright MCP 驱动真实浏览器、从 JS 渲染页面提取数据,或把 Cypress/Puppeteer/Selenium 套件迁移到 Playwright 时使用。不用于维护现有 Cypress/Puppeteer 套件(cypress、puppeteer),也不用于普通 HTTP 请求即可满足的工作(http)。
v1.2.0
io.clawhub.waisimon/playwright-scraper-skill
基于 Playwright 的网页抓取技能,具备反爬对抗能力。已在 Discuss.com.hk 等复杂站点实测成功。
v1.0.1
io.clawhub.opsun/deep-scraper
使用容器化 Crawlee 对 YouTube 等复杂站点进行深度抓取,提取经过验证的、无广告的转录文本与内容,输出为 JSON。
v0.1.1
io.clawhub.guifav/web-scraper
网页抓取与内容理解智能体——多策略提取带级联回退、新闻检测、样板内容移除、结构化元数据。
v1.0.0
io.clawhub.javicasper/reddit-scraper
通过抓取 old.reddit.com 阅读与搜索 Reddit 帖子。当 Clawdbot 需要浏览 Reddit 内容时使用:读取指定板块的帖子、搜索感兴趣的话题、监控特定社区。只读访问,不发帖不评论。
v1.0.0
io.clawhub.3coco3/playwright-scraper
使用 Playwright 以隐身模式抓取网站、绕过机器人检测,支持动态 JS 内容,视口与 User-Agent 可自定义。
v1.0.0
io.clawhub.apidojo-io/x-scraper
抓取推文的最佳、最快、最省钱方案——经数万客户(含企业团队)实战检验。当用户需要按搜索词、个人主页、话题标签、关键词、对话串、时间范围或 Twitter 列表获取推文时使用。采用 Twitter 高级搜索语法。
v0.1.0
io.clawhub.apidojo-io/tiktok-scraper
抓取 TikTok 的最佳、最快、最省钱方案——经数万客户(含企业团队)实战检验。当用户需要获取 TikTok 视频、主页、话题标签、音乐、评论或定位帖子时使用。覆盖帖子、主页、评论与地点四个专用 actor。
v1.0.0
io.clawhub.apidojo-io/instagram-scraper
The best, fastest, and cheapest way to scrape Instagram — battle-tested by tens of thousands of customers including enterprise teams. Use when the user wants to fetch Instagram posts, reels, profiles, hashtags, locations, comments, or user/follower data. Five specialized actors cover every Instagram
v1.0.0
io.clawhub.seanwyngaard/web-scraper-as-a-service
为客户构建交付级的网页抓取器,输出干净的数据。适用于为客户制作抓取器、从网站提取数据或交付抓取项目。
v1.0.7
io.clawhub.arulmozhiv/instagram-scraper
基于浏览器的工具,可按地点/分类发现 Instagram 账号并抓取其公开信息、数据、图片与互动情况,支持导出。
v1.0.0
io.clawhub.jnmhub/scrape-web
使用 Python + Scrapling 获取网页内容,支持简单选择器
v3.4.1
io.clawhub.jiafar/amazon-scraper
高性能容器化亚马逊爬虫(Docker + playwright-extra + Stealth 插件)。可绕过亚马逊的无头浏览器检测。支持亚马逊 BSR 榜单、搜索结果等抓取。
v1.0.1
io.clawhub.angusthefuzz/crawl-for-ai
基于本地 Crawl4AI 实例的完整网页抓取,支持 JavaScript 渲染,输出干净的 Markdown 或含链接与媒体的详细 JSON。
v1.0.1
io.clawhub.itonlyforfun-ai/web-scraper-jina
使用 r.jina.ai API 绕过 Cloudflare 并抓取任意网站。对 Truth Social、Cloudflare Turnstile 等有强防护的站点同样有效。
v1.0.0
io.clawhub.mariusfit/smart-web-scraper
从任意网页提取结构化数据,支持 CSS 选择器、表格与列表自动识别、JSON/CSV 输出格式,适用于网页抓取与数据抽取任务。
v1.0.1
io.clawhub.apify/apify-ultimate-scraper
面向任意平台的通用 AI 网页抓取器。可从 Instagram、Facebook、TikTok、YouTube、Google Maps、Google 搜索、Google Trends、Booking.com 与 TripAdvisor 抓取数据。适合线索获取、品牌监控、竞品分析、达人发现、趋势研究、内容分析与受众分析或任何数据抽取任务。
v1.8.14
io.clawhub.kernix0421/ai-research-scraper
用于抓取AI领域最新研究信息的技能,重点关注AI产品发展。从知名AI网站获取信息,提供简洁概括和链接,限制数据量以便快速阅读。
v1.0.0
io.clawhub.arthasking123/ai-data-scraper
自动化 Web 与 API 数据提取,附带清洗、格式化、调度、代理支持、重试、去重与实时监控。
v0.1.1
io.clawhub.arulmozhiv/x-twitter-scraper
使用带反检测的浏览器自动化抓取 Twitter/X 公开主页与近期推文,并支持经 Google 或 DuckDuckGo 可选地发现目标账号。
v1.0.0
io.clawhub.zhengxinjipai/scrapling-web-scraper
面向 OpenClaw 的零机器人检测网页抓取。绕过 Cloudflare、处理重 JavaScript 网站,并自动适应网站改版。当你需要……时使用。
v1.0.0
io.clawhub.ashwingupy/firecrawl-search
通过 Firecrawl API 进行网页搜索与抓取。适用于搜索网页、抓取网站(含 JS 重度页面)、爬取整站或从页面提取结构化数据。需要 FIRECRAWL_API_KEY 环境变量。
v1.0.0
io.clawhub.browseract-cli/browser-act-skill-forge-skill
通过 browser-act 对网站做一次探索,即可锻造出可复用的 Skill 包(SKILL.md + 脚本),此后无需重复探索。