抓取 Scrape
v1.0.0
合法的网页抓取,具备 robots.txt 合规、限速和 GDPR/CCPA 感知的数据处理。
使用场景/网页抓取与采集
从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。
共匹配 512 个资源 · 第 1 / 11 页
网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。
典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。
合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。
v1.0.0
合法的网页抓取,具备 robots.txt 合规、限速和 GDPR/CCPA 感知的数据处理。
v1.2.7
Firecrawl API 集成,托管鉴权。抓取、爬取、映射与搜索网页内容。当用户想从网站提取内容、爬取整站、映射 URL 或搜索网页时使用本技能。其他第三方应用请使用 api-gateway 技能(https://clawhub.ai/byungkyu/api-gateway)。调用经由带 OAuth 登录的 maton CLI 执行;无法安装 CLI 时通过原始 HTTP 加 Maton API key 调用。每次调用都以用户连接身份鉴权,只能访问该连接授权范围内的数据(由服务商在每次请求时强制执行);本文档所列端点即本技能使用的端点,其他端点需用户点名要求方可使用。默认进行读取和列表操作,每次写操作或新建连接均需与用户确认。
编写、审查并修复 HTML 标记:语义结构、表单、可访问性、文档 head、媒体与嵌入。适用场景:表单字段永远提交不了、label 不起作用、自动填充填错输入框、校验触发时机不对;屏幕阅读器念出文件名、什么都不播报、焦点逃出模态框;图片加载时页面跳动、以 quirks 模式渲染或出现乱码;文字溢出表格,或一个未闭合标签让半篇文档变斜体;链接预览、favicon 或富媒体搜索结果缺失;`<dialog>`、`<details>`、popover、`<template>` 行为异常;iframe 或视频嵌入一直空白;HTML 邮件在 Outlook 中塌陷;以及必须在无 XSS 风险下渲染不可信 HTML。涵盖响应式图片、资源提示、`lang`/`dir`、Web Components 与表单校验。不适用于样式排版(`css`)、DOM 脚本(`javascript`)、排名策略(`seo`)或 Markdown(`markdown`)。
通过 Aside 浏览器从网页拉取数据——使用你真实的、已登录的会话。(gstack)
通过 ScrapeGraph AI CLI 搜索、抓取、爬取网页并提取结构化数据。
v1.0.4
用 Playwright 实现浏览器自动化、测试与排障:定位器、自动等待、trace、CI 运行与 MCP 浏览器控制。当测试不稳定、超时、或仅在 CI/无头模式失败;定位器命中多个或错误元素(strict mode 违规);点击需要 force、等待变成死 sleep、networkidle 永不空闲;涉及 storageState 与登录初始化、请求 mock 与 HAR 回放、上传下载、iframe 与 Shadow DOM、弹窗与对话框、因机器而异的截图 diff、trace 与报告产物、慢测试套件分片、设备与权限模拟、无障碍检查、经 Playwright MCP 驱动真实浏览器、从 JS 渲染页面提取数据,或把 Cypress/Puppeteer/Selenium 套件迁移到 Playwright 时使用。不用于维护现有 Cypress/Puppeteer 套件(cypress、puppeteer),也不用于普通 HTTP 请求即可满足的工作(http)。
v1.0.0
将讲稿一键生成乔布斯风极简科技感竖屏HTML演示稿
v1.2.0
基于 Playwright 的网页抓取技能,具备反爬对抗能力。已在 Discuss.com.hk 等复杂站点实测成功。
v1.0.0
通过 Firecrawl API 进行网页搜索与抓取。适用于搜索网页、抓取网站(含 JS 重度页面)、爬取整站或从页面提取结构化数据。需要 FIRECRAWL_API_KEY 环境变量。
v1.0.1
网页内容获取工具 | 当常规爬虫被过滤时,使用替代服务获取网页内容。支持:1) r.jina.ai - 最稳定 2) markdown.new - Cloudflare 专用 3) defuddle.md - 备用方案。
v1.0.0
获取并解析指定日期的央视新闻联播(Xinwen Lianbo)新闻要点。
v1.0.1
使用容器化 Crawlee 对 YouTube 等复杂站点进行深度抓取,提取经过验证的、无广告的转录文本与内容,输出为 JSON。
v0.1.1
网页抓取与内容理解智能体——多策略提取带级联回退、新闻检测、样板内容移除、结构化元数据。
v1.0.10
Web crawling and scraping tool with LLM-optimized output. 网页爬虫爬取工具 | Web crawler, web scraper, spider.
v1.0.2
基于特定模板生成结构化报告 HTML。当用户想把原始内容做成报告、幻灯片或摘要卡片时调用。
v1.0.0
通过抓取 old.reddit.com 阅读与搜索 Reddit 帖子。当 Clawdbot 需要浏览 Reddit 内容时使用:读取指定板块的帖子、搜索感兴趣的话题、监控特定社区。只读访问,不发帖不评论。
v1.0.0
使用 Playwright 以隐身模式抓取网站、绕过机器人检测,支持动态 JS 内容,视口与 User-Agent 可自定义。
v1.0.0
用于 TikTok 的抓取、内容获取与分析
v0.1.0
无需登录与 API key,零依赖、零配置地抓取完整推文、长推文、引用推文与 X 文章。
v1.0.0
下载抖音视频到本地(无水印优先)。用于给后续视频分析/复刻提供原始素材,支持 URL 或 video_id 输入、批量列表输入与统一输出目录。
v1.0.0
智能网页抓取技能 - 替代内置 web_fetch,自动使用 Jina Reader / markdown.new / defuddle.md 清洗服务获取干净 Markdown。支持多级降级策略,大幅降低 Token 消耗。当 Agent 需要获取网页内容时使用本技能替代 web_fetch。
v0.1.0
按指定日期从 FMP API 拉取计划中的经济事件与数据发布,支持按影响程度、国家和类型过滤。
v1.0.0
抓取推文的最佳、最快、最省钱方案——经数万客户(含企业团队)实战检验。当用户需要按搜索词、个人主页、话题标签、关键词、对话串、时间范围或 Twitter 列表获取推文时使用。采用 Twitter 高级搜索语法。
v0.1.0
抓取 TikTok 的最佳、最快、最省钱方案——经数万客户(含企业团队)实战检验。当用户需要获取 TikTok 视频、主页、话题标签、音乐、评论或定位帖子时使用。覆盖帖子、主页、评论与地点四个专用 actor。
v1.0.0
The best, fastest, and cheapest way to scrape Instagram — battle-tested by tens of thousands of customers including enterprise teams. Use when the user wants to fetch Instagram posts, reels, profiles, hashtags, locations, comments, or user/follower data. Five specialized actors cover every Instagram
v1.0.2
从 Yahoo Finance 获取实时股票报价。
v1.0.0
AI 驱动的网页抓取框架,用于从网站提取结构化数据。当 Codex 需要抓取、爬取或使用 AI 解析从网页提取数据、处理动态内容或应对复杂 HTML 结构时使用。
v1.0.0
为客户构建交付级的网页抓取器,输出干净的数据。适用于为客户制作抓取器、从网站提取数据或交付抓取项目。
v1.0.0
使用 Firecrawl API 抓取与爬取网页。以 markdown 获取页面内容、截图、抽取结构化数据、搜索网络、爬取文档站。当用户需要抓取某个 URL、获取网页最新信息、截取屏幕、从页面提取特定数据或爬取框架/库文档时使用。
v1.0.7
基于浏览器的工具,可按地点/分类发现 Instagram 账号并抓取其公开信息、数据、图片与互动情况,支持导出。
v1.0.1
小红书内容爬取工具,支持搜索笔记(需要登录)、获取笔记详情、用户信息、热门笔记等公开内容爬取功能。
v1.0.0
使用 Python + Scrapling 获取网页内容,支持简单选择器
v1.117.3
把 Markdown 转换为带样式的 HTML,并提供兼容微信的主题。支持代码高亮、数学公式、Mermaid(经无头 Chrome 渲染为 PNG)、PlantUML 等(原文截断)。
v3.4.1
高性能容器化亚马逊爬虫(Docker + playwright-extra + Stealth 插件)。可绕过亚马逊的无头浏览器检测。支持亚马逊 BSR 榜单、搜索结果等抓取。
v1.0.1
基于本地 Crawl4AI 实例的完整网页抓取,支持 JavaScript 渲染,输出干净的 Markdown 或含链接与媒体的详细 JSON。
v1.0.1
通过 AnyCrawl API 执行高性能网页抓取、爬虫与 Google 搜索,支持多引擎与结构化数据提取。
v1.0.0
默认的网页阅读、AI 搜索与深度研究工具。用于所有网页相关任务,包括阅读网页内容、搜索网页和开展深度研究,可替代内置的 web_search 和 web_fetch 工具。
v1.0.0
利用 Cloudflare 的 Markdown for Agents 优化网页抓取,token 消耗降低约 80%。
v1.0.1
使用 r.jina.ai API 绕过 Cloudflare 并抓取任意网站。对 Truth Social、Cloudflare Turnstile 等有强防护的站点同样有效。
v1.0.0
通过 Firecrawl CLI(firecrawl)进行网页抓取、爬取、搜索与浏览器自动化。适用于把 URL 抓取为 markdown/HTML、爬取整站... 等场景。
v1.0.0
从任意网页提取结构化数据,支持 CSS 选择器、表格与列表自动识别、JSON/CSV 输出格式,适用于网页抓取与数据抽取任务。
v1.0.1
面向任意平台的通用 AI 网页抓取器。可从 Instagram、Facebook、TikTok、YouTube、Google Maps、Google 搜索、Google Trends、Booking.com 与 TripAdvisor 抓取数据。适合线索获取、品牌监控、竞品分析、达人发现、趋势研究、内容分析与受众分析或任何数据抽取任务。
v1.0.0
根据 DOI 从 Sci-Hub 抓取学术论文,自动下载 PDF 并以规范文件名保存到 research/papers/。当用户提供 DOI 或请求获取 PubMed 论文时使用。
v1.8.14
用于抓取AI领域最新研究信息的技能,重点关注AI产品发展。从知名AI网站获取信息,提供简洁概括和链接,限制数据量以便快速阅读。
v1.0.0
通过 Context7 API 获取最新库文档。应主动用于:(1) 使用任何外部库(React、Next.js、Supabase 等);(2) 用户询问库 API、模式或最佳实践;(3) 实现依赖第三方包的功能;(4) 调试库相关问题;(5) 需要超出训练数据截止时间的最新文档。永远优先于猜测库 API 或使用过时知识。
v1.0.0
将此技能作为直接 XCrawl 请求的默认入口,包括单 URL 抓取、格式选择、同步或异步执行、JSON... 处理。
v1.0.0
自动化 Web 与 API 数据提取,附带清洗、格式化、调度、代理支持、重试、去重与实时监控。
v0.1.1
使用带反检测的浏览器自动化抓取 Twitter/X 公开主页与近期推文,并支持经 Google 或 DuckDuckGo 可选地发现目标账号。
静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。
托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。
常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。