AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 512 个资源 · 第 1 / 11 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →

Firecrawl 网页抓取 API

v1.2.7

SkillClawHub4.1k

Firecrawl API 集成,托管鉴权。抓取、爬取、映射与搜索网页内容。当用户想从网站提取内容、爬取整站、映射 URL 或搜索网页时使用本技能。其他第三方应用请使用 api-gateway 技能(https://clawhub.ai/byungkyu/api-gateway)。调用经由带 OAuth 登录的 maton CLI 执行;无法安装 CLI 时通过原始 HTTP 加 Maton API key 调用。每次调用都以用户连接身份鉴权,只能访问该连接授权范围内的数据(由服务商在每次请求时强制执行);本文档所列端点即本技能使用的端点,其他端点需用户点名要求方可使用。默认进行读取和列表操作,每次写操作或新建连接均需与用户确认。

source

HTML

SkillClawHub3.5k

编写、审查并修复 HTML 标记:语义结构、表单、可访问性、文档 head、媒体与嵌入。适用场景:表单字段永远提交不了、label 不起作用、自动填充填错输入框、校验触发时机不对;屏幕阅读器念出文件名、什么都不播报、焦点逃出模态框;图片加载时页面跳动、以 quirks 模式渲染或出现乱码;文字溢出表格,或一个未闭合标签让半篇文档变斜体;链接预览、favicon 或富媒体搜索结果缺失;`<dialog>`、`<details>`、popover、`<template>` 行为异常;iframe 或视频嵌入一直空白;HTML 邮件在 Outlook 中塌陷;以及必须在无 XSS 风险下渲染不可信 HTML。涵盖响应式图片、资源提示、`lang`/`dir`、Web Components 与表单校验。不适用于样式排版(`css`)、DOM 脚本(`javascript`)、排名策略(`seo`)或 Markdown(`markdown`)。

source

Playwright(自动化 + MCP + 抓取)

v1.0.4

SkillClawHub42.5k

用 Playwright 实现浏览器自动化、测试与排障:定位器、自动等待、trace、CI 运行与 MCP 浏览器控制。当测试不稳定、超时、或仅在 CI/无头模式失败;定位器命中多个或错误元素(strict mode 违规);点击需要 force、等待变成死 sleep、networkidle 永不空闲;涉及 storageState 与登录初始化、请求 mock 与 HAR 回放、上传下载、iframe 与 Shadow DOM、弹窗与对话框、因机器而异的截图 diff、trace 与报告产物、慢测试套件分片、设备与权限模拟、无障碍检查、经 Playwright MCP 驱动真实浏览器、从 JS 渲染页面提取数据,或把 Cypress/Puppeteer/Selenium 套件迁移到 Playwright 时使用。不用于维护现有 Cypress/Puppeteer 套件(cypress、puppeteer),也不用于普通 HTTP 请求即可满足的工作(http)。

source

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景