AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 1,401 个资源 · 第 29 / 30 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →

Cloudflare 临时邮箱

SkillSkillsMP

使用用户提供的 Address JWT 与 API base URL,从 cloudflare_temp_email 邮箱收发邮件。当用户(或 OpenClaw/Codex/Cursor 之类的 agent)需要列出收件箱、获取指定邮件,或通过服务端解析的 /api/parsed_mails、/api/parsed_mail/:id 与 /api/send_mail 端点发送邮件时使用。若解析端点不可用,回退为用 mail-parser-wasm + postal-mime 在本地解析 /api/mail/:id 的原始源码。不处理邮箱创建——JWT 由用户自行提供。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截取屏幕、提取数据、测试 Web 应用,或自动化任何浏览器任务。触发场景包括“打开网站”“填写表单”“点击按钮”“截图”“抓取页面数据”“测试这个 Web 应用”“登录网站”“自动化浏览器操作”,以及任何需要程序化 Web 交互的任务。

source

agent-browser(浏览器自动化 CLI)

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发语包括「打开网站」「填写表单」「点击按钮」「截图」「抓取页面数据」「测试这个 Web 应用」「登录网站」「自动化浏览器操作」等需要程序化网页交互的任务。

source

agent-browser(浏览器自动化 CLI)

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发语包括「打开网站」「填写表单」「点击按钮」「截图」「抓取页面数据」「测试这个 Web 应用」「登录网站」「自动化浏览器操作」等需要程序化网页交互的任务。

source

代理浏览器自动化 CLI

SkillSkillsMP

面向 AI 代理的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、表单填写、按钮点击、截图、数据提取、Web 应用测试或任何浏览器任务自动化。触发场景包括“打开网站”“填写表单”“点击按钮”“截图”“从页面抓取数据”“测试这个 Web 应用”“登录网站”“自动化浏览器操作”,或任何需要程序化网页交互的任务。

source

agent-browser(浏览器自动化 CLI)

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发语包括「打开网站」「填写表单」「点击按钮」「截图」「抓取页面数据」「测试这个 Web 应用」「登录网站」「自动化浏览器操作」等需要程序化网页交互的任务。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截图、提取数据、测试 Web 应用,或自动化任意浏览器任务。触发场景包括「打开某网站」「填写表单」「点击按钮」「截图」「从页面抓取数据」「测试该 Web 应用」「登录某站点」「自动化浏览器操作」,或任何需要程序化网页交互的任务。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截取屏幕、提取数据、测试 Web 应用,或自动化任何浏览器任务。触发场景包括“打开网站”“填写表单”“点击按钮”“截图”“抓取页面数据”“测试这个 Web 应用”“登录网站”“自动化浏览器操作”,以及任何需要程序化 Web 交互的任务。

source

Cursor 文档库

SkillSkillsMP

所有 Cursor 文档的唯一权威来源与管家。负责本地文档存储、抓取、发现与定位。在查找、检索、搜索或解析 Cursor 文档时使用;支持按关键词、分类、标签或自然语言查询发现文档;从 llms.txt 抓取;管理索引元数据(关键词、标签、别名);或从文件系统重建索引。可运行脚本完成文档抓取、查找与解析。处理 doc_id 解析、关键词检索、自然语言查询、分类/标签过滤、别名解析、llms.txt 解析、供内部使用的 Markdown 小节抽取、基于哈希的漂移检测以及完善的索引维护。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括浏览页面、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发请求如“open a website”“fill out a form”“click a button”“take a screenshot”“scrape data from a page”“test this web app”“login to a site”“automate browser actions”,或任何需要程序化 Web 交互的任务。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括浏览页面、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发请求如“open a website”“fill out a form”“click a button”“take a screenshot”“scrape data from a page”“test this web app”“login to a site”“automate browser actions”,或任何需要程序化 Web 交互的任务。

source

安全评估

SkillSkillsMP

安全评估与情报——网络侦察、Web 应用安全测试、提示注入测试、安全新闻监控与年度报告分析。适用场景:recon、侦察、端口扫描、子域名、DNS、WHOIS、ASN、netblock、CIDR、mass scan、路径发现、端点发现、公司结构、赏金计划、IP 侦察、域名侦察、被动侦察、Web 评估、OWASP、渗透测试、威胁建模、漏洞分析、ffuf、Playwright、Gemini 分析、提示注入、越狱、LLM 安全、护栏绕过、直接注入、间接注入、多阶段攻击、安全新闻、sec updates、数据泄露、tldrsec、安全研究、年度报告、威胁态势、安全趋势、厂商报告、抓取报告、列出来源。

source

安全评估

SkillSkillsMP

安全评估与情报——网络侦察、Web 应用安全测试、提示注入测试、安全新闻监控与年度报告分析。适用场景:recon、侦察、端口扫描、子域名、DNS、WHOIS、ASN、netblock、CIDR、mass scan、路径发现、端点发现、公司结构、赏金计划、IP 侦察、域名侦察、被动侦察、Web 评估、OWASP、渗透测试、威胁建模、漏洞分析、ffuf、Playwright、Gemini 分析、提示注入、越狱、LLM 安全、护栏绕过、直接注入、间接注入、多阶段攻击、安全新闻、sec updates、数据泄露、tldrsec、安全研究、年度报告、威胁态势、安全趋势、厂商报告、抓取报告、列出来源。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截取屏幕、提取数据、测试 Web 应用,或自动化任何浏览器任务。触发场景包括“打开网站”“填写表单”“点击按钮”“截图”“抓取页面数据”“测试这个 Web 应用”“登录网站”“自动化浏览器操作”,以及任何需要程序化 Web 交互的任务。

source

agent-browser(浏览器自动化 CLI)

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发语包括「打开网站」「填写表单」「点击按钮」「截图」「抓取页面数据」「测试这个 Web 应用」「登录网站」「自动化浏览器操作」等需要程序化网页交互的任务。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括浏览页面、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发请求如“open a website”“fill out a form”“click a button”“take a screenshot”“scrape data from a page”“test this web app”“login to a site”“automate browser actions”,或任何需要程序化 Web 交互的任务。

source

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景