AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 1,401 个资源 · 第 13 / 30 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →

api-breaking-change-detector

SkillSkillsMP

Cross-references C# Web API controllers/DTOs against their TypeScript/JavaScript consumers (React, Angular, Vue, Svelte, Node.js, or hand-written/auto-generated HTTP clients like Fetch, Axios, NSwag) to catch contract drift in both directions: backend changes that break client applications (renamed/removed JSON keys, new required parameters, status code shifts) and frontend code sending fields the backend no longer reads. Works directly against source code, not exported OpenAPI spec files. Use when the user asks to check for breaking API changes, verify frontend/backend contract sync, or audit a DTO/controller change against its TypeScript/JS consumers before merging. Not for generating new API code from a spec (see openapi-to-application-code) or scaffolding new endpoints (see aspnet-minimal-api-openapi).

source

context7-docs(库文档检索)

SkillSkillsMP

为任意库、框架、SDK、CLI 工具或云服务获取最新文档和代码示例。只要用户询问特定库——哪怕 React、Next.js、Prisma、Express、Tailwind、Django、Spring Boot 等常见库——都应使用,因为训练数据可能未反映最近的 API 变更或版本更新。以下情况务必使用:API 语法问题、配置项、版本迁移问题、提到库名的 "how do I" 问题、涉及库特定行为的调试、安装说明,以及 CLI 工具用法。即使你认为自己知道答案也要用——不要依赖训练数据中的 API 细节、函数签名或配置项,它们常常过时。库文档优先于网络搜索。

source

数据抓取 Apify

SkillSkillsMP

通过 Apify actor 抓取社交平台、商业数据与电商内容——Instagram、LinkedIn、TikTok、YouTube、Facebook、Google Maps、Amazon 及通用网页爬取——并在代码中过滤。适用场景:抓取 Instagram/LinkedIn/TikTok/YouTube/Facebook、Google Maps 销售线索、Amazon 评论、商业智能、多平台社媒监听、竞品分析、线索生成、社媒监控、Apify actor、网页爬取、提取联系人。不适用于 X/Twitter 操作(用 _X)、四级代理递进式抓取(用 BrightData)、真实 Chrome 反爬绕过与 computer use(用 Interceptor)。

source

browserbase-cli(Browserbase CLI 工作流)

SkillSkillsMP

使用 Browserbase CLI(`browse`)完成 Browserbase Functions 与平台 API 工作流。当用户要求运行 `browse`、部署或调用 functions、管理会话/项目/上下文/扩展,通过 Browserbase Fetch API 抓取页面、通过 Browserbase Search API 搜索网页,或搭建起始模板时使用。交互式浏览优先用 Browser 技能;只有用户明确要走 CLI 路径时才使用顶层 `browse` 驱动命令(`browse open`、`browse get` 等)。

source

浏览器操作

SkillSkillsMP

通过 agent-browser 实现无头浏览器自动化——Rust CLI 守护进程,带持久化 auth profile,支持快速、可脚本化、并行的浏览器工作。支持批量命令、网络拦截、设备模拟、按站点 auth profile(一次有头登录,此后始终无头)、通过 --session 并行隔离会话。工作流:ReviewStories(将 YAML 用户故事分发到并行 UIReviewer)、Automate(加载并运行参数化 recipe 模板)、Update。通过 agent-browser 指令委派给通用 agent 做后台并行抓取。若站点有 bot 检测则回退到 Interceptor。适用场景:无头浏览器、批量抓取、快速截图、dev server 测试、并行浏览器、后台自动化、提取数据、审查 stories、自动化 recipe、批量截图、并行抓取多页。不适用于真实 Chrome 的部署验证或 UI 确认(用 Interceptor)。不适用于简单单 URL 抓取(用 WebFetch)。不适用于验证码或 bot 检测绕过(用 BrightData 或

source

数据抓取 Apify

SkillSkillsMP

通过 Apify actor 抓取社交媒体平台、商业数据与电商内容——Instagram 资料/帖子/话题标签/评论、LinkedIn 资料/职位/帖子、TikTok 资料/话题标签/视频/评论、YouTube 频道/搜索/评论、Facebook 帖子/群组/评论、Google Maps 商家搜索并提取联系方式/评论/图片、Amazon 商品/评论/价格,以及配合自定义 pageFunction 提取逻辑的通用多页网页爬取。基于文件的 TypeScript 封装(scrapeInstagramProfile、searchGoogleMaps、scrapeAmazonProduct、scrapeWebsite 等)在返回模型上下文前于代码中过滤与转换数据,相比直接走 MCP 协议可节省 95-99% 的 token。通过 Promise.all 并行查询多平台,支撑社媒监听看板。线索富化流水线:Google Maps → 合格过滤 → 可选 LinkedIn 富化。可同时在 Instagram、YouTube、TikTok 上做竞品分析。适用场景:抓取 Instagram、抓取 LinkedIn、抓取 TikTok、抓取 YouTube、抓取 Faceboo

source

浏览器操作

SkillSkillsMP

通过 agent-browser 实现无头浏览器自动化——Rust CLI 守护进程,带持久化 auth profile,支持快速、可脚本化、并行的浏览器工作。支持批量命令、网络拦截、设备模拟、按站点 auth profile(一次有头登录,此后始终无头)、通过 --session 并行隔离会话。工作流:ReviewStories(将 YAML 用户故事分发到并行 UIReviewer)、Automate(加载并运行参数化 recipe 模板)、Update。通过 agent-browser 指令委派给通用 agent 做后台并行抓取。若站点有 bot 检测则回退到 Interceptor。适用场景:无头浏览器、批量抓取、快速截图、dev server 测试、并行浏览器、后台自动化、提取数据、审查 stories、自动化 recipe、批量截图、并行抓取多页。不适用于真实 Chrome 的部署验证或 UI 确认(用 Interceptor)。不适用于简单单 URL 抓取(用 WebFetch)。不适用于验证码或 bot 检测绕过(用 BrightData 或

source

数据抓取 Apify

SkillSkillsMP

通过 Apify actor 抓取社交媒体平台、商业数据与电商内容——Instagram 资料/帖子/话题标签/评论、LinkedIn 资料/职位/帖子、TikTok 资料/话题标签/视频/评论、YouTube 频道/搜索/评论、Facebook 帖子/群组/评论、Google Maps 商家搜索并提取联系方式/评论/图片、Amazon 商品/评论/价格,以及配合自定义 pageFunction 提取逻辑的通用多页网页爬取。基于文件的 TypeScript 封装(scrapeInstagramProfile、searchGoogleMaps、scrapeAmazonProduct、scrapeWebsite 等)在返回模型上下文前于代码中过滤与转换数据,相比直接走 MCP 协议可节省 95-99% 的 token。通过 Promise.all 并行查询多平台,支撑社媒监听看板。线索富化流水线:Google Maps → 合格过滤 → 可选 LinkedIn 富化。可同时在 Instagram、YouTube、TikTok 上做竞品分析。适用场景:抓取 Instagram、抓取 LinkedIn、抓取 TikTok、抓取 YouTube、抓取 Faceboo

source

Windows-MCP 工具测试器

SkillSkillsMP

Windows-MCP 工具的自动化测试技能。只要用户想测试、验证、基准评测或评估任何 Windows-MCP 工具(App、PowerShell、Screenshot、Snapshot、Click、Type、Scroll、Move、Shortcut、Wait、MultiSelect、MultiEdit、Clipboard、Process、Notification、FileSystem、Registry、Scrape)就使用本技能。触发短语如“测试 Click 工具”“基准评测 Screenshot”“验证 FileSystem”“对 Registry 跑 QA”“检查 PowerShell 是否可用”“评估工具性能”,或任何提及测试/验证 Windows-MCP 工具的内容。每次调用只测试一个工具。

source

MCP 文档检索

SkillSkillsMP

从 modelcontextprotocol.io 获取最新的 MCP 规范与文档。训练数据可能过时——只要问题涉及 MCP 协议,默认使用本技能。触发场景:实现或调试 MCP 特性(sampling、elicitation、completion、tools、resources、prompts、传输层);SEP 或规范要求;MCP 传输行为(SSE、Streamable HTTP、重连、重试);授权/OAuth;一致性测试失败;能力协商;消息 Schema。仅在与 MCP 协议零依赖的纯 Kotlin、构建系统或重构任务时跳过。拿不准时就触发

source

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景