AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 1,401 个资源 · 第 10 / 30 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →

ByteFun AI MCP 服务

MCP ServerMCP Hub 中国20.2k

ByteFun AI MCP服务 - 打通产品设计、UI设计、代码开发的服务平台,支持设计稿转代码和跨平台原生代码开发。提供两大核心功能模块:UI设计优化 - 将用户输入的需求转换为带有UI设计规范的静态HTML+CSS设计提示词,实现设计稿到代码的转换;代码开发优化 - 将用户输入的需求转换为带有完整开发规则的TypeScript代码开发提示词,支持跨平台原生开发。

stdionpm
Keenable 网页搜索 icon

Keenable 网页搜索

MCP Serversmithery11k

Keenable 是免费的远程 MCP 服务器,为智能体开放网页索引访问:搜索网页并返回排序结果,支持按日期与站点筛选,还可把已收录页面抓取为干净的 Markdown;开箱即用,无需账号或 API key。工具:search_web_pages(搜索网页并返回排序结果)、fetch_page_content(抓取已收录 URL 并提取干净的 Markdown 正文)。文档:https://docs.keenable.ai/mcp-server

streamable-httpregistry 收录
romulus-31780 icon

romulus-31780

MCP Serversmithery8.4k

ROMulus is a retro gaming ROM search engine that aggregates results from four major sites. Search by game title and console to get download page URLs, cover images, and file sizes... all in one all. Tools: • search_roms — Find ROMs by title, optionally filtered by console (NES, SNES, N64, GameCube, PS1, PS2, PSP, GBA, Genesis, Dreamcast, and 20+ more) • get_game_details — Fetch full metadata for a game: year, region, genre, languages, rating, serial number, and description • list_systems — List all 28 supported consoles No API key required.

streamable-http

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景