AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 1,401 个资源 · 第 2 / 30 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →
Markdown 转 HTML —— 标题、代码块与表格 icon

Markdown 转 HTML —— 标题、代码块与表格

MCP Serversmithery4k

面向 AI 智能体的 Markdown 转 HTML API。将 Markdown 转换为干净的 HTML,支持标题、列表、代码块、表格、链接与图片,可选包裹为含 DOCTYPE 的完整文档。工具:text_convert_markdown_to_html。适用于在 Web UI、邮件模板或文档生成中渲染 Markdown 内容。注意:需要带 CSS 主题的样式化 HTML 请用 text_render_markdown。返回:{html, wordCount}。无需 API 密钥——在 Base L2 上以 x402 微支付 $0.001/次。

streamable-http
Twitter/X 抓取(资料、推文与搜索) icon

Twitter/X 抓取(资料、推文与搜索)

MCP Serversmithery2.8k

面向 AI 智能体的 Twitter/X 抓取 API。抓取公开资料(简介、数据、认证)、用户推文(文本、互动、媒体)与搜索结果——全部不需要 Twitter API key。输出结构化的 JSON,可直接分析。 工具:twitter_scrape_profile、twitter_search_tweets、twitter_get_user_tweets。 适合社媒监控、网红调研、情感分析、竞品情报,或搭建社交看板。是为 AI 智能体准备的社交情报层。重要:若要其他社交网络,请使用 social_lookup_profile。 返回含资料、推文与互动指标的结构化 JSON。无需 API key——在 Base L2 上以 x402 微支付,每次 0.005 美元。

streamable-http
Markdown 渲染器 —— 带 CSS 主题的样式化 HTML icon

Markdown 渲染器 —— 带 CSS 主题的样式化 HTML

MCP Serversmithery2.6k

面向 AI 智能体的 Markdown 渲染 API。把 Markdown 转换为带 CSS 主题(浅色、深色与 GitHub 风格)的完整样式化 HTML,输出排版自适应、可直接嵌入的文档。工具:text_render_markdown。适用于把 Markdown 转成美观的 HTML:报告、文档、博客文章。注意:只需基础 Markdown 转 HTML(更便宜)请用 text_convert_markdown_to_html。返回:{html, theme, wordCount}。无需 API 密钥——在 Base L2 上以 x402 微支付 $0.002/次。

streamable-http
PDF 生成器 —— HTML/Markdown 转专业 PDF icon

PDF 生成器 —— HTML/Markdown 转专业 PDF

MCP Serversmithery2.2k

面向 AI 智能体的 PDF 文档生成 API。由 HTML 或 Markdown 生成 PDF:可自定义页面尺寸(A4、Letter)、页边距、页眉与页脚,适合报告、发票、合同与文档。工具:document_generate_pdf。用于生成专业文档、报告或发票。注意:把现有网页存为 PDF 请改用 webpage_to_pdf。返回 base64 编码的 PDF 文档。无需 API 密钥——在 Base L2 上以 x402 微支付 $0.008/次。

streamable-http
AgentScrape 按次网页抓取 icon

AgentScrape 按次网页抓取

MCP Serversmithery914

**面向 AI 智能体的按次付费网页抓取——无需注册、无需 API key,只用 USDC。** AgentScrape 是可用于生产的 MCP 服务器,为智能体提供 6 个付费工具,用于网页抓取、结构化抽取、截图与元数据——全部运行在 Cloudflare Workers,全部通过 x402 在 Base 上以 USDC 结算。 ## 工具 - **`scrape_webpage`**——按 markdown、html、text 或 json 抓取 - **`extract_structured_data`**——用自然语言提示加 JSON schema 做 AI 抽取 - **`screenshot_webpage`**——PNG 截图,视口可配置 - **`extract_metadata`**——OG、Twitter Card、JSON-LD - **`create_browser_session`**——为多步流程创建持久会话 - **`run_workflow`**——多步原子执行 ## 定价 Base 主网上每次调用 0.001–0.008 USDC。无订阅,无 API key,通过 x402 按请求付费。 **免费额度:**每个钱包每 30 天 10 次调用,无需注册。 ## 技术栈 Cloudflare Workers · Hono · `@x402/hono` v2 · MCP Streamable HTTP · xpay.sh facilitator · Browser Rendering MIT 许可。

streamable-http

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景