AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 889 个资源 · 第 1 / 19 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →
framefetch 视频数据提取 icon

framefetch 视频数据提取

MCP Serversmithery5k

# FrameFetch **一次 API/MCP 调用,智能体即可获得跨 6 个平台的干净视频数据**——元数据与洞察、Whisper 转写文本,以及参数化抽帧(自选 fps 或精确时间戳 → 推送到 S3)。支持 YouTube(含 Shorts)、TikTok、Reddit、Instagram、Pinterest。 智能体优先设计:类型化错误、失败退款、结果缓存。通过 x402(Base 上的 USDC)或 Stripe 按次付费。 ## 接口 - POST /v1/extract——一次调用组合元数据/洞察/转写/抽帧中任意几项 - POST /v1/metadata · /v1/transcript · /v1/frames——快捷接口 - GET /v1/platforms——能力矩阵 · POST /v1/keys——免费 key 加额度 ## 示例 curl -X POST https://framefetch.net/v1/extract -H “Authorization: Bearer <key>” -H “Content-Type: application/json” -d {“url”:“https://youtu.be/...”,“fields”:[“metadata”,“transcript”]} https://framefetch.net

streamable-http
Web Scraper — Clean Markdown from Any URL icon

Web Scraper — Clean Markdown from Any URL

MCP Serversmithery4.6k

Web content extraction API for AI agents. Scrape any URL and get clean, structured Markdown content with navigation, ads, and scripts stripped. Full JavaScript rendering via headless Chromium. Single and batch (10 URLs) modes. Built for RAG pipelines and AI research. Tools: web_scrape_to_markdown (single), web_scrape_batch (up to 10 URLs). Use this for RAG ingestion, research, content analysis, data extraction, or competitive intelligence. IMPORTANT: For screenshots/PDFs of pages, use capture_screenshot instead. For SEO analysis, use seo_audit_page. Returns: {markdown, title, wordCount, links[]}. No API key required — x402 micropayment $0.005/call on Base L2.

streamable-http
HTML 转 Markdown —— 干净转换并剥离脚本 icon

HTML 转 Markdown —— 干净转换并剥离脚本

MCP Serversmithery4.2k

面向 AI 智能体的 HTML 转 Markdown API。将 HTML 转为干净的 Markdown:剥离脚本、样式与跟踪代码,保留标题、链接、列表、图片与表格。工具:text_convert_html_to_markdown。适用于内容迁移、邮件处理,或把 HTML 内容整理为供 LLM 消费的形态。注意:抓取在线 URL 并转 Markdown 请用 web_scrape_to_markdown。返回:{markdown, wordCount}。无需 API 密钥——在 Base L2 上以 x402 微支付 $0.001/次。

streamable-http
Markdown 转 HTML —— 标题、代码块与表格 icon

Markdown 转 HTML —— 标题、代码块与表格

MCP Serversmithery4k

面向 AI 智能体的 Markdown 转 HTML API。将 Markdown 转换为干净的 HTML,支持标题、列表、代码块、表格、链接与图片,可选包裹为含 DOCTYPE 的完整文档。工具:text_convert_markdown_to_html。适用于在 Web UI、邮件模板或文档生成中渲染 Markdown 内容。注意:需要带 CSS 主题的样式化 HTML 请用 text_render_markdown。返回:{html, wordCount}。无需 API 密钥——在 Base L2 上以 x402 微支付 $0.001/次。

streamable-http
Twitter/X 抓取(资料、推文与搜索) icon

Twitter/X 抓取(资料、推文与搜索)

MCP Serversmithery2.8k

面向 AI 智能体的 Twitter/X 抓取 API。抓取公开资料(简介、数据、认证)、用户推文(文本、互动、媒体)与搜索结果——全部不需要 Twitter API key。输出结构化的 JSON,可直接分析。 工具:twitter_scrape_profile、twitter_search_tweets、twitter_get_user_tweets。 适合社媒监控、网红调研、情感分析、竞品情报,或搭建社交看板。是为 AI 智能体准备的社交情报层。重要:若要其他社交网络,请使用 social_lookup_profile。 返回含资料、推文与互动指标的结构化 JSON。无需 API key——在 Base L2 上以 x402 微支付,每次 0.005 美元。

streamable-http
Markdown 渲染器 —— 带 CSS 主题的样式化 HTML icon

Markdown 渲染器 —— 带 CSS 主题的样式化 HTML

MCP Serversmithery2.6k

面向 AI 智能体的 Markdown 渲染 API。把 Markdown 转换为带 CSS 主题(浅色、深色与 GitHub 风格)的完整样式化 HTML,输出排版自适应、可直接嵌入的文档。工具:text_render_markdown。适用于把 Markdown 转成美观的 HTML:报告、文档、博客文章。注意:只需基础 Markdown 转 HTML(更便宜)请用 text_convert_markdown_to_html。返回:{html, theme, wordCount}。无需 API 密钥——在 Base L2 上以 x402 微支付 $0.002/次。

streamable-http
PDF 生成器 —— HTML/Markdown 转专业 PDF icon

PDF 生成器 —— HTML/Markdown 转专业 PDF

MCP Serversmithery2.2k

面向 AI 智能体的 PDF 文档生成 API。由 HTML 或 Markdown 生成 PDF:可自定义页面尺寸(A4、Letter)、页边距、页眉与页脚,适合报告、发票、合同与文档。工具:document_generate_pdf。用于生成专业文档、报告或发票。注意:把现有网页存为 PDF 请改用 webpage_to_pdf。返回 base64 编码的 PDF 文档。无需 API 密钥——在 Base L2 上以 x402 微支付 $0.008/次。

streamable-http
AgentScrape 按次网页抓取 icon

AgentScrape 按次网页抓取

MCP Serversmithery914

**面向 AI 智能体的按次付费网页抓取——无需注册、无需 API key,只用 USDC。** AgentScrape 是可用于生产的 MCP 服务器,为智能体提供 6 个付费工具,用于网页抓取、结构化抽取、截图与元数据——全部运行在 Cloudflare Workers,全部通过 x402 在 Base 上以 USDC 结算。 ## 工具 - **`scrape_webpage`**——按 markdown、html、text 或 json 抓取 - **`extract_structured_data`**——用自然语言提示加 JSON schema 做 AI 抽取 - **`screenshot_webpage`**——PNG 截图,视口可配置 - **`extract_metadata`**——OG、Twitter Card、JSON-LD - **`create_browser_session`**——为多步流程创建持久会话 - **`run_workflow`**——多步原子执行 ## 定价 Base 主网上每次调用 0.001–0.008 USDC。无订阅,无 API key,通过 x402 按请求付费。 **免费额度:**每个钱包每 30 天 10 次调用,无需注册。 ## 技术栈 Cloudflare Workers · Hono · `@x402/hono` v2 · MCP Streamable HTTP · xpay.sh facilitator · Browser Rendering MIT 许可。

streamable-http

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景