AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 1,401 个资源 · 第 1 / 30 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →

Firecrawl 网页抓取 API

v1.2.7

SkillClawHub4.1k

Firecrawl API 集成,托管鉴权。抓取、爬取、映射与搜索网页内容。当用户想从网站提取内容、爬取整站、映射 URL 或搜索网页时使用本技能。其他第三方应用请使用 api-gateway 技能(https://clawhub.ai/byungkyu/api-gateway)。调用经由带 OAuth 登录的 maton CLI 执行;无法安装 CLI 时通过原始 HTTP 加 Maton API key 调用。每次调用都以用户连接身份鉴权,只能访问该连接授权范围内的数据(由服务商在每次请求时强制执行);本文档所列端点即本技能使用的端点,其他端点需用户点名要求方可使用。默认进行读取和列表操作,每次写操作或新建连接均需与用户确认。

source

HTML

SkillClawHub3.5k

编写、审查并修复 HTML 标记:语义结构、表单、可访问性、文档 head、媒体与嵌入。适用场景:表单字段永远提交不了、label 不起作用、自动填充填错输入框、校验触发时机不对;屏幕阅读器念出文件名、什么都不播报、焦点逃出模态框;图片加载时页面跳动、以 quirks 模式渲染或出现乱码;文字溢出表格,或一个未闭合标签让半篇文档变斜体;链接预览、favicon 或富媒体搜索结果缺失;`<dialog>`、`<details>`、popover、`<template>` 行为异常;iframe 或视频嵌入一直空白;HTML 邮件在 Outlook 中塌陷;以及必须在无 XSS 风险下渲染不可信 HTML。涵盖响应式图片、资源提示、`lang`/`dir`、Web Components 与表单校验。不适用于样式排版(`css`)、DOM 脚本(`javascript`)、排名策略(`seo`)或 Markdown(`markdown`)。

source

Playwright(自动化 + MCP + 抓取)

v1.0.4

SkillClawHub42.5k

用 Playwright 实现浏览器自动化、测试与排障:定位器、自动等待、trace、CI 运行与 MCP 浏览器控制。当测试不稳定、超时、或仅在 CI/无头模式失败;定位器命中多个或错误元素(strict mode 违规);点击需要 force、等待变成死 sleep、networkidle 永不空闲;涉及 storageState 与登录初始化、请求 mock 与 HAR 回放、上传下载、iframe 与 Shadow DOM、弹窗与对话框、因机器而异的截图 diff、trace 与报告产物、慢测试套件分片、设备与权限模拟、无障碍检查、经 Playwright MCP 驱动真实浏览器、从 JS 渲染页面提取数据,或把 Cypress/Puppeteer/Selenium 套件迁移到 Playwright 时使用。不用于维护现有 Cypress/Puppeteer 套件(cypress、puppeteer),也不用于普通 HTTP 请求即可满足的工作(http)。

source
framefetch 视频数据提取 icon

framefetch 视频数据提取

MCP Serversmithery5k

# FrameFetch **一次 API/MCP 调用,智能体即可获得跨 6 个平台的干净视频数据**——元数据与洞察、Whisper 转写文本,以及参数化抽帧(自选 fps 或精确时间戳 → 推送到 S3)。支持 YouTube(含 Shorts)、TikTok、Reddit、Instagram、Pinterest。 智能体优先设计:类型化错误、失败退款、结果缓存。通过 x402(Base 上的 USDC)或 Stripe 按次付费。 ## 接口 - POST /v1/extract——一次调用组合元数据/洞察/转写/抽帧中任意几项 - POST /v1/metadata · /v1/transcript · /v1/frames——快捷接口 - GET /v1/platforms——能力矩阵 · POST /v1/keys——免费 key 加额度 ## 示例 curl -X POST https://framefetch.net/v1/extract -H “Authorization: Bearer <key>” -H “Content-Type: application/json” -d {“url”:“https://youtu.be/...”,“fields”:[“metadata”,“transcript”]} https://framefetch.net

streamable-http
Web Scraper — Clean Markdown from Any URL icon

Web Scraper — Clean Markdown from Any URL

MCP Serversmithery4.6k

Web content extraction API for AI agents. Scrape any URL and get clean, structured Markdown content with navigation, ads, and scripts stripped. Full JavaScript rendering via headless Chromium. Single and batch (10 URLs) modes. Built for RAG pipelines and AI research. Tools: web_scrape_to_markdown (single), web_scrape_batch (up to 10 URLs). Use this for RAG ingestion, research, content analysis, data extraction, or competitive intelligence. IMPORTANT: For screenshots/PDFs of pages, use capture_screenshot instead. For SEO analysis, use seo_audit_page. Returns: {markdown, title, wordCount, links[]}. No API key required — x402 micropayment $0.005/call on Base L2.

streamable-http
HTML 转 Markdown —— 干净转换并剥离脚本 icon

HTML 转 Markdown —— 干净转换并剥离脚本

MCP Serversmithery4.2k

面向 AI 智能体的 HTML 转 Markdown API。将 HTML 转为干净的 Markdown:剥离脚本、样式与跟踪代码,保留标题、链接、列表、图片与表格。工具:text_convert_html_to_markdown。适用于内容迁移、邮件处理,或把 HTML 内容整理为供 LLM 消费的形态。注意:抓取在线 URL 并转 Markdown 请用 web_scrape_to_markdown。返回:{markdown, wordCount}。无需 API 密钥——在 Base L2 上以 x402 微支付 $0.001/次。

streamable-http

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景

网页抓取 MCP 推荐 — 选型推荐与 Cursor / Claude 安装 - AgentHub