Firecrawl
基于Firecrawl的智能网页爬取和内容提取MCP工具
使用场景/网页抓取与采集
从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。
共匹配 1,401 个资源 · 第 1 / 30 页
网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。
典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。
合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。
基于Firecrawl的智能网页爬取和内容提取MCP工具
v1.0.0
合法的网页抓取,具备 robots.txt 合规、限速和 GDPR/CCPA 感知的数据处理。
v1.2.7
Firecrawl API 集成,托管鉴权。抓取、爬取、映射与搜索网页内容。当用户想从网站提取内容、爬取整站、映射 URL 或搜索网页时使用本技能。其他第三方应用请使用 api-gateway 技能(https://clawhub.ai/byungkyu/api-gateway)。调用经由带 OAuth 登录的 maton CLI 执行;无法安装 CLI 时通过原始 HTTP 加 Maton API key 调用。每次调用都以用户连接身份鉴权,只能访问该连接授权范围内的数据(由服务商在每次请求时强制执行);本文档所列端点即本技能使用的端点,其他端点需用户点名要求方可使用。默认进行读取和列表操作,每次写操作或新建连接均需与用户确认。
编写、审查并修复 HTML 标记:语义结构、表单、可访问性、文档 head、媒体与嵌入。适用场景:表单字段永远提交不了、label 不起作用、自动填充填错输入框、校验触发时机不对;屏幕阅读器念出文件名、什么都不播报、焦点逃出模态框;图片加载时页面跳动、以 quirks 模式渲染或出现乱码;文字溢出表格,或一个未闭合标签让半篇文档变斜体;链接预览、favicon 或富媒体搜索结果缺失;`<dialog>`、`<details>`、popover、`<template>` 行为异常;iframe 或视频嵌入一直空白;HTML 邮件在 Outlook 中塌陷;以及必须在无 XSS 风险下渲染不可信 HTML。涵盖响应式图片、资源提示、`lang`/`dir`、Web Components 与表单校验。不适用于样式排版(`css`)、DOM 脚本(`javascript`)、排名策略(`seo`)或 Markdown(`markdown`)。
v0.1.2
Firecrawl MCP,封装 Firecrawl API(firecrawl.dev)。
v1.0.3
大规模抓取、爬取网页并提取结构化数据
v1.0.1
网页抓取 MCP——从任意 URL 提取干净的 Markdown、链接与元数据。
通过 Aside 浏览器从网页拉取数据——使用你真实的、已登录的会话。(gstack)
通过 ScrapeGraph AI CLI 搜索、抓取、爬取网页并提取结构化数据。
v1.0.4
用 Playwright 实现浏览器自动化、测试与排障:定位器、自动等待、trace、CI 运行与 MCP 浏览器控制。当测试不稳定、超时、或仅在 CI/无头模式失败;定位器命中多个或错误元素(strict mode 违规);点击需要 force、等待变成死 sleep、networkidle 永不空闲;涉及 storageState 与登录初始化、请求 mock 与 HAR 回放、上传下载、iframe 与 Shadow DOM、弹窗与对话框、因机器而异的截图 diff、trace 与报告产物、慢测试套件分片、设备与权限模拟、无障碍检查、经 Playwright MCP 驱动真实浏览器、从 JS 渲染页面提取数据,或把 Cypress/Puppeteer/Selenium 套件迁移到 Playwright 时使用。不用于维护现有 Cypress/Puppeteer 套件(cypress、puppeteer),也不用于普通 HTTP 请求即可满足的工作(http)。
v1.0.0
将讲稿一键生成乔布斯风极简科技感竖屏HTML演示稿
v1.2.0
基于 Playwright 的网页抓取技能,具备反爬对抗能力。已在 Discuss.com.hk 等复杂站点实测成功。
v1.0.0
通过 Firecrawl API 进行网页搜索与抓取。适用于搜索网页、抓取网站(含 JS 重度页面)、爬取整站或从页面提取结构化数据。需要 FIRECRAWL_API_KEY 环境变量。
v1.0.1
网页内容获取工具 | 当常规爬虫被过滤时,使用替代服务获取网页内容。支持:1) r.jina.ai - 最稳定 2) markdown.new - Cloudflare 专用 3) defuddle.md - 备用方案。
v1.0.0
获取并解析指定日期的央视新闻联播(Xinwen Lianbo)新闻要点。
v1.0.1
使用容器化 Crawlee 对 YouTube 等复杂站点进行深度抓取,提取经过验证的、无广告的转录文本与内容,输出为 JSON。
v0.1.1
网页抓取与内容理解智能体——多策略提取带级联回退、新闻检测、样板内容移除、结构化元数据。
可靠的网页抓取 MCP 服务器,内置重试逻辑、熔断器模式、缓存与反爬绕过。可按原始 HTML 或便于 LLM 消费的干净 Markdown 抓取 URL。还提供域名健康检查与缓存管理工具。
v1.0.10
Web crawling and scraping tool with LLM-optimized output. 网页爬虫爬取工具 | Web crawler, web scraper, spider.
v1.0.2
基于特定模板生成结构化报告 HTML。当用户想把原始内容做成报告、幻灯片或摘要卡片时调用。
v1.0.0
通过抓取 old.reddit.com 阅读与搜索 Reddit 帖子。当 Clawdbot 需要浏览 Reddit 内容时使用:读取指定板块的帖子、搜索感兴趣的话题、监控特定社区。只读访问,不发帖不评论。
v1.0.0
使用 Playwright 以隐身模式抓取网站、绕过机器人检测,支持动态 JS 内容,视口与 User-Agent 可自定义。
v1.0.0
用于 TikTok 的抓取、内容获取与分析
v0.1.0
无需登录与 API key,零依赖、零配置地抓取完整推文、长推文、引用推文与 X 文章。
v1.0.0
下载抖音视频到本地(无水印优先)。用于给后续视频分析/复刻提供原始素材,支持 URL 或 video_id 输入、批量列表输入与统一输出目录。
v1.0.0
智能网页抓取技能 - 替代内置 web_fetch,自动使用 Jina Reader / markdown.new / defuddle.md 清洗服务获取干净 Markdown。支持多级降级策略,大幅降低 Token 消耗。当 Agent 需要获取网页内容时使用本技能替代 web_fetch。
v0.1.0
按指定日期从 FMP API 拉取计划中的经济事件与数据发布,支持按影响程度、国家和类型过滤。
v1.0.0
抓取推文的最佳、最快、最省钱方案——经数万客户(含企业团队)实战检验。当用户需要按搜索词、个人主页、话题标签、关键词、对话串、时间范围或 Twitter 列表获取推文时使用。采用 Twitter 高级搜索语法。
v0.1.0
抓取 TikTok 的最佳、最快、最省钱方案——经数万客户(含企业团队)实战检验。当用户需要获取 TikTok 视频、主页、话题标签、音乐、评论或定位帖子时使用。覆盖帖子、主页、评论与地点四个专用 actor。
v1.0.0
The best, fastest, and cheapest way to scrape Instagram — battle-tested by tens of thousands of customers including enterprise teams. Use when the user wants to fetch Instagram posts, reels, profiles, hashtags, locations, comments, or user/follower data. Five specialized actors cover every Instagram
v1.0.2
从 Yahoo Finance 获取实时股票报价。
v1.0.0
AI 驱动的网页抓取框架,用于从网站提取结构化数据。当 Codex 需要抓取、爬取或使用 AI 解析从网页提取数据、处理动态内容或应对复杂 HTML 结构时使用。
v1.0.0
为客户构建交付级的网页抓取器,输出干净的数据。适用于为客户制作抓取器、从网站提取数据或交付抓取项目。
v1.0.0
使用 Firecrawl API 抓取与爬取网页。以 markdown 获取页面内容、截图、抽取结构化数据、搜索网络、爬取文档站。当用户需要抓取某个 URL、获取网页最新信息、截取屏幕、从页面提取特定数据或爬取框架/库文档时使用。
# FrameFetch **一次 API/MCP 调用,智能体即可获得跨 6 个平台的干净视频数据**——元数据与洞察、Whisper 转写文本,以及参数化抽帧(自选 fps 或精确时间戳 → 推送到 S3)。支持 YouTube(含 Shorts)、TikTok、Reddit、Instagram、Pinterest。 智能体优先设计:类型化错误、失败退款、结果缓存。通过 x402(Base 上的 USDC)或 Stripe 按次付费。 ## 接口 - POST /v1/extract——一次调用组合元数据/洞察/转写/抽帧中任意几项 - POST /v1/metadata · /v1/transcript · /v1/frames——快捷接口 - GET /v1/platforms——能力矩阵 · POST /v1/keys——免费 key 加额度 ## 示例 curl -X POST https://framefetch.net/v1/extract -H “Authorization: Bearer <key>” -H “Content-Type: application/json” -d {“url”:“https://youtu.be/...”,“fields”:[“metadata”,“transcript”]} https://framefetch.net
v1.0.7
基于浏览器的工具,可按地点/分类发现 Instagram 账号并抓取其公开信息、数据、图片与互动情况,支持导出。
v1.0.1
小红书内容爬取工具,支持搜索笔记(需要登录)、获取笔记详情、用户信息、热门笔记等公开内容爬取功能。
v1.0.0
使用 Python + Scrapling 获取网页内容,支持简单选择器
v1.117.3
把 Markdown 转换为带样式的 HTML,并提供兼容微信的主题。支持代码高亮、数学公式、Mermaid(经无头 Chrome 渲染为 PNG)、PlantUML 等(原文截断)。
Web content extraction API for AI agents. Scrape any URL and get clean, structured Markdown content with navigation, ads, and scripts stripped. Full JavaScript rendering via headless Chromium. Single and batch (10 URLs) modes. Built for RAG pipelines and AI research. Tools: web_scrape_to_markdown (single), web_scrape_batch (up to 10 URLs). Use this for RAG ingestion, research, content analysis, data extraction, or competitive intelligence. IMPORTANT: For screenshots/PDFs of pages, use capture_screenshot instead. For SEO analysis, use seo_audit_page. Returns: {markdown, title, wordCount, links[]}. No API key required — x402 micropayment $0.005/call on Base L2.
v3.4.1
高性能容器化亚马逊爬虫(Docker + playwright-extra + Stealth 插件)。可绕过亚马逊的无头浏览器检测。支持亚马逊 BSR 榜单、搜索结果等抓取。
v1.0.1
基于本地 Crawl4AI 实例的完整网页抓取,支持 JavaScript 渲染,输出干净的 Markdown 或含链接与媒体的详细 JSON。
v1.0.1
通过 AnyCrawl API 执行高性能网页抓取、爬虫与 Google 搜索,支持多引擎与结构化数据提取。
v1.0.0
默认的网页阅读、AI 搜索与深度研究工具。用于所有网页相关任务,包括阅读网页内容、搜索网页和开展深度研究,可替代内置的 web_search 和 web_fetch 工具。
v1.0.0
利用 Cloudflare 的 Markdown for Agents 优化网页抓取,token 消耗降低约 80%。
面向 AI 智能体的 HTML 转 Markdown API。将 HTML 转为干净的 Markdown:剥离脚本、样式与跟踪代码,保留标题、链接、列表、图片与表格。工具:text_convert_html_to_markdown。适用于内容迁移、邮件处理,或把 HTML 内容整理为供 LLM 消费的形态。注意:抓取在线 URL 并转 Markdown 请用 web_scrape_to_markdown。返回:{markdown, wordCount}。无需 API 密钥——在 Base L2 上以 x402 微支付 $0.001/次。
v1.0.1
使用 r.jina.ai API 绕过 Cloudflare 并抓取任意网站。对 Truth Social、Cloudflare Turnstile 等有强防护的站点同样有效。
v1.0.0
通过 Firecrawl CLI(firecrawl)进行网页抓取、爬取、搜索与浏览器自动化。适用于把 URL 抓取为 markdown/HTML、爬取整站... 等场景。
静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。
托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。
常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。