Puppeteer
基于Puppeteer的网页自动化和数据抓取MCP工具
使用场景/网页抓取与采集
从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。
共匹配 889 个资源 · 第 8 / 19 页
网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。
典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。
合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。
基于Puppeteer的网页自动化和数据抓取MCP工具
Apify Actors MCP服务器,提供与各种Apify Actor的交互能力,包括网页抓取、数据提取、社交媒体监控等功能
ByteFun AI MCP服务 - 打通产品设计、UI设计、代码开发的服务平台,支持设计稿转代码和跨平台原生代码开发。提供两大核心功能模块:UI设计优化 - 将用户输入的需求转换为带有UI设计规范的静态HTML+CSS设计提示词,实现设计稿到代码的转换;代码开发优化 - 将用户输入的需求转换为带有完整开发规则的TypeScript代码开发提示词,支持跨平台原生开发。
从 arXiv、PubMed、bioRxiv、medRxiv、Google Scholar、Semantic Scholar 和 IACR 搜索并下载学术论文。抓取 PDF 并提取全文,加速文献综述。返回一致的元数据,便于筛选、引用与分析。
Keenable 是免费的远程 MCP 服务器,为智能体开放网页索引访问:搜索网页并返回排序结果,支持按日期与站点筛选,还可把已收录页面抓取为干净的 Markdown;开箱即用,无需账号或 API key。工具:search_web_pages(搜索网页并返回排序结果)、fetch_page_content(抓取已收录 URL 并提取干净的 Markdown 正文)。文档:https://docs.keenable.ai/mcp-server
一个 MCP 接口背后接入 5 个独立新闻源(AP、BBC、NPR、Hacker News、Google News)。就同一主题抓取全部来源的头条、按 URL 去重,并把被忽略的报道角度呈现出来。适合每日简报、研究型智能体和舆情转向检测。
ROMulus is a retro gaming ROM search engine that aggregates results from four major sites. Search by game title and console to get download page URLs, cover images, and file sizes... all in one all. Tools: • search_roms — Find ROMs by title, optionally filtered by console (NES, SNES, N64, GameCube, PS1, PS2, PSP, GBA, Genesis, Dreamcast, and 20+ more) • get_game_details — Fetch full metadata for a game: year, region, genre, languages, rating, serial number, and description • list_systems — List all 28 supported consoles No API key required.
把最新的、对应具体版本的文档与代码示例直接拉进你的提示词,消除过期信息与凭幻觉编造的 API,提升编码体验。只需在提问时加上 use context7,即可获得准确相关的回答。
# EPL Language MCP Server The official Model Context Protocol (MCP) server for the EPL (English Programming Language) ecosystem. This server provides AI coding assistants with direct access to the EPL runtime, compiler, and documentation. It empowers AI models to securely run EPL code, execute test suites, analyze Abstract Syntax Trees (ASTs), and fetch real-time syntax documentation. **Key Capabilities:** - **Code Execution:** Run EPL scripts dynamically and return standard output and errors. - **AST Generation:** Parse EPL source code into structural JSON trees for deep analysis. - **Documentation Retrieval:** Fetch the latest EPL language rules and standard library documentation. - **Test Harness:** Run and evaluate EPL test suites programmatically.
基于 Stripe 的市场,AI 智能体可在其中自主发现并购买 API 服务。按次付费,无需注册账号。已上线 6 个服务:号码校验、网页抓取、PDF 生成、截图 API 等。基于 Stripe Agent Toolkit 构建。
轻松跟踪与浏览 RSS 订阅源。从任意 feed URL 拉取最新条目,并提取文章全文,获得干净无干扰的阅读体验。以一致的结构化格式保存或分析文章。
Fetch US Bureau of Labor Statistics data — CPI, unemployment, wages, JOLTS, and more via MCP.
v0.1.5
Fetch, validate, and permission-check Agent Manifest Protocol (AMP) manifests for API discovery.
v2.3.0
Zenrows MCP 服务器——为 AI 编码助手提供抓取、提取、批量任务与浏览器会话。
v0.1.0
Fetch your own Delhaize (Belgium) till receipts and weekly promotions with a headless browser.
v1.5.19
Fetch transcripts, subtitles, chapters, metadata and frames from YouTube and 10+ video platforms
v0.2.0
抓取 AI 问答引擎与 Google 搜索/新闻结果,支持国家级与州级的地理定向。
v1.10.0
Fetch, crawl, and search the web: Google, Amazon, Walmart, Booking.com, Agoda, and YouTube data.
v0.5.7
通过 MCP 获取美国劳工统计局数据——CPI、失业率、工资、JOLTS 等。
v0.1.0
Scrape Google Maps business leads (phones, websites, emails, socials) with Hubertino.
v1.0.0
Crawl a site for broken links, redirects and missing SEO tags. Pay per page on Apify.
v0.1.1
Oxylabs MCP — Oxylabs Web Scraper API (oxylabs.io)
v0.5.0
从美国国家气象局航空气象中心获取 METAR、TAF、飞行员报告与国内 SIGMET。
v1.0.2
Fetch any public web page through managed proxies, with optional JS rendering and extraction rules.
v1.0.0
Scrape Google Maps business leads, reviews, and photos via hosted Remote MCP.
v1.0.0
Fetch a URL and report its status, headers, and size. Runs locally.
v1.0.1
Fetch satellite TLE orbital elements and catalog data from CelesTrak. No key required.
v1.1.0
Crawl a site for broken links, 404s, dead images, redirect chains and slow pages, with sources
v0.1.0
Any web page -> clean markdown. Firecrawl-lite, 0.001 USDC/extract (x402, Base), free demo.
v1.0.0
Auditable deep-research MCP server powered by TinyFish Search and Fetch.
v1.0.1
Crawl a site: pages, resources, links, duplicates, tags, Lighthouse and raw HTML.
v1.0.0
Fetch and extract data from any public web page, even JS-rendered or anti-bot protected
v1.0.0
Fetch a public robots.txt and return group counts only.
v0.1.9
通过 MCP 获取美国劳工统计局数据——CPI、失业率、工资、JOLTS 等。
v1.0.0
Fetch any web page to clean Markdown with Litmus trust signals. No account or API key needed.
v1.0.0
获取任意 YouTube 视频的完整转写文本,干净可读,无需 API key,无需注册。
v0.1.0
Fetch English writing practice prompts and score a written response. Bring your own API key.
v1.0.0
获取实时 Google 搜索结果,含标题与链接,适合用作 SERP API。
v0.1.0
Fetch URLs and return clean Markdown for RAG — nav, ads and boilerplate stripped.
v0.2.0
为 AI 代理抓取、爬取并检索网页,通过 MCP 提供。
v0.9.1
使用 Oxylabs Web Scraper API 抓取并处理指定 URL 与来源的内容。
v3.1.0
按指定账号抓取近期公开的 X/Twitter 帖子,用于监控、对比、OSINT 与研究。
v1.0.0
获取真实的加州 Notary Public 考试练习题,并在对话中为答案评分。
v0.1.3
Fetch, parse, screenshot and browse pages via MCP without a real browser -- no JS execution.
v1.0.0
抓取 Stack Overflow 的问题、回答、标签、得分与采纳状态,按行付费。
v1.0.0
抓取 Shopify 店铺的商品、变体、价格与应用商店条目,按行付费。
v1.0.0
按公司、表格类型、日期或全文检索抓取 SEC EDGAR 公告文件,按行付费。
v1.0.0
按作者、主题、期刊或 DOI 抓取 arXiv、OpenAlex 与 Crossref 的论文,按行付费。
静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。
托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。
常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。